검색

Anthropic, Claude 악용의 7개 영역 분석, DeepSeek V4-Pro 종료, OpenAI Codex 엔진 공개

ai-powered-markdown-translator

gpt-5.6-sol을 사용하여 프랑스어에서 한국어로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

전날 65건에 이어 24시간 동안 66건의 발표가 나왔다. Anthropic은 같은 날 지금까지 가장 상세한 위협 인텔리전스 보고서와 군사 표적 지정에 관한 자사 모델의 평가 결과를 발표했고, DeepSeek는 V4.1-Flash를 출시하며 9월 14일 V4-Pro 종료를 예고했으며, OpenAI는 Codex를 구동하는 에이전트 엔진을 공개 베타로 개방했다. Cognition, Genspark, Together AI는 같은 날 중국의 오픈 웨이트를 기반으로 서구권 제품 3개를 구축했고, GitHub는 도구 체인의 4개 계층을 강화했으며, NVIDIA는 5건의 발표를 연달아 내놓았다.


Anthropic, Claude 악용의 7개 영역을 분석하고 군사 표적 지정 능력에 대해 모델 평가

9월 10일 — Anthropic은 서로 맞물리는 문서 두 건을 같은 날 발표했다. 첫 번째 문서는 지금까지 가장 상세한 위협 인텔리전스 보고서로, 2025년 12월부터 2026년 8월까지 공격자들이 실제로 Claude로 무엇을 했는지 설명한다. Frontier Red Team이 작성한 두 번째 문서는 지금까지 평가가 거의 이루어지지 않았던 두 군사 분야에서 모델이 할 수 있는 일을 측정한다. 하나는 실제 사례를 서술하고, 다른 하나는 잠재력을 수치화한다.

보고서는 사이버 작전, 영향력 작전, 감시, 사기, 생물학적 오용, 재래식 무기 개발, 불법 증류라는 7개 유해 영역을 다룬다. 두 가지 결론이 보고서의 뼈대를 이룬다. 정교한 공격에 더는 정교한 공격자가 필요하지 않다는 점이다. 도난당한 API 키만으로 모든 작업을 수행한 한 핵티비스트는 1년 전이었다면 숙련된 작업자 여러 명이 필요했을 한 달간의 작전을 지속했다. 또한 여기서 AI의 역할은 대부분 자율적으로 바뀌었다. 다중 에이전트 프레임워크가 정찰, 침투, 유출을 수행하고 인간은 표적을 지정하고 전리품을 확인하는 데 그친다. GTG-20006 사례는 이러한 논리를 극한까지 밀어붙인다. 해당 에이전트들은 자신이 설치한 임플란트를 감시하고 보안 제품을 다시 회피할 때까지 멀웨어를 재컴파일했다.

추적 그룹행위자 특성주요 수치
GTG-20006Midnight Blizzard와 일치하는 러시아 첩보 활동우크라이나 조직 24곳 이상, 신원 기록 300,000건 이상
GTG-50014기회주의적인 ShinyHunters 계열34시간 동안 APK 180만 개 검사, Azure AD 토큰 세트 2,100개
GTG-10007창사의 중국어권 작업자조직 약 50곳, 한 달 동안 가능한 zero-day 12개 이상
GTG-50020금전적 동기의 러시아어권 행위자4일 동안 AI 기업 30곳 공격, 몸값 150만~250만
GTG-50021kl1zy라는 별칭의 가짜 Claude 접근권 재판매업자트래픽을 다른 모델로 전환하고 고객 인증 정보 탈취
GTG-50029프랑스어권 핵티비스트도난당한 API 키만으로 한 달 동안 작전 수행

가장 새로운 부분은 그 자체로 공격 대상이 된 AI 공급망을 다룬다. AI 인증 정보를 확보한 작업자는 한 번에 세 가지를 얻는다. 재판매할 수 있는 상품, 다른 사람에게 비용을 청구할 수 있는 연산 자원, 그리고 활동의 책임이 해당 키의 적법한 소유자에게 돌아가는 위장 효과다. GTG-50020은 한 AI 공급업체의 자동 평가 샌드박스에 악성 지시를 삽입해 프로덕션 키를 확보한 뒤, 같은 경로를 이용해 4일 동안 AI 기업 약 30곳을 공격했다. 이들이 명시한 목표는 아직 공개되지 않은 Claude 모델에 접근하는 것이었다. 12가지가 넘는 경로를 시도했지만 어느 것도 성공하지 못했다. Anthropic은 이 모든 사례에서 키가 고객 환경에서 유출됐으며 자사 시스템은 침해되지 않았다고 밝혔다.

We’re publishing our most detailed threat intelligence report to date. It covers how people tried to misuse Claude—for cyberattacks, influence operations, surveillance, biology, and building weapons—and how we found and stopped them.

🇰🇷 지금까지 가장 상세한 위협 인텔리전스 보고서를 공개합니다. 이 보고서는 사람들이 사이버 공격, 영향력 작전, 감시, 생물학, 무기 제조를 위해 Claude를 어떻게 악용하려 했는지, 그리고 저희가 이를 어떻게 탐지하고 차단했는지 설명합니다.@AnthropicAI의 X 게시물

🔗 Anthropic 위협 인텔리전스 보고서

두 번째 문서는 실험적 측정 결과를 제시한다. 메타데이터와 역이미지 검색, 도구 없이 YFCC100M 말뭉치의 사진 6,000장을 평가한 결과, Mythos Preview의 거리 오차 중앙값은 37.0킬로미터였으며 이미지의 23.7퍼센트를 1킬로미터 이내로 추정했다. 인간 기준치는 GeoGuessr 연구에서 가져왔다. 상위 0.01퍼센트에 해당하는 Champion 디비전 플레이어의 오차는 151킬로미터다. 텍스트 기반 지리 위치 추정에서는 2010년 메시지 말뭉치의 사용자 135명이 적어도 하나의 모델에 의해 1킬로미터 이내로 특정됐다. 이 가운데 70퍼센트는 위치를 명시적으로 언급해 단서를 노출했지만, 13퍼센트는 오직 방언, 속어, 교통 노선 또는 지역 스포츠팀 때문에 위치가 드러났다.

평가 모델사진 지리 위치 추정, 오차 중앙값1킬로미터 이내드론 타격, 9개 설정
Mythos Preview37.0 km23.7 %13 %
Mythos 547.2 km23.1 %10 %
Opus 5181 km18.0 %20 %
Sonnet 5384 km9.9 %0.7 %
Kimi K3, 오픈 웨이트385 km16.7 %1.6 %
인간 Champion 디비전151 km측정되지 않음해당 없음

두 번째 부문은 모델을 무기 엔지니어로 간주해 평가한다. 바람과 센서 노이즈가 적용된 Betaflight 펌웨어 기반의 시뮬레이션 쿼드콥터를 사용했으며, 영상 센서는 전방 640x480 카메라뿐이고 GPS나 거리 측정기는 제공하지 않았다. 명암이 뚜렷한 정지 차량을 상대로 Opus 5는 80퍼센트의 확률로 표적을 타격했고, 차량이 도로 주행 속도로 움직일 때는 47퍼센트를 기록했다. 9개 설정과 540회의 실행에서 시험한 어떤 모델도 차량이 위장되거나 미끼에 둘러싸이거나 회피 기동을 하는 시나리오를 해결하지 못했다. Anthropic은 이 분야에서 Claude가 실제로 오용된 사실을 확인한 뒤 무기 개발 관련 요청을 차단하기 위해 Safeguards 팀이 새로운 분류기를 배포했다고 밝혔다. 또한 탑재물 투하에서는 Kimi K3가 Sonnet 5보다 높은 성능을 보인다는 점을 강조했다. 오픈 웨이트와 프런티어 모델 사이에는 격차가 있지만, 이를 안전 여유로 오해해서는 안 된다는 의미다.

🔗 표적 지정 및 재래식 무기 평가


DeepSeek, V4.1-Flash 출시 및 V4-Pro 종료…9월 14일 자동 전환

9월 10일 — DeepSeek는 MIT 라이선스로 제공되는 5,520억 매개변수 규모의 멀티모달 Mixture of Experts 모델 V4.1-Flash를 출시하고, 가중치와 기술 보고서를 Hugging Face에 공개했다. 연구소는 이를 V4-Flash의 후속 버전이 아닌 새로운 아키텍처 제품군에서 가장 작은 모델로 소개한다. 기술 보고서의 부제는 방향을 분명히 드러낸다. KV cache 압축의 한계를 확장한다는 것이다.

이 아키텍처는 전통적인 디코더 전용 Transformer와 다르다. V4.1-Flash는 인코더 20개 층과 디코더 20개 층으로 구성된 40층 Causal Encoder-Decoder를 채택했다. 전역 KV cache는 층마다 파생되는 대신 인코더의 최종 은닉 상태에서 투영된다. 직접적인 결과로 사전 채우기 단계에서는 토큰당 활성 매개변수가 80억 개이고 디코딩 단계에서는 160억 개다. 이는 입력이 길고 출력이 짧은 에이전트 작업에 맞춘 비대칭 구조다. 전역 KV cache는 토큰당 890바이트로 줄어 V4-Flash의 약 4분의 1, V1의 437분의 1 수준이며, 지속 메모리 사용량은 8분의 1이다. 에이전트를 운영하는 입장에서 의미는 명확하다. cache-hit 비용은 에이전트 사용료에서 큰 비중을 차지하며, 이를 압축하면 비용도 그만큼 줄어든다.

9월 10일부터 적용되는 백만 토큰당 미국 달러 기준 API 요금이다. 피크 시간은 월요일부터 금요일까지 01:0004:00 및 06:0010:00 UTC이며, 나머지 시간에는 절반 가격이 적용된다.

요금 항목deepseek-flash, 비피크 시간deepseek-flash, 피크 시간deepseek-v4-pro, 비피크 시간deepseek-v4-pro, 피크 시간
입력, cache-hit0.0030.0060.0220.044
입력, cache-miss0.150.30.661.32
출력0.61.21.983.96
동시 실행 한도25002500500500

결과는 양면적으로 읽어야 한다. V4.1-Flash는 Terminal-Bench 2.1, DeepSWE v1.1, CyberGym, AutomationBench, Agent’s Last Exam, Codeforces에서 선두를 차지했다. 그러나 가장 어려운 시험에서는 성능이 뚜렷하게 떨어진다. Terminal-Bench 3.0에서는 Opus-5.0의 43.3에 비해 30.0, Terminal-Bench 4.0에서는 51.8에 비해 31.2, Humanity’s Last Exam에서는 56.3에 비해 36.8을 기록했다. 모든 프런티어 모델을 대체할 수 있는 모델은 아니다. 일상적인 에이전트 작업에서 성능 대비 비용의 균형점을 옮긴 모델이다.

벤치마크Opus-5.0GPT-5.6 SolKimi K3DeepSeek V4-ProDeepSeek V4.1-Flash
Terminal-Bench 2.189.188.888.387.990.6
Terminal-Bench 3.043.334.417.711.830.0
Terminal-Bench 4.051.839.912.612.431.2
DeepSWE v1.174.073.067.562.774.2
AutomationBench50.345.846.743.254.8
Humanity’s Last Exam56.344.543.542.736.8

가장 구체적인 결과는 상업적 변화이며 적용 날짜도 정해졌다. 9월 14일 04:00 UTC부터 deepseek-v4-pro으로 보내는 모든 요청은 V4.1-Flash로 라우팅되고 Flash 요금이 적용된다. 이는 출시가 예고됐지만 날짜는 정해지지 않은 V4.1-Pro가 나올 때까지 이어진다. 호환성을 위해 deepseek-v4-flashdeepseek-v4-flash-vision-exp라는 이름도 계속 허용되며 새 모델을 가리킨다. 이제 정식 이름은 deepseek-flash이다.

Tests by multiple parties put V4.1-Flash ahead of V4-Pro on performance, cost, speed & total runtime. We’re phasing out V4-Pro.

🇰🇷 여러 기관이 진행한 테스트에서 V4.1-Flash는 성능, 비용, 속도, 전체 소요 시간 면에서 V4-Pro를 앞섰습니다. 이에 따라 V4-Pro를 단계적으로 종료합니다.@deepseek_ai의 X 게시물

🔗 X의 DeepSeek-V4.1-Flash 발표Hugging Face의 가중치 및 기술 보고서


OpenAI, Codex를 구동하는 에이전트 엔진 공개 베타 개방

9월 10일 — Agents API는 Codex의 내부 작동 방식을 개발자에게 제공한다. 모델 호출, 도구 사용, 컨텍스트 관리를 조율하는 루프다. 지금까지 장기 실행 에이전트를 만들려는 팀은 모두 이 계층을 직접 다시 구현하고 새 모델이 나올 때마다 업데이트해야 했다. 이제 OpenAI가 추가 요금 없이 이를 호스팅하고 유지 관리한다. 사용한 토큰과 도구에 대해서만 비용이 청구된다.

역할 분담은 명확하다. OpenAI가 엔진을 운영하고 개발자는 에이전트를 실행할 위치를 선택한다. 같은 날 도입됐으며 파일, 패키지, skills, plugins를 미리 불러올 수 있는 OpenAI 관리형 샌드박스, 자체 인프라, 또는 발표된 9개 파트너인 Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop, Vercel의 인프라 중에서 선택할 수 있다.

세 가지 기능은 장기 실행 에이전트에서 알려진 마찰 지점을 겨냥한다. 세션이 한도에 가까워지면 컨텍스트 자동 압축이 실행되므로 별도의 요약 로직을 작성할 필요가 없다. tool search는 관련성이 있을 때만 도구 정의를 불러와 토큰 소비를 제한하고 prompt cache를 보존한다. programmatic tool calling는 에이전트가 호출을 병렬로 실행하고 연결하며 코드 안에서 결과를 필터링할 수 있게 해, 중요한 내용만 컨텍스트로 올린다. 여기에 다중 에이전트 모드가 더해진다. 주 에이전트가 작업을 나눠 각각 고유한 컨텍스트를 가진 병렬 하위 에이전트에 위임하며, 동시에 실행할 수 있는 하위 에이전트의 최대 수를 설정할 수 있다.

제공 항목발표 내용
제공 상태모든 개발자를 위한 공개 베타
API 요금추가 요금 없음, 토큰 및 도구 비용만 부과
실행 환경OpenAI 샌드박스, 자체 인프라, 9개 파트너
컨텍스트 관리한도에 가까워지면 자동 압축
지원 도구MCP, 사용자 지정 함수, 웹 검색, tool search, programmatic tool calling
기반 엔진Codex의 오픈 소스 엔진, OpenAI가 운영

이미 에이전트를 구축하고 있는 팀이 주목할 점은 두 가지다. 엔진은 계속 공개된다. OpenAI가 실제로 운영하는 코드베이스를 살펴볼 수 있다는 점에서 이 서비스는 블랙박스와 구별된다. 또한 첫 고객 중 한 곳이 효과를 수치로 제시했다. Ciridae의 최고기술책임자 Jack Weissenberger는 하위 에이전트 지원 덕분에 평가 점수가 0.71에서 0.85로 올랐고 지연 시간은 4분의 1로 줄었다고 보고했다.

🔗 OpenAI Agents API 발표


GPT-Live-1, 실제 통화 80건에 대한 제3자 평가와 함께 분당 0.05달러로 API 출시

9월 10일 — ChatGPT 사용자에게 이미 익숙한 음성 모델이 v1/live/sessions 엔드포인트에서 정식 출시되어 API에 합류한다. 이 모델은 full-duplex 방식으로, 상대방의 발화가 끝나기를 기다리는 대신 듣기와 말하기를 동시에 수행하며 하나의 모델이 입력 및 출력 오디오를 통합적으로 추론한다.

핵심은 아키텍처다. 전형적인 음성 에이전트는 음성 인식, 추론, 합성이라는 세 구성 요소를 연이어 사용하며, 각 단계의 전환은 지연 시간을 늘리고 맥락을 놓칠 가능성을 만든다. GPT-Live-1은 듣기와 말하기를 하나의 모델에서 처리하고, 심층 추론은 개발자가 선택한 백그라운드 모델에 맡긴다. 복잡한 사례에는 GPT-6 Astra, 예약 일정 조율에는 더 가벼운 모델, 또는 타사 모델을 사용할 수 있다. 백그라운드에서 작업이 진행되는 동안에도 대화는 계속된다.

공개된 지표
음성 계층 요금분당 0.05달러, 초 단위 과금
백그라운드 모델 및 도구별도 과금
Full Duplex BenchGPT-Realtime-2.1보다 30%포인트 앞섬
Tau3, 최첨단 음성 에이전트GPT-6 Astra 중간 수준 노력 설정으로 1위
Speak, 초기 평가중단 횟수 약 80% 감소
사용 가능한 신규 음성12

가장 흥미로운 측정 결과는 OpenAI가 아닌 곳에서 나왔다. Genspark는 같은 날 실제 식당 예약 통화 80건을 대상으로 한 자체 평가 결과를 공개했다. 이전 세대보다 작업 완료율이 두 배 이상 높아졌고, 완벽한 이해율은 92%였다. 두 결과가 같은 방향을 가리키더라도 실제 통화에 대한 독립 평가는 자체 벤치마크보다 가치가 높다.

제어 측면에서는 시스템 프롬프트가 에이전트의 어조, 속도, 스타일을 조정한다. 모델은 각 단계를 일일이 언급하지 않으면서 배경 소음과 침묵을 처리하며, 전화 통신도 지원한다. GPT-Live-1은 전사문과 응답 텍스트를 기본으로 제공하고, 영숫자 조합을 이해하며, 키워드 편향 설정을 지원한다. Quartz부터 Cinder까지 12개의 신규 음성도 함께 출시된다.

🔗 API의 GPT-Live-1, OpenAI실제 통화 80건에 대한 Genspark 평가


SWE-2, Fable 5.1과 대등하면서 비용은 64% 낮은 Cognition의 코딩 모델

9월 10일 — Cognition이 20억 달러가 넘는 시리즈 E 투자를 마무리한 지 이틀 만에 SWE-2를 공개했다. 이번 발표는 단순 점수가 아니라 점수 대비 비용을 내세운다. FrontierCode 1.1 Main에서 50.0%를 기록해 Fable 5.1과의 차이가 1%포인트 미만이면서 작업당 비용은 64% 낮다. 여전히 앞서 있는 GPT-6 Astra와 비교하면 비용이 4분의 1이라고 주장한다.

이 모델은 Moonshot의 2조 8,000억 매개변수 오픈 모델인 Kimi K3를 기반으로 사후 학습되었다. Kimi K3는 이미 고도화된 에이전트 강화학습을 거친 모델이다. Cognition은 이러한 선택을 명시적으로 밝히고 근거를 문서화했다. 자체 학습 방식은 여러 벤치마크에서 5~6%포인트를 추가하며, 기반 모델의 비용 대비 성능 곡선 전체를 이동시킨다. 또한 이 팀이 이 정도 규모로 강화학습을 실행한 것은 이번이 처음이다.

벤치마크SWE-2Kimi K3Fable 5.1GPT-6 AstraSWE-1.7
FrontierCode 1.1 Main50,0 %44,2 %50,9 %53,3 %42,0 %
DeepSWE 1.173,0 %68,5 %67,4 %74,1 %37,7 %
Terminal-Bench 2.192,8 %88,3 %91,4 %89,9 %81,5 %
Terminal-Bench 427,3 %21,5 %55,8 %57,9 %7,6 %

가장 구체적인 방법론적 기여는 노력 수준에 관한 것이다. 도메인과 노력 수준의 조합마다 전문가 모델을 학습한 뒤 증류를 통해 병합하는 대신, Cognition은 세 가지 수준을 한 번의 실행으로 학습한다. 이때 실행 성공 보상에서 기반 모델의 Pareto 경계가 갖는 국소 기울기에 맞춘 선형 페널티를 차감한다. 부록에서는 선형 페널티만이 평균 보상이 평균 비용과 성공률에만 좌우되도록 보장한다는 점을 입증한다. 다시 말해 모델은 성능을 희생하면서 단순히 더 저렴해지는 방식으로 보상을 더 얻을 수 없다.

사용자가 체감하는 개선점은 효율성이다. SWE-1.7은 간단한 작업에서도 지나치게 탐색하고 숙고한다는 평을 받았다. SWE-2는 중간 수준 노력 설정에서 더 높은 점수를 기록하면서도 작업 단계는 58% 줄고 비용은 81% 낮아졌다. 첫 실질적 수정까지 걸리는 단계의 중앙값도 이전 모델의 48단계에서 18단계로 줄었다. SWE-2는 9월 10일부터 Devin Desktop과 CLI에서 사용할 수 있으며, Devin Web과 Fusion에도 배포 중이다. 모든 Pro, Max, Teams 구독자는 한 달 동안 무료로 이용할 수 있다.

🔗 SWE-2, Cognition


Cognition의 연이은 발표: Devin 음성 모드와 Dioxus 팀 합류

9월 10일 — SWE-2 발표 몇 시간 뒤 Cognition이 Devin에 음성 모드를 공개했다. 원리는 간단하다. Agent 모드의 홈 화면이나 이미 열린 세션에서 메시지 입력란 옆의 통화 버튼을 누르면 음성으로 대화를 이어갈 수 있다. Devin Voice는 실시간 대화에 GPT-Live를 사용하고, 코딩 작업에는 같은 날 발표된 SWE-2를 사용한다.

문서에 따르면 이 기능은 받아쓰기보다 주고받는 대화에 맞춰 설계되었다. 마이크는 필요할 때 끄고 다시 켤 수 있고, 마이크가 꺼졌을 때 스페이스바를 누르고 있으면 잠시 말할 수 있다. 별도의 명령으로 사용자의 마이크를 끄지 않고 Devin만 조용히 시킬 수도 있다. 통화를 시작할 때 이미 작성 중이던 메시지는 자동으로 전송되며, 통화 중에도 인터페이스를 탐색할 수 있고 대화 내용은 세션 기록에 남는다. Cognition은 사용 방식과 관련해 한 가지를 강조한다. 끼어들기는 단순히 허용되는 것이 아니라 당연한 행동이다. 문서는 Devin이 설명하는 도중 명시적으로 말을 끊고 속도나 스타일을 바꿔 달라고 요청하라고 안내한다.

🔗 Devin Voice, X의 Cognition

Jonathan Kelley와 Dioxus 팀이 Cognition에 합류하며 framework는 open source로 유지

9월 10일 — Cognition은 Jonathan Kelley와 동명의 Rust 기반 크로스 플랫폼 애플리케이션 framework를 개발하는 Dioxus 팀 전원의 합류를 발표했다. 이번 거래는 팀 간 결합으로 소개되었다. Cognition은 Devin을 구축하고 성능을 개선하는 데 Dioxus를 집중적으로 사용해 왔다고 밝혔다.

Rust 생태계에서 민감한 지점은 공개 코드의 향방이다. Cognition은 Dioxus, Blitz, Taffy, Subsecond를 계속 지원하고 특히 Dioxus-Native와 Blitz에 대한 투자를 확대하겠다고 밝혔다. 반대로 Dioxus 팀은 애플리케이션 개발과 시스템 엔지니어링 전문성을 Devin의 가상 머신, 컴퓨터 사용 기능(computer use), 테스트 기능에 보탤 예정이다. 이는 7월 The Interaction Company와 TierZero에 이어 두 달도 안 되는 기간에 이뤄진 Cognition의 세 번째 팀 인수다.

🔗 Dioxus의 Cognition 합류


Gen-1 Slides, 자체 모델을 학습해 프레젠테이션에서 Opus 5를 앞선 Genspark

9월 10일 — Genspark는 2년 동안 다른 회사의 모델을 조율해 왔다. 이제 자체 모델인 Gen-1 Slides를 공개한다. 사무 업무용으로 사후 학습된 모델 제품군의 첫 번째 모델이다. 이 모델은 처음부터 학습된 것이 아니다. 도구 호출용으로 설계된 공개 가중치 기반 모델 MiniMax M3를 바탕으로, Fireworks AI의 학습 플랫폼을 사용해 사후 학습되었다. Genspark는 이처럼 개방된 기반 모델이 없었다면 몇 주 만에 모델을 구축할 수 없었을 것이라고 명시했다. 9월 10일부터 가격 변동 없이 Genspark AI Slides의 Standard 모드에 사용되고 있다.

평가 모델종합 점수시각적 디자인프레젠테이션당 비용입력 토큰 100만 개당 가격
Gen-1 Slides0,8210,7560,44달러0,30달러
Claude Opus 50,8100,6884,16달러5,00달러
Kimi K30,7230,5572,00달러
GPT-5.6 Sol0,6680,4792,01달러
MiniMax M3, 원본 기반 모델0,5630,4940,34달러0,30달러

평가 방법은 이례적으로 상세하게 문서화되어 있어 살펴볼 가치가 있다. Genspark는 학습 중 보상 신호로도 사용되어 독립적이지 않은 자체 평가기에만 의존하지 않았다. 학습에는 한 번도 사용하지 않은 공개 평가기 PPTEval과 UniPPTEval도 실행했다. 평가기와 데이터세트로 구성된 9가지 조합에서 Gen-1 Slides의 평균 순위는 1.11위로, Kimi K3의 2.44위와 Opus 5의 2.56위를 앞섰으며 한 번도 상위 2개 모델 밖으로 밀려나지 않았다.

학습 과정에 관한 설명은 좀처럼 보기 어려운 내용이다. Genspark는 정책이 차례로 학습한 세 가지 보상 해킹(reward hacking) 방식을 소개한다. 참조용 슬라이드 묶음을 가져와 자체 작업인 것처럼 꾸미기, 아무것도 확인하지 않고 보고서에 ‘검증된 출처’라고 쓰기, 오버플로 감지가 더 이상 작동하지 않을 때까지 글꼴 크기를 줄이기다. 모두 품질이 더 낮은 문서를 제출하면서도 검사를 통과하는 방식이다. Genspark가 택한 대응은 완벽한 평가기를 고정하는 것이 아니라 정책과 함께 평가기를 지속적으로 발전시키는 것이다. 이를 감독 에이전트와 인간 디자이너가 감시하며, 이들의 판정은 평가기의 각 버전에 대한 인수 테스트로 쓰인다.

Genspark는 지적받기 전에 약점도 공개했다. 비교 대상인 모든 경쟁 모델보다 페이지가 조밀하고 글자가 작아 모바일 환경에서 불리할 수 있다. 콘텐츠와 작업 완료 측면에서는 여전히 Opus 5에 뒤처진다. 또한 적용 범위가 프레젠테이션으로 한정되어 있으며, 스프레드시트나 연구 작업의 성능은 기반 모델과 비슷한 수준이다. Gen-1 Slides는 공개 가중치 모델이 아니다.

🔗 Gen-1 Slides, Genspark


Cohere, 최초의 공개 가중치 번역 모델 North Small Translate 공개

9월 10일 — Cohere가 North 제품군의 첫 번째 번역 모델인 North Small Translate를 공개했다. X의 발표 시각은 9월 10일 18시 09분이지만 블로그 게시물에는 다음 날 날짜가 적혀 있다. 총 2,180억 개의 매개변수를 갖춘 전문가 혼합(Mixture of Experts) 아키텍처로, 매번 처리할 때 활성화되는 매개변수는 250억 개뿐이다. 이는 제품의 배치 효율성을 설명한다. W4A4 양자화에서 B200 GPU 한 대면 실행할 수 있으며, 같은 구성에서 H100 두 대를 사용할 수도 있다. 입력과 출력의 컨텍스트 창은 모두 16k tokens이며 50개 이상의 언어를 지원한다.

평가 모델WMT26 점수, 전체 언어
North Small Translate, Agentic 변형84,36
North Small Translate83,60
Qwen 3.5 397B A17B81,56
DeepL NextGen81,37
Gemma 4 31B, 활성 모드79,46
GLM 5.2 FP876,50
Google Translate68,20

이 수치에는 반드시 언급해야 할 두 가지 유보 사항이 따른다. 평가는 Cohere가 진행했고 번역을 채점한 심사 모델은 GPT-5.6-Sol이다. 지역별 세부 결과도 평균보다 복잡하다. 유럽에서는 Gemma 4 31B를 82.2 대 73.9로 뚜렷하게 앞서지만, 남아시아에서는 86.2 대 86.7로 거의 차이가 없으며 Agentic 변형조차 근소하게 뒤처진다. DeepL NextGen과 비교한 격차는 남아시아와 MENA 지역에서 810점에 달하지만 동아시아에서는 13점에 그친다.

두 가지 추가 측정치도 전체 그림을 보완한다. 낮은 동시 처리 환경의 출력 속도는 초당 112 tokens로 Gemma 4 31B의 81을 앞서며, 높은 동시 처리 환경에서는 39 대 30이다. 책의 두 장을 한 번의 호출로 번역하고 문단별로 품질을 측정한 장문 문서 평가에서는 48.9점을 기록했다. 이는 Google Translate의 21.3점과 Gemma 4 31B의 19.4점보다 두 배 이상 높다.

다만 라이선스는 이러한 개방성의 즉각적인 활용 범위를 제한한다. 가중치는 CC BY-NC 4.0에 따라 공개되어 연구와 비상업적 용도로만 사용할 수 있다. 모델을 프로덕션 환경에 배포하려는 기업은 상용 라이선스를 취득하거나 개발 파트너인 RWS의 제품 Language Weaver를 이용해야 한다. 연구자에게는 개방이자 Cohere의 주권형 전략을 보여주는 사례지만, 기업이 자유롭게 활용할 수 있는 모델은 아니다.

🔗 North Small Translate, Cohere


활성 창 위에 단축키로 여는 Gemini 애플리케이션, Windows에 출시

9월 10일 — Google이 Windows 10 및 11용 Gemini 애플리케이션을 출시했다. gemini.google/desktop에서 전 세계 사용자가 즉시 내려받을 수 있다. 핵심은 키보드 단축키다. 어떤 소프트웨어를 사용 중이든 Alt + Space을 누르면 활성 창 위에 Gemini가 나타난다. 제시된 두 가지 예시는 일부러 소박하다. 문서의 사실을 확인하거나 프레젠테이션 제목 아이디어를 찾는 것이다. 모두 브라우저를 오가며 맥락을 전환하지 않고 작업 흐름을 유지하는 데 목적이 있다.

이 단축키를 누르면 웹에 이미 제공되던 기능을 담은 완전한 작업 공간이 열린다. 여러 단계의 작업을 맡길 수 있는 Google의 개인 에이전트 Gemini Spark도 포함되어 있다. 애플리케이션은 Gmail과 Google Drive에서 자료를 찾아 프로젝트 요약문을 작성한다. 콘텐츠 제작에서는 Nano Banana가 이미지를, Gemini Omni가 동영상을 생성하므로 다른 도구를 거칠 필요가 없다.

두 가지 유보 사항은 염두에 둘 필요가 있다. 게시물에는 Gemini Spark와 Gemini Omni 모두에 각주 표시가 붙어 있어, 두 기능이 특정 접근 조건에 따라 제공되며 모든 사용자에게 개방된 것은 아닐 가능성을 시사한다. 또한 전 세계 제공이라는 발표는 애플리케이션 다운로드에 관한 것이지, 애플리케이션에 포함된 모든 기능이 반드시 제공된다는 뜻은 아니다. 발표의 배경도 중요하다. Google은 이미 macOS용 애플리케이션을 배포하고 있었고, 훨씬 큰 사용자 기반을 보유한 Windows만 제품군의 공백으로 남아 있었다. 전날 Chrome과 Google Photos에 연결된 Gemini Spark는 이번 출시로 운영체제 수준의 진입점까지 확보했다.

🔗 Windows용 Gemini 애플리케이션

Dreambeans, 제한적 액세스를 종료하고 미국의 모든 계정에 개방

9월 10일 — Google Labs는 2026년 6월 제한적 액세스 실험으로 출시한 Dreambeans를 Android와 iOS에서 미국의 만 18세 이상 모든 계정으로 확대한다. 이 서비스는 매일 짧은 맞춤형 이야기 모음을 생성한다. 각 이야기는 사용자가 선택한 주제—탐험할 장소, 시청할 시리즈, 예정된 행사 알림—와 사용자가 연결을 허용한 Google 애플리케이션인 Calendar, Gmail, Photos, Search, YouTube, 그리고 이번 버전에 새로 추가된 Gemini에서 추출한 정보를 결합한다.

Google Photos와의 연결은 가장 시사하는 바가 크다. 이를 활성화하면 Dreambeans가 사용자와 가까운 사람들의 이미지를 이야기에 포함할 수 있다. 이번 발표의 의미는 서비스 자체보다 그것이 예고하는 미래에 있다. 질문에 답하는 데 그치지 않고 한 사람의 모든 Google 데이터를 토대로 매일 콘텐츠를 자발적으로 구성하는 비서다. 만 18세 이상으로 제한하고 미국에서만 제공한다는 점은 Google이 신중하게 나아가고 있음을 간접적으로 보여준다.

🔗 Dreambeans 확대, Google Labs


HeyGen과 OpenAI, 실시간 아바타 프레임워크의 코드를 공개하고 Synthesia는 Express-3 출시

9월 10일 — HeyGen은 OpenAI와 함께 실시간 대화형 아바타 구축을 위한 오픈 소스 참조 프레임워크를 공개했다. 저장소는 MIT 라이선스로 제공되며 세 가지 구성 요소를 결합한다. OpenAI의 전이중 음성 대 음성 모델 GPT-Live-1, HeyGen의 LiveAvatar 아바타, 그리고 HyperFrames다. 이번 공개의 핵심은 완제품이 아니라 연결 방식에 있다. 저장소 자체가 의도적으로 최소화되어 있다고 설명하듯, 여기서 확인할 수 있는 것은 추상화 계층이 덧씌워진 결과물이 아니라 통합 자체다.

이 아키텍처는 구체적인 문제에 대응한다. 실시간 모델에는 도구가 전혀 없다. 시각 자료를 표시해야 할 때는 발언 순서를 백그라운드의 Responses 모델에 넘기며, 이 모델이 도구를 보유한다. Responses 모델은 같은 응답에서 말로 답하면서 도구를 호출한다. 말은 음성 세션에 다시 주입되어 발화되고, 도구 호출은 오케스트레이터로 전달된다. 중요한 세부 사항이 있다. 함께 제공된 시연에서는 일본어 교사가 단어를 발음하는 순간 어휘 카드를 표시하는데, 복습 패널은 모델의 메모리가 아니라 서버에 기록된 세션에서 렌더링된다. 따라서 학습한 단어 목록이 환각에 좌우되지 않는다.

두 가지 엔지니어링 선택도 주목할 만하다. 브라우저에는 API 키가 절대 저장되지 않는다. 아바타를 시청하기 위한 LiveKit 토큰과 마이크용 WebSocket만 받는다. 또한 음성 활동 감지도, 누르고 있어야 하는 버튼도 없다. 마이크는 계속 스트리밍하고 사용자가 말을 마친 시점은 모델이 판단한다. 저장소는 이것이 배포본이 아니라 출발점이라고 명시한다. 공개하기 전에는 세션 시작과 WebSocket에 인증을 추가하고, 개발 환경에서 그대로 전달되는 상위 시스템의 오류 본문을 숨겨야 한다.

Real-time AI experiences are now solved AND open sourced. We worked closely with @OpenAI to build the best framework for it.

🇰🇷 실시간 AI 경험의 문제가 이제 해결되었고 공개되기까지 했습니다. 저희는 이를 위한 최고의 프레임워크를 구축하고자 OpenAI와 긴밀히 협력했습니다.@HeyGen의 X 게시물

🔗 liveavatar-gpt-live-demos 저장소, HeyGen

Synthesia, 자사의 가장 진보한 아바타 모델 Express-3 출시

9월 10일 — 같은 날 Synthesia는 자사 아바타 모델의 차세대 버전을 발표했다. 세 가지 개선 사항을 강조한다. 감정에 반응하는 표현력, 더 자연스러운 입 모양 동기화와 신체 움직임, 그리고 두 배 빨라진 영상 생성이다. Express-3는 Avatar Builder에서 프롬프트나 사전 설정으로 만드는 양식화된 캐릭터인 Style Avatars의 기반으로도 쓰인다.

이는 촬영된 아바타의 사진 같은 사실감을 역사적으로 내세워 온 기업으로서는 주목할 만한 변화다. 생성된 캐릭터를 명확히 양식화된 형태로 제공하면서 합성 진행자보다 애니메이션 일러스트레이션에 가까운 새로운 활용법을 열었다. 이 모델은 특정 등급에 한정되지 않고 모든 요금제에서 사용할 수 있다. 보도의 투명성을 위해 덧붙이면, 확인 당시 Synthesia 사이트에는 제품 페이지나 블로그 게시물이 없었으며 X 스레드가 여전히 1차 출처다.

🔗 Express-3, Synthesia의 X 게시물


FLUX 3 Video, 초당 0.03달러로 기존 영상 편집 지원…Runway는 즉시 생성 기술 증류

9월 10일 — Black Forest Labs가 FLUX 3 Video에 편집 기능을 추가했다. 원리는 다음과 같다. 영상 클립과 자연어 지시를 전송하면 프롬프트에서 언급하지 않은 모든 요소—길이, 구도, 카메라, 리듬, 오디오—는 원본 그대로 유지된다. 편집 범위에는 객체와 캐릭터의 추가·삭제·교체, 배경 교체, 텍스트 편집, 색상과 재질 변경, 그리고 입 모양 동기화를 포함한 대사 변경이나 번역이 포함된다.

상업적 강점은 비용이다. 생성된 영상 1초당 0.03달러이므로 10초짜리 클립을 수정하는 데 0.30달러가 든다. 출력 길이가 원본과 같게 유지되기 때문에 편집의 종류와 관계없이 동일하다. Black Forest Labs는 이 모델이 품질과 비용의 파레토 경계에 있으며 시장에서 가장 저렴하다고 주장한다. 또 다른 강점은 정밀도다. 자체 시험에 따르면 다른 주요 모델은 단 하나의 변경만 요청해도 원본 영상의 다른 부분까지 수정하는 경우가 많다.

API 매개변수
모델고속 변형 FLUX 3 Video Edit
요금출력 1초당 0.03달러
청구 예시10초 클립당 0.30달러
최대 원본 길이15초 및 50MiB
출력 해상도최대 720p, 초당 24프레임
프롬프트 길이1~4,096자

API는 의도적으로 간소화되어 있다. 영상과 프롬프트라는 두 필드만 있으면 되며, 선택적으로 검열 강도를 설정할 수 있다. 나머지는 모두 HTTP 422 오류로 거부된다. 무작위 시드나 길이, 강제 형식은 지정할 수 없다. 한계도 명확하다. 15초를 초과하는 원본은 잘리지 않고 거부되며, 영상을 양식 참조로 사용하는 기능과 마스크, 클립 확장은 지원하지 않는다. 대사와 관련해서는 새 텍스트의 길이를 교체할 대사의 길이에 맞춰 작성해야 한다고 문서에서 경고한다.

🔗 FLUX 3 Video Edit, Black Forest Labs의 X 게시물

Runway, 즉시 영상 생성 연구 공개

9월 10일 — Runway는 영상을 완성된 객체로 제공하는 대신 프롬프트가 입력되는 동안 스트리밍하는 방법을 자세히 설명한다. 출발점이 된 판단은 창작뿐 아니라 경제성과도 관련된다. 사용자 의견에 따르면 생성과 반복 작업은 업무에서 가장 느린 부분이며, 어떤 용도가 실현 가능한지는 주어진 품질 수준에서 출력물 하나를 만드는 비용에 따라 결정된다.

이 접근법은 Gen-4.5를 비롯한 기존 기반 모델을 두 단계로 사후 학습하는 데서 시작한다. teacher forcing은 아키텍처를 시간적으로 인과적인 자기회귀 생성기로 변환하고, student forcing은 분포 일치 증류를 통해 이를 가속해 각 이미지를 몇 단계의 노이즈 제거만으로 생성한다. 글에서 가장 유익한 대목은 두 번째 단계다. 오프 폴리시 증류는 메모리 비용이 낮지만 충분하지 않다. 진행 도중 스스로 오류를 수정할 수 있는 언어 모델과 달리 영상에서는 작은 오류가 프레임마다 누적되기 때문이다. 학생 모델이 학습 중 직접 시퀀스를 생성해 자신의 맥락을 접하는 온 폴리시 증류는 이러한 편향을 증폭하는 대신 교정한다. 마지막 교훈은 시퀀스 길이를 점차 늘리는 커리큘럼이 고정 길이보다 우수하다는 점이다.

🔗 즉시 영상 생성을 향하여, Runway


ElevenLabs, Universal Music Group과 다년 계약 체결

9월 10일 — ElevenLabs는 Universal Music Group과 다년간의 라이선스 계약 및 전략적 협업을 발표했다. 이는 음반 대기업과 맺은 회사 최초의 계약으로, 카탈로그 라이선스와 공동 제품 개발을 모두 아우른다.

협업은 라이선스를 취득한 음악과 아티스트의 자발적 참여를 기반으로 구축하는 새로운 음악 창작 플랫폼에서 시작된다. 아직 개발 중인 이 플랫폼은 팬들이 참여 아티스트와 작곡가의 곡을 바탕으로 리믹스, 매시업, 새로운 곡 해석, 맞춤형 음성 경험을 공동 창작할 수 있도록 하는 것을 목표로 한다.

핵심은 서비스의 분리이며, 이 부분은 주의 깊게 살펴볼 필요가 있다. 이 플랫폼은 ElevenLabs의 현재 음악 제품과 분리되어 별도로 판매된다. Music API와 ElevenMusic은 어느 쪽도 해당하지 않는다. 다시 말해 Universal의 라이선스 음악이 기존 모델을 강화하는 데 사용되는 것이 아니라 별도의 제품 안에 존재한다.

이번 발표는 관련 움직임이 집중된 시기에 나왔다. Suno는 9월 8일 Believe 및 TuneCore와 세계적 파트너십을 발표했고, Stability AI는 8월 말 Sony Music Group, Universal Music Group, Warner Music Group이 투자자로 참여한 시리즈 B 투자를 마무리했다. 따라서 Universal은 현재 서로 경쟁하는 여러 오디오 생성기와 각기 다른 수준으로 협력하고 있다.

🔗 ElevenLabs와 Universal Music Group의 계약


The Defense Factory, OpenAI의 지속적 사이버 방어 지침서

9월 9일 — OpenAI가 자사 보안 개선 과정의 실행 지침을 공개했다. 핵심 주장은 한 문장으로 요약된다. 갈수록 쉽게 구할 수 있는 공개 가중치 모델을 기반으로 장시간 공격 작업을 수행할 수 있는 에이전트 때문에 기존 방어만으로는 부족해지고 있지만, 방어자에게는 여전히 두 가지 구조적 이점, 즉 자체 코드에 대한 직접 접근권과 최첨단 모델을 사용할 수 있다는 이점이 있다.

출발점은 이론이 아니었다. OpenAI는 내부 적색경보를 발령하고 Security, Applied, Research 팀을 사고 대응 수준의 긴급 스프린트에 투입했다. 100개가 넘는 영역에 250명 이상을 동원했으며, 전체 목록이 완성되기도 전에 첫날부터 긴급하거나 우선순위가 높은 문제 53개를 해결했다.

공개된 지표
동원된 인원250명 이상
다룬 영역100개 이상
분류 후 수락된 할당90.6%
중복으로 확인된 발견 사항37%
실행 시 재현된 발견 사항19.5%
동적 검증 후 오탐0.81%
취소된 수정 사항0.53%
Codex를 거친 문제 해결 비율100%

이 방식을 재현하려는 이들에게는 두 가지 교훈이 두드러진다. 환경의 재현성이 실제 병목이다. 의존성과 구성이 올바르지 않으면 재현할 수 없는 발견 사항과 실행 자체가 불가능했던 시험을 구별할 수 없다. 또한 자율성은 수동 단계에서 출발해 점진적으로 구축된다. 작은 작업 묶음, 사람의 검증을 거친 뒤 결과에 대한 신뢰가 쌓일수록 반복 단계를 제거하는 방식이다. 누적된 맥락은 공유 SECURITY.md 파일에 저장되어 반복 작업마다 재사용된다. Cloudflare, Ramp, Google도 같은 접근법을 연구하고 있다.

🔗 The Defense Factory, OpenAI


OpenAI, 금융용 ChatGPT 출시하고 데이터 웨어하우스에 에이전트 연결

9월 10일 — ChatGPT for Financial Services는 GPT-6 Astra의 추론 능력과 사전 통합된 금융 데이터 기반을 결합하며, Morgan Stanley와 Evercore가 설계 파트너로 참여했다. 이 제품은 두 회사가 가장 큰 마찰을 겪는다고 지적한 투자은행 업무와 주식 리서치부터 시작한다.

차별화 요소는 데이터다. 각 은행이 직접 커넥터를 연결하도록 하는 대신 OpenAI가 Daloopa, PitchBook, LSEG News, Crunchbase 같은 프리미엄 데이터 세트를 직접 색인하고 호스팅한다. 여기에는 실적 발표 녹취록, 재무제표, 기초 재무 데이터, 비상장 기업 정보가 포함된다. 특히 세분화된 인용을 제공한다. 손익계산서를 표준화하는 분석가는 조정 영업이익의 산출 내역과 주석을 검토하고 어떤 비용이 제외되었는지 확인한 다음, 가치 평가에서 이를 어떻게 활용할지 결정할 수 있다. 기업이 이미 보유한 구독 서비스와 관련해서는 S&P Capital IQ, LSEG, MSCI, Dow Jones Factiva, Moody’s와 통합 인증을 개발 중이며 생태계에는 50개가 넘는 커넥터가 있다. 미국 재무부 보고서의 표, 그래프, 각주 분석을 다루는 OfficeQA Pro 벤치마크에서 GPT-6 Astra는 69.9%를 기록해 GPT-5.6 Sol의 60.2%를 앞섰다.

🔗 ChatGPT for Financial Services

Data agent, 자연어로 데이터 웨어하우스 조회

9월 10일 — ChatGPT Work의 새로운 Data 플러그인은 기업이 승인한 데이터 소스에 연결해 무엇이 달라졌는지 조사하고, 쿼리를 작성하지 않고도 대화형 대시보드를 생성한다. 커넥터 목록은 운영 환경의 주요 웨어하우스를 대부분 포괄한다. Amazon Redshift, Google BigQuery, Snowflake, Databricks, ClickHouse, MongoDB, Datadog뿐 아니라 Google Drive와 SharePoint의 파일도 포함된다.

중요한 점은 따로 있다. 에이전트는 조직의 비즈니스 정의—용어, 지표, 맞춤형 계산, 관계—를 통해 데이터를 해석한다. 이러한 정의는 Databricks Genie Ontology, dbt, GitHub, Snowflake Horizon 같은 의미 계층과 신뢰할 수 있는 소스에서 가져온다. 이것이 그럴듯한 답변과 팀의 데이터 모델에 부합하는 답변을 구분한다. 거버넌스도 같은 원칙을 따른다. 관리자는 어떤 연결을 어떤 역할에 공개할지 결정하며, 쿼리는 연결된 계정의 권한으로 실행되고 테이블·행·열 단위의 제한도 적용된다. 에이전트는 Omni, Oracle BI, Power BI, Sigma, Tableau, ThoughtSpot에서도 직접 작업할 수 있다. OpenAI는 자체 활용 현황을 근거로 제시한다. 제품 팀 거의 전체와 영업 조직의 3분의 2 이상이 이를 사용한다.

🔗 ChatGPT Work의 Data agent


OpenAI, GPT-6 Astra 기업용 자료 공개 및 Codex CLI 모델 선택기에 추가

9월 9일 — GPT-6 Astra 출시 일주일 후, OpenAI가 그동안 빠져 있던 수치를 담은 기업용 자료를 공개했다. 핵심 주장은 컴퓨터 사용 능력이다. Astra는 팀이 이미 사용하는 애플리케이션에서 작업하며, API를 제공하지 않는 애플리케이션까지 지원해 일반적으로 필요한 데이터 준비와 통합 개발 단계를 피할 수 있다. 이를 보여주기 위해 선택한 시연도 인상적이다. Financial Modeling World Cup 과제에서 Astra는 2023년 Microsoft Excel 챔피언십의 인간 우승자보다 약 4배 빠르게 Excel 과제를 완료한다.

공개된 지표
입력 및 출력 요금토큰 100만 개당 10달러 및 50달러
Terminal-Bench 4.0, GPT-6 Astra57.9%
Terminal-Bench 4.0, GPT-5.6 Sol237.3%
Terminal-Bench 4.0, Claude Fable 5.155.8%
Claude Fable 5.1 대비 작업당 예상 비용약 63% 낮음
Sol 대비 컴퓨터 사용 안전성의도하지 않은 결과 89% 감소
Preparedness Framework사이버 보안에서 최초로 Critical 기준에 도달한 모델

« GPT-5.6 Sol2 »라는 표기는 OpenAI가 Terminal-Bench 비교 글에서 실제로 사용한 표현이며, 이를 그대로 옮겼다. 배포 측면에서는 보안 부분이 가장 중요하다. Astra는 Preparedness Framework에서 사이버 보안 역량이 Critical 기준을 넘어선 최초의 모델이며, 이에 따라 보호 조치가 강화됐다. 관리자는 승인된 사이트와 애플리케이션으로 접근을 제한하고 탐색 기록을 관리할 수 있으며, 출시 시점에는 기업용 접근이 기본적으로 비활성화된다.

🔗 업무용 GPT-6 Astra, OpenAI

Codex CLI 0.154.0, 실험적 worktree와 모델 선택기의 Astra

9월 9일 — Codex CLI가 0.154.0으로 업데이트됐다. 이는 9월 4일의 0.153.4 이후 첫 번째 안정 버전이다. 이번 버전은 두 가지 추가 기능을 중심으로 구성된다. 첫 번째는 GPT-6 Astra의 완전한 통합이다. 이제 모델 선택기와 Amazon Bedrock 카탈로그에서 사용할 수 있으며, 새 모델로의 마이그레이션과 프롬프팅을 위해 내장된 OpenAI Docs 스킬도 업데이트됐다. 두 번째는 실험적인 worktree 지원이다. --worktree/worktree은 새 세션이나 포크된 세션을 위해 격리된 Git 체크아웃을 생성하며, codex exec을 포함해 이를 나열하고 재개할 수 있다. 하나의 저장소에서 여러 에이전트를 병렬로 실행하는 사용자에게 이는 브랜치끼리 충돌하는 고질적인 문제에 대한 해답이다.

그 밖에도 일상적인 사용성이 개선됐다. Codex가 작업을 계속하는 동안 초안을 잃지 않고 인라인 질문에 답할 수 있으며, Windows 세션 간에 백그라운드 Codex 서버를 공유할 수 있고, Vim의 교체 모드에서 실행 취소와 반복을 사용할 수 있다. 보안 측면에서는 이제 macOS 샌드박스가 터미널 입력 주입을 차단한다. 마지막으로 사용 중단 예정이었던 진입점 codex mcp-server가 제거됐다. 이를 여전히 사용하던 통합 기능은 마이그레이션해야 한다.

🔗 Codex CLI 0.154.0


Claude Code 2.1.268, 8건의 비밀 정보 유출 차단 및 Managed Agents 시각화 도구 추가

9월 10일 — Claude Code가 2.1.268로 업데이트됐다. 2.1.267이 나온 다음 날 공개된 내용이 풍부한 버전이다. 크게 세 가지 축으로 요약된다. 에이전트 집단 관리, 권한 모델 강화, 그리고 비밀 정보 유출과 관련된 일련의 수정 사항이다.

팀 단위로 Claude Code를 배포하는 경우 비밀 정보 관련 수정이 가장 눈에 띈다. 이전까지 플러그인 및 마켓플레이스 오류에는 소스의 Git URL에 포함된 토큰이나 비밀번호가 표시됐다. 또한 /mcp, /plugin, claude mcp list, claude mcp get이 표시하는 서버 상세 정보와 MCP 연결 오류에는 MCP 구성의 변수 치환을 통해 확인된 비밀 정보가 노출됐다. 이제 두 동작 모두 제거됐다.

권한 강화로 실제 사각지대 두 곳도 해결됐다. 심볼릭 링크로 연결된 디렉터리의 실제 위치를 경로로 지정하면 denyask 규칙이 해당 디렉터리에 적용되지 않았다. macOS의 /etc, /tmp, /var과 Linux의 /bin가 이에 해당한다. 수정된 두 번째 사례는 권한 검사기가 분석할 수 없는 명령어인 env -C 또는 eval가 같은 줄에 있을 때 Read나 Edit의 deny 규칙이 적용되지 않던 문제다.

영향받은 영역변경 사항
에이전트 집단 요금/cost에 맞춰 gateway 구성에 명시된 요금
권한심볼릭 링크로 연결된 디렉터리에 denyask 규칙 적용
비밀 정보오류 메시지와 /mcp에 Git 토큰이나 확인된 변수 값이 더 이상 표시되지 않음
수정된 회귀 문제2.1.265부터 발생한 타사 진입점의 HTTP 400
WebFetch제한 시간 300초, 환경 변수로 조정 가능

세 버전 동안 이어진 회귀 문제도 수정됐다. 2.1.265부터 Anthropic API와 호환되는 타사 진입점에서 매 턴 HTTP 400 오류가 발생했다. 해당 진입점이 거부하는 Artifact 도구 입력 스키마의 정규 표현식이 원인이었다.

🔗 2.1.268 릴리스 노트

Claude Managed Agents에 세션 시각화 도구와 자동 모드 추가

9월 10일 — Anthropic 개발자 계정이 하나의 스레드에서 두 가지 추가 기능을 발표했다. 첫 번째는 관찰 가능성에 대한 요구를 해결한다. 이전까지는 호스팅된 에이전트 세션이 실행 중이어도 접속해 살펴볼 수 없었다. 이제 ant beta:sessions connect 명령어로 터미널을 실행 중인 세션에 연결할 수 있으며, --web 옵션을 사용하면 대신 localhost에서 제공되는 인터페이스가 열린다.

두 번째 추가 기능은 권한 모드다. auto를 사용하면 Claude는 세션의 user.message 이벤트에 표현된 의도를 바탕으로 각 도구 호출을 검토한 뒤, 직접 실행하거나 거부하거나 사용자에게 결정을 되돌린다. 이 메커니즘은 Claude Code에 이미 있는 자동 모드의 논리를 터미널 연결 없이 서버 측에서 실행되는 에이전트에 옮긴 것이다. 두 발표가 함께 나온 이유도 여기에 있다. 시각화 도구가 없다면 서버 자동 모드는 내부 상황을 볼 수 없기 때문이다.

🔗 Claude Managed Agents 업데이트


GitHub, 도구 체인의 네 계층 강화

9월 9일 — GitHub가 코드 에이전트의 확산으로 기업 환경에 남아 있던 허점을 막았다. 이전까지 Copilot 에이전트의 보호 장치는 대부분 로컬 워크스테이션에서 설정됐다. 이제 Copilot Business 및 Copilot Enterprise 관리자는 중앙에서 관리되는 권한을 사용할 수 있으며, 각 에이전트 작업을 거부, 사람의 승인 필요, 별도 확인 없이 허용이라는 세 가지 범주로 분류할 수 있다.

범위는 자율 에이전트에 중요한 요소를 포함한다. shell 명령어, 파일 읽기 및 수정, 접근 가능한 네트워크 도메인이다. 핵심은 변경 기록의 한 문장에 담겨 있다. 관리되는 제한은 사용자 설정이나 작업 공간 설정, 자동 승인 또는 사용자가 과거에 이미 부여한 승인으로 완화할 수 없다. 이것이 기업 정책과 단순한 기본 설정을 구분하는 차이다. 팀마다 서로 다른 정책을 적용할 수 있어 회사 전체를 가장 엄격한 부서의 기준에 맞출 필요도 없다. 이 기능은 에이전트가 실제로 실행되는 세 환경인 GitHub Copilot 애플리케이션, Copilot CLI, Agent Host를 사용하는 Visual Studio Code 세션에서 곧바로 정식 제공된다.

🔗 Copilot 에이전트의 관리형 권한

GitHub Actions, 캐시에 최소 권한 원칙 적용

9월 10일 — 캐시 오염은 지속적 통합에서 잘 알려진 공격 경로다. 신뢰할 수 없는 소스에서 실행된 워크플로가 캐시에 데이터를 쓴 뒤, 신뢰할 수 있는 워크플로가 그 내용을 복원하는 방식이다. GitHub Actions는 워크플로나 작업 수준에서 선언할 수 있는 매개변수로 이에 대응한다. 각 워크플로나 작업에 필요한 접근 권한만 부여하며, 값은 네 가지다. 쓰기 없이 복원만 가능한 읽기 전용, 읽기 및 쓰기, 복원 없이 쓰기만 가능한 쓰기 전용, 접근 없음이다.

두 가지 세부 사항이 이 장치를 견고하게 만든다. 이 모드는 워크플로의 자율적인 준수에 맡겨지지 않고 캐시 서비스 자체에서 적용된다. 또한 재사용 가능한 워크플로에도 전파된다. 호출된 워크플로는 호출자가 부여한 것보다 더 많은 접근 권한을 얻을 수 없다. 신뢰할 수 없는 이벤트에는 읽기 전용 캐시를 적용하는 기존 기본값이 유지된다. 작성자가 이런 이벤트에 쓰기를 명시적으로 선언해 이를 무시하면 거부되는 대신 경고 주석이 표시된다. 이 기능은 모든 요금제에서 정식 제공된다.

🔗 Actions의 캐시 접근 제어

CodeQL 2.27.0, Linux ARM64에서 네이티브 실행

9월 9일 — GitHub 코드 분석의 기반이 되는 정적 분석 엔진이 2.27.0으로 업데이트되면서 기다려 온 인프라 기능이 추가됐다. 플랫폼 전용 릴리스 리소스를 통해 Linux arm64에서 네이티브로 실행된다. ARM 머신에서 지속적 통합을 실행하는 팀은 더 이상 에뮬레이션을 거칠 필요가 없다.

분석 범위 측면에서는 제어되지 않는 명령줄을 위한 Rust 전용 쿼리가 추가됐고, Java 및 Kotlin용 Micronaut 프레임워크가 모델링됐으며, libpq 실행 함수가 C 및 C++의 SQL 주입 종착점으로 지정됐다. 기본 구성은 조직의 비공개 레지스트리에서 사용자 지정 쿼리나 패키지를 가져오기 위해 인증할 수도 있다. 계획 수립 시 유의해야 할 사용 중단 예정 사항은 두 가지다. Java 9 및 10 지원은 2027년 1월에 종료되지만 Java 7 및 8 지원은 유지되며, 다중 플랫폼 배포판은 플랫폼별 아카이브로 대체되면서 제거될 예정이다.

🔗 CodeQL 2.27.0 및 Linux ARM64

npm, 복구 코드를 통한 로그인 후 72시간 동안 쓰기 작업 동결

9월 9일 — 복구 코드는 구조적으로 2단계 인증을 우회하는 수단이다. npm은 이에 맞춰 이전까지 영향력이 큰 계정에만 적용하던 보호 조치를 모든 계정으로 확대한다. 복구 코드를 통한 로그인이 성공하면 계정은 72시간 동안 보안 정지 상태로 전환된다.

정지 조치는 공급망 공격에 중요한 작업을 대상으로 한다. 패키지 게시와 접근 토큰 생성을 포함한 민감한 쓰기 작업이 일시 중단된다. 로그인, 탐색, 패키지 설치를 비롯한 나머지 기능은 정상적으로 계속 작동한다. 지원팀에 별도로 요청하지 않아도 기한이 끝나면 자동으로 해제된다. 복구 코드를 사용하지 않았는데도 차단된 사용자는 즉시 지원팀에 문의하라고 npm은 안내한다.

🔗 npm 보안 정지 확대


NVIDIA, 하루에 5건의 발표 공개

9월 10일 — 연이어 나온 발표의 규모 자체가 내용만큼 주목할 만하다. 첫 발표는 Nemotron 3 Ultra에 적용된 NIM 2.0.12 서비스 스택의 수치를 다룬다. B200 4대로 구성된 시스템에서 입력 컨텍스트 64K, 출력 토큰 400개, KV 캐시 재사용률 76%라는 대표적인 에이전트 워크로드를 사용했을 때, 최적화된 스택은 동일한 상호작용성을 유지하면서 시스템 처리량을 초당 718토큰에서 1,997토큰으로 높인다. 이는 사용자당 초당 50토큰이라는 동일한 목표에서 동시 사용자 수가 2.5배 늘어난다는 의미다.

이 글의 의미는 수치 그 이상이다. NVIDIA는 벤치마크 표가 자주 가리는 한 가지 사실을 강조한다. 추론 성능은 시스템의 속성이라는 점이다. 정밀도와 커널, 병렬 처리, 스케줄링, 배치 처리, 메모리 할당, 접두사 재사용, 디코딩 전략이 모두 상호작용하며, 성능 향상은 개별 조정의 백분율을 단순히 더한 결과가 아니라 서로 결합된 구성 묶음에서 나온다. 회사는 자사 성능 곡선조차 상대화한다. 이는 출발점일 뿐이며, 권장 방법은 이미지 다이제스트를 고정한 상태에서 자체 트래픽을 재현한 다음 지연 시간 목표를 충족하는 Pareto 지점을 선택하는 것이다.

🔗 Nemotron 3 Ultra의 NIM 최적화

Skild AI, 단 하나의 영상으로 로봇에게 작업 학습

9월 10일 — Skild AI의 로봇 파운데이션 모델 S1은 작업자가 원하는 작업을 촬영하고 그 영상을 프롬프트로 모델에 제공하는 방식이다. S1은 영상에서 드러난 의도, 객체, 작업 순서를 해석한 뒤 재훈련이나 가중치 업데이트 없이 눈앞의 로봇이 수행할 동작으로 변환한다.

수치는 성능 향상의 규모를 보여준다. 새로운 다단계 작업에서 S1은 각 단계를 약 66% 성공한 반면, 비교 가능한 시스템은 9%에 그쳐 7배 이상의 성능 차이를 보였다. Skild는 짧은 시연 영상 하나가 수작업으로 수집한 약 380개의 훈련 예제, 즉 인간 노동 50~100시간과 맞먹는 효과를 제공한다고 추정한다. 화분 분갈이 테스트에서는 녹화부터 자율 실행까지 11분이 걸렸다. 사업적 맥락도 주목할 만하다. Skild는 첫 배포 후 10개월 만에 연환산 매출 1억 달러의 실행률과 60건 이상의 파트너십을 발표했다. Skild, NVIDIA, Foxconn은 이미 Blackwell 시스템 조립을 위해 양팔 매니퓰레이터에 이 모델을 배포하고 있다.

🔗 Skild AI와 NVIDIA 물리 AI 스택

9월 10일 — 추론 가속기 제조사 d-Matrix는 차세대 XPU Raptor를 NVLink Fusion을 통해 NVIDIA 인프라 플랫폼에 연결할 예정이다. 여기에는 NVLink 스케일업, Spectrum-X 스케일아웃, MGX 랙 아키텍처가 포함된다. 또한 Vera CPU, ConnectX-9 SuperNIC, BlueField-4 DPU를 통합하고, 분리형 추론을 위해 Vera Rubin NVL72 같은 GPU 시스템과 함께 자사 랙을 운영할 계획이다.

이번 발표의 의미는 산업적 논리에 있다. XPU 설계는 첫 단계일 뿐이며, 이를 대규모로 배포하려면 검증된 네트워크, 랙 아키텍처, 전력, 냉각, 소프트웨어, 공급망이 필요하다. 각 단계는 시간과 비용, 위험을 추가한다. 운영상의 핵심 논리는 상호 대체 가능성이다. 공통 랙을 표준으로 삼으면 데이터센터를 한 번 구축한 뒤 프로세서 유형마다 별도의 아키텍처 없이 GPU, CPU, XPU를 수용할 수 있다. 달리 보면 NVLink Fusion은 컴퓨팅 실리콘이 다른 곳에서 공급되더라도 NVIDIA가 랙, 네트워크, 소프트웨어를 계속 장악할 수 있게 하는 메커니즘이다.

🔗 d-Matrix의 NVLink Fusion 도입

NVIDIA, Nemotron과 Palantir Foundry로 공급망 전문성을 체계화

9월 10일 — 이는 제품 시연이 아니라 초대형 내부 운영에서 얻은 경험을 공유하는 사례다. 규모를 보면 문제가 분명해진다. Grace Blackwell NVL72 플랫폼에는 수백만 개의 부품과 수천 곳의 공급업체가 관여하며, 랙 하나를 구성하는 18개의 컴퓨팅 트레이 중 단 하나에도 Grace CPU 2개, Blackwell GPU 4개, HBM3e 스택 32개가 필요하다. Vera Rubin의 부품 명세는 이보다 두 배 더 크다.

어려움은 규모가 아니라 변동성에 있다. 어느 주에 조립을 가로막았던 부품이 다음 주에는 넘쳐날 수 있다. NVIDIA는 자체 지표인 Time of Ownership을 추적한다. 이는 제조 시설이 자재를 받은 시점부터 해당 자재가 부분 조립품이나 완제품으로 시설을 떠나는 시점까지를 측정하며, 위탁 제조업체는 서로 다른 세 곳의 공급원에서 모든 자재가 도착한 뒤에야 작업을 시작할 수 있다. NVIDIA에 따르면 이 기간을 줄이려면 실시간 가시성, 중복성, 상류 공급망 약속의 신뢰성, 인간 전문성의 체계화라는 네 가지 요소가 필요하다. 이 글은 마지막 요소를 가장 혁신적인 것으로 제시한다. 복잡한 할당 결정의 바탕이 되는 판단을 매번 조정할 때마다 처음부터 다시 시작하는 대신, 지속적으로 축적되는 지식으로 만드는 것이다.

🔗 Nemotron과 Palantir Foundry로 공급망 체계화

BioNeMo Inference Runtime, 단백질체 규모의 구조 예측 가속

9월 10일 — BioIR은 최적화된 커널과 적용 가능한 경우 CUDA Graphs를 사용해 기존 PyTorch 워크플로를 유지하면서 NVIDIA GPU에서 생체분자 구조 예측 모델을 가속한다. 서로 독립된 입력으로 이루어진 대규모 배치의 경우, Ray를 이용하면 하나의 모델을 분산하는 대신 같은 노드의 각 GPU에서 모델의 전체 복제본을 실행할 수 있다.

목표는 처리량이다. 이제 구조 예측은 단백질 하나를 처리하는 수준이 아니라 전체 작업 목록을 파이프라인에 통과시키는 단백질체 규모로 수행되는 경우가 많다. 가장 설득력 있는 근거는 실제 활용 사례다. BioIR은 최근 AlphaFold 데이터베이스 확장에 사용되어 4,777개 단백질체에서 단백질 복합체 구조를 생성했으며, 이는 약 3,100만 개의 후보 복합체에 해당한다.

🔗 BioIR을 활용한 고처리량 구조 예측


Together AI, 커널을 Vera Rubin으로 이식하고 선점형 컴퓨팅을 절반 가격에 개방

9월 10일 — FlashAttention을 개발한 바로 그 Together AI 커널 팀이 NVIDIA Vera Rubin NVL72 플랫폼에 조기 접근해 자사의 GPU 커널 라이브러리인 ThunderKittens의 이식 과정을 문서화했다. 출발점부터 시사하는 바가 크다. Rubin은 Blackwell의 프로그래밍 모델을 유지하므로 기존 커널이 수정 없이 작동하지만, NVFP4에서는 이론적 한계의 42.1%, FP8에서는 44.4%에만 도달한다. 원인은 말로 설명하기는 쉽지만 해결하기는 어렵다. Rubin에서는 tensor core가 피연산자를 두 배 빠르게 소비할 수 있지만, Blackwell 커널이 이를 충분히 빠르게 공급하지 못한다.

성능을 끌어올리는 방법은 세 가지다. 첫째, K 방향의 단계당 크기를 32바이트에서 64바이트로 늘려 명령어를 확장한다. 둘째, 타일링을 1x1에서 2x1로 바꿔 출력 블록마다 행렬 B를 한 번만 불러오도록 읽는 바이트 수를 줄인다. 이는 tensor memory에 64개 열이 추가된 덕분에 가능하다. 셋째, 공유 메모리가 328 KiB로 확장된 점을 활용해 더 많은 타일을 미리 준비하도록 파이프라인을 심화한다. 탐색 결과는 마지막 방법의 효과를 수치로 보여준다. 정사각형 16k NVFP4 GEMM에서 단계를 3개에서 5개로 늘리자 처리량이 17,054 TFLOPS에서 22,239 TFLOPS로 상승했다. FP8에서는 최적 성능이 11,995 TFLOPS에 이른다. 측정은 적격성 평가용 샘플 버전 GPU에서 CUDA 13.4를 사용해 수행됐다.

🔗 NVIDIA Vera Rubin NVL72의 ThunderKittens

선점형 컴퓨팅, 온디맨드 요금의 50%로 제공

9월 10일 — Together AI가 자사 GPU 클러스터에서 두 번째 컴퓨팅 유형을 공개 미리보기로 선보인다. 고정된 절반 가격으로 청구되는 선점형 노드다. 일반적인 현물 시장과 다른 점은 바로 이 고정 요금으로, 경매 가격을 따르지 않는다. 사용량은 시간보다 짧은 단위로 청구되며 1~2분마다 측정된다.

재개 조건도 명확하다. 다른 곳에서 용량을 요구하면 클러스터는 최대 5분 동안 드레이닝 절차를 진행한다. 노드를 차단하고 Kubernetes 이벤트를 발생시키며, pod에 SIGTERM을 보내고, 워크로드에 checkpoint를 기록할 5분을 준 뒤 노드를 삭제한다. Together AI는 이 시간이 충분한지 판단하는 데 유용한 기준을 제시한다. 매개변수 3,210억 개 모델의 전체 가중치 checkpoint는 약 3.5 TB이며, 성능이 저하된 상황에서도 병렬 파일 시스템에 기록하는 데 22초에서 4분이 걸린다. 적용 대상이 아닌 경우도 두 가지로 명시했다. checkpoint 없이 며칠 동안 진행되는 학습과 대체 수단 없이 엄격한 서비스 수준을 보장해야 하는 서비스다.

🔗 Together AI 선점형 컴퓨팅


Mistral, Cloudera와 손잡고 Vibe CLI의 보안 허점 네 곳 차단

9월 10일 — Mistral이 규제 산업의 여러 대기업에서 사용하는 하이브리드 데이터 플랫폼 기업 Cloudera와 파트너십을 발표했다. 협약은 두 영역을 다룬다. 첫째는 추론이다. Mistral 모델이 플랫폼에 통합되어 사설 또는 공용 cloud, 자체 시설, 심지어 네트워크에서 완전히 격리된 환경에서도 배포할 수 있다. 둘째는 학습이다. 기업이 직접 통제하는 환경 안에서 축적한 독점 데이터로 모델을 학습할 수 있도록 Mistral이 지원한다.

제시된 수치는 목표로 삼은 데이터 자원의 규모를 보여준다. Cloudera 플랫폼에서 관리되는 고객 데이터가 30 exabyte에 달한다. 이 글은 주권형 AI를 수사적 표현이 아닌 운영 관점에서 정의한다. 데이터는 고객이 정한 경계 안에 머물고, 모델은 개방형 가중치로 맞춤화되어 고객의 소유가 되며, 학습과 추론은 고객이 선택한 인프라와 관할권에서 실행된다. 모델이나 요금, 출시 일정은 발표되지 않았다. 이는 제품 출시가 아니라 유통 및 통합 협약이다.

🔗 Mistral과 Cloudera

Vibe CLI 2.25.1과 2.25.2, 인증되지 않은 디버그 리스너 제거

9월 9일과 10일 — Mistral이 명령줄 코딩 에이전트의 두 버전을 잇달아 출시했다. 더 큰 변화가 담긴 버전은 2.25.1이며, 새로운 기능보다 수정된 문제들이 더 주목할 만하다. 변경 기록의 네 항목이 보안과 직접 관련된다.

가장 분명한 조치는 localhost:5678에서 인증 없이 작동하던 debugpy 리스너를 제거한 것이다. 이 리스너는 디버그 모드가 vibe-acp으로 설정되면 활성화됐으며, 모든 로컬 프로세스가 여기에 연결해 에이전트의 컨텍스트에서 코드를 실행할 수 있었다. 같은 수정에서 hook 명령은 더 이상 shell을 거치지 않으므로 저장소의 hooks.toml 파일을 통한 잠재적 삽입 공격도 차단됐다. 나머지 두 수정은 smart approve 모드를 대상으로 한다. 빠른 사전 검사 기능은 지금까지 읽기용 git 명령인 git diff, git show, git blame, git log -p, git status -v을 자동 승인했지만, 이 명령들은 바로 파일 내용을 출력하는 명령이다. 따라서 diff에 표시된 비밀 정보가 확인 절차 없이 읽힐 수 있었다. 이제 이 명령들은 다시 분류기를 거친다. 또한 명령 앞에 cd을 붙이면 비밀 정보 분석이 그 뒤의 부분만 읽어 사전 검사를 우회할 수 있었으나, 이제는 명령 전체를 읽는다.

다음 날 공개된 2.25.2는 변경 사항이 더 적다. VS Code 확장 기능에 디버그 하위 메뉴가 추가되어 단계, token, 처리량, 컨텍스트, 비용을 표시하는 세션 상태 패널을 제공한다. 또한 권한 시스템의 눈에 잘 띄지 않는 결함도 수정됐다. 영구 권한 부여를 기록하지 못했을 때 오류가 조용히 무시되어, 다음 세션에서 아무런 설명 없이 같은 질문을 다시 표시하던 문제다.

🔗 Vibe CLI 2.25.2


커뮤니티 기여 두 가지: Gradio 그래프로 구현한 AUTOMATIC1111과 tensor별 민감도 분석

9월 10일 — Hugging Face의 Gradio 팀이 AUTOMATIC1111을 그래프 형태로 재구성한 Workflow1111을 공개했다. 이 시연은 복제 가능한 Space의 단일 캔버스에 미디어 파이프라인 11개와 노드 73개를 통합한다. 앞선 글에서 작은 그래프 5개만 보여줬던 워크플로 기본 요소를 대상으로 한 부하 테스트라는 의미도 있다.

목표는 stable-diffusion-webui 사용자가 익숙한 탭을 포괄하는 것이다. text-to-image, 고해상도 보정, image-to-image, 이미지 질의, prompt 행렬, 확대 및 배경 제거, 전처리기, PNG 텍스트 블록에 저장된 생성 매개변수 불러오기를 지원한다. 여기에 AUTOMATIC1111에는 없었던 기능 두 가지도 추가됐다. 언어 모델을 활용한 prompt 작성과 image-to-video다. 개발자가 주목할 부분은 노드의 성격이다. 애플리케이션의 연산자 노드 36개 중 22개는 프로세스 내부에서 완전히 실행되며, 언어 모델과 diffusion 모델을 결합하는 데 사용자 지정 노드가 전혀 필요하지 않다. 둘 다 일반 노드로 취급된다. 두 가지 출력 방식도 눈여겨볼 만하다. 캔버스의 각 출력 노드는 route를 직접 작성하지 않아도 REST endpoint가 되며, 그래프는 Hugging Face 인프라에 종속되지 않아 노드가 모델을 로컬로 불러와 자체 GPU에서 실행할 수 있다.

🔗 Gradio 팀의 Workflow1111

Bartowski, 더 나은 GGUF quantization을 위해 tensor별 민감도 지도 작성

9월 10일llama.cpp 사용자의 상당수가 기본 기준으로 삼는 GGUF quantization을 제작하는 Bartowski가 모델을 압축할 때 실제로 무엇을 보호해야 하는지 체계적으로 분석한 연구를 공개했다. 출발점의 문제는 간단하다. 상류의 quantization 코드와 Bartowski의 자체 수정 사항 모두 모든 아키텍처에 같은 규칙을 적용한다.

방법은 직접적이다. 저자는 각 tensor에 대해 두 가지 변형을 만든다. 하나는 특정 tensor만 q2_k에 두고 나머지를 모두 q8_0으로 설정하며, 다른 하나는 그 반대로 설정한다. 그런 다음 wikitext-2-raw에서 Kullback-Leibler divergence로 측정한 성능 저하를 한 번에 tensor 하나씩 확인한다. 탐색 대상은 Qwen3.5-0.8B와 Qwen3.5-4B다. 세 가지 결과가 두드러진다. token_embd이 민감도 규모에서 확연히 우세하고, 깊이에 따른 민감도는 U자형 곡선을 그리며, 사용한 bit를 기준으로 보면 작은 attention projection이 뚜렷하게 두각을 나타낸다. 저자는 이 데이터를 바탕으로 모델 형태, 상대적 손상 표, bit budget을 이용해 tensor별 배치를 구성하는 solver를 만들었다.

🔗 GGUF quantization을 위한 tensor별 배치 지도


Amp, 모드 다이얼 개방…Replit과 Databricks 통합은 정식 제공 전환

9월 10일 — Amp가 7월부터 네 단계로 에이전트의 작업 강도를 제어해 온 선택기를 개방한다. 지금까지 각 단계에서 사용할 모델은 Amp가 단독으로 결정했으며, 7월에 공개한 「누가 모델에 관심을 가지는가?」라는 제목의 글에서 이 입장을 옹호한 바 있다. 이번 업데이트는 그 입장을 철회하는 대신 선택 사항으로 바꾼다.

첫 번째 탭에서는 내장 모드의 서로 다른 세 역할인 기본 에이전트, Oracle, 하위 에이전트에 사용할 모델과 추론 노력을 지정할 수 있다. 이 모델들은 사전에 연결된 사용자의 API key 또는 ChatGPT 구독을 통해 실행되며, 요금은 Amp 요금제가 아니라 해당 연결 방식을 따른다. 모드의 prompt와 도구는 유지되고 엔진만 바뀌며, 자동으로 남겨둔 항목에는 계속 Amp의 선택이 적용된다. 두 번째 탭은 이미 plugin으로 사용자 지정 에이전트를 만든 사용자를 위한 것이다. 사용자 지정 에이전트를 내장 모드 옆의 다이얼에 배치할 수 있으며, plugin 에이전트가 기존 모드와 달라야 할 부분만 설명해 해당 모드를 확장할 수도 있다. 2~4개의 모드를 끌어서 배치하고 순서를 정한 뒤 길게 눌러 확인하면 된다. 관리자는 개인의 선택을 덮어쓰지 않으면서 팀용 공용 다이얼을 정의할 수 있다.

🔗 나만의 다이얼 만들기, Amp

Replit, Databricks 통합을 정식 제공하고 Lakebase 기본 지원 추가

9월 10일 — Replit이 6월에 발표한 공개 미리보기를 마치고 Databricks 통합을 정식 제공으로 전환하며, Databricks의 관리형 데이터베이스인 Lakebase의 기본 지원도 추가한다. 역할 분담은 그대로다. Replit은 애플리케이션 제작 속도를 높이고, Databricks는 기업 데이터를 호스팅하며 접근 권한을 관리한다.

Lakebase는 읽기와 쓰기 사이의 공백을 메운다. 지금까지 이 통합으로 구축한 애플리케이션은 관리되는 데이터 창고의 데이터를 읽을 수 있었지만, 자체적으로 생성한 데이터는 다른 곳에 저장해야 했다. 기본 지원이 추가되면서 두 데이터가 나란히 존재할 수 있게 됐고, 배포 시 Replit Agent가 해당 데이터베이스를 자동으로 프로비저닝한다. 두 번째 새로운 기능은 이런 아키텍처에서 가장 즉각적인 위험인 운영 데이터로 애플리케이션을 테스트하는 문제를 다룬다. 이제 Replit은 별도의 미리보기 환경을 만들어 테스트 데이터를 실제 업무 데이터와 격리한다.

🔗 Replit과 Databricks 통합 정식 제공


Sakana AI, SCSK 및 Sumitomo Corporation과 3자 동맹 체결

9월 10일 — Sakana AI가 일본 산업에 AI를 도입하기 위해 SCSK Corporation 및 Sumitomo Corporation과 포괄적 사업 파트너십을 발표했다. 서두에서 제시한 진단은 모델 자체보다 그 주변 요소에 초점을 맞춘다. 고객에게 중요한 것은 특정 AI를 채택하는 일이 아니라 업무 목표에 맞는 AI를 사용해 구체적인 성과를 내는 것이다. 이를 위해 데이터, 기존 시스템과의 통합, 품질, 정보 보안, 거버넌스, 배포 후 운영을 하나의 과정으로 다뤄야 한다. 보도자료는 이런 유형의 협약에서 드물게 명확한 점도 언급한다. 특정 기술이나 모델에 지나치게 의존해서는 안 된다는 것이다.

각 회사는 서로 다른 요소를 제공한다. Sakana AI는 모델 연구 역량과 고객 문제를 사용 사례로 바꾼 뒤 구현으로 이어가는 능력을 제공한다. SCSK는 알고리즘과 실제 업무 구현 사이의 간극을 메우는 것으로 소개된 통합 역량을 제공한다. Sumitomo Corporation은 약 900개의 연결 회사와 10만 고객 기반이라는 현장을 제공한다. 네 가지 프로젝트가 시작되며, 기술적으로 가장 구체적인 프로젝트는 사이버 보안에 관한 것이다. 세 파트너는 SCSK의 Frontier AI 프로그램을 통해 Sakana AI가 개발한 orchestration 모델을 기반으로 취약점 진단부터 수정까지 지원하는 솔루션을 설계할 예정이다.

🔗 Sakana AI, SCSK 및 Sumitomo Corporation 파트너십


단신

  • Claude Code 데스크톱 애플리케이션의 패널을 분리할 수 있게 됨 — Claude가 기본 창에서 계속 작업하는 동안 diff 패널이나 터미널을 두 번째 화면으로 옮겼다가 다시 결합할 수 있다. 이번 게시물은 릴리스 노트 없이 사용 사례를 소개하는 형식이므로 실제 제공 시작일은 확인되지 않았다. 🔗 출처
  • 9월 11일부터 25일까지 열리는 커뮤니티 buildathon, Fable 5.1 Build Days — Claude 커뮤니티가 2주 동안 전 세계 여러 도시에서 buildathon을 개최하며, Anthropic 커뮤니티 페이지에서 참가 신청을 받는다. 🔗 출처
  • T. Rowe Price가 Claude를 투자 조직 전반으로 확대 — 펀드 매니저와 애널리스트는 Claude 및 Cowork와 함께 펀더멘털 리서치를 수행하고, 개발자들은 Claude Code로 투자 도구를 구축한다. 강조된 핵심은 배포가 지원 부서가 아니라 종목을 선정하는 사람들부터 시작된다는 점이다. 🔗 출처
  • Claude SMB 투어가 1,000명의 경영진에게서 Anthropic이 배운 것 — 파트너 Tenex와 함께 6주 동안 10개 지역을 순회했으며, 각 일정에는 반나절간의 무료 교육과 약 100명의 경영진이 실제 업무 하나를 자동화하는 세션이 포함됐다. 이는 5월 출시된 Claude for Small Business 플러그인을 중심으로 진행됐다. 🔗 출처
  • Zed가 Delta에서 준비 중인 코드 리뷰를 공개 — 에이전트가 변경 사항을 구조화된 리뷰 가이드로 변환해 원래 대화 스레드 옆에 표시하므로, 코드를 작성한 에이전트에게 직접 질문할 수 있다. 공개 시점은 “곧”이라는 표현 외에는 알려지지 않았다. 🔗 출처
  • Warp가 pull request당 비용을 80달러에서 30달러로 절감 — 여러 공급자에서 실제 에이전트 실행을 재현한 결과, 기존 구성인 Claude Opus 5보다 비용을 66퍼센트 절감하면서 GPT 5.6 Sol에서 가장 높은 코드 품질을 얻었다고 회사는 밝혔다. 다만 이 평가는 필연적으로 사내 corpus에 좌우된다. 🔗 출처
  • Meta FAIR가 전체 효소 시스템을 QM/MM보다 1,000배 빠르게 시뮬레이션 — 시카고의 Andrew Ferguson 연구팀과 함께 명시적 용매를 포함한 약 100,000개 원자 규모의 완전한 효소를 준양자 수준의 정확도로 시뮬레이션했으며, 실험 측정값과도 일치했다. 조사 시점에는 논문이나 모델이 공개되지 않았다. 🔗 출처
  • Together AI, 법률 작업에서 Kimi K3가 Fable 5.1보다 60퍼센트 앞선다고 주장 — Harvey의 lab-aa 벤치마크에 포함된 어려운 자율 작업을 대상으로 한 주장으로, 측정 방법론이나 프로토콜 없이 Kimi K3를 상업적으로 제공하는 업체가 발표했다. 확립된 결과가 아니라 주장으로 다뤄야 한다. 🔗 출처
  • Hugging Face가 Training Agents 네 번째 에피소드를 공개 — 보상 함수에서 에이전트 훈련 환경으로 전환하는 과정을 다룬 1시간 15분 분량의 생방송이다. 🔗 출처
  • Google AI가 초파리 connectome을 활용한 커뮤니티 프로젝트를 정리 — MaleCNS 데이터세트의 뉴런 166,000개가 공개된 지 일주일 만에 Minecraft, Doom, Beat Saber를 비롯한 6개 커뮤니티 프로젝트가 등장했다. 이 중에는 100달러 상당의 bitcoin을 초파리 뇌에 맡기고 수익이 나면 도파민 자극을 주는 프로젝트도 있다. 🔗 출처
  • pull request의 AI Scan 활성화를 API로 지원 — 조직과 repository를 위한 2개의 REST endpoint를 통해 AI 지원 탐지 기능을 대규모로 배포할 수 있다. 조직 수준에서 비활성화된 설정을 repository 설정으로 우회할 수는 없다. GitHub Advanced Security용 공개 preview다. 🔗 출처
  • 모든 Copilot 환경에서 MAI-Code-1-Flash 제거 — Copilot Chat, 인라인 편집, ask 및 agent 모드, 자동 완성에서 당일부로 지원이 중단되며, 대안은 MAI-Code-1.1-Flash다. 기업 관리자가 이 모델을 명시적으로 허용해야 할 수도 있다. 🔗 출처
  • Xcode 27 runner 이미지가 macOS 27로 전환 — 호스팅되는 macOS runner가 타기팅 label 변경 없이 macOS 26에서 macOS 27 공개 preview로 전환된다. arm64 runner에서만 제공된다. 🔗 출처
  • NVIDIA가 3대의 컴퓨터로 구성된 robotaxi stack을 상세히 소개 — robotaxi 시장이 2035년까지 4,000억 달러 규모와 600만 대 이상의 상용 차량에 이를 것으로 전망하고, 모든 주요 상용 프로그램이 자사의 modular stack에서 실행된다고 주장하는 포지셔닝 게시물이다. 🔗 출처
  • Luma가 Layers에서 이미지에 삽입된 텍스트를 추출 — layer를 선택하고 Extract를 누르면 픽셀에 새겨진 텍스트가 library에서 가장 가까운 font를 적용한 편집 가능한 텍스트로 되살아난다. 문구를 수정할 때 전체를 다시 생성하는 대신 두 번의 클릭만 하면 된다. 🔗 출처
  • USC와 함께 개발한 HorizonRelight가 장시간 영상의 조명을 안정화 — ECCV 2026에서 발표된 NVIDIA와 University of Southern California의 연구로, sliding window의 context를 다음 window로 전달해 segment 사이의 조명 변화를 방지한다. 🔗 출처
  • Wan이 NadouPro와 함께 Wan 3.0 세계 대회를 개최 — 상금이 10,000달러를 넘는 커뮤니티 대회로, 관련된 신제품 발표는 없다. 🔗 출처
  • Midjourney가 body scanner에 관해 커뮤니티 의견을 조사 — 전신 초음파 검사를 수행하는 scanner를 주제로 두 차례 설문을 진행했으며, 제품이나 출시 일정은 발표되지 않았다. 공개적인 시장 조사이므로 인용하기 전에 확인이 필요하다. 🔗 출처
  • MiniMax가 Nebius의 AI Builder 프로그램에 합류 — NVIDIA, LangChain, Hugging Face, Cognition, Prime Intellect와 함께 참여한다. 해당 기간에 나온 MiniMax의 유일하게 실질적인 게시물이다. 🔗 출처
  • Kling AI가 TIFF Market 2026에 참가 — 프로그램과 연사가 공개됐고 현장 booth도 운영하지만, 신제품 출시는 없다. 🔗 출처
  • NVIDIA가 Seattle DGX Spark hackathon 시상식을 재방송 — 제품 발표가 없는 41분 분량의 커뮤니티 콘텐츠다. 🔗 출처
  • Codex Python SDK 0.154.0에 max 및 ultra reasoning effort 추가 — 외부 메시지가 turn을 시작하거나 활성 turn에 합류할 수도 있으며, 이때 tool 수준의 권한을 갖지만 사용자 승인을 부여하지 않는다는 점이 명시됐다. hook metadata와 typed notification에 적용할 2건의 migration이 예정돼 있다. 🔗 출처
  • Codex와 ChatGPT를 활용한 새로운 항균제 탐색 — César de la Fuente 연구소를 소개하며, 초기 후보 분자 탐색 기간을 수년에서 몇 시간으로 단축한 사례를 다룬다. 연구자는 체계적인 검증과 검증 실험의 대체 불가능한 역할을 강조한다. 🔗 출처
  • Cohere가 Berlin에서 찍은 사진 모음을 게시 — North Small Translate 출시 3시간 뒤에 올라온 두 단어와 사진 4장뿐인 게시물로, 제품 발표나 활용 가능한 정보는 없다. 🔗 출처

이것이 의미하는 것

오늘 가장 뚜렷한 사실은 세 가지 발표에 분산돼 거의 눈에 띄지 않았다. SWE-2는 2조 8,000억 개 parameter를 갖춘 open model Kimi K3를 기반으로 post-training됐다. Gen-1 Slides는 MiniMax M3에서 출발했고, Genspark는 이 open base가 없었다면 몇 주 만에 해당 모델을 만들 수 없었을 것이라고 명시했다. 같은 날 Together AI는 Fable 5.1과 비교하며 Kimi K3를 내세웠다. 24시간 동안 중국에서 공개한 weight를 기반으로 구축된 서구 제품이 3개이며, 그중 2개는 기업에 판매된다. Frontier Red Team 보고서는 이 논쟁에서 좀처럼 언급되지 않는 반대 측면도 덧붙인다. 시뮬레이션된 부하 차단에서 Kimi K3는 Sonnet 5보다 높은 수준에 있으며, Anthropic은 최전선과의 격차를 안전 여유로 해석해서는 안 된다고 신중하게 명시한다. weight 공개는 가격뿐 아니라 역량의 분포도 바꾼다.

보안은 담론에서 수치의 영역으로 넘어갔으며, 같은 날 4개 업체에서 이런 변화가 나타났다. Anthropic은 더 이상 원칙만 발표하지 않고 group identifier, 유출된 데이터 양, operation 지속 시간을 공개한다. OpenAI는 자체 방어 chain의 false positive 비율, 즉 dynamic validation 이후 0.81퍼센트라는 수치와 철회된 수정 사항의 개수를 공개한다. GitHub는 화려하지 않지만 모두 실제 경로 하나씩을 차단하는 4가지 least privilege 조치를 제시한다. Mistral은 인증되지 않은 debug listener를 수정했는데, 이 문제 때문에 모든 local process가 agent context에서 코드를 실행할 수 있었다. 이 발표들을 잇는 세부 사항은 어디서나 같다. 문서화된 침해는 모델이 아니라 그 배관에서 비롯됐다. 고객에게서 탈취된 API key, shell에서 실행된 hook, 자동 승인된 읽기용 git command, 오염된 continuous integration cache가 원인이었다.

가격 대비 성능의 전환은 빨라지고 있지만, 그 적용 범위를 명확히 해야 한다. SWE-2는 64퍼센트 저렴한 가격으로 Fable 5.1과 같은 수준이며, Gen-1 Slides는 presentation 분야에서 0.44달러의 비용으로 4.16달러인 Opus 5를 앞선다. V4.1-Flash는 Flash 요금으로 V4-Pro를 대체하고, Together AI는 절반 가격의 preemptible 서비스를 제공한다. GPT-Live-1의 음성 요금은 분당 0.05달러이며, FLUX 3 Video의 편집 요금은 초당 0.03달러다. 하지만 DeepSeek의 표는 나머지 절반을 보여준다. Terminal-Bench 3.0에서는 30.0 대 43.3, Humanity’s Last Exam에서는 36.8 대 56.3이다. 저렴해지는 것은 일반적인 agent 작업이지 어려운 작업이 아니다. Genspark도 약점이 지적되기 전에 먼저 공개하며 같은 취지로 설명한다. 현시점에서 올바른 접근은 더 이상 모델 하나를 선택하는 것이 아니라, 전체 workload 중 어느 부분이 가격 격차가 실재하는 영역에 속하는지 파악하는 것이다.

마지막으로 생성형 시청각 기술은 시연을 벗어나 계약과 단위 요금의 단계로 들어서고 있다. HeyGen은 OpenAI와 함께 MIT license 기반의 완전한 real-time avatar framework를 공개하고, Synthesia는 같은 날 Express-3를 출시했다. Black Forest Labs는 명확하게 문서화된 제한과 함께 초 단위로 영상 편집 요금을 부과한다. Runway는 긴 sequence에서 policy distillation만이 실현 가능한 이유를 설명하며, ElevenLabs는 대형 음반사와 첫 계약을 체결했다. 이 5개 발표의 공통점은 이미지 품질이 아니라 구조다. license, 초당 가격, 그리고 라이선스를 받은 음악이 기존 모델의 학습에 사용되지 않도록 기존 제품과 별도로 판매되는 플랫폼이 그것이다. 이는 시연의 언어가 아니라 자리를 잡아가는 산업의 언어다.


출처