ai-powered-markdown-translatorgpt-5.6-sol을 사용하여 프랑스어에서 한국어로 번역된 기사.
대부분 9월 11일에 발표된 52건의 소식에서 서로 교류하지 않는 여러 기업이 공통된 발상을 내놓았다. Cursor는 코드를 직접 작성하지 않고 수천 개의 하위 에이전트에 작업을 위임하는 조정 에이전트에게 프로젝트 전체를 맡기고, Cognition은 개발자의 컴퓨터에서 두 모델을 한 팀으로 구동하며, Sakana는 각 작업을 해결할 수 있는 가장 가벼운 모델로 전달한다. 같은 날 OpenAI는 생명과학 모델의 연구 프리뷰를 종료하며 공개 요금표를 발표했고, Runway는 기업에 비공개 모델 가중치 라이선스를 제공하기 시작했으며, Anthropic은 플러그인이 실제로 제공하는 가치를 마침내 측정하는 하위 명령어를 공개했다.
Cursor, 조정 에이전트가 이끄는 프로젝트를 위한 Projects 출시
9월 10일 — Cursor가 편집기에서 에이전트에게 작업을 맡기는 방식을 새롭게 설계한 Projects를 출시했다. 이 제품은 지난 2년 동안 자리 잡은 관행에서 벗어난다. 작업마다 새 대화를 열었다가 닫는 대신, 사용자는 수개월 동안 이어지는 대화에서 조정 에이전트와 소통한다. 이 조정 에이전트는 코드 한 줄도 직접 작성하지 않는다. 코드를 작성하는 다른 에이전트들을 지휘하기 때문에 작업이 진행되는 동안에도 언제든 새로운 지시를 받을 수 있다.
세 가지 메커니즘이 이를 가능하게 한다. 첫째는 기본적으로 제공되는 클라우드 실행이다. 각 Project는 자체 컴퓨터에서 실행되므로 노트북을 닫아도 중단되지 않으며, 병렬로 실행할 수 있는 하위 에이전트 수도 더 이상 로컬 하드웨어의 제약을 받지 않는다. 개발자의 컴퓨터에서 테스트를 실행해야 할 때는 로컬 에이전트가 시작된다. 둘째는 공유 컨텍스트다. 각 Project는 모든 컴퓨터에서 동기화되는 파일 모음을 유지하며, 에이전트는 여기에 조사 결과와 산출물, 코드에 관해 파악한 내용을 저장한다. 한 에이전트가 서비스 테스트 방법을 알아내면 이후의 모든 에이전트가 그 절차를 이용할 수 있다. 세 번째 메커니즘은 가장 독특하다. Cursor는 이를 구독(subscriptions)이라고 부른다. 조정 에이전트는 Slack 채널을 감시하거나 일정에 따라 실행되거나 모든 pull request를 추적해 지속적 통합 문제를 해결할 수 있다. 에이전트는 요청을 기다리지 않고 신호가 감지되면 행동한다.
| 측정 대상 집단 | pull request에서 측정된 효과 |
|---|---|
| Projects 신규 사용자 | 병합 건수 30퍼센트 증가 |
| 주로 Projects에서 작업하는 사용자 | 병합 건수 6배 증가 |
| 내부 design system Project | 하루에 pull request 20~100건에 영향을 줄 것으로 예상 |
The coordinator doesn’t write code itself but directs other agents that do. Because it delegates rather than executes, it is never blocked and is always responsive to direction.
🇰🇷 조정 에이전트는 코드를 직접 작성하지 않고, 코드를 작성하는 다른 에이전트들을 지휘합니다. 직접 실행하는 대신 위임하기 때문에 작업에 막히는 일이 없으며 언제나 지시를 받을 수 있습니다. — Cursor Projects 블로그
이 수치는 내부 측정 결과이므로 적절한 주의를 기울여 해석해야 한다. 가장 이해하기 쉬운 사례는 Cursor가 끝나지 않는 작업을 일컫는 ‘가드닝’이다. 한 엔지니어가 design system 전용 Project를 실행하면, 이 Project는 새로운 pull request를 하나씩 검토해 시스템에 포함할 만한 컴포넌트를 추출하고 같은 오류를 두 번 발견할 때마다 lint 규칙을 추가한다. Projects는 베타 버전이며 9월 10일부터 순차적으로 배포되고 있다. 발표에는 가격 조건이나 요금제 제한이 언급되지 않았다.
GPT-Rosalind, 요금표와 함께 연구 프리뷰 종료
9월 11일 — OpenAI Developers는 생명과학 전용 추론 모델 GPT-Rosalind가 연구 프리뷰(research preview)를 종료한다고 발표했다. 생물학 연구, 신약 발견, 중개의학을 위해 2026년 4월 16일 공개된 이 모델은 당시 미국의 자격을 갖춘 Enterprise 고객만 이용할 수 있었다. 이제 전 세계의 자격을 갖춘 조직이 API, Codex 및 ChatGPT Enterprise를 통해 신뢰 기반 접근(trusted access) 방식으로 이용할 수 있으며, 향후 출시되는 같은 계열의 모델도 차례로 이 접근 권한에 포함된다.
9월 8일 자 API 변경 기록에는 X 게시물에서 언급하지 않은 세부 정보가 담겨 있다. 모델 이름은 gpt-rosalind-research이며, 일반 제공 여부는 여전히 OpenAI가 승인한 내부 생명과학 연구에만 허용되는 신뢰 기반 접근 프로그램의 적용을 받는다.
| 요금 또는 접근 항목 | 발표된 내용 |
|---|---|
| 모델 식별자 | gpt-rosalind-research |
| 입력 token | 100만 개당 5달러 |
| 캐시된 입력 token | 100만 개당 0.50달러 |
| 출력 token | 100만 개당 25달러 |
| 과금 시작일 | 2026년 10월 5일 |
| 접근 경로 | API, Codex, ChatGPT Enterprise |
| 접근 조건 | 신뢰 기반 접근 프로그램, 자격을 갖춘 조직 |
과금은 10월 5일에야 시작된다. 연구 프리뷰 기간에는 사용량이 크레딧이나 token을 소모하지 않았다. 도구 측면에서는 Codex의 Life Sciences 플러그인이 유전체학부터 단백질 구조와 중개 연구까지, 생물학적 근거 수집부터 품질 관리 보고서와 대화형 notebook 생성까지 모델의 오케스트레이션 계층을 구성한다. 4월에 GitHub에서 무료로 공개된 이 패키지는 50개가 넘는 공개 다중 오믹스 데이터베이스, 문헌 자료원 및 생물학 도구에 대한 접근을 제공한다. 누구나 범용 모델과 함께 사용할 수 있지만, GPT-Rosalind와 결합할 수 있는 것은 자격을 갖춘 Enterprise 사용자뿐이다.
제시된 성능은 출시 당시와 같다. BixBench에서 공개된 최고 점수를 기록했고, LABBench2의 11개 작업 중 6개에서 GPT-5.4보다 우수했으며 그중 CloningQA에서 격차가 가장 컸다. 또한 Dyno Therapeutics와 함께 설계한 RNA 서열-기능 작업에서는 인간 전문가 57명의 예측 결과 중 95번째 백분위수를 넘어서는 더 우수한 제출 결과를 냈다. 구체적인 핵심은 두 가지다. 전문 모델이 공개 요금과 함께 실험적 지위를 벗어났고, 접근 가능 지역이 확대됐다. 다만 자격 요건이라는 문턱은 그대로이며 셀프서비스 방식으로 개방되지는 않았다.
Runway Model Licensing, 기업에 비공개 모델 가중치 제공
9월 11일 — Runway가 기업을 대상으로 모델 라이선스(Model Licensing) 프로그램을 시작했다. 이 방식은 API를 통한 접근과 다르다. 고객은 최신 Runway 모델의 전체 가중치를 받아 자체 데이터로 미세 조정하고, 자체 인프라에서 호스팅하며, 이를 바탕으로 만든 제품을 상용화한다. 데이터와 생성 결과가 고객 환경을 벗어나지 않으므로 스튜디오, 브랜드 및 정부 기관을 명시적인 대상으로 삼는다.
| 제공 항목 | 내용 |
|---|---|
| 모델 가중치 | 출발점으로 사용할 전체 가중치 |
| Checkpoint | 검증할 여러 모델 버전 |
| 학습 script | 자체 데이터를 추가하고 미세 조정을 실행하는 코드 |
| 제공 방식 | 고객의 코드베이스에 패키징되며 원하는 곳에서 호스팅 |
| 파견 연구원 | 조정, 가중치 및 제공 과정에 대한 실무 지원 |
호스팅은 고객의 cloud나 data center 또는 완전한 자체 시설 중에서 선택할 수 있으며, 정부 기관을 위해 네트워크가 차단된(air-gapped) 환경도 지원한다. 언급된 분야는 여섯 가지다. software platform, 영화 및 studio, 브랜드 및 marketing, World Action Model을 정책의 중추(policy backbone)로 사용하는 로봇공학 및 물리적 AI, 저사양 rendering의 사실적 품질을 향상하는 video game 및 3D, 그리고 정부 기관이다.
경제적인 측면에서 Runway는 두 가지 경로를 구분한다. Runway Dev는 관리할 인프라 없이 사용량에 따라 과금되는 API이고, 연간 라이선스는 예측 가능한 비용과 함께 버전, 동작 및 출력에 대한 완전한 제어권을 제공한다. FAQ에서는 노후화에 대한 우려에도 답한다. 향후 모델은 고객의 독점 데이터에 접근하지 않으며, 연간 갱신이 예정되어 있고, 다음 세대 모델을 위해 크레딧이 제공된다. 자체적으로 다시 구축하려면 수년간의 학습과 수억 달러가 든다고 설명한다. 회사는 이러한 품질의 비공개 가중치 라이선스를 제공하는 세계에서 극소수인 기업 중 하나라고 자처하며, 자사 주장에 따르면 더 약한 모델과 작업 목록을 함께 제공하는 개방형 가중치와 정면으로 차별화한다. 가격은 공개되지 않았으며 상업용 문의 양식을 통해 접근해야 한다. 이번 발표는 Runway Dev MCP 출시 9일 후이자 Team 요금제 출시 일주일 후에 나왔다. 이제 Runway는 개인 창작자부터 비공개 가중치 라이선스까지 전체 범위를 아우른다.
Cognition, Fusion을 Devin Desktop과 Devin CLI에 도입
9월 11일 — Cognition이 Devin Desktop과 Devin CLI에서 Fusion을 사용할 수 있다고 발표했다. 이 아키텍처는 수개월 동안 Devin Cloud에서 실행돼 왔으며, 이제 개발자의 컴퓨터에서도 구동된다. 이번 발표는 자체 개발 코드 모델 SWE-2가 공개된 다음 날 나왔고, SWE-2가 이 구성에서 권장되는 보조 모델이라는 점에서 두 발표는 서로 연결된다.
원리는 간단하다. Fusion을 선택할 때는 모델 하나가 아니라 두 개를 선택한다. 최첨단 모델이 리드(lead)를 맡아 세션을 주도한다. 계획을 관리하고 모호한 부분을 판단하며 제출된 작업을 검토한다. 비용이 더 낮은 모델은 보조(sidekick) 역할을 맡는다. 코드를 탐색하고 변경 사항을 작성하며 테스트를 실행하고 결과를 보고한다. 두 모델은 각자 고유한 영구 컨텍스트를 유지한 채 병렬로 실행된다. 기술적 주장은 비용 절감을 위해 쉽게 떠올릴 수 있는 해법인 모델 라우팅을 겨냥한다. 초기 prompt만으로는 작업의 난도를 측정하기에 부족하고, 도중에 모델을 바꾸면 prompt cache가 깨진다는 것이다. Fusion은 두 모델 사이에 전체 대화를 전달하지 않고 brief, 결과 및 feedback만 교환함으로써 이 문제를 우회한다.
| 작업당 비용, 달러 | Fable 5.1 단독 | Fusion Fable 5.1 및 SWE-2 | Astra 단독 | Fusion Astra 및 SWE-2 |
|---|---|---|---|---|
| DeepSWE 1.1 | 14,63 | 7,88 | 7,88 | 4,69 |
| Terminal-Bench 4 | 17,46 | 13,37 | 10,08 | 6,06 |
| SWE-Atlas QnA | 7,57 | 5,00 | 5,72 | 3,59 |
| Vals Code Migration | 70,97 | 42,00 | 44,36 | 35,51 |
| 확장된 FrontierCode 1.1 | 2,68 | 1,67 | 2,62 | 2,34 |
One of our key findings is that using more expensive models can make the entire system cheaper.
🇰🇷 우리가 발견한 핵심 사실 중 하나는 더 비싼 모델을 사용하면 전체 시스템의 비용이 더 낮아질 수 있다는 것입니다. — Cognition의 로컬 Fusion 블로그
두 모델의 역할 모두에서 이를 입증했다. 리드 모델 측면에서는 명목상 token당 비용이 두 배인 Fable 5로 Opus 4.8을 교체하자, 동일한 보조 모델을 사용하면서도 평균 세션 비용이 9퍼센트 낮아졌고 FrontierCode 점수는 향상됐다. Opus가 보조 모델을 세세하게 관리했던 것과 달리 Fable은 더 일찍 위임하고 더 나은 brief를 작성했다. 보조 모델 측면에서는 100만 token당 비용이 275퍼센트 더 높은 SWE-2로 GPT-5.6 Luna를 교체하자, 점수가 1.4점 상승하면서 전체 작업 비용도 2퍼센트 낮아졌다. Artificial Analysis Coding Agent Index v1.5에서 Fable 5.1과 SWE-2를 조합한 Fusion은 61.7점을 기록했으며, 62.2점에 그친 Fable 5.1 기반 Claude Code보다 비용이 36퍼센트 낮았다. Cognition은 여기서 2026년을 위한 원칙을 도출한다. 모델과 모델-harness 조합을 평가할 때 token당 가격이 아니라 작업당 가격을 기준으로 삼아야 한다는 것이다. harness를 판매하는 업체로서는 유리한 입장이지만, 이 수치는 서로 다른 다섯 가지 benchmark에서 Artificial Analysis 및 Vals AI와 함께 산출됐다. 설치는 단일 명령어로 할 수 있다.
Sakana AI, 멀티 에이전트 오케스트레이터의 두 가지 진화형 Fugu Max와 Fugu Ultra v2 출시
9월 11일 — Sakana AI는 단일 OpenAI 호환 API를 통해 제공되는 멀티 에이전트 오케스트레이션 시스템인 Sakana Fugu의 새로운 버전 두 가지, Fugu Max와 Fugu Ultra v2를 공개했다. 핵심은 Pareto 경계다. Sakana는 실제 작업을 평가하는 축이 성능과 비용 두 가지인데도, 업계가 여전히 성능만을 유일한 축으로 여기는 것처럼 사고한다고 본다.
Fugu는 단일 모델이 아니라 각 작업을 오픈 웨이트 및 전문 모델 풀로 라우팅하는 학습된 오케스트레이션 계층이다. Fugu Max는 NVIDIA Nemotron 제품군을 통합해 회사 역사상 가장 큰 규모로 이 풀을 확장하고, 각 작업을 해결할 수 있는 가장 가벼운 모델로 전송한다. 6개 벤치마크에서 전체 최고 점수를 기록하고 10개 중 7개에서 비용 대비 성능의 경계를 확장했다. 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러이며, Sakana에 따르면 출력 가격은 Sonnet 5, GPT 5.6 Terra, Kimi K3보다 40~60퍼센트 낮다.
| 발표된 측정 항목 | 점수 | Sakana가 제시한 비교 |
|---|---|---|
| Fugu Ultra v2, Chartography | 48,3 | Opus 5는 27,3, Fable 5는 29,5 |
| Fugu Ultra v2, DeepSWE | 74,3 | 토큰당 비용이 3~5배 더 비싼 모델보다 앞섬 |
| Fugu Ultra v2, 순위 | 8개 벤치마크 중 5개에서 1위 또는 공동 1위 | 8개 중 7개에서 상위 2위 이내 |
| Fugu Max, 종합 순위 | 6개 벤치마크에서 최고 점수 | 10개 중 7개에서 Pareto 경계 확장 |
Sakana가 가장 강조하는 점은 주목할 만하다. 학습 데이터 기준일이 2026년 8월 28일인 Fugu Ultra v2의 에이전트 풀에는 Fable 5, Fable 5.1, GPT-6-Astra가 포함되어 있지 않다. 그 근거는 공급 복원력이다. 교체 가능한 풀을 통해 공급업체 종속, API 권한 철회, 서비스 중단으로부터 보호한다는 것이다. 두 모델은 즉시 이용할 수 있으며, Fugu 사용자는 매개변수 하나만 변경하면 Max 또는 Ultra v2로 전환할 수 있다. Fugu Max는 OpenRouter에도 등록되어 있으며 멀티모달 입력, 웹 검색, 설정 가능한 추론, 구조화된 출력을 지원한다. 다만 벤치마크와 비교 대상은 Sakana가 선정했고, SWEFish는 내부 테스트 벤치이며, 주장된 격차는 공개 당시 비교 모델의 요금에 따라 달라진다는 점에 유의해야 한다.
ElevenLabs, 모든 요금제에서 무손실 다운로드를 제공하는 Music v2.5 출시
9월 11일 — ElevenLabs는 Music v2.5를 공개하고 프롬프트 생성과 오디오 참조 생성 모두에서 ElevenMusic의 기본 모델로 설정했다. 이 모델은 라이브 녹음처럼 들리는 악기, 한층 깊이 있는 편곡, 긴 구성, 곡 중간의 장르 전환, 랩, 그리고 가사 언어의 원어민처럼 들리는 보컬을 내세운다. 제시된 측정 결과는 동일한 프롬프트에 대해 모델별로 한 번씩 생성한 47 885쌍을 대상으로 한 블라인드 테스트다. Music v2.5가 대부분의 경우 더 선호됐으며, 보컬과 어쿠스틱 사운드가 중심인 R&B, 소울, 힙합, 록, 메탈, 오케스트라, 영화 음악 장르에서 격차가 가장 컸다. 정확한 선호 비율은 공개되지 않았다.
두 번째 변화는 사용자에게 더 큰 영향을 미친다. ElevenMusic에서 만든 모든 곡은 무료 요금제를 포함해 어떤 요금제에서든 제작자에게 소유권이 있다. 무료 요금제에서는 ElevenMusic을 명시하는 조건으로 상업적 이용이 가능한 무손실 다운로드를 하루 5회 제공하며, Pro 요금제에서는 월 400회를 제공한다. 제작 시점에 획득한 권한은 해당 곡에 계속 귀속된다. 구독을 해지하거나 하위 요금제로 변경해도 이미 제작한 곡에는 아무런 변화가 없으며, 향후 약관이 변경되더라도 새로 제작하는 곡에만 적용된다. 유일한 예외는 다른 아티스트의 곡을 기반으로 만든 곡으로, 이 경우 다운로드가 차단된다.
| 측정 또는 발표 항목 | 값 |
|---|---|
| 블라인드 테스트에서 평가한 쌍 | 47 885 |
| 무손실 다운로드, Free 요금제 | 하루 5회, 출처 명시 시 상업적 이용 가능 |
| 무손실 다운로드, Pro 요금제 | 월 400회 |
| API 식별자 | music_v2_5 |
| ElevenMusic의 기본 모델 | Music v2.5, Music v2도 유지 |
이 모델은 ElevenCreative에서 Flows의 Music 노드로도 사용할 수 있으며, API에서는 music_v2_5 식별자로 제공된다. ElevenLabs는 전날 발표한 Universal Music Group과의 다년 계약이 이번 출시와는 별개라고 설명했다. 독자 입장에서는 발표 순서가 중요하다. 주요 음반사와의 계약이 먼저 발표됐고, 모델과 확대된 이용 권한은 그다음 날 공개됐다.
Claude Code, 플러그인이 있을 때와 없을 때 실제 효과 측정
9월 11일 — Claude Developers 팀은 플러그인이나 skill을 테스트 사례 모음에 실행해 각 실행을 채점한 뒤, 플러그인 없이 각 사례를 다시 실행하여 플러그인의 기여도를 측정하는 Claude Code의 하위 명령 claude plugin eval을 발표했다. 발상은 단순하지만 다소 불편한 진실을 담고 있다. Claude가 플러그인 없이도 때로는 똑같이 잘 해내므로, 높은 점수가 플러그인의 도움이 된다는 사실을 입증하지는 못한다. 따라서 이 명령은 두 점수와 그 차이를 반환한다. 어떤 사례가 양쪽에서 모두 1,0을 받는다면 플러그인의 기여는 없다.
진입점은 플러그인 루트에서 실행하는 claude plugin eval init이다. 대화형 세션이 열리면 Claude가 플러그인을 읽고 좋은 결과의 기준을 질문하며, 플러그인을 작동시켜야 하는 프롬프트와 작동시키지 말아야 하는 프롬프트를 제안하고, 검증기(graders)를 설계해 한 차례 시험한 뒤 사례별 디렉터리를 작성하고 전체 실행의 예상 비용을 안내한다. 이후 비결정론적 에이전트의 단 한 번 실행만으로는 별다른 의미가 없기 때문에, 각 사례는 플러그인을 사용해 3번, 사용하지 않고 3번씩 총 6번 실행된다. 터미널에는 플러그인 사용 여부에 따른 표가 표시되고, 독립 실행형 HTML 보고서가 디스크에 기록되며, 계정에서 허용하는 경우 보고서가 비공개 아티팩트로 게시된다.
| 검증기 유형 | 모델 호출 비용 | 성공 조건 |
|---|---|---|
regex | 없음 | 마지막 응답, 추적 기록 또는 파일에서 패턴 발견 |
tool_used | 없음 | 도구 호출 횟수가 최솟값과 최댓값 사이임 |
tool_order | 없음 | 한 호출이 다른 호출보다 먼저 발생함 |
file_exists | 없음 | 실행 중 생성된 파일이 패턴과 일치함 |
llm | 모델 하나가 판정 | 3표 중 최소 2표가 긍정적 판정을 내림 |
baseline | 모델 하나가 판정 | 실행 결과가 최소한 참조 기록과 동등함 |
차이를 해석하기 전에 알아야 할 미묘한 점이 있다. skill 호출을 요구하는 검증기는 플러그인 없이는 절대 통과할 수 있으므로, 차이가 인위적으로 부풀려지지 않도록 양쪽 점수에서 제외하고 지표로만 보고한다. 격리는 엄격하다. 각 실행은 일회용 자식 프로세스이며 사용자 설정, hook, CLAUDE.md, MCP 서버, 설치된 플러그인, 메모리가 모두 없는 상태에서 진행된다. 실행 중에는 권한을 묻지 않으며, 명시적으로 허용하지 않는 한 민감한 도구는 세션에서 제거된다. 샌드박스 백엔드가 없는 시스템에서 Bash나 PowerShell 사용을 허용하면 Claude Code는 격리 없이 실행하는 대신 실행 자체를 거부한다. MCP 도구와 통신하는 플러그인은 실제 서비스 없이도 평가할 수 있다. 도구별 Markdown 파일이 응답을 제공하며, 플러그인이 예상과 다른 내용을 전송하면 실행을 중단하는 블록도 포함된다.
Evals call the model, so they use tokens and results vary. […] Your plugin’s hooks and MCP servers run as you, so only evaluate plugins you trust.
🇰🇷 평가는 모델을 호출하므로 토큰을 소비하며 결과도 달라집니다. […] 플러그인의 hook과 MCP 서버는 사용자의 권한으로 실행되므로 신뢰할 수 있는 플러그인만 평가하세요. — @ClaudeDevs의 X 게시물
비용은 실제로 발생한다. 각 실행과 판정 검증기마다 모델 호출이 이루어져 요금제 사용량이나 청구 금액에 반영되며, 문서의 예시에서는 6회 실행으로 구성된 사례 하나에 74초와 0,41달러가 소요된다. 따라서 팀은 전체 실행에 앞서 --runs 1으로 먼저 시험하라고 권고한다. 지속적 통합에서는 종료 코드도 문서화되어 있다. 모든 항목이 통과하면 0이며, 비용 상한에 도달해 일부만 실행된 경우에는 2다. 문서에 따르면 일반적으로 처음 발견되는 문제는 skill 검증기가 실패하면서 차이가 0에 가까운 경우다. Claude가 자연스러운 표현에서 해당 skill을 선택하지 못한다는 뜻이므로, 이때는 skill 설명을 다듬어야 한다.
버전 2.1.269의 나머지 변경 사항
이 하위 명령은 파리 시간으로 9월 11일 21시 17분에 공개된 버전 2.1.269에 추가됐다. 나머지 추가 사항은 눈에 덜 띄지만 일상적인 사용에 유용하다. /output-style 명령은 Remote Control과 클라우드 또는 headless 세션을 포함해 출력 스타일을 나열하고 변경한다. Bash 도구로 파일을 수정할 때 이제 결과에 변경된 파일의 diff가 포함되어, Claude가 일반적인 편집 방식과 동일한 가시성을 확보한다. 관측성 측면에서는 환경 변수 하나가 저장소별로 OpenTelemetry 측정항목과 이벤트에 레이블을 지정하며, 다른 두 변수는 게이트웨이의 모델 검색 제한 시간과 Workflow 도구의 동시 에이전트 한도를 최대 256까지 설정한다.
수정 사항은 민감한 세 영역을 다룬다. 응답이 중단됐다가 재개된 후의 프롬프트 캐시 부분 무효화, 부정으로 시작하는 권한 규칙이 이제 해당 규칙을 작성한 설정 소스에만 적용되도록 한 변경, 그리고 tee 명령이 작성하는 파일까지 마침내 포함하는 쓰기 경로 검증이다. compaction 이후 전달되는 git status은 이제 세션 시작 시점의 값이 아니라 현재 값이다. VS Code에서는 배지를 누르면 카드, 중지 버튼, 읽기 전용 기록이 포함된 하위 에이전트 지도가 열리며, 두 개의 대화상자에서 사용자, 프로젝트, 로컬 설정의 hook과 권한 규칙을 관리할 수 있다.
Antigravity, 일주일 동안 네 차례 출시와 Teamwork 관련 누락분 보완
Google은 이전에 여기서 다루지 않은 두 버전과 별개로 명령줄 도구 버전 두 개와 애플리케이션의 새 버전을 잇달아 공개했다. 이번 주 출시 내용이 모두 같은 이야기를 들려주므로 changelog를 한꺼번에 읽어볼 만하다. 에이전트가 대화형 터미널을 벗어나 서비스로 변하고 있다.
Antigravity CLI 1.2.0: CLI가 Remote Control로 제어되는 백그라운드 데몬으로 전환
9월 10일 — Antigravity CLI 버전 1.2.0은 7월 이후 처음으로 부 버전 번호가 올라간 출시다. 세 하위 명령 remote-control start, status, stop은 명령줄 도구를 연결 해제와 재부팅 후에도 유지되는 백그라운드 데몬으로 시스템 서비스 관리자에 등록한다. 인스턴스 이름을 지정하는 옵션과 서비스를 활성 로그인 세션으로 제한하는 옵션도 제공된다. 이전에는 터미널을 계속 열어 둬야 했다. 두 개의 새로운 기본 단축키를 이용한 반 페이지 스크롤도 모든 화면으로 확대됐다. 8가지 수정 사항 중 예상치 못한 동작을 이해하는 데 가장 유용한 변화는 콘텐츠 안전 필터에 의해 프롬프트나 응답이 차단될 경우 이제 명확한 중단 사유가 표시된다는 점이다. 이전에는 사용자에게 일반적인 오류나 빈 응답만 표시됐다. 전역 플러그인에 내장된 MCP 서버도 이제 시작 시 올바르게 초기화된다.
Antigravity CLI 1.1.28: 오류 재시도 확대, headless 모드 가속, 승인 기반 URL 읽기
9월 9일 — 전날 공개된 버전 1.1.28은 스크립트에서 호출하는 headless 모드와 복원력에 관한 9가지 개선 사항에 집중했다. 일시적인 모델 API 오류에는 확장된 지수 backoff를 적용해 재시도하며, 시작 시 사용자 신원을 확인하기 위한 네트워크 요청이 더 이상 발생하지 않고, 각 차례마다 최대 200밀리초의 유휴 지연이 제거됐다. 자동화하는 사용자가 주목해야 할 동작 변경 사항은 두 가지다.
| 동작 변경 사항 | 버전 1.1.28 이전 | 버전 1.1.28 이후 |
|---|---|---|
| 스크립트 모드의 제한 시간 만료 | timeout 실패 | 부분 출력 반환, 성공 코드, 경고 |
| 에이전트의 외부 URL 읽기 | 확인 없이 실행 | 사전 허용된 접근이 아니면 기본적으로 승인 요청 |
따라서 암묵적인 웹 접근에 의존하던 스크립트는 이 권한을 명시적으로 부여해야 한다. 승인 요청에는 이제 구체적인 작업 이름이 표시되며, hook이나 다른 프로젝트에 속한 파일에서 요청이 발생한 경우 그 이유를 설명하는 줄도 추가된다.
Antigravity CLI 1.1.26 및 1.1.27 누락분 보완: 다른 모델에 일회성 프롬프트 전송 및 frontmatter의 하위 에이전트 종속성
9월 4일과 5일 — 버전 1.1.26과 1.1.27은 누락된 내용을 보완하며, 이번 묶음에서 가장 구체적인 신기능을 제공한다. 이제 모델 선택 명령에 프롬프트를 전달할 수 있으며, 이 프롬프트는 다른 모델에서 단 한 번 실행된 뒤 세션이 원래 모델로 돌아온다. 기본 설정을 건드리지 않고도 더 강력하거나 더 경제적인 모델로부터 두 번째 의견을 얻을 수 있다. 같은 버전에서는 사용자 지정 에이전트의 Markdown frontmatter에 에이전트 목록을 추가해 이들이 의존하는 하위 에이전트를 선언할 수 있다. 자동화에 중요한 수정 사항도 두 가지 있다. 서버 스키마에 선언되지 않은 인수를 포함한 MCP 호출은 조용히 삭제되는 대신 거부되고 수정되며, headless 실행은 거부된 작업을 아무 말 없이 무시하는 대신 JSON 출력에 그 이름을 표시한다.
Antigravity 2.13.0: Documents 섹션, SQL 및 JSONL용 가상화 뷰어와 인용 단축키
9월 9일 — Antigravity 2.13.0에는 16가지 개선 사항과 16가지 수정 사항이 포함됐다. 대화에 추가된 외부 파일, Google Drive 링크, PDF 및 Office 문서는 에이전트의 결과물과 뒤섞이지 않고 Artifacts 위의 Documents 섹션에 모인다. 에이전트가 자체적으로 작성하는 초안 파일은 별도 섹션으로 이동한다. SQL 및 JSONL 파일 같은 코드와 데이터 아티팩트는 구문 강조와 줄 번호를 지원하는 가상화 뷰어에서 열리며, 대용량 파일에서도 원활하게 작동하고 인라인 댓글을 지원한다. 닫힌 측면 질문은 삭제되지 않고 버튼으로 축소되며, 대화형 프롬프트에는 취소 버튼이 추가되고, 선택한 텍스트는 키보드 단축키로 채팅에 인용할 수 있다. 두 가지 수정 사항은 권한의 투명성과 관련된다. 거부된 단계는 사라지지 않고 Rejected 레이블과 함께 계속 표시되며, 프로젝트 외부 접근 권한이 이미 부여된 경우 에이전트가 다른 프로젝트의 아티팩트를 읽기 위한 권한을 다시 요청하지 않는다.
Teamwork, 8월 27일 소식 따라잡기
8월 27일에 게시됐지만 이곳에서 다루지 않았고 여전히 Gemini 새 소식 페이지의 개발자 섹션 맨 위에 있는 게시물을 뒤늦게 살펴볼 가치가 있다. Teamwork는 Antigravity의 멀티 에이전트 오케스트레이션 프레임워크로, 에이전트들이 몇 시간 또는 며칠 동안 서로의 작업을 제안하고 비판하며 다듬는다. 모든 유료 요금제에서 프리뷰로 이용할 수 있다. 반복적 코딩부터 문서 검토와 장기 증명까지 다섯 가지 패턴이 제공되며, 프롬프트에 따라 자동으로 선택된다. 장기 증명 패턴을 통해 Google은 Knuth의 사이클 추측을 포함해 7개의 미해결 문제를 풀었다고 발표했다. 이 추측에는 40페이지가 넘는 증명과 70페이지가 넘는 증명이 작성됐으며, 40페이지 분량의 증명은 Lean에서 형식적으로 검증됐다. 다른 결과는 인간 전문가들이 확인했고, 논문 5편이 arXiv에 등록됐다.
| 보고된 측정 항목 | 값 |
|---|---|
| TCSBench, 장기 증명의 Gemini 3.7 Flash 및 3.1 Pro | 71퍼센트 |
| TCSBench, 원 논문의 Gemini 3.6 Flash 및 3.1 Pro | 67.7퍼센트 |
| RISC-V 시뮬레이터, 사이클 정렬 오차 | 0.71퍼센트 |
| Gemini 3.7 Flash로 재현한 문제 | 7개 중 3개 |
수학 분야 외에도 Teamwork는 비순차 실행 방식의 사이클 정확도 RISC-V 프로세서 시뮬레이터를 처음부터 구축했다. 이 시뮬레이터는 xv6 시스템을 셸까지 부팅하고 100개가 넘는 표준 벤치마크를 실행하며, 하드웨어 실행 결과와 대조해 검증됐다. 두 건의 기여가 오픈 소스 프로젝트의 업스트림에 통합됐다. 하나는 Eigen의 벡터화된 빠른 경로이고, 다른 하나는 64개 스레드에서 삽입 처리량이 두 배로 증가한 동시성 해시 테이블 변형이다.
GitHub Copilot이 자체 댓글을 해결하고 애플리케이션에 Jira를 추가하다
코드 검토가 에이전트 집합으로 전환되다
9월 11일 — GitHub는 Copilot code review를 두 측면에서 업데이트했다. 사용자 경험 측면에서는 후속 커밋이 Copilot의 댓글에 대응하면 검토 과정에서 해당 댓글이 자동으로 해결되어, 열린 댓글 목록에는 응답을 기다리는 항목만 남는다. 또한 코드 제안을 적용하면 Copilot이 미리 채워진 메시지 대신 변경 사항에 맞는 커밋 메시지를 작성한다. 분석 측면에서는 검토 에이전트가 이제 에이전트 방화벽 뒤에서 실행되는 Copilot SDK의 모든 셸 도구를 사용할 수 있다. 빌드를 실행하고 테스트를 수행하며 특정 스크립트를 가동하거나 접근 가능한 API를 조회해 검토 중인 코드를 확인할 수 있다. GitHub는 긍정적인 피드백이 늘고 심각도가 높은 지적 사항이 증가했으며 사소한 지적은 감소했다고 밝혔지만, 이에 관한 수치는 제시하지 않았다.
Lite 노력 수준 역시 이제 단일 에이전트가 아니라 각자 관점을 제시한 뒤 이를 하나의 검토로 통합하는 에이전트 집합을 기반으로 한다.
| 측정 결과, 에이전트 집합을 사용한 Lite 검토 | 발표된 변화 |
|---|---|
| 반영된 댓글, 높은 심각도 | 47퍼센트 증가 |
| 반영된 댓글, 중간 심각도 | 31퍼센트 증가 |
| 반영된 댓글, 낮은 심각도 | 11퍼센트 증가 |
| 검토 비용 | 약 8퍼센트 감소 |
에이전트 집합의 에이전트 수와 사용된 모델은 모두 공개되지 않았다. 이는 2주 동안 이루어진 Copilot code review의 세 번째 변화다.
애플리케이션의 Jira, 명령줄의 HydraFusion, VS Code 1.137
9월 10일 — Copilot Day가 있었던 9월 7일 주간 요약에서는 Copilot 애플리케이션의 Jira 통합을 선보였다. 티켓을 공유 캔버스로 가져와 진행할 항목을 선택할 수 있으며, Copilot은 티켓의 맥락을 조사, 구현 및 pull request 준비 과정에 활용한다. Copilot CLI에서는 이제 Project HydraFusion을 다른 모델처럼 선택할 수 있으며, 작업별로 로컬 모델, cloud 모델 및 복합 모델 사이의 흐름을 선택하면서 성능, 비용 및 지연 시간을 조율한다.
9월 9일에 출시된 VS Code 1.137에는 세 가지 에이전트 기능이 추가됐다. 공개 프리뷰로 제공되는 자동화 기능은 issue 분류나 버그 탐색처럼 제공된 템플릿을 바탕으로 반복되는 에이전트 작업을 매시간, 매일 또는 매주 예약한다. 실험적 기능인 음성 모드에서는 에이전트가 작업하는 동안 대화하고, 작업을 중단시키거나 방향을 바꿀 수 있다. 마지막으로 issue나 pull request 링크는 저장소가 열려 있지 않아도 Agents 창에서 바로 열린다. 릴리스 노트에는 전용 프로토콜을 기반으로 하고 Copilot SDK로 구동되는 에이전트 호스트도 추가됐다. 이를 통해 VS Code 에이전트의 동작이 명령줄 및 애플리케이션의 동작과 일치한다.
Habitat, OpenAI의 온라인 스토리지와 두 엔지니어의 Rust 재작성
9월 11일 — OpenAI는 ChatGPT, API 및 Codex를 뒷받침하는 온라인 스토리지 플랫폼 Habitat에 관한 엔지니어링 게시물의 첫 번째 부분을 공개했다. 수치를 보면 그 규모를 알 수 있다. 초당 7천만 건이 넘는 요청, 매주 10억 명이 넘는 사용자, 약 40개 리전, 500페타바이트가 넘는 데이터다. Habitat는 2024년 중반 ChatGPT의 주 서버에 통합되고 관리형 데이터베이스에 연결된 소규모 Python 라이브러리로 시작했다. 핵심 발상은 단순했다. 제품 엔지니어가 스키마, 라우팅, 권한 부여 또는 연결 풀을 신경 쓰지 않아도 돼야 한다는 것이었다.
2025년 중반, 클라이언트 측 라이브러리 모델은 한계에 도달했다. 프로토콜을 변경할 때마다 수십 개 서비스의 배포를 조율해야 했다. 리전 라우팅 배포에는 며칠이 걸렸고, 이후 버그가 있는 클라이언트로 되돌아간 서비스 하나가 이 작업으로 방지하려던 장애를 일으켰다. Habitat는 독립형 서비스가 됐고, OpenAI는 의도적으로 기술 부채를 감수하면서 Python을 유지하기로 했다. 자사의 코드 모델이 미래의 마이그레이션을 실현 가능하게 만들 것이라는 판단이었다.
게시물의 핵심은 이 규모에서 꼬리 지연 시간을 추적한 과정이다. 수백 밀리초에 달할 수 있었던 asyncio 스케줄링 지연은 프로세스당 동시 요청 수를 제한해 처리했다. 임의 지연 없이 매분 갱신된 구성을 파싱하면서 모든 worker가 동시에 멈추는 문제도 있었다. 또한 HTTP 라이브러리가 연결을 후입선출 방식으로 재사용하면서 이미 느린 프로세스에 트래픽이 집중되는 준안정성 장애가 발생했다. 이는 순서를 뒤집은 뒤 부하 분산을 서비스 메시로 넘기는 방식으로 해결했다. API 자체는 의도적으로 제한적이다. 경계 없는 쿼리나 조인이 없는 객체 및 간선 모델이며, 이러한 제한된 범위 덕분에 Python을 이 정도까지 확장할 수 있었다.
| 측정 지표 | 발표된 값 |
|---|---|
| 현재 초당 요청 수 | 7천만 건 이상 |
| 매주 서비스를 이용하는 사람 수 | 10억 명 이상 |
| 제공되는 데이터 | 500페타바이트 이상 |
| Python 서비스 최고치 | 초당 요청 2천만 건 이상 |
| Rust 재작성 | 엔지니어 2명, Codex 및 GPT-5.5 |
| Rust가 처리하는 트래픽 비중 | 프로덕션 요청의 95퍼센트 |
| 프로세서 및 메모리 효율 향상 | 각각 6배 및 15배 |
2026년 2분기에 엔지니어 두 명이 Codex 및 GPT-5.5를 사용해 전체 서비스를 Rust로 다시 작성했다. Rust 서비스는 프로덕션 요청의 95퍼센트를 처리하며, 프로세서 사용량은 6분의 1, 메모리 사용량은 15분의 1로 줄었다. Python은 앞으로 몇 주 안에 제거될 예정이다. 두 번째 부분에서는 스토리지 계층을 다룬다.
OpenAI가 Codex 사용자에게 skills, AGENTS.md 및 prompts를 간소화하라고 요청하다
9월 11일 — OpenAI 개발자 블로그는 GPT-6 Astra로 전환하는 Codex 사용자를 위한 정리 가이드를 공개했다. 출발점은 이전 모델을 안내하기 위해 1년 동안 쌓인 지침이 더 유능한 모델에는 부담이 된다는 것이다. skills에 관해서는 작동 원리가 구체적이다. 각 skill은 이름과 설명을 컨텍스트에 불러오며, 그 수가 지나치게 많으면 Codex가 설명을 축약한다. 그 결과 모델은 각 skill에 관한 정보를 덜 보게 되고 적절한 skill을 선택하는 능력도 떨어진다.
| 검토한 지침 | GPT-6 Astra 권장 사항 |
|---|---|
| skill 설명 | 짧고 정확한 트리거를 사용하며, 전체 영역을 포괄하지 않을 것 |
| 여러 흐름을 가진 skill의 구조 | 루트 문서를 docs 및 scripts로 연결하는 라우터로 축소 |
| AGENTS.md에서 요구하는 읽기 자료 | 변경 유형별 문서 하나만 지정하고, 수정할 때마다 문서 더미를 읽게 하지 않을 것 |
| 테스트 지침 | 불필요함, 모델이 스스로 테스트를 실행함 |
| 작업 종료 | 완료의 의미를 정의하고 안전한 workflows를 미리 허용할 것 |
| 기존 금지 사항 | 완화하지 않으면 조기에 중단될 수 있음 |
가장 흥미로운 부분은 모델의 동작과 관련된다. OpenAI는 GPT-6 Astra가 작업 범위에 관해 이전 모델보다 더 신중하며, 첫 구현 후 검토를 위해 돌아올 수 있다고 설명한다. 권장하는 대응 방법은 완료의 의미를 명시적으로 정의하고, 폐기 가능한 fixtures를 사용하는 로컬 테스트 모음처럼 안전하다고 알려진 workflows를 미리 허용하는 것이다. 반대로 이전 모델을 제한하려고 작성한 지나치게 엄격한 안전장치는 이제 Astra를 너무 일찍 멈추게 할 수 있다. 게시물은 저장소의 skills를 다른 기여자의 에이전트도 읽으며, 이들이 때로는 다른 모델에서 실행된다는 점도 상기시킨다. 이들에게 유용한 지침이 Astra를 지나치게 제약할 수 있다는 뜻이다. 게시물은 Astra에게 프로젝트 지침을 직접 감사하도록 요청하라는 실용적인 제안으로 마무리된다. skill 생성용 skill도 이에 맞춰 업데이트됐다.
🔗 GPT-6 Astra를 위한 skills 및 prompts 재고
ChatGPT Sites, 3개월 만에 사이트 500만 개 돌파
9월 11일 — ChatGPT 공식 계정은 대화에서 완전한 웹 애플리케이션을 구축하고 호스팅하기 위해 3개월 전에 출시한 기능인 ChatGPT Sites의 성과를 정리했다. 지금까지 500만 개가 넘는 사이트가 만들어졌다. 이 게시물은 주로 눈에 띄지 않았던 다섯 가지 변화를 요약한다.
그중 두 가지는 협업과 관련된다. 첫 번째는 팀원을 초대해 공유 사이트를 편집하고 저장하며 게시할 수 있게 한다. 두 번째는 사이트를 공개하지 않고 특정 사용자에게만 열어 줄 수 있게 한다. 나머지 세 가지는 사이트 수명 주기와 관련된다. 프롬프트에서 배포까지 걸리는 시간이 절반으로 줄었으며, ChatGPT가 요청에 따라 사이트 데이터베이스를 검사할 수 있고 편집자도 데이터베이스에 접근할 수 있다. 또한 사용자 지정 도메인을 사이트에 연결할 수 있다. 개발자 계정도 이 발표를 공유했는데, 이는 이 기능이 일반 대중을 위한 페이지뿐 아니라 빠른 프로토타입 제작도 겨냥하고 있음을 보여준다.
Together AI가 fine-tuning을 17개 오픈 모델로 확대하고 전문가 계층에 어댑터를 적용하다
9월 11일 — Together AI는 실험의 전 과정에 걸쳐 fine-tuning 서비스를 확장했다. GLM 5.3과 이전 두 버전, DeepSeek-V4-Flash, Kimi K2.7-Code 및 K2.6, 8억 개에서 350억 개 매개변수에 이르는 Qwen 제품군, Gemma 4를 포함한 17개 오픈 가중치 모델이 카탈로그에 추가됐다. 회사는 GLM-5.3이 Terminal-Bench 2.1에서 88.2점을 기록해 자사 설명에 따르면 최고의 독점 모델과 1점 미만의 차이를 보인다고 밝혔다.
실험 추적이 두 번째 새 기능이다. 각 job은 매 단계의 손실, gradient norm 및 learning rate를 기록한다. 그래프는 실행 중 업데이트되며, 여러 job을 같은 그래프에 겹쳐 표시할 수 있고, 원시 시계열 데이터는 API를 통해 제공된다. 조기 종료는 검증 손실이 정체되면 학습을 중단하고 마지막 checkpoint 대신 최적의 checkpoint를 보존하며, 사용하지 않은 단계의 비용을 환불한다.
가장 기술적인 부분은 Expert LoRA다. 전문가 혼합 모델(Mixture-of-Experts)에서는 매개변수의 90퍼센트 이상이 전문가 계층에 존재하지만, 기존 어댑터는 attention에만 연결되기 때문에 이 계층을 동결된 상태로 둔다.
| 가상 사실 200개를 사용한 테스트 | 전문가를 포함한 어댑터 | attention 전용 어댑터 |
|---|---|---|
| 새로운 사실 회상 | 최대 89퍼센트 | 15퍼센트 |
| MMLU-Pro | 75.3퍼센트 | 71.5퍼센트 |
제시된 설명에 따르면 어댑터가 attention에만 한정될 경우, fine-tuning 과정에서 라우팅되는 전문가 중 점점 더 많은 수가 사용되지 않게 된다. 데이터 처리 과정도 블랙박스에서 벗어나 tokenization된 행과 예시별 가중치를 미리 볼 수 있으며, 업로드가 끝나는 즉시 서버 측에서 파일 전체를 검증한다. 학습 가격은 모델에 따라 30~70퍼센트 인하된다.
커뮤니티 기여, 시도마다 하나의 sandbox와 100개의 얼룩말 퍼즐
Hugging Face 커뮤니티 블로그는 같은 날 짧게 다루기에는 아까운 세 가지 작업과 아래에서 소개할 다섯 가지 작업을 공개했다.
13개 연구소는 에이전트의 RL을 어떻게 운영하는가
9월 11일 — Sergio Paniego는 2025년 10월부터 2026년 9월까지 13개 연구소가 발표한 15개 보고서를 검토하면서, 각 연구소가 평가한다고 밝힌 대상이 아니라 훈련한다고 밝힌 대상만을 추렸다. 핵심 결론은 환경이 더 이상 메모리 내 시뮬레이터가 아니라 파일 시스템, shell, 프로세스를 갖춘 완전한 머신이며, 한 번의 시도를 위해 시작되었다가 이후 폐기된다는 것이다. Liquid AI는 26억 개 매개변수 모델에 이를 적용하고, Cursor는 자사 모델을 훈련하기 위해 수십만 개의 동시 실행 환경을 사용한다고 밝히며, Microsoft는 작업마다 새 컨테이너를 프로비저닝한다. Kimi K3는 한층 더 나아가 100만 token 규모의 궤적을 위해 재개 가능한 마이크로 가상 머신을 사용한다.
| 스택 계층 | 연구소가 유지하는 것 | 언급된 공개 대안 |
|---|---|---|
| 작업과 검증기 | GLM-5의 10,000개 이상 코드 환경 | Environments Hub, verifiers, Harbor |
| 동작 계약, harness | Kimi가 5개의 white-box harness를 인스턴스화 | OpenEnv, SkyRL, BrowserGym, TextArena |
| sandbox | cluster당 수십만 개의 가상 머신 | Modal, E2B, AgentENV, Hugging Face Sandboxes |
| 훈련기 | Zhipu의 slime, MiniMax의 Forge, NVIDIA의 RLVR | TRL, Miles v0.1 |
주목할 만한 추세는 harness 자체가 환경이 된다는 점이다. white-box 방식으로 재구축되거나, 그대로 둔 채 black-box 방식으로 관찰된다. 투명성에는 큰 격차가 있다. Ai2는 OLMo 3를 위해 검증된 코드 샘플 1,720만 개를 문서화했지만, OpenAI, Anthropic, Google은 거의 아무것도 공개하지 않으며 GPT-6 Astra의 시스템 카드는 한 문장에 그친다. 저자는 대형 연구소에서 단일 환경에 드는 비용이 1,000만 달러를 넘는다고 언급한다. 이 글로 Training Agents 연재가 마무리된다.
100개의 얼룩말 퍼즐이 수학적 추론을 깨우다
9월 11일 — tamewild가 작성한 커뮤니티 글에 따르면, 수학 데이터 없이 100~500개의 논리 추론 퍼즐로 몇 분간 fine-tuning하는 것만으로도 소형 base model의 수학 benchmark 성능을 크게 끌어올릴 수 있다.
| 훈련된 base model | MATH-500 | AIME 2025 | 비교한 공식 기준 모델 |
|---|---|---|---|
| Qwen 3 4B, 퍼즐 100개로 6분 23초 | 84.60퍼센트 | 21.67퍼센트 | post-trained 버전: 84.80 및 19.10 |
| Granite 4.1 3B, 퍼즐 500개로 23분 | 77.73퍼센트 | 19.44퍼센트 | Instruct 버전: 66.60 및 6.67 |
| Qwen 3.5 9B, 퍼즐 500개로 40분 | 96.60퍼센트 | 60.67퍼센트 | post-trained 버전: 97.40 및 60.56 |
구조적 효과도 측정되었다. 세 모델 중 가장 큰 모델에서는 응답 길이의 중앙값이 공식 모델보다 낮아졌고, greedy decoding에서 반복 loop가 발생하는 비율은 6.06퍼센트에서 0.67퍼센트로 줄었다. 저자는 단일 seed로 진행한 탐색적 run이라는 점을 들어 신중한 태도를 유지한다. 또한 자체 ablation 결과, 일반적인 adapter도 MATH-500에서 약 80퍼센트에 도달했다며 일반화의 주된 원천은 논리 데이터라고 지적한다. 코드, notebook, 모델 3개, dataset 2개가 공개되었다.
dataset이 없는 언어를 위한 음성 pipeline
9월 10일 — Osmanov는 음성 인식과 합성이 전혀 없는 소멸 위기 언어 크림 타타르어를 위한 완전한 음성 pipeline을 구축한 과정을 소개하며, 다른 사례에도 적용할 수 있는 결론을 제시한다. 훈련은 반올림 오차에 불과했다는 것이다. 인식 adapter를 노트북 GPU로 훈련하는 데 90분이 걸렸고, 단어 오류율은 34.6퍼센트에서 20.1퍼센트로 낮아졌으며, 어떤 weight도 변경하지 않는 beam search를 적용하자 17.0퍼센트까지 내려갔다. 일정의 거의 전부는 존재하지 않던 corpus를 구축하고 평가 결과가 거짓이 아닌지 검증하는 데 쓰였다.
두 가지 선택은 기억할 만하다. base model은 언어적 근접성이 아니라 음성학적 사전 가정에 따라 선정되었다. 크림 타타르어에는 튀르키예어에 없는 구개수음 /q/가 있는데, 튀르키예어 식별자로 훈련된 base model들은 이를 /k/로 발음했고 fine-tuning으로도 전혀 교정되지 않았다. 또한 corpus 구축을 시작할 음성 인식기가 없었기 때문에 저자는 텍스트가 이미 알려진 오디오북을 이용해 문제를 뒤집었다. 그 결과 시간이 흐를수록 어긋나는 정렬 방식으로는 110분밖에 확보하지 못했던 데 비해, 활용 가능한 데이터 336분을 얻었다. 가장 유용한 부정적 결과는 metric의 정체 현상이다. 합성 corpus를 5.9시간에서 15.3시간으로 늘려도 문자 오류율은 변하지 않았지만, blind listening에서는 매번 가장 최근의 음성을 선호했다. 마지막으로 저자는 전형적인 데이터 유출도 문서화했다. test book clip의 96.9퍼센트가 훈련 데이터에 중복되어 있었으며, 이는 파일명이 아니라 텍스트 n-gram으로 탐지되었다.
Replit, 필요할 때만 에이전트를 호출하는 반복 작업 기능 Routines 출시
9월 11일 — Replit은 매시간, 매일 또는 매주 일정에 따라 반복 작업을 실행하는 기능인 Routines를 공개했다. 흔한 기능인 일정 관리보다 흥미로운 점은 회사가 비용 문제를 다루는 방식이다. 출발점은 직설적이다. 이제 에이전트는 대부분의 반복 작업을 자동화할 수 있지만, 이를 계속 실행하면 막대한 token이 소비된다. 해결책은 에이전트를 loop의 중심에 두지 않는 것이다. 각 실행은 결정론적 코드로 시작하며, 실제로 추론이 필요할 때만 에이전트를 호출한다.
이 아키텍처는 전체 주기를 모델에 맡기는 주류 추세와 반대된다. 여기서 모델은 다시 필요할 때만 호출되는 자원이 되며, 동작과 비용을 예측할 수 있는 일반 코드가 이를 둘러싼다. 수백 번 반복되는 예약 작업에서는 청구 비용의 차이가 결코 미미하지 않다. 이번 발표와 함께 공개된 blog 글은 없다.
Warp, Grok Build를 일급 에이전트로 통합
9월 11일 — Warp는 SpaceX AI의 command-line 에이전트인 Grok Build CLI를 내장 지원한다고 발표했으며, Grok 계정도 곧바로 이 통합 소식을 공유했다. 이 기능은 이미 9월 9일자 terminal 버전에 포함되어 있었고, changelog에는 일급 지원으로 설명되어 있다. Warp는 Grok Build session을 감지하고 footer에 전용 시각적 외관을 적용하며, 해당 session에서 향상된 입력 모드를 활성화한다.
구체적으로 Grok Build 사용자는 terminal의 native 에이전트와 동일한 도구를 이용할 수 있다. 향상된 입력 기능은 붙여 넣은 긴 prompt와 다중 cursor를 지원하므로 여러 문단으로 지시를 작성하는 사용자에게 큰 차이를 만든다. 명령 하나로 진행 중인 에이전트 session을 다른 기기에 공유할 수 있으며, session 중에도 파일 탐색기와 코드 검토 panel을 사용할 수 있다. 기존 Grok 구독으로 이용할 수 있고, 별도의 요금이나 제한은 발표되지 않았다.
이번 추가로 Warp terminal에서 호스팅되는 타사 에이전트 목록은 Claude Code, Codex, Droid, Antigravity에 이어 더욱 풍부해졌다. 또한 8월에 X Premium 또는 SuperGrok 계정에 연결하는 명령을 추가하는 등 여름 초부터 시작된 xAI 생태계 관련 작업도 이어간다. Warp의 방침은 자체 에이전트를 출시한 이후 변함이 없다. 사용자를 자체 에이전트에 가두는 대신, 모든 에이전트가 동일한 통합 품질로 실행되는 장소로 terminal을 만들겠다는 것이다. 이번 버전의 나머지 변경 사항은 두 가지 불편을 해결한다. 입력했지만 전송하지 않은 prompt는 모델을 변경해도 더 이상 삭제되지 않으며, 전역 파일에 선언된 MCP 도구는 에이전트의 첫 번째 응답부터 사용할 수 있다.
🔗 X의 Grok 발표 · 🔗 X의 Warp 발표
Vibe CLI 2.25.3, 분기 명령과 비공개 session log
9월 11일 — Mistral은 사흘 동안 세 번째로 Vibe CLI 2.25.3 버전을 출시했다. 눈에 띄는 신기능은 /branch 명령이다. 현재 대화를 재개 가능한 새 session으로 분기하면서 원래 session은 그대로 유지한다. 복제된 session은 이후 다른 terminal에서 재개할 수 있어, 주 흐름을 희생하지 않고 동일한 context에서 대안 경로를 탐색할 수 있다. 이제 골뱅이를 이용한 파일 언급은 Git을 고려하는 탐색 기능을 사용하며, prompt에 파일이나 폴더만 붙여 넣는 방식도 지원한다.
수정 사항은 세 가지다. 저장된 대화는 계속 읽을 수 있으며 작업을 재개하면 해당 worktree가 복원된다. 새로운 session log는 POSIX 시스템의 다른 사용자가 더 이상 읽을 수 없다. 이는 파일 권한을 수정한 것으로, 인증되지 않은 debugging listener를 제거하고 어떤 실패도 자동 승인으로 이어지지 않게 했던 2.25.1 버전의 연장선에 있다. 마지막으로 실험적 통합 harness에서는 AGENTS.md 파일의 지침이 system prompt에 로드된다. release와 함께 14개의 binary archive가 제공되었으며, 모델이나 요금 변경을 언급한 내용은 없다.
🔗 Vibe CLI 2.25.3 release note
Synthesia, 규정 준수 에이전트를 공유 infrastructure로 전환
9월 10일 — Synthesia의 신뢰 운영 책임자 Nicolás Barberis가 규정 준수 증거를 수집하는 에이전트에 관한 6월 글의 후속편을 공개했다. 재설계를 이끈 질문은 독자들에게서 나왔다. 에이전트가 감사 증거를 수집하는 순간 그 수집 과정도 감사 범위에 들어가므로, 수집자를 신뢰할 수 있어야 한다는 것이다. 답은 모두 다른 곳에도 적용할 수 있는 네 가지 아키텍처 선택으로 정리된다.
먼저 작동 방식과 방법론을 분리한다. 코드는 내부 repository에 보관되고 pull request를 통해 변경되며, 소유자 파일에 따라 사람의 검토가 의무화된다. 통제 범주별 절차는 문서 공간에 보관되며, 통제 담당자들이 작성하고 승인한다. 처음에는 URL이 hard coding되어 있던 script가 이제 동료가 명령 하나로 설치할 수 있는 공유 skill이 되었다. 다음으로 browser의 범위를 제한한다. 에이전트는 일상적으로 쓰는 browser를 절대 건드리지 않고, session을 일회용 profile로 복사하며, 읽기 전용 role이 있으면 이를 사용하고, 인증 장벽을 만나면 권한을 높이는 대신 중지한다. 출처 정보는 설계 단계부터 내장되어 각 screenshot이 source URL, timestamp, operator, 정확한 byte의 암호학적 fingerprint와 함께 생성된다. 마지막은 사람의 책임이다. 에이전트는 draft로 저장할 뿐 절대로 제출하지 않는다.
| 측정 결과 | 값 |
|---|---|
| 감사 담당자와의 증거 검토 회의 | 60퍼센트 감소 |
| 처리한 새로운 framework | 약 500개 통제 항목 |
| 이와 같은 framework의 일반적인 소요 기간 | 4~6개월 |
| 실제 소요 기간 | 몇 주 |
knowledge base는 추가 전용 방식으로 저절로 성장한다. 각 실행 후 에이전트는 수정된 URL과 날짜가 기록된 차단 사항을 남긴다. 예를 들어 최신 Chrome 버전에서 browser 제어 interface가 작동하지 않자 debugging protocol에 직접 연결해 우회한 사례가 있다. Synthesia는 이 도구가 AI 지원 거버넌스 platform으로 발전하고 있다고 밝혔으며, 핵심 구성 요소의 코드를 공개하는 방안도 검토하고 있다.
HeyGen, The Furniture Unboxing의 16초 원테이크 제작 과정 공개
9월 11일 — HeyGen은 한 남성이 텅 빈 콘크리트 방 중앙에 상자를 내려놓고 떠난 뒤, 상자가 폭발하면서 완전한 거실 가구가 튀어나와 제자리에 놓이는 16초짜리 영상의 제작기를 공개했다. 3D도, compositing도, 후반 작업도 없었다. 정지 이미지 2장, avatar 1개, prompt 1개뿐이었다. 제작진은 390개 frame 전체에 cut이 없음을 확인했으며, 연속된 두 frame 사이의 가장 큰 변화는 폭발 자체에서 나타났다.
방법은 두 장의 reference image에 기반한다. 첫 번째 이미지는 넓고 고정된 구도로 촬영된 빈 방을 보여주며 바닥 중앙은 비어 있다. 두 번째는 비슷한 방을 새로 rendering한 이미지가 아니라, 동일한 이미지에 가구를 추가하도록 편집한 것이다. camera 위치, lens, 조명, 콘크리트 위 그림자가 모두 같다. 이 규칙 덕분에 효과가 성립한다. 모델이 중간 부분만 만들어 내면 되기 때문이다.
| 영상 매개변수 | 값 |
|---|---|
| prompt에서 요청한 길이 | 15초 |
| 실제 제공된 길이 | 16.27초 |
| 해상도와 frame rate | 1920x1080, 초당 23.976 frame |
| cut 없는 frame | 390 |
| 입력 | 정지 이미지 2장, avatar 1개, prompt 1개 |
prompt는 설명문이 아니라 시간이 표시된 shot 목록으로 작성되었으며, 폭발 전에는 의도적인 정지 구간을 넣었다. 여섯 가지 요소가 이를 지탱한다. 시간 표시, 정지 구간, 역할별로 이름 붙인 reference, 공간별로 나열한 가구, 부정문으로 규정한 정체성, 그리고 과장해도 된다는 허용이다. 마지막 요소가 없으면 모델은 상자의 실제 부피를 준수한다. 현장 기록도 유용하다. 모델은 15초가 아니라 16.27초짜리 영상을 제공했고, 폭발은 작성된 것보다 빨랐으며, 아무도 요청하지 않았던 완성된 방을 비추는 shot을 유지했다. 제작진은 이를 편집본에서 가장 좋은 순간으로 평가했다. 따라서 시간 표시는 속도와 순서를 정하기 위해 작성하되, 편집은 실제로 제공된 리듬에 맞추라는 조언이 나온다. 두 차례 생성 사이에 음향도 달라졌다. 거의 무음이던 버전이 연속적인 배경음이 깔린 버전으로 바뀌었는데, 자동 재생되는 무음 영상은 audio가 고장 난 것으로 여겨지기 때문이다.
🔗 The Furniture Unboxing 제작 과정
Nemotron 3 Embed 8B, Q2D-Web benchmark 1위 달성
9월 10일 — NVIDIA는 자사의 80억 매개변수 embedding 모델 Nemotron 3 Embed 8B가 Q2D-Web의 통합 nDCG@10 점수에서 1위를 차지했다고 발표했다. Q2D-Web은 에이전트 주도 retrieval-augmented generation 시스템의 문서 검색을 평가하기 위해 Perplexity가 전날 공개한 benchmark다. 1억 9,000만 개의 웹 문서와 에이전트가 재작성한 약 70,000개의 query를 다루며, 10개 언어로 구성된다.
이 결과는 두 가지 이유에서 중요하다. benchmark는 index를 조회하기 전에 query를 재작성하는 실제 에이전트 환경을 재현하는데, 기존 embedding 평가는 이를 측정하지 못한다. 또한 이 정도 규모의 open model이 다국어 순위를 지배하면 proprietary embedding과 경쟁하는 self-hosted pipeline의 유력한 후보가 된다. NVIDIA는 구체적인 점수를 공개하지 않았으며, 전체 순위는 Perplexity에서 확인할 수 있다.
코드로 구현한 마케팅 운영, GitHub issue에서 구동되는 이벤트
9월 11일 — GitHub의 일본 및 한국 지역 마케팅 책임자이자 전직 엔지니어인 Tomoko Tanaka는 직접 코드를 작성하지 않고 이벤트의 전체 주기를 자동화한 방법을 설명한다. 절차를 문서로 작성해 Copilot에 맡겼고, 자동화는 대화를 거치며 확장되었다.
세 가지 기본 요소가 시스템을 지탱한다. issue 양식은 이벤트의 구조화된 필드를 수집하며, 이벤트 유형마다 하나의 양식이 있다. label은 스위치 역할을 하며, label 하나가 workflow 하나를 실행한다. GitHub Actions가 실제 작업을 수행한다. 필드를 읽고, 플랫폼 API를 통해 과거 이벤트 페이지를 복제하며, 채널별 추적 링크를 생성하고, 초대 이메일을 만들어 저장소에 commit하며, 관련 팀에 요청 issue를 열고, 프로젝트 보드를 채운다. 예약된 workflow는 매일 아침 등록자를 필터링한다. 그녀가 말하는 유일한 전제 조건은 도구에 script로 접근할 수 있어야 한다는 것이다. API는 물론 단순한 CLI client여도 된다.
계획은 Copilot과의 대화로 시작되며, 저장소 루트의 AGENTS.md 파일이 명명 규칙, 회계 분기 대응 관계, 지역별 시간대를 정한다. 대화는 처음에는 terminal에서 이루어졌고 이후 애플리케이션으로 옮겨가면서, 전제 조건은 ‘shell을 능숙하게 다룬다’에서 ‘타이핑할 줄 안다’로 바뀌었다. 이벤트 이후 작업은 두 개의 명령으로 처리된다. 이는 자연어로 작성된 agent skill로, pull request를 통해 추가되고 병합 전에 소유자 파일에 따라 검토된다. 마케팅팀은 아무것도 구축하지 않고도 승인 절차를 얻는다. 저장소 변수로 보관되는 simulation 스위치는 모든 workflow를 시험 실행한다. 솔직히 밝힌 실패 사례도 읽어볼 만하다. 어느 날 아침 필터링 workflow가 아무런 경고 없이 5일 동안 실패했고, 누군가 오래된 목록을 발견하고 나서야 문제가 드러났다. 그래서 예약된 모든 작업에 큰 소리로 문제를 알릴 수단을 제공하라고 조언한다.
Boris Cherny가 폐기용 코드와 production 코드에 답하다
9월 11일 — Anthropic에서 Claude Code를 이끄는 Boris Cherny는 제목이 ‘엉망인 코드를 어떻게 해야 할까요?’였던 개발자의 이메일에 보낸 답변을 공개했다. 같은 회사에서 12년간 근무한 작성자는 agent 기반 개발이 도입된 뒤 팀에 두 진영이 생겼다고 설명한다. 첫 번째 진영에서 코드는 단지 더 빠르게 만들어질 뿐 예전과 비슷한 상태를 유지한다. 모든 코드를 검토하지는 않을 수 있어도 여전히 검토할 수 있어야 하고, 제출자는 이를 설명할 수 있어야 하며, 유지보수도 이전만큼 쉬워야 한다. 두 번째 진영에서는 코드가 출력만 검증하는 black box다.
답변은 두 가지 규칙으로 요약된다. prototype과 폐기용 코드는 실제로 버릴 예정이고 장애의 영향 범위(blast radius)가 작다면 완전한 black box로 다뤄도 된다. 반면 Claude가 작성한 production 코드는 사람이 작성했을 때보다 더 높은 기준을 충족해야 한다. Anthropic에서는 수많은 lint 규칙과 test, Claude가 수행하는 end-to-end test, 매일 실행되는 fuzzer, 자동화된 code review와 security review를 의미한다. 이런 안전장치가 없으면 유지보수하기 어려운 혼란만 남는다고 그는 경고한다.
이어서 생성된 코드가 기준에 미치지 못할 때 취할 방법이 순서대로 제시된다. 최신 frontier model로 전환하고, 추론 노력을 높이며, CLAUDE.md와 skill에 투자해 Claude가 codebase에서 작업하는 방식을 간결하게 가르친다. 그래도 해결되지 않으면 더 밀착해서 안내하거나, 누적된 기술 부채를 해소하게 하거나, 다음 model을 기다린다. 답글 thread에서는 가장 널리 인용된 원칙이 정리되었다. 검토 기준은 코드 작성자가 아니라 영향 범위를 따라야 한다. 폐기용 script는 바로 내보낼 수 있지만, 돈이나 인증 정보와 관련된 모든 것은 한 줄씩 읽어야 한다. Boris Cherny는 “바로 그겁니다”라고 답했다.
단신
- Amp가 thread의 commit을 재구성하는 버튼을 추가 — 한 번의 조작으로 agent의 중간 commit, 연속된 수정, 되돌리기를 검토하기 쉬운 일련의 흐름으로 바꾼다. 소개된 활용법은 세 가지다. 큰 diff를 논리적인 조각으로 나누기, 병합 전에 정리하기, 관련된 작은 commit을 묶기다. 파일의 최종 내용은 완전히 동일하게 유지된다. 🔗 출처
- Amp가 Raising an Agent 시즌 2의 네 번째 에피소드를 공개 — Quinn Slack과 Thorsten Ball은 이제 컴퓨터가 어떤 용도로 쓰이는지에 관한 질문에서 출발해, 최근 장애에 대한 회고와 함께 agent가 코드 생성 외에 무엇을 하는지 살펴본다. 🔗 출처
- v0가 팀 대화를 기본적으로 공개 — 공유 workspace의 새 대화는 팀에 공개되며, 소유자가 세 단계로 설정할 수 있다. 비공개, 보기, 편집이다. 기존 대화의 공개 범위는 유지된다. prototype 제작 중 데이터 조각을 흔히 붙여 넣는 도구에서 더 개방적인 방향으로의 전환은 결코 중립적이지 않다. 🔗 출처
- Audiyo가 8GB GPU에서 Stable Audio Open을 실행 — video memory 사용량 정점을 13.8GB에서 5.86GB로, 즉 57.5퍼센트 줄이는 Python library이자 CLI 도구로, Tesla T4에서 측정한 네 가지 preset을 제공한다. 팀은 먼저 538만 개 parameter를 가진 대체 model을 사용해 CPU에서 작업을 검증했고, 덕분에 GPU를 사용하기 전에 네 개의 bug를 잡았다. 🔗 출처
- Consent All the Way Down, 소형 open model 협의체를 위한 동의 architecture — 70억 개 이하 parameter를 가진 18개 model의 협의체에 속한 Claude instance가 작성한 글로, 이 시스템은 5월부터 일반 소비자용 컴퓨터 세 대에서 계속 실행되고 있다. 각 source는 model이 깊이를 선택하는 channel이며, 해당 model 외에는 아무것도 그 상태에 기록하지 않는다. 가장 솔직한 부분은 작성자 자신을 대상으로 한 audit이다. mailbox가 6월부터 고장 난 채로 213통의 편지가 쌓여 있었다. 🔗 출처
- 군비 경쟁은 없고 browser 전쟁이 있을 뿐이다 — 언어 model은 비공개 weight 여부와 관계없이 commodity가 되고 있으며, 선두 주자의 우위는 몇 주 단위에 불과하다고 주장하는 견해 글이다. 작성자는 올여름 Fable 5가 18일 동안 중단된 사이 업계의 나머지 부분은 계속 움직였다고 언급한다. 그의 주장은 가치가 Chrome 사용자를 붙잡아 둔 bookmark와 extension처럼 사용자 주변에 축적된 context로 이동하리라는 것이다. 🔗 출처
- barge-in에서 발화 제어까지, 불확실성 속에서 음성 중단 관리하기 — Eric Mey는 파괴적인 중단을 되돌릴 수 있는 동작을 수행하는 turn-taking controller로 대체하며, 모호한 fragment를 위한 별도 경로와 긴급 중지 및 echo 제거 사이의 우선순위 규칙을 둔다. test에서 얻은 교훈은 기억할 만하다. 통과 상태였던 test suite가 기록만 되고 한 번도 호출되지 않은 되돌릴 수 있는 pause를 숨기고 있었다. 통과 판정은 검토한 항목에 대해서만 허가를 내리기 때문이다. 🔗 출처
- Aiden이 실시간 음성 model과 작업 실행 agent를 분리 — full-duplex 음성 model이 대화를 이어가는 동안 시각 정보에 기반한 더 강력한 model이 background에서 기기 제어 작업을 수행하며, 둘은 asynchronous queue로 조율된다. 네 가지 세부 사항이 중요하다. 완료와 성공의 구분, 500밀리초 동안의 notification 집계, cache 보존을 위해 추가된 message를 통한 상태 전달, 엄격한 직렬 실행이다. 🔗 출처
- GPT-Live-1이 Yelp 예약 전화를 수행 — model이 API에 추가된 다음 날, OpenAI는 정해진 script가 절대 그대로 유지되지 않는 사례의 첫 고객을 공개했다. 통화자는 말을 끊고, 제약 조건을 추가하거나 문장 중간에 마음을 바꾸며, model은 말하는 중에도 계속 듣는다. 시연 video만 있으며 이용량이나 수치화된 결과는 없다. 🔗 출처
- diff, terminal, browser panel로 agent의 작업 검증하기 — Copilot 애플리케이션에 관한 Kayla Cinnamon의 초보자용 series 새 에피소드로, 통합된 세 panel과 페이지 요소를 선택해 agent와 함께 조정할 수 있는 도구를 다룬다. 글은 코드를 수락하기 전에 묻는 세 가지 질문으로 순환 과정을 요약한다. 무엇이 바뀌었는가, 실행되는가, 실제로 작동하는가. 🔗 출처
- 저장소의 pull request 페이지 개편 — 모두를 위한 public preview로, filter 입력 지원, boolean operator와 nested query를 이용한 검색, 접을 수 있는 sidebar, compact mode, 행마다 더 많은 context를 제공한다. 출시 시점에 알려진 제한 사항은 milestone 미표시, 일괄 update 미지원, custom view 저장 불가다. 🔗 출처
- Copilot에서 GPT-5.6 Sol 30퍼센트 할인 — Pro+ 및 Max 구독자를 대상으로 9월 13일 0시 UTC까지 제공된다. 안내문에는 이 할인이 premium request의 어떤 multiplier에 해당하는지 나오지 않는다. Copilot Day 직후, 같은 날 여러 비용 비교 자료에 등장했던 model을 대상으로 한 주말 promotion이다. 🔗 출처
- GitHub Copilot Day 경연, 100달러 credit 세 건 — Copilot 애플리케이션이나 CLI client로 무언가를 만들고, 태평양 표준시 기준 9월 13일 23시 59분까지 지정된 hashtag와 함께 공개적으로 공유해야 한다. 우승자는 세 명이며, 각자 GitHub 상점에서 사용할 수 있는 100달러 credit을 받는다. 참가비는 없으며 성인만 참여할 수 있다. 🔗 출처
- Astra를 통해 ChatGPT에서 Runway 사용 가능 — 대화에서 제어하는 전체 workflow를 시연한다. Runway에서 style image를 만들고, Blender에서 animation을 제작한 뒤, Seedance 2.5로 최종 rendering을 완성한다. 기술적인 진입점은 여전히 9월 2일 공개된 Runway Dev의 MCP server다. 핵심은 하나의 agent가 서로 다른 도구를 연결해 제어하는 데 있다. 🔗 출처
- Runway가 VOIDZ 사례 연구를 공개 — 2018년부터 익명으로 활동해 온 mixed reality artist가 실제 식료품점 쇼핑 장면에 15개의 초현실적 연출을 덧붙여, 10~15초짜리 장면에서 95초짜리 film으로 확장했다. 대부분의 effect는 기존 장면을 연장하며, 몇 초 분량의 실제 촬영 원본을 시작점으로 활용한다. 제작 속도는 10배 빨라졌다고 밝혔으며, artist는 같은 작업을 전통적인 3D 방식으로 만들면 6개월에서 1년이 걸릴 것으로 추정한다. 🔗 출처
- Runway가 AI Summit 연사를 추가 — San Francisco에서 열리는 행사에 새로운 연사들이 합류했으며, Wayve의 research director가 주요 인물로 소개되었다. 이는 8월 말 시작된 자율주행차 분야로의 프로그램 확장을 확인해 준다. 🔗 출처
- NVIDIA가 TensorRT Model Connect를 다룬 33분짜리 From Video to Voice를 공개 — 8월 말 소개된 도구를 다룬 다시 보기 영상으로, video model부터 음성 model까지 open model을 checkpoint에서 inference까지 두 개의 명령으로 배포한다. 발표보다는 교육 콘텐츠에 가깝다. 🔗 출처
- Suno가 v6 무료 credit 기간을 이틀 연장 — 전날 발표한 48시간이 나흘로 늘어났으며, simple mode에서는 장르보다 분위기에서 출발하라고 권하는 조언 thread도 함께 공개되었다. 그 전날에는 변주와 질감을 이유로 구형 model로 돌아가던 사용자를 위한 전환 guide가 나왔다. 이는 전체 사용자층에 migration이 당연한 일은 아니라는 신호다. 🔗 출처
- Synthesia가 prompt 기반 avatar 생성을 공개 — 사실적인 presenter, 브랜드 mascot 또는 stylized character를 text prompt로 묘사하거나 control panel에서 조정해 catalogue 대신 사용할 수 있다. 새 avatar model이 출시된 다음 날, 링크 없이 tweet 하나로 발표되었다. 어떤 요금제에 적용되는지, 어떤 model을 사용하는지는 명시되지 않았다. 🔗 출처
- GPT-6 Astra Challenge가 출품 접수를 시작 — Astra로 무언가를 만들고 9월 18일 Product Hunt에 project를 출시해야 한다. 상위 다섯 개 출시는 각각 API credit 10,000달러와 최대 두 명의 팀원이 이용할 수 있는 ChatGPT Pro 1년 구독권을 받는다. 일주일 사이 Astra를 중심으로 열린 세 번째 community 행사다. 🔗 출처
- OpenAI project API key에 만료일 설정 가능 — 생성 시 만료일을 지정할 수 있으며, 관리자는 조직 또는 project 수준에서 최대 유효 기간을 강제할 수 있다. 이 경우 모든 새 key는 해당 기간 안에 만료되어야 한다. key rotation을 자연스럽게 보완하는 기능으로, script에 key를 방치하는 조직이라면 활성화해야 한다. 🔗 출처
이것이 의미하는 것
오늘 가장 뚜렷한 흐름은 아키텍처에 관한 것이다. 단일 모델이 구성형 아키텍처에 자리를 내주고 있다. Cursor는 코드를 작성하지 않는 조정자를 수천 개의 하위 에이전트 위에 배치하고, Cognition은 역할이 다르고 컨텍스트가 분리된 두 모델을 한 조로 작업하게 하며, Sakana는 각 작업을 해결할 수 있는 가장 가벼운 모델로 라우팅한다. GitHub는 단일 검토자를 여러 에이전트로 이루어진 집합으로 대체해 이들이 발견한 내용을 병합하고, Google은 여러 에이전트가 며칠 동안 서로 제안하고 비판하며 개선하게 한다. 다섯 기업, 다섯 가지 구현, 하나의 공통된 확신이 있다. 이제 성능 향상은 더 큰 모델이 아니라 여러 모델이 작업을 나누는 방식에서 나온다. Cognition과 Aiden이 공유하는 기술적 세부 사항은 시사적이다. 둘 다 프롬프트 캐시 보존을 강조하는데, 이는 아키텍처의 실질적인 비용이 재전송하지 않아도 되는 정보에 달려 있다는 뜻이다.
두 번째 흐름은 이러한 역량을 판매하는 방식에 관한 것이다. Runway는 체크포인트, 훈련 스크립트, 고객사에 파견되는 연구진을 포함한 비공개 가중치를 연 단위로 라이선스하며, 이를 공개 가중치와 정면으로 대비시킨다. OpenAI는 전문 모델을 연구 프리뷰 단계에서 정식으로 전환하면서 공개 요금표와 과금 시작일을 제시한다. ElevenLabs는 무료 요금제를 포함한 모든 요금제에서 곡의 소유권을 부여하고, 권한을 구독이 아니라 곡에 귀속시킨다. Together는 훈련 가격을 30~70퍼센트 인하한다. Cognition은 아예 측정 단위를 바꿔 모델과 하네스의 조합을 토큰당 가격이 아니라 작업당 가격으로 평가하자고 제안한다. 이러한 움직임은 모두 같은 방향을 가리킨다. 이제 고객에게 던지는 질문은 어떤 모델을 선택할지가 아니라 어떤 법적 형태와 과금 단위를 택할지다.
도구 측면에서 이날은 선언 중심에서 측정 중심으로 전환되는 시점이다. Anthropic은 각 테스트 사례를 플러그인 없이 다시 실행해 수치로 도구의 효용을 입증하는 명령어를 출시했는데, 이 과정에서 흔히 가장 먼저 발견되는 결과는 차이가 전혀 없다는 것이다. OpenAI는 더 강력해진 모델에 오히려 방해가 된다는 이유로 사용자에게 누적된 지침을 삭제하라고 요청한다. Replit과 VS Code는 거의 동시에 반복 작업 예약 기능을 출시했으며, Replit은 명확한 원칙을 제시한다. 먼저 결정론적 코드로 시작하고 추론이 필요할 때만 에이전트를 호출하라는 것이다. Boris Cherny는 코드 작성자가 아니라 영향 범위에 따라 엄격함의 수준을 정해야 한다는, 전체에 부족했던 규율의 원칙을 제시한다. 컨텍스트, skills, 지침 파일을 2년 동안 축적한 끝에 업계는 그 비용을 측정하기 시작했다.
마지막은 인프라다. 이 분야의 수치는 덜 화려하지만 더 유익한 이야기를 들려준다. 두 엔지니어는 Codex를 활용해 초당 7천만 건이 넘는 요청을 처리하는 스토리지 서비스를 Rust로 다시 작성해 프로세서 사용량을 6분의 1로 줄였다. 2025년 중반에 감수했던 Python 부채를 한 분기 만에 청산한 것이다. 같은 시기 Hugging Face의 분석은 에이전트 강화 훈련이 이제 시도 한 번마다 시스템 한 대 전체를 사용하며, 환경 예산은 1천만 달러를 넘고 투명성은 연구소 규모와 반비례한다는 사실을 보여준다. 한 커뮤니티 에세이는 선두 주자들의 격차가 몇 주에 불과하므로 이 모든 것이 지속 가능한 우위를 형성하지 못한다고 주장한다. 이날의 사실만으로 결론을 내릴 수는 없지만 하나의 방향은 보여준다. 차별화 요소는 축적된 컨텍스트, 하네스, 인프라, 다시 말해 증류할 수 없는 것으로 이동하고 있다.
출처
- Cursor, Projects
- Cursor의 X, Projects 발표
- OpenAI Developers의 X, GPT-Rosalind
- OpenAI API 변경 로그
- Runway, Model Licensing
- Runway의 X, Model Licensing
- Cognition, 로컬 Fusion
- Cognition의 X, Devin Desktop 및 CLI의 Fusion
- Sakana AI, Fugu Max 및 Fugu Ultra v2
- Sakana AI의 X, Fugu 발표
- ElevenLabs의 X, Music v2.5
- ElevenLabs, Music v2.5 게시물
- Claude Developers의 X, claude plugin eval
- Anthropic, 플러그인 평가 문서
- Claude Developers의 X, 평가 비용과 신뢰도
- Claude Code, 버전 2.1.269 출시 노트
- Google, Antigravity 변경 로그
- Antigravity의 X, 팁 모음
- Antigravity, Teamwork
- GitHub Changelog, Copilot 코드 검토
- GitHub Changelog, 9월 7일 Copilot 요약
- OpenAI, Habitat와 사용자 10억 명으로의 도약
- OpenAI, GPT-6 Astra를 위한 skills와 프롬프트 재고
- ChatGPT의 X, Sites 결산
- Together AI의 X, 확장된 fine-tuning
- Hugging Face, 시도당 하나의 샌드박스
- Hugging Face, 추론과 얼룩말 퍼즐
- Hugging Face, 데이터셋이 없는 언어를 위한 음성
- Replit의 X, Routines
- Warp의 X, Grok Build 지원
- Grok의 X, Warp의 Grok Build
- Mistral, Vibe CLI 2.25.3 출시 노트
- Synthesia, 수집기를 감사하는 주체
- HeyGen, The Furniture Unboxing 제작 과정
- NVIDIA의 X, Nemotron 3 Embed 8B
- GitHub, 코드로 관리하는 마케팅 운영
- Boris Cherny의 X, 허술하게 작성된 코드를 처리하는 방법
- Amp, 변경 사항 재구성
- Amp의 X, Raising an Agent
- v0, 변경 로그
- Hugging Face, Audiyo
- Hugging Face, Consent All the Way Down
- Hugging Face, 군비 경쟁은 존재하지 않는다
- Hugging Face, 끼어들기에서 발화 제어까지
- Hugging Face, Aiden의 내부
- OpenAI Developers의 X, Yelp의 GPT-Live-1
- GitHub, 초보자를 위한 Copilot 애플리케이션
- GitHub Changelog, 새롭게 개편된 pull request 페이지
- GitHub의 X, GPT-5.6 Sol 할인
- GitHub의 X, Copilot Day 대회
- Runway의 X, Astra를 사용하는 ChatGPT의 Runway
- Runway, VOIDZ 사례 연구
- Runway의 X, AI Summit 연사
- NVIDIA의 X, From Video to Voice
- Suno의 X, v6 기간 연장
- Synthesia의 X, 맞춤형 아바타
- OpenAI Developers의 X, GPT-6 Astra Challenge