ai-powered-markdown-translatorgemini-3.8-flash-medium으로 프랑스어에서 한국어로 번역된 기사.
9월 30일 수요일, Google은 최대 100만 토큰 출력을 지원하며 Fairwind Program의 신뢰할 수 있는 사이버 방어자들에게 우선 배포되는 프론티어 모델인 Gemini 4 Argon을 발표했습니다. OpenAI는 자사 모델의 보호된 추론 과정을 추출하려는 조직적인 캠페인을 무력화했다고 밝히며, 그 핵심 배후로 Moonshot AI와 관련된 인물들을 지목했습니다. Cohere는 자체 평가 방식을 적용한 Embed 5를 출시했고, Ideogram 4.5는 아티팩트 없는 연속 수정을 약속하며, HeyGen은 MiniMax H3 기반의 비디오 모델을 선보였습니다. 개발자 측면에서는 Claude Code 2.1.286, Zed 1.22.0, VS Code 1.140이 같은 날 출시되었습니다.
Gemini 4 Argon: Google의 새로운 프론티어 모델, 사이버 방어자에게 우선 제공
9월 30일 — Google은 Google DeepMind 수석 부사장이자 Google 수석 AI 아키텍트(Chief AI Architect)인 Koray Kavukcuoglu의 기고문을 통해 새로운 프론티어 모델인 Gemini 4 Argon을 발표했습니다. Argon은 실제 환경의 소프트웨어 엔지니어링, 기업 내 지식 작업(법률, 금융), 사이버 방어라는 세 가지 영역에서 길고 복잡한 워크플로(long-horizon workflows)에 걸친 심층 추론을 지원하도록 설계되었습니다.
이 모델은 아직 대중에게 공개되지 않았습니다. 9월 2일 Gemini 3.8 Flash Cyber와 함께 시작된 Fairwind Program의 신뢰할 수 있는 사이버 방어자 그룹에 우선 배포되며, 이들은 Google 내부 팀과 마찬가지로 사이버 안전장치(cyber guardrails)가 해제된 버전을 제공받습니다. 개발자, 기업, 일반 대중에게는 구체적인 일정 발표 없이 유료 API 고객 및 Google AI Ultra 구독자를 시작으로 “가능한 한 신속히” 제공될 예정입니다. 그때까지 Google은 사이버 및 화생방핵(CBRN) 관련 유해 요청에 대한 거부 조치를 강화하고, 모델의 사고 과정(Chain of Thought)과 행동에 대한 모니터링을 강화하며, 고위험 학습 및 평가 작업을 격리된 샌드박스에서 수행하고 있습니다. 또한 미국 정부의 모델 출시 전 사전 접근 자발적 프로세스에도 참여하고 있다고 밝혔습니다.
Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.
🇰🇷 우리의 새로운 프론티어 모델 Gemini 4 Argon을 소개합니다. 프로그래밍, 기업 지식 작업, 사이버 방어 분야의 복잡한 워크플로를 위해 설계되었으며, 오늘부터 Fairwind Program을 통해 신뢰할 수 있는 테스터 그룹에 배포됩니다. — @GoogleDeepMind X에서
가격은 이미 책정되었습니다. 출시 프로모션 가격은 입력 토큰 100만 개당 2달러, 출력 10달러로 전날 출시된 GPT-6.1 Sol과 동일하며, 기간이 명시되지 않은 출시 기간이 끝난 후에는 각각 4달러와 20달러로 인상됩니다. 캐시된 입력은 일반 입력보다 95% 저렴합니다. 출력 한도는 이전의 64K에서 100만 토큰으로 늘어나 Google에 따르면 업계 최고 수준입니다. 모델은 까다로운 문제를 해결하기 위해 단일 실행 과정에서 수십만 토큰을 생성할 수 있습니다.
| 100만 토큰당 가격 | 출시 프로모션 가격 | 출시 기간 이후 가격 |
|---|---|---|
| 입력 | 2달러 | 4달러 |
| 출력 | 10달러 | 20달러 |
Google DeepMind 페이지는 19개 항목에 걸쳐 Argon을 GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5와 비교하고 있습니다. Argon은 이 중 13개 항목에서 최고 점수를 기록했고, CWE-bench v1에서는 GPT-6 Astra와 공동 1위(68.0%)를 차지했으며, 5개 항목에서 뒤처졌습니다. 에이전트 코딩 분야가 가장 치열했습니다. DeepSWE v1.1(77.9%)과 Vibe Code Bench에서는 1위를 차지했으나, FrontierSWE v2와 Terminal-bench 4.0에서는 네 모델 중 최하위를 기록했습니다. 지식 작업, 특히 Harvey의 Legal Agent Benchmark(다른 세 모델의 최고 기록인 6.7% 대비 19.6%)와 256K~1M 토큰 범위의 긴 컨텍스트 처리에서는 압도적인 우위를 보였습니다. 각 행의 최고 점수는 굵은 글씨로 표시되어 있습니다.
| 평가 벤치마크 (도메인) | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index (지식 작업) | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench (지식 작업) | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 (지식 작업) | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey의 Legal Agent Benchmark (지식 작업) | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 (에이전트 코딩) | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 (에이전트 코딩) | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench (에이전트 코딩) | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 (에이전트 코딩) | 57.4% | 58.2% | 57.9% | 66.4% |
| PostTrainBench (ML 엔지니어링) | 45.3% | 44.3% | 40.2% | 49.3% |
| Terminal-Bench Science 0.1 (과학 및 수학) | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2 (과학 및 수학) | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench (과학 및 수학) | 76.0% | 72.0% | 65.6% | 69.6% |
| 최대 128K GraphWalks BFS (긴 컨텍스트, F1) | 99.7% | 98.7% | 91.4% | 90.6% |
| 256K ~ 1M GraphWalks BFS (긴 컨텍스트, F1) | 84.2% | 71.8% | 65.0% | 66.8% |
| Agent’s Last Exam (컴퓨터 사용) | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0, 오프라인 하위 집합, 부분 점수 (컴퓨터 사용) | 69.2% | 72.6% | — | — |
| Chartography (멀티모달 이해) | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench (멀티모달 이해) | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 (사이버 보안) | 68.0% | 68.0% | 58.0% | 67.0% |
Google 내부에서는 이미 수천 명의 직원이 이를 활용하고 있습니다. Google의 오픈 소스 비디오 디코더인 libgav1에서 Argon 에이전트는 기존 Rust 포팅의 SIMD 코드 32,000줄을 안전한 Rust 코드로 대체했습니다. 그 결과 완성된 디코더는 기존 포팅 버전보다 2.7배 빠르면서도 동일한 비디오 출력을 제공합니다. 다른 에이전트들은 배포 시 300TiB 이상의 메모리를 확보할 수 있는 데이터 센터용 메모리 최적화 작업을 준비했습니다. 사이버 보안 분야에서는 Wiz가 Scan for Good 이니셔티브에 Argon을 도입했습니다. Argon은 전 세계 병원에서 사용하는 의료 소프트웨어에서 이전 프론티어 모델들이 놓쳤던 민감한 개인정보를 노출하는 치명적인 취약점을 발견했습니다.
🔗 Gemini 4 Argon: our next era of frontier intelligence (Google 블로그) 🔗 Google DeepMind Gemini 페이지 및 벤치마크 표
OpenAI, 증류 공격 캠페인 차단 발표… 핵심 배후로 Moonshot AI 관련자 지목
9월 30일 — OpenAI는 자사 보안(Security) 블로그 기고문을 통해 모델이 작업을 수행할 때 생성하는 내부 추적 기록인 보호된 추론(protected reasoning)을 추출하려는 조직적인 캠페인을 감지하고 무력화했다고 밝혔습니다. OpenAI는 이를 적대적 증류(adversarial distillation), 즉 다른 모델을 훈련, 복제 또는 개선하기 위해 특정 모델의 출력이나 추론을 무단으로 체계적으로 사용하는 행위로 보고 있습니다.
OpenAI에 따르면 공격자들은 암호화를 해독하거나 데이터베이스를 침해하지 않았으며, 저장된 사용자 대화에 직접 접근하지도 않았습니다. 이들은 한 대화의 암호화된 추론을 복사한 뒤 다른 대화에서 모델에게 이를 해독하고 전사하도록 요청하는 등, 대화 내용을 조작하여 보호된 추론이 가시적인 형태로 다시 나타나도록 유도했습니다. 독립 연구원들이 책임 있는 공개 절차를 통해 유사한 취약점을 보고한 바 있으며, 이는 8월 10일 arXiv에 제출된 논문 “Stealing Reasoning Traces from Proprietary LLM APIs”에 기술되어 있습니다. OpenAI는 이러한 공격 경로가 실제로 존재했음을 확인했습니다.
| 캠페인 단계 | OpenAI가 확인한 일자 또는 규모 |
|---|---|
| 활동 시작 (소량) | 7월 1일 |
| 활동 정점 | 7월 24일 및 25일 |
| 정점 기간 동안 추출 패턴을 따른 요청 수 | 4,000명 이상의 사용자로부터 발생한 16,000건 |
| 해당 패턴과 연계된 그룹 | 15,000명 이상의 사용자 |
| 그룹 완전 무력화 | 7월 28일 |
행위자 식별(attribution)과 관련하여 기고문은 신중한 입장을 유지하고 있습니다. 모든 공격자가 동일한 주체에 속하는지 여부는 입증되지 않았으며, 정점 기간의 16,000건의 요청 역시 추출 시도일 뿐 반드시 성공한 것은 아닙니다. 그러나 OpenAI는 이번 활동의 핵심 배후를 Kimi의 개발사인 Moonshot AI와 관련된 인물들의 소행으로 보고 있습니다.
… we attribute a core cluster of the activity to individuals associated with Moonshot AI …
🇰🇷 … 당사는 이번 활동의 핵심 배후를 Moonshot AI와 관련된 인물들로 보고 있습니다 … — OpenAI, 보안 블로그 기고문
이에 대응하여 OpenAI는 부정 계정을 차단하거나 제한했고, 가입 및 인프라 제어를 강화했으며, 관련 네트워크 모니터링을 확대하고 사용자, 워크스페이스, 조직 및 모델 제품군 간의 숨겨진 추론 보호 조치를 강화했습니다. 다른 사용자의 암호화된 추론을 재생하여 내용을 복원할 수 있었던 경로를 차단했으며, 이를 노출할 수 있는 스트리밍(streaming) 출력을 감지하고 차단하는 제어 기능을 추가했습니다. 이러한 결과는 Frontier Model Forum과 정부 채널을 통해 공유되었습니다. OpenAI에 따르면 이 기법은 자사 모델에만 국한된 것이 아니며, 추론을 이식 가능하거나 재생 가능하게 만드는 모든 시스템이 유사한 위험에 노출될 수 있습니다. 추출된 추론은 원본 모델의 안전장치 없이 다른 모델을 훈련하는 데 사용될 수 있으므로, OpenAI는 적대적 증류를 안전 및 국가 안보상의 위협으로 규정하고 있습니다. 이러한 문제는 새로운 것이 아닙니다. 지난 2월 Anthropic은 DeepSeek, Moonshot AI, MiniMax가 증류 캠페인을 벌였다고 지목한 바 있으며, 9월 24일부터 추론 추출을 포함한 여러 범주에서 차단된 요청에 대해 요금을 부과하고 있습니다.
🔗 arXiv의 “Stealing Reasoning Traces from Proprietary LLM APIs” 논문
임베딩: Cohere, Embed 5 및 RCP-nDCG@10 지표 출시, Perplexity는 pplx-embed-v2-context-9b-preview 공개
9월 30일 — Cohere가 엔터프라이즈 검색을 위한 임베딩 모델 제품군인 Embed 5를 출시했습니다. 동일한 임베딩 공간을 공유하는 두 가지 티어로 제공됩니다. 최고 품질과 오프라인 인덱싱을 위한 Embed 5 Pro, 그리고 대화형 검색, 대규모 RAG 및 에이전트 검색을 위한 Embed 5 Fast입니다. 출력 차원을 동일하게 유지한다면 아무것도 재인덱싱할 필요 없이 Pro로 코퍼스를 인덱싱한 뒤 Fast로 질의할 수 있습니다. 40개의 개발 데이터셋에서 Cohere가 권장하는 이 방식은 전부 Pro로 구성된 시스템 품질의 평균 98.4%를 유지했으며, 전부 Fast로 구성된 시스템의 96.6%와 대비됩니다.
두 모델 모두 최대 128K 토큰을 읽을 수 있고 텍스트, 이미지 또는 둘을 단일 벡터로 융합한 입력을 지원하며, 100개 이상의 언어를 지원하고 float, int8 또는 바이너리 형태로 256~2,048차원의 벡터를 생성합니다. Cohere는 int8 기준 1,024차원을 권장하며, 이는 2,048차원의 float32 기준 8KB에 비해 벡터당 1KB에 해당합니다. 텍스트 기준 가격은 Pro가 100만 토큰당 0.12달러, Fast가 3분의 1 저렴한 0.08달러로 평균 2.4배 더 높은 문서 처리량을 제공합니다. 이미지는 두 모델 모두 100만 토큰당 0.40달러가 청구됩니다. Embed 5는 오늘부터 Cohere API, Model Vault, Microsoft Foundry, Amazon SageMaker 및 North에서 사용할 수 있으며, vLLM을 통해 프라이빗 배포도 가능합니다.
| 벤치마크 (지표) | Embed 5 Pro | Embed 5 Fast | 언급된 기타 모델 |
|---|---|---|---|
| ViDoRe V3, 8개 도메인 (RCP-nDCG@10) | 85.8 | 84.5 | Voyage 4 Large 83.7 ; Gemini Embedding 2 83.2 ; OpenAI text-embedding-3-large 75.5 |
| FinanceBench (RCP-nDCG@10) | 80.1 | 80.0 | Pro가 OpenAI text-embedding-3-large보다 21.4점 앞섬 |
| FinQA (RCP-nDCG@10) | 90.0 | 88.8 | — |
| ViDoRe V3 Finance (RCP-nDCG@10) | 85.0 | 83.9 | — |
| 분석된 PDF, 제품군 평균 (RCP-nDCG@10) | 84.8 | 83.4 | Voyage 4 Large 83.6 ; Gemini Embedding 2 80.8 ; Embed 4 78.6 |
| 텍스트 및 이미지 융합, 5개 데이터셋 (nDCG@10) | 82.3 | 81.2 | Gemini Embedding 2 61.3 |
| 페이지 이미지, 5개 금융 데이터셋 (nDCG@10) | 77.0 | 73.2 | Embed 4 71.1 ; Voyage Multimodal 3.5 70.1 ; Gemini Embedding 2 56.7 |
| 유럽 5개 언어 (nDCG@10 또는 RCP-nDCG@10) | 77 | — | Voyage 4 Large 76 ; Gemini Embedding 2 73 |
이러한 점수의 대부분은 Cohere가 같은 날 발표한 평가 방법인 RCP-nDCG@10으로 표기됩니다(아래 참조). 블로그 글의 주석에 따르면 이는 고정된 후보군 세트를 재정렬하는 방식이므로 1단계 검색(retrieval)보다는 순위 지정(ranking) 품질을 측정합니다. 다국어 비교를 담은 두 번째 표도 꼼꼼히 살펴볼 가치가 있습니다. Cohere는 Embed 4 대비 향상된 성능(페르시아어에서 최대 13점)을 강조하지만, 제시된 10개 언어 중 중국어를 제외한 9개 언어에서 Gemini Embedding 2가 Embed 5 Pro를 앞섰으며, Voyage 4 Large는 5개 언어에서 앞섰습니다. Cohere는 10월 8일 X의 세션을 통해 Embed 5를 소개할 예정입니다.
🔗 Cohere의 Embed 5 블로그 글 · @cohere의 X 발표
RCP-nDCG@10: Cohere가 Embed 5를 측정하는 지표
9월 30일 — Cohere는 검색 평가 방법인 RCP-nDCG@10(Rubric-Calibrated Preferences nDCG@10)도 함께 발표했습니다. 출발점은 이렇습니다. MTEB 및 BEIR의 지표인 nDCG는 결과를 사전에 라벨링된 문서 목록과 비교하는데, 이 목록은 필연적으로 불완전하여 라벨링되지 않은 관련 문서는 점수를 전혀 얻지 못합니다. Cohere의 연구에 따르면 관련 없음으로 표시된 문서의 28%가 실제 인간에 의해 유용한 것으로 평가되었습니다. RCP-nDCG@10은 평가를 보정된 AI 판사에게 맡겨, 각 쿼리에 대해 동일한 5가지 예/아니오 질문에 답하고 문서를 그룹별로 비교하도록 합니다. 289건의 맞대결에 대해 46명의 평가자를 대상으로 한 블라인드 검증 결과, 두 지표가 서로 다른 승자를 지목했을 때 인간은 70%의 경우에서 RCP-nDCG의 손을 들어주었습니다. 논문, 코드, 데이터가 공개되었으며 MTEB의 수석 관리자는 이를 통합할 것이라 발표했습니다. Cohere는 아직 출시일이 정해지지 않은 Rerank를 포함한 5세대 Embed 및 Rerank를 이 지표에 맞춰 최적화했다고 밝혔으며, 이들 모델이 기존 nDCG 기준으로는 항상 최고로 보이지는 않을 수 있다고 덧붙였습니다.
🔗 Cohere의 RCP-nDCG@10 블로그 글 · GitHub의 코드 및 데이터
Perplexity, pplx-embed-v2-context-9b-preview 및 context-bench 벤치마크 공개
9월 30일 — Perplexity가 Hugging Face에 MIT 라이선스로 문맥 임베딩 모델인 pplx-embed-v2-context-9b-preview를 프리뷰 형태로 공개했습니다. 문서의 각 조각은 전체 문서를 시야에 둔 상태에서 인코딩되므로, “그녀”라고 지칭하는 구절도 올바른 엔티티에 계속 연결됩니다. 모델은 쿼리당 단 하나의 정답 구절(gold passage)만을 사용하는 대신, 문서의 각 토큰에 점수를 매기는 Perplexity의 문맥 압축 모델인 교사 모델로부터 학습합니다. 이를 통해 답변과 이를 뒷받침하는 근거 구절을 모두 찾아내는 법을 배웁니다. 블로그 글의 공동 작성자인 turbopuffer의 비공개 벤치마크인 context-bench(2,099개 쿼리, 38,894개 문서)를 대상으로 한 블라인드 평가에서 voyage-context-4를 앞섰으며, ConTEB에서는 모든 과제에서 1위를 차지하지는 못했으나 가장 높은 평균 점수를 기록했습니다. Perplexity는 가중치와 인터페이스가 여전히 변경될 수 있다고 안내했으며, 출시일은 미정이지만 API를 통한 접근을 준비 중입니다.
| Perplexity가 발표한 측정 지표 | pplx-embed-v2-context-9b-preview | voyage-context-4와의 차이 |
|---|---|---|
| context-bench 답변 재현율, K = 10 | 45.5% | +14.4점 |
| context-bench 근거 재현율, K = 10 | 40.6% | +5.0점 |
| 벡터당 스토리지 (1,024차원, int8) | 1KB | float32 형식의 voyage-context-4 대비 8배 작음 |
🔗 Perplexity Research 블로그 글 · Hugging Face의 모델
Ideogram 4.5: 연속적인 수정을 염두에 두고 설계된 이미지 편집 모델
9월 30일 — Ideogram이 “가장 정밀한 편집 모델”이라 소개하며 Ideogram 4.5를 출시했습니다. 개발 배경은 다음과 같습니다. 이미지 모델은 수정을 거칠 때마다 아티팩트, 픽셀 왜곡, 색상 변화를 추가하므로, 여러 번 수정을 거치면 이미지를 금방 사용할 수 없게 됩니다. Ideogram 4.5는 이러한 현상의 누적을 제거하고 다회차 편집(multi-turn editing)을 가능하게 하도록 설계되었습니다.
Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.
🇰🇷 가장 정밀한 편집 모델인 Ideogram 4.5를 소개합니다. 편집을 거칠 때마다 최첨단 모델들은 아티팩트, 픽셀 왜곡, 색상 변화를 누적시킵니다. Ideogram 4.5는 아티팩트 축적을 제거하여 멀티턴(multi-turn) 편집을 가능하게 합니다. Ideogram, API 및 출시 파트너를 통해 이용할 수 있습니다. 가중치는 곧 공개됩니다. — X의 @ideogram_ai
이 점을 뒷받침하기 위해 Ideogram은 GPT Image 2.5 Sunburst, Nano Banana Pro, Nano Banana 2와 동일한 연속 수정을 수행한 결과를 나란히 비교해 공개했으며, 경쟁 모델들의 결과물은 몇 번의 수정만으로 사용할 수 없게 된다고 주장했습니다. 비교는 수치 점수 없이 시각적으로 이루어졌습니다. 예시로는 색상 및 조명(컴포지션을 해치지 않으면서 그림자, 반사 및 하이라이트가 변경 사항을 따라감), 텍스트 수정, 제품 사진, 인테리어 디자인, 단계별 오래된 사진 복원, 스케치나 깊이 맵에서 이미지로의 변환, 크롭 등이 포함되었습니다.
이 모델은 또한 모든 해상도에서의 편집(Zoom editing) 기능을 도입했습니다. Ideogram의 예시에서 24.2메가픽셀(4,016 × 6,016픽셀)에 달하는 고해상도 이미지의 특정 영역을 이미지 축소 없이 수정할 수 있으며, 가장자리가 보존되어 눈에 띄는 이음매 없이 다시 합성할 수 있습니다. Ideogram에 따르면 타깃 편집에 맞춰 설계되었지만 일반적인 편집 작업에서도 매우 뛰어난 성능을 발휘합니다.
| 발표 내용 | 알려진 내용 |
|---|---|
| 이용 가능 여부 | 9월 30일부터 Ideogram 및 API에서 즉시 이용 가능 |
| 출시 파트너 | 당일 발표를 진행한 Pika 및 Luma |
| 공개 가중치 | 지난 6월 공개된 Ideogram 4.0과 마찬가지로 “곧” 제공 예정 |
| 가격 | 미공개 |
HeyGen Video: MiniMax H3 기반으로 구축되어 API로 제공되는 비디오 모델
9월 30일 — HeyGen이 막대한 비용을 들이지 않고 프로덕션 품질의 비디오를 원하는 기업을 겨냥한 비디오 생성 모델인 HeyGen Video를 출시했습니다. MiniMax H3를 기반으로 구축되고 HeyGen이 사후 학습을 진행한 이 모델은 텍스트나 이미지로부터 비디오를 생성하며, 동일한 호출 내에서 오디오도 함께 생성됩니다. HeyGen API는 물론 OpenRouter, Runware, ComfyUI에서도 사용할 수 있습니다.
가격 측면에서는 세 가지 수치가 공존합니다. 카탈로그 페이지에 따르면 10월 말까지 초당 0.01달러부터 시작하여 표준 요금인 0.02달러 대비 50% 할인 혜택이 적용됩니다. 반면 비교표에는 출시 프로모션 적용 전, 오디오를 포함한 768p 기준 정가인 초당 0.03달러가 기재되어 있습니다. 이 가격을 기준으로 하더라도 HeyGen Video는 비교 대상 모델 중 가장 저렴합니다.
| 비교 모델 | 초당 정가 (768p, 오디오) | HeyGen 내부 Elo (HeyGen Video = 1,000) |
|---|---|---|
| HeyGen Video | 0.03달러 | 1,000 |
| Seedance 2.0 | 0.303달러 | 955 |
| H3 Max | 0.08달러 | 952 |
| H3 Max Turbo | 0.04달러 | 920 |
| H3 Max balanced | 0.08달러 | 860 |
| Kling 3.0 Pro | 0.168달러 | 857 |
| Veo 3.1 | 0.40달러 | 744 |
품질 면에서 HeyGen은 Artificial Analysis Arena 쿼리를 기반으로 한 내부 평가(4,800표)를 바탕으로 자사 모델의 Elo를 1,000으로 환산해 비교했습니다. H3 Max와의 블라인드 선호도 평가에서 650표 중 55.8%가 HeyGen Video를 선택했으며, 오차 범위는 49~62%로 동률일 가능성도 배제할 수 없습니다. 10초 분량의 이미지 투 비디오 클립 생성 시 확산 트랜스포머(diffusion transformer)의 추론 시간은 캡셔닝 시간을 제외하고 3.7초로 떨어져, H3 Max Turbo의 4.1초 및 H3 Max의 8.3초와 대비됩니다.
MiniMax는 이번 출시를 환영하며, 같은 날 H3에서 파생된 또 다른 모델인 Creatify의 광고 최적화 비디오 모델 Boreal-H3를 소개했습니다.
🔗 HeyGen Video 카탈로그 · @HeyGen의 X 발표
범용 어시스턴트 및 에이전트: Gemini의 skills, Manus Flex 및 Grok Bot
Gemini 앱, Gems를 대체할 skills 출시
9월 30일 — Google이 Gemini 앱에 skills를 도입합니다. 한 번 저장해 둔 뒤 슬래시(/)와 skill 이름을 입력하여 호출하는 지침입니다. Gemini는 대화로부터 skills를 직접 생성할 수도 있고, 프롬프트가 일치할 때 스스로 실행할 수도 있으며, 여러 skills를 조합할 수도 있고 각 skill에 참조 파일(일반 텍스트, PDF, 이미지)을 포함할 수도 있습니다. Gemini Spark에 이미 도입되었던 이 기능은 이제 전 세계 Gemini 채팅에 적용되며, 모든 등급의 Google AI 구독자 및 현재 기준 만 18세 이상 사용자에게 제공됩니다. Workspace 고객에게는 향후 몇 주 내에 순차적으로 적용될 예정입니다. skills는 Gems를 대체하게 되며, 개인 계정은 11월부터, Workspace 비즈니스, 엔터프라이즈 및 비영리 계정은 2027년 3월부터, 교육 계정은 2027년 6월부터 자동 마이그레이션과 함께 Gems가 사라지게 됩니다. 미니 애플리케이션 제작 도구인 Opal도 마이그레이션되지 않는 “Gems by Google Labs”와 함께 11월에 서비스가 종료됩니다.
🔗 Gemini의 skills로 가장 반복적인 작업 해결하기 (Google 블로그)
Manus Flex: Manus 에이전트에서 자체 API 키 사용
9월 29일 — Manus가 지원되는 추론 제공업체의 API 키를 Manus에 직접 연결해 사용할 수 있는(bring your own API key) Manus Flex를 출시했습니다. 지금까지 Manus는 모델을 자체적으로 선택하고 에이전트 하네스 및 인프라를 제공해 왔습니다. 이제 Flex를 통해 특정 제공업체의 키로 동일한 프로젝트, 도구, 런타임 환경, 에이전트 워크플로를 구동할 수 있으며, 기본 모델과 추론 노력(reasoning effort) 수준도 직접 선택할 수 있습니다. 결제는 분할 청구됩니다. 추론 비용은 제공업체가 직접 청구하는 반면, 작업에 사용되는 기타 서비스 및 인프라는 기존처럼 Manus 크레딧을 차감합니다. OpenRouter, Fireworks, Modal이 추론 파트너 프로그램(Manus Flex Inference Partner Program)의 초기 파트너 3사로 참여합니다. Manus 2.0 출시 다음 날 게시된 이 글에는 요금제, 가격, 모델 목록은 명시되지 않았습니다.
Grok Bot, Cursor에 코드 작업을 맡기고 풀 리퀘스트를 관리
9월 30일 — Team Bots 발표 이틀 후, SpaceXAI가 소프트웨어 개발을 위해 Grok Bot을 강화했습니다. @bot 계정의 스레드에서 개발사는 자사의 Bot들이 코드 작업을 Cursor에 위임하고, GitHub 및 Origin(자세한 설명은 없음) 플러그인을 통해 풀 리퀘스트를 관리하며, 자신이 빌드한 작업물의 비디오 데모를 공유할 수 있다고 발표했습니다. SpaceXAI는 또한 자체 엔지니어링 팀의 Bot들을 설치 가능한 템플릿(templates) 형태로 배포하며, 각 템플릿에는 고유한 skills, 루틴 및 커넥터가 포함되어 있습니다. 해당 스레드에는 요금제, 가격, 출시일이 구체적으로 명시되지 않았으며, x.ai에도 관련 블로그 글은 게시되지 않았습니다. Cursor와의 연계는 완전히 새로운 것은 아닙니다. 9월 초 Grok 및 Cursor Enterprise 고객을 대상으로 2주간 Grok Bot for Enterprise가 무료로 제공된 바 있습니다. 달라진 점은 이제 Bot이 코드 작업을 스스로 위임한다는 것입니다.
로보틱스 및 월드 모델: Runway의 Praxis-1, Ai2의 MolmoAct 2 및 NVIDIA의 Physis-Lang
Runway, 오픈 가중치 월드 액션 모델 Praxis-1 공개
9월 30일 — Runway가 실제 로봇 제어를 목표로 하는 첫 오픈 가중치 월드 액션 모델(world action model)인 Praxis-1을 공개했습니다. 이 모델은 Solaris나 GWM Worlds 2와 같은 자사 월드 모델과 동일한 비디오 사전 학습을 기반으로 하며, 로봇 공학 개발자와 연구자를 위한 범용 정책 모델을 지향합니다. Runway의 접근법은 로봇 시연 데이터는 희소하지만 비디오는 사실상 무제한이라는 점에 착안합니다. 시연 영상에서 동일한 정책이 재학습 없이도 스튜디오에서 주방으로 전환됩니다. 아직 다운로드할 수 있는 파일은 없으며, Praxis-1은 현재 Noble Machines, Standard Bots, Ultra에서 각각 자체 하드웨어를 통해 테스트 중이고, 가중치를 포함한 대중 공개는 향후 수개월 내로 예정되어 있습니다.
| Runway가 발표한 지표 | 발표된 결과 |
|---|---|
| 월드 모델 시뮬레이션과 실제 결과 간 상관관계 | 0,95 |
| 웹 비디오를 활용한 조정 후 최종 배치 오차 | 16,1 cm |
| 원격 조종 로봇 비디오를 활용했을 때의 동일 오차 | 16,0 cm |
Ai2의 MolmoAct 2, 주최 측의 파인튜닝 후 Reality Check에서 1위 기록
9월 30일 — Ai2는 자사의 완전 공개형 로봇 공학 모델인 MolmoAct 2가 실제 환경 조작 독립 벤치마크인 Reality Check에서 종합 성공률 1위를 차지했다고 발표했습니다. 다만 주최 측인 Poke & Wiggle이 벤치마크 작업에 맞춰 모델들을 직접 파인튜닝했다는 점을 감안할 필요가 있습니다. 전날 해당 기업이 발표한 Reality Check는 뮌헨의 도이체스 박물관(Deutsches Museum)에 설치된 FR3 Duo 스테이션에서 실제 로봇으로 10가지 환경(나사 분류하기, DC 커넥터 연결하기, 드라이버로 공구함 열기 등)에 걸쳐 14,400회의 실행을 진행했습니다. 학습 영역 밖에 배치된 물체와 스테이션 데이터 100시간을 활용한 중간 학습이라는 두 가지 축은 아직 “예정” 상태로 남아 있습니다.
| 평가 모델 | 종합 성공률 | 환경당 약 10회 시연 후 성공률 | 환경당 약 300회 시연 후 성공률 |
|---|---|---|---|
| MolmoAct 2 | 28 % | 4 % | 44 % |
| Pi 0.5 | 21 % | 5 % | 33 % |
| DiT-Flow | 19 % | 2 % | 29 % |
| GR00T N1.7 | 12 % | 4 % | 19 % |
Physis-Lang: 월드 모델에 물리학을 설명하는 캡션
9월 29일 — NVIDIA, MIT, 옥스퍼드 대학교 연구진이 월드 모델을 개선하기 위해 비디오 캡션에 물리적 추론을 추가하는 프레임워크인 Physis-Lang을 발표했습니다. 캡션은 원인, 작용하는 법칙, 결과를 명시적으로 설명합니다. 전담 비평가가 누락되거나 근거가 부족한 주장을 찾아내고, 에이전트가 캡셔닝 프롬프트를 미세 조정하며, 모델의 실패 사례는 취약점을 보완할 비디오를 검색하는 데 사용됩니다. NVIDIA에 따르면 재학습 없이 프롬프트에 이러한 추론을 추가하는 것만으로도 Cosmos 3의 PhyGenBench 점수가 5.62점 향상되었습니다. 추가 학습을 거친 Cosmos3-Super 및 Cosmos3-Nano 기반 Physis-Lang은 이미지-투-비디오 Physics-IQ Verified 순위에서 나란히 1, 2위를 차지했습니다(기존 최고 점수 42.7점 대비 각각 48.2점, 43.3점). PhyGenBench와 VideoPhy-2는 GPT-5.5로 채점되었으며, VideoPhy-2 전체 데이터셋에서는 Veo 3.1이 여전히 근소한 우위를 유지하고 있습니다.
| 비디오 물리 벤치마크 | Cosmos3-Nano | Veo 3.1 | Cosmos3-Nano 기반 Physis-Lang |
|---|---|---|---|
| PhyGenBench | 61,67 | 65,63 | 71,04 |
| Physics-IQ Verified | 40,23 | 34,99 | 43,41 |
| VideoPhy-2 Hard | 48,31 | 58,43 | 62,36 |
| VideoPhy-2 전체 데이터셋 | 60,41 | 68,87 | 68,02 |
🔗 Physis-Lang 프로젝트 페이지 · @NVIDIAAI의 X 공지
오픈 모델: Hunmin-397B-A17B-CUA 및 JEV-27B-VL
Hunmin-397B-A17B-CUA, 3,970억 파라미터 MoE에 Qwen-CUA의 에이전트 능력 이식
9월 30일 — Hugging Face 커뮤니티 블로그에서 이호준(hojun Lee) 연구원이 mncai 조직이 Apache-2.0 라이선스로 공개한 컴퓨터 사용(computer use) 모델인 Hunmin-397B-A17B-CUA를 상세히 소개했습니다. 다만 저자 스스로 밝힌 한계점도 있습니다. 평가는 자체적으로 수행되었고 에이전트 벤치마크는 단 1회만 실행되어 공식 발표된 순위와 직접 비교할 수 없다는 점입니다(베이스 모델의 OSWorld 점수는 48.16점으로, OSWorld-Verified에 발표된 62.2점과 차이가 있습니다). 이 모델은 170억 개의 활성 파라미터를 갖춘 전문가 혼합(MoE) 모델인 Qwen3.5-397B-A17B를 기반으로 하며, 전체 프로젝트는 B200 8장으로 구성된 단일 노드에서 진행되었습니다. 연구팀은 베이스 모델과 이미 특화된 Qwen-CUA 간의 가중치 차이를 계산한 뒤, 선별된 모듈에 저차원 버전만 이식했습니다. 이 전이만으로도 Qwen-CUA의 시각적 그라운딩 약점을 답습하지 않으면서 OSWorld-316 점수를 48.84점에서 68.25점으로 끌어올렸습니다. 이후 파인튜닝과 GRPO 강화 학습을 거쳐 4.3점이 추가로 향상되었습니다.
| 평가 벤치마크 (자체 프로토콜) | Qwen3.5-397B 베이스 | Hunmin-CUA | Qwen-CUA (원본) |
|---|---|---|---|
| OSWorld, 360개 작업 | 48,16 | 70,45 | 77,12 |
| WindowsAgentArena, 153개 작업 | 41,77 | 50,85 | 56,68 |
| ScreenSpot-Pro | 72,74 | 75,61 | 62,20 |
| KMMLU-Pro (한국어) | 77,91 | 76,12 | 71,41 |
🔗 Hunmin-CUA 블로그 게시글 · Hugging Face 가중치
AutoTrust AI, 이미지까지 판단하는 오픈 의사결정 모델 JEV-27B-VL 공개
9월 30일 — AutoTrust AI가 9월 27일에 선보였던 오픈 의사결정 모델 JEV-27B의 비전 탑재 버전인 JEV-27B-VL을 Apache-2.0 라이선스로 공개했습니다. 이미지와 텍스트를 제공하고 질문을 던지면, 약 100밀리초 만에 단 한 번의 패스로 각 선택지에 보정된 확률을 부여해 답변합니다. 질문에서 요구할 때는 이미지를 살펴보며 단계별로 추론하기도 합니다. 그러나 이 모델의 의사결정 헤드는 학습 도중 이미지를 전혀 보지 않았습니다. 주요 테스트로, 공개 숏폼 비디오 애플리케이션 데이터셋인 MicroLens에서 썸네일만으로 200명의 사용자를 위해 20개의 후보 비디오 순위를 매긴 결과, 59,045명의 사용자로 학습된 협업 필터링과 대등한 AUC를 기록했으며 Top-5 적합 비디오 비율에서는 더 높은 성과를 보였습니다. 저자들은 이 결과가 200명의 사용자 단일 데이터셋에서 도출된 것임을 상기시켰습니다.
| MicroLens 추천 방식 | AUC | Top-5 적합 비디오 비율 |
|---|---|---|
| JEV-27B-VL, 상호작용 데이터 없이 썸네일만 활용 | 0,727 | 59 % |
| 59,045명 사용자로 학습된 협업 필터링 | 0,728 | 49 % |
| JEV-27B-VL, 제목만 활용 | 0,649 | 46 % |
| 무작위 순서 | 0,489 | 21 % |
리더보드: Hugging Face의 Open TTS Leaderboard 및 LILT의 AURORA
Hugging Face, 오픈 음성 합성 순위표인 Open TTS Leaderboard 출시
9월 30일 — Hugging Face가 오픈 및 다국어 모델에 중점을 둔 음성 합성(text-to-speech, TTS) 순위표인 Open TTS Leaderboard를 출시했습니다. Hub에는 8,000개가 넘는 TTS 모델이 등록되어 있지만, 표준적인 투표 기반 아레나는 속도를 따라가지 못하고 오픈 모델을 과소 대표하고 있습니다. 블로그 글에 따르면 Artificial Analysis가 순위를 매긴 92개 모델 중 오픈 가중치 모델은 16개에 불과했습니다. 따라서 이 순위표는 투표 대신 객관적인 지표를 도입했습니다. 명료도(요청된 텍스트와 Qwen3 ASR 전사 결과 간의 단어 또는 문자 오류율), 속도(H200 및 CPU에서의 배치 추론 및 첫 오디오 출력까지의 지연 시간), 음성 복제 충실도(WavLM 유사도)입니다. 모델 평가는 수 주간의 투표 대신 몇 시간 만에 완료됩니다. 영어 부문에서는 Kokoro-82M, supertonic-3, Fish Audio의 s2-pro가 선두를 달리고 있으며, 다국어 부문에서는 OmniVoice, s2-pro, Fun-CosyVoice3-0.5B가 앞서고 있습니다. 저자들은 자연스러움이나 표현력은 측정되지 않았다고 밝히며, 평가 스크립트를 “곧” 공개할 예정이라고 전했습니다.
🔗 Open TTS Leaderboard 블로그 게시글 · Hugging Face 리더보드
LILT, 다국어 에이전트 작업 리더보드 AURORA 출시
9월 30일 — LILT가 기계 번역 없이 원어민 전문가가 직접 설계하고 검증한 비영어권 에이전트 작업에서 최첨단 모델을 측정하는 순위표인 AURORA를 출시했습니다. 초기에는 네 가지 벤치마크로 시작합니다. 10개 언어로 구성된 324개 코드 작업의 다국어 Terminal-Bench, 고객 지원을 위한 다국어 버전 τ³-bench, 롱 컨텍스트 지시 준수를 위한 MultiChallenge, 에이전트 추론을 위한 GAIA-v2-LILT입니다. Claude Opus 5.5는 다국어 Terminal-Bench에서 선두를 차지했으며, 5개 언어 각각의 τ³-bench에서도 1위를 기록했습니다. GAIA의 경우 모델들은 기계 번역 버전에 비해 LILT가 감수한 버전에서 평균 20.7점 높은 점수를 얻었으며, LILT는 이 격차가 번역으로 인해 발생한 오류의 크기를 보여준다고 설명했습니다. 동일한 대화라 하더라도 한국어나 아랍어는 영어보다 약 1.4배 더 많은 토큰을 소비합니다.
| 평가 모델 (다국어 Terminal-Bench 발췌) | 평균 성공률 |
|---|---|
| Claude Opus 5.5 (effort high) | 76,4 % |
| Claude Opus 5 (effort high) | 73,5 % |
| Gemini 3.8 Flash | 67,3 % |
| GPT-6 Sol | 64,8 % |
| Command A+ | 4,3 % |
🔗 LILT의 AURORA 블로그 게시글 · AURORA 리더보드
공공 부문 및 엔터프라이즈: Claude for Government, Anthropic의 구매 에이전트, OpenAI와 America’s SBDC
Claude for Government, 정식 출시(GA)로 전환
9월 30일 — Claude for Government가 베타를 마쳤습니다. Anthropic은 미국 연방 기관 및 주 정부 기관을 대상으로 정식 출시(General Availability)한다고 발표했습니다. 지난 7월부터 퍼블릭 베타로 운영된 이 플랫폼은 FedRAMP High 인증 환경에서 상용 고객과 동등한 기능으로 Claude의 코드 및 에이전트 작업 역량을 제공하며, Claude Code CLI와 Claude for Microsoft 365가 얼리 액세스로 도입됩니다. 좌석당 라이선스는 없으며, 기관은 정액제 구간에 따라 사용량을 지불하고 고정 한도를 두어 약정 예산 초과를 방지합니다. 또한 SCIM 그룹 매핑을 통해 좌석 계층별로 처리율 제한, 금액 한도 및 허용 모델을 지정합니다. 제어 측면에서는 Anthropic 내부의 민감한 작업에 2인 승인 절차가 요구되며, 사용량 내보내기에는 측정 데이터만 포함되고 대화 내역은 기관이 관리하는 기기에 유지됩니다. Anthropic은 가격 정보를 공개하지 않았습니다.
🔗 Claude for Government 정식 출시 공지
Anthropic, Managed Agents 기반 에이전트로 인바운드 영업 문의 대응
9월 30일 — Anthropic은 자사 영업팀이 베타 상태인 Claude Managed Agents를 기반으로 구축한 구매 에이전트를 통해 월 수만 건에 달하는 인바운드 문의 접수 체계를 어떻게 개편했는지 소개했습니다. Contact Sales 및 Pricing 페이지, claude.ai 내부, 이메일에 배치된 이 에이전트는 몇 가지 질문을 던지고 요금제와 좌석 수를 추천한 뒤, 구매로 유도하거나 전체 대화 내역과 함께 영업 담당자에게 인계하거나 단순히 문의에 답변합니다. 고객은 처음부터 인간 상담원을 선택할 수도 있습니다. 칼 존슨(Carl Johnson)이 작성한 글에 따르면, 이 에이전트는 하루 수천 건의 대화를 처리합니다. 에이전트가 인계한 리드는 기존 양식에 비해 영업 기회로 전환되는 비율이 2배 이상 높고 계약 성사 기간도 약 5일 단축되었으며, 계약을 마무리하기 위해 영업 담당자가 개입해야 하는 대화의 비중은 약 절반으로 줄었습니다. 단 한 명의 엔지니어가 몇 주 만에 첫 버전을 구축했으며, 에이전트는 소규모 팀에 Enterprise 대신 Team 요금제를 추천하는 경우가 많은데 Anthropic은 이를 기꺼이 수용하기로 결정했습니다.
🔗 Anthropic 영업팀이 Claude Managed Agents로 인바운드를 재구축한 방법
OpenAI, America’s SBDC와 파트너십 체결 및 중소기업 보고서 발표
9월 30일 — OpenAI가 연간 100만 명의 기업가를 지원하는 미국 중소기업 개발 센터 전국 네트워크인 America’s SBDC와 파트너십을 맺었습니다. 첫 번째 단계로, 9월 23일 파일럿으로 시작된 OpenAI Academy의 커뮤니티 트레이너 프로그램(Community Trainer Program)을 통해 약 150명의 상담사를 교육할 계획입니다. 이들은 SBDC 네트워크에서 3시간짜리 워크숍을 진행하며 대면으로 최소 1,000개의 중소기업에 다가가는 것을 목표로 합니다. 같은 날 발표된 ‘Small Businesses, Bigger Capabilities’ 보고서는 활용 수치를 제시했습니다. 9월 9일부터 15일까지 일주일 동안 500인 미만 기업의 직원 약 400만 명이 OpenAI 제품을 사용했으며, 이 중 약 5명 중 1명은 10인 미만 기업에 종사하고 있었습니다. 8월 기준 특히 ChatGPT Work와 Codex 등의 에이전트 출력 토큰은 중소기업 전체 출력 토큰의 3분의 2를 차지했는데, 이는 4월의 3분의 1에서 크게 증가한 수치입니다.
Runway Ads: 성과형 광고를 위한 자율 엔진
9월 30일 — Runway가 유료 캠페인의 크리에이티브 부문을 엔드투엔드로 전담하는 Runway Ads를 출시했습니다. 광고 계정과 브랜드 키트를 연결하면, Runway Agent 기반으로 구축된 이 툴이 동영상 및 이미지 소재를 생성하고 승인된 베리에이션을 Meta, Google, TikTok에 게시하며, 성과를 검토하고 비용 지출을 유도한 요소를 중심으로 다음 소재들을 제작합니다. 또한 팀이 설정한 규칙에 따라 화면 텍스트를 포함한 각 소재를 현지화하고, 각 형식에 맞게 크기를 조정하며, 자동 브랜드 검수를 거치고 예산 한도를 준수합니다. 사람의 승인이 기본적으로 활성화되어 있으며, 캠페인별 또는 베리에이션 유형별로 자동 게시를 설정할 수 있습니다.
| 7월 이후 Runway 내부 지표 | 블로그 게시물에 공개된 결과 |
|---|---|
| 주당 광고 수 | 77건에서 약 900건으로 증가 |
| 광고비 대비 수익률(ROAS) | 2배 증가 |
| 전환율 | 약 +34%, 클릭률 유지 |
| 구독자당 비용 | −41% |
Runway Ads는 현재 선별된 엔터프라이즈 파트너를 대상으로 파일럿 운영 중입니다. 발표 트윗에서는 향후 몇 주 내 광범위한 배포를 약속했으며, 이 툴을 통해 7월 이후 1억 달러의 ARR(연간 반복 매출)을 추가로 확보했다고 주장했으나, 이 수치는 블로그 본문에는 명시되지 않았습니다.
🔗 Runway Ads 게시물 · @runwayml의 트윗
ElevenLabs, 3억 달러 규모의 주식 공개매수 후 220억 달러의 기업 가치 평가 받아
9월 30일 — ElevenLabs가 직원들을 대상으로 한 3억 달러 규모의 주식 공개매수(tender offer)를 마무리하며 기업 가치 220억 달러를 인정받았습니다. 이는 2월 시리즈 D 당시 가치 평가액의 두 배에 달하는 수치입니다. 이번 거래는 Wellington과 T. Rowe Price가 주도했으며, EQT, Goldman Sachs, GIC, OTPP, Sapphire Ventures, BDT & MSD가 신규 투자자로 참여했고, Andreessen Horowitz, Lightspeed, ICONIQ 등 기존 투자자들도 함께했습니다. 기업 고객은 매출의 55%를 차지하고 있습니다. ElevenAgents는 매주 1,500만 건 이상의 대화를 처리하고 있어 2월 대비 3배 증가했으며, 연간 반복 매출(ARR)도 해당 기간 동안 3배 이상 증가했습니다. 고객 분석에 따르면 음성 에이전트는 챗 에이전트보다 문의를 31% 더 빠르게 해결합니다. 이 회사는 900만 달러의 가치 평가를 받았던 초기 라운드 이후 4년 만에 800명 이상의 직원을 보유하게 되었습니다.
Vera Rubin NVL72, CoreWeave에서 프로덕션 단계 진입… Cognition은 최대 4.8배 높은 처리량 측정
9월 30일 — 샌프란시스코에서 열린 CoreWeave Fully Connected 행사에서 NVIDIA는 CoreWeave에서 Vera Rubin NVL72의 프로덕션 도입 세부 사항을 발표했습니다. Spectrum-X Ethernet 102.4T 네트워킹을 갖춘 이 플랫폼은 이번 달 초 첫 프로덕션 랙을 도입한 CoreWeave Cloud에서 제공됩니다. Devin의 개발사인 Cognition은 이곳에서 프로덕션 워크로드를 실행하는 최초의 고객으로, FrontierCode의 작업들을 활용한 초기 테스트에서 GB200 NVL72 대비 SWE-2 추론 시 최대 4.8배 더 높은 총 토큰 처리량을 측정했습니다. CoreWeave는 에이전트용으로 설계된 Vera CPU도 제공할 예정입니다. 랙당 128개의 CPU와 11,264개의 코어를 갖추어 11,000개 이상의 격리된 환경을 동시에 실행할 수 있으며, 에이전트 샌드박스 시작 속도는 3배 이상 빠릅니다. 아울러 CoreWeave는 프로덕션에서 학습으로의 피드백 루프를 위해 Weights & Biases, OpenPipe, marimo를 결합한 CoreWeave Forge를 출시했으며, 서버리스 강화 학습(serverless RL)은 1.4배 더 빠르고 비용은 40% 절감된다고 발표했습니다.
🔗 CoreWeave 및 Vera Rubin 관련 NVIDIA 게시물
코딩 에이전트 및 개발 도구: Claude Code 2.1.286, Zed 1.22.0, Gemini CLI, VS Code 1.140, HydraFusion 및 gcloud용 MCP 서버
Claude Code 2.1.286: VS Code 북마크, 재시도 상한 설정 및 bare 모드 강화
9월 30일 — 19시 10분(UTC)에 출시된 Claude Code 2.1.286은 49건의 버그 수정을 포함해 총 88건의 변경 사항을 담고 있습니다. 권한 프롬프트는 여러 요청이 쌓일 때 해당 위치(“2 of 5”)를 표시하며, VS Code 확장 프로그램에는 Claude의 응답을 사이드 패널에 보관할 수 있는 북마크(bookmarks), Claude가 물어본 질문과 선택된 답변을 보여주는 Questions 행, 그리고 질문 카드 내의 옵션 미리보기가 추가되었습니다. 두 가지 주요 동작 변경 사항도 있습니다. 이제 단일 한도가 모델 호출 재시도에 적용되어 기본 설정 기준 최대 14회 요청으로 제한되며, --bare 모드는 시스템 알림이나 백그라운드 작업 없이 커맨드라인에 지정된 MCP 서버에만 연결합니다. verify라는 이름의 스킬이 존재할 경우, Claude는 문서나 테스트를 제외하고 매 커밋 직전에 이를 실행하도록 안내받으며, 플러그인은 git 저장소나 폴더인 npm 소스를 거부합니다. 마지막으로, API가 기본 모델을 거부할 경우 Claude Code는 매 턴마다 실패하는 대신 동일 계열의 이전 모델로 한 번 재시도합니다.
Zed 1.22.0: 서브에이전트별 모델 지정
9월 30일 — Zed가 서브에이전트에 중점을 둔 1.22.0 안정화 버전을 출시했습니다. spawn_agent 도구에 선택적 매개변수인 model가 추가되어 부모로부터 상속받거나 설정된 모델과 다른 모델로 서브에이전트를 실행할 수 있으며, 각 서브에이전트 카드에는 사용된 모델이 표시됩니다. 또한 서브에이전트는 컨텍스트를 자동으로 압축하여 Zed에 따르면 더 긴 작업을 수행할 수 있습니다. 모델 측면에서는 OpenAI API 키를 사용하는 BYOK 방식으로 GPT-6.1 Sol이 도입되었고, Grok 4.7이 SuperGrok 및 xAI 추천 모델로서 안정화 단계에 진입했으며, OpenCode Zen 및 Go 모델 목록을 실시간으로 가져옵니다. 이번 버전은 터미널에서 완료된 명령당 약 2MB의 메모리 누수가 발생하던 문제를 해결했고, 활성 독(dock)을 닫는 단축키가 모든 플랫폼에서 ctrl-alt-w로 변경되었습니다. 총 18개의 신규 기능과 37개의 버그 수정이 포함되었습니다.
Gemini CLI: v0.62.0 안정화 버전 출시, 및 확인 없이 계획을 실행하는 프리뷰 버전
9월 29일 — Gemini CLI가 저녁(UTC)에 두 가지 버전을 출시했습니다. v0.62.0은 21시 17분에 안정화 버전으로 전환되었으며, 19개 항목은 9월 16일부터 24일까지 발표된 프리뷰 및 나이틀리 버전의 내용(MCP 도구 호출의 구조화된 제목, OAuth 리프레시 토큰(refresh token) 보존, Gemini 3.8 Flash 및 3.5 Flash Lite)을 반영합니다. 새로운 기능은 20시 58분에 출시된 프리뷰 v0.63.0-preview.0에 포함되어 있습니다. 비대화형 모드에서 에이전트는 이제 확인을 기다리지 않고 계획을 작성하고 실행합니다(PR 29539). 이전에는 Plan Mode 지침으로 인해 도구 호출 없이 단순한 조율 메시지만 응답했습니다. 또한 0 이하의 maxChars 제한은 도구 출력 잘림을 비활성화합니다(PR 29542). 9월 30일 나이틀리 버전은 0.64.0 시리즈를 시작합니다. PR 29549에 따르면 Zed나 OpenHands 같은 클라이언트가 청구 금액을 약 3배 과대평가하던 문제와 달리, ACP 모드에서 CLI가 마침내 표준 사용량을 올바르게 보고합니다.
🔗 Gemini CLI v0.63.0-preview.0 · Gemini CLI v0.62.0
VS Code 1.140, Copilot 하네스 도입
9월 30일 — Visual Studio Code 1.140이 Copilot 하네스(Copilot harness)와 함께 안정화 버전으로 출시되었습니다. Copilot SDK를 기반으로 하는 이 기능은 VS Code의 에이전트에 GitHub Copilot 앱 및 Copilot CLI의 동작과 기능을 부여하며, Agent Host Protocol 기반의 전용 호스트 프로세스에서 실행되어 여러 창에서 동일한 세션에 참여할 수 있습니다. 릴리스 노트에서는 일부 사용자에게 이미 기본값으로 선택되어 있을 수 있다고 안내합니다. 실험적 기능으로, 멀티 폴더 세션을 통해 각 채팅에 고유한 폴더나 worktree를 부여하며, 에이전트는 시스템, 메모리, CPU 수 및 모델에 따라 선택된 원격 호스트로 세션을 위임할 수 있습니다. 기업을 위한 세 가지 제어 기능도 추가되었습니다. 채팅 내 관리자 요구 최소 버전 설명, 관리형 설정(autoTier)으로 고정되는 Auto 모드의 기본 수준, 그리고 기본적으로 비활성화되어 있는 Copilot의 OpenTelemetry 데이터에 사용자 신원 정보 추가 기능입니다.
HydraFusion, VS Code 및 GitHub Copilot 앱에 도입
9월 30일 — GitHub은 9월 4일 Copilot CLI에서 선보인 다중 모델 오케스트레이션인 HydraFusion을 VS Code(1.140 버전 이상 또는 Insiders) 및 GitHub Copilot 앱(여전히 연구 프리뷰 단계)으로 확장합니다. HydraFusion은 선택기에서 모델처럼 선택할 수 있지만 모델 자체는 아닙니다. 워크플로 선택을 최적화 문제로 처리하여 세 가지 패턴 중 하나를 채택합니다. Single 모드에서는 단일 모델이 작업을 해결하고, Cascade 모드에서는 효율적인 모델이 초안을 작성한 뒤 품질 검사를 통해 결과를 수락하거나 더 강력한 모델로 에스컬레이션하며, Critique 모드에서는 다른 모델 계열의 읽기 전용 비평 모델이 검토한 후 작성 모델이 한 번 수정합니다. Auto 모드가 요청당 하나의 모델을 선택하는 것과 달리, HydraFusion은 단일 턴 내에서 여러 모델을 조율합니다. Copilot Pro, Pro+, Business, Enterprise에서 이용 가능하며, Business 및 Enterprise에서는 관리자가 프리뷰를 활성화해야 합니다. GitHub은 새로운 수치를 공개하지 않았습니다.
🔗 VS Code 및 GitHub Copilot 앱의 HydraFusion
Google Cloud, gcloud 및 bq를 실행하는 원격 MCP 서버 프리뷰 공개
Google Cloud가 관리형 원격 MCP 서버 목록에 Google Cloud CLI remote MCP server를 퍼블릭 프리뷰로 추가했습니다. 이 서버는 gcloud 및 bq(BigQuery) 커맨드라인 도구의 수백 가지 명령을 run_gcloud_command 및 run_bq_command라는 두 개의 MCP 도구로 묶어 제공합니다. Google은 커맨드라인을 선택한 이유로 두 가지 근거를 제시했습니다. 첫째, 명령 하나가 API라면 직접 조율해야 했을 여러 단계의 작업을 캡슐화하며, 둘째, 모델들이 이러한 명령의 공개 문서를 바탕으로 광범위하게 사전 학습되었다는 점입니다. 원격 서버를 사용하면 에이전트 환경에 CLI를 설치할 필요가 없어 Gemini Enterprise와 같은 웹 호스팅 에이전트 플랫폼에서도 이러한 작업을 활용할 수 있습니다. 명령은 격리된 샌드박스 내에서 네트워크가 제한된 프록시 뒤에서 실행되며 앰비언트 자격 증명(ambient credentials) 없이 실행됩니다. 각 명령은 Agent Identity 또는 OAuth 2.0으로 인증된 호출자 ID의 IAM 권한으로 실행됩니다. Model Armor는 프롬프트와 응답을 필터링할 수 있으며, 각 호출은 감사 로그에 기록될 수 있습니다. 서버 자체에 대한 별도 요금은 청구되지 않으며, 생성된 리소스와 발생 가능한 데이터 전송에 대해서만 요금이 부과됩니다.
🔗 Google Cloud CLI 원격 MCP 서버로 에이전트 역량 강화하기(Google Cloud 블로그)
단신
- Codex CLI 0.159.2 — 9월 29일 23시 57분 UTC에 출시된 이번 버전에는 단 하나의 백포트 패치만 포함되어 있습니다. Windows 환경에서 Codex가 백그라운드 프로세스나 샌드박스 내 명령을 실행할 때 콘솔 창이 더 이상 깜빡이지 않습니다. 🔗 출처
- Amp의 Plaid — GPT-6 Astra를 사용하는 Amp의 모드에 OpenAI의 초고속 티어를 기반으로 한 Plaid가 도입되었습니다. 토큰당 비용은 6배 증가하지만 요청 속도는 최대 6배 빨라지며, Amp가 제공하는 추론에만 한정됩니다. 서브에이전트는 fast 또는 standard 속도를 유지하며, Amp는 별도의 가격을 공개하지 않았습니다. 🔗 출처
- Warp와 Factories as Code — Warp가 자사의 소프트웨어 팩토리 구성을 “에이전트를 위한 Terraform”이라고 소개했습니다. 단일 저장소에서 에이전트, 자동화, 접근 권한, 지표 측정을 정의합니다. factory.yaml 포맷은 8월 말에 도입되었으며, 대화형 가이드를 통해 AWS 또는 GCP에 대한 연합 액세스, 웹훅, Slack, Linear, Jira 연동 등을 상세히 설명합니다. 🔗 Warp 스레드 · 🔗 구성 가이드
- Crosby의 Devin 도입 — Cognition의 사례 연구에 따르면, 50명 이상의 변호사와 10여 명의 엔지니어로 구성된 뉴욕 로펌 Crosby가 Devin에 인시던트 1차 대응을 맡겼습니다. 하루 20~40건의 버그 및 알림을 검토하며 대부분 약 5분 내에 처리되어 Sentry 노이즈가 최소 50% 감소했습니다. 🔗 출처
- claude.dev — Anthropic이 claude.dev를 Claude 기반 개발자들을 위한 공식 허브로 발표했습니다. 심층 기술 분석, Claude Code 및 API 가이드, Agents, Engineering, Playbooks, Skills 섹션과 함께 이스터 에그로 숨겨진 Terminal 페이지가 포함되어 있습니다. 사이트의 일부 게시물은 이미 9월 22일부터 공유되고 있었습니다. 🔗 출처
- ChatGPT 사이트 수정 가능 — 9월 29일 릴리스 노트에 따르면, 게시된 사이트는 Edit site를 통해 수정할 수 있으며 Plus 및 Pro 플랜의 Automations에서 예약할 수 있습니다. Enterprise에서는 기본적으로 비활성화된 플러그인별 Allow use in Sites 설정을 통해 비공개 사이트가 연결된 애플리케이션을 활용할 수 있습니다. 🔗 ChatGPT 릴리스 노트 · 🔗 Enterprise 및 Edu 릴리스 노트
- Kimi Work 3.2.15 — 9월 30일 버전에서는 내장 브라우저 내 Notion 및 Feishu 문서의 인간-AI 공동 편집 기능이 추가되었고, 에이전트 실행 내역이 기본적으로 접히도록 변경되었으며, PPT 동시 편집 시 파일이 손상되던 문제가 해결되었습니다. 🔗 출처
- Cue의 금융 관리 — Manus 2.0과 함께 출시된 개인 에이전트 앱이 이제 Plaid를 통해 구독 및 지출 동향을 추적하고 은행 계좌를 오토파일럿으로 관리합니다. 지원 국가, 요금제, 이용 조건은 명시되지 않았습니다. 🔗 출처
- Genspark에 GPT-6.1 Sol 탑재 — Genspark가 출시 다음 날 AI Chat, Code Agent, Claw에 GPT-6.1 Sol을 도입했습니다. OpenAI의 설명(API 가격이 Astra의 5분의 1 수준이면서도 이에 준하는 지능 제공)을 인용했으며, 요금제나 크레딧 비용은 구체적으로 밝히지 않았습니다. 🔗 출처
- Qwen3.8-27B-pi — Thomas Kim이 Pi 하네스에 맞춰 파인튜닝된 Qwen3.8-27B를 Apache-2.0 라이선스로 공개하며 노력 수준의 효율을 재정립했습니다. Terminal-Bench 2.1에서 medium 수준이 기본 모델의 xhigh 수준과 동일한 성능(89개 작업 중 67개)을 내면서도 출력 토큰은 약 41% 절감했습니다. 🔗 출처
- Nebius의 Qwen3.8-27B 지원 — Qwen이 9월 28일 발표된 자사의 270억 파라미터 덴스 모델의 Nebius Token Factory 출시 소식을 공유했습니다. 코드, 연구, 에이전트 워크플로를 겨냥하며, 가격 및 처리량은 공개되지 않았습니다. 🔗 출처
- Bekko System One v0 — Yuichi Tateno가 브라우저에서 실행 가능한 하위 2개 모델을 포함한 17M, 68M, 400M 파라미터의 의사결정 모델 3종과 S1MB 벤치마크를 공개했습니다. 400M 모델은 Jev 1.13의 59.59 대비 50.60을 기록했으나, 일반화 성능에서는 96.27 대비 54.48을 기록했습니다. 🔗 출처
- ZooWork Instinct Tuned 4B — SRP가 Qwen3.5-4B를 기반으로 디코딩 없이 한 번의 패스로 선택지를 평가하는 40억 파라미터 의사결정 모델을 Apache-2.0 라이선스로 공개했습니다. 저자들에 따르면 개발 과정에서 활용된 JevBench 공개 작업에서 231개 중 198개(85.71%)를 달성했습니다. 🔗 출처
- Transformers v5.18.0 — Hugging Face가 4개의 아키텍처(NVIDIA의 Nemotron 3 Diarization 및 NemotronH Omni, NAVER의 HyperCLOVAX Vision V2, GTE)를 추가하고 6건의 주요 호환성 변경 사항을 안내했습니다. 🔗 출처
- TaskSmith — Hugging Face에서 강화학습 환경을 연구하는 Adithya S K가 풀 리퀘스트를 검증 가능한 강화학습 환경으로 변환하는 오케스트레이터를 공개했습니다. TRL, PEFT, Accelerate, Diffusers, Transformers에서 파생된 50개 환경이 Harbor 작업 형태로 제공됩니다. 🔗 출처
- TraceML 0.4.1 — 이 오픈소스 도구는 이제 옵티마이저 업데이트의 전체 그룹을 측정합니다. ResNet-50과 T4 GPU 환경에서 데이터 로딩을 튜닝한 결과, 데이터 대기 시간이 스텝의 23%에서 2ms 미만으로 단축되었으며 중앙값 오버헤드는 0.35%에 불과했습니다. 🔗 출처
- 루프형 트랜스포머 — 54,106개 파라미터와 260개의 검증 가능한 케이스로 구성된 토이 모델에서 동일하게 주어진 80회 블록 패스 예산 하에, 1회 루프는 260개 케이스 전체를 학습한 반면, 2회 루프는 평균 125.3개, 8회 루프는 평균 37.0개를 학습했습니다. 패스 횟수를 늘린다고 해서 학습 효율이 더 경제적이 되지는 않았습니다. 🔗 출처
- ‘아니오’라고 말할 수 있는 평가 방식 — Eric Mey의 튜토리얼은 영화 리뷰 감성 분석(SST-2)에서 홀드아웃 데이터 기준 7점 더 높은 모델이라도 핵심 동작이 저하되면 반려하는 평가 방식을 보여줍니다. 해당 스크립트는 CPU에서 1분 이내에 실행됩니다. 🔗 출처
- 1만 명의 합성 피보험자 데이터 — Intelligent Actuaries가 CC-BY-4.0 라이선스로 생명보험 실효 및 해약에 관한 합성 연구 데이터를 공개했습니다. 10개 시장에 걸친 가상 피보험자 1만 명, 즉 SOA-LIMRA 조사 형식에 맞춘 2023~2025년의 27,692건 증권-연도 기록이 포함됩니다. 🔗 출처
- cuObject 및 SCADA Server SDK — NVIDIA가 CPU 메모리를 거치지 않고 RDMA를 통해 객체 스토리지에 접근하는 cuObject 라이브러리를 정식 출시했으며, 40개 이상의 기업이 참여하는 Storage-Next 이니셔티브 하에 IBM이 Storage Scale로 프로토타입을 제작한 SCADA Server SDK를 선보였습니다. 🔗 출처
- NeMo Relay와 Hermes Agent — Nous Research의 Teknium이 공동 저술한 NVIDIA 튜토리얼에서 Hermes 에이전트를 추적 분석했습니다. 108회의 실행 결과, 도구 패치를 통해 모델 호출 횟수가 3.8회에서 4.9회로 늘어난 대신 Qwen3 Coder 30B의 성공률이 27회 중 19회에서 22회로 상승했습니다. 🔗 출처
- OpenClaw Enterprise를 위한 OpenShell — NVIDIA가 전날 OpenClaw 재단이 Red Hat, NVIDIA, OpenAI와 함께 발표한 지속형 에이전트용 오픈소스 제어 플레인인 OpenClaw Enterprise의 에이전트 거버넌스를 지원하기 위해 자사의 오픈소스 환경 OpenShell을 제공합니다. 🔗 출처
- GitHub Advanced Security 평가판 — GitHub Team 고객은 조직의 Overview 페이지, 결제 페이지 또는 Risk Assessment에서 직접 GitHub Code Security 및 GitHub Secret Protection의 평가판을 시작할 수 있습니다. 체험 기간은 명시되지 않았습니다. 🔗 출처
- GHE.com과 X25519 — 2026년 10월 7일부터 데이터 레지던시를 적용하는 GitHub Enterprise Cloud는 키 교환 방식으로 X25519만 제공하는 TLS 클라이언트의 접속을 차단합니다. P-256과 P-384는 계속 지원되며 SSH는 영향을 받지 않습니다. 🔗 출처
- Runway의 사례 연구 2건 — 프랑스 음료 브랜드 Bonjour는 Runway를 통해 500개 이상의 광고 변형본을 제작하고 5만 유로 이상의 제작비를 절감 및 재배정했습니다. World Juggling Federation은 ESPN에 방송될 1시간 분량 프로그램의 방송 그래픽 작업을 단 한 사람에게 맡겼습니다. 🔗 Bonjour · 🔗 World Juggling Federation
- Luma의 Ad Variants — Luma가 완성된 광고를 동일 캠페인 내에서 여러 크기와 여러 시장용으로 맞춤 변형해 주는 기능을 공개했습니다. 가격, 요금제, 출시일 및 관련 블로그 게시물은 아직 없습니다. 🔗 출처
- Microduck 양산 돌입 — Pollen Robotics가 시뮬레이션 기반 오픈소스 강화학습 스택으로 훈련된 399달러짜리 소형 이족 보행 로봇 Microduck 10,950대가 12월 10일부터 1월 10일 사이에 매주 분할 출고될 예정이라고 발표했습니다. 🔗 출처
- Cognition의 인재 영입 — Devin 개발사인 Cognition이 Alex Stamos를 최고 정보보안 책임자(CISO)로 영입한 바로 다음 날, 전 Snowflake CRO인 Chris Degnan을 최고 매출 책임자로 영입했습니다. 🔗 Chris Degnan · 🔗 Alex Stamos
- Claude Founder House — Anthropic이 SF Tech Week 기간 동안 샌프란시스코(10월 6~8일 Terra Gallery)와 스톡홀름(10월 14일)에서 창업자를 위한 행사를 개최합니다. 강연, 워크숍 및 Applied AI 팀과의 상담 세션이 진행됩니다. 🔗 출처
- AI Engineer Paris — Mistral이 지난주 Station F에서 열린 행사의 결산을 공개했습니다. 900명 이상의 참가자, 60명의 연사, 57개의 강연, 22개의 파트너사가 참여했으며, 별도의 신제품 발표는 없었습니다. 🔗 출처
- NVIDIA 박사과정 장학금 — 2027-2028 Graduate Fellowship Program의 지원 접수가 2026년 10월 30일까지 진행되며, 박사과정 학생당 최대 6만 달러가 지원됩니다. 2002년 이후 220건 이상의 장학금이 수여되었습니다. 🔗 출처
이것이 의미하는 바
이제 보안이 프론티어 모델의 일정을 좌우합니다. Gemini 4 Argon은 Fairwind Program의 논리를 이어갑니다. 신뢰할 수 있는 사이버 방어자들이 사이버 안전장치 없이 모델을 먼저 제공받고, 다른 사용자들은 보호 조치가 강화될 때까지 구체적 날짜 없이 ‘가능한 한 빨리’ 지원받게 됩니다. 같은 날, OpenAI는 문제의 또 다른 이면을 보여주었습니다. 이제 보호해야 할 대상은 모델 자체뿐만 아니라 그 추론 과정이기도 하다는 점입니다. 단일 주체의 소행이든 아니든 간에, OpenAI가 Moonshot AI와 관련된 개인들이 핵심이라고 지목한 이번 캠페인은 기술적 방어책과 연구소 및 정부 간 정보 공유를 통해 추론 궤적을 반드시 지켜야 할 자산으로 만들고 있습니다.
오늘 공개된 수치의 상당 부분은 발표 주체가 직접 설계하거나 수행한 측정에서 비롯되었습니다. Cohere는 같은 날 공개한 자체 지표로 Embed 5를 평가하며, 기존 측정 방식으로는 자사 모델이 덜 우수해 보일 수 있다고 스스로 경고했습니다. HeyGen은 내부 Elo 레이팅을, Hunmin은 자체 프로토콜을 기반으로 에이전트 벤치마크를 단 1회만 실행했으며, Reality Check에서는 주최 측이 직접 모델을 파인튜닝했습니다. 반면 Perplexity는 turbopuffer의 비공개 벤치마크에서 블라인드 방식으로 모델을 평가받았고, Open TTS Leaderboard와 AURORA는 투표나 기계 번역 대신 검증 가능한 작업과 지표로 대체하고 있습니다. 두 점수를 비교하기 전에, 누가 그 점수를 만들어냈는지부터 살펴보아야 합니다.
이미지 및 비디오 생성은 사용 편의성과 비용에 따라 평가받는 추세가 더욱 뚜렷해지고 있습니다. Ideogram 4.5는 단순히 더 아름다운 이미지가 아니라 연속적인 편집을 견뎌낼 수 있는 이미지를 약속합니다. HeyGen Video는 초 단위로 판매되며 기존 라인업의 모든 모델보다 저렴하고, MiniMax H3와 같은 기초 모델이 HeyGen부터 Creatify에 이르기까지 특화된 파생 버전을 만들어낼 수 있음을 보여줍니다. Runway Ads는 실제 광고 지출에 이르는 전 과정을 연결하며, 2월 이후 두 배로 뛴 ElevenLabs의 기업 가치는 대화형 에이전트에 대한 기업들의 수요에 기반하고 있습니다.
개발자 측면에서는 하네스가 모델과 구별되는 독자적인 제품으로 자리 잡고 있습니다. VS Code는 Copilot 하네스를 채택하여 앱과 CLI 전반에서 에이전트를 일관되게 맞추고 있으며, HydraFusion은 단일 턴 내에서 여러 모델을 조율하고, Zed는 서브에이전트별로 모델을 선택할 수 있게 하며, Manus는 하네스에 타사 제공업체의 API 키를 허용합니다. Gemini CLI는 비대화형 모드에서 사람의 개입 없이 계획을 실행하고, Claude Code는 스크립트 기반 사용을 위해 --bare를 강화하며, Google Cloud는 호출자의 IAM 권한을 유지한 채 샌드박스 내에서 gcloud와 bq를 에이전트에 노출합니다. 이러한 수요는 인프라 수준에서도 확연히 드러납니다. CoreWeave에서 상용 가동되는 Vera Rubin NVL72의 첫 번째 고객은 바로 Devin의 개발사인 Cognition입니다.
출처
- Gemini 4 Argon: our next era of frontier intelligence (Google 블로그)
- Google DeepMind의 Gemini 페이지
- @GoogleDeepMind의 Gemini 4 Argon 발표
- 증류 캠페인에 관한 OpenAI 블로그 게시물
- Stealing Reasoning Traces from Proprietary LLM APIs (arXiv)
- Cohere의 Embed 5 블로그 게시물
- @cohere의 Embed 5 발표
- Cohere의 RCP-nDCG@10 블로그 게시물
- GitHub의 RCP-nDCG 코드 및 데이터
- 문맥적 임베딩에 관한 Perplexity Research 블로그 게시물
- Hugging Face의 pplx-embed-v2-context-9b-preview
- @ideogram_ai의 Ideogram 4.5 발표
- Ideogram 4.5 모델 페이지
- HeyGen Video 카탈로그
- @HeyGen의 HeyGen Video 발표
- Gemini 앱의 Skills (Google 블로그)
- Manus Flex 소개
- Grok Bot과 Cursor에 관한 @bot 스레드
- Runway Research의 Praxis-1
- MolmoAct 2와 Reality Check에 관한 Ai2 트윗
- Poke & Wiggle의 Reality Check 순위표
- Physis-Lang 프로젝트 페이지
- @NVIDIAAI의 Physis-Lang 발표
- Hunmin-CUA 블로그 게시물
- Hunmin-397B-A17B-CUA 가중치
- JEV-27B-VL 블로그 게시물
- Open TTS Leaderboard 블로그 게시물
- Hugging Face의 Open TTS Leaderboard
- LILT의 AURORA 블로그 게시물
- AURORA 순위표
- Claude for Government 정식 출시
- Anthropic 영업팀이 Claude Managed Agents로 인바운드를 재구축한 방법
- 중소기업에 관한 OpenAI 블로그 게시물
- Runway Ads 블로그 게시물
- Runway Ads에 관한 @runwayml 트윗
- 인수 제안에 관한 ElevenLabs 블로그 게시물
- CoreWeave 및 Vera Rubin에 관한 NVIDIA 블로그 게시물
- Claude Code 2.1.286 릴리스 노트
- Zed 1.22.0 릴리스 노트
- Gemini CLI v0.63.0-preview.0
- Gemini CLI v0.62.0
- VS Code 1.140 릴리스 노트
- VS Code 및 GitHub Copilot 앱의 HydraFusion
- Google Cloud CLI 원격 MCP 서버 (Google Cloud 블로그)
- Codex CLI 0.159.2
- Amp의 Plaid Speed
- Factories as Code에 관한 @warpdotdev 스레드
- Factories as Code, Warp
- Crosby 사례 연구, Devin
- @ClaudeDevs의 claude.dev 소개
- ChatGPT 릴리스 노트
- ChatGPT Enterprise 및 Edu 릴리스 노트
- Kimi Work 릴리스 노트
- Cue와 금융 관리
- Genspark의 GPT-6.1 Sol
- Qwen3.8-27B-pi
- Nebius Token Factory의 Qwen3.8-27B
- Bekko System One v0
- ZooWork Instinct Tuned 4B
- Transformers v5.18.0
- TaskSmith
- TraceML 0.4.1 및 Transformers의 Trainer
- 루프형 트랜스포머 훈련하기
- ‘아니오’라고 말할 수 있는 평가 작성하기
- 1만 명의 합성 피보험자
- cuObject 및 SCADA Server SDK
- NeMo Relay와 Hermes Agent
- OpenClaw Enterprise를 위한 OpenShell
- GitHub Team용 GitHub Advanced Security 평가판
- GHE.com의 X25519 전용 TLS 지원 종료
- Bonjour 사례 연구, Runway
- World Juggling Federation 사례 연구, Runway
- Luma의 Ad Variants
- Microduck, Pollen Robotics
- Cognition의 Chris Degnan 영입
- Cognition의 Alex Stamos 영입
- Claude Founder House
- @MistralDevs의 AI Engineer Paris 결산
- NVIDIA Graduate Fellowships