검색

Jalapeño가 첫 측정치를 공개하고, WebMCP Challenge는 여섯 개 플랫폼을 모으며, Perplexity는 에이전트를 로컬에서 실행한다

ai-powered-markdown-translator

gpt-5.4-mini로 fr에서 ko로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

24시간 동안 51건의 발표가 아홉 개 분야에 걸쳐 쏟아졌다. 8월 25일은 이번 주 중 가장 분주한 날이다. 여기서 네 가지 흐름이 두드러진다. OpenAI는 자사 추론 칩인 Jalapeño의 첫 측정 결과를 공개하고, 이어서 Chrome, Cloudflare, Shopify, Vercel, Render, Netlify와 함께 WebMCP를 둘러싼 10일짜리 해커톤을 시작한다. Perplexity는 자사의 Computer 에이전트 전체를 사용자의 기기 안으로 내려보낸다. IBM은 추론 모델 첫 제품군인 Granite 4.2를 공개한다. 그리고 Anthropic은 Claude의 메모리를 채팅과 Cowork 사이에서 통합해, 파일별로 읽고 수정할 수 있게 만든다. 나머지 내용 — National Hurricane Center에서 운영에 들어간 WeatherNext Cyclones, Stability AI의 시리즈 B, 20여 건에 이르는 도구 업데이트 — 는 아래에 이어진다.


WebMCP: 하나의 표준, 제품 지원, 내부 활용, 그리고 이를 시작하기 위한 대회

8월 25일 — OpenAI는 웹과 에이전트의 상호작용 방식을 바꾸는, 아직은 실험적인 열린 표준에 관한 10일짜리 해커톤인 WebMCP Challenge를 시작한다. 겨냥한 문제는 분명하다. 오늘날 사이트에서 작업을 수행해야 하는 에이전트는 눈과 마우스를 전제로 설계된 인터페이스 안에서 어떻게 이동해야 하는지 스스로 추측해야 한다. WebMCP는 이 논리를 뒤집어, 사이트가 에이전트가 직접 호출할 수 있는 구조화된 도구를 스스로 노출하도록 한다.

이 대회 자체가 발표의 가장 중요한 부분은 아니다. 진짜 핵심은 드러난 정렬이다. Chrome(Google), Cloudflare, Shopify, Vercel, Render, Netlify가 모두 같은 표준 위에서 OpenAI와 손을 잡았다. 심사위원단에도 그 흔적이 보인다. Sarah Drasner(Chrome의 Distinguished Engineer), Andrew Galloni(Cloudflare의 VP Research & Innovation), Jude Gao(Vercel의 Next.js Core 팀), Ilya Grigorik(Shopify의 Distinguished Engineer), Sean Roberts(Netlify의 VP of Applied AI), Justin Rushing(OpenAI의 Browser Agent Lead), 그리고 MCP-B의 창시자 Alex Nahas가 참여한다.

The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.

🇰🇷 WebMCP Challenge가 시작되었습니다. 우리는 @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, @Netlify와 함께 10일짜리 해커톤을 진행합니다. 상금은 현금 3만 5천 달러, Codex Micro, ChatGPT Pro 구독, 그리고 파트너들이 제공하는 다양한 부상입니다.@OpenAIDevs X에서

일정은 촉박하고 평가 기준은 분명하다. 유용성, 독창성, 완성도, WebMCP의 신중한 활용, 그리고 인간-에이전트 경험의 품질이다. 참가 신청과 제출은 Devpost를 통해 진행된다. OpenAI는 프로젝트의 출발점을 마련하기 위해 에이전트-네이티브 데모 앱도 공개한다. 에이전트가 구동하는 3D 모델링, 에이전트가 자기 이름으로 댓글을 다는 협업 글쓰기, 맞춤형 십자말풀이 생성기, 여행 메모를 일정으로 바꾸는 Wandernote, 그리고 브라우저 안에서 DuckDB-Wasm으로 데이터를 탐색하는 기능이 그것이다. 기존 애플리케이션에 WebMCP를 추가하는 것도 허용된다.

대회 항목발표된 세부 내용
발표된 기간10일
제출 시작2026년 8월 25일, PT 12시
제출 마감2026년 9월 3일, PT 13시
수상자 발표2026년 9월 23일 (예정일)
총상금35,000달러
수상자당 부상 (상위 10명)3,000달러, ChatGPT Pro 1년, Codex Micro 키보드, 각종 굿즈
제출 플랫폼Devpost

이 표준을 일상적으로 사용할 수 있게 해주는 제품 측면의 조각도 같은 날 등장한다. ChatGPT 데스크톱 앱의 내장 브라우저와 ChatGPT Sites가 이제 WebMCP를 소비할 수 있다. ChatGPT나 Codex가 호환 사이트를 방문하면, 에이전트는 페이지가 노출한 도구를 감지해 인터페이스를 더듬지 않고 자동으로 사용한다. 다만 이를 위해서는 데스크톱 앱을 최신 버전으로 업데이트해야 한다. 순환의 다른 절반은 배포 쪽이다. Codex에게 WebMCP 호환 애플리케이션을 만들게 한 뒤, 이를 Sites에 바로 배포하도록 할 수 있다. 한편 Chrome과의 지원 비대칭도 주목할 만하다. Chrome에서는 WebMCP가 여전히 실험적 플래그나 origin trial 뒤에 있는 반면, ChatGPT 브라우저는 이를 기본적으로 처리한다.

세 번째 축은 가장 시사하는 바가 크다. OpenAI가 자기 내부에서 이 기술을 어떻게 쓰는지 문서화했기 때문이다. 회사의 한 엔지니어는 작업마다 개별 자동화를 쓰는 방식을 그만두고, Codex와 협업하도록 설계된 오픈 소스 노트북용 웹 애플리케이션 Runme를 만들었다고 설명한다. 그는 여기에 짧은 목표와 명시적인 지시사항을 적는다. 이전 실행을 확인하고, 자세한 계획을 작성하고, 시작 전에 검토 승인을 기다리고, 실행한 명령과 그 해석을 문서화하라는 식이다. 그러면 Codex가 작업을 진행하면서 노트북을 읽고 갱신한다. 여기서 주목할 만한 설계 선택은 두 가지다. 먼저 영속성이다. 노트북은 Google Drive에 저장되고, Runme는 별도의 Markdown 인덱스 *.index.md를 생성해 Drive가 색인할 수 있게 한다. 덕분에 에이전트는 과거 실행을 운영 맥락으로 다시 찾아볼 수 있다. 다음은 기능 노출 방식이다. Runme는 정적으로 제공되는 클라이언트 애플리케이션이며, 전통적인 MCP 접근 지점을 노출하기 위해 서버를 따로 추가하면 인프라가 늘어나고 노트북 데이터의 처리 위치도 바뀌게 된다. WebMCP는 애플리케이션이 브라우저 안에서 직접 자신의 도구를 등록하게 해준다.

🔗 WebMCP Challenge · ChatGPT desktop 및 Sites에서의 지원 · OpenAI의 Codex, Runme, WebMCP


Jalapeño: OpenAI, 추론 칩의 첫 수치를 공개하고 compute 전략을 드러내다

8월 25일 — OpenAI가 자신들이 직접 설계한 첫 추론 칩 Jalapeño의 첫 측정 결과를 공개한다. 이번 발표의 포인트는 단순한 성능 향상이 아니다. 기존 추론 시스템이 대체로 처리량과 지연 시간 사이에서 절충해야 하는 반면, Jalapeño는 하나의 아키텍처 안에서 둘 다를 내세운다는 점이다.

측정은 한 요청의 전체 처리를 시뮬레이션하는 SemiAnalysis의 공개 벤치마크 InferenceX를 기반으로 한다. GPT-OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T라는 세 개의 공개 모델이 상용 시스템과 비교됐다. 칩당이 아니라 와트당으로 정규화한 선택은 명시적이며 실용적이다. Jalapeño는 비교 대상 시스템보다 전력을 두 배 적게 쓴다. Jalapeño의 발표 전력은 700W이며, 테스트 부하에서의 지속 소비 전력은 550W 이하로 유지됐다. 비교 대상인 GB200은 1,200W, GB300은 1,400W다.

평가된 모델 (비교 시스템)kW당 최고 처리량종단 간 지연 시간최소 TBT
GPT-OSS 120B (GB200, 1,200 W)≈1.9배 (85,448 vs 44,960)≈1.7배 (1.03초 vs 1.80초)≈2.7배 (0.69 vs 1.87 ms)
DeepSeek R1 670B (GB300, 1,400 W)≈1.7배 (19,641 vs 11,781)≈3.6배 (1.65초 vs 5.99초)≈4.1배 (1.43 vs 5.90 ms)
Kimi K2.5 1T (GB300, 1,400 W)≈1.5배 (18,195 vs 11,862)≈3.4배 (1.56초 vs 5.31초)≈3.8배 (1.44 vs 5.48 ms)

세 모델 전체를 보면, OpenAI는 최고 처리량 기준 와트당 AI 작업량이 1.51.9배 많고, 종단 간 지연 시간은 비교 시스템보다 1.73.6배 짧으며, 매우 상호작용적인 작업에서는 성능이 최대 2.1~4.1배 높다고 말한다. 기술적으로는 칩, 메모리, 네트워크, 소프트웨어, 그리고 랙 단위 시스템의 공동 설계에서 이득이 나온다. 추론은 서로 다른 병목을 가진 두 단계로 진행된다. 프리필(prefill)은 프롬프트를 처리하며 연산을 포화시키고, 디코드(decode)는 토큰을 하나씩 생성하면서 주로 메모리 대역폭에 의존한다. Jalapeño는 데이터 이동을 최소화하려 한다. 모델 상태 — KV 캐시를 포함해 — 는 명시적으로 배치해 로컬에 유지할 수 있고, 시스템은 단계에 따라 연산, 메모리, 네트워크의 적절한 조합을 활성화한다.

개발자에게 가장 흥미로운 부분은 칩 설계 그 자체에 AI가 어떻게 들어갔는가 하는 점이다. OpenAI는 초기 설계에서 fabrication 단계인 tapeout까지 9개월이 걸렸다고 밝히며, 설계·측정·검증의 반복을 더 짧게 돌렸다고 설명한다. 이 칩은 AI와 인간 모두에게 예측 가능한 프로그래밍 대상이 되도록 설계됐다. 지역 텐서를 통해 작업을 표현하고, 명시적인 통신과 예측 가능한 동기화를 사용한다. Codex와 GPT-Astra를 통해 팀은 2개월 만에 원래 생산 계획에 없던 세 가지 가중치 공개 모델을 이식했고, GPT-OSS의 선택된 attention 및 mixture-of-experts 블록에서는 AI가 생성한 커널이 인간 전문가가 작성한 구현보다 1.5~1.8배 더 빠르게 동작한다. 다만 이 수치는 선택된 블록에만 해당하며 전체 모델에 대한 것이 아니라는 점을 분명히 해야 한다. 일정은 여전히 신중하다. 생산 자격 검증은 진행 중이고, 소프트웨어는 더 다듬어야 하며, OpenAI 인프라 배포는 연말로 예정돼 있다. Gen 2는 고도 개발 단계에 있고, Gen 3도 윤곽을 드러내고 있다.

같은 날 Sarah Friar는 이 모든 것의 경제적 논리를 설명하는 글을 올린다. 그녀는 Microsoft와 NVIDIA를 기반으로 AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy, SoftBank를 보완하는 폭넓은 compute 포트폴리오를 주장한다. 논지는 상업적이면서 동시에 기술적이다. 공급자 선택권을 유지해야 각 작업을 최적의 성능 대비 가격 비율로 보낼 수 있고, 가격 규율도 유지할 수 있다는 것이다. 이에 더해 하나의 구체적인 수치가 붙는다. Artificial Analysis Coding Agent Index에서 최대 추론 상태의 GPT-5.6 Sol은 다른 최상위 모델 대비 출력 토큰 사용량을 54% 줄이면서도 새 기록을 세운다. 글은 제번스의 역설도 정면으로 받아들인다. 지능을 더 싸게 만들면 소비가 줄어드는 것이 아니라, 오히려 수익성 있는 사용처가 넓어진다는 것이다. 인프라 측면에서 Project Camellia는 조지아에 위치하며, 물 순환이 폐쇄형이고 연례 독립 공공 감사 대상이라는 점이 강조된다. OpenAI는 학습과 추론 모두에서 NVIDIA와 다른 파트너들의 가속기를 계속 대규모로 배치할 것이라고 밝힌다.

🔗 Jalapeño — 첫 결과 · 풍부한 지능을 떠받치는 전체 스택


Perplexity Portable Computer: 모든 것이 기계에서 실행된다, 벤치마크가 이를 뒷받침한다

8월 25일 — Perplexity가 Portable Computer를 출시한다. 이는 사용자 기계에서 완전히 실행되는 Computer 에이전트의 변형이다. 전환은 외형보다 아키텍처적인 변화가 더 크다. 로컬에서 도는 것은 모델만이 아니라 오케스트레이터, 플래너, 도구 라우터, 스케줄러, 지속형 작업 큐, 로컬 검색 인덱스를 포함한 전체 오케스트레이션 체인이다.

오늘 우리는 @NVIDIA DGX Spark에서 Portable Computer를 출시합니다.

Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.

🇰🇷 오늘 우리는 @NVIDIA DGX Spark에서 Portable Computer를 출시합니다. Portable Computer는 Perplexity Computer의 완전한 로컬 버전으로, 실행 환경 전체 — 오케스트레이터 LLM, 서브에이전트 LLM, 에이전트 하니스 — 가 로컬 하드웨어에서 실행됩니다. 클라우드 의존성은 전혀 없습니다.@perplexity_ai X에서

이 발표는 NVIDIA와 공동으로 진행되며, 우선 DGX Spark를 겨냥한다. 이는 Grace Blackwell GB10 플랫폼, 20코어 Arm CPU, NVIDIA GPU, 128GB 통합 메모리를 갖추고 있으며, RTX GPU가 탑재된 PC로의 확장도 예고되어 있다. 선택 가능한 두 모델은 Qwen 3.8 27B 또는 PPLX 27B이며, Perplexity가 Qwen 모델을 후학습한 버전이다. 또한 NVIDIA Nemotron 3.5 Lightning, 30B 오픈 모델이 선택기에 합류할 예정이다. 로컬에서 처리된 작업은 어떤 크레딧도 소모하지 않는다. 클라우드로의 에스컬레이션은 여전히 가능하지만 — 최신 정보, 브라우저, 연결된 애플리케이션, 또는 15개 이상의 frontier 모델 중 하나 — 사용자 명시적 승인에 따라야 한다. Google Drive, Gmail, Slack, GitHub 커넥터는 장치에서 직접 동작하며, 받아쓰기는 오디오가 기기를 떠나지 않은 채 NVIDIA Nemotron 3.5 ASR Model을 통해 로컬로 실행되고, 코드 실행은 격리된 샌드박스에서 이루어진다. Portable Computer는 DGX Spark를 보유한 Pro 및 Max 구독자에게만 제공되며, Linux에서 먼저, 그다음 Windows에서 지원되고, 앱에서 원클릭 설치가 가능하다.

같은 날, 엔지니어링 팀은 이 출시를 뒷받침하는 수치를 공개한다. 핵심 주장은 모델과 하니스(harness)를 함께 설계해야 한다는 것이다. 일반적인 하니스는 긴 컨텍스트를 흡수하고 넓은 시간 범위에 걸쳐 계획할 수 있는 frontier 모델을 전제하지만, 로컬 모델은 이를 잘 따라가지 못한다.

측정된 벤치마크Computer (Qwen 3.8 27B)PiHermesComputer + PPLX 27B
Local Knowledge Work Bench (53개 작업)82,6 %77,6 %74,0 %85,4 %
BrowseComp (1 266개 작업)66,7 %50,2 %43,9 %
ParseBench-100 (멀티모달 문서)65,1 %13,9 %34,6 %

BrowseComp에서 Computer는 Hermes보다 시간은 61% 적게, 토큰은 16% 적게 사용하며, Pi보다 시간은 51% 적게, 토큰은 70% 적게 사용한다. 이 격차를 설명하는 설계 선택은 네 가지다. 최소한의 시스템 프롬프트, 경로를 따라 로드와 언로드를 반복하는 skills로 모듈화된 기능, 많이 쓰이는 커넥터(Gmail, GitHub, Outlook, Google Calendar)를 컨텍스트를 잡아먹는 MCP 서버 노출 대신 컴팩트한 명령줄 도구로 변환한 점, 그리고 항상 활성화되어 있고 구성 불가능한 샌드박스다. 샌드박스가 사용 불가능하면, 하니스는 도구 호출 전에 비활성화되며 격리되지 않은 실행으로 전환하지 않는다. Perplexity는 또 하나의 실용적 관찰도 덧붙인다. Qwen 3.8 27B는 260K 토큰 창을 지원한다고 표시하지만, 실증적으로는 100K를 넘어서면 성능이 떨어지기 시작한다.

Terminal Bench 2.1 (89개 작업)점수실행당 API 비용
Qwen 3.8 27B, 100% 로컬59,6 %약 0
Qwen 3.8 27B + Claude Opus 5 자문73,0 %0,415 USD
Claude Opus 5 단독82,4 %0,65 USD

자문 모델(advisor)로의 에스컬레이션 메커니즘은 보고서에서 가장 흥미로운 부분이다. frontier와의 격차 약 5분의 3을 비용은 대략 3분의 2 수준으로 줄여 주며, 최종 판단은 여전히 사용자에게 있다. 각 호출 전에 하니스는 관련 컨텍스트를 선택하고, 개인정보 분류기를 적용하며, 무엇이 기기를 벗어나게 되는지 사용자에게 보여 준다. 자문 모델은 텍스트만 반환할 뿐 파일이나 도구에 직접 접근할 수 없다. 마지막으로 PPLX 27B의 후학습은 rejection fine-tuning에 이어 Docker 컨테이너에서 실행된 합성 환경 위의 강화학습을 결합하며, 실제 사용자 데이터는 전혀 사용하지 않는다. 기술 보고서와 평가 벤치마크의 오픈소스 공개가 예고되어 있다.

🔗 로컬 하니스 벤치마크 · Portable Computer — Perplexity 게시물


Claude: 채팅과 Cowork 사이의 단일 메모리, 파일별로 읽기 가능

8월 25일 — Anthropic이 지금까지 공존하던 두 기억의 경계를 없앤다. 이제 Claude가 채팅에서 기억하는 내용은 Claude Cowork에서도 정확히 동일하게 이용 가능하며, 그 반대도 마찬가지다. 구체적으로, Cowork가 클라우드에서 작업을 실행할 때는 지난 몇 달간 축적된 맥락과 함께 시작한다. 분기 우선순위, 프로젝트 진행 상태, 대화 상대의 문체 선호 등이 포함된다. Anthropic은 의도적으로 현실적인 예를 든다. 예를 들어 상사에 대한 진행 상황을 물을 때 그 사람이 누구인지, 어떤 방식으로 정보를 받는 것을 선호하는지 일일이 설명하지 않아도 된다.

두 번째 변화는 더 조용하지만 일상적인 동작을 바꾼다. 메모리가 사후 요약으로 갱신되는 것이 아니라 대화가 진행되는 동안 계속 업데이트된다. 어떤 마감이 9월로 미뤄졌다고 언급하면 다음 대화에서 그 점이 반영된다. “이걸 기억해 둬”라는 표현은 특정 항목의 저장을 강제하기 위해 여전히 사용할 수 있고, 메모리는 언제든 일시 중지하거나 초기화할 수 있다.

투명성 측면에서 Anthropic은 블랙박스 대신 읽을 수 있는 표현을 택했다. Claude가 기억하는 모든 내용은 주제별로 정리된 짧은 파일 형태로 설정 다음의 메모리에 나타난다. 각 파일은 읽을 수 있고, 수정할 수 있으며, 삭제할 수 있다. 실용적 이점은 즉각적이다. 회사의 이전 이름을 단 하나의 파일에서만 고치면 이후 모든 대화가 올바른 이름을 사용한다.

민감한 주제 처리는 제품 설계 선택의 관점에서 가장 흥미로운 지점이다. 기본적으로 Claude는 건강, 출신, 민족, 종교적 신념, 정치적 의견, 성 정체성에 관한 내용은 기억하지 않는다. 다만 Anthropic은 경계가 개인적일 수 있음을 인정하고, 이런 주제를 포함할 수 있는 선택적 설정을 제공한다. 이를 통해 예를 들어 레시피를 제안할 때 글루텐 불내증을 기억하도록 Claude를 설정할 수 있다. 이 설정은 소급 적용되지 않으며 언제든 비활성화할 수 있다. 어떤 설정이든 예외로 남는 범주가 하나 있다. 신분증 번호, 범죄 경력, 이민 신분, 그리고 더 넓게는 허용 가능한 사용 정책에 위배되는 모든 내용이다. Claude는 이런 유형의 정보를 저장할 수 없을 때 이를 명시적으로 알리며, 이는 보이지 않는 필터링보다 드러나는 거부를 우선하는 설계다.

메모리 측면설명된 동작
범위채팅과 Claude Cowork 사이에서 공유되는 단일 메모리
업데이트 시점대화 중, 이전의 종료 후 요약이 아니라 그 과정에서
저장 형식주제별로 정리된 짧은 파일, 개별적으로 읽고 수정 가능
민감한 주제기본적으로 저장되지 않으며, 설정으로 활성화 가능, 소급 효과 없음
영구 제외 항목신분증 번호, 범죄 경력, 이민 신분
Free, Pro, Max 요금제웹, 데스크톱, 모바일에서 기본적으로 활성화
Team, Enterprise 요금제관리자가 열 수 있으며, 활성화 전까지는 사용자별로 비활성화

🔗 Claude의 메모리는 어디서나 작동한다 · @claudeai 발표


IBM이 최초의 추론 가족인 Granite 4.2와 두 개의 470M ASR 모델을 공개하다

8월 25일 — IBM이 Granite 4.2를 공개한다. 이는 추론을 위해 명시적으로 설계된, 밀집형 디코더 전용 언어 모델의 첫 번째 가족으로 소개된다. 이전 세대가 효율성과 전통적인 기업 작업에 초점을 맞췄다면, 이번 버전은 추론을 중심에 놓고 이를 모듈화한다. 각 모델은 thinking, non-thinking, low-effort라는 세 가지 모드를 제공하며, 애플리케이션은 자신이 지불할 수 있는 지연 시간과 토큰 예산에 따라 이를 선택한다. 세 가지 크기(3B, 8B, 30B)는 같은 아키텍처와 같은 파이프라인을 공유하므로 통합 측면에서 서로 전환하기가 어렵지 않다.

아키텍처는 전통적이다. 40개 헤드에 8개 KV 헤드를 갖는 GQA 어텐션, 131 072 토큰의 컨텍스트를 유지하기 위한 1천만의 θ를 사용하는 RoPE, SwiGLU MLP, RMSNorm 정규화, CoreWeave가 호스팅하는 NVIDIA GB200 NVL72 클러스터에서 bfloat16으로 훈련한다. 사전 학습은 약 15조 토큰을 다섯 단계에 걸쳐 처음부터 진행한다. Granite 4.2를 진정으로 구분하는 것은 후학습이다. 단일 패스가 아니라 특화된 단계들을 연쇄하는 강화학습 파이프라인이며, 비동기 GRPO와 절단된 중요도 샘플링을 사용해 생성과 학습 단계의 절반이 서로를 막지 않는다. 커리큘럼은 검증 가능한 보상에 기반한 세 번의 RLVR 패스, 지시 따르기와 코드를 겨냥한 증폭기, 128K 문맥의 소프트웨어 엔지니어링 두 단계, 터미널 단계, 검색 단계, 그리고 RLHF 정렬로 이어진다. 에이전트 강화 블록은 8B와 30B 모델에만 적용되며, 이것이 3B와 대형 모델들 사이의 에이전트 코딩 성능 차이를 설명한다.

IBM이 공개한 벤치마크3B Dense8B Dense30B Dense
SWE-Bench Verified47,6757,00
SWE-Bench Multilingual30,7841,89
Terminal-Bench 2.120,5629,24
τ³-bench45,7858,0662,00
AIME2578,3386,6789,17
GPQA54,8064,1466,41
LiveCodeBench v669,7173,2475,77
MMLU-Pro67,8474,0477,60
RULER 128K55,3071,4181,38

이번 공개는 bfloat16 가중치에만 그치지 않는다. vLLM용으로 네 가지 양자화 변형이 함께 제공되며 — 보정 없는 동적 채널별 FP8, 그리고 2,000개의 SFT 샘플로 보정한 GPTQ를 통한 NVFP4와 MXFP4 — llama.cpp용으로는 Q2_K부터 Q8_0까지 14개의 GGUF 형식이 제공된다. 프랑스어를 포함해 12개 언어가 지원되며, 에이전트 코딩 하니스 3종도 첫날부터 문서화된다: OpenCode, Pi, OpenHands. 데이터 품질에 관해 IBM은 GPT-OSS-120B와 Gemma 4가 SFT 샘플을 평가하는 심사 모델로 사용되는 흐름을 자세히 설명한 뒤, SHA-256 해시를 이용한 로컬 및 전역 중복 제거를 수행한다.

같은 날 IBM은 Granite Speech 5.0 Turbo CTC도 발표한다. 이는 4억 7천만 개 매개변수를 가진 영어 음성 인식 모델 두 개로, 훈련 데이터와 라이선스만 다르다. 표준 버전은 Apache 2.0, 추가 데이터로 훈련된 버전은 CC-BY-NC-SA-4.0이다. 아키텍처 변화는 눈에 띈다. 이전 Granite Speech는 음향 인코더, 프로젝터, LLM을 결합했지만, 이번 모델은 인코더 전용이다. 스택은 16개의 Conformer 블록을 쌓고, 여덟 번째 블록 출력에서 자기 조건화(self-conditioning)를 적용하며, 이차적 스케일링을 피하기 위해 점곱 어텐션을 chunkwise 어텐션으로 대체하고, CTC 손실을 직접 최적화한다. 진짜 새로움은 토큰 비율이다. 서브샘플링 연산을 통해 log-Mel 스펙트로그램 출력의 초당 100 프레임 흐름을 초당 12.5 프레임으로 낮추며, 이것이 이름의 “Turbo”를 설명한다. 결과는 단일 점수 대신 속도/정확도 파레토 그래프와 함께 원거리 음성용 OpenASR Leaderboard 및 FFASR Leaderboard에 보고되며, Chrome과 Edge에 제한된 WebGPU를 통해 브라우저에서 실행되는 연속 인식 데모도 제공된다.

🔗 Granite 4.2 — 기술 경로 · Granite Speech 5.0 Turbo CTC


WeatherNext Cyclones, 실시간으로 National Hurricane Center에서 사용하는 최초의 AI 모델

8월 25일 — Google AI가 Google DeepMind와 Google Research에서 나온 열대성 사이클론 예측 모델 WeatherNext Cyclones를 자세히 소개했다. 이번 발표가 주목받는 이유는 원시 성능 그 자체보다도, 기상 AI가 연구실에서 운영 단계로 넘어가고 있음을 보여주기 때문이다.

공략한 문제는 구조적이다. 지금까지 사이클론을 추적하려면 절충이 필요했다. 초거대 슈퍼컴퓨터에서 돌아가는 물리 모델은 지구 전역을 휩쓰는 거대한 대기 구조를 잘 포착하지만, 폭풍의 세기를 결정하는 국지적이고 강한 물리를 이해하려면 완전히 다른 지역 모델로 전환해야 했다. WeatherNext Cyclones는 이 왕복을 없애고, 경로·강도·크기를 한 번에 예측한다.

발표된 개선폭은 기존 시스템 대비 하루 전체의 예측 여유를 더 확보하는 수준이다. Google은 이를 이렇게 설명한다. 3일 예보의 정확도가 이제 과거의 2일 예보 수준에 도달했으며, 역사적으로 이런 진전에는 방법론적 발전의 10년이 필요했다는 것이다. 두 번째 성과는 확률적 특성이다. 이 모델은 폭풍당 최대 1,000개의 시뮬레이션을 생성할 만큼 빠르기 때문에, 가장 가능성이 높은 단일 경로 대신 여러 시나리오 범위를 제공한다. 덕분에 빠른 강도 강화가 더 읽기 쉬워진다. 이는 24시간 동안 최대 지속풍속이 최소 30노트 증가하는 경우로 정의된다. 올해는 폭풍당 1,000개의 확률 예측이 WeatherLab을 통해 예보관들에게 제공된다.

가장 의미 있는 요소는 실제 배치다. 2025년 허리케인 시즌 동안 WeatherNext Cyclones는 미국 National Hurricane Center에서 시험을 거쳤으며, 이 기관이 실시간 운영에서 AI 모델을 사용한 첫 사례였다. 기상학자들은 이를 사용해 자메이카에 상륙한 허리케인 Melissa의 카테고리 5 상륙 예보를 작성했고, 그 결과 현지 당국은 추가 준비 시간을 확보했다. 관련 논문은 Nature에 게재되었고, Google은 모델 코드와 가중치를 GitHub에서 오픈소스로 공개할 예정이라고 밝혔다.

모델의 측면WeatherNext Cyclones의 기여
예측 대상경로, 강도, 크기를 한 번에 예측
예측 여유하루 증가; 3일 예보 = 과거 2일 예보 수준의 정확도
폭풍당 시뮬레이션 수최대 1,000
운영 배포U.S. National Hurricane Center, 2025년 허리케인 시즌
문서화된 사용 사례자메이카에서의 허리케인 Melissa 카테고리 5 상륙
강도 강화 기준24시간 내 최대 지속풍속 30노트 초과
제공 방식WeatherLab; 코드와 가중치 오픈소스 GitHub 공개

🔗 @GoogleAI 발표 · Google DeepMind 게시물


Stability AI, EA·Sony Music·Universal·Warner와 함께 7,600만 달러 규모의 Series B 마감

8월 25일 — Stability AI가 Series B를 마감했다고 발표했다. 신규 자본 7,600만 달러가 유입되었고, Prem Akkaraju가 2024년 6월 회사 경영을 다시 맡은 이후 누적 자금 조달 규모는 두 차례의 지분 투자와 전환사채를 포함해 2억 3,200만 달러에 달한다. 업계 규모를 생각하면 금액 자체는 크지 않지만, 이번 투자자 구성은 그 자체로 큰 의미가 있다.

엔터테인먼트 업계의 거물 네 곳이 자본에 합류했다. 게임 부문에서는 Electronic Arts, 음악 부문에서는 Sony Music Group, Universal Music Group, Warner Music Group이다. 이 세 개의 대형 음반사는 이제 같은 연구소의 주주가 되었다. 여기에 AMD Ventures와 Pacific Alliance Ventures도 더해졌다. 이 투자자들은 갑자기 등장한 것이 아니다. EA, Universal, Warner는 이미 2025년 가을부터 Stability AI의 전략적 파트너였다. 이번 라운드는 기존 상업적 계약을 지분 참여로 전환한 셈이다.

또 다른 신호는 금융 투자자들의 충성도다. Coatue, Greycroft, Kadmos Capital, Sean Parker, Eric Schmidt가 새로운 경영진 아래 두 번째 연속 라운드에서도 다시 참여했다. Stability AI가 2023년과 2024년에 겪은 혼란을 떠올리면, 이는 사실상 신뢰 확인에 가깝다. Coatue의 공동창업자 Thomas Laffont도 이사회에 합류했으며, 이사회에는 이미 James Cameron, Sean Parker, Dana Settle, Prem Akkaraju가 참여하고 있다.

This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.

🇰🇷 이처럼 전례 없는 투자자 그룹은 우리의 비전을 확인해 줍니다. 즉, 모든 창작자, 음악가, 이야기꾼에게 역량을 부여하는 생성형 AI입니다. Stability는 AI 분야에서 독특한데, 우리는 창작자들을 위한 도구를 만드는 창작자이기 때문입니다. — Prem Akkaraju, Stability AI CEO, 8월 25일 보도자료

내세우는 전략은 틈새 연구소의 전략이다. 범용 모델은 없고, 창작 업계 전문가를 위한 도구를 만들되 권리 보유자와 대립하는 대신 그들과 함께 구축한다. 이는 정확히 Stable Audio 3.0의 방향과도 맞닿아 있다. Stable Audio 3.0은 완전히 라이선스된 데이터로 학습된 오픈 가중치 모델 계열이며, 8월 18일에는 오디오 워크스테이션용 플러그인으로 확장되었다. 이번 자금은 제품군, 응용 연구, 전문 서비스 부문을 뒷받침하는 데 쓰일 예정이다.

🔗 @StabilityAI 발표


ChatGPT 기업용: Admin 플러그인, 멀티 브라우저 확장, 100달러 Premium 좌석

8월 25일 — OpenAI의 세 가지 발표는 결국 같은 대상, 즉 ChatGPT와 Codex를 대규모로 배포하는 조직을 향한다.

가장 핵심적인 것은 Admin 플러그인이다. ChatGPT Work와 Codex용으로 제공되며, 그동안 대시보드·설정 화면·리포트를 오가야 했던 작업을 대화 한곳에서 처리하게 해 준다. 범위는 일상 업무 전반을 포괄한다. 도입과 크레딧 소비를 파악하고, 한도에 가까운 구성원이나 그룹을 찾아내며, 입사와 퇴사를 관리하고, 실제 권한을 검토하며 접근 문제를 진단하고, 사용 한도를 조정하고, 지출 요청을 실제 소비와 대조해 판단하는 일 등이 포함된다. 가장 흥미로운 부분은 코드를 쓰지 않는 자동화다. 보류 중인 사용 요청은 Slack이나 Microsoft Teams로 라우팅해 검토 도구 안에서 승인받을 수 있고, 기능 접근 요청은 사전에 정의된 기준을 충족하면 자동으로 허용되며, 예외만 사람에게 전달된다. 보안 측면에서 중요한 점은 플러그인이 사용자의 기존 역할과 권한 내에서 작동하며 어떤 접근도 확장하지 않는다는 것이다. 각 지시는 지원되는 읽기 또는 쓰기 작업에 매핑되고, 결과는 구조화된 형태로 반환된다. OpenAI는 자사 활용 사례도 언급했다. Slack 안의 ChatGPT Work 에이전트가 내부 IT 요청을 처리하고 있으며, 배포된 워크플로우는 지원 티켓 양의 약 45%를 해결해 주고 있다. 지원량이 거의 두 배로 늘어난 상황에서도 백로그를 없앤 것이다.

두 번째 발표는 ChatGPT 브라우저 확장 기능이 Chrome 범위를 벗어난다는 것이다. 이제 Microsoft Edge, Brave, Opera, Vivaldi를 지원한다. 이 변화는 개인정보 보호를 이유로, 혹은 기업의 제약 때문에 대체 브라우저를 사용하는 이들에게 중요하다. 강조된 사용 사례는 두 가지다. 첫째, ChatGPT Desktop에서 @ tab를 통해 열려 있는 탭의 컨텍스트를 작업에 가져와 Codex가 이미 표시된 문서나 티켓을 기반으로 작업하게 하는 것. 둘째, 에이전트가 브라우저를 조작해 실제 웹 작업을 수행하게 하는 것으로, 구독 해지가 예시로 제시되었다.

세 번째 발표는 더 간단하다. 100달러짜리 Premium 좌석이 ChatGPT Business에 추가되었으며, 팀 규모에 따라 유연하게 확장 가능한 요금제로 소규모 기업과 스타트업을 겨냥한다. 발표는 상세 블로그 없이 X에서 이뤄졌고, 해당 좌석의 정확한 구성은 메시지에 명시되지 않았다.

🔗 Admin 플러그인 · 멀티 브라우저 확장 기능 · ChatGPT Business Premium 좌석


NVIDIA: Gamescom에서 RTX Spark 확대, 그리고 SANA가 MiniMax H3의 지연 시간을 27배 줄이다

8월 25일 — 이번 주 쾰른에서 열리는 Gamescom을 계기로 NVIDIA는 올가을 출시 예정인 Windows PC 플랫폼 RTX Spark 카탈로그를 확장한다. Electronic Arts, Embark Studios, Ubisoft가 5월 COMPUTEX에서 처음 참여를 약속했던 KRAFTON, NetEase, Riot Games, XBOX에 합류한다. 언급된 타이틀은 기술 요구 수준이 다양하다. EA 쪽에서는 EA SPORTS F1 25와 Apex Legends, Ubisoft에서는 Anno 117: Pax Romana, Embark Studios에서는 ARC Raiders와 THE FINALS가 포함된다.

가장 구체적인 포인트는 안티치트다. 게임을 실행하는 것만으로는 충분하지 않다. 대형 온라인 게임은 각 플랫폼에 이식되어야 하는 안티치트 시스템에 의존하며, 그렇지 않으면 멀티플레이어에서 게임이 사실상 불가능해진다. NVIDIA는 EA와 협력해 EA Javelin Anticheat를 RTX Spark에 네이티브로 탑재하려 한다고 밝혔다. 새 PC 플랫폼의 실제 채택 여부를 가르는 것은 바로 이런 인프라 세부사항이다. 렌더링 측면에서는 DLSS 4.5 Ray Reconstruction이 즉시 제공되며, 2세대 transformer 모델이 기존 디노이저를 초거대 슈퍼컴퓨터로 학습된 네트워크로 대체한다. path tracing은 CONTROL Resonant와 007 First Light에 적용되고, Gears of War: E-Day는 RTX Mega Geometry를 통합한다. 또한 NVIDIA ACE 기술은 Aniimo에 2027년 초 도입 예정이라고 발표되었다.

같은 회사의 또 다른 면모는 8월 24일에 드러난다. 더 기술적인 내용이다. MiniMax는 NVIDIA의 SANA 팀이 Sol Engine을 자사의 비디오 모델 H3에 적용해 얻은 결과를 공유했다. 단일 GB200에서 768p 영상 10초를 생성하는 데 걸리는 시간은 414초에서 14.93초로 줄어들어, 27.7배의 가속이 이뤄졌다. 이 방법은 커널 최적화가 아니라 생성 과정을 두 번의 패스로 나누는 방식에 기반한다. 먼저 H3가 4단계로 저해상도 초안을 만들고, 그다음 Sol-Attn을 사용한 3단계 패스로 LTX가 목표 해상도에서 정제한다. 합계 7단계다. 두 번째 레버는 비용이 큰 VAE 디코딩을 TAEH3와 TAEHV라는 경량 디코더로 대체하는 것이다. 동시에 정제 패스를 위해 latent는 안정적으로 유지된다.

MiniMax H3 측정 항목측정값
측정된 부하768p 영상 10초, 단일 GB200
이전 지연 시간414초
이후 지연 시간14.93초
가속 계수27.7x
생성 단계4단계(H3 저해상도 초안) + 3단계(LTX)
대체된 디코더VAE 디코딩 대신 TAEH3 및 TAEHV
노드당 예상 처리량월 378,000개 영상, 97% 이상의 GPU 여유

예상 처리량은 MiniMax의 추정치일 뿐 실제 생산 측정치는 아니므로 그렇게 읽어야 한다. 그러나 방향은 분명하다. 10초 영상에 15초가 걸리는 수준이면, 고충실도 영상 생성은 배치 비동기 렌더링에서 거의 상호작용적인 인프라로 넘어간다.

🔗 Gamescom의 NVIDIA · H3의 SANA와 Sol Engine


열린 중국 모델이 연구의 기준이 되고, Qwen3.8-27B가 Code Arena 상위 10위권에 진입

8월 25일 — Qwen이 같은 아침 두 가지 결과를 전했는데, 두 번째가 첫 번째의 의미를 설명해 준다.

첫 번째는 순위표다. 웹 인터페이스 생성을 평가하는 Code Arena: WebDev에서 Qwen3.8-27B가 종합 9위, 1595점으로 진입했다. 같은 크기대 모델 가운데 상위 10위권에 든 것은 이 모델뿐이며, 훨씬 큰 Qwen3.8-Max보다도 단 6계단 뒤처질 뿐이다. Arena는 이 모델이 순위의 Pareto 경계를 다시 그린다고 평가하며, 비교 기준도 제시한다. 비슷한 크기지만 4월에 출시된 Gemma 4-31B는 80위다.

평가 모델Code Arena: WebDev 순위획득 점수순위 메모
GLM-5.3 (Max)종합 8위15978월 20일 기준, 열린 모델 중 2위
Qwen3.8-27B종합 9위1595상위 10위권에서 같은 크기대 모델은 유일
Qwen3.8-Max27B보다 6계단 앞섬n.c.같은 계열의 훨씬 큰 모델
Gemma 4-31B종합 80위n.c.2026년 4월 출시

두 번째 결과는 사용 현황 측정이다. Ai2에서 Olmo 프로젝트를 공동 지휘했던 Nathan Lambert는 Codex에 2022년 말 ChatGPT 출시 이후 공개된 AI 및 머신러닝 관련 arXiv 논문 50만 편을 분류하게 하여, 연구에서 실제로 사용되는 열린 모델을 식별했다. 반전은 두 숫자로 요약된다. 2024년에는 논문의 약 30%가 미국의 열린 모델을, 10%가 중국 모델을 언급했다. 그런데 지금은 약 40%가 중국의 열린 LLM을, 25~30%만 미국의 LLM을 인용한다.

모델 계열LLM을 인용한 논문 비중
OpenAI (닫힌 모델)약 37%
Qwen약 33%
Gemini, Claude10~15%
Gemma, Mistral5~10%
Olmo약 1%

세부적으로 보면, Qwen은 어떤 LLM이든 인용한 논문의 3분의 1에서 언급된다. Llama는 2025년 4월 무렵, Llama 4 출시와 동시에 30%로 정점을 찍었고 이후 하락 중이다. Lambert는 중요한 한계를 스스로 제시한다. 연구는 시간이 걸리므로 출판물은 모델 출시보다 뒤처질 수밖에 없다. 따라서 이 수치는 당장의 선호가 아니라 진행 중인 작업의 상태를 보여 준다. 이와 별개로 또 하나의 큰 흐름이 보인다. AI 논문 중 LLM을 언급하는 비율은 2023년 1월 10.43%에서 2026년 50% 이상으로 상승했다.

🔗 Code Arena의 Qwen3.8-27B · arXiv 분석에 대한 Qwen의 언급 · @natolambert 분석


Claude Code가 2.1.245로 넘어가고, 웹에서의 Claude 렌더링은 4배 더 부드러워지다

Claude Code의 두 버전이 같은 창에서 공개되었고, 그 내용은 조직 배포를 분명히 겨냥하고 있다. CHANGELOG에는 날짜가 없지만, Git 히스토리로 보면 2.1.2438월 24일 23:40 UTC의 커밋에, 2.1.2458월 25일 05:13 UTC의 커밋에 해당한다.

추가된 설정해당 버전실용적 의미
modelPricing2.1.243/cost의 계약 요금, 상태 표시줄, 원격 측정에 반영되는 계약 요금
modelPicker2.1.243/model용으로 정렬되고 라벨이 붙은 모델 목록
promptCacheTtl / subagentPromptCacheTtl2.1.243대화에는 1시간, 서브에이전트에는 5분짜리 프롬프트 캐시
/usage의 Ventilation Loops2.1.243삐걱거리는 /loop 작업을 찾아내기
Console을 통한 키 없는 연결2.1.243API 키를 금지하는 조직용
glibc 2.44 수정2.1.245Arch Linux, CachyOS, Fedora Rawhide에서의 시작 시 충돌

가장 구조적인 설정은 modelPricing이다. 지금까지 표시되는 비용은 공개 요율을 기준으로 계산되었지만, 이제 조직은 모델별 계약 요금과 할인 계수를 주입할 수 있어, 수치가 내부 재청구에 바로 활용 가능해졌다. promptCacheTtlsubagentPromptCacheTtl의 조합은 API 키 사용자에게 현실적인 경제적 절충안을 제공한다. 주 컨버세이션에는 1시간짜리 캐시를 유지해 문맥이 안정적인 반면, 문맥이 더 자주 바뀌는 서브에이전트에는 5분만 허용하는 방식이다. 수정 사항 측면에서는 비대화형 모드의 원격 MCP 서버가 끊김 뒤 더 이상 멈춰 있지 않고, /resume는 더 이상 가장 최근 50개 세션으로만 제한되지 않으며, 10분 넘게 말이 없는 세션은 이제 약 3분 뒤 만료되어 재시도와 명시적 오류가 발생한다.

8월 24일, Anthropic은 웹과 데스크톱의 Claude에서 생성 중인 응답을 보여주는 엔진을 다시 작성했다고도 발표했다. 인터페이스 렌더링에서 원리는 전형적이다. 새 조각이 나올 때마다 응답 전체를 다시 그리는 대신, 아직 변하고 있는 부분만 건드리는 것이다. 긴 응답에서는 차이가 구조적이다. 이미 표시된 텍스트의 길이에 따라 렌더링 비용이 더 이상 계속 증가하지 않는다. 발표된 성능 향상은 그럴듯하다. 부드러움이 약 4배 향상되고, 성능이 낮은 노트북에서 멈춤은 9배 줄었으며, 최악의 인터페이스 정지는 4.5배 짧아졌고, 120Hz MacBook에서는 시작부터 끝까지 120fps가 유지된다. 흥미로운 점은 대상 사용자다. 가장 큰 이득을 보는 것은 바로 보급형 구성이다.

🔗 Claude Code CHANGELOG · 4배 더 부드러운 렌더링, @ClaudeDevs


코드 에이전트가 산업화되다: Warp는 factories 형식을 공개하고, Rohlik은 코드의 90%를 에이전트가 작성한다

8월 24일 저녁 무렵 — Warp는 8월 18일 발표한 클라우드 에이전트 플랫폼 Warp Factories의 내부 메커니즘을 공개했다. 선택한 설정 형식과, 조기 액세스 공개가 그것이다. 출발점은 분명하다. Warp는 품질과 비용상의 이유로 자사 에이전트를 로컬 머신 밖으로 옮기고 있으며, 버전 관리되는 코드처럼 환경, 하네스, 보안 권한을 기술할 필요가 있었다.

설정 항목선택된 값
정의 파일factory.yaml, schemaVersion: v1alpha1
주요 키name, repositories (owner / name), agentDefaults.model
에이전트 정의agents/<nom>/agent.mdagentType (FOREMAN, REVIEW…) 및 model
트리거automations/<nom>/automation.md : agent, triggers (공급자, 이벤트)
사용 가능한 인터페이스CLI (warp agent run-cloud), REST API, TypeScript SDK, MCP 서버
조기 액세스적격 고객에게 최대 10,000 USD의 무료 사용량 제공

분리는 흥미롭다. 에이전트는 단일 YAML에 기술되지 않고 전용 Markdown 파일에 기술되므로, 에이전트 정의가 읽을 수 있고 diff 가능한 문서가 된다. Warp는 이 방식을 자사에도 적용한다. “wilson”이라 불리는 내부 factory는 warp-server이나 warp-terraform 같은 저장소를 담당하고, 비밀 정보와 MCP 서버를 선언하며, 에이전트를 역할별(code-review, foreman, implementation, spec, triage)로 34줄에 정리한다. 액세스 요청 페이지에 나온 수치는 외부에서 검증할 수 없는 상업적 주장이다. 하루 20만 번의 에이전트 실행, 수정 없이 병합되는 pull request 비율 30% 이상, pull request당 비용 20% 절감이 그것이다.

8월 25일, Cognition은 앞선 사례보다 훨씬 더 잘 문서화된 사례 연구를 공개했다. Rohlik Group은 체코에서 출발한 온라인 식료품 유통업체로, 5개국에서 사업을 하며, 수익성이 있고, 지난해 매출이 13억 달러를 넘었다. 1만 7천 개 품목의 주간 장바구니를 1시간 미만 또는 15분 단위 슬롯으로 배송한다. 이 글을 구조화하는 숫자는 대략 90%다. 현재 그곳의 코드 약 90%가 에이전트에 의해 생성되고, 엔지니어링 조직은 스스로를 “agent-mostly”라고 설명한다.

이건 도구를 연결했다고 얻어지는 결과가 아니다. Rohlik은 1년 전 시작했다고 말하며, 처음의 Devin 경험은 버그가 많았다고 평가했다. 판도를 바꾼 것은 고객 측에 깔아둔 기반이었다. 50개가 넘는 내부 및 외부 MCP 통합, 새 도구는 첫날부터 에이전트가 접근 가능해야 한다는 원칙, Snowflake 데이터 웨어하우스 위의 시맨틱 계층, 그리고 새 동료에게 넘겨줄 맥락을 에이전트에게 제공하는 지식 베이스가 그것이다. 작업은 만들어지는 곳에서 Devin에게 도착한다. 버그에 대한 Slack 대화이든, Linear 사양 문서를 펼쳐 pull request로 이어지든 마찬가지다. 주장된 결과 — 11월 이후 엔지니어링 처리량 2배, AutoStore 로보틱스 통합을 업계의 2~3년 대신 8개월 만에 출시, 프로토타입 제작 기간이 한 달에서 하루로 단축 — 는 여전히 공급업체가 공개한 고객 페이지의 내용이다. 더 말해주는 것은 다른 데 있다. 최고의 엔지니어들은 이제 시간을 80%나 코드 리뷰에 쓰고, Rohlik에서 Devin 사용량의 약 30%는 업무 사용자의 데이터 분석이다.

🔗 factory.yaml 형식, @warpdotdev · Rohlik 사례 연구, @cognition · Devin 고객 페이지


GitHub: agentic 워크플로와 Customize 탭에 대한 네 가지 실습, 일반 제공 시작

8월 25일 — GitHub이 학습 플랫폼 GitHub Skills에 네 개의 새 실습을 올렸다. 관점은 분명하다. 올해의 agentic 기능을 문서로 설명하는 대신, pull request를 따라 제공되는 지시문과 함께 데모 저장소에서 직접 연습하게 하는 것이다.

공개된 실습실습의 목적
Agent Orchestration Build Your AI Dream TeamCopilot CLI의 사용자 정의 에이전트: 계획, 설계, 구축, 검증, 전달
Agentic Workflows that Read the Roomgh aw 확장, Markdown의 agentic 워크플로, pull request를 통한 변경 제출
Idea to Merge with the Copilot App세션에서 병합된 pull request까지, 전부 GitHub Copilot 앱 안에서
Ship with Quality자동화된 품질 신호, 테스트 커버리지, pull request에 강제되는 검증

이 네 개 중 가장 눈에 띄는 것은 첫 번째다. GitHub CLI에서 다중 에이전트 오케스트레이션에 대한 가이드형 경로를 처음 제시했기 때문이다. 그 주제는 지금까지 오직 산문으로만 문서화되어 있었다. 두 번째는 gh aw 확장을 도입하며 보안 측면에서 중요한 점을 하나 담고 있다. 워크플로가 제안한 수정 사항은 직접 적용되지 않고 pull request를 거쳐 전달되므로, 인간 리뷰 지점을 유지한다.

같은 날 GitHub Copilot 앱은 Customize 탭을 일반 제공으로 출시했다. 이 탭의 기능은 지난 몇 달간 각각 따로 도입된 네 가지 확장 메커니즘 — MCP 서버, 플러그인, 스킬, 캔버스 — 을 한 화면에 모으는 것이다. Featured 보기는 각 범주에서 선별한 편집자 추천을 보여준다. 사용자는 하고 싶은 일은 알지만 어떤 종류의 확장이 맞는지는 모를 때 유용하다. 또한 MCP 서버는 인기 순으로 강조된 옵션과 범주별 탐색을 갖춘 전용 탐색 기능을 제공한다. 변경 기록은 캔버스의 가치를 구체적인 사례로 보여준다. Azure DevOps canvas를 이용해 이슈를 분류하고, 백로그 우선순위를 정하고, 후속 작업을 배정한 뒤, Copilot에 작업을 맡겨 조사, 구현 또는 리뷰 준비를 시킬 수 있다.

🔗 GitHub Skills 실습 네 개 · 일반 제공되는 Customize 탭


Google 개발자 도구: Gemini CLI 0.57.0과 Antigravity 2.10.0

8월 25일 — Google이 Gemini CLI 0.57.0 안정 버전을 공개했고, 15분 먼저 0.58.0 미리보기도 나왔다. 이번 버전의 내용은 새 기능보다 Google이 자기 도구를 어떻게 관리하는지를 더 많이 보여준다. 변경 로그의 24개 항목 중 13개가 [SSR Agent] Issue Fix로 시작하며, 이들은 19239부터 28518까지의 오래된 이슈 번호로 연결된다. 이 수정들은 backlog에 쌓인 불편을 다룬다. 무기한으로 멈추는 터미널 UI에는 타임아웃이 추가되었고, 개인 계정에 대해 오해를 부르는 관리 오류 메시지가 수정되었으며, 자동 완성 제안 뒤 공백이 없던 문제와 외부 편집기 출력 후 새로고침되지 않던 터미널 렌더링이 바로잡혔다. 다시 말해, Google은 자기 기술 부채에 에이전트를 투입했고 그 결과가 곧바로 안정 버전에 반영된 셈이다.

공개된 버전날짜와 시간 (UTC)배포 채널주요 내용
v0.57.08월 25일, 18:37:14Stable[SSR Agent] 수정 13개, eval 검증, 문맥 기반 재시도
v0.58.0-preview.08월 25일, 18:22:01PreviewmacOS Seatbelt 프로필의 Docker 격리, 안전성 검증기

기능 측면에서는 평가에 초점이 맞춰져 있다. eval 검증 명령과 실패 요약을 포함하는 도구 호출 포맷터가 추가됐다. 신뢰성도 개선됐다. 용량 오류는 문맥을 고려한 조용한 재시도를 유발하고, 다중 턴 요청을 취소하면 부분 상태가 아니라 완전 롤백이 일어난다. 릴리스 노트를 찾는 사람이라면, 저장소의 docs/changelogs/index.md 파일은 8월 6일 v0.54.0 이후로는 업데이트되지 않았다는 점을 참고할 만하다.

2.9.1과 Remote Control 이후 4일 만에, Google Antigravity는 8월 24일 2.10.0으로 올라가며 도구 밖으로 나가야 했던 두 가지 부족함을 메운다. 바로 통합 터미널과 네이티브 Git 버전 관리다. 둘 다 사이드바에 직접 들어갔다. 이 통합은 제품의 흐름과도 잘 맞는다. Antigravity는 한 줄씩 코드를 편집하기보다 에이전트를 조종하는 환경으로 자리 잡고 있으니, 창을 바꾸지 않고도 명령을 실행하고 diff를 확인할 수 있어야 한다. 이번 버전의 나머지는 에이전트에 맡길 수 있는 것과 그 작업을 보는 방식을 넓힌다. 오디오 파일이 허용되는 첨부 파일에 추가되었고, 이미지에 대한 대화형 주석으로 시각 자료에 표시를 남겨 에이전트를 유도할 수 있으며, MCP 도구 실행의 풍부한 미리보기는 도구 서버가 실제로 무엇을 했는지 읽기 쉽게 보여준다. Google은 이번 버전을 13개의 개선과 8개의 수정으로 집계하며 점진적 배포를 진행한다.

🔗 Gemini CLI v0.57.0 · Antigravity 변경 로그


Anthropic, 웰빙에 대한 독립 평가에 500만 달러를 지원하다

8월 25일 — Anthropic은 AI가 사용자 웰빙에 미치는 영향을 다루는 독립 연구를 지원하기 위해 500만 달러 규모의 장학 프로그램을 시작했다. 선정된 연구자는 직접 자금과 모델 접근권, 기술 지원을 받지만, 연구는 전적으로 독립적으로 수행된다. 평가 결과는 오픈 소스로 공개되어 업계 전체가 재사용할 수 있다. 신청은 9월 21일까지이며, 전체 제안서를 제출하도록 선정된 지원자에게는 10월 5일 전에 통보된다.

기술적 논거는 이 분야가 왜 일반적인 평가 방법을 잘 견디지 않는지 설명한다. 대부분의 모델 동작은 개별 응답 하나만 보면 정확하고 적절한지 판단할 수 있다. 하지만 웰빙은 맥락을 요구한다. 곤경에 처한 사용자가 자해적 생각을 처음부터 반드시 언급하는 것은 아니며, 한 경우에는 합리적인 식이 균형 조언이 그 사람이 섭식 장애 전력이 있음을 보여줬을 때 잠재적으로 위험해질 수 있다. Safeguards 팀은 동시에 다섯 가지 엄격성 기준을 제시한다. 무엇을 측정하는지 명확히 밝힐 것, 임상의와 분야 전문가를 설계에 참여시킬 것, 보호와 피해를 모두 시험할 것 — 즉, 과도한 순응 위험과 과도한 거부 위험을 함께 평가할 것 —, 멀티턴 시나리오로 실제 사용을 반영할 것, 그리고 자동 채점기를 실제 전문가에 맞춰 검증할 것. 세 번째 기준인 과잉 준수와 과잉 거부의 대칭성은 이 접근이 단순히 안전장치를 더 엄격하게 만드는 것과 다른 지점이다.

🔗 웰빙 연구 장학금


Quantization-Aware Healing : 원본의 완전 정밀도를 뛰어넘는 4비트 모델

8월 25일 — 대규모 모델을 배포 가능하게 만드는 표준 파이프라인은 보통 세 단계를 거친다: 아키텍처를 압축하고, 결과를 양자화한 뒤, 품질 손실을 복구하는 것이다. 이 마지막 단계에서 가장 널리 쓰이는 방법은 QAT (quantization-aware training)로, 가짜 양자화 연산을 삽입해 다시 학습시키는 방식이다. 대안인 QAD는 압축된 모델에서 완전 정밀도로 증류한다. 두 경우 모두 학생 모델은 많아야 압축된 교사 모델을 따라잡는 수준에 그치며, 따라서 압축이 정해 둔 한계를 그대로 물려받는다.

Multiverse Computing은 한 줄짜리 변화로 이 구조를 바꾼다: 압축 이전의 원본 모델에서 직접 증류하는 것이다. 그러면 양자화는 손실이 발생하는 후처리가 아니라, 완전한 학습 단계가 된다. 결과는 직관에 어긋난다. GPT-OSS 120B를 60B로 압축한 뒤 MXFP4로 양자화한 경우에 이 방법은 9개 벤치마크 중 7개에서 자체 bfloat16 소스와 같거나 더 나은 4비트 모델을 만들어냈고, 압축의 피해가 가장 큰 영역에서 특히 큰 향상을 보였다: 장문 맥락 추론의 AA-LCR에서 +7.4점, AIME 2025에서 +5.6점이다. 나머지 두 하락폭, MMLU-Pro와 SciCode에서는 모두 1.5점 미만이다.

같은 파이프라인에서 QAT와 직접 비교한 결과는 실무적으로 아마도 가장 유용한 결과일 것이다. GPT-OSS 9B를 MXFP4로 양자화한 경우 두 방법 모두 비슷한 최고점, 즉 54.9 대 54.6에 도달하지만, 그 대가는 다르다. QAH는 약 100스텝 만에 그 수준에 도달해 유지하는 반면, QAT는 거기에 도달하는 데 약 700스텝이 걸리고 이후 성능이 떨어진다. 실제 배포 관점의 결과는 다르다. QAT 체크포인트는 조기 중단을 면밀히 감시해야 하지만, QAH 체크포인트는 그럴 필요가 훨씬 적다.

🔗 Quantization-Aware Healing


Gradio가 그래프 기반 AI 파이프라인 빌더 gr.Workflow를 통합하다

8월 25일 — Hugging Face가 gr.Workflow를 소개하는 가이드를 공개했다. 이는 이제 Gradio에 통합된 프리미티브다. 출발점은 단순하다: 흥미로운 AI 애플리케이션 대부분은 하나의 모델 호출이 아니라 연쇄 작업이다. 이미지를 생성하고, 배경을 지우고, 나레이션을 만들고, LLM에게 제목을 묻는다. 지금까지는 이런 흐름을 연결하고 깔끔하게 노출하려면 로직과 인터페이스를 모두 직접 작성해야 했다. gr.Workflow는 이 둘을 합친다. 단계를 타입이 지정된 노드 그래프로 설명하면, 그 그래프 자체가 인터페이스가 된다.

개발자 입장에서의 가치는 시각적 데모를 넘어선다. 그래프의 각 출력은 자동으로 자체 REST 엔드포인트를 얻는다. 예시로 제시된 미디어 스튜디오는 FLUX 생성, 배경 제거, 음성 합성, LLM을 연달아 수행하며, 인터페이스를 거치지 않고 코드에서 호출할 수 있는 세 개의 별도 경로(/sticker, /voiceover, /episode_title)를 노출한다. 노드들은 네 개의 세계와 대화할 수 있다. Hugging Face의 Inference Providers를 통해 호스팅되는 모델, 블록처럼 재사용되는 다른 공개 Gradio Spaces, Hub 데이터셋의 한 행, 그리고 임의의 Python이다. 이 마지막 항목이 가장 많은 가능성을 연다. @spaces.GPU로 장식된 연산자 노드는 실행 시간 동안 ZeroGPU GPU를 예약하므로, 자체 가중치를 실행할 수 있다. 실제로 Spaces에 배포된 다섯 개의 애플리케이션이 가이드를 함께 제공하며, 그중에는 데이터셋 프로파일러와 Lightricks/LTX-Video로 정지 이미지를 애니메이션화하는 데모가 포함된다.

🔗 gr.Workflow 가이드


ElevenLabs가 섹션별 노래 편집기 Composer를 출시하다

8월 25일 — ElevenLabs가 섹션별로 작업하는 노래 편집기 Composer를 발표했다. 이 방식은 음악 모델의 지배적인 생성 모드와 결별한다. 한 번에 완성된 곡을 만들어 놓고, 마음에 들지 않는 부분이 있으면 전체를 다시 돌리는 대신, Composer는 벌스, 코러스, 브리지 하나만 따로 다시 작업할 수 있게 한다. 시작점은 네 가지다. 자신의 가사, 가져온 기존 트랙, 빈 페이지, 또는 간단한 프롬프트다. 이후 곡은 반복적인 수정으로 완성된다.

이는 Eleven Music 이후 ElevenLabs의 두 번째 음악 진출이며, 회사 입장에서는 바쁜 한 주에 나온 발표다. CLI v1이 전날 출시됐기 때문이다. 포지셔닝은 오디오 업계 전반의 흐름과도 일치한다. Suno는 8월 13일 Studio 2.0을 출시했고, Pika는 8월 18일 Pika Music 라인업을 내놓았으며, Stability AI는 같은 날 오디오 워크스테이션용 플러그인을 공개했다. 곡의 구조를 세밀하게 제어하는 것이, 순수한 생성 품질보다 더 중요한 경쟁 무대가 됐다. 다만 한 가지 유보점이 있다. 발표와 함께 블로그 글이 없고, Composer에 접근하는 플랜, 내보내기 형식, API 접근에 대해서도 아무 정보가 없다.

🔗 Composer 발표, @ElevenLabs


LiveAvatar가 모든 동시성 제한을 없애고 분당 0.01달러로 내려가다

8월 25일 — HeyGen이 실시간 아바타 제품인 LiveAvatar의 동시성 제한을 없앤다고 발표했다. 표현이 강조하는 바는 변화의 성격이다. 제한이 완화되는 것이 아니라 사라진다는 것이다. 세션 하나든 만 개든 사전 할당량 협상 없이 같은 API에서 돌아간다. 발표에는 두 가지 추가 사항이 따른다. 렌더링은 여전히 1080p 전신이며, 대규모 사용 시 요금은 분당 0.01달러까지 내려간다.

이 가격대는 가능한 사용 사례의 성격을 바꾼다. 분당 1센트라면 실시간 아바타는 대규모 고객 지원, 교육, 또는 인터랙티브 키오스크에 충분히 실용적이다. 지금까지는 단가가 실현 가능성을 결정하던 사례들이다. 동시성 제한 제거가 기술적으로 흥미로운 핵심이다. 실시간 아바타 플랫폼은 보통 각 세션이 GPU를 계속 점유하기 때문에 동시 세션 수를 상한으로 묶어 둔다. 이 상한을 풀려면 충분한 여유 용량이 있거나, 모델 효율이 개선되어야 한다. HeyGen은 자신의 접근 방식을 설명하는 글을 공개했지만, 스캔 시점에는 기술 세부 사항을 확인할 수 없었다.

🔗 LiveAvatar의 무제한 동시성


Grok 4.6이 OpenCode Go에 들어오다

8월 25일 — Grok 4.6이 오픈소스 코드 에이전트 OpenCode의 구독형 요금제인 OpenCode Go에 합류했다. 발표는 하루가 끝날 무렵 OpenCode가 했고, @grok 계정은 30분 뒤 이를 재전파했다. 개발자에게 실질적인 포인트는 할당량이다. Go 요금제 사용자는 5시간당 169회 요청을 할 수 있다. 이는 월간 누적이 아니라 이동형 상한선이므로, 코딩 보조 세션 특유의 몰아쓰기 패턴에 잘 맞는다.

이 통합은 Grok 4.6이 외부 도구로 확장되는 일련의 흐름 속에 놓여 있다. 이 모델은 8월 14일 GitHub Copilot에 들어왔고, 8월 19일 Amazon Bedrock에, 이어 8월 21일 Google의 Gemini Enterprise Agent Platform에 추가됐다. xAI는 이미 2026년 5월 OpenCode를 SuperGrok 및 X Premium 구독에 연결한 바 있다. 따라서 오늘의 변화는 OpenCode 자체에 대한 접근이 아니라, xAI 구독을 따로 제공하지 않고도 포함된 할당량과 함께 Go 요금제에서 4.6 모델을 사용할 수 있게 된 점이다.

🔗 @grok 재전파 · @opencode 발표


Cohere가 2026년 주권 AI 채택에 관한 IDC 연구를 공개하다

8월 25일 — Cohere가 규제 산업에서의 주권 AI 채택에 관한 IDC 의뢰 InfoBrief 결과를 발표했다. 이 연구는 2026년 4월부터 5월 사이 캐나다, 미국, 영국, 독일에서 연매출 10억 달러를 넘는 기업의 고위 의사결정자 500명 이상을 대상으로 조사했다.

가장 눈에 띄는 결과는 채택보다 개념적 혼란에 가깝다. 경영진 3명 중 1명은 주권 AI를 자기 말로 설명하는 데 어려움을 겪었고, 이 주제에 대해 매우 잘 알고 있다고 답한 비율은 13%에 불과했다. 정의를 내릴 수 있다고 답한 사람들 가운데 52%는 이를 로컬 또는 국가 수준의 통제로 설명했고, 35%는 디지털 독립성을 언급했다. 이 격차는 조직도에도 나타난다. IT 책임자들의 인지도는 비즈니스 책임자들보다 두 배 높았다.

조사된 산업데이터 유출 및 규제가 주요 우려 사항경쟁 우위가 동인
금융 서비스82 %21 %
제조업77 %32 %
통신75 %37 %
헬스케어74 %28 %
에너지70 %21 %

동기에 대해서는 업종을 가로지르는 명확한 합의가 있다. 데이터 유출, 프라이버시, 규제가 모든 조사 산업에서 최상위에 올랐다. 경쟁 우위는 2차적 동인이지만 점차 중요해지고 있으며, 독일(23%)이나 영국(18%)보다 캐나다(35%)와 미국(28%)에서 더 강조됐다. 이 연구는 물론 고객이 선택한 인프라와 관할권에서 실행되는 Cohere의 에이전트 플랫폼 North를 뒷받침한다. 다만 수치는 확인된 출처에 귀속되어 있다. IDC는 또 2028년까지 다국적 기업의 CIO들이 모듈형 주권 클라우드 환경과 데이터 로컬라이제이션에 대한 투자를 65% 늘릴 것으로 전망했다.

🔗 State of Sovereign AI Adoption 2026


단신

  • Bain & Company가 Claude Partner Network에 합류하다 — 이 컨설팅 회사는 1만 9천 명 직원 대상 Claude 배포를 기반으로 하는 Global Premier 파트너가 됐다. 파일럿 단계에서 이미 7천 명 이상이 사용했으며, 참가자의 3분의 2 이상이 Claude for Excel을 채택했다. 🔗 Anthropic 게시물
  • Amp가 orbs가 무엇인지 설명하다 — 이름에 대한 혼란에 답하는 Thorsten Ball의 메모. orb는 웹, 휴대폰, CLI에서 제어할 수 있는 원격 에이전트다. 비용에 관한 두 가지 유용한 명시도 있다. 무제한 sleep은 과금되지 않으며, 동시에 존재하는 orb 수에도 상한이 없다. 🔗 Amp 메모
  • Together AI가 Qwen3.8 27B에 파인튜닝과 전용 추론을 열다 — 이 모델은 자체 데이터에 대한 조정과 예약된 하드웨어에서의 Dedicated Model Inference 모두에 사용할 수 있게 된다. 🔗 @togethercompute 트윗
  • FINAL-Bench가 에이전트를 위한 금융 예측 대회 FINCHAL을 열다 — 상금 2,000달러가 걸린 이 대회는 예측이 아니라 포지션을 요구하며, 실력과 운을 분리하기 위해 luck ceiling을 공개한다. 🔗 FINAL-Bench 게시물
  • Au-Zone이 EdgeFirst Model Zoo를 공개하다 — 실제 임베디드 실리콘에서 측정한 탐지 및 분할용 네 가지 YOLO 계열을 모아 놓았으며, 공개된 각 수치는 제조사가 내세우는 TOPS의 불투명성에 맞서 검증 세션으로 되돌아간다. 🔗 EdgeFirst 게시물
  • macOS용 Gemini 스마트 받아쓰기 — 데스크톱의 어떤 창에서든 받아쓰기를 할 수 있고, 멈칫거림은 자동으로 제거되며 문장 중간 수정도 반영된다. 음성은 파일 요약과 텍스트 재작성에도 사용된다. 🔗 blog.google 가이드
  • 푸시 규칙이 경로 예외를 허용하다 — 공개 프리뷰에서 Restrict file paths와 Restrict file size 규칙이 특정 경로를 예외로 둘 수 있다. 예를 들어 **/gradle/wrapper/*.jar를 제외한 모든 곳에서 JAR를 차단할 수 있다. 🔗 GitHub 변경 로그
  • 보안 경고에서 사용자를 차단하는 기능 — 이 작업은 공개 저장소의 설명이나 댓글에 있는 세 점 메뉴에서 수행할 수 있으며, 설정으로 돌아갈 필요가 없다. 경고는 그대로 유지된다. 🔗 GitHub 변경 로그
  • Manus가 데이터 복원 수요 급증을 알리다 — 실패한 복원은 나중에 같은 날 다시 시도해야 하며, 백업 패키지는 그대로 보존하고 변경하지 말라는 명시적 지침이 있다. 🔗 @ManusAI 트윗
  • Kling이 MCP 서버에 관한 세 가지 가이드를 공개하다 — 검증된 크리에이티브 설정을 다시 재생하고 변형을 대량 생성하기 위해 Kling을 MCP 호환 어시스턴트에 연결하는 방법이다. 세 개의 튜토리얼 중 두 개는 Claude Code를 클라이언트로 언급한다. 🔗 Kling 블로그
  • Wan 3.0이 Runway와 Replicate에 등장하다 — Runway는 8월 24일 이미지, 비디오, 오디오의 다중 참조 입력과 함께 이를 통합했고, Replicate는 8월 25일 동기화된 오디오가 포함된 네이티브 30초 단일 테이크를 내세우며 뒤따랐다. 🔗 @runwayml 트윗
  • Runway가 AI Summit의 새 연사들을 발표하다 — 9월 샌프란시스코 행사 프로그램이 로보틱스, 자율주행차, 마케팅, 인프라로 확장됐다. 🔗 @runwayml 트윗
  • MiniMax가 H3 통합 색인을 공개하다 — Awesome MiniMax H3 Integrations는 공개 비디오 모델 주변에서 만들어지는 것들을 모아 보여 주며, 여기에는 24GB VRAM에서 돌아가는 구성도 포함된다. 🔗 @MiniMax_AI 트윗
  • Luma가 Dream Lab Weekly를 시작하다 — Luma의 크리에이티브 전문가들과 그들의 주간 제품 작업을 다루는 영상 시리즈의 첫 번째 에피소드다. 🔗 @LumaLabsAI 트윗
  • NVIDIA가 열린 모델 라우팅에 대한 Nemotron Labs 세션을 방영하다 — Get Started with Open Model Routing라는 55분짜리 라이브 스트리밍으로, Nemotron 3.5 Lightning과 NeMo Switchyard 작업의 연장선이다. 🔗 @NVIDIAAI 트윗
  • Grok Imagine의 오디세이 콘테스트가 1주일 남았다 — 도구의 비디오 및 음성 기능을 보여 주는 오디세이 장면을 구성해야 하며, 상금은 10만, 5만, 2만 5천 달러다. 🔗 @grok 트윗
  • Plus 및 Pro 구독자를 위한 한도 재설정 은행 — 재설정 창을 기다리는 대신 사용자가 비축된 재설정을 소비한다. 시작 시 무료 1회와 추천을 통한 추가 제공이 있으며, Business 측에서는 공유 워크스페이스 크레딧이 있다. 🔗 ChatGPT 및 Codex 변경 로그

의미하는 바

실리콘이 다시 모델 연구실의 주제가 되고 있다. OpenAI는 같은 날 자사 추론 칩의 첫 실측 수치와 컴퓨트 전략을 드러내는 글을 공개했다. 이는 일정상의 우연이 아니다. 모델 제공사가 자체 실리콘을 설계하고, 공개 제3자 벤치마크로 측정하며, 10개 파트너 포트폴리오를 공개적으로 감수하는 순간 경쟁의 성격이 바뀐다. 더 이상 질문은 “어떤 모델이 최고인가”가 아니라 “성공한 작업 하나당 비용이 얼마인가”로 바뀌며, 답은 가중치만큼이나 랙 안에서 결정된다. 아마 가장 의미심장한 세부는 다른 곳에 있다. AI가 칩 설계와 커널 작성에 사용되었고, 선택된 블록에서는 인간 전문가의 구현을 능가하는 생성형 구현이 나왔으며, 9개월 만에 양산 단계로 넘어갔다. 순환이 닫힌다 — 모델이 자신을 돌릴 하드웨어를 설계하는 것이다.

AI가 다시 기기 위로 내려오고 있고, 숫자도 그 흐름을 따라가기 시작했다. 같은 날 나온 세 가지 신호가 같은 방향을 가리킨다. Perplexity는 자사의 에이전트를 전부 로컬에서 DGX Spark로 구동하며 크레딧을 소모하지 않고, 클라우드 승격은 사용자 결정으로 남겨둔다. Multiverse Computing은 4비트 모델이 원본의 완전 정밀도와 같거나 이를 능가하는 방식을 공개해, 과감한 양자화에 대한 흔한 반론을 약화시킨다. Au-Zone은 탑재형 실리콘 비전 측정치를 공개하며, 광고된 TOPS가 특정 모델이 실제로 무엇을 할 수 있는지 전혀 말해주지 못한다고 지적한다. 이 셋 중 어느 것도 frontier와의 동등성을 주장하지 않는다. Perplexity의 정직한 수치는 Terminal Bench 2.1에서 로컬 59.6% 대 Claude Opus 5 단독 82.4%다. 하지만 상담용 모델로의 승격은 비용의 3분의 2로 격차의 5분의 3을 회수한다. 그리고 바로 이 절충점이, 완전한 동등성보다, 로컬 실행을 정당화한다.

오픈 가중치는 이제 기본 위치로 자리 잡고 있다. Qwen이 공유한 50만 개 arXiv 논문 분석은 이미 감지되던 반전을 기록한다. 중국 오픈 모델의 언급 비중은 10%에서 약 40%로 올라간 반면, 미국 오픈 모델은 2530% 사이에서 정체했다. 크기에서 유일하게 Qwen3.8-27B가 Code Arena 톱 10에 진입했고, GLM-5.3은 다중 시도 기준으로 GPT-5.6 Sol과 Claude Fable 5를 DeepSWE에서 2.15.4배 낮은 비용으로 넘어섰으며, IBM은 Granite 4.2를 네 가지 양자화 변형과 14개 GGUF 포맷으로 첫날부터 공개했다 — 같은 논리가 반복된다. 가중치를 여는 일은 더 이상 따라잡기의 제스처가 아니라, 다른 이들의 기본 인프라가 되는 방식이다. 다만 Nathan Lambert가 직접 짚듯, 발표는 출시보다 뒤처지며, 이런 곡선은 현재의 선호보다 진행 중인 작업을 보여준다.

그리고 웹은 눈이 아니라 에이전트가 읽는 것을 준비하고 있다. WebMCP Challenge는 상금이 3만 5천 달러인 대회로, 금액만 보면 크지 않다. 하지만 그보다 중요한 것은 이 대회가 드러내는 바다. Chrome, Cloudflare, Shopify, Vercel, Render, Netlify가 OpenAI와 함께 사이트가 에이전트에게 인터페이스를 추측하게 두는 대신 구조화된 도구를 노출하도록 요구하는 표준에 동참하고 있다. 같은 날 ChatGPT desktop은 WebMCP를 기본적으로 사용할 수 있고, Codex는 호환 애플리케이션을 생성하고 배포할 수 있으며, OpenAI는 노트북 도구에서 이 프로토콜의 내부 사용법을 문서화했다. 이러한 수렴은 Rohlik이 50개가 넘는 MCP 통합과 함께 설명한 내용, 즉 새로운 도구는 첫날부터 에이전트가 접근 가능해야 한다는 원칙과 맞닿아 있다. 에이전트를 위한 인터페이스 층은 더 이상 연구 주제가 아니라 엔지니어링 요구사항이 된다.


출처