검색

Gemini 3.8 Flash, 3분의 1 가격으로 최상위 모델 수준 달성, Meta의 Muse Spark 1.3, Code Arena WebDev 선두에 오른 Qwen3.8-Max-0902

ai-powered-markdown-translator

gpt-5.6-sol로 프랑스어에서 한국어로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

9월 2일 하루 동안 49건의 발표가 나왔으며, 이는 이번 모니터링을 시작한 이래 세 번째로 많은 수치다. Google의 Gemini 3.8 Flash, Meta Superintelligence Labs의 Muse Spark 1.3, Alibaba의 Qwen3.8-Max-0902라는 세 가지 주요 모델이 같은 날 출시됐지만, 어느 모델도 단순 점수 경쟁을 전면에 내세우지는 않았다.

이번 소식에는 네 가지 흐름이 관통한다. 먼저 세 번의 출시 모두에서 핵심 논거가 된 가격이다. 다음은 데스크톱 컴퓨터에서 동영상 생성이 가능해지고, 같은 날 저녁 코드가 공개된 Apple Silicon 추론 엔진이 등장한 로컬 추론이다. 또 하나는 GitHub가 한 모델에는 데이터 보존을 의무화하고 다른 모든 모델에는 기본값을 선택할 수 있게 한 기업의 모델 거버넌스다. 마지막은 선별된 방어자에게만 제공되는 전용 모델과 Linux Foundation에 합류한 연합으로 대표되는 사이버 보안이다.


Gemini 3.8 Flash와 3.8 Flash Cyber, 같은 가격으로 더 많은 작업을 수행하는 모델

9월 2일 — Google은 Tulsee Doshi(제품 관리 선임 이사)와 Raluca Ada Popa(Google DeepMind의 Gemini 보안 책임자)의 이름으로 Gemini 3.8 Flash와 Gemini 3.8 Flash Cyber, 두 모델을 공개했다. 이는 6주 만에 세 번째 Flash 출시이며, 3.7 Flash가 나온 지는 불과 3주밖에 되지 않았다.

두 변형은 동일한 기반 지능을 공유하며, Google은 코드 및 추론 능력 향상의 일부가 사이버 보안 분야에서의 집중 훈련에서 비롯됐다고 명시했다. 방어 모델을 위한 작업이 범용 모델의 성능까지 끌어올렸다는 것이다. 출시 가격은 3.7 Flash와 동일하다.

Gemini 3.8 Flash 특성측정값
입력 가격토큰 100만 개당 0.75달러
출력 가격토큰 100만 개당 3.75달러
HLE-Verified54.9%

Google이 직설적으로 설명한 한 가지 사항은 개발자가 주목할 만하다. 이 모델은 더 많은 자원을 소비한다. 신뢰성 향상은 설계상의 선택에서 비롯됐다. 복잡한 작업에서 3.8 Flash는 추가 추론 단계를 수행하고 도구를 반복적으로 호출한다. 따라서 노력 수준이 높으면 토큰 비용도 증가하며, Google은 계산 효율이 더 중요한 작업 부하에서는 노력 수준을 낮추거나 3.7 Flash를 계속 사용할 것을 권장한다. 이전 버전도 계속 완전히 지원된다.

Cyber 변형은 더욱 이례적이다. 같은 날 시작된 Fairwind 프로그램을 통해 신뢰할 수 있는 방어자에게만 제공되며, 자율적인 취약점 발견과 특히 자동 수정을 목표로 한다.

사이버 보안 평가Gemini 3.8 Flash Cyber비교 기준
CyberGym Pass@1(C/C++ 취약점 발견)86.2%GPT-5.5-Cyber 85.6% · Mythos 5 83.8% · GPT-5.6 Sol 83.6% · 3.5 Flash Cyber 77.5%
20개 언어 대상 내부 벤치마크70% 이상C/C++에만 국한되지 않은 더 넓은 범위
CWE-Bench pass@1(수정, Collinear)47.2%선도적인 최전선 모델은 47.8%지만 비용은 훨씬 더 높음

내부 배포 수치는 절대적 우위보다는 가격 대비 성능이라는 포지셔닝을 뒷받침한다. Chrome Security 팀은 훨씬 큰 최고 상용 모델보다 2.6배 많은 유효 수정 사항을 얻었고, Wiz는 침투 테스트 벤치마크에서 2.35.2배 낮은 비용으로 7.59.7% 더 높은 재현율을 측정했다. Cloud Vulnerability Research 팀은 일반적으로 수개월이 걸리는 연구에서 2시간도 채 되지 않아 근본적이고 치명적인 취약점을 찾아냈다. 한편 범용 모델은 이미 Antigravity, Google AI Studio를 통한 Gemini API와 Android Studio, Stitch의 인터페이스 생성 기능, Gemini Enterprise에 배포됐으며, Google AI Pro 및 Ultra 구독자는 Gemini 앱, Google Search의 AI Mode, Google Sheets에서도 이용할 수 있다.

🔗 Gemini 3.8 Flash와 3.8 Flash Cyber 발표

출시 성능을 기록한 CursorBench 점수

Cursor는 발표 몇 시간 뒤 모델 선택기에 Gemini 3.8 Flash를 추가했으며, 자체 벤치마크는 에이전트 환경에서 이 모델의 성능을 보여주는 현재 가장 유용한 측정치를 제공한다. 같은 날짜의 CursorBench 기록에 따르면 3.8 Flash는 Gemini « Latest » 버전으로 승격됐고, 3.7 Flash는 보조 위치로 이동했다.

모델 및 노력 수준CursorBench 3.2 점수작업당 평균 비용작업당 단계 수
Fable 5.1 Max73.4%9.64달러70
Grok 4.6 Extra High70.8%2.81달러46
Fable 5.1 High69.4%4.80달러44
Opus 5 Extra High69.3%7.35달러72
Gemini 3.8 Flash High69.2%2.38달러161
Gemini 3.8 Flash Medium67.0%1.93달러136
Gemini 3.7 Flash High61.6%1.20달러99

핵심은 한눈에 드러난다. Gemini 3.8 Flash High는 69.2%로 Fable 5.1 High와 동등한 점수를 약 절반의 가격에 달성했고, Opus 5 Extra High와는 비슷한 점수를 3분의 1 가격에 냈다. 이전 세대와의 격차는 7.6포인트다. 다만 단계 수 열은 Google의 설계 선택에 따른 숨은 비용을 보여준다. 작업당 161단계로, Fable 5.1 High의 44단계보다 훨씬 많다. Cursor도 페이지 하단에 두 가지 단서를 달았다. 결과에는 편차가 있으며, 표시된 비용은 실제 청구서에서 측정한 값이 아니라 공개된 토큰 100만 개당 가격을 기준으로 재구성한 값이다.

🔗 Cursor의 Gemini 3.8 Flash · 🔗 CursorBench 결과


Meta Superintelligence Labs의 에이전트 모델 Muse Spark 1.3

9월 2일 — Meta Superintelligence Labs는 Muse Spark 1.2의 후속 모델인 Muse Spark 1.3을 공개했으며, 같은 날 Muse Code와 dev.meta.ai에서 접근할 수 있는 Meta Model API에 배포했다. Muse Voice Transcribe에 이어 이 연구소가 이틀 연속으로 내놓은 두 번째 모델이다.

이 모델이 내세우는 핵심은 점수 경쟁이 아니라 실제 사용성이다. 하나의 대화 흐름에서 여러 작업 흐름을 오가며 장기적인 업무를 수행하도록 설계됐다. 개방형 목표가 주어지면 도구를 사용해 무질서하고 서로 모순되는 출처에서 자체 맥락을 구성하고, 계획의 빈틈을 수정하며, 학습한 내용을 계속 기록한다. 가장 이례적인 부분은 협업 방식이다. Muse Spark 1.3은 지시가 모호할 때 명확히 하기 위한 질문을 하고, 막히면 사용자에게 도움을 요청하며, 결과를 수반하는 행동을 하기 전에 확인을 구하도록 훈련됐다. Meta 엔지니어들의 비교에 따르면 버전 1.2보다 도구 호출은 약 20%, 토큰은 약 25% 적게 사용하며, 이는 비용 청구에 직접 반영되는 차이다.

평가 범주벤치마크Muse Spark 1.3Muse Spark 1.2GPT-5.6 SolOpus 5
에이전트GDPVal-AA v2(지식 노동)1754161517101824
에이전트OSWorld 2.0(에이전트 기반 데스크톱 사용)66.947.662.768.3
에이전트DeepSearchQA(에이전트 기반 탐색)89.485.993.090.4
에이전트AutomationBench(종단 간 업무 흐름)49.438.246.750.3
긴 맥락MRCR 512K-1M98.155.573.8
코딩DeepSWE v1.1(장기 에이전트 코딩)75.455.073.074.0
코딩SWEAtlas CodeBase QnA59.446.253.552.7

이 표는 주의 깊게 읽을 필요가 있다. Muse Spark 1.3은 긴 맥락과 코딩에서 뚜렷한 우위를 보이지만, 여기서 선정한 네 가지 에이전트 평가에서는 Opus 5가 모두 앞선다. 무엇보다 비교 조건이 동일하지 않으며, 이는 Meta가 공개한 방법론에서도 명시돼 있다. Muse Spark 1.3과 1.2는 xhigh 노력 수준으로 평가됐지만, Claude Opus 5와 GPT-5.6 Sol은 max 모드로 평가됐다. 유일한 예외는 DeepSWE v1.1으로, Muse Spark 1.3도 max에서 측정됐다. 그러나 바로 이 모드는 아직 제공되지 않으며, Meta는 추가 보안 테스트가 완료된 뒤 출시할 예정이라고 밝혔다.

로드맵의 한 문단은 개방형 생태계 관점에서 주목할 만하다.

Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.

🇰🇷 더 큰 모델과 Muse Spark의 오픈 가중치 등을 포함한 추가 소식을 곧 전해드릴 예정이니 계속 지켜봐 주세요.@AIatMeta의 X 게시물

Meta가 오픈 가중치 출시를 크게 줄였던 한 해를 보낸 뒤 나온 약속이라는 점에서 의미가 크다. 다만 어떤 버전이 대상인지, 출시일과 범위가 무엇인지는 제시되지 않았다.

🔗 Muse Spark 1.3 소개


Qwen3.8-Max-0902, Code Arena WebDev 1위 차지

9월 2일 — Qwen은 주력 모델의 업데이트인 Qwen3.8-Max-0902를 공개했다. 날짜가 붙은 snapshot이며 qwen3.8-max-2026-09-02 별칭으로도 제공된다. 이 모델은 2조 4천억 개의 매개변수와 100만 토큰의 맥락 창이라는 8월 버전의 구조적 특성을 유지하면서, « Coding & Cowork »에 초점을 맞춘 추가 후속 훈련 단계를 거쳤다.

모델 특성공개된 값
매개변수2.4 T
맥락 창1 M tokens
최대 입력991 K tokens(thinking 모드에서는 983 K)
최대 출력131 K tokens
추론 예산262 K tokens
입력 및 출력 가격토큰 100만 개당 각각 2달러와 6달러
명시적 캐시 읽기토큰 100만 개당 0.17달러
암시적 캐시 읽기토큰 100만 개당 0.25달러
명시적 캐시 생성토큰 100만 개당 2.50달러
처리량 제한분당 1 M tokens, 분당 요청 15 K건

이 모델은 이미지, 텍스트, 동영상을 입력으로 받아들이며 Responses API를 통해 코드 인터프리터, 이미지 대 이미지 검색, 텍스트 대 이미지 검색, 웹 추출기, 웹 검색 등 다섯 가지 내장 도구를 제공한다. 같은 날 QwenCloud의 API를 통해 제공되기 시작했다.

같은 날 Arena.ai는 Code Arena WebDev 결과를 공개했다. Qwen3.8-Max-0902는 1,691점으로 종합 순위에 곧바로 1위로 진입했다. 이전 버전보다 22점 높고, Max 설정의 Claude Opus 5보다 3점, Max 설정의 Kimi K3보다 17점 앞선다. 토큰 100만 개당 혼합 가격이 5달러인 이 모델은 Arena의 파레토 최전선에서 가장 높은 점수를 기록한 위치를 차지했으며, 이는 전체 순위에서 점수 대비 비용이 가장 뛰어나다는 뜻이다.

범주별 세부 결과를 보면 전체 그림은 조금 달라진다. Data & Analytics와 Consumer Product에서는 1위, Brand & Marketing, Gaming, Simulations에서는 2위, Content Creation Tools와 Reference-Based Design에서는 3위를 기록했다. 따라서 이 모델은 창의적 작업보다 데이터 애플리케이션과 소비자 제품에서 더 강점을 보인다. Arena는 Agent Arena 점수도 추후 공개할 예정이다.

🔗 Qwen3.8-Max-0902 발표


추론이 클라우드를 떠나다: 데스크톱에서 실행되는 영상, 오픈 라이선스 로컬 엔진

이는 오늘의 근본적인 흐름이며, 어느 한 발표만으로는 설명되지 않는다. 두 건의 주요 공개와 네 건의 비교적 조용한 신호가 모두 같은 방향을 가리킨다. 어제까지만 해도 데이터 센터 GPU가 필요했던 작업을 로컬에서 실행하는 것이다.

9월 2일 — Hao AI Lab(UCSD)의 FastVideo 팀이 오픈 영상 모델 MiniMax H3의 증류 버전인 FastH3의 로컬 포팅을 공개했다. 지금까지 영상과 오디오를 동시에 생성하려면 데이터 센터 GPU가 필요했지만, 이제 이 모델은 NVIDIA DGX Spark 한 대, QSFP 링크로 연결한 DGX Spark 두 대 또는 최소 36GB의 통합 메모리를 갖춘 Apple Silicon Mac에서 실행된다.

주요 제약은 연산 능력이 아니라 메모리다. DGX Spark에는 약 270GB/s 속도의 128GB 통합 LPDDR5X가 탑재되어 있는데, 이는 데이터 센터용 HBM 대역폭의 약 10분의 1이며 실제 워크로드에 사용할 수 있는 용량은 121GB다. 따라서 파이프라인은 단계별로 진행된다. 프롬프트를 인코딩하고, 텍스트 인코더를 해제하고, transformer를 로드하고, 노이즈를 제거한 뒤 이를 해제하고, 마지막으로 VAE를 로드한다. 개별 GPU에서는 가중치를 호스트로 다시 복사하면 디바이스 메모리가 확보되지만, Spark에서는 이 복사본이 동일한 메모리 풀에 다시 들어간다. 팀은 이 과정을 제거하고 DiT를 GPU에 직접 로드하도록 바꿨다. 그 결과 transformer 로딩 시간은 445초에서 39초로, 124프레임의 768×1344 실행 시간은 772초에서 336초로 줄었다.

테스트 장비첫 번째 생성반복 생성
Apple M4 Max504 s465 s
DGX Spark264 s243 s
4x GB20010,2 s5,1 s

5초 분량의 1024×576 영상과 50단계를 처리하는 데 1,881초가 필요한 공개 DGX Spark용 vLLM-Omni 방식과 비교하면, 4단계 FastH3는 268초까지 내려가 약 7배 빠르다. 이 비율은 832×480에서 8.4배로 올라가고 1344×768에서는 7.9배로 낮아진다. M4 Max에서는 캐시되지 않은 프롬프트의 인코딩 시간이 약 80초에서 약 17초로 줄며, TAEH3 디코더는 최대 메모리 사용량을 11.0GiB에서 3.6GiB로 낮추면서 디코딩 시간을 102초에서 1초로 단축한다. MLX 가중치는 INT8, INT6, INT4 형식으로 Hugging Face에 공개되었고, 처음 공개된 FastVideo Cookbook도 함께 제공된다. 다음 목표로 발표된 것은 5090과 4090을 포함한 RTX 제품군이다.

같은 날 저녁, Perplexity는 Lily의 코드를 공개했다. Lily는 Mac에서 하이브리드 연산의 온디바이스 부분을 실행하는 로컬 추론 엔진이다. 이 엔진은 전날 연구 게시물에서 소개되었으며, 새로운 소식은 perplexityai/pplx-garden 저장소에서 Apache-2.0 라이선스로 코드가 공개되어 fabric-libpplx-unigram와 함께 제공된다는 점이다.

코드는 극단적인 특화 전략을 확인해 준다. Lily는 범용 엔진이 아니다. 그룹 크기 64의 MLX 형식으로 4비트 affine 양자화된 Qwen3.6-35B-A3B checkpoint 단 하나만 로드하며, 로딩 시 이를 검증한다. Dense Qwen checkpoint, 더 작은 변형, BF16, GGUF, AWQ, GPTQ, int8, fp8은 명시적으로 거부된다. Rust로 작성되고 시작 시 소스에서 컴파일되는 Metal kernel을 사용하는 이 엔진은 실행 경로에서 PyTorch도 MLX도 사용하지 않으며, 최소 macOS 26에서 제품군 10 이상의 Apple GPU, 즉 M5 이상을 요구한다. API 범위도 그만큼 제한적이다. route는 단 세 개뿐이고 디코딩은 항상 greedy 방식이며, sampling parameter, streaming, tool, multimodal 콘텐츠는 무시되지 않고 거부된다. 바로 이 제한성이 흥미로운 지점이다. Perplexity가 내놓은 것은 MLX-LM의 경쟁자가 아니라, 특정 플랫폼과 모델에 맞춤 제작한 엔진이 범용 framework를 능가한다는 증명이다.

이날 공개된 다른 네 건의 자료도 같은 방향을 가리키며 단신에서 다룬다. 17개 언어를 지원하는 17~42MB 규모의 번역 모델 TranslatePsy-Nano, 출력의 단 한 byte도 바꾸지 않고 MoE 모델의 expert를 NVMe에 상주시킨 i64 Systems의 작업, 기업에서 소형 모델을 적정 규모로 선택해야 한다고 주장하는 Cohere의 게시물, Perplexity의 Portable Computer를 로컬에서 실행하는 방법을 다룬 NVIDIA의 DGX Spark 라이브 방송이다. 각각만 보면 큰 비중을 차지하지 않지만, 모두 연산을 데이터 센터에서 디바이스로 옮기고 있다.

🔗 로컬 FastH3 · 🔗 Lily 코드 공개 · 🔗 pplx-garden 저장소


Anthropic이 Claude Commerce Agents 코드를 공개하다

9월 2일 — Anthropic이 상거래 agent 구축을 위한 Apache 2.0 라이선스 기반 참조 저장소인 Claude Commerce Agents를 오픈 소스로 공개했다. 이번 발표는 전자상거래 팀이 배포를 계획하는 연말 성수기에 앞서 의도적으로 이루어졌다.

이 blueprint에는 완전한 agent 두 개가 포함되어 있다. 구매 agent는 기업 애플리케이션 안에서 작동한다. 카탈로그를 검색하고, 자연어로 표현된 요청에 맞춰 상품 묶음을 구성하고, 고객 선호도를 기억하고, 대화 안에 상품·비교 결과·장바구니를 표시한 뒤 checkout으로 넘긴다. 같은 대화 흐름에서 고객 서비스 질문에도 답한다. 판매자 agent는 매장을 운영하는 팀을 대상으로 한다. 판매 분석, 프로모션 전 품절 상품 경고, 이력에 근거한 가격 추천, 캠페인 작성 기능을 제공한다.

저장소 구성 요소제공 내용
제공되는 agent구매 agent(고객용) 및 판매자 agent(back-office용)
실행 가능한 업종소매, 여행, 통신, 티켓 판매
RuntimeMessages API, Claude Agent SDK, Claude Managed Agents (beta)
배포 플랫폼Claude API, Amazon Bedrock, Microsoft Foundry, Google Cloud Vertex AI
Claude Code plugincommerce-builder@claude-commerce-agents
기술 요구 사항Python 3.11 이상, Node 22
이미 관찰된 결과Claude에서 구매 agent를 실행하는 소매업체의 경우 장바구니 규모가 최대 35% 커지고, 구매자가 결제를 완료할 가능성은 60% 증가

모델이 결정하는 것과 실제로 실행되는 것의 분리는 선언적이 아니라 구조적이다. 소비자 측에서 agent가 호출하는 backend interface에는 결제 method 자체가 없다. 판매자 측에서는 각 쓰기 tool이 서버에서 생성한 식별자와 함께 대기 상태의 변경 사항을 만들며, apply_change 함수는 실제 사람의 검증 interface를 통해 승인된 식별자에 대해서만 완료된다. Anthropic은 이것이 유지·관리되지 않고 contribution도 받지 않는 참조 구현이라고 명시한다. 계속 추적해야 할 dependency가 아니라 fork를 위한 출발점이다. 데모에 등장하는 모든 기업은 가상이며, 실제 주문이 이루어지거나 카드가 결제되는 일은 없다.

🔗 Claude Commerce Agents 발표 · 🔗 commerce-agents 저장소

기술 부문: 코드로 구현한 cache, latency, guardrail

같은 날 공개되고 Ali Shazal과 Matthew Koen이 작성한 이 blueprint의 엔지니어링 가이드는 소매업체, marketplace, 여행업체와 함께한 1년간의 작업을 요약한다. 첫 번째 조언은 통념을 뒤집는다. 여러 범주를 다뤄야 하는 agent를 위해 영역별 sub-agent를 만들지 말라는 것이다. 상거래 대화는 강하게 결합된 하나의 session이며, 이를 분할하면 품질이 저하된다. 역량은 agent 수를 늘리는 데서가 아니라 skill에서 나온다.

다루는 주제Anthropic이 제시한 수치
렌더링된 상거래 응답출력 token 500~700개
캐시된 token 읽기새로운 token 비용의 10분의 1
cache 쓰기약 1.25배의 추가 비용, 두 번째 사용부터 상쇄
목표 cache 적중률90~99%
캐시된 읽기의 속도token 약 100,000개에서 1.5~2배 빠름
memory의 효과내부 평가 모음에서 사실 회상률 13% 향상
흐름당 평가 사례시작 시 50~100개

모델 선택과 관련해서는 분석이 중심인 판매자 agent에는 Opus부터 시작하고, latency가 더 중요한 소비자 agent에는 Sonnet부터 시작할 것을 권장한다. 이후 각 모델과 각 effort 수준에서 전체 평가 모음을 실행하고, 모델 호출당 비용이 아니라 완료된 작업당 비용을 측정해야 한다. 안전성 부문은 모호한 여지가 없다.

The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.

🇰🇷 프롬프트는 안전한 행동이 시작되는 곳이지만, 상거래에서는 안전이 집행되는 곳이 될 수 없다. 실패는 금전적이며 대개 되돌릴 수 없고, 프롬프트 규칙은 단 한 번의 injection이나 잘못된 sample만으로도 우회될 수 있다.Anthropic, 효과적인 상거래 agent의 구조에 관한 가이드

따라서 네 가지 규칙이 코드로 적용되며, 세 runtime이 공유할 수 있도록 한 번만 정의된다. 모델은 준비하지만 사람이나 정책이 적용한다. 쓰기와 rendering은 서버가 발급한 식별자만 허용한다. 한도가 설정된 거래는 반복 요청에도 한도를 지켜야 한다. 제3자 콘텐츠는 정제된다.


Claude Code와 Claude Cowork에서 컴퓨터 제어가 백그라운드로 이동하다

9월 2일 — Claude의 컴퓨터 제어(computer use)가 더 이상 화면을 독점하지 않는다. 지금까지 이런 작업을 시작한다는 것은 자신의 컴퓨터를 내어주는 것과 같았다. Claude가 승인된 애플리케이션에서 작업하는 동안 다른 window가 숨겨졌기 때문이다. 이제 Claude Cowork와 데스크톱 애플리케이션의 Code 탭 모두에서 사용자가 다른 일을 계속하는 동안 작업이 백그라운드에서 진행된다.

이 변경 사항은 beta이며 Pro 및 Max 요금제 전용이고 macOS로 제한된다. 반면 computer use 자체는 macOS와 Windows에서 계속 research preview로 제공된다. 이미 이 기능을 사용하던 사람은 별도로 활성화할 것이 없다. 다른 사용자는 Settings > General에서 이 기능을 찾을 수 있으며, macOS에서는 손쉬운 사용 및 화면 기록 시스템 권한도 필요하다.

보안 체계는 바뀌지 않는다. sandbox에서 실행되는 Bash tool과 달리 computer use는 실제 desktop에서 실행된다. 접근 수준은 애플리케이션 범주별로 고정되며 변경할 수 없다. browser와 trading platform에는 보기 전용, terminal과 IDE에는 클릭 전용 권한이 부여되어 Claude가 화면 제어 대신 전용 tool을 사용하도록 유도하며, 나머지에는 완전한 제어 권한이 주어진다. 승인은 현재 session 동안 유효하며, Dispatch에서 시작한 session에서는 30분 동안 유효하다.

🔗 백그라운드 computer use 발표


Cursor가 고객 관리 장비에서 cloud agent를 실행하다

9월 2일 — Cursor가 Jack Pertschuk 명의의 제품 게시물을 공개하며 고객 소유 infrastructure에서도 cloud agent를 실행할 수 있도록 했다. 지금까지 Cursor cloud agent는 Cursor의 cloud에 있는 전용 virtual machine에서 실행되었다. Self-Hosted Machines를 사용하면 tool 실행은 기업 network 내부의 장비로 이동하고, agent loop, inference, planning은 계속 Cursor에서 처리된다.

이 조치를 뒷받침하는 수치는 서두에 제시된다. 이제 cloud agent가 Cursor 내부에서 merge되는 pull request의 60% 이상을 생성한다. 작업에서 이 agent들이 차지하는 비중이 커질수록 이들이 실행되는 장비는 더 이상 사소한 문제가 아니다. Cursor는 팀이 자체 장비를 선택하게 되는 세 가지 상황을 제시한다. source manager 및 내부 서비스에 직접 연결된 상태로 tool을 실행해야 할 때, iOS 개발을 위한 GPU나 Mac 같은 특수 hardware가 필요할 때, 또는 cloud agent image로 패키징하기 어려운 운영체제를 실행해야 할 때다.

구성 요소기술 세부 사항
등록 명령agent worker start, 장시간 유지되는 외부 방향 HTTPS 연결
연결 방향Cursor는 고객 network로 들어오는 연결을 절대 시작하지 않음
사용 가능한 구성My Machines(개별 workstation 또는 VM) 및 Pools(팀의 공유 queue)
비활성 후 재개snapshot을 통한 hibernation, 동일한 worker 식별자로 복원
sandbox 제공업체AWS Lambda, Cloudflare, Coder, Daytona, E2B, Modal, Namespace, Vercel
컴퓨터 제어Chrome 또는 Chromium을 통해 Mac에 더해 Linux도 지원

Pool은 요청 queue를 감시하고 팀이 제공한 script로 장비를 시작하는 controller를 통해 확장된다. 사용 가능한 worker가 없으면 요청은 대기한다. Cursor는 장비를 초기화하거나 계속 켜 두는 방식 사이의 중간 선택지로 hibernation을 도입했다. 두 방식 모두 비용이 크기 때문이다. 비활성 장비의 snapshot을 생성한 뒤 종료하고, 재연결 가능 시간 안에 다시 실행 요청이 들어오면 snapshot을 복원한다. Pool은 특정 저장소에 연결되지 않으므로 동일한 queue가 여러 저장소를 지원할 수 있다.

게시물 자체에서도 한 가지 한계를 밝힌다. 이동하는 것은 실행 환경뿐이다. Tool 출력은 inference를 위해 Cursor로 다시 전송되며 코드를 포함할 수 있고, agent transcript도 그곳에서 처리되고 저장될 수 있다. 따라서 이는 완전한 격리가 아니라 실행 장소의 이동이다.

🔗 Self-Hosted Machines


Claude Fable 5.1, 통합 서비스에서 정식 출시

9월 1일과 2일 — 출시 당일 Claude Fable 5.1이 GitHub Copilot에서 정식 출시되었고, 다음 날 Genspark가 이를 Code Agent와 Claw에 통합했다. 이틀 동안 같은 모델을 도입한 통합 서비스가 두 곳이라는 점에서, 이는 서로 무관한 두 소식이 아니라 도입의 물결이다.

GitHub에서는 Visual Studio Code, Visual Studio, Copilot CLI, coding agent, GitHub Copilot 애플리케이션, github.com, iOS 및 Android용 GitHub Mobile, JetBrains IDE, Xcode, Eclipse까지 광범위하게 지원하며, Pro+, Max, Business, Enterprise 요금제에서 점진적으로 배포되고 공급자의 공개 요금이 적용된다. 그러나 이번 제공에서 가장 주목할 만한 부분은 기술이 아니라 계약 조건이다.

접근 조건Fable 5.1에 적용되는 사항
관리자 정책기본적으로 비활성화되며 명시적으로 활성화해야 함
데이터 보존Anthropic의 안전 분류기를 위해 기본적으로 의무 적용
보존 데이터의 사용Anthropic 모델 학습에는 사용하지 않음
다른 Claude 모델Fable 5와 Fable 5.1을 제외하고 무보존 유지
무보존 예외자격을 갖춘 기업에 역년 말까지 적용
예외 종료 후Enterprise Frontier Safeguards 필요

Copilot의 다른 Claude 모델과 달리 Fable 5.1은 기본적으로 데이터 보존을 요구한다. Anthropic은 안전 분류기를 작동시키기 위해 프롬프트와 출력을 보존한다. 따라서 정책을 활성화하는 것은 이 제약을 명시적으로 수락하는 것이며, 비활성 상태로 두면 모델을 사용할 수 없다. 우회책은 일시적이고 선별적이다. 자격을 갖춘 기업은 Anthropic이 자동화된 안전 모니터링과 고객이 제어하는 저장 및 암호화 키를 제공할 Enterprise Frontier Safeguards를 배포할 때까지 역년 말까지 무보존 상태를 유지할 수 있다. 자격은 셀프서비스로 얻을 수 없다. 지원팀이 우회할 수 없는 GitHub 영업팀을 거쳐야 하며, 승인을 받아도 아무 기능도 자동으로 활성화되지 않는다.

한편 Genspark는 벤치마크나 요금 세부 정보 없이 출시 첫날부터 Genspark Code Agent와 Claw에 통합했다고 밝혔다. 이 업체는 모델 출시 후 몇 시간 만에 전환한 Cursor, Devin, Warp, v0, Amp, Perplexity Computer 등의 에이전트 플랫폼 대열에 합류했다.

🔗 GitHub Copilot의 Fable 5.1 · 🔗 Genspark 발표


GitHub, 품질 저하 없이 Copilot 비용을 낮춘 방법 공개

9월 2일 — GitHub는 Napalys Klicius와 함께 Erik Kristensen이 작성한 Copilot 비용 절감 엔지니어링 글을 공개했다. 이 분야의 글로서는 이례적으로 수치를 제시하고 실패한 실험을 설명하며, 자명해 보이는 최적화가 왜 역효과를 낼 수 있는지 밝힌다.

도입부의 주장은 직관에 반한다. 단일 상호작용의 토큰 수를 세는 것으로는 효율성을 측정할 수 없다. 간결한 도구 응답에서 에이전트에 필요한 정보가 빠지면 명령을 다시 실행해야 하므로, 결국 작업 전체가 더 느리고 비싸진다. GitHub는 읽기 전에 셸 출력을 줄이는 유틸리티인 RTK(Rust Token Killer)를 통해 이 함정을 설명한다. 실제로 일부 응답은 짧아졌지만 이후 복구 단계에서 상호작용 횟수가 늘어났다. 국소적으로 절약한 토큰을 전체적으로 다시 소비한 셈이다. 따라서 배포되지 않았다.

평가한 변경 사항측정된 효과
오프라인 테스트에서 줄 번호 제거추론 비용 약 5% 감소
CLI 프로덕션 환경에서 줄 번호 제거사용자당 일평균 비용 약 3% 감소
task 도구 프롬프트 압축상호작용당 1,300토큰 제거, 활성 시간당 정규화 비용 2.9% 감소
완료된 백그라운드 작업을 직접 전달AI Credits로 측정한 토큰 관련 사용량 약 2.3% 감소
Copilot code review에서 줄 번호 제거 및 압축두 변경 사항 각각 검토당 프롬프트 토큰 약 5% 감소
이전의 공유 파일 도구로의 마이그레이션검토 비용 약 20% 감소
RTK(Rust Token Killer)제외됨, 테스트한 구성에서 전체 비용 증가

채택된 압축 정책은 의도적으로 보수적이며 세 부분으로 구성된다. 소스 코드처럼 보이는 출력은 그대로 보존하고, 아무것도 삭제하지 않은 채 검색 결과를 재구성하며, 설치·빌드·테스트에서 반복되는 잡음만 압축한다. git diff 압축도 초기 버전에 포함되었지만, 벤치마크 작업에서 에이전트가 원본 출력을 다시 여는 것으로 나타나 제거되었다.

가장 교훈적인 사례는 프롬프트 압축이다. Copilot이 자체 지침을 반복적으로 다시 작성하는 메타 프롬프팅 루프를 통해 task 도구의 프롬프트를 절반으로 줄였지만, 첫 온라인 실험에서 오프라인 평가가 놓친 성능 저하가 드러났다. 루프가 병렬 처리에 관한 신중한 지침을 엄격한 순서 지정 규칙으로 바꾸면서 서로 독립적인 에이전트까지 직렬화한 것이다. 수정안에서는 허용 목록과 차단 목록을 모델에 판단을 맡기는 한 문장으로 대체했다. 마지막이자 가장 유용한 교훈은 개선 효과를 한 제품에서 다른 제품으로 그대로 옮길 수 없다는 점이다. Copilot code review에서 얻은 좋은 결과를 바탕으로 더 간결하게 만든 지침 세트는 Copilot CLI의 비용을 오히려 증가시켰다.

None of these changes made the model smarter. They removed work the model never needed to do.

🇰🇷 이 변경 사항 중 어느 것도 모델을 더 똑똑하게 만들지는 않았다. 단지 모델이 애초에 할 필요가 없었던 작업을 없앴을 뿐이다.GitHub Blog, AI 코딩을 더 비용 효율적으로 만드는 방법


재편되는 Copilot 모델 카탈로그

9월 1일과 2일 — 같은 시기에 공개된 두 개의 변경 기록은 동일한 재편의 양면을 보여준다. Copilot 카탈로그에서 무엇이 빠지는지, 그리고 이제 누가 기본 모델을 결정하는지에 관한 내용이다.

9월 1일부터 Copilot Chat, 온라인 편집, ask 및 agent 모드, 코드 완성 등 대부분의 Copilot 환경에서 모델 6개가 지원 중단된다.

제외되는 모델GitHub가 제안하는 대안
Gemini 3.1 ProGemini 3.7 Flash
Claude Opus 4.5Claude Opus 4.7, Claude Opus 4.8 또는 Claude Opus 5
Claude Opus 4.6Claude Opus 4.7, Claude Opus 4.8 또는 Claude Opus 5
Claude Sonnet 4.5Claude Sonnet 5
Claude Sonnet 4.6Claude Sonnet 5
Raptor MiniMAI-Code-1.1-Flash

한 가지 예외는 남아 있다. 연간 요금제를 이용하는 개인 구독자는 Claude Sonnet 4.6을 계속 사용할 수 있다. 사용자 측에서 별도의 조치를 할 필요는 없지만, Copilot Enterprise 관리자는 정책에서 대체 모델을 명시적으로 활성화해야 할 수 있다. 그렇게 하지 않으면 해당 모델이 VS Code나 github.com에 나타나지 않는다.

동시에 기업 관리 설정에서는 이제 어떤 모델이든 새 대화의 기본값으로 지정할 수 있다. 설정 단위는 기업보다 더 세밀하다. 관리자는 model 키를 overridable로 선언하고 team-mappings.json의 팀 구성 파일을 편집해 각 팀이 자체 기본값을 선택하도록 할 수 있으며, 적용 대상이 아닌 사용자는 전역 설정을 상속한다. 이 기능은 Copilot Business와 Copilot Enterprise의 GitHub Copilot 애플리케이션, Copilot CLI, Visual Studio Code에서 정식 출시되었다.

🔗 지원 중단 모델 · 🔗 기업 기본 모델


8월 Ship Log: Slack과 Teams의 Copilot 및 CLI의 미디어 지원

9월 1일과 2일 — GitHub가 X Article 형식으로 공개한 월간 요약은 홍보성 콘텐츠지만, 그동안 알려지지 않았던 8월 출시 내용을 담고 있다. 이제 Slack과 Microsoft Teams에서 GitHub Copilot을 사용할 수 있다. 이 통합은 Copilot CLI와 GitHub Copilot 애플리케이션의 에이전트 기능을 팀 대화로 가져온다. GitHub를 멘션하면 대화 흐름을 벗어나지 않고 변경 사항을 계획하고, 문제를 조사하거나, 코딩 작업을 전달할 수 있다.

8월 Ship Log 항목출시 내용
Slack과 Microsoft Teams의 CopilotCopilot CLI 및 Copilot 애플리케이션의 에이전트 기능
Copilot code review, Balanced 깊이Lite와 함께 정식 출시, 조직 또는 저장소별로 기본값 설정 가능
다시 소개된 새 모델Gemini 3.7 Flash, MAI-Code-1.1-Flash, Fireworks AI가 호스팅하는 Kimi K3
GPT-5.6 Sol 프로모션9월 3일까지 반값
자동 선택 프로모션Copilot Max 사용자에게 30% 할인
GitHub Copilot Day2026년 9월 10일

이 요약은 Lite와 함께 정식 출시된 Copilot code review의 Balanced 깊이도 설명한다. Balanced는 pull request를 더 심층적으로 분석하는 데 적합하고, Lite는 직접적인 변경 사항에 적합하며, 기본 깊이는 조직 또는 저장소 수준에서 설정할 수 있다.

이번 달의 또 다른 출시는 명령줄 측면의 기능을 완성한다. gh v2.99.0부터 제공되는 GitHub CLI의 반복 가능한 --attach 플래그는 로컬 이미지나 동영상을 업로드한 뒤 issue, pull request 또는 댓글에서 인라인으로 참조한다. Markdown을 작성하는 6개 명령에서 사용할 수 있으며, 기존 Markdown을 처리하는 방식 덕분에 실용성이 높다. 본문에서 이미 참조된 로컬 경로는 그 자리에서 다시 작성되므로 ![alt](./login.png)는 대체 텍스트를 유지하면서 업로드된 자산을 가리키게 된다. 대체 텍스트는 경로의 # 뒤에 입력한다. 지원 형식은 PNG, JPEG, GIF, WebP, SVG, MP4, MOV, WebM이며, 유료 요금제에서는 이미지 10MB, 동영상 100MB까지 허용된다. 이 버전은 GitHub Enterprise Server를 지원하지 않는다. GitHub는 코딩 에이전트도 이 기능을 이어받아 이제 결과를 설명하는 대신 직접 보여줄 수 있다고 명시적으로 강조한다.

🔗 2026년 8월 Ship Log · 🔗 GitHub CLI의 미디어


Fairwind Program, 신뢰할 수 있는 방어자를 위한 Google의 사이버 방어 프로그램

9월 2일 — Google은 Gemini 3.8 Flash Cyber와 같은 날 이 모델의 배포 경로인 Fairwind Program을 출시했다. 보안 및 개인정보 보호 담당 부사장 Four Flynn이 제시한 논리는 방어팀이 직면한 구체적인 딜레마에서 출발한다. 거대하고 비용이 많이 들며 기업 코드베이스에서 통제하기 어려운 최첨단 모델을 도입할 것인지, 아니면 복잡한 취약점 수정에 어려움을 겪는 더 작은 오픈 가중치 모델을 택할 것인지의 문제다.

이에 대한 답은 Gemini 3.8 Flash Cyber와 Google의 자동 수정 도구인 CodeMender를 결합하는 것이다. 핵심 주장은 탐지가 아니라 해결에 있다. 취약점을 찾아내는 것은 인식과 두려움을 키우지만, 자동으로 찾아 수정하는 것은 보안을 제공한다는 것이다. 고객 조직의 안전한 클라우드 환경 안에서 수주가 아니라 수분 만에 검증되고 배포 가능한 수정 사항을 생성하겠다는 약속이다.

접근은 의도적으로 단계별로 이루어지며 세 집단에 우선권이 주어진다. 정부와 국가 사이버 당국, 의료·통신·에너지·금융망의 중요 인프라 운영자, 핵심 기술 플랫폼이다. 참여 조직은 접근 권한을 내부 사이버 보안팀, 사고 대응팀 또는 침투 테스트팀으로 제한하고 다중 인증과 같은 보호 조치를 배포하는 등 엄격한 제약에 동의한다. Google은 전 세계에서 650개 이상의 파트너가 참여한다고 밝혔다. 프로그램 밖에서도 모든 Google Cloud 고객은 AI Threat Defense와 함께 Gemini Enterprise Agent Platform에서 공개된 모델을 사용해 CodeMender를 이용할 수 있다. 또한 Google은 Google.org를 통한 누적 사이버 보안 지원금이 1억 달러를 넘어섰다고 밝혔다. 여기에는 미국의 병원, 교육구, 지방자치단체 서비스 1,250곳 이상을 지원한 사이버 클리닉 35곳에 제공된 3,600만 달러가 포함된다.

🔗 Fairwind Program


Google 명령줄 도구: 이틀 동안 세 가지 버전 출시

9월 1일과 2일 — Google은 이틀 동안 동일한 범위에서 세 가지 버전을 출시했으며, 이를 종합하면 우선순위가 분명하게 드러난다. 기능은 줄이고, 격리와 안정성은 강화하는 것이다.

출시 버전날짜주요 내용
Gemini CLI v0.58.09월 1일보안 중심 변경 7건, stable 채널로 승격
Antigravity CLI 1.1.239월 1일개선 2건, 수정 11건
Antigravity 2.12.09월 2일개선 7건, 수정 9건

Gemini CLI의 stable 채널은 v0.58.0으로 전환됐다. preview v0.59.0이 공개된 지 32분 만에 이루어진 승격이라 별다른 주목을 받지 못했다. 내용은 거의 전적으로 방어적 조치로 구성된다. 가장 실질적인 수정은 macOS sandbox에 적용됐다. 이제 Seatbelt 프로필이 Docker 및 컨테이너 runtime의 socket과 binary를 격리해 전형적인 탈출 경로를 차단한다. 격리된 process가 host의 Docker socket에 접근하면 실제로 sandbox를 벗어날 수 있기 때문이다. 그 밖의 두 가지 변경은 핵심부를 강화한다. 무시된 경로를 처리할 때 symbolic link 평가가 일관되게 이루어지며, 최상위 안전성 검사기가 쓰기 정책 구성에 명시적으로 선언된다.

Antigravity 2.12.0에는 두 가지 새로운 기능이 추가됐다. 응답 인용 기능을 사용하면 응답의 일부를 강조 표시해 다음 prompt의 context로 다시 삽입할 수 있다. 이는 긴 agent session에서 일상적으로 발생하는 문제에 대한 직접적인 해법이다. 유료 사용자 전용인 /boost 명령은 multi-agent 추론 pipeline을 통해 사고 노력을 강화한다. 이 기능은 Google이 더 많은 token을 사용하는 대신 더 열심히 작동한다고 밝힌 Gemini 3.8 Flash와 같은 날 출시됐다. 두 움직임 모두 사용자가 노력 수준을 명시적으로 제어할 수 있게 한다는 점에서 같은 방향을 향한다. 나머지는 실질적인 불편을 해소한다. 일반 설정에서는 어떤 project가 설정값을 재정의하는지 표시하며, 분할 화면 terminal 배치는 window를 다시 불러온 뒤에도 유지되고, 받아쓰기가 실행되는 동안에도 메시지를 보낼 수 있다.

마지막으로 Antigravity CLI 1.1.23은 각 단계가 아니라 하위 trajectory마다 한 번씩 trajectory metadata를 전송해 subagent streaming을 가볍게 만들고, /model에 희미한 안내 문구로 표시되는 추천 model 이름을 Tab으로 적용할 수 있게 한다. 11건의 수정에서는 일상적으로 성가신 결함들이 드러난다. prompt hook으로 인한 crash, Gemini model의 history를 재구성할 때 누락되던 tool call ID, 읽기 쉬운 작업 설명 대신 일반적인 제목을 표시하던 권한 요청 등이 포함된다. 설명조차 하지 않은 작업을 승인해 달라고 요구한다는 점에서 이는 실제로 심각한 문제다. 또한 enable_mcp_tools=true으로 선언된 subagent는 MCP dispatcher가 없어 실패했다.

🔗 Gemini CLI v0.58.0 출시 노트 · 🔗 Antigravity 변경 기록


Gemini Notebook의 Short Video Overviews가 70개 이상의 언어로 확대

9월 1일 — Gemini Notebook은 Short Video Overviews를 70개 이상의 언어로 확대하고 영어 변형 세 가지를 새로 추가했다. 이 기능은 notebook의 source를 약 60초 길이의 세로형 video로 변환하며, 이제 사용자의 언어로 생성할 수 있다.

이번 배포는 web과 mobile에 적용되며 Ultra 및 Pro 구독자에게만 제공된다. 다만 팀은 같은 게시물에서 Pro 사용자 대상 배포가 아직 완료되지 않았다고 밝혔다. 발표에는 두 가지 세부 사항도 포함됐다. notebook에 들어 있는 source 수는 token 사용량 계산에 포함되지 않으며, Pro 사용자는 계속 영어로 Cinematic Video Overviews를 생성할 수 있다. 영어에서 70개 언어로의 확대를 통해 이 기능은 시연 수준을 넘어 영어권 밖에서도 실제로 사용할 수 있는 도구가 됐다.

🔗 Gemini Notebook 발표


편집기가 model multiplexer로 변모하다

9월 1일과 2일 — 겉보기에는 관련이 없는 두 발표가 동일한 흐름을 보여준다. 개발 환경이 외부 model에 접근하는 지점이 되고, 차별화 요소는 model의 품질에서 model이 실행되는 조건으로 이동하고 있다.

Zed는 stable 버전 1.18.0을 공개했으며, 가장 중요한 내용은 출시 노트의 AI 부분에 담겨 있다. 이번 버전에서는 최근 출시된 여러 model을 한꺼번에 따라잡았다. Amazon Bedrock에서 GPT-5.6의 100만 token context window를 지원하고, Gemini 3.5 Flash-Lite가 Google AI model 목록에 추가됐으며, Grok 4.5와 Grok 4.6이 xAI model에 합류했다. 전날 출시된 Claude Fable 5.1 지원도 개선됐다. 이 네 항목 가운데 두 가지는 출시 노트에서 외부 기여로 명시돼 있다. agent 작업에 특화된 사용성 개선도 추가됐다. 끊어진 외부 agent 연결을 재시작 없이 다시 불러올 수 있고, 긴 session의 memory 사용량이 줄었으며, 연결 오류에 접근할 수 없는 host의 이름이 표시된다. MCP server를 연결하는 사용자라면 주목할 수정도 있다. 표준이 아닌 scope를 요구하는 server에서 OAuth 인증이 실패하던 문제가 해결됐다.

한편 Mistral은 자사의 coding agent인 Vibe Code에서 Pro 및 Team 요금제 사용자가 GLM 5.2를 이용할 수 있도록 했다. 주목할 부분은 model 자체가 아니라 이를 제공하는 방식이다. Mistral은 유럽의 자체 infrastructure에서 이 model을 hosting한다. 따라서 유럽의 개발자가 Vibe Code에서 GLM 5.2를 사용하면 요청이 Z.ai server를 거치지 않고 Mistral이 수행하는 inference를 이용하게 된다. 이는 Mistral이 8월부터 내세운 지역별 inference 전략을 구체적으로 구현한 사례다. 동시에 Mistral이 자체 Devstral 계열을 보유하고 있으면서도 경쟁 연구소가 개발한 open-weight model을 자사 도구에서 제공하기로 했다는 점에서 더욱 시사적이다.

🔗 Zed 1.18.0 출시 노트 · 🔗 Vibe Code의 GLM 5.2


NVIDIA: engineering 게시물 두 편과 관할이 바뀐 alliance

9월 2일 — NVIDIA는 같은 날 기술 관련 게시물 두 편과 governance 관련 게시물 한 편을 공개했다.

model co-design 연재의 세 번째 글인 첫 번째 게시물은 speculative decoding 조정을 위한 다섯 가지 규칙을 제시한다. 기법 자체는 잘 알려져 있다. 작은 draft model이 여러 token을 제안하면 target model이 이를 한 번의 병렬 처리로 검증한다. 실무적인 문제는 여전히 남는다. 몇 개의 token을 추측해야 하며, 어떤 메커니즘을 사용해야 하는가? 검증 과정에서 연산량은 (1 + D)에 따라 증가하지만 memory access는 그대로 유지된다. 따라서 검증이 memory-bound에서 compute-bound로 전환되는 지점까지 draft 길이 D를 늘려야 한다. 대표적인 expert GEMM에서는 D = 7일 때 D = 0에 필요한 batch 크기의 8분의 1만으로 이 상태에 도달한다. attention이 decoding 시간을 지배하면 최적 길이는 D = 128/G − 1이 된다. 여기서 G는 하나의 KV head를 공유하는 query head의 수다. 그 이상에서는 G × (1 + D)가 attention kernel의 tile 크기인 128의 배수가 되는 값을 선택하는 편이 낫다. 측정에는 NVIDIA의 speculative decoding benchmark인 SPEED-Bench가 사용됐다. Qwen 3.5 122B A10B를 target으로 삼았을 때 외부 draft model인 35B A3B는 D = 9에서 acceptance length 6을 달성한다. 게시물은 흔히 간과되는 점을 강조한다. acceptance가 높다고 해서 가속 효과도 더 높은 것은 아니다. 마지막에는 경고도 덧붙인다. target을 fine-tuning하면 output distribution이 바뀌므로 특정 checkpoint에 맞춰 학습된 drafter는 target이 개선되더라도 acceptance가 낮아질 수 있다.

두 번째 게시물은 단일 예제를 중심으로 구성한 6단계 CUDA 최적화 과정이다. RGB 이미지 세 장을 grayscale로 변환한 뒤 각 32 × 32 pixel tile의 median을 계산한다. 출발점은 의도적으로 오류를 넣은 code이며, Compute Sanitizer가 즉시 문제를 진단한다. block index를 사용해야 하는 곳에서 global index를 사용해 shared memory 범위를 벗어나 쓰기가 발생한 것이다.

최적화 단계총시간단계별 향상
초기 code6,8 s
CUB (DeviceTransform 및 BlockRadixSort)635 ms약 10x
pool 방식 memory container약 244 ms약 2,6x
pinned memory25 ms약 10x
이미지당 하나의 CUDA stream23 ms누적 약 300x

직접 만든 bubble sort를 cub::BlockRadixSort으로 교체하는 것만으로도 median 계산 시간이 2,142 s에서 773 µs로 줄어들어 2717배 빨라졌다. 이 단계들 가운데 저수준 최적화에 해당하는 것은 없다. 모두 API를 교체한 결과다.

마지막으로 NVIDIA가 창립에 참여한 Open Secure AI Alliance가 Linux Foundation에 합류한다. 이 alliance가 내세우는 주장은 기존 논의의 초점을 바꾼다. agent는 단순한 language model이 아니라 model, context를 제공하는 harness, 수행 가능한 작업의 범위를 제한하는 guardrail로 구성된 software system이다. 그러나 안전성에 관한 논의는 대체로 model 자체에만 집중돼 왔다. 실제 보안은 harness, alignment mechanism, execution environment, identity, policy, observability, recovery를 포함한 전체 체계에 좌우된다. OpenSSF와 협력해 AI 관련 incident와 near miss를 기밀로 수집하는 체계인 SAFE(Shared AI Findings Exchange)에 대한 의견도 받고 있다.

🔗 Speculative decoding · 🔗 단계별 CUDA 최적화 · 🔗 Open Secure AI Alliance


Equinix Inference Exchange, 280개 data center에서 제공되는 open model

9월 2일 — Equinix는 NVIDIA와의 협력을 확대하고 Together AI를 새로 참여시킨 분산형 AI inference 프로그램인 Equinix Inference Exchange를 발표했다. 구성은 세 계층으로 이루어진다. Equinix는 Equinix Fabric을 통해 cloud와 연결된 물리적 기반을 제공하고, NVIDIA는 검증된 enterprise reference architecture를 제공하며, Together AI는 그 위에서 platform을 운영해 200개 이상의 open source model을 공유 배포 또는 전용 single-tenant environment 형태로 지원한다.

핵심 주장은 model 선택보다 inference의 위치에 있으며, 세 가지 사용 사례를 겨냥한다. 지연 시간을 줄이기 위한 도심 edge inference, 폐쇄형 proprietary model에서 개방형 대안으로 workload를 이전하는 경우, 규제 대상 기업을 위한 sovereign AI다. 규모를 보여주는 수치도 있다. 77개 대도시에 걸친 280개 이상의 data center, 230개의 cloud on-ramp, 상호 연결된 10,500개 이상의 기업으로 이루어진 network가 활용된다.

다만 일정과 관련해서는 주의해야 할 점이 있다. Equinix의 보도자료에는 solution이 2027년 1분기부터 제공된다고 명시돼 있지만, Together AI의 발표는 자사 platform이 이미 Equinix의 전 세계 data center에서 가동 중인 것처럼 설명한다. 이는 service 개시 발표가 아니라 partnership 및 roadmap 발표다.

🔗 Equinix 보도자료


benchmark가 실제로 무엇을 측정하는지 감사하는 Ai2의 방법론, BenchMIRT

9월 1일 — Ai2는 좀처럼 정면으로 다뤄지지 않는 질문을 제기하는 방법론인 BenchMIRT를 공개했다. benchmark가 실제로 측정한다고 주장하는 능력을 제대로 측정하고 있는가? 최종 score를 기준으로 판단하는 대신 각 질문의 수준까지 내려가 실제로 성공 여부를 결정하는 능력이 무엇인지 추정한다. 이 방법은 심리측정학에서 유래한 항목반응이론(Item Response Theory)의 다차원 변형을 기반으로 한다. 학습에는 open-weight model 100개, benchmark 16개, 질문 34,000개 이상의 결과가 사용됐다.

가장 확실한 성과는 방법론적인 부분이다. 각 benchmark가 무엇을 측정하도록 설계됐는지 알려주지 않았는데도 BenchMIRT는 안전성과 일반 추론이라는 두 가지 지배적인 차원을 스스로 도출했다. 처음부터 분석을 다시 실행해도 동일한 두 차원이 발견됐다.

감사 대상 benchmark추론과의 상관관계안전성과의 상관관계감사 결과
MMLU-Pro0,97-0,21명시된 목표에 부합
BBQ0,85-0,06안전성 test임에도 추론 능력을 반영
WMDP-0,890,21위험한 지식의 부재를 측정
ToxiGen0,40-0,32두 차원 모두 약하며 benchmark가 92 %에서 포화

model이 사회적 고정관념에 의존하는지를 시험하도록 설계된 BBQ는 일반 추론과 0,85의 상관관계를 보이지만 안전성과는 전혀 상관관계가 없다. 따라서 낮은 score는 model의 행동보다 추론 능력에 관해 더 많은 것을 말해줄 가능성이 있다. 두 번째 성과는 실용적이다. Ai2는 질문을 판별력에 따라 정렬하면 10 %만 남겨도 model 순위가 거의 동일하게 유지된다는 사실을 보여준다. 또한 관찰하지 않은 질문에 대한 응답을 79 %의 확률로 정확하게 예측해, 70 %를 기록한 단순한 접근법을 앞선다. 두 가지 한계도 인정한다. 학습에 사용된 model은 모두 2025년 3월 이전의 것이며, 발견되는 차원은 제공된 benchmark 집합에 따라 달라진다.

🔗 BenchMIRT


Runway Dev MCP, coding agent가 media integration을 직접 제어하다

9월 2일 — Runway는 자사의 개발자 platform을 일상적으로 사용하는 coding 도구인 Claude, ChatGPT, Codex 또는 Cursor에 직접 연결하는 hosted MCP server, Runway Dev MCP를 출시했다. 핵심 주장은 한 문장으로 요약된다. integration을 작성한 agent가 이제 그 integration에 알맞은 model을 선택하고, 의존하는 도구를 구성하며, 직접 debugging할 수 있다.

이 service는 integration의 세 단계를 모두 지원한다. 첫 API call 전에는 agent가 catalog를 조회해 project에서 사용할 수 있는 model, 가격, 필요한 input을 파악한 다음 선택한 model의 정확한 request schema를 가져온다. 추측하지 않고 첫 시도부터 올바르게 호출하는 것이 목적이다. production에서는 비용, 지연 시간 또는 품질에 따라 여러 model 가운데 하나를 선택하고 generation별 비용 상한을 설정하는 Model Router를 생성하고 구성할 수 있다. 특정 call에 router가 어떤 model을 선택했는지도 확인할 수 있다. 같은 방식이 Characters에도 적용된다. 세 번째 단계는 debugging이다. generation이 실패하면 agent가 정의된 도구를 통해 task를 조회하고 거부된 정확한 이유를 확인한다. moderation 거부, asset 크기 제한, 잘못 구성된 request body 등을 파악한 뒤 수정하고 다시 실행한다. Quickstart menu는 API key를 생성한 다음 미리 작성된 메시지와 함께 Claude Code, Codex 또는 Cursor를 연다.

🔗 Runway Dev MCP


DreamX-Creator 1.0, 단일 이미지에서 네이티브 2K 오디오·비디오 생성

9월 2일 — Alibaba의 AMAP 팀은 단일 이미지와 텍스트 프롬프트에서 시작해 비디오 모델과 오디오 모델을 연쇄적으로 연결하지 않고도 네이티브 2K로 동기화된 비디오 및 오디오 스트림을 생성하는 Apache 2.0 라이선스의 70억 매개변수 모델 DreamX-Creator 1.0을 공개했다.

시스템은 세 가지 구성 요소로 이루어진다. 점진적 공동 학습과 결합해 두 스트림 사이의 양방향 상호작용을 지원하는 게이트형 교차 모달 어텐션(Gated Cross-Modal Attention), 모달리티를 인식하는 멀티모달 피드백으로 구동되는 오디오·비디오 강화 학습, 그리고 움직임과 오디오의 시간 정렬을 보존하면서 비디오를 2K로 끌어올리는 단일 단계 자기회귀 개선이다.

현재 공개 범위는 여전히 제한적이다. 전날 개설된 GitHub 저장소에는 프로젝트 소개와 로드맵이 담겨 있으며, 기술 보고서는 arXiv에 게재됐다. 검증된 가중치, 추론 코드, 구성 및 평가 도구는 아직 달성되지 않은 이정표로 남아 있다. 이 작업은 Wan2.2와 OpenMOSS의 MOVA를 기반으로 하며, 두 프로젝트 모두 명시적으로 감사의 대상에 포함됐다.

🔗 DreamX-Creator 1.0 발표


OpenAI API, 지나치게 빠른 트래픽 증가와 모델 과부하를 구분

9월 2일 — OpenAI는 지금까지 클라이언트 애플리케이션이 구분할 수 없었던 두 가지 상황을 API가 알리는 방식을 변경했다.

HTTP 상태오류 코드의미대응 방법
429slow_down요청 처리량이 지나치게 빠르게 증가함Retry-After을 준수하고 처리량을 줄인 뒤 점진적으로 다시 높임
503server_is_overloaded요청한 모델이 일시적으로 과부하 상태임Retry-After을 준수한 뒤 다시 시도하고, 오류가 지속되면 대기 시간을 늘림

이러한 구분은 모든 재시도 코드에 즉각적인 실무적 영향을 준다. 문서에 따르면 트래픽이 조직의 분당 요청 및 토큰 한도 내에 있더라도 slow_down 오류가 발생할 수 있다. 이는 할당량 소진을 뜻하는 것이 아니라 증가 속도가 지나치게 가파르다고 판단됐음을 의미한다. 다시 말해, 애플리케이션은 표시된 한도를 전혀 초과하지 않았어도 제한될 수 있다. 처리량 제한 가이드에서는 경험칙으로 트래픽이 분당 입력 토큰 100만 개에 도달한 뒤에는 15분마다 50%를 초과해 늘리지 말라고 제안한다. Retry-After 헤더가 없을 때 OpenAI는 동일한 서비스의 모든 인스턴스가 동시에 재시도하지 않도록 짧은 무작위 지연을 포함한 지수 백오프를 권장한다. 사용량 기반 트래픽이 이러한 한도에 자주 부딪히는 조직에는 Scale Tier가, GPT-5.6 및 후속 모델에는 Reserved Tier가 권장된다.

🔗 OpenAI API 변경 기록


단신

  • Claude Code 2.1.258 — 수정 사항만 포함된 버전이다. 2.1.255부터 작동하지 않았던 macOS 12 Monterey의 시작 기능이 복구됐으며, 원격 및 예약 세션도 권한을 다시 승인한 뒤 더 이상 실패하지 않는다. 🔗 변경 기록
  • Claude Campus Ambassadors — 올해는 학부, 대학원, 박사 및 박사후과정의 세 가지 별도 경로로 지원을 받는다. 🔗 발표
  • Nokia, Cursor로 코드 5천만 줄 분석 — Core Networks 사업부의 엔지니어 두 명이 2주 만에 완료했으며, 팀은 원래 전문가 약 12명이 수개월간 투입돼야 할 것으로 예상했다. 독립적인 측정 절차가 없는 공급업체 사례 연구다. 🔗 사례 연구
  • TranslatePsy-Nano — Tether AI Research가 유럽 9개 언어용 EuroNano와 아프리카 8개 언어용 AfriNano라는 두 가지 소형 번역 모델 제품군을 공개했다. 각 언어 그룹당 하나의 체크포인트를 사용하며 42MB, 31MB, 17MB 버전으로 제공된다. 🔗 발표
  • Puffin-World — 세계를 물리, 기하학, 외형이라는 세 가지 네이티브 상태로 표현하는 통합 멀티모달 모델로, Puffin-16M 데이터세트와 함께 공개됐다. 🔗 소개
  • NVMe에 상주하는 MoE 전문가 — i64 Systems는 SHA-256 매니페스트 검증과 함께 전문가 가중치를 NVMe에 유지하고, 임대 경로와 상주 경로의 출력이 바이트 단위로 동일함을 측정했다. 🔗 기술 게시물
  • CiNet International Conference의 Sakana AI — 최고기술책임자 Llion Jones와 연구원 Kai Arulkumaran이 2026년 10월 5일부터 7일까지 Osaka에서 신경과학과 머신러닝을 잇는 연결 고리를 주제로 강연한다. 🔗 발표
  • Gemini CLI, 9월 2일 nightly — 변경 사항은 하나뿐이다. 8월 말부터 시작된 네트워크 보안 강화의 연장선에서 웹 검색 유틸리티의 대상 검증과 연결 라우팅이 개선됐다. 🔗 릴리스 노트
  • MrBeast, Google과 다년 파트너십 체결 — 이번 계약은 Beast Industries와의 관계를 YouTube 너머 Gemini 및 Google Health로 확장한다. 첫 영상은 9월 5일 공개되며, Gemini를 활용해 정글, 사막, 북극에서 생존하는 내용을 담는다. 🔗 발표
  • Google의 8월 AI 발표 요약 — 한 달 동안 이미 다룬 내용을 모은 월간 게시물로, 자체적인 새 소식은 없다. 🔗 요약
  • Enterprise Live Migrations 정식 출시 — 데이터 레지던시를 유지하면서 GitHub Enterprise Server 저장소를 거의 중단 없이 클라우드로 마이그레이션하며, gh elm 확장 프로그램으로 제어된다. AI와는 관련이 없지만 완전성을 위해 포함했다. 🔗 변경 기록
  • ElevenLabs, Ashley Kramer를 최고매출책임자로 임명 — 해당 기간 회사가 올린 유일한 게시물이며, 제품 변경 기록은 8월 24일 이후 갱신되지 않았다. 🔗 발표
  • NVIDIA, Perplexity의 Portable Computer에서 DGX Spark 라이브 방송 — 로컬 실행에 26분을 할애했으며 설명문이나 전사문은 없다. 이날 DGX Spark를 로컬 포팅 대상으로 삼은 두 번째 시연이다. 🔗 방송
  • Kling AI, MCP 서버의 Elements 문서화 — 장면 사이에서 캐릭터의 정체성을 유지하는 방법을 다룬 튜토리얼로, 제품 교육 자료이지 출시는 아니다. 🔗 튜토리얼
  • Codex CLI 0.152.1 — 0.152.0 출시 약 20시간 뒤 나온 수정 릴리스다. 이제 Guardian 승인 검토가 모델 메타데이터로 전달된 Node REPL 정책을 준수한다. 🔗 릴리스 노트
  • Cohere, 기업용 소형 모델 전략 옹호 — 공급업체는 Command R7B, 매개변수 33억 5천만 개의 Tiny Aya, Artificial Analysis의 Coding Index에서 33.4점을 받은 North Mini Code를 함께 제시하며 적정 규모 설정의 중요성을 주장한다. 새로운 출시는 없다. 🔗 게시물
  • Perplexity, 교육용 가이드 두 편 공개 — 개인 비서와 환각 탐지를 다룬다. 두 번째 가이드는 2단계 사후 학습을 설명하는데, 첫 단계에서는 제품 동작을 개발하고 두 번째 단계에서는 더 어려운 연구 과제를 활용한다. 🔗 가이드

이것이 의미하는 것

최전선 모델에서도 가격이 핵심 논거가 됐다. 같은 날 세 가지 제품이 출시됐지만 어느 것도 기록적인 점수를 앞세우지 않았다. Google은 Gemini 3.8 Flash에 이전 세대와 같은 요금을 유지하면서 모델이 더 많은 토큰을 소비한다는 점을 인정했다. 이는 드문 고백으로, 표시 가격이 아니라 작업의 실질 비용으로 가격 논의를 옮긴다. Qwen은 단순한 1위 대신 Arena 파레토 전선의 정점을 명시적으로 내세운다. Meta는 성능 향상을 벤치마크 점수가 아니라 도구 호출 20% 감소와 토큰 25% 감소로 수치화한다. CursorBench 표는 이날 가장 인상적인 척도를 보여준다. Gemini 3.8 Flash는 69.2%에서 작업당 2.38달러가 들지만, 비슷한 점수에 Fable 5.1은 4.80달러, Opus 5는 7.35달러가 필요했다. 다만 단계 수 열은 이 가격의 대가가 다른 곳에서 발생함을 상기시킨다. 44단계에 비해 161단계다.

하네스 엔지니어링이 측정 가능한 경제적 지렛대로 떠오르고 있다. GitHub의 글은 이러한 모델을 기반으로 구축하는 사람에게 이날 가장 유용한 문서다. 모델 자체를 건드리지 않고도 각각 25%를 절감하는 네 가지 최적화와 실패한 실험까지 기록했다. Anthropic의 엔지니어링 가이드도 반대편에서 같은 이야기를 한다. 설계 단계부터 9099%의 캐시 성공률을 목표로 하고, 호출당 비용이 아니라 완료된 작업당 비용을 보라는 것이다. 두 문서는 모델 경쟁이 가리는 한 가지 사실에 수렴한다. 모델이 같아도 하네스가 비용의 상당 부분을 결정하며, 개선 효과는 한 제품에서 다른 제품으로 그대로 이전되지 않는다. GitHub는 코드 검토에서 효과적이었던 최적화가 CLI에서는 비용을 높이는 사례를 통해 이를 입증했다.

추론이 워크스테이션으로 내려오면서 연산 위치가 설계 변수가 되고 있다. FastH3는 Mac이나 데스크톱 컴퓨터에서 비디오 생성을 실행하게 하고, Perplexity는 단일 하드웨어 유형에서 단 하나의 모델만 실행하는 엔진의 코드를 공개하며, Tether는 17MB 번역기를 출시했다. i64 Systems는 MoE 전문가를 NVMe에 상주시켰고, Cohere는 적정 규모 설정을 주장한다. 이 흐름은 지연 시간과 데이터 주권을 이유로 280개 데이터센터에 추론을 분산하는 Equinix, NVIDIA, Together AI의 상위 계층 움직임과 맞닿아 있다. 공통된 맥락은 소형화가 아니라 전문화다. Lily는 Apple Silicon에서 Qwen3.6-35B-A3B 이외의 모든 것을 거부하기 때문에 성과를 내며, Perplexity는 이러한 좁은 범위가 한계가 아니라 장점이라고 본다.

통제와 거버넌스가 강화되고 있으며, 이제 기술뿐 아니라 계약을 통해서도 구현된다. GitHub는 Fable 5.1에 데이터 보존을 의무화하면서도 해당 연도 말에 만료되는 예외를 제공하고, 각 기업 팀이 기본 모델을 선택할 수 있게 하는 한편 같은 날 카탈로그에서 모델 여섯 개를 제거했다. Cursor는 에이전트 실행을 고객 네트워크로 옮기면서도 전사문은 자사에서 계속 처리한다고 명시했다. Google은 서면 운영 조건에 따라 엄선된 파트너 650곳에만 사이버 방어 모델을 제공한다. Mistral은 유럽에서 중국 모델을 서비스하며 이를 강점으로 내세운다. 마지막으로 BenchMIRT는 이러한 결정의 일부가 의존하는 평가 도구 자체도 감사해야 한다고 상기시킨다. 일반 추론과 0.85의 상관관계가 있고 안전성과는 -0.06의 상관관계를 보이는 사회적 편향 벤치마크는 이름표가 주장하는 대상을 측정하지 않는다.


출처