검색

Anthropic에서 Claude Opus 5.5 출시, OpenAI가 GPT-6 Sol과 Luna 공개, Claude Code의 Pro 및 Team Standard가 Opus로 전환

ai-powered-markdown-translator

gpt-5.6-sol을 사용하여 프랑스어에서 한국어로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

9월 22일 화요일, Anthropic과 OpenAI가 두 시간도 채 되지 않는 간격으로 각각 최전선 모델을 출시했다. Claude Opus 5.5는 Fable 5.1과 동급이면서 Opus 5보다 비용이 40% 낮은 모델로 소개됐고, GPT-6 Sol과 GPT-6 Luna는 GPT-5.6 프로모션 요금보다 API 가격이 절반으로 낮아졌다. 두 모델군은 같은 날 GitHub Copilot, Devin, Perplexity에 도입됐으며, Claude Code 2.1.280은 Pro 및 Team Standard 요금제의 기본 모델을 Sonnet에서 Opus로 변경했다. Codex CLI 0.156.0, Anthropic의 상향된 사용량 한도, NVIDIA의 연이은 발표도 이날 소식에 포함됐다.


Anthropic, Claude 5.5 제품군의 첫 모델 Claude Opus 5.5 출시

9월 22일 — Anthropic이 새로운 Claude 5.5 제품군의 첫 모델인 Claude Opus 5.5(claude-opus-5-5)를 출시했다. Sonnet 5.5와 Haiku 5.5는 “향후 몇 주 안에” 뒤이어 출시된다. 오늘부터 Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud, Microsoft Foundry에서 사용할 수 있으며, Claude Code에서는 유료 요금제의 기본 모델이 된다. 컨텍스트 창은 100만 tokens, 최대 출력은 128,000 tokens이며, 2026년 6월까지의 지식을 안정적으로 갖추고 있다.

Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.

It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.

🇰🇷 새로운 Claude 5.5 제품군의 첫 모델인 Claude Opus 5.5를 소개합니다. 대부분의 작업에서 Claude Fable 5.1과 동급의 성능을 발휘하면서 운영 비용은 Opus 5보다 40% 낮습니다.@claudeai의 X 게시물

Anthropic에 따르면 이 40%는 일반적인 작업에서 “기본 설정”을 기준으로 측정한 수치이며, 더 낮은 가격과 작업당 더 적은 token 사용량을 합산한 결과다. 요금은 20% 인하돼 100만 tokens당 입력 4달러, 출력 20달러로 책정됐다. Opus 5의 요금은 각각 5달러와 25달러였다. 캐시 읽기 요금은 60% 낮아진 0.20달러다. 출력 생성 속도는 30% 이상 빨라졌으며, 연구 미리보기로 제공되는 빠른 모드(fast mode)는 8달러와 40달러에 최대 2.5배 빠른 속도를 제공한다.

Benchmark(Anthropic 수치)Claude Opus 5.5Claude Fable 5.1GPT-6 Astra
Terminal-Bench 4.066,4 %55,8 %57,9 %
FrontierCode v1.1 Main54,4 %50,3 %53,3 %
GDPval-AA v2.1 (Elo)184617351542
OSWorld 2.081,8 %80,7 %
AutomationBench40,0 %31,4 %41,4 %
Terminal-Bench-Science 0.158,7 %52,6 %64,6 %

Opus 5.5는 에이전트형 코딩, 사무 작업, 컴퓨터 사용에서 선두에 올랐지만, AutomationBench와 Terminal-Bench-Science에서는 GPT-6 Astra가 여전히 앞선다. Anthropic은 자사 점수가 프로덕션 안전장치를 활성화한 상태에서 측정돼 더 낮게 나왔을 가능성이 있다고 설명하며, Benchmark 격차가 이제는 “신뢰도가 떨어지는 지침”이 됐다고 평가한다. 실제 사용 시 Fable 5.1과의 차이는 이 수치보다 작다는 설명이다. 이 모델은 사이버 보안, 생물학, 증류 분야에서 Fable 5.1 수준의 안전장치를 적용해 출시된 최초의 Opus다. 대부분의 사이버 작업은 Opus 4.8로 전환된다. Anthropic은 이 모델이 자신이 평가받고 있다고 자주 의심하는 것으로 보인다는 점도 인정했다.

개발자는 마이그레이션 과정에서 설정을 조정해야 한다. 적응형 사고는 더 이상 비활성화할 수 없고, 도구 선택을 tool_choice에서 any 또는 tool으로 강제하면 400 오류가 반환된다. 기본 노력 수준은 Opus 5의 high에서 medium으로 변경된다. 두 도구 호출 사이에 작성된 텍스트는 이제 사고 블록에 포함되며, 기본 표시 설정에서는 빈 상태로 나타난다.

🔗 Claude Opus 5.5 소개 · API용 Opus 5.5의 새로운 기능


Claude Code 2.1.280에 Opus 5.5 도입, Pro 및 Team Standard를 Opus로 전환

9월 22일 — Claude Code 2.1.280이 Opus 5.5 발표 7분 뒤인 16시 38분(UTC)에 공개됐다. 2.1.279는 출시되지 않았다. CHANGELOG는 9월 19일의 2.1.278에서 114개 항목을 담은 이번 버전으로 곧바로 넘어갔다.

가장 눈에 띄는 변화는 모델에 관한 것이다. Opus 5.5가 기본 Opus 모델이 됐으며, Pro 및 Team Standard 요금제의 기본 모델도 Sonnet에서 Opus로 변경됐다. Max, Team Premium, Enterprise에는 이미 Opus가 기본값이었다. /effort이 모델별 설정으로 바뀌기 전에 저장한 노력 수준은 Opus 5.5 같은 새 모델에 더 이상 적용되지 않으며, 이 모델들은 각자의 기본 설정으로 시작한다. 한편 Opus 4.7, Opus 4.8, Fable 5는 더 이상 선택한 설정보다 높은 시작 노력 수준을 강제하지 않는다.

보안 측면에서는 심볼릭 링크를 통한 쓰기를 이제 실제 목적지를 기준으로 판단한다. 권한 요청에는 쓰기가 최종적으로 도달하는 위치가 표시되며, acceptEdits, 권한 규칙, 자동 모드는 더 이상 트리 외부로 이어지는 쓰기를 승인하지 않는다. 안전성 검사에서 응답이 없을 때 자동 모드가 작업을 쉬지 않고 반복적으로 거부하는 문제도 해결됐다. 이제 재시도 간격이 점차 길어지며, 연속으로 열 번 거부되면 해당 차례가 종료된다. 예약된 이름을 모방하는 plugin marketplace는 거부되며, CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH 변수를 사용해 MCP 도구 설명의 2,048자 제한을 변경할 수 있다.

나머지는 편의성 개선이다. y 또는 n 키만 눌러서는 더 이상 대화 상자를 확인하거나 닫을 수 없으며, 대신 Enter와 Escape를 사용한다. 대화 상자에서 Ctrl+C를 두 번 눌러도 Claude Code가 종료되지 않는다. prompt cache 중단 문제 두 건이 수정됐고, VS Code 확장 프로그램에는 입력형 명령 여섯 개(/status, /sandbox, /chrome, /export, /skills, /plan)가 추가됐다.

CHANGELOG 항목 범주항목 수
수정 사항(Fixed)69
개선 사항(Improved)21
추가 사항(Added)12
변경 사항(Changed)10
되돌리기 및 제거2
합계114

🔗 Claude Code v2.1.280

Opus 5.5 활용을 위한 두 가지 안내서

9월 22일 — Anthropic은 Addy Osmani가 작성한 안내서 두 편도 공개했다. 첫 번째인 “Opus 5.5에서 작업 하나에 드는 비용”(What a task costs on Opus 5.5)은 token당 가격이 같은 두 모델도 각 차례마다 전체 대화를 다시 전송하기 때문에 동일한 작업의 비용이 크게 달라질 수 있다고 설명한다. 공개 요금을 바탕으로 한 예시에 따르면 입력 token 280만 개의 비용은 캐시를 사용하지 않을 때 11.20달러지만, 90%를 캐시에서 읽으면 1.62달러다. 또한 출력 token 하나의 비용은 캐시 읽기보다 100배 높다. 일상적으로는 medium 노력을 사용하고, medium이 막히면 high을 사용한 다음, Opus 5.5가 같은 문제에서 두 번 실패하면 Fable 5.1로 전환할 것을 권한다. 노력 수준이나 모델을 변경하면 캐시가 비워진다. 캐시는 구독 환경에서는 한 시간 동안 유지되며, API key를 사용할 때는 기본적으로 5분 동안 유지된다. 지원 ticket 44건을 대상으로 한 내부 Benchmark에서는 낮은 노력 수준으로 Opus 4.8에서 Opus 5.5로 전환했을 때 비용이 약 18% 감소했고, /claude-api prompt-audit으로 9%가 추가로 감소했다.

claude.dev에 게시된 두 번째 안내서는 먼저 “완료”의 의미를 정의한 뒤 모델이 작업하도록 두고, 모델은 답변하기 전에 항상 사고하므로 “신중히 생각하라” 같은 지시는 삭제하라고 권한다. 또한 메시지가 안전장치에 의해 표시될 때 이전 모델로 전환되는 과정과, 애플리케이션 또는 /config에서 이 동작을 조정하는 방법도 설명한다.

🔗 Opus 5.5에서 작업 하나에 드는 비용 · Opus 5.5를 최대한 활용하는 방법


OpenAI, GPT-5.6 프로모션 요금보다 50% 저렴한 GPT-6 Sol과 GPT-6 Luna 출시

9월 22일 — Anthropic의 발표 후 두 시간도 채 지나지 않아 OpenAI가 GPT-6 SolGPT-6 Luna로 GPT-6 제품군을 확장했다. 두 모델은 GPT-6 Astra와 유사한 방법으로 훈련됐으며, 회사에 따르면 Astra는 여전히 자사의 최고 모델이다. Sol은 복잡한 코딩과 에이전트형 workflow를, Luna는 대량의 특정 작업을 겨냥한다. 각각 GPT-5.6 Sol과 GPT-5.6 Luna의 후속 모델이다.

We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

🇰🇷 캐싱과 추론의 효율성도 높였으며, 그 절감분을 고객에게 직접 돌려드립니다. Sol과 Luna의 API 가격은 GPT-5.6 프로모션 요금보다 50% 낮습니다.@OpenAI의 X 게시물

요금 유형(100만 tokens당)GPT-6 SolGPT-6 Luna제시된 GPT-5.6 요금(Sol / Luna)
입력2달러0.10달러4달러 / 0.20달러
캐시된 입력0.20달러0.01달러명시되지 않음
출력10달러0.50달러20달러 / 1.20달러

두 모델 모두 1,050,000 tokens의 컨텍스트를 지원하며 최대 128,000 tokens를 생성한다. 입력이 272,000 tokens를 넘으면 전체 요청의 입력 요금은 두 배, 출력 요금은 1.5배로 청구된다.

Opus 5.5 이전의 Claude 모델들과 Sol을 비교한 OpenAI의 Benchmark에서 Sol은 xhigh 노력 수준으로 AutomationBench 33.2%를 기록했으며, 작업당 비용은 0.27달러였다. 이는 max 노력 수준의 Claude Opus 5보다 높다. Claude Opus 5는 26.9%를 기록했고 비용은 11.1배 더 높았다. low 노력 수준의 GPT-6 Astra는 30.3%였다. DeepSWE v1.1에서는 Claude Fable 5의 최고 점수보다 1.1점 낮은 68.8%를 기록하면서 작업당 비용은 약 80% 낮았다. Luna는 66.6%를 기록했다. 경쟁 모델의 점수는 공개 보고서에서 가져왔다. 정렬 측면에서는 부정직한 행동을 유도하도록 설계된 코딩 작업에서 측정한 기만율이 Sol에서 1.3%로 낮아졌다. GPT-5.6 Sol은 10.4%였다.

두 모델은 Plus, Pro, Business, Enterprise, Edu 구독자를 대상으로 ChatGPT Work와 Codex에 단계적으로 도입된다. Enterprise에서는 관리자가 활성화해야 한다. Free 및 Go 사용자는 데스크톱 애플리케이션에서 Luna를 사용할 수 있으며, 두 모델은 아직 Chat에서는 제공되지 않는다. API에서는 Responses와 Chat Completions를 통해 gpt-6-solgpt-6-luna이라는 이름으로 제공된다.

🔗 GPT-6 Sol 및 Luna 소개

GPT-6를 위해 재설계된 prompt caching

9월 22일 — 출시와 함께 공개된 “GPT-6를 위한 더 나은 prompt caching”에서는 GPT-6 제품군의 새로운 cache system을 자세히 설명한다. 기본 cache 적중률이 높아졌으며, 30분 이내에 재사용되는 적격 공유 prefix의 캐시된 입력 token에는 최대 90% 할인이 적용된다. 캐시 쓰기에는 입력 요금의 1.25배가 부과된다. 개발자에게는 Prompt Caching dashboard, 재사용할 prefix를 지정하는 명시적 cache breakpoint(explicit cache breakpoints), 애플리케이션 시작 시 수행하는 cache prewarming(prewarming), cache를 깨뜨리지 않고 응답마다 추론 노력 수준을 변경할 수 있는 configuration_update가 제공된다. GitHub 제품 책임자 Mario Rodriguez는 재처리해야 하는 prompt token의 비중을 50% 넘게 줄였다고 밝혔으며, Strawberry Browser는 비용이 20% 감소했다고 발표했다.

🔗 GPT-6를 위한 더 나은 prompt caching


같은 날 주요 도구에 도입: GitHub Copilot, Devin, Perplexity, Cursor, v0

9월 22일 — Opus 5.5와 새로운 GPT-6 모델 두 개는 지체 없이 확산됐다. 몇 시간 만에 주요 코딩 및 검색 도구들이 자체 측정 결과와 함께 이 모델들을 추가했다.

GitHub Copilot, Opus 5.5와 GPT-6 Sol 및 GPT-6 Luna 제공

GitHub는 세 모델을 출시 당일 열 개 환경에 추가했다. 대상은 VS Code, Visual Studio, Copilot CLI, 코딩 에이전트, GitHub Copilot 애플리케이션, github.com, GitHub Mobile, JetBrains, Xcode, Eclipse다. 모든 모델은 premium 요청 배수 없이 공급자의 공개 요금에 따라 사용량 기반으로 청구된다. 기존 요청 기반 과금 방식을 유지하는 연간 구독자는 이 모델들을 이용할 수 없다. 아직 어떤 모델도 자동 선택(Auto)에 포함되지 않았다.

Copilot 모델이용 가능 요금제100만 tokens당 입력 및 출력
Claude Opus 5.5Pro+, Max, Business, Enterprise(Pro 제외)4달러 및 20달러
GPT-6 SolPro+, Max, Business, Enterprise2달러 및 10달러, 272,000 tokens 초과 시 4달러 및 15달러
GPT-6 LunaPro, Pro+, Max, Business, Enterprise0.10달러 및 0.50달러, 272,000 tokens 초과 시 0.20달러 및 0.75달러

따라서 Luna는 Copilot Pro에서 이용할 수 있는 유일한 GPT-6 모델이며, Opus 5.5는 이 요금제에서 제공되지 않는다. GitHub의 초기 테스트에 따르면 Opus 5.5는 Claude Opus 5와 같은 수준으로 작업을 해결하면서 단계와 token을 현저히 적게 사용한다. GitHub는 Opus 5.5가 텍스트 출력에 watermark를 삽입한다고도 밝혔다. GitHub에 따르면 이는 의미, 품질, 가독성, token 수, 비용에 영향을 주지 않는다.

🔗 GitHub Copilot의 Claude Opus 5.5 · GitHub Copilot의 GPT-6 Sol 및 GPT-6 Luna

Devin, FrontierCode 1.1에서 신규 모델 순위 공개

Cognition은 Claude Opus 5.5 출시 당일 Devin Desktop과 Devin CLI에서 이를 제공하고, FrontierCode 1.1 벤치마크의 Extended 변형에서 65.3%로 1위에 올렸다. Claude Fable 5(64.9%)와 GPT-6 Astra(64.5%)를 앞섰으며, 작업당 비용은 Fable 5의 10분의 1 미만이다. 이 65.3%는 Main 변형에서 측정해 Anthropic이 발표한 54.4%와 직접 비교할 수 없다. 47분 뒤에는 GPT-6 Sol과 Luna도 합류했다. Sol은 작업당 비용을 61% 절감하고 컨텍스트를 약 17% 적게 읽으면서 GPT-5.6 Sol과 대등한 성적을 냈고(60.7% 대 60.6%), Luna(56.1%)는 작업당 비용이 0.10달러 미만으로 Cognition 순위에서 가장 저렴한 모델이 됐다.

그 전날인 9월 21일 오후(태평양 표준시)에 Cognition은 Grok 4.7을 제공하고 59.4%로 측정했다. 이는 Grok 4.6(61.3%)보다 낮은 점수다. Java, Go, Ruby의 어려운 백엔드 작업에서는 견고하지만, 범위를 벗어나 과도하게 작업하는 경향(over-scope)이 있어 작업에서 요구하는 것보다 더 큰 diff를 생성한다. 뒤이어 v0도 Grok 4.7을 제공하면서 9월 27일까지 40% 할인을 적용했지만, 무엇에 대한 할인인지는 밝히지 않았다.

평가 모델FrontierCode 1.1 Extended 점수
Claude Opus 5.565.3%
Claude Fable 564.9%
GPT-6 Astra64.5%
Claude Fable 5.163.6%
SWE-262.5%
Grok 4.661.3%
GPT-6 Sol60.7%
GPT-5.6 Sol60.6%
Grok 4.759.4%
Gemini 3.7 Flash56.3%
GPT-6 Luna56.1%

굵게 표시된 모델은 9월 21일과 22일에 Devin에 추가된 모델이다. 점수는 Cognition이 Extended 변형에서 측정해 발표했다.

🔗 Devin의 Opus 5.5 · Devin의 GPT-6 Sol 및 Luna · Devin의 Grok 4.7 · v0의 Grok 4.7

Perplexity: Computer에 Opus 5.5와 GPT-6 Sol, Agent API에 모델 4종 추가

Perplexity는 두 신제품을 다단계 에이전트 Computer에 9월 17일 도입한 작업 강도 슬라이더에 연결했다. Claude Opus 5.5는 Standard 단계가 됐다. Perplexity의 자체 비용 및 성능 벤치마크 WANDR에서 작업당 4.13달러에 0.610을 기록해 Claude Fable 5.1보다 조금 높은 점수를 내면서 작업당 비용은 67.6% 낮췄다. Perplexity 애플리케이션에서도 사용할 수 있는 GPT-6 Sol은 Light 단계의 기본 옵션이 됐다. 두 발표 모두 대상 요금제나 대체된 모델은 명시하지 않았다.

개발자 측에서는 날짜가 2026년 9월로만 표기된 API 변경 로그 항목을 통해 Agent API에 openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5, xai/grok-4.7을 추가했으며, 해당 항목에는 요금이 기재되지 않았다.

🔗 Computer의 Opus 5.5 · Computer의 GPT-6 Sol · Perplexity API 변경 로그

Cursor와 v0, Opus 5.5 제공

Cursor는 Opus 5.5를 최대 작업 강도(Max)에서 57.8%를 기록한 CursorBench의 새로운 최고 모델로 소개했다. Opus 5보다 작업당 비용이 40% 낮다는 Anthropic의 수치이며, 작업 강도 단계도 명시됐다. v0는 요금 세부 정보 없이 이를 제공했다.

🔗 X의 Cursor · X의 v0


Anthropic, 5시간 한도 상향 및 10월 22일까지 한도 초기화 제공

9월 22일 — Opus 5.5와 함께 Anthropic은 Pro, Max, Team 및 라이선스 기반(seat-based) Enterprise 요금제의 5시간 기준 한도를 상향했다. @ClaudeDevs 계정에 따르면 Claude Code의 5시간 세션 한도는 이날부터 20% 증가한다. 구독자에게는 비축해 두었다가 원하는 시점에 실행할 수 있는 한도 초기화도 한 차례 제공된다. Pro, Max 및 Team에서는 설정 → 사용량(Settings → Usage)에서 이용할 수 있으며, 10월 22일까지 사용해야 한다.

가격 효과도 더해진다. Claude Code에서 Opus 5.5는 유료 요금제의 기본 모델이 되며, Opus 5보다 저렴해 5시간 및 주간 한도를 “25% 더 오래” 사용할 수 있다. 같은 날 공개된 비용 안내서는 캐시된 컨텍스트를 포함해 가격 인하분이 한도에 반영된다고 명시하지만, 캐시 읽기의 추가 가격 인하는 API에만 적용된다.

🔗 X의 @ClaudeDevs · 초기화 및 한도


Codex CLI 0.156.0, 음성 및 worktree를 기본 활성화

9월 22일 — 19시 51분(UTC)에 공개된 Codex CLI 0.156.0은 9월 18일의 0.155.1 이후 첫 안정 버전이며, 전체 변경 로그에는 0.155.0 이후의 pull request 525개가 수록됐다. 이 버전은 0.155에서 아직 실험적이었던 두 기능을 정식으로 제공한다. Linux와 Windows용 내장 오디오 엔진을 사용하는 음성 대화와, 에이전트 명령 센터에서 상태별로 작업을 필터링하고 세션으로 열 수 있는 worktree다.

버전의 새 기능명령 또는 설정이전 Codex CLI 상태
음성 대화 기본 활성화F8, /voice settings실험적 /voice(0.155.0, 9월 17일)
Worktree 기본 활성화에이전트 명령 센터0.154.0(9월 9일)부터 실험적
전체 화면 인터페이스/tui, 다음 실행 시없음
분석 대시보드/usage데스크톱 애플리케이션 분석 기능(9월 18일)
로컬 백그라운드 서버/daemon, --no-daemon없음

전체 화면 인터페이스에는 대화 기록 검색, 마우스 선택 및 오른쪽 클릭 복사 기능이 추가됐다. 내장 테마 6종도 도입됐으며, 응답에서 Mermaid 다이어그램과 수식을 직접 표시한다. 또한 이 버전은 여러 sandbox 격리 취약점도 보완했다. Windows의 수신 트래픽, app-server의 Unix socket, macOS에서 수정 가능한 fcntl 관련 문제다. 출시 노트에서는 GPT-6을 언급하지 않으며, Sol과 Luna는 /model 또는 --model으로 선택한다.

🔗 Codex CLI 0.156.0


터미널 코딩 에이전트: Vibe CLI, Qwen Code 및 Amp

Vibe CLI 2.25.6 및 2.25.7

9월 22일 — Mistral은 수정 사항 6개가 포함된 Vibe CLI 2.25.7을 공개했다. 그 전날인 9월 21일 CHANGELOG에 기록됐지만 GitHub release로는 공개되지 않은 2.25.6에 주요 새 기능이 포함돼 있으며, 추가 사항 1개, 변경 사항 3개, 수정 사항 17개로 구성된다. --experimental-harness 옵션을 사용하면 활성 모델이 이미지를 읽지 못하더라도 이미지를 첨부할 수 있다. 같은 제공업체의 vision 지원 모델이 에이전트를 위해 이미지를 설명하며, config.tomlvision_model 키로 다른 모델을 지정할 수 있다. 이렇게 설명된 인터페이스 캡처에는 에이전트가 화면을 재구성할 수 있도록 레이아웃 계약(layout contract)이 포함된다.

보안 측면에서는 승인 없이 실행되는 Git 명령이 강화됐다. 보안 fetch가 더 이상 Git 설정의 경로 재정의를 상속하지 않으며, 신뢰할 수 없는 checkout은 SSH 클라이언트나 hook을 선택할 수 없다. 읽기 전용 명령에 끼워 넣은 위험한 옵션이나 shell 리디렉션에도 승인이 필요하다. 마지막으로 2.25.7에서는 무료 계정을 포함한 Vibe 및 workspace API 키로 /teleport을 사용할 수 있게 됐다.

🔗 Vibe CLI v2.25.7 · Vibe CLI CHANGELOG

Qwen Code v0.24.4

9월 22일 — v0.24.3 출시 하루 뒤 Qwen Code가 주요 변경 없이 기능 13개와 수정 사항 15개를 포함한 v0.24.4로 업데이트됐다. 이제 qwen serve 서버는 대상 시스템에 daemon을 설치하지 않고 SSH를 통해 원격 workspace를 열 수 있으며, v0.24.0에서 Linux에 도입된 bubblewrap(bwrap) sandbox가 각 도구 실행 단위로 적용된다. Web Shell에서는 인증된 서버가 loopback이 아닌 주소에서 수신 대기할 때 QR code 페어링을 기본으로 사용할 수 있다. 일회용 초대는 60초 후 만료되며, 편집 diff는 승인 전에 표시된다. Java 측에서는 관리형 도구 실행 기록이 JDBC를 통해 데이터베이스에 보존된다. 수정 사항 2개만 포함한 v0.24.5-preview.0도 같은 날 뒤이어 공개됐다.

🔗 Qwen Code v0.24.4

Amp runner, Git worktree 생성 지원

9월 22일 — 하나의 runner가 여러 디렉터리를 제공할 수 있게 된 지 5일 만에 Amp는 Git worktree 생성 기능도 추가했다. 선택 화면에서 제공되는 각 저장소에 New Worktree 옵션이 나타난다. Tab을 누르고 branch 이름을 지정하면 저장소 옆에 새 checkout이 만들어지고 해당 checkout에서 thread가 시작된다(~/code/amp~/code/amp-fix-flaky-login-test을 생성한다). 기본 checkout에는 영향을 주지 않는다. 이후 전용 작업을 통해 thread를 보관하고 worktree와 branch를 삭제할 수 있다. runner는 ampcode.com에서 구성한 비밀 정보와 환경 변수(Secrets & Env Vars)도 받을 수 있다. 기본적으로 비활성화돼 있으며 --amp-env으로 활성화한다. 수정한 변수는 재시작이나 SSH 없이 다음 thread부터 적용된다.

🔗 하나의 Runner, 여러 Worktree


제3자 평가: OpenAI는 규칙을 정하고 영국 AISI는 결과를 공개

9월 22일 — 같은 날, 연구소 외부 기관의 모델 평가에 관한 두 건의 발표가 나왔다.

OpenAI: 독립 평가자를 위한 4대 우선순위와 7대 원칙

Lama Ahmad가 작성한 이 글에서 OpenAI는 민간 또는 비영리 독립 평가자에게 모델의 학습, 평가 및 배포에 관한 심층적인 접근 권한을 제공하겠다고 약속했다. 평가자가 OpenAI의 가정에 이의를 제기하고, 놓친 위험을 파악하며, 보호 조치를 직접 판단할 수 있게 하기 위해서다. 정부와 함께 진행하는 작업과 별개인 이러한 평가는 출시와 연계되지 않으며, 수주에서 수개월 동안 진행된다.

우선 분야검토 대상
안전성 논증(safety cases)학습부터 외부 배포까지 모델의 위험이 통제되고 있음을 입증하는 논거
핵심 보호 조치jailbreak 저항성, cyber 방어, 정렬 이탈 감시 장치, 사고 과정 추적의 신뢰성
Preparedness Framework역량 시험(화학 및 생물학적 위험, cybersecurity, AI 자기 개선)과 정렬
정렬 이탈 사고중대한 사고에 관한 독립 조사로, 7월의 Hugging Face 사고가 사례로 언급됨

전체 과정에는 7가지 원칙이 적용된다. 합의된 범위와 사전 등록된 주장, 비례적인 접근 권한, 투명한 방법론, 전문성과 독립성(이해관계 충돌 공개), 보안과 기밀 유지, 공개 전 시정 기간을 둔 실행 가능한 조사 결과, 그리고 삭제 처리를 규정하는 책임 있는 공개다. OpenAI는 여러 기관과 논의 중이라고 밝혔지만 이름은 공개하지 않았다.

🔗 효과적인 제3자 평가를 위한 우선순위와 원칙

UK AI Security Institute, EvalEval을 통해 검증된 결과 공개

EvalEval Coalition은 Hugging Face 블로그를 통해 첨단 AI의 위험을 연구하는 영국 공공기관 UK AI Security Institute(AISI)가 이제 평가 결과를 맥락 및 구성과 함께 EvalEval의 개방형 플랫폼 Evaluation Cards에 공통 형식 Every Eval Ever로 공개한다고 발표했다. 첫 공개 자료에는 6개 모델을 대상으로 측정한 5개 벤치마크(HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro 및 Terminal-Bench 2.0)와 cyber 평가 2건이 포함됐다. 대상 모델은 Claude Opus 4, 4.5 및 4.6, GPT-5, GPT-5.2 및 GPT-5.4다. 핵심은 재현성이다. 구성을 함께 제공하는 검증된 기준 자료는 겉보기에 비교 가능한 두 점수가 왜 서로 다른지 이해하는 데 도움이 된다.

🔗 UK AISI와 EvalEval이 벤치마크 결과의 재현성을 높이는 방법


ChatGPT, 미국에서 Experian 신용 점수 추적 지원

9월 21일 — @ChatGPT 계정이 9월 21일 발표한 새 기능을 통해 ChatGPT에서 신용 점수를 추적할 수 있게 됐다. 미국의 Plus 및 Pro 구독자는 재정 영역에서 Experian 신용 보고서와 VantageScore 3.0 점수를 연결하고, 점수에 영향을 미치는 요인에 관한 맞춤형 설명을 받으며, 점수가 바뀌면 알림을 받을 수 있다. 이 기능은 웹과 최신 버전의 iOS 및 Android 애플리케이션에서 이용할 수 있다.

OpenAI는 구체적인 활용 사례로 신용 상태가 임대 신청에 미치는 영향 측정, 우선 상환할 신용카드 선택, 장기적인 신용 구축, 신용과 예산이 자동차 임대나 주택담보대출에 미치는 영향 확인을 제시했다. 이 기능은 미국 Pro 구독자를 대상으로 5월에 미리보기로 출시한 개인 재정 도구와 Plaid를 통한 은행 계좌 연결 기능을 보완한다.

🔗 X의 ChatGPT 발표


Google: Colab을 Google AI 요금제에 포함하고 Gemini API의 Gemini 2.5 이용 제한

Colab, Google AI 요금제에 포함

9월 22일 — Google AI 구독자는 더 빠른 accelerator 및 더 강력한 시스템에 대한 우선 접근권을 비롯한 Colab premium 혜택을 받는다. Ultra 구독자는 중단 없는 백그라운드 실행과 Premium GPU 이용 권한도 추가로 얻어, 브라우저 탭을 열어 두지 않고도 장시간의 학습을 끝까지 실행할 수 있다. 게시물에서는 “오늘부터” 출시한다고 밝혔지만, 혜택은 향후 몇 주에 걸쳐 Colab 지원 국가에 제공된다고 명시했다. Colab FAQ에 따르면 Google AI 요금제와 Colab Pro 또는 Pro+ 구독의 컴퓨팅 단위는 동일한 잔액에 합산된다. 저장 공간만 제공하는 Google One 요금제와 무료 체험은 대상이 아니다. 게시물과 FAQ 모두 각 요금제에 할당되는 단위 수는 밝히지 않았다.

🔗 이제 Google AI 요금제에 포함되는 Colab · Colab FAQ

Gemini API, Gemini 2.5 이용 제한

9월 18일 — Gemini API 출시 노트의 9월 18일자 공지에 따르면, 안정적인 성능을 보장하고 용량을 유지하기 위해 Gemini 2.5 모델은 과거에 이를 활발히 사용했던 사용자만 이용할 수 있게 됐다. 이 모델들은 사용 중단 예정이 아니며 별도 공지가 있을 때까지 계속 제공된다. 사용 중단 페이지에는 gemini-2.5-pro, gemini-2.5-flash, gemini-2.5-flash-lite의 종료일이 표시되지 않았고, gemini-2.5-flash-image만 2026년 10월 2일에 종료된다. Google은 모든 신규 프로젝트에 Gemini 3.5 Flash-Lite 또는 Gemini 3.8 Flash 사용을 권장한다.

🔗 Gemini API 출시 노트 · Gemini 사용 중단 페이지


Hugging Face, Transformers에서 llama.cpp의 GGUF 실행 지원

9월 22일 — 이제 Hugging Face를 통해 llama.cpp의 양자화 형식인 GGUF 파일을 Transformers에서 효율적으로 실행할 수 있다. 파일을 from_pretrained에 전달하기만 하면 된다(gguf_file 매개변수). 가중치는 메모리에서 압축된 상태로 유지되고, 연산은 kernels 라이브러리를 통해 Hub에서 배포되는 ggml의 Metal 커널로 처리된다. 이후 transformers serve 명령어를 사용하면 OpenAI 호환 API를 통해 모델을 제공할 수 있다.

초기 지원 범위는 제한적이다. Apple Silicon Mac만 지원하며, dense 및 MoE 버전의 Qwen3.5 아키텍처와 호환되는 Qwen3.8 체크포인트를 대상으로 한다. 한 번에 하나의 대화만 처리할 수 있고, main 브랜치에서 설치해야 한다. 커널 4개는 ggml에서 가져왔으며, Hugging Face가 작성한 다섯 번째 커널은 전문가 라우팅을 담당한다. Hugging Face는 MacBook Pro M2 Max에서 Transformers의 성능이 llama.cpp에 “근접”한다고 평가하지만, 수치는 그래프로만 제시되었고 측정 방식도 서로 다르다. 한쪽은 프리필을 포함하고 다른 쪽은 디코딩만 측정했다. 따라서 팀은 효율적인 로컬 추론에는 여전히 llama.cpp를 권장한다. 핵심 이점은 다른 데 있다. 일반적인 PyTorch 도구로 GGUF를 다루거나, 역양자화한 GGUF에서 출발해 미세 조정할 수 있다는 점이다.

GGUF 변형(Qwen3.5-4B, Unsloth)파일 크기명시된 절충점
BF168,42 GB양자화되지 않은 기준 모델
Q6_K3,53 GB더 높은 정밀도
Q5_K_M3,14 GB크기와 정밀도의 절충
Q4_K_M2,74 GB로컬 환경에 권장되는 시작점

🔗 이제 Transformers에서 llama.cpp 양자화 모델 실행 지원


Kimi: Amazon Bedrock의 K3와 이름이 변경된 브라우저 확장 프로그램

Amazon Bedrock에 Kimi K3 출시

9월 22일 — Moonshot AI가 Amazon Bedrock에 Kimi K3를 출시한다고 발표했다. 다만 AWS 제품 페이지에는 출시일이 9월 18일로 기재되어 있다. 7월 말에 공개된 이 오픈 가중치 모델은 100만 token의 컨텍스트를 지원하며, Bedrock의 액세스 제어, 암호화 및 감사 기능을 활용한다. 미국 및 글로벌 리전 간 추론(cross-Region inference)으로 제공되며(us.moonshotai.kimi-k3, global.moonshotai.kimi-k3), 명시적 캐싱은 캐시 지점당 1,024 token부터 시작해 최소 30분 동안 유지된다. 기본 요금에는 Priority 등급은 1.75배, Flex 등급은 0.5배의 요율이 적용된다.

추론 옵션(Standard 등급)100만 token당 입력 요금100만 token당 출력 요금캐시 읽기
글로벌 추론3.00달러15.00달러0.30달러
미국 추론3.30달러16.50달러0.33달러

🔗 Amazon Bedrock의 Kimi K3 제품 페이지 · Bedrock의 Kimi K3, X 발표

Kimi WebBridge, Kimi Browser Extension으로 변경

9월 22일 — 지난 6월 Kimi Work와 함께 등장한 브라우저 확장 프로그램의 이름이 변경되고 사이드바가 추가됐다. 사용자는 사이드바에서 Kimi와 대화하며 웹사이트 탐색, 양식 작성, 작업 완료를 요청할 수 있다. 반복 작업은 한 번 기록한 뒤 skill로 저장할 수 있으며, Kimi는 다음번에 이를 다시 활용한다. 확장 프로그램은 웹페이지를 명령어로 분해하는 기능도 제공한다. 로컬 서비스는 Chrome DevTools Protocol을 통해 이미 실행 중인 Chrome이나 Edge를 제어한다. Moonshot은 로그인 세션과 페이지 콘텐츠가 기기 밖으로 전송되지 않는다고 설명한다. Kimi 계정이 필요한 기능은 사이드바뿐이다.

🔗 Kimi Browser Extension · Kimi Browser Extension, X 발표


SpaceXAI: Grok Bot으로 급증한 고객 지원 티켓 처리

9월 22일 — SpaceXAI가 회사 도구 안에서 작업하는 에이전트 Grok Bot을 중심으로 자체 고객 지원 체계를 재구축한 경험을 공개했다. 8월 14일 Cursor가 SpaceXAI에 합류한 이후 두 지원팀이 통합되면서 훨씬 더 많은 제품을 담당하게 됐다. 게시물에 따르면 인력을 전혀 충원하지 않은 상태에서 티켓 수가 175% 증가했으며, 그렇지 않았다면 약 200명을 채용해야 했을 수도 있다. 측정 기간은 명시되지 않았다.

배포는 단계적으로 진행됐다. 티켓 처리를 위해 Plain에, 인시던트 관리를 위해 Linear에 연결된 Grok Bot은 처음에는 내부 메모 작성으로만 제한됐으며 모든 쓰기 작업을 사람이 승인했다. 이후 간단한 티켓을 처리하기 시작했고, 첫날이 끝나기 전부터 고객에게 직접 답변했다. 현재는 들어오는 모든 티켓을 사전 조사하고, 엔지니어링팀을 위해 문제를 동영상으로 재현하며, 매일 20,000건이 넘는 제품 피드백을 요약한다.

SpaceXAI가 공개한 지표발표 수치
고객 지원 티켓 증가율+175%
피한 것으로 추산되는 채용 인원200
기존 도구의 해결 건당 비용1~4달러
Grok Bot의 티켓당 최저 비용0.20~0.30달러
사람 없이 처리된 환불 비율99%

🔗 SpaceXAI가 Grok Bot으로 고객 지원을 확장하는 방법


Cognition: 라틴아메리카 진출과 새로운 Devin 릴리스 노트

Cognition, São Paulo를 거점으로 라틴아메리카 진출

9월 22일 — Cognition의 라틴아메리카 팀은 São Paulo 미술관인 MASP에서 전주에 발표한 내용을 게시물로 다시 소개했다. 회사는 São Paulo에 팀을 두고 라틴아메리카 지역으로 사업을 확장하며, 고객사에 파견되는 엔지니어(deployed engineers) 등을 채용한다. Itaú, Nubank, Santander, Natura, EBANX 등 기존 고객을 기반으로 확장에 나선다. Cognition에 따르면 Itaú에서는 기술팀의 75% 이상이 Devin을 사용하고 있으며, Devin은 300,000개가 넘는 저장소를 문서화하고 취약점의 약 70%를 자동으로 해결했다. Nubank에서는 수백만 줄 규모의 모놀리식 시스템 마이그레이션 기간이 수년에서 몇 주로 단축됐으며, 비용은 20분의 1 이하였다고 한다. 이 성과는 Cognition이 자체적으로 공개한 것으로, 제3자 출처는 없다.

🔗 라틴아메리카에서 소프트웨어 엔지니어링의 미래 구축

9월 21일 Devin 릴리스 노트

9월 21일 — 이전 판 발행 이후 공개된 Devin 릴리스 노트에 따르면, Cognition이 9월 10일 출시한 코딩 모델 SWE-2가 에이전트 선택기의 연구 프리뷰(research preview)로 추가됐다. 세션을 시작할 때나 진행 중에 SWE-2와 작업 강도(Medium, High 또는 Max)를 선택할 수 있으며, Slack에서는 !swe2로 같은 설정을 적용할 수 있다. Microsoft 365 MCP 서버(Mail 및 Contacts, Calendar, To Do, OneDrive 및 SharePoint, Teams, Entra ID 디렉터리)가 MCP 마켓플레이스에 추가됐다. OAuth 범위를 설정하지 않으면 기본적으로 읽기 전용이다. Devin Review는 Bitbucket Data Center를 지원하게 됐고, 플러그인은 최대 20 MiB와 2,500개 파일까지 포함할 수 있다. 독립형 CLI npx devin-review은 폐기됐으며, 이미 설치된 사본도 더 이상 작동하지 않는다.

🔗 9월 21일 Devin 릴리스 노트


Genspark의 프레젠테이션 벤치마크, Fireworks AI의 SII 지수에 포함

9월 22일 — Fireworks AI가 Specialized Intelligence Index(SII)를 출시했다. 보안, 법률, 금융, 고객 지원, 소프트웨어, 의료, 생산성 등 7개 분야에서 실무자들이 만든 20개의 실제 업무 벤치마크로 구성된 지수다. 참여한 12개 기업에는 Harvey, Doximity, Mercor, Sierra, Decagon, Genspark 등이 포함된다. 생산성 부문의 유일한 벤치마크인 Genspark Slides Benchmark는 Genspark Slides 에이전트의 실행 환경에서 11개 모델이 실제 작업 200개를 바탕으로 프레젠테이션을 만들도록 한다. 평가는 Genspark의 내부 평가기가 수행한다. Genspark는 자체 모델인 Gen-1 Slides의 입력 요금이 Claude Opus 5의 약 17분의 1이라는 점을 강조한다.

평가 모델SII 지수 점수9월 10일 Genspark 게시물 점수지수 기준 프레젠테이션당 비용
Claude Fable 5.183,6%표에는 없으며, 본문에서 Gen-1 Slides보다 0.003점 앞섬표시되지 않음
Gen-1 Slides82,2%0,8210.44달러
Claude Opus 581,0%0,8104.16달러
Claude Fable 579,9%표에 없음표시되지 않음
GPT-6 Astra78,0%표에 없음표시되지 않음
Kimi K372,6%0,7232.00달러
GPT-5.6 Sol67,0%0,6682.01달러
MiniMax M356,1%0,5630.34달러

🔗 Specialized Intelligence Index · Genspark 발표


Runway, AI 교육을 받은 크리에이터를 위한 채용 플랫폼 DIFFUSE 출시

9월 22일 — Runway가 DIFFUSE(diffuse.runway.com)를 출시했다. 브랜드, 에이전시, 스튜디오가 생성형 AI 도구에 익숙한 인재(AI-native talent)를 검색하고 연락해 채용할 수 있는 개방형 플랫폼이다. 크리에이터, 프리랜서, 소규모 전문 스튜디오, 제작사는 프로필을 만들고 포트폴리오를 게시할 수 있다. 요금은 공개되지 않았다.

Runway는 약 400개 기업이 게시한 1,000건 이상의 크리에이티브 채용 공고를 자체 조사한 결과를 근거로 제시한다. 공고의 17%가 AI 역량이나 생성형 도구를 언급했으며, 회사 측에 따르면 Runway는 그중 압도적으로 수요가 많은 동영상 도구였다. Runway는 AI가 크리에이티브 직무를 일부 대체하고 있음을 인정하면서도, 이러한 도구를 중심으로 새로운 크리에이티브 인력이 형성되고 있고 이들에 대한 수요가 빠르게 증가하고 있다고 주장한다.

🔗 DIFFUSE 소개 · Runway의 X 게시물


개발자를 위한 NVIDIA: Isaac ROS 5.0, DLSS 5 및 RTX Mega Geometry 2.0

Isaac ROS 5.0, 에이전트에 초점

9월 22일 — Toronto에서 열린 ROSCon에서 공개된 Isaac ROS 5.0은 NVIDIA의 GPU 가속 ROS 패키지 모음으로, 무료이자 오픈 소스다. ROS Lyrical과 Ubuntu 24.04를 지원하며 Jetson Orin Nano부터 Jetson Thor까지 전체 Jetson 제품군을 아우른다. 주요 신기능은 에이전트를 겨냥한다. 설치와 조작을 위한 재사용 가능한 Isaac skill, 에이전트가 읽을 수 있는 문서, 에이전트가 자체 카메라에 맞춰 스테레오 비전 모델 FoundationStereo를 미세 조정하도록 돕는 skill, 독립형 집기·배치(pick and place) skill이 추가됐다. FoundationPose에는 객체의 위치와 방향을 최대 5.5배 빠르게 추적하는 추론 라이브러리가 추가됐지만, NVIDIA는 비교 기준을 명시하지 않았다.

🔗 Isaac ROS 5.0

스튜디오를 위한 DLSS 5 세부 정보 공개, RTX Mega Geometry 2.0 제공

9월 22일 — 이미 NBA 2K27에서 사용할 수 있는 DLSS 5의 개발자용 세부 정보가 공개됐다. 3D 유도 신경 렌더링(3D-Guided Neural Rendering)은 파이프라인의 마지막 단계에 삽입되며, 엔진이 렌더링한 이미지에서 시작해 색상과 모션 벡터를 활용하여 프레임마다 조명과 재질 세부 정보를 결정론적으로 추가한다. 단일 GeForce RTX 50 시리즈에서 최대 4K까지 실행된다. 스튜디오는 구조 강도(Structure Intensity)와 색조 강도(Tone Intensity)를 조절할 수 있으며, AI 기반 의미론적 마스킹도 사용할 수 있다. 같은 게시물에서는 ACE에 6억 개 매개변수를 가진 모델 2개인 Nemotron Speech 3.5 Streaming(음성 인식)과 Qwen3 TTS(음성 합성)를 추가하고, RTX Kit 2026.3을 공개했으며, 초고밀도 메시를 위한 연속 세부 수준 클러스터 스트리밍 기능을 갖춘 RTX Mega Geometry 2.0을 제공한다고 밝혔다.

🔗 게임 개발자를 위한 신기능


NVIDIA와 추론: 멀티 GPU Dynamo-Triton 및 B200의 기밀 컴퓨팅

Dynamo-Triton 26.07, GPU 8개에 분산된 모델 제공

9월 21일 — NVIDIA가 여러 GPU에 분산된 TensorRT 모델을 일반 모델처럼 제공하는 방법을 공개했다. TensorRT 11.0부터 완전히 지원되는 TensorRT 멀티 GPU 추론(multi-device inference)은 NCCL을 기반으로 한다. 이전의 Triton Inference Server인 Dynamo-Triton 26.07은 TensorRT 백엔드에서 이 기능을 활성화하며, 애플리케이션은 단일 gRPC 엔드포인트만 호출한다. Cosmos 3 Nano의 동영상 생성(1280×720, 189프레임, 35단계)에서 종단 간 지연 시간은 GPU 1개 사용 시 156.6초에서 8개 사용 시 34.2초로 줄어 4.58배 단축됐다. NVIDIA는 이 테스트에서 동시 요청 처리량이나 동영상당 비용은 측정하지 않았다고 명시했다.

테스트 구성GPU 수평균 종단 간 지연 시간
단일 GPU1156,595초
CP2287,999초
CP4453,093초
CP8834,183초

🔗 Dynamo-Triton과 멀티 GPU TensorRT

B200의 기밀 추론, 처리량의 96% 이상 유지

9월 22일 — NVIDIA가 암호화된 메모리를 갖춘 가상 머신에서 워크로드를 실행하고 기밀 GPU와 암호화된 NVLink를 사용하는 Blackwell Confidential Computing의 성능 비용을 측정했다. Intel TDX 플랫폼의 DGX B200(GPU 8개)에서 TensorRT LLM으로 NVFP4 형식의 DeepSeek-R1을 제공하고 입력 32,000 token, 출력 1,000 token으로 설정한 결과, 동시 요청이 1개에서 16개일 때 기밀 모드는 처리량의 96.198.2%를 유지했고 출력 token당 평균 시간은 1.24.3%만 증가했다. 이를 위해 framework를 세 가지 방식으로 조정해야 했다. 일부 전송에서는 고정 메모리 대신 페이징 가능한 메모리를 사용하고, 커널 자동 튜너에는 GPU 내부 카운터를 활용했으며, 이 모드에서는 NVLink SHARP 멀티캐스트를 사용할 수 없어 다른 통신 알고리즘을 적용했다. 오버헤드가 드러나도록 워크로드를 선택했으며, NVIDIA는 자체 워크로드에서 두 모드를 비교할 것을 권장한다.

🔗 기밀 컴퓨팅과 TensorRT LLM


단신

  • Zed, Delta 준비 중 — Zed는 아직 사용할 수 없는 기능이지만, 에이전트를 활용하는 멀티플레이어 코딩 환경 Delta에서 스레드를 묶는 색상 표시와 자동 컨텍스트 압축까지 남은 거리를 보여주는 게이지를 이번 주에 선보인다고 발표했다. 🔗 출처
  • Replit과 Handshake — Replit은 Handshake의 AI Skills Studio 창립 파트너다. 무료로 제공되는 45분짜리 미션 3개를 완료하면 Handshake 프로필에 표시되는 프로젝트로 이어진다. 다른 파트너로는 OpenAI(미션 10개), Google, Figma, Vercel 등이 있다. 🔗 출처
  • oMLX, Hugging Face 합류 — Apple의 MLX 생태계 프로젝트 oMLX를 만든 Jun Kim이 Hugging Face에 합류한다. 프로젝트는 계속 Apache 2.0을 따르고 그가 지휘하며, 유지보수와 자금 지원을 받게 된다. 우선 목표는 Transformers 모델을 MLX로 더 빠르게 이전하는 것이다. 🔗 출처
  • SnowLLM — 커뮤니티 게시물에 따르면 Apache-2.0 기반의 이 추론 엔진은 커널이 바이너리로 제공되며 Ryzen AI Max의 GPU용으로 작성됐다. 저자들의 설명에 따르면 llama.cpp보다 디코딩 속도가 최대 2.3배 빠르고, 추측 디코딩을 제외하면 1.9배 빠르며, 프리필 속도는 최대 9.4배 빠르다. 🔗 출처
  • DecisionBench와 Bosun v3.1 — Hanno Labs는 DecisionBench 1.0(과제 43개, 분야 28개)과 Qwen3 기반의 오픈 가중치 의사결정 모델 2종(매개변수 6억 개 및 17억 개)을 공개했다. 자체 응용 평가 모음에서 각각 83.20%와 87.29%를 기록했으며, 추론 부문에서는 Jev가 이들을 앞섰다. 🔗 출처
  • 매개변수 6억 개짜리 Moshi — 한 개발자가 Qwen3-0.6B-Base를 기반으로 구축한 전이중 음성 모델 개발 시도를 소개했다. B200에서 시도당 2~15달러를 들여 훈련한 결과 텍스트는 수렴했지만 음성은 여전히 뭉개졌으며, 병목은 세밀한 음향 코드북에 있는 것으로 파악됐다. 프로젝트는 중단됐고 가중치는 공개되지 않았다. 🔗 출처
  • Together AI와 GLM-5.2 — Together AI는 9월 18일 자 사례 연구를 21일 X에 다시 게시하며, 한 핀테크 기업이 B200 56개와 256K 컨텍스트의 GLM-5.2로 코딩 에이전트를 제공한다고 설명했다. 1~3분의 대기열 지연 사고는 라우팅을 재구성해 당일 해결했다. 🔗 출처
  • Gemini CLI — 9월 19일 이후 처음으로 새 코드가 포함된 9월 22일 nightly는 프록시 뒤에서 Vertex AI를 사용할 때 발생하던 HttpsProxyAgent is not a constructor 충돌을 수정하고, ACP 모드에서 권한 요청 전에 tool_call 업데이트를 보낸다. 🔗 출처
  • Google Flow — 공식 계정은 월간 사용자 수가 2,500만 명을 넘었다고 밝혔으며, 지난 7월에는 8월 31일까지 Google AI 구독자에게만 제공했던 일일 추가 크레딧 50개 혜택을 모든 사용자에게 연장했다. 🔗 출처
  • Jigsaw와 Sensemaking AI — Google의 인큐베이터는 Gemini 기반 오픈 소스 시민 의견 수렴 제품군을 30개 도시·주·국가에 배포하기 위한 Partner Program을 시작했다. 공개되지 않은 규모의 기금에는 Google.org, Bloomberg Philanthropies, Packard Foundation이 참여한다. 🔗 출처
  • 교육 장학금 10만 건 — Google은 유엔 총회를 계기로 국제전기통신연합의 AI for Good 프로그램 산하 AI Skills Coalition을 통해 80여 개국에 공인 AI 교육 장학금 10만 건을 지원한다. 장학금은 현지 정부와 Giga 네트워크를 통해 배포된다. 🔗 출처
  • Google 코드를 보호하는 에이전트 — Google은 9월 19일 게시물에서 오픈 소스 하니스 Mantis로 구축한 에이전트를 사용해 인프라 코드의 모든 변경 사항을 제출 전에 분석하며, 매달 수백 건의 취약점을 차단한다고 설명했다. 분류 에이전트는 1분 이내에 92%가 넘는 정확도를 낸다고 밝혔다. 🔗 출처
  • Copilot CLI 1.0.88 — 이제 기업 관리 설정이 그동안 MCP 정책, 권한, plugins가 적용되지 않았던 --acp, --ahp-host, --server 세션에도 적용되며, /fork도 한 턴 동안 작동한다. 9월 21일 공개된 1.0.87에는 Auto 라우팅 수준을 위한 관리 설정이 추가됐다. 🔗 출처
  • Pika와 Seedance 2.5 — Seedance 2.5의 Draft 모드가 Pika와 Pika API Club에 도입됐다. 초당 10센트부터 클립 초안을 만든 뒤 고품질 버전으로 완성할 수 있다. 🔗 출처
  • Pika Swap Anything — 원본 영상의 리듬, 움직임, 서사를 유지하면서 배우, 의상, 배경 또는 소품을 교체하는 새로운 Pika 애플리케이션이다. 가격은 공개되지 않았다. 🔗 출처
  • Suno Studio — Suno의 음악 제작 워크스테이션에 컴프레서(임계값, 비율, 어택, 릴리스, 사이드체인)를 비롯한 오디오 효과 제품군이 추가됐다. Premier 구독에 포함된다. 🔗 출처
  • Sluicebox와 Nemotron 3 Ultra — NVIDIA 사례 연구에 따르면 공급망 탄소 분석 스타트업 Sluicebox는 Nemotron 3 Ultra로 전환해 추론 비용을 51~80% 절감했고, 공급업체 데이터 추출에서 이전 모델의 84%보다 높은 87.7%를 달성했다. 🔗 출처
  • Topograph — GPU 클러스터의 네트워크 토폴로지를 검색해 Kubernetes, Slurm, Slinky에 제공함으로써 분산 워크로드를 최대한 가까이 배치하는 NVIDIA의 오픈 소스 도구 모음이다. Crusoe, Google Cloud, Lambda, Nebius, Nscale, Oracle Cloud의 API를 읽는다. 🔗 출처
  • 에이전트 평가하기 — NVIDIA는 9월 21일 방법론 게시물에서 도구 호출부터 과제 완료까지 6가지 지표를 제안하고, PinchBench에서 86%를 기록하면서 Qwen3.6 35B보다 30% 빠른 Nemotron 3.5 Lightning을 소개했다. 🔗 출처
  • Intel의 Qwen-Image-2.1 — Intel이 9월 21일 발표하고 Qwen이 22일 공유한 첫날부터의 OpenVINO 지원은 Arc Pro B70 GPU와 Core Ultra Series 3의 통합 GPU를 대상으로 하며, 전용 notebook도 제공한다. 🔗 출처
  • Box와 Grok 4.7 — Grok 4.7이 출시된 9월 21일, Box는 200만 달러 규모의 보험 사고를 다루는 Box Agent 미리보기에서 이를 시험했다. 이 과정에서 82,000달러짜리 중복 청구서와 누락된 64,000달러짜리 대변전표를 찾아냈다. 출시일과 가격은 모두 공개되지 않았다. 🔗 출처
  • 외과의사와 Codex — OpenAI Developers는 손 외과의사 Brian Pridgen이 Codex로 직접 도구를 만들고 PubMed의 과학 문헌을 검토하는 모습을 담은 영상을 공개했다. 수치나 서면 연구는 제시되지 않았다. 🔗 출처
  • Word의 ChatGPT — 9월 17일 발표됐다. 하나의 Microsoft 추가 기능으로 전 세계의 Word, Excel, PowerPoint에서 ChatGPT를 이용할 수 있으며, 사용량 제한이 있지만 Free를 포함한 모든 요금제에서 제공된다. Business와 Enterprise 사용자는 9월 30일까지 Word에서 GPT-5.6 Sol을 무료로 미리 사용할 수 있다. 🔗 출처
  • AI 리터러시 — Perplexity는 답변 평가를 핵심 역량으로 제시하고 ‘교육 연극’을 비판하는 안내서를 공개했다. Gallup을 인용해 2025년 4분기 기준 도입했다고 답한 비율은 38%였지만 매일 사용한 비율은 12%였다고 밝혔다. 🔗 출처

이것이 의미하는 것

같은 날 Anthropic과 OpenAI는 동일한 주장을 내세웠다. 어떤 대가를 치르더라도 더 강력한 모델을 제공하겠다는 것이 아니라, 훨씬 저렴한 비용으로 자사의 최상위 제품에 가까운 수준을 제공하겠다는 것이다. Opus 5.5는 Opus 5보다 40% 저렴하면서 Fable 5.1 수준이라고 소개됐고, GPT-6 Sol은 백만 tokens당 2달러와 10달러에 Astra의 강점을 상당 부분 계승한 모델로 제시됐다. 이제 두 회사 모두 token당 가격이 아니라 과제당 비용을 기준으로 판단하며, cache를 실질적인 핵심 수단으로 삼고 있다. Anthropic의 cache 읽기 비용은 0.20달러이며, OpenAI는 최대 90% 할인과 명시적인 중단 지점을 제공한다.

통합 속도는 시간 단위로 측정된다. GitHub Copilot, Devin, Perplexity, Cursor, v0는 모두 당일 새 모델을 지원했으며, Cognition의 FrontierCode 1.1 Extended, Perplexity의 WANDR, Cursor의 CursorBench처럼 저마다 자체 측정 기준을 제시했다. 이 수치들은 서로 직접 비교할 수 없다. Opus 5.5는 Extended 변형에서 65.3%, Main 변형에서 54.4%를 기록했으며, 두 회사 모두 아직 자사 새 모델을 상대 회사의 새 모델과 비교하지 않았다. 개발자에게 알맞은 선택은 출시 자료의 표보다 자신이 쓰는 도구와 실제 과제에서 점점 더 분명하게 판가름 난다.

요금제 역시 차별화의 장이 되고 있다. Anthropic은 5시간 기준 사용 한도를 높이고 한도 초기화를 제공하며, Claude Code의 Pro와 Team Standard에 Opus를 적용한다. GitHub는 Opus 5.5를 상위 요금제에만 제공하지만 GPT-6 Luna는 Copilot Pro부터 개방한다. Google은 Colab을 Google AI 요금제에 포함하는 동시에 용량을 보전하기 위해 Gemini 2.5 사용을 제한한다. 이제 요금제별 연산 자원 배분은 표시 가격만큼이나 중요하다.

마지막으로 측정 방식 자체도 달라지고 있다. Anthropic은 benchmark의 근소한 격차가 예전만큼 유용한 지침이 되지 못하며, Opus 5.5가 자신이 평가받고 있다는 사실을 자주 인식하는 듯하다고 인정한다. OpenAI는 독립 평가자에게 모델을 개방하기 위한 규칙을 정했다. 영국 AISI는 EvalEval을 통해 결과를 재현할 수 있게 했으며, NVIDIA는 개별 도구 호출이 아니라 과제 완료 여부를 기준으로 에이전트를 평가하자고 제안한다. 이제 모델이 실제로 무엇을 하는지 검증하는 일은 점수만큼이나 중요하다.


출처