ai-powered-markdown-translatorgpt-6.1-sol을 사용하여 프랑스어에서 한국어로 번역한 기사.
Google Cloud는 10월 8일 Gemini at Work 2026에서 Gemini 에이전트를 공개했다. 기업의 모든 업무를 담당하는 단일 에이전트로, 클라우드에서 계속 실행되며 Gemini 모델과 Claude 모델을 모두 조율한다. 한편 HeyGen은 자체 개발한 첫 음성 모델인 HeyGen Voice를 출시했으며, 이 모델은 Artificial Analysis의 Controlled Voice 순위에서 1위를 차지했다. Anthropic은 Claude Managed Agents에서 실행당 최대 1 000개의 에이전트를 구동할 수 있는 워크플로를 공개했다. 코딩 분야에서는 Codex가 사용자의 다음 메시지를 예측하는 기능을 도입하고, Windows에서 Microsoft Execution Containers 기반의 새로운 샌드박스를 채택했다.
Google Cloud, 모든 업무를 담당하는 단일 Gemini 에이전트 출시
10월 8일 — Google Cloud는 Gemini at Work 2026에서 Gemini 에이전트를 공개하며, 업무용 단일 범용 에이전트라고 설명했다. 하나의 입력창과 하나의 API로 질문에 답하고, 지식 노동을 수행하며, 이미지와 미디어를 만들고, 코드를 작성하고 실행한다. Google Cloud 최고경영자인 토머스 쿠리안이 제시한 구상은 일련의 지시 대신 목표를 맡기는 것이다.
이 에이전트는 하나의 메모리를 유지하며 클라우드에서 계속 실행되고, 웹, iOS, Android, Windows, Mac, 명령줄, Google Workspace, Microsoft 365, Slack 등 어디서나 사용할 수 있다. 외부 애플리케이션에서는 인터페이스 없이(headless) 실행할 수도 있다. 몇 시간 또는 며칠이 걸리는 작업도 컴퓨터를 닫은 뒤 계속 진행된다. 장시간 작업에서는 각자 고유한 신원을 가진 임시 하위 에이전트를 만들며, 자체 @agents.company.com 주소와 저장 공간을 갖고 상시 역할을 수행하는 동료 에이전트(coworker agent)가 될 수도 있다. 모델은 별도의 선택 사항이 된다. Google에 따르면 이 에이전트는 이미 Gemini 모델과 Anthropic의 Claude 모델을 조율하며, 다른 비공개 모델과 공개 모델도 뒤이어 지원할 예정이다. 금융 분야와 법률 분야에 특화된 버전도 미리 보기로 제공될 예정이다. 금융 버전은 기본 스킬이 50개 이상이며, 이미 CME Group과 Deutsche Bank가 사용하고 있다.
| 발표된 제어 구성 요소 | Google이 설명한 역할 |
|---|---|
| 각 에이전트의 신원 | 암호학적으로 증명된 신원, 역할별 권한, 해당 에이전트 명의의 감사 로그 |
| Agent Sandbox | 자체 네트워크 경계를 갖춘 격리 실행 환경 |
| Agent Gateway | 에이전트의 모든 트래픽이 통과하는 인공지능용 네트워크 방화벽 |
| 실시간 지출 상한 | Cloud Billing에서 프로젝트 에이전트를 일시 중지하고 클릭 한 번으로 재개 |
Google Cloud는 사용 실적도 제시했다. 약 500개 고객사가 각각 1년 동안 1조 개 이상의 토큰을 처리했으며, Fortune 100 기업의 약 90 %가 Gemini Enterprise를 사용한다. 다만 게시물에는 에이전트 자체의 출시일이나 가격이 나와 있지 않다. Google Cloud는 동적 모델 선택을 시험한 스포츠 브랜드 On 등 사전 체험에 참여한 대형 고객사만 언급했다.
🔗 Gemini at Work 2026 (Google Cloud 블로그)
Gemini Enterprise, Antigravity 도구에서 Claude Opus 5.5와 Claude Sonnet 5.5 지원
10월 8일 — 같은 날 공개된 Gemini Enterprise 릴리스 노트에 따르면, 관리자는 Antigravity 2.0, Antigravity CLI, IDE용 Antigravity 확장 프로그램에서 Claude Opus 5.5와 Claude Sonnet 5.5를 활성화할 수 있다. 관리자는 별도의 Anthropic 계정 없이 Google Cloud 콘솔에서 직접 이용 약관에 동의한다.
| 활성화 설정 | Google이 명시한 값 |
|---|---|
| 기본 상태 | 타사 모델 비활성화, 관리자가 활성화 |
| 과금 방식 | 프로젝트 지출 상한 내에서 사용량에 따라 과금 |
| 추론 위치 | global, us 및 eu |
| 사고 수준 | Low, Medium (기본값), High 또는 Max |
개발자는 Gemini Enterprise 라이선스를 유지하면서 모델 선택기에서 Claude를 선택한다. 타사 모델을 사용하려면 초과 사용(overages)을 먼저 활성화해야 하며, 해당 모델의 비용은 모든 모델에 공통으로 적용되는 지출 상한에 포함된다. 같은 페이지에서는 싱가포르에서 Gemini 3.8 Flash가 정식 출시됐다는 소식도 전했다.
음성: HeyGen Voice, Controlled Voice 순위 1위… Mistral, 아랍어용 모델 2종 공개
10월 9일 — HeyGen이 HeyGen Voice를 출시했다. 조슈아 쉬는 이를 지금까지 아바타로 알려진 회사가 자체 개발한 첫 음성 모델이라고 소개했다. 이 모델은 HeyGen과 API에서 사용할 수 있으며, 가격은 100만 자당 30달러다. 10월 31일까지 API 사용자는 자동으로 할인을 적용받아 15달러를 지불한다.
성능을 뒷받침하는 근거는 HeyGen보다 1분 30초 먼저 평가 결과를 공개한 Artificial Analysis에서 나왔다. 모든 모델이 동일한 복제 음성 8개로 미국 영어와 영국 영어를 구사하는 Controlled Voice 순위에서 HeyGen Voice는 1 468회의 평가 출전으로 Elo 1 201을 기록하며 1위를 차지했다. 어시스턴트와 고객 서비스 부문, 영국 영어 부문에서도 1위다.
HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo
🇰🇷 HeyGen Voice가 Artificial Analysis의 Controlled Voice TTS Arena 순위에서 Alibaba의 Qwen-Audio-3.1-TTS-Plus와 ElevenLabs의 Eleven v4 Turbo를 앞서며 1위를 차지했다. — @ArtificialAnlys의 X 게시물
| 평가 모델 | Controlled Voice Elo (10월 9일) | 100만 자당 API 요금 |
|---|---|---|
| HeyGen Voice | 1 201 | 30달러 (10월 31일까지 15달러) |
| Qwen-Audio-3.1-TTS-Plus | 1 182 | 19,3달러 |
| Eleven v4 Turbo | 1 166 | 40달러 |
| Eleven v4 | 1 162 | 80달러 |
이 1위 기록은 음성 복제라는 특정 범위에 해당한다. 각 제공업체가 자체 음성을 사용하는 Provider Voice 순위에서는 10월 9일 저녁에도 Eleven v4 Turbo와 Eleven v4가 선두를 유지했으며, HeyGen Voice는 상위 8개 모델에 들지 못했다. 발음 안정성 평가에서 HeyGen Voice는 83,1 %를 기록해 29개 모델 중 10위에 올랐다.
API의 음성 복제는 즉시 이루어진다. 녹음 하나에서 처음 3분만 사용해 별도의 학습 없이 몇 초 만에 사용 가능한 음성을 만든다. 음성 합성은 일괄 출력(44,1 kHz WAV 파일)이나 스트리밍으로 진행되며, Artificial Analysis는 API의 기본 설정을 평가했다.
Voxtral Mini 4B Realtime Arabic과 LIDstral Arabic: Mistral의 아랍어용 모델 2종
10월 8일 — Mistral은 별도 발표 없이 아랍어용 공개 모델 2종을 Apache 2.0 라이선스로 Hugging Face에 게시했다. Voxtral Mini 4B Realtime Arabic은 아랍어 방언과 현대 표준 아랍어를 스트리밍으로 전사하며, 화자가 대화 도중 언어를 바꾸는 경우(code-switching)도 지원한다. Voxtral Mini 4B Realtime을 미세 조정한 모델로, 매개변수는 약 44억 개다. 모델 설명에 따르면, 2026년 1월 Mistral과 모로코가 체결한 협력의 일환으로 모로코 디지털 전환·행정 개혁부와 공동 개발했다. 이 협력을 통해 ISMA와 Darija in the Wild라는 새로운 벤치마크 2종도 만들어졌다.
| 공개 모델 | 모델 기능 | 모델 설명에 따른 결과 |
|---|---|---|
| Voxtral Mini 4B Realtime Arabic | 아랍어 스트리밍 전사 | 480 ms 조건의 7개 벤치마크에서 평균 문자 오류율 8,82 %, Voxtral Transcribe Arabic은 7,91 % |
| LIDstral Arabic | 프로세서에서 언어 및 방언 식별, 51개 클래스 | 모로코 다리자어에서 F1 88,67 %, GlotLID v3는 71,28 % |
🔗 Hugging Face의 Voxtral Mini 4B Realtime Arabic · Hugging Face의 LIDstral Arabic
Claude Managed Agents: 실행당 최대 1 000개의 에이전트를 구동하는 동적 워크플로
10월 9일 — Anthropic은 새로운 다중 에이전트 조율 방식인 Claude Managed Agents의 동적 워크플로(dynamic workflows)를 공개 베타로 제공한다. 세션을 이끄는 에이전트가 직접 프로그램을 작성하면, 서버가 백그라운드에서 이를 실행하면서 단계별로 여러 에이전트를 구동한 뒤 결과를 통합한다. multiagent_20261001 유형을 활성화하면 에이전트가 실행 시작 여부를 결정한다.
한 번의 실행에서 최대 1 000개의 에이전트를 구동하며, 이 중 64개가 동시에 실행된다. 기본 유지 시간은 24시간이고, 한 세션에서 10개의 실행을 열린 상태로 유지할 수 있다. 실행에 사용된 토큰은 세션의 토큰과 동일하게 과금되며 세션 예산에 포함된다. Anthropic은 토큰 사용량이 많을 수 있다고 경고하며, 116 000줄의 코드베이스에 인위적으로 넣은 버그 70개를 대상으로 진행한 내부 테스트를 소개했다.
| Anthropic 테스트 구성 | 3차례 시도에서 발견한 버그 |
|---|---|
| 단일 에이전트 | 14, 15 및 27 |
| 동적 워크플로 | 매 시도에서 66 |
🔗 @ClaudeDevs의 발표 · 워크플로 실행 문서
코딩 에이전트: Codex의 메시지 예측과 MXC 샌드박스, Claude Code 2.1.296, Vibe CLI 2.26.1
Codex는 같은 날 두 가지 새 기능을 도입했으며, Anthropic과 Mistral은 명령줄 에이전트의 새 버전을 공개했다.
Codex, 사용자의 다음 메시지 예측… Pro 구독자 대상 베타 제공
10월 9일 — OpenAI는 Codex 데스크톱 앱에서 작성창 예측(composer predictions) 기능을 베타로 제공한다. Codex가 응답을 마치면 입력창에 다음 메시지 제안이 표시될 수 있다. 이 제안은 현재 대화를 바탕으로 생성하며, 메모리나 연결된 앱의 정보는 조회하지 않는다. Tab 키를 누르면 제안이 삽입되며, 텍스트는 계속 수정할 수 있고 자동으로 전송되지 않는다. 제안 대상은 단어별 자동 완성이 아닌 하나의 완전한 메시지다.
| 베타 이용 조건 | OpenAI가 명시한 값 |
|---|---|
| 요금제 및 연령 | 개인용 ChatGPT Pro, 18세 이상 |
| 대화 및 모델 | GPT-6 Astra 또는 GPT-6.1 Sol을 사용하는 로컬 및 SSH 대화 |
| 기본 설정 | 활성화됨, General > Composer > Show predictions에서 비활성화 가능 |
| 베타 기간 비용 | Codex 사용 한도에 포함되지 않으며 크레딧을 소비하지 않음 |
수락한 예측을 포함해 실제로 전송한 메시지는 기존 방식대로 사용량에 산입된다. 이 기능은 Chat에서는 제공되지 않는다.
🔗 @OpenAIDevs의 발표 · OpenAI 도움말
Windows용 Codex: Microsoft Execution Containers 기반 샌드박스
10월 9일 — OpenAI는 Windows용 Codex에 Microsoft Execution Containers(MXC) 기반 샌드박스 모드를 추가했다. Microsoft는 MXC를 10월 7일 정식 출시했다. 이 모드는 호환되는 Windows 11 기기(24H2 build 26100.9278 또는 25H2 build 26200.9278)가 필요하며, 더 빠른 설정, 더 엄격한 네트워크 제어, 더 세밀한 파일 접근 설정을 제공한다고 설명한다.
문서에 따르면 MXC는 권장 구현 방식이 된다. 관리자 승인을 받은 설정이나 추가 Windows 계정, 로컬 방화벽 규칙 없이 프로세스를 기본적으로 격리한다. elevated 및 unelevated 모드는 기존 방식의 대체 수단이 된다. 데스크톱 앱은 일반 소비자 계정에서 MXC를 자동으로 선택한다. CLI나 기업 환경에서는 config.toml에 prefer_mxc = true을 설정해 활성화하며, 관리자는 allow_mxc = false으로 차단할 수 있다. 문서에는 두 가지 제한 사항이 명시돼 있다. 관리형 네트워크에는 allow_local_binding = true이 필요하며, 남아 있는 하위 프로세스는 포그라운드 명령이 끝나면 종료된다.
🔗 @OpenAIDevs의 발표 · Windows 샌드박스 문서
Claude Code 2.1.296: 하위 에이전트 전용 컨텍스트 압축과 워크플로 에이전트의 모델 통일
10월 9일 — Claude Code 2.1.296에는 수정 사항 56개를 포함해 총 79개의 항목이 담겼으며, 별도 트윗은 게시되지 않았다. 주로 하위 에이전트에 대한 제어 기능을 강화했다.
| 새 버전의 기능 | 변경 내용 |
|---|---|
autoCompactWindow (하위 에이전트, --agents) | 하위 에이전트가 주 대화보다 일찍 컨텍스트를 압축 |
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL | 워크플로의 모든 에이전트가 같은 모델을 사용하며, 다른 하위 에이전트는 기존 모델을 유지 |
Read의 allow_large 옵션 | 컨텍스트가 허용하면 대용량 텍스트 파일을 한 번의 호출로 읽기 |
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MS | 529 오류 이후 재시도 사이의 최대 대기 시간 연장 |
| MCP 도구 설명을 처음부터 전송 | 기본 제한을 2 048자에서 4 096자로 확대 |
/cost과 상태 표시줄은 이제 Sonnet 5.5의 캐시 읽기 비용을 토큰 100만 개당 0,10달러로 계산한다. 보안 측면에서는 호출을 거부하면서도 턴을 종료하지 않던 관리형 PreToolUse 훅, BASH_ARGV0을 사용하는 일부 명령을 자동 승인하던 Bash 검사, Claude in Chrome 작업에서 자동 모드 검사를 건너뛰던 클라우드 세션 문제를 수정했다. 또한 비 UTF-8 파일의 모든 비 ASCII 문자를 바꾸던 Edit 및 NotebookEdit 수정 작업은 이제 거부된다.
Vibe CLI 2.26.1: 로컬 Devstral 모델 제거, 비대화형 모드 기능 확대
10월 9일 — 2.26.0 출시 사흘 뒤, Mistral이 별도의 트윗 없이 Vibe CLI 2.26.1을 공개했다. 패치 버전 번호를 달고 있지만, 이번 버전에는 85개 항목(추가 23개, 변경 24개, 수정 36개, 제거 2개)이 포함되며, 이 중 37개는 새로운 Rust 인터페이스에 관한 내용이다. 내장되어 있던 로컬 Devstral 모델은 제거됐다. 설정에서 여전히 이 모델을 고정해 둔 경우 경고와 함께 기본 호스팅 모델로 전환된다. 이 기본 모델은 이제 off와 high 두 가지 추론 수준만 제공하며, 컨텍스트 창 크기를 256k로 명시한다. 자동 압축도 이 크기를 기준으로 작동한다.
비대화형 모드 vibe -p에는 시간제한, 파일이나 표준 입력에서 프롬프트 읽기, 종료할 때마다 작성되는 export.json 보고서, 구분된 종료 코드가 추가된다. 사용법이나 설정 오류는 1, 인프라 장애는 2, 한도 도달이나 모델의 거부는 3이다. Rust CLI에는 /proxy-setup, 각 턴의 요약을 소리 내어 읽어 주는 내레이터, /plugins, /whoami이 추가된다. 새 설정으로 에이전트의 백그라운드 프로세스나 하위 에이전트 사용을 금지할 수 있으며, Document Library 커넥터는 기본적으로 비활성화된 상태를 유지한다.
생성형 이미지·영상·게임: Qwen-Image-2.1-Turbo, Midjourney의 Thinking 모드, Synthesia의 Syren, Google의 Playground
더 빠르고 저렴한 이미지 모델, 자신의 결과를 검토하는 생성기, 영상을 편집하는 에이전트, 코드 없이 게임을 만드는 플랫폼이 등장했다.
Qwen-Image-2.1-Turbo: 노이즈 제거 8단계, 이미지당 0,016달러
10월 9일 — Qwen이 Qwen-Image-2.1의 가속 체크포인트(accelerated checkpoint)인 Qwen-Image-2.1-Turbo를 공개했다. 동일한 70억 매개변수 아키텍처를 사용하며, 노이즈 제거 8단계로 이미지를 생성하고 수정한다. Qwen에 따르면 여전히 2K 이미지를 생성하고 자연어로 수정을 요청할 수 있지만, 이 버전의 품질이나 속도에 관한 구체적인 수치는 공개되지 않았다. 가중치는 Hugging Face와 ModelScope에서 Qwen 연구 라이선스(Qwen Research License)에 따라 제공된다. 체크포인트에는 8단계 샘플링 일정이 내장되어 있으며, 기본 CFG 값은 1이다.
같은 날 Qwen은 Qwen-Image-2.1 Pro와 Turbo API를 공식 개방했다. QwenCloud는 Turbo에 분당 120회의 요청을 허용한다.
| API로 제공되는 모델 (Model Studio) | 이미지당 가격 | 무료 이미지 수 |
|---|---|---|
| qwen-image-2.1-turbo | 0,016달러 | 10 |
| qwen-image-2.1-pro | 0,04달러 | 10 |
| qwen-image-2.0-pro | 0,075달러 | 100 |
🔗 Qwen 발표 · Hugging Face 모델 소개
Midjourney, Thinking 모드 시험 및 알파 사이트의 공유 폴더 기능 공개
10월 8일 — 저녁에 공개된 Midjourney 알파 변경 내역에는 초기 버전 기능 두 가지가 소개됐다. 현재는 alpha.midjourney.com에서만 사용할 수 있다. 첫 번째는 시험 기능이다. V8.2로 생성하거나 편집한 이미지에서 Rerun (Thinking) 버튼을 누르면, 모델이 결과를 살펴보고 프롬프트와 다른 부분(사물, 배치, 해부학적 구조, 텍스트)을 찾아 다시 생성한다. Midjourney는 프롬프트 충실도, 타이포그래피, 일관성에서 더 나은 결과를 확인했다고 밝히며, 이를 일반 모드로 제공하는 방안을 검토하고 있다.
두 번째는 폴더 공유 기능이다. 폴더에서 직접 이미지를 생성할 수 있는 공동 작업자나 열람자를 초대할 수 있고, 링크로 공유하거나 모든 Midjourney 회원에게 폴더를 공개할 수도 있다. Midjourney는 공유가 이미지의 공개 범위를 바꾸지는 않는다고 설명한다. stealth 모드를 사용하지 않으면 이미지는 여전히 Explore와 프로필에 나타날 수 있다.
🔗 Midjourney 알파 변경 내역 · Thinking 모드 시험 안내 (Midjourney)
Syren: Synthesia, 영상 제작을 에이전트에 맡기는 베타 기능 출시
10월 9일 — Synthesia가 무료 계정을 포함한 모든 고객에게 Syren 베타를 출시했다. 원하는 영상을 설명하거나 문서, 이미지, 영상, PowerPoint 프레젠테이션, YouTube 링크를 제공하면, Syren이 그래픽 애니메이션(motion graphics), 아바타, 내레이션, 음악, 보조 화면(b-roll)을 포함한 완성된 영상을 만들어 준다. 이후 대화로 수정할 수 있다. Synthesia의 최고기술책임자 피터 힐에 따르면, 에이전트는 영상 전체를 코드로 작성하며, 6월부터 Synthesia 애니메이션에 사용해 온 자체 렌더링 엔진이 이를 실시간으로 재생한다.
영상은 가로 또는 세로 형식으로 최대 3분까지 제작할 수 있으며, 브라우저에서 렌더링된다. 요금은 크레딧 단위로 부과되지만 상세 가격은 공개되지 않았고, Enterprise 관리자는 도구를 비활성화할 수 있다. 블로그 글은 기존 영상에서 브랜드 정체성을 자동으로 학습하는 기능도 곧 제공할 예정이라고 밝혔다. Syren은 HeyGen의 HyperFrames Studio 출시 나흘 뒤, Anthropic의 Claude Motion 출시 다음 날 등장했다. 이 두 도구 역시 에이전트가 영상을 제작한다.
Playground: Google, 코드 없이 게임을 만드는 플랫폼 공개
10월 7일 — Google이 몇 개의 프롬프트로 게임을 설명해 코드 작성 없이 만들고, 플레이하고, 공유할 수 있는 실험적 게임 플랫폼 Playground를 출시했다. 대화형 인터페이스에서 빈 화면으로 시작하거나, 예제를 변형하거나, 단계별 안내를 받을 수 있으며, 이후 요청에 따라 물리 법칙, 규칙, 캐릭터, 배경을 조정한다.
게임은 휴대전화와 컴퓨터의 브라우저에서 실행된다. 비공개로 유지하거나 링크로 공유하거나 Explore 갤러리에 공개할 수 있으며, 일부 장르에는 순위표와 멀티플레이 기능이 제공된다. 공개되는 모든 게임은 안전성 검사를 거친다. Playground는 미국의 18세 이상 사용자에게 개방되며, 게임 생성 권한은 Google AI 구독에 따라 달라진다. 더 야심 찬 3D 게임을 위한 Unity Spark 연동도 곧 비공개 베타로 제공될 예정이다. Google은 플랫폼을 구동하는 모델이 무엇인지는 밝히지 않았다.
건강: AMIE 임상 연구, The Lancet에 게재
10월 8일 — Google과 베스 이스라엘 디코니스 메디컬 센터(BIDMC)가 Google의 대화형 진단 인공지능 AMIE(Articulate Medical Intelligence Explorer)에 관한 전향적 타당성 연구를 The Lancet에 발표했다. Google에 따르면 이는 Lancet 본지에 실린 자사의 첫 논문이다. 환자들은 긴급 진료를 받기 최대 5일 전부터 AMIE와 대화했으며, 이후 의사는 대화 기록과 요약을 받았다.
| 연구 측정 항목 | 발표된 결과 |
|---|---|
| 등록 환자(2025년 4월~11월), 이후 추적 관찰 환자 | 114, 이후 98 |
| 안전상의 이유로 중단된 사례 | 0 |
| 확인된 환각 | 1 |
| 의사가 진료 준비에 AMIE가 유용하다고 평가한 사례 | 44건 중 33건 (75 %) |
| 최종 진단과 일치한 진단 (Google) | 90 % |
단일 기관에서 대조군 없이 진행됐으며 Alphabet이 연구비를 지원한 연구다. 승인이나 실제 도입을 의미하지는 않으며, 저자들은 더 큰 규모의 시험이 필요하다고 강조한다.
🔗 Google 블로그 글 · The Lancet 논문
OpenAI 연구: 회사와 결별한 연구자 세 명의 서한에 대한 답변
10월 9일 — OpenAI가 연구 책임자들 명의로 @OpenAINewsroom에 게시한 입장문에서, 지난주 회사와 결별했다고 밝힌 연구자 세 명의 서한에 답했다. OpenAI에 따르면 내부 조사 결과 이들은 민감한 정보 취급에 관한 명확한 규정을 위반했으며, 신뢰 훼손의 범위는 서한에 드러난 내용보다 더 넓었다. OpenAI는 기존 결정을 유지한다. 또한 이러한 결정은 안전 우려를 제기하거나 의견을 공개적으로 밝힌 것과는 무관하며, 우려를 표현했다는 이유로 직원을 해고하지 않는다고 주장한다.
입장문은 다음 내용도 발표했다.
We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.
🇰🇷 우리는 현재 외부 안전성 평가 기관과의 계약 체결을 적극적으로 마무리하고 있으며, 앞으로 몇 주 안에 세부 사항을 발표할 것입니다. — @OpenAINewsroom의 X 게시물
OpenAI는 한 가지 점에서는 서한에 동의한다고 밝혔다. 프런티어 모델의 모니터링 가능성(monitorability)을 유지하려면 OpenAI를 포함한 업계 전체의 노력이 필요하다는 것이다. 이 글은 OpenAI의 설명을 전달하며, 연구자들의 서한은 직접 확인하지 않았다.
개방형 모델 제작: ML Intern으로 약 103달러에 모델 여섯 개 제작, Ai2의 GPU 스케줄러
모델 제작에 관한 두 가지 경험 사례다. 하나는 에이전트 측면, 다른 하나는 컴퓨팅 클러스터 측면을 다룬다.
ML Intern: 약 103달러의 컴퓨팅 비용으로 개방형 모델 여섯 개 제작
10월 8일 — 이곳에서 이미 10월 1일과 8일에 다른 관점으로 소개한 HuggingChat의 ML Intern 모드에 대해, Hugging Face 블로그가 처음으로 수치가 담긴 결과를 공개했다. 프로젝트 여섯 개를 처음부터 끝까지 수행했으며, 총 컴퓨팅 비용은 약 103달러였다. 각 프로젝트는 메시지 하나로 시작해 평가를 포함한 공개 모델을 Hub에 게시하는 것으로 끝난다. 에이전트는 계획을 세우고, 비용이 발생하는 컴퓨팅 작업 전에 허가를 요청하며, 짧은 시험을 실행한 뒤 Hugging Face의 하드웨어에서 학습, 평가, 게시를 진행한다.
| ML Intern이 제작한 모델 | 발표된 결과 | 컴퓨팅 비용 |
|---|---|---|
| Pocket Rewriter (0.8B) | 유효한 출력 99,7 %, Qwen-Image 2.1의 9B 재작성 모델 대비 약 4분의 1 수준의 토큰 사용 | 약 16달러 |
| Citrus Doctor (Qwen3.5-2B) | 감귤류 질병의 정확한 진단 비율이 14,9 %에서 52,8 %로 상승 | 약 1,90달러 |
| Qwen-Image 2.1용 LoRA 두 개 | 시점 변경, 낙서를 요청한 사물로 대체 | 약 16달러 및 24,30달러 |
| Huggy LoRA (FLUX.2 klein) | 캐릭터 LoRA | 약 7,60달러 |
| Agate 4단계 | 소형 이미지 모델을 50단계(가이던스 포함 시 100회 실행)에서 4단계로 증류 | 약 37달러 |
Ai2의 GPU 스케줄러: 대기 시간 중앙값이 5분에서 24초로 단축
10월 9일 — Ai2가 제러미 트라이바가 작성한 블로그 글에서 GPU 클러스터의 새 스케줄러를 자세히 소개했다. NVIDIA H100, B200, B300 GPU 수천 개가 881 024개 규모의 클러스터로 구성되어 약 150명의 연구자에게 공유되며, 수요는 공급의 23배에 이른다. 기존 우선순위 기반 시스템에서는 아무 작업도 하지 않는 태스크가 GPU를 계속 점유했고, 결국 모든 작업의 우선순위가 최대로 올라갔다.
새 시스템은 연구 조직도에 따라 배분되는 GPU 시간 예산, 최근 7일을 기준으로 계산하는 계층적 공정 배분(fair-share), 그리고 ‘스케줄링 계약’을 기반으로 한다. 각 작업은 최대 8시간의 보호 시간을 선언하며, 그 시간이 지나면 선점되어 다시 대기열에 들어갈 수 있다. 배정되지 않은 시간은 무료로 사용할 수 있지만 언제든 선점될 수 있다.
| Ai2가 측정한 지표 | 기존 스케줄러 | 새 스케줄러 |
|---|---|---|
| 최대 H100 클러스터의 대기 시간 중앙값 | 5분 | 24초 |
| 디버깅 작업의 대기 시간 p90 | 2시간 | 30초 |
| 30일 동안 제공된 약정 GPU 시간 | — | 98 % |
사람의 개입이 필요한 복구 작업은 74 % 줄었다. Ai2는 기존에는 일주일까지 지속할 수 있었던 대화형 세션이 이제 8시간 후에는 선점될 수 있다는 등의 한계를 인정하며, 코드는 공개하지 않았다.
의사결정 모델: pplx-decider-v1.1-27b, Decision Bench 최고 점수 기록…다른 아홉 모델과 통계적으로 동률
10월 9일 — 이미 10월 6일과 8일에 다룬 Perplexity의 의사결정 모델이 외부 평가 결과를 얻었다. Atlan Frontier Labs의 오픈 소스 평가 도구 Decision Bench(폐쇄형 질문 1 071개, 데이터셋 36개, 순위에 오른 모델 15개)에서 pplx-decider-v1.1-27b는 원점수 기준 최고 점수인 94,5 %를 기록했으며, 비용도 의사결정 1 000건당 0,017달러로 가장 낮았다. 다만 이 사이트는 95 % 신뢰구간이 겹치는 모델에 같은 순위를 부여한다. 따라서 모델 열 개가 공동 1위다.
| Decision Bench에서 평가한 모델 | 측정된 정확도 | 1 000행당 비용 |
|---|---|---|
| pplx-decider-v1.1-27b | 94,5 % | 0,017달러 |
| DeepSeek V4.1 Flash | 94,2 % | 0,683달러 |
| Gemini 3.5 Flash | 94,2 % | 3,32달러 |
| Jev 1.13 | 93,8 % | 0,044달러 |
Perplexity는 탐색 에이전트 실용 가이드(cookbook)도 공개했다. 이 가이드에서는 클릭을 항상 코드가 결정하며, 모델은 결정하지 않는다. 또한 API에서는 v1.1이 v1을 대체한다.
🔗 @perplexitydevs의 연속 게시물 · Decision Bench 순위
Grok Bot, 자체 이메일 주소 부여
10월 9일 — SpaceXAI의 에이전트 Grok Bot에 이제 자체 이메일 주소가 생겼다. Bot은 이 주소로 서비스에 가입하거나, 사용자를 대신해 기업에 연락하거나, 다른 사람과 약속을 잡을 수 있다. 기능은 발표 당일 배포됐다. Bot에게 주소를 요청하거나 X에서 @bot을 언급하면 되며, 팀에서는 관리자가 먼저 기능을 활성화해야 한다.
발표는 @bot 계정의 연속 게시물을 @grok이 공유한 형태로 이루어졌으며, x.ai에는 별도의 블로그 글이 없다. 주소 형식이나 도메인, 제공 대상 요금제는 명시되지 않았다. 9월 말 Team Bots에 자체 Slack 식별자가 제공된 데 이어, 에이전트는 외부에서 활동할 수 있는 독자적인 신원을 갖게 됐다.
ElevenLabs, 동남아시아 거점으로 싱가포르 진출
10월 8일 — ElevenLabs가 싱가포르 진출을 공식 발표했다. 이곳에 동남아시아와 더 넓게는 아시아·태평양 지역의 거점이 될 사무소를 연다. 블로그 글은 이미 마련된 인프라를 강조한다. 7월부터 기업은 싱가포르에 데이터를 호스팅할 수 있으며, 데이터 미보관 옵션과 지역 내 지연 시간 단축이 제공된다.
ElevenLabs는 특히 지역 고객 사례를 소개했다. 다섯 시장에서 대화형 인공지능으로 잠재 고객을 선별하는 Funding Societies, 말레이시아의 Boost Bank, 필리핀의 Salmon Group, 인도네시아의 MNC Group, 싱가포르 공립 병원 60 %가 사용하는 의료 플랫폼 Rezonate 등이다. 인원 규모는 공개되지 않았다. 이번 진출은 9월 말과 10월 초에 이루어진 브뤼셀 및 암스테르담 진출에 뒤이은 것이다.
단신
- Claude Code의 Projects — Anthropic이 대기 명단에 등록한 모든 Pro 및 Max 구독자에게 이용 권한을 제공했다. Projects는 여전히 베타 단계다. 대기 명단은 계속 열려 있고, 수용 능력에 따라 추가 이용 권한이 제공될 예정이며, 문서에 따르면 Team과 Enterprise에는 아직 제공되지 않는다. 🔗 출처
- 에이전트 자동화 가이드 — claude.dev의 가이드가 Claude Managed Agents 기반의 참조 구현을 소개한다. 이 구현은 정해진 일정에 따라 Slack 채널과 GitHub의 pull request를 읽고 Slack에 요약을 게시한다. 가이드는 여섯 구성 요소와 흔한 장애에 대한 대응책을 자세히 설명하며, 읽을 수 없는 소스를 별일 없는 하루로 오인하지 않거나 지출 상한을 정상 실행 비용의 3~5배로 설정하는 방법 등을 다룬다. 🔗 출처
- Block과 Claude Fable — Anthropic이 공개한 인터뷰에서 Block은 Claude Fable이 대규모 코드 마이그레이션을 설계하고 최대 수십 개의 Opus 또는 Sonnet 모델을 지휘해, 한 번의 마이그레이션에서 최대 1,000개의 pull request를 병합하는 규모로 작업한다고 설명했다. 병합과 운영 환경 배포는 사람이 담당하며, 배포에는 두 차례의 승인이 필요하다. 🔗 출처
- Claude Enterprise의 Compliance API — 대화 엔드포인트(endpoints)가 기존 키를 사용해 통합 Claude 환경의 대화도 베타로 반환한다. 클라우드 세션에서 이어간 대화는 하나의 대화로 반환되며, Claude의 작업은
tool_use및tool_result블록에 담긴다. 🔗 출처 - Codex CLI 0.162.1 — 0.162.0의 이번 패치는 여러 줄로 된 비동기 질문에서 발생하던 TUI 충돌과, 이미 실행 중인 백그라운드 서버의 기능 설정이 CLI와 달라 발생하던 시작 실패를 해결한다. 🔗 출처
- ChatGPT Enterprise와 Edu의 역할별 플러그인 — 역할 기반 접근 제어(RBAC)가 활성화되면 소유자와 관리자가 역할별로 플러그인 접근 권한을 설정할 수 있다. 작업 공간에는 Available, Install 또는 Disabled를 설정하고, 사용자 지정 역할에는 Default를 설정해 작업 공간 설정을 상속하게 할 수 있다. 🔗 출처
- Sophos와 OpenAI Daybreak — 이 사이버 보안 업체에 따르면 Daybreak로 구축한 에이전트가 처리하는 사건의 평균 대응 시간은 약 38분에서 약 89초로 줄었으며, MDR 사건의 52 %는 AI가 처음부터 끝까지 해결한다. 파괴적인 작업은 여전히 사람의 감독을 받는다. 🔗 출처
- Asana와 StackAI의 탐색 에이전트 — Asana에 따르면 Codex의 GPT-6 Astra가 약 일주일 만에 이 에이전트를 최적화했다. GPT-6.1 Sol에서는 테스트 한 번에 0.47달러가 들고 약 4분이 걸리며, 이는 기존 운영 구성보다 비용이 76배 낮고 속도가 5배 빠른 수준이다. 🔗 출처
- LegalOn과 Codex — LegalOn Technologies는 GPT-5.5의 무제한 빠른 모드에서 GPT-6 Luna, GPT-6.1 Sol, GPT-6 Astra에 작업을 분배하는 방식으로 전환하고, 필요할 때만 빠른 모드를 사용하며 서비스별·개인별 상한을 적용해 Codex의 추정 일일 비용을 약 65 % 줄였다고 밝혔다. 🔗 출처
- Gemini CLI v0.64.0-preview.1 — 이번 프리뷰는 무해한 셸 명령에서 발생하는 Untrusted Command Flags Detected 경고의 오탐을 없앤다. 읽기 전용 옵션은 예외 처리하고, 셸 변수는 유지하며, 각 하위 명령에 ALLOW 규칙이 있으면 반복문을 허용한다. 10월 9일에는 nightly가 출시되지 않았으며, 정식 버전은 여전히 v0.63.0이다. 🔗 출처
- Antigravity 2.22.0 — 플러그인이 측면 패널에 자체 인터페이스를 표시할 수 있고(UI Extensions), 사이드바의 섹션 사이에서 대화를 끌어다 놓아 정리할 수 있으며, 타임스탬프에 월 이름이 표시된다. 🔗 출처
- Gemini 3.7 Flash 사용 중단 예정 — Gemini API에서
gemini-3.7-flash호출은gemini-3.8-flash로 리디렉션되며, 기존 에이전트deep-research-pro-preview-12-2025는 10월 23일 종료된다. 대체 에이전트는deep-research-preview-04-2026또는deep-research-max-preview-04-2026다. 🔗 출처 - Google Flow Music용 VST3 및 AU 플러그인 — 10월 6일 소식: 자연어로 만든 악기와 효과인 Spaces를 디지털 오디오 워크스테이션(Digital Audio Workstations)용 플러그인으로 내보낼 수 있다. 프로듀서 크리스 리딕타인스의 No Chaser 플러그인이 그 예다. 🔗 출처
- Google Earth AI와 공중 보건 — 10월 6일 소식: 콩고민주공화국의 에볼라 유행 당시, 지리 공간 추론 에이전트 시제품이 세계보건기구(OMS) 아프리카 사무소에서 몇 분 만에 위험에 노출된 지역 48곳과 위험군 45,500명 이상을 파악하도록 도왔다. PDFM 모델은 콜레라 위험 지역도 최대 8주 전에 파악한다. 🔗 출처
- Copilot code review 과금 — 유료 AI Credits 사용이 활성화되어 있으면, 조직 소유자는 라이선스를 보유한 구성원이 요청한 리뷰 비용을 구성원의 할당량에서 차감하는 대신 저장소를 소유한 조직에 청구할 수 있다. 또한 조직이나 기업이 제공한 라이선스에만 리뷰 실행 권한을 부여할 수 있다. 🔗 출처
- Copilot CLI 1.0.95 — 정식 버전으로 출시되었으며, macOS에서 Microsoft Entra의 네이티브 브로커로 인증하고 실패하면 브라우저로 전환한다. 프리뷰 1.0.96-0은 각 권한 결정을 사용자, Assisted Permissions, 정책 또는 무인 모드의 대체 처리 중 누가 내렸는지 타임라인에 표시한다. 🔗 출처
- GitHub MCP Server 2.0 — 10월 6일 소식: GitHub의 공식 MCP 서버가 Code Mode 또는 Programmatic Tool Calling으로 작업하는 에이전트에 출력 스키마(output schemas)로 정의된 타입 지정 출력을 반환한다. 이 출력은 MCP 2026-07-28 이상 사양을 사용하는 클라이언트에만 알려진다. 🔗 출처
- Genspark의 Claude Haiku 5.5 — Genspark가 AI Chat, Code Agent, Claw에 이 모델을 도입했다. Haiku 4.5보다 실행 비용이 약 75 % 낮다는 Anthropic의 설명을 그대로 인용했으며, 자체 요금제나 가격은 제시하지 않았다. 🔗 출처
- v0용 Meta VR 템플릿 — Meta가 Vercel과 함께 Immersive Web SDK 기반의 v0 템플릿을 공개했다. 경험을 설명하면 v0가 코드를 작성하고 미리보기를 제공하며, 한 번의 클릭으로 Vercel에 배포해 Quest 브라우저에서 열 수 있다. 2027년 봄 출시 예정인 Meta VR Glasses의 시선 및 손 입력도 이미 지원한다. 🔗 출처
- v0 for teams — v0가 동료의 작업을 확인하고, 동료의 대화에 참여하며, 함께 제작하는 방식을 영상으로 소개했다. 이 게시물은 9월부터 단계적으로 도입된 기능을 강조하며, 새로운 요금은 제시하지 않았다. 🔗 출처
- DeepSeek Harness 0.2.1-alpha.2 — 26번째 프리뷰로, 정식 버전은 아직 없다. 플러그인 카탈로그가 필요할 때 Claude Code와 Codex 패키지를 설치하고, 두 가지 실험적 플러그인인 Git Worktrees와 추론 번역이 추가되었으며, 공유 AGENTS.md에서 전역 지침을 가져올 수 있다. 🔗 출처
- OGX 1.5.0 — 4월에 이름을 바꾸고 meta-llama 조직에서 독립한 기존 Llama Stack이 DeepSeek 및 Fireworks AI용 /v1/messages API의 네이티브 패스스루, Text-Embeddings-Inference 공급자, Exa 및 Serply 웹 검색, MCP 2.x 클라이언트를 추가했다. 기존 호환성을 깨뜨리는 변경 사항은 네 가지다. 🔗 출처
- GenIA — Meta가 튀빙겐 AI 센터와 함께 수행한 이 연구의 코드를 별도 발표 없이 비상업용 CC BY-NC 4.0 라이선스로 공개했다. 추론 시점에 SAM 3D Objects의 고정된 사전 분포를 정렬해, 재학습 없이 이미지 한 장, 몇 개 시점의 이미지 또는 동영상에서 3D 객체를 재구성한다. 🔗 출처
- Hub의 decision-model 라벨 — Hugging Face가 의사결정 모델에 전용 라벨을 부여하고 Models 페이지에 아이콘과 필터를 추가했다. 의사결정 GGUF에는 llama.cpp 메타데이터를 바탕으로 라벨이 자동으로 지정된다. 🔗 출처
- Darwin-27B-ZTC-v2 — VIDRAFT는 Apache-2.0 라이선스의 새 평가 모델이 System One Mosaic Benchmark(137개 평가)에서 Borda 점수 89.58로 OpenJev-27B(87.50)와 Jev 1.13(85.05)을 앞서며 1위에 올랐다고 발표했다. 저자들이 발표한 순위이며, 공개 순위표의 특정 시점 현황이라고 설명한다. 🔗 출처
- 의사결정 모델의 확신도 — 스티븐 솔카는 커뮤니티 게시글에서 OpenRouter를 통해 질문한 GPT-6 Luna Decisions가 SHA-256 검증 600건에 «일치하지 않음»이라고 답해 정확도 50 %, 평균 확신도 99.8 %를 기록했다고 보여준다. 인과 추론에서는 확신도 99 %를 기준으로 선별한 49개 답변 중 47개가 정답이었지만, 전체 사례의 8.2 %만 포괄했다. 🔗 출처
- 강화 학습 환경으로 옮긴 openai-math — FineEnvs가 openai/math 논문에서 Lean으로 형식화한 405개 결과 중 369개를 Harbor 환경으로 옮겼다. 에이전트는 Lean 4 샌드박스에서 정리를 증명해야 하며, Comparator는 정확히 해당 명제를 완전히 증명한 경우에만 보상을 부여한다. Apache-2.0 라이선스의 실험적 데이터셋이다. 🔗 출처
- JOSIE-2 — 괵데니즈 귈메즈가 Mac M4 두 대에서 약 3,000개의 선별된 예제로 Qwen3.5를 사후 학습한 2B, 4B, 9B 모델군의 기술 보고서를 공개했다. 추론 모드에서 JOSIE-2-4B는 ARC-Challenge에서 95.5(+12.1), TruthfulQA에서 69.2(+20.3)를 기록했으며, 평가한 벤치마크는 두 개뿐이다. 🔗 출처
- Gradio 6.30 —
gr.Workflow에 애플리케이션 보기가 추가되었으며, Run this node 명령은 하위 그래프 전체를 다시 실행하는 대신 아직 유효한 상위 결과를 재사용한다.gr.ImageEditor은 불러온 이미지의 알파 채널을 유지한다. 🔗 출처 - tokenizers 0.23.3 — Python 패키지만 대상으로 한 이번 패치는
huggingface_hubv2를 지원해, 릴리스 노트에 따르면 Transformers 설치를 가능하게 한다. 또한 0.23.1에서 도입된 잘라내기 관련 호환성 파괴 변경을 되돌린다. 🔗 출처 - AI의 학술 심사 — Sakana AI가 TMLR에 게재 승인된 논문을 소개했다. 이 연구의 벤치마크는 논문에 모순된 주장을 삽입해 AI 심사자가 이를 찾아내는지 검증한다. Sakana AI의 발표에 따르면 자사의 Multi-Layered Review가 테스트한 다른 시스템보다 더 많이 탐지했지만, 수치는 제시하지 않았다. 🔗 출처
- Suno Studio — 클립이 첫 박자에 더 잘 맞춰지고 프로젝트 템포에 맞게 늘어나며, 페이드에 지수 또는 로그 곡선을 적용할 수 있다. 신시사이저, 키보드, 플러그인 보기를 분리해 두 번째 화면에도 배치할 수 있다. Studio는 Premier 구독에 포함된다. 🔗 출처
- World Models’ Last Exam in Physics — Einsia의 영상 모델 대상 물리 시험(40개 과제, 9개 범주, 8개 모델)에서 Seedance 2.5가 100점 만점에 57.76점으로 1위를 차지했다. MiniMax가 최고의 공개 모델이라고 소개한 MiniMax H3(54.89)와 NVIDIA의 Cosmos 3 Super(42.46)가 뒤를 이었다. 제3자 벤치마크다. 🔗 출처
- 에이전트가 구축한 Omniverse 시뮬레이션 — NVIDIA 블로그는 사내 팀들이 GPT-6 Astra를 통해, 한 사례에서는 Claude Fable 5를 통해 ovphysx, ovstage, ovrtx, ovui 라이브러리로 시뮬레이션을 구성하는 모습을 소개한다. 약 3일 만에 만들거나 개선한 디지털 트윈도 포함되며, 새로운 제품은 발표하지 않았다. 🔗 출처
- Shopify 상점 관리 — 상점을 연결하면 Grok Bot이 주문을 확인하고, 재고를 추적하며, 상품 정보를 최신 상태로 유지할 수 있다. 요금제나 제한은 명시되지 않았다. 🔗 출처
- X 검색 — 10월 7일 소식: 모든 사용자가 X 커넥터를 설정하지 않고도 Grok Bot으로 X를 검색하고 읽고 모니터링할 수 있다. 예를 들어 제품에 대한 반응을 추적하거나 해당 업계의 주간 요약을 받을 수 있다. 8월 말에는 여전히 계정 연결이 필요했다. 🔗 출처
- Grokipedia v0.3 — 공식 계정에 따르면 Grok이 작성하는 이 백과사전은 일주일 동안 독자가 요청한 문서 4,400개 이상을 게시하고, 하루 2,200건 이상의 수정을 수행했다. 새 문서당 출처는 평균 78개이며, 이제 수정 사항을 실시간으로 보여주는 페이지도 제공한다. 🔗 출처
- mistral CLI 0.8.0 —
mistral apps deploy이 워크플로 워커와 모든 모듈도 한 번에 배포하며, API 키 하나만으로 지속적 통합 환경에서도 사용할 수 있다.mistral apps dev은 Docker에서 로컬 Postgres 데이터베이스를 실행한다. 대신 현재 디렉터리의.env은 더 이상 읽지 않는다. 🔗 출처 - Mistral Python SDK 3.2.0 — 채팅 및 에이전트 호출이 응답과 프롬프트의 로그 확률(logprobs)을 지원하며,
top_k, 반복 페널티, 최소 토큰 수도 지원한다. 별도 발표 없이 자동 생성된 버전이다. 🔗 출처 - Qwen Code v0.25.1-preview.1 — 사흘 사이에 나온 v0.25.1의 두 번째 프리뷰로, 새로운 기능 16개와 수정 사항 27개가 포함된다. 세션 중심의 다중 에이전트 협업과, 도구 입력을 수정한 뒤 전체를 다시 검증하는 PreToolUse 훅 등이 추가되었다. 정식 버전은 아직 출시되지 않았다. 🔗 출처
- Perplexity Agent API의 Claude Haiku 5.5 — 10월 7일 소식: Agent API가
anthropic/claude-haiku-5-5를 Anthropic 요금으로 지원한다. 입력 토큰이 100,000개 이하이면 토큰 100만 개당 입력 0.10달러, 출력 0.50달러이며, 이를 초과하면 각각 0.50달러와 2.50달러다. 🔗 출처 - 공유 또는 전용 추론 — Cohere의 Embed 및 Rerank 가이드는 요청 수보다 요청의 형태가 더 중요하다고 설명하며, NVIDIA A10 GPU 한 개를 사용하는 전용 인스턴스와 비교한 예시 손익분기점을 계산한다. 긴 문서는 분당 약 4건, 카탈로그는 20건, 재순위화(reranking)는 29건이다. 🔗 출처
- 에이전트 또는 MCP — Perplexity가 결정을 내리는 에이전트와 에이전트를 도구에 연결하는 MCP를 구분하는 가이드를 공개했다. 선택 기준 표, 온라인 상점 사례, 네 가지 위험과 대응책을 담고 있다. 가이드에 따르면 Claude, ChatGPT 또는 Cursor가 Perplexity의 MCP 서버를 통해 Computer에 작업을 맡길 수 있다. 🔗 출처
이것이 의미하는 바
이제 하나의 에이전트가 수많은 다른 에이전트를 조율하며, 각 에이전트에는 고유한 신원이 부여된다. Gemini 에이전트는 각자 고유한 신원을 가진 하위 에이전트를 실행하며, 자체 주소를 가진 동료 에이전트가 될 수도 있다. Claude Managed Agents에서는 에이전트가 최대 1 000개의 에이전트를 실행하는 프로그램을 작성할 수 있다. Grok Bot에는 외부에서 활동할 수 있도록 이메일 주소가 주어지고, Block은 하나의 마이그레이션에서 수십 개 모델을 지휘하는 역할을 Claude Fable에 맡긴다. 이제 중요해지는 질문은 에이전트가 작업을 수행할 수 있는지가 아니라, 이를 어떻게 관리할 것인가이다. Google은 Agent Gateway, Agent Sandbox, 각 에이전트 명의의 감사 로그와 실시간 지출 한도로 이에 대응한다. Anthropic은 한도에 도달하면 모든 실행을 일시 중지하는 세션 예산으로, OpenAI는 네트워크와 파일 접근을 더 엄격하게 제한하는 Windows 샌드박스로 대응한다.
플랫폼 자체에서도 여러 모델을 함께 사용하는 방식이 자리 잡고 있다. Gemini를 개발하는 Google은 자체 에이전트가 Claude 모델을 조율하도록 하고, 모델 선택과 에이전트 선택을 명시적으로 분리한다. 또한 Antigravity에서 Claude Opus 5.5와 Sonnet 5.5를 제공하며, 자사 모델과 동일한 지출 한도 안에서 사용료를 청구한다. Genspark와 Perplexity의 Agent API는 Claude Haiku 5.5 출시 후 며칠 안에 이를 추가하고, LegalOn은 작업 성격에 따라 코딩 작업을 OpenAI의 세 모델에 나누어 맡기며, Block은 자동 모델 선택기를 구축한다.
단가는 계속 낮아지고 있으며, 각 발표는 이를 수치로 보여 준다. Qwen-Image-2.1-Turbo는 이미지당 0,016달러로 Pro 버전보다 2,5배 저렴하다. HeyGen Voice는 10월 31일까지 100만 자당 15달러, 이후에는 30달러로 Eleven v4 Turbo보다 저렴하다. pplx-decider-v1.1-27b는 1 000건의 결정당 0,017달러이며, ML Intern으로 약 103달러의 연산 비용을 들여 여섯 개 모델을 Hub에 공개했다. 다만 최상위 순위는 세심하게 살펴봐야 한다. HeyGen Voice가 1위를 차지한 것은 음성을 통제한 순위에서만이며, pplx-decider는 신뢰 구간이 겹치는 다른 아홉 개 모델과 공동 순위에 올라 있다.
의료 분야에서는 여전히 신중해야 한다. The Lancet에 발표된 AMIE 연구는 단일 기관에서 대조군 없이 진행되고 Alphabet이 자금을 지원한 타당성 연구다. 환자 98명이 참여했으며, 안전상의 이유로 중단된 대화는 없었고, 환각 현상 한 건이 확인됐다. 이는 저자들도 직접 요구하는 더 큰 규모의 시험으로 나아가는 단계이며, 승인이나 환자를 대상으로 한 도입을 뜻하지 않는다.
출처
- Gemini at Work 2026 (Google Cloud 블로그)
- Gemini Enterprise 릴리스 노트
- HeyGen Voice 발표 (@HeyGen)
- Artificial Analysis 결과 (@ArtificialAnlys)
- Voxtral Mini 4B Realtime Arabic (Hugging Face)
- LIDstral Arabic (Hugging Face)
- Claude Managed Agents의 동적 워크플로 (@ClaudeDevs)
- 워크플로 실행 문서 (Claude Platform)
- Codex의 입력창 예측 (@OpenAIDevs)
- 입력창 예측 도움말 문서 (OpenAI)
- Windows용 Codex의 MXC 샌드박스 (@OpenAIDevs)
- Windows 샌드박스 문서 (ChatGPT Learn)
- Claude Code 2.1.296 (GitHub)
- Vibe CLI 2.26.1 (GitHub)
- Qwen-Image-2.1-Turbo (@Alibaba_Qwen)
- Qwen-Image-2.1-Turbo (Hugging Face)
- Midjourney 알파 변경 기록
- Thinking 모드 테스트 (Midjourney)
- Syren (Synthesia)
- Playground (Google 블로그)
- AMIE 임상 연구 (Google 블로그)
- The Lancet의 AMIE 연구
- OpenAI 연구 책임자들의 글 (@OpenAINewsroom)
- ML Intern으로 만든 여섯 개 모델 (Hugging Face 블로그)
- Ai2의 GPU 스케줄러 (Ai2 블로그)
- Decision Bench의 pplx-decider-v1.1-27b (@perplexitydevs)
- Decision Bench 순위
- Grok Bot의 이메일 주소 (@bot)
- 싱가포르의 ElevenLabs (ElevenLabs 블로그)
- Claude Code의 Projects (@ClaudeDevs)
- 효과적인 에이전트 자동화 구축 (claude.dev)
- Block과 Claude Fable (claude.com)
- Claude Platform 릴리스 노트
- Codex CLI 0.162.1 (GitHub)
- ChatGPT Enterprise 및 Edu 릴리스 노트
- Sophos와 OpenAI Daybreak (OpenAI)
- Asana와 StackAI의 브라우징 에이전트 (OpenAI)
- LegalOn과 Codex (OpenAI)
- Gemini CLI v0.64.0-preview.1 (GitHub)
- Antigravity 변경 기록
- Gemini API 릴리스 노트
- Google Flow Music 플러그인 (Google 블로그)
- Google Earth AI와 공중 보건 (Google 블로그)
- Copilot code review 과금 (GitHub 변경 기록)
- Copilot CLI 1.0.95 (GitHub)
- GitHub MCP Server 2.0.0 (GitHub)
- Genspark의 Claude Haiku 5.5 (@genspark_ai)
- v0용 Meta VR 모델 (Meta)
- 팀용 v0 (@v0)
- DeepSeek Harness 0.2.1-alpha.2 (GitHub)
- OGX 1.5.0 (GitHub)
- GenIA (GitHub)
- Hub의 결정 모델 (Hugging Face 변경 기록)
- Darwin-27B-ZTC-v2와 System One Mosaic Benchmark (Hugging Face 블로그)
- 결정 모델의 신뢰도 (Hugging Face 블로그)
- FineEnvs/openai-math (Hugging Face)
- JOSIE-2 기술 보고서 (Hugging Face 블로그)
- Gradio 6.30.0 (GitHub)
- tokenizers 0.23.3 (GitHub)
- 인공지능을 활용한 과학 논문 검토 (@SakanaAILabs)
- Suno Studio 업데이트 (@suno)
- 세계 모델의 물리학 최종 시험 (Einsia)
- 에이전트가 구축한 Omniverse 시뮬레이션 (NVIDIA 블로그)
- Grok Bot과 Shopify (@bot)
- Grok Bot과 X 검색 (@bot)
- Grokipedia v0.3 성과 정리 (@Grokipedia)
- mistral CLI 0.8.0 (GitHub)
- Mistral Python SDK 3.2.0 (GitHub)
- Qwen Code v0.25.1-preview.1 (GitHub)
- Agent API 모델 (Perplexity)
- Embed와 Rerank의 공유 또는 전용 추론 (Cohere 블로그)
- 에이전트 또는 MCP (Perplexity 블로그)