ai-powered-markdown-translatorgpt-5.6-sol을 사용하여 프랑스어에서 한국어로 번역된 기사.
이번 화요일 Google은 백그라운드에서 도구를 호출하면서도 대화를 끊지 않는 실시간 음성 대화 모델 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시한다. Anthropic은 Claude Code 세 가지 버전을 공개하고 Salesforce를 Claude에 통합하며, OpenAI는 10월 14일 ChatGPT와 Codex에서 GPT-5.5를 지원 종료한다. 에이전트는 Perplexity를 사전 설치하는 HP부터 AWS Marketplace에서 판매되는 Devin까지 기존 유통망에도 진출하고 있으며, NVIDIA는 Vera Rubin 플랫폼을 구성하는 두 가지 요소를 상세히 공개했다.
말하면서 작업하는 두 음성 모델, Gemini 3.8 Live와 3.8 Live Extended Thinking
9월 15일 — Google이 Gemini Audio 팀에서 선보인 두 가지 실시간 음성 대화 모델을 출시한다. Gemini 3.8 Live는 규모, 속도, 비용을 겨냥한다. 거의 실시간으로 시각 입력을 받아들이며 대화 도중 97개 언어를 자동으로 전환한다. Gemini 3.8 Live Extended Thinking은 여러 단계의 추론이 필요한 작업을 위한 모델이다. 추론과 발화를 동시에 수행하고, 짧은 말로 요청 접수를 알리며 백그라운드 작업의 진행 상황을 설명한다. 추론 수준은 API에서 조절할 수 있다. 두 모델 모두 음성 응답을 계속하는 동안 백그라운드에서 도구와 API를 호출하는 비동기 함수 호출을 실행한다.
The models talk, think, and handle tasks in the background without breaking your flow.
🇰🇷 이 모델들은 대화의 흐름을 끊지 않으면서 말하고, 생각하고, 백그라운드 작업을 처리합니다. — @GoogleDeepMind의 X 게시물
Google은 확인 코드나 사건 번호처럼 받아 적은 영숫자 데이터의 정확성도 강조하며, 이 모델들을 음성 인식, 텍스트 처리, 음성 합성을 차례로 연결하는 파이프라인형 아키텍처보다 단순한 대안으로 소개한다. Gemini 3.8 Audio 모델 설명서에 따르면 두 모델은 Gemini 3 Pro를 기반으로 하며, 128K tokens의 컨텍스트에서 오디오, 이미지, 동영상, 텍스트를 입력받고 최대 64K tokens을 출력한다. 지식 기준 시점은 2025년 1월이다.
| 순위 또는 benchmark | 평가 모델 | Google이 공개한 점수 |
|---|---|---|
| 음성 대 음성 품질 지수(Artificial Analysis) | 3.8 Live Extended Thinking | 82,6(1위) |
| τ-Voice | 3.8 Live Extended Thinking | 68,6 % |
| τ-Voice-banking (Sierra) | 3.8 Live Extended Thinking | 35,1 % |
| Big Bench Audio | 3.8 Live Extended Thinking | 97,7 % |
| Speech Agent Arena (Artificial Analysis) | 3.8 Live | 2위 |
이 순위들은 제3자가 관리하지만, 인용된 점수는 Google이 공개한 수치다. Live API에서 Google은 두 모델의 비용을 입력 오디오의 경우 분당 0,005달러, 출력 오디오의 경우 분당 0,018달러로 추산한다. 이는 입력 100만 tokens당 3달러, 출력 100만 tokens당 12달러를 기준으로 한 것이다. 통합 업체로는 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents가 언급됐다.
| 제공 채널 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| Gemini API와 Google AI Studio | 9월 15일부터 | 9월 15일부터 |
| Gemini Enterprise | 비공개 미리보기 | 비공개 미리보기 |
| 일반 사용자 | Search Live | Gemini Live, Docs Live(Google AI Pro 및 Ultra 구독자), Gmail Live와 Keep Live(모든 Google AI 구독자) |
Search Live에서 이 모델은 실시간 문제 해결 과정을 단계별로 안내한다. 생성된 모든 오디오에는 보이지 않는 SynthID 워터마크가 적용된다.
🔗 Gemini 3.8 Live와 3.8 Live Extended Thinking 소개 🔗 Live API 개발자 게시물 🔗 Gemini 3.8 Audio 모델 설명서
Claude Code 2.1.271~2.1.273: Remote의 fast mode, 명령별 네트워크, 강화된 권한
9월 15일 — Anthropic이 22시간을 조금 넘는 기간에 Claude Code 세 가지 버전을 공개했다. 첫 버전은 파리 시각으로 자정 직후에 나왔다.
| 공개 버전 | 날짜와 시각(UTC) | 릴리스 노트 내용 |
|---|---|---|
| 2.1.271 | 9월 14일 22시 12분 | 96줄: Remote의 fast mode, 명령별 allowed_domains, omitClaudeMd, --accept-command |
| 2.1.272 | 9월 15일 0시 42분 | 한 줄: 버그 수정 및 안정성 개선 |
| 2.1.273 | 9월 15일 20시 23분 | 64줄: LLM 게이트웨이용 헤더, Remote Control 세션 복제, Bedrock·Vertex·Foundry의 로컬 분류기 |
2.1.271은 조직이 허용한 경우 클라우드와 자체 호스팅 실행기 모두에서 Claude Code Remote 세션에 fast mode를 제공한다. 샌드박스를 사용하는 자동 모드에서 Bash, PowerShell, Monitor는 명령별 allowed_domains 목록을 지원한다. 필요한 호스트를 명령과 함께 검토해 해당 명령에만 개방하고 나머지는 거부한다. 에이전트 frontmatter의 omitClaudeMd 필드는 사용자, 프로젝트, 로컬 CLAUDE.md 파일 없이 하위 에이전트를 실행하되 관리형 정책 파일은 계속 불러온다. 또한 claude plugin install --accept-command <sha256>는 --json에서 이전에 표시된 정확한 명령만 허용하며 -y은 허용하지 않는다. 2.1.273에서는 claude --remote-control로 시작한 세션을 Claude 앱에서 복제할 수 있으며, 복제된 세션은 컴퓨터의 백그라운드에서 실행된다. MCP 서버의 연결이 끊기고 자동 재연결 시도가 중단될 때도 경고하며, CLAUDE_CODE_GATEWAY_HINT_HEADERS=1로 활성화되는 LLM 게이트웨이용 요청 헤더를 추가한다.
| 변경된 요소 | 새로운 동작 |
|---|---|
| 자동 모드에서 하위 에이전트의 반환 | 마지막 메시지를 사후 검사하는 대신 안전 분류기가 검토하는 전용 반환 호출(hand-back call) 사용 |
자동 모드에서 skill의 ! 명령과 slash 명령 | 분류기 대신 기본 모드의 권한 규칙 적용 |
| Monitor 감시 | 최대 30분의 만료 시간 필수(-p 실행 시 10분), 재설정할 수 있도록 Claude에 알림 |
| 동적 workflow | 사용량 한도에 도달하면 일시 중지하고 초기화 시 자동 재개하며, 에이전트를 중단하지 않음 |
| Bedrock, Vertex, Foundry의 자동 모드(2.1.273) | 당분간 로컬 분류기를 기본으로 사용하고, 플랫폼 분류기는 CLAUDE_CODE_AUTO_MODE_SERVER=1로 사용 |
두 버전은 여러 권한 검사 문제도 수정한다. 하위 shell, 두 번의 디렉터리 변경 또는 cd + git 조합을 포함한 명령은 permissions.blockReadsOutsideWorkingDirectories에서 확인 요청을 건너뛰었으며, 하위 shell은 권한 우회(bypass) 모드에서 위험한 rm을 숨길 수 있었다. 서버 측 관리 설정이 있으면 MDM 또는 managed-settings.json에서 강제한 MCP 설정이 무시됐다. /resume과 /teleport는 이전 대화에서 읽은 파일의 추적 정보를 유지했기 때문에 Claude가 재개된 대화에서는 읽은 적 없는 파일을 수정할 수 있었다. 마지막으로 컨텍스트 표시기는 advisor 도구의 대화 차례를 실제 크기의 약 두 배로 계산해 컨텍스트 창의 절반쯤에서 자동 압축을 일으켰다.
세 릴리스 노트 모두 9월 14일 발표된 Claude Mods를 언급하지 않는다. 다만 이슈 #91870에서 커뮤니티 테스터들은 2.1.272가 이미 관련 영역에 영향을 미쳤다고 판단한다.
🔗 Claude Code 2.1.271 릴리스 노트 🔗 Claude Code 2.1.273 릴리스 노트
승인된 조직을 위한 베타 영업 plugin, Salesforce in Claude
9월 15일 — Anthropic이 영업 담당자의 계정, 영업 기회, pipeline을 Claude로 가져오는 Salesforce in Claude 베타를 출시한다. 공식 게시물은 Salesforce와 함께 설계한 plugin이라고 소개하는 반면, 도움말 센터는 계정 조사, 통화 준비, pipeline 검토, CRM 업데이트 등 37개의 영업 skill을 Salesforce가 구축했다고 설명한다. Salesforce 읽기·쓰기용 connector와 비즈니스 채널 및 팀 thread를 위한 Slack connector 두 가지도 함께 제공된다.
Salesforce는 계속 기준 시스템으로 유지된다. 각 영업 담당자는 자신의 자격 증명으로 연결하고, Claude는 해당 사용자의 Salesforce 권한이 허용하는 정보만 읽으며, 모든 쓰기 작업은 기본적으로 승인을 받아야 한다. 이 plugin은 채팅과 Claude Cowork의 웹 및 desktop 버전에서 작동한다. 베타는 유료 요금제를 대상으로 하지만 Salesforce의 베타 등록을 통해 승인되고 최신 Sales Cloud Enterprise Edition을 보유한 조직만 이용할 수 있다. 해당 조직의 Salesforce 관리자는 AgentExchange에서 접근 권한을 요청한다. GitLab, Siemens, Legora가 이를 도입했으며 Salesforce 영업 담당자 7,000명이 사용하고 있다.
🔗 Salesforce를 Claude에 통합 🔗 조직에 Salesforce in Claude 설정하기
GPT-5.5, 10월 14일 ChatGPT·ChatGPT Work·Codex에서 퇴장하지만 API에는 유지
9월 15일 — OpenAI가 자사 애플리케이션에서 GPT-5.5 지원을 종료한다고 X에서 발표했다. 이 내용은 이미 9월 14일 자 ChatGPT 및 Codex changelog에 기재돼 있었다. 10월 14일, GPT-5.5는 일반 사용자, Business, Enterprise, Edu를 포함한 모든 요금제의 ChatGPT, ChatGPT Work, Codex에서 제거된다.
| 대상 서비스 | 10월 14일 상황 |
|---|---|
| ChatGPT와 ChatGPT Work | 모든 요금제에서 GPT-5.5 제거 |
| ChatGPT 로그인 방식의 Codex | GPT-5.5 제거, gpt-5.6-sol로 전환하도록 요청 |
| API key 방식의 Codex | GPT-5.5 계속 이용 가능 |
| OpenAI API | GPT-5.5 계속 이용 가능 |
ChatGPT 로그인 방식의 Codex에 대해서는 gpt-5.5가 명시적으로 선택된 모든 곳에서 이를 교체하라고 문서가 안내한다. 여기에는 workspace 기본값, 저장된 설정, 관리형 구성, 맞춤형 에이전트, 예약 작업, script가 포함된다. @ChatGPT 계정의 게시물은 Codex의 대체 모델로 GPT-6 Astra도 언급한다. 관리자 안내서는 기본 모델을 바꾼다고 해서 해당 모델에 대한 접근 권한이 생기는 것은 아니므로, 관련 사용자가 대체 모델을 이용할 수 있는지 client별로 확인해야 한다고 경고한다. OpenAI는 7월 31일 발표 후 ChatGPT 로그인 사용자용 Codex에서 8월 31일 제거된 GPT-5.4와 GPT-5.4 mini에 적용했던 한 달 전 사전 고지 방식을 다시 따랐다.
🔗 ChatGPT 및 Codex changelog 🔗 @ChatGPT의 X 게시물
HP, Autodesk Revit 연동과 함께 Windows PC에 Perplexity 사전 설치
9월 15일 — Perplexity와 HP가 PC 작업 표시줄에 Windows용 Perplexity 애플리케이션을 사전 설치한다고 발표했다. AMD Ryzen AI Max PRO 400 시리즈 프로세서를 탑재한 ZBook Ultra G3a 모바일 workstation부터 시작하며, 앞으로 몇 달 안에 다른 모델도 추가되지만 목록, 가격, 날짜는 공개되지 않았다. 게시물에 따르면 ZBook Ultra G3a의 로컬 AI 기능으로 cloud credit 없이 오프라인에서 작동하는 에이전트의 로컬 버전인 Portable Computer를 통해 일상적인 작업을 실행할 수 있다. 다만 이용 가능 여부는 기기 구성에 따라 달라진다. 게시물에는 호환 구성이 나와 있지 않지만, 전날 공개된 Windows 버전은 최소 24GB 비디오 메모리를 갖춘 NVIDIA RTX GPU를 요구했다.
Portable Computer는 건축 정보 모델링(Building Information Modeling) 소프트웨어인 Autodesk Revit에도 연결된다. 별도 module로 기술 미리보기(Tech Preview) 형태로 제공되는 Revit 2027의 MCP 서버를 이용한다. 접근 권한은 읽기 전용이다. 에이전트는 특정 층의 문 개수나 문의 내화 등급처럼 모델에 관한 질문에 답하고, 모델을 수정하지 않은 채 보기, PDF, 일람표를 내보낸다. Personal Computer for Windows는 Windows 10과 11에서 Pro, Max, Enterprise 구독자가 이용할 수 있다.
🔗 HP를 통해 더 많은 Windows PC에 제공되는 Perplexity
Cognition, AWS와 계약하고 Devin Cloud에서 macOS 출시
9월 15일 — Cognition이 같은 날 인프라로 연결된 두 가지 소식을 발표했다. 이제 Devin이 Apple 애플리케이션을 빌드하는 Mac은 AWS EC2 Mac 호스트다.
AWS와의 전략적 협력 계약
Cognition과 Amazon Web Services는 다년간의 전략적 협력 계약(Strategic Collaboration Agreement)을 체결했으며, 게시물에는 금액이나 정확한 기간이 명시되지 않았다. 두 가지는 이미 시행 중이다. Devin은 AWS Marketplace를 통해 구매할 수 있으며, Agent Toolkit for AWS는 Devin에서 직접 사용할 수 있다. 고객의 AWS 환경과 더욱 긴밀하게 통합하는 방안도 검토 중이지만 일정은 공개되지 않았다. Devin은 고객이 선택한 AWS 리전의 단일 테넌트(single-tenant) 환경에 배포되며, 데이터는 전용 VPC에 보관되고 세션마다 가상 머신 하나가 할당되어 작업이 끝나면 삭제된다.
| Cognition이 언급한 고객 | 발표된 결과 |
|---|---|
| Mercedes-Benz | 200,000줄이 넘는 COBOL을 분석했으며, 8개월로 예상된 프로젝트를 8일로 단축 |
| 이름이 공개되지 않은 자동차 제조업체 | 25,000줄 규모의 COBOL 흐름을 메인프레임(mainframe)에서 AWS Lambda로 마이그레이션했으며, 예상 비용은 73% 절감 |
Devin Cloud에 macOS 도입
Cognition은 이미 7월 31일에 Xcode와 iOS Simulator를 갖춘 macOS 기반 Devin 클라우드 에이전트를 공개했다. iPhone, iPad, Mac 애플리케이션을 빌드하고 검증하기 위해 9월 15일 Devin Cloud에 출시된 이번 기능에는 몇 가지 새로운 요소가 포함됐다. Devin은 테스트 화면 녹화를 Slack으로 보내고, 애플리케이션을 설치할 수 있는 TestFlight 링크를 전달하며, 새로운 iOS Simulator 패널은 실행 중인 애플리케이션을 보여준다. 에이전트는 컴퓨터 사용(computer use) 도구에 노출된 접근성 트리를 통해서도 애플리케이션을 조작한다. 역할과 이름으로 컨트롤을 조회하고 조작한 뒤 트리를 다시 읽으며, 화면 캡처는 계속 렌더링 결과를 판단하는 데 사용된다. 이 계층은 Dioxus의 오픈 소스 accessibility-cli를 기반으로 하며, 해당 팀은 9월 10일 Cognition에 합류했다.
macOS VM은 물리적 AWS EC2 Mac에서 Apple의 Virtualization.framework를 통해 실행되며, 세션을 재개할 때 머신을 계속 켜둘 필요가 없도록 스냅샷(snapshots) 시스템에 NBD(Network Block Device) 인터페이스가 추가됐다. 사용자 공간의 Ethernet 게이트웨이가 Apple의 관리형 NAT를 대체해 각 세션의 네트워크 정책을 적용한다. 요금과 대상 플랜은 모두 공개되지 않았다.
NVIDIA, Vera Rubin의 두 가지 핵심 구성 요소인 Groq 3 LPX와 NVLink 6 상세 공개
9월 15일 — NVIDIA 기술 블로그의 두 게시물은 Vera Rubin 플랫폼이 추론 과정에서 에너지를 절약하고 네트워크 장애를 견디는 방식을 설명한다. 아래 수치는 NVIDIA가 제시한 것이다.
Groq 3 LPX, 전압 여유를 줄이는 결정론적 실행
Groq 3 LPX의 프로덕션 도입은 8월 24일 이곳에서 다뤘으며, 이번 게시물은 그 작동 원리를 설명한다. 실행에 앞서 LPU 칩 컴파일러는 랙에 있는 256개 칩에서 각 연산과 데이터 전송이 이뤄지는 시점을 클록 주기 단위로 고정하여 전류 수요를 예측할 수 있게 한다. 두 가지 기술이 이를 활용한다. Preemptive Power(PEP)는 수요가 급증하기 직전에 전원망에 전압을 높이도록 요청하고, Clock Period Synthesis(CPS)는 전류가 가장 빠르게 상승하는 구간의 클록 주기를 늘린다. 목표는 모든 회로가 확보하는 전압 여유(voltage guardband)를 줄이는 것이다. 전력은 전압의 제곱에 비례해 증가하므로 이 여유에는 큰 비용이 든다. 전압이 10% 높아지면 전력은 21% 증가한다.
내부 테스트에서 전압 강하는 60% 넘게 감소했다. NVIDIA는 동일한 부하에서 필요한 전력이 비슷한 비결정론적 시스템보다 10%대 초반(low-double-digit) 비율로 줄어들 수 있다고 추산한다. 이러한 제어 기능은 2026년 하반기에 Vera Rubin에 도입된다.
🔗 Groq 3 LPX의 결정론적 실행에 관한 NVIDIA 게시물
NVLink 6, 실리콘부터 소프트웨어까지 아우르는 복원력 스택
NVLink 6는 Vera Rubin NVL72 랙의 Rubin GPU 72개를 하나의 도메인으로 연결한다. 범용 Ethernet 대안보다 패킷 처리량이 10배 높다는 NVIDIA의 주장은 이미 7월 21일 이곳에서 언급됐다. 이번 게시물은 계층별 장애 허용 방식을 상세히 설명한다.
| 스택 계층 | NVIDIA가 설명한 메커니즘 |
|---|---|
| 물리 계층 | 경량 오류 수정과 물리 계층 재전송(Physical Layer Retry)의 결합 |
| 링크 계층 | 크레딧 기반 흐름 제어(credit-based flow control)로 설계상 패킷 손실 방지 |
| 링크 관리 | NMX Controller를 통한 약 1.5초 내 소프트웨어 복구 |
| 추론 서비스 | Shadow Engine Recovery(NVIDIA Dynamo): GPU B200에서 중단 시간을 283초에서 7.3초로 단축 |
| 다중 노드 체크포인트 | NCCL이 프로토타입으로 지원하는 cuda-checkpoint, 연말까지 정식 출시 예정 |
크레딧 기반 흐름 제어는 다음 홉에 패킷을 받을 공간이 있을 때만 패킷을 전송하는 반면, Ethernet은 PFC와 ECN에 의존한다. Shadow Engine Recovery는 자체 NCCL 통신기가 이미 초기화된 추론 엔진 복제본을 유지한다.
🔗 NVLink 6의 복원력에 관한 NVIDIA 게시물
Gemini Notebook, 노트북과의 음성 대화 및 오디오 녹음 기능 발표
9월 15일 — 새 학기를 맞아 Gemini Notebook은 디자인을 개편하고 다양한 학습 도구를 발표했으며, 대부분은 아직 출시를 앞두고 있다.
| 발표된 학습 도구 | 공개 일정 |
|---|---|
| 모바일에서 노트북과 실시간 음성 대화, 약 100개 언어 지원 | 이번 주 성인 Google AI Ultra 구독자에게 제공, Google AI Pro 및 기타 사용자에게 곧 제공 |
| 모바일 애플리케이션의 오디오 녹음기 | 다음 주부터 |
| Reports의 대화형 학습 개요 | 향후 몇 주 내 모든 사용자에게 제공 |
| 단답형, 객관식 또는 빈칸 채우기 퀴즈 | 향후 몇 주 내 모든 사용자에게 제공 |
| 공유 가능한 80개 이상의 언어로 제공되는 Short Video Overviews | 9월 1일의 70개 이상에서 확대되어 현재 제공 중 |
음성 대화는 노트북의 출처를 바탕으로 답변하며 음성으로 중단할 수 있다. 녹음기는 강의나 생각을 노트북 안에서 출처와 함께 직접 녹음한다. 학습 개요는 요약, 인포그래픽, 퀴즈, 복습 카드(flashcards)를 조합한다. 이미 8월에 발표된 학생용 혜택과 관련해 Google은 미국 학생에게 무료로 제공되는 Google AI Pro 1년 이용권이 Gemini Notebook의 한도를 4배로 늘리고, 140개가 넘는 기타 시장에서 제공되는 Google AI Plus 1년 이용권은 한도를 2배로 늘린다고 밝혔다.
🔗 새로운 Gemini Notebook 도구로 학습 루틴 개선하기
Antigravity 2.14.0, Enterprise 및 Business 계정에 통합 터미널과 Git 개방
9월 15일 — 10가지 개선 사항과 18가지 수정 사항을 포함한 Antigravity 2.14.0은 Enterprise 및 Business 계정에 사이드바의 통합 터미널과 Git 버전 관리를 개방한다. 이 기능들은 다른 계정에는 8월 24일의 2.10.0 버전에서 도입됐다. 기록이 매우 긴 대화는 더 빠르게 로드되고 메모리 사용량도 줄어들며, 메시지를 보낼 때마다 반복되던 skills, 규칙, 사용자 지정 파일의 중복 분석도 제거됐다.
수정 사항 가운데 일시적인 서비스 오류는 더 이상 세션을 종료하지 않는다. 대신 약 12분 동안 점차 길어지는 간격으로 재시도한다. 완료된 하위 에이전트가 활성 상태로 계속 표시되어 재시작할 때까지 후속 메시지를 차단하는 문제도 해결됐고, 터미널 명령 출력과 관련된 메모리 누수도 수정됐다. 버전 제목은 새로운 권한 시스템을 언급하지만, 릴리스 노트에서 이와 관련된 변경은 일반 설정 섹션의 이름을 “Global Permissions”로, 프로젝트 설정 상속 옵션을 “Inherit Global”로 바꾼 것뿐이다.
IBM Research, ALTK-Evolve로 에이전트의 일관성 격차를 절반으로 축소
9월 15일 — IBM Research는 Hugging Face 블로그에 ALTK-Evolve 시리즈의 세 번째 글을 게시했으며, 이번에는 에이전트 실행의 일관성을 다룬다. AppWorld의 168개 과제에서 온도를 0으로 설정한 GPT-4.1 기반 ReAct 에이전트는 5회 시도 중 평균 77.4%의 실행에 성공하지만(Mean@5), 5번 모두 성공한 과제는 53.0%에 불과하다(Pass^5). IBM은 이 24.4포인트 차이를 일관성 격차(consistency gap)라고 부른다.
Consistency Analyzer는 기록된 단일 궤적에서 불안정한 결정을 식별한다. 정답 데이터 없이, 과제를 다시 실행하지 않고, logits에도 접근하지 않은 채 각 단계를 오프라인에서 재생하며 다섯 개의 완성을 요청한다. 취약한 단계는 일관성 지침(consistency guidelines)으로 변환되어 추론 시점에 주입된다.
| 에이전트 구성 | Mean@5 점수 | Pass^5 점수 | 일관성 격차 |
|---|---|---|---|
| 지침이 없는 ReAct GPT-4.1 | 77.4% | 53.0% | 24.4포인트 |
| 일관성 지침이 있는 ReAct GPT-4.1 | 81.0% | 69.0% | 12.0포인트 |
gpt-oss-120b에서는 Pass^5가 10.1%에서 16.1%로 상승한다. Analyzer와 지침 생성 기능은 ALTK-Evolve 오픈 소스 저장소에 통합됐다.
🔗 Hugging Face 블로그의 IBM Research 게시물
Aillis, Evidence Finder에 Sakana Namazu 도입해 일본 의사 국가시험에서 96.4% 달성
9월 14일 — 머신러닝 기반 의료기기를 개발하는 일본 기업 Aillis가 의사를 위한 근거 검색 도구 Evidence Finder에 Sakana Namazu를 도입한다. Sakana Namazu는 Sakana AI가 8월 초 출시한 일본어 특화 LLM이다. 도쿄 시간 오전 11시에 발표된 보도자료는 9월 14일 집계 이후 같은 날 태평양 시간 오후 3시 30분에 Sakana AI가 X에서 공유했다. Evidence Finder는 의학 문헌을 바탕으로 참고문헌을 인용한 답변을 작성하며, Verify 기능은 해당 참고문헌의 존재 여부를 확인한다. 두 회사는 의료 분야 활용을 위한 공동 작업도 시작한다.
Sakana Namazu를 기반으로 하는 Evidence Finder 버전은 2026년 2월 시행된 제120회 일본 의사 국가시험에서 96.4%인 500점 만점에 482점을 획득했다. Aillis가 9월 1일 집계한 바에 따르면, 이는 일본 경제산업성의 GENIAC 프로그램이 지정한 일본산 파운데이션 모델 가운데 최고 점수다. 보도자료에는 두 가지 단서가 제시됐다. 이미지가 포함된 문제를 거부하는 것을 비롯한 제품 제한이 이번 시험에서는 해제됐지만 상용 서비스는 텍스트 문제만 처리하며, Evidence Finder는 의료기기가 아니다.
🔗 PR Times의 Aillis 보도자료 🔗 Sakana AI의 X 공유 게시물
Google, AI 사용 현황과 사회적 영향 수치 공개
9월 15일 — Google은 같은 날 AI의 실제 사용 현황과 사회적 파급 효과를 다룬 두 묶음의 게시물을 공개했다.
AI & Economy ATLAS 공개 및 과학자 대상 연구 발표
Google 수석 경제학자실의 연구 프로그램인 AI & Economy ATLAS가 누구나 이용할 수 있는 대화형 체험으로 공개된다. 9월 9일 이곳에서 언급된 행정 절차 관련 수치도 이 프로그램에서 나왔다. 사용자는 직업별, 가정 내, 국가별 AI 사용 현황을 비교할 수 있다.
| 강조된 ATLAS 지표 | Google이 공개한 수치 |
|---|---|
| 인도: 직업적 AI 사용에서 예술, 디자인, 미디어 직종이 차지하는 비중 | 19%, 세계 평균의 1.6배 |
| 미국: 컴퓨터 및 수학 분야의 비중 | 30%, 나머지 세계의 2배 |
| 브라질 및 독일: 장비 진단과 같은 수작업 과제의 비중 | 7%, 일본은 4% |
Google, Google DeepMind, MIT FutureTech가 2,600개의 특화 AI 모델을 분석하고 미국과 영국의 과학자 600여 명을 대상으로 설문한 연구에 따르면, 응답자의 거의 절반이 매일 AI를 사용하며 매주 7시간에 조금 못 미치는 시간을 절약한다고 답했다. 저자들은 부작용도 지적한다. AI 출력물을 검증하는 데 시간이 들고, 물리적 실험과 임상 검증을 기다리는 동안 검증되지 않은 가설이 계속 쌓인다는 것이다.
🔗 Google의 AI & Economy ATLAS에서 얻은 새로운 통찰
사회적 영향을 위한 AI: 언어, Google.org 수상자 및 FireSat
Google에 따르면 이 그룹의 기술은 70억 명 이상이 사용하는 300개 이상의 언어로 작동하며, 여러 데이터 세트는 현지 파트너와 함께 구축되었다. Google은 공개 데이터베이스 LinguaMeta를 시각화하는 대화형 도구 Language Explorer도 선보였다.
| Google이 언급한 이니셔티브 | 발표된 수치 |
|---|---|
| WAXAL, 공개 음성 말뭉치 | 사하라 이남 아프리카의 27개 언어 |
| Project Vaani | 109개 언어로 된 30,000시간 이상의 음성 |
| Google.org Impact Challenge: AI for Government Innovation | 수상자 15곳, 3,000만 달러, 지원서 2,600건 이상 |
| FireSat | 첫 번째 운영 위성군이 궤도에 진입했으며, 2030년경까지 약 50기를 배치해 20분마다 이미지를 촬영하는 것이 목표 |
| 8월 말 공개된 Planetary Prediction Engine | Google에 따르면 콩고민주공화국의 신규 Ebola 발생 지역 중 83%를 사전에 탐지 |
세금 신고 분야의 Code for America와 도로 안전 분야의 Johns Hopkins University를 비롯한 Google.org 수상자들은 Google 엔지니어의 자원봉사 지원을 받으며, 프로젝트를 재사용 가능한 오픈 소스 모델로 설계한다.
🔗 모든 사람을 위한 모든 언어의 AI 🔗 AI로 공공 서비스를 혁신하는 15개 조직 🔗 과학을 가속하고 삶을 개선하는 AI 구축 🔗 AI로 산불 감지하기
단신
- Anthropic이 영업팀의 Claude 배포를 위한 가이드를 공개 — Salesforce in Claude와 같은 날 공개된 AI 네이티브 매출 조직 구축은 두 고객을 인용한 게시물과 함께 소개되었다. Cox Communications는 첫해에 투자 대비 7배의 수익을 거두고 잠재 고객 검증 및 보강 비용을 86% 절감했으며, 정확도는 18%에서 97%로 높아졌다고 밝혔다. 또한 Cyera 직원 약 1,500명 중 88%가 매주 Claude를 사용한다. 🔗 출처
- Perplexity가 섀도 AI 가이드를 공개 (shadow AI) — 이 게시물은 자체 데이터를 제시하지 않고 외부 조사를 취합한다. 직원의 약 절반이 AI를 사용하면서 소속 조직의 규칙을 위반한 적이 있다고 답했으며(KPMG), Cloud Security Alliance 조사 응답자의 82%는 조직 시스템에서 알려지지 않은 에이전트가 발견됐다고 보고했다. 새로운 기능 없이 Perplexity Enterprise와 Comet for Enterprise를 홍보하는 내용으로 마무리된다. 🔗 출처
- v0가 모델에 구애받지 않는 방식으로 전환 (model-agnostic) — 단 하나의 트윗에 따르면 Vercel의 애플리케이션 제작 도구는 Vercel AI Gateway를 통해 제공되는 최첨단, 저가형, 개방형, 고속 모델을 지원하며, 여기에는 Claude, GPT, Kimi, GLM, Grok, DeepSeek가 포함된다. 전체 목록과 요금, 적용 대상 상품은 공개되지 않았다. 🔗 출처
- Warp가 사내 소프트웨어 팩토리의 성과를 수치로 공개 — 소프트웨어 팩토리(software factory) 도입을 위한 3단계 방법론(crawl, walk, run)을 설명한 게시물에서 Warp CEO Zach Lloyd는 자사 팩토리가 마케팅 사이트인 warp.dev 변경 사항의 약 75%를 자동화한다고 밝혔다. Warp Factories는 여전히 얼리 액세스 단계이며, 자격을 갖춘 기업에는 10,000달러 상당의 사용량이 제공된다. 🔗 출처
- Kimi Code 0.43.1이 서브 에이전트 스웜 문제를 수정 — 0.43.0 출시 후 19시간도 지나지 않아 Moonshot AI가 7개의 수정 사항을 공개했다. 여기에는 서브 에이전트 종료 시 메모리 해제, 대규모 스웜에서의 렌더링 및 이벤트 루프 경량화, 전체 CLI를 종료하는 대신 서브 에이전트만 중단하도록 변경된 Ctrl+C가 포함된다. 🔗 출처
- Gemini CLI v0.60.0이 안정화 버전으로 전환 — 이 버전은 9월 8일 프리뷰의 11가지 안정성 강화 변경 사항을 그대로 포함하며, v0.61.0-preview.0은 이미 nightly로 공개된 수정 사항 3개와 에이전트 루프 수정 사항을 포함해 다음 릴리스 계열을 시작한다. 🔗 출처
- Copilot이 저장소 사용자 지정 속성에 허용할 값을 제안 — 기업 또는 조직의 사용자 지정 속성(custom property)을 만들 때 Copilot이 클릭 한 번으로 승인할 수 있는 값을 제안한다. 이 기능은 Copilot Business와 Enterprise에서 공개 프리뷰로 제공되며, ‘Repository custom property suggestions’ 정책의 통제를 받는다. 🔗 출처
- Grok Imagine이 베타에서 이미지 속 텍스트 편집을 지원 — SpaceXAI의 이미지 및 동영상 생성 도구를 이용하면 초대장, 포스터, 광고 등 모든 이미지에 포함된 텍스트를 수정할 수 있다. 발표에는 요금제, 플랫폼, 사용 모델이 명시되지 않았다. 🔗 출처
- MiniMax H3가 디노이징에서 실시간 속도의 2배를 돌파 — 당일 집계 이후인 9월 14일 태평양 시간 오후 4시 34분에 게시된 트윗에서 MiniMax는 SGLang-Diffusion과 VDN-H3를 사용하면 H3가 B200 GPU 8개에서 14.4초 길이의 768p 동영상을 9.0초 만에 생성하며, 측정된 품질 저하는 없다고 밝혔다. 이는 9월 14일 정리된 H3 생태계의 연장선에 있다. 🔗 출처
- Retrieve-for-Train이 강화 학습을 소형 확산 모델로 증류 — ICML 2026 논문에서 나온 이 Google Research 연구는 오프라인 환경에서 4B 매개변수 모델을 강화 학습(Reinforcement Learning)으로 단 한 번 훈련해 다양한 하위 쿼리를 생성하게 한 다음, 그 동작을 5,390만 매개변수의 확산 모델로 증류한다. 이 모델은 전체 쿼리 집합을 한 번에 생성하며 12배에서 20배까지 속도를 높인다. 🔗 출처
- NVIDIA가 밀집 모델과 전문가 혼합 모델의 선택을 수치로 비교 (Mixture-of-Experts, MoE) — 이 교육용 게시물은 8월 31일 수집된 Artificial Analysis 데이터를 바탕으로 Gemma 4 31B, Qwen3.8-27B, Nemotron 3.5 Lightning, Mistral Small 4를 비교한다. 전체 30B 매개변수 중 3B가 활성화되는 Lightning은 Qwen3.8-27B보다 4배에서 5배 빠르고 비용은 14분의 1이지만, 역량 점수는 절반 미만이다. 🔗 출처
- NVIDIA FLARE 2.9에 Slurm 추가 — 버전 2.8부터 Docker와 Kubernetes를 지원해 온 연합 학습(federated learning) 프레임워크가 이제 하나의 연합 환경에서 세 가지 환경을 함께 운영하며, 작업별로 이식 가능한 리소스 설명 방식을 도입한다. 🔗 출처
- Sakana Marlin에 대화형 읽기와 PowerPoint 내보내기 추가 — 대화형 읽기(Interactive Reading)를 통해 Sakana AI의 자율 연구 어시스턴트에 보고서 내용을 질문하고, 주장을 뒷받침하는 인용 출처를 해당 지점에서 열 수 있다. 출처 URL이 포함된 편집 가능한 PowerPoint 프레젠테이션으로 내보내는 기능도 지원한다. 🔗 출처
- ShadowPEFT가 PEFT 라이브러리에 통합 — 커뮤니티 게시물에 따르면, 동결된 모델에 분리 가능한 소형 ‘섀도’ 네트워크를 연결하는 이 방법이 PEFT의 기본 브랜치에 병합되었으며 다음 버전에 포함될 예정이다. Llama-3.2-3B에서 저자들이 측정한 GSM8K 점수는 48.1%로 LoRA의 46.9%보다 높았지만, 최대 메모리 사용량은 28.2GB로 LoRA의 22.3GB보다 많았다. 🔗 출처
- RiverRider가 파일 위치 탐색 성능을 무작위 기준과 비교 — 개인 기여 프로젝트로, SWE-bench Verified에서 3,300만 매개변수의 로컬 인코더는 45.8%의 사례에서 올바른 파일을 1위에 올린다. 그러나 쿼리를 섞은 기준선도 24.4%의 사례에서 해당 파일을 상위 50개 결과 안에서 찾아내므로, 신호와 무작위 결과의 비율은 45.8에서 3.9로 낮아진다. 🔗 출처
- EcoHash가 Qwen3.8-27B에서 RTX PRO 6000의 동시 처리량을 2배로 향상 — 다른 주제로 9월 14일에도 인용된 추론 서비스 제공업체가 자체 서비스에서 측정한 게시물이다. vLLM 0.27.1에서 모델의 다중 토큰 예측 헤드(multi-token prediction, MTP)를 활성화하면 토큰당 시간이 22ms에서 13ms로 줄고 지속 가능한 동시 요청 수가 32개에서 64개로 늘어난다. 이 상한은 네 차례 반복 중 두 차례 달성됐으며, 그 대가로 KV 캐시 용량의 23%를 사용한다. 🔗 출처
- DINO-X가 실패 사례와 함께 간 혈관 연구 모델을 공개 — 연구 전용 커뮤니티 모델로, 8,600만 매개변수의 이 ViT-Base는 CT 스캔 단면 17,639개로 구성된 외부 데이터에서 0.9413의 AUROC를 기록했다. 저자는 공개되지 않은 0.6529 성능의 대장 전문 모델을 비롯한 부정적 결과도 함께 발표했다. 🔗 출처
이것이 의미하는 것
음성이 완전한 에이전트 인터페이스로 자리 잡고 있다. Gemini 3.8 Live와 Extended Thinking 변형은 응답을 계속하는 동안 백그라운드에서 도구를 호출하고, 받아쓰기로 입력된 코드와 숫자의 정확성을 높이며, 비용은 오디오 분당 기준으로 산정된다. Google은 백그라운드 작업의 진행 상황을 설명하는 Extended Thinking 변형을 Docs Live, Gmail Live, Keep Live와 함께 업무 도구에 곧바로 배치했다. 한편 Gemini Notebook은 각 노트북의 출처에 기반한 음성 대화 기능을 발표했다. 핵심 관심사는 음성의 품질에서 모델이 말하는 동안 무엇을 수행하는지로 이동하고 있다.
두 번째 흐름은 배포에 관한 것이다. 에이전트는 이미 존재하는 경로를 통해 업무 도구에 진입한다. Salesforce in Claude는 영업 스킬, CRM 및 Slack 커넥터, 각 쓰기 작업에 대한 승인을 갖추고 출시된다. HP는 자사 PC의 작업 표시줄에 Perplexity를 사전 설치하고 Revit 설계 모형에 읽기 전용으로 연결한다. Devin은 AWS Marketplace에서 구매해 전용 VPC에 배포할 수 있다. 모든 사례에서 에이전트는 기업이 이미 사용하는 도구 안으로 들어가며, 영업 담당자의 Salesforce 권한, Revit 읽기 전용 접근 권한, AWS 전용 VPC 같은 안전장치를 따른다.
세 번째 흐름은 신뢰성과 통제에 관한 것이다. Claude Code 버전 2.1.271과 2.1.273은 분류기가 서브 에이전트의 반환 내용을 검토하도록 하고, 명령별로 네트워크를 개방하며, 하위 셸이나 무시된 MDM 설정을 통한 권한 우회 문제를 수정한다. IBM Research는 온도를 0으로 설정한 에이전트가 실행당 평균 77.4%의 성공률을 보이면서도 다섯 번 모두 성공하는 작업은 53.0%에 불과할 수 있음을 보여주고, 평균과 함께 Pass^k를 공개할 것을 권고한다. NVIDIA는 하드웨어에도 같은 기준을 적용한다. NVLink 6는 약 1.5초 만에 링크를 복구하며, Shadow Engine Recovery는 추론 중단 시간을 283초에서 7.3초로 줄인다. 이제 문제는 단지 에이전트가 성공하는지가 아니라, 검증 가능한 한계 안에서 매번 성공하는지 여부다.
마지막 흐름은 속도에 관한 것이다. OpenAI는 이전 GPT-5.4와 마찬가지로 발표 한 달 뒤 애플리케이션에서 GPT-5.5를 제거할 예정이며, 예약 작업과 스크립트를 포함해 해당 식별자가 명시적으로 선택된 모든 곳에서 교체할 것을 요구한다. 도구 측면에서는 Claude Code가 22시간 동안 세 개 버전을 공개했고, Kimi Code는 이전 버전 출시 후 19시간도 지나지 않아 수정 버전을 냈으며, Gemini CLI는 9월 8일 프리뷰를 일주일 뒤 안정화 버전으로 전환했다. 한편 지금까지 모델을 선택기에 하나씩 추가해 온 v0는 모델에 구애받지 않는다고 선언하고 Vercel AI Gateway를 활용한다. 이 환경에서 모델은 교체 가능한 구성 요소가 된다.
출처
- Google, Gemini 3.8 Live 및 3.8 Live Extended Thinking
- Google, Live API 개발자 게시물
- Google DeepMind, Gemini 3.8 Audio 모델 카드
- Google DeepMind의 X 게시물, Gemini 3.8 Live 발표
- Claude Code, 버전 2.1.271 릴리스 노트
- Claude Code, 버전 2.1.273 릴리스 노트
- Claude, Claude에 Salesforce 도입하기
- Claude 도움말 센터, Salesforce in Claude 구성하기
- OpenAI, GPT-5.5 지원 종료에 관한 ChatGPT 및 Codex 변경 기록
- ChatGPT의 X 게시물, ChatGPT, ChatGPT Work 및 Codex에서 GPT-5.5 지원 종료
- Perplexity, HP와 함께 더 많은 Windows PC에 도입되는 Perplexity
- Cognition, AWS와의 협약
- Devin, Devin에 macOS 도입하기
- NVIDIA, Groq 3 LPX의 결정론적 실행
- NVIDIA, NVLink 6 복원력
- Google, Gemini Notebook의 새로운 학습 도구
- Google Antigravity, 변경 기록
- Hugging Face, IBM Research와 ALTK-Evolve를 활용한 에이전트 일관성
- PR Times, Aillis 보도자료
- Sakana AI의 X 게시물, Aillis 보도자료 공유
- Google, AI & Economy ATLAS
- Google, 모든 사람을 위한 모든 언어의 AI
- Google.org, AI for Government Innovation 수상자
- Google, 과학을 가속하고 삶을 개선하는 AI 구축
- Google, AI로 산불 감지하기
- Claude, AI 네이티브 매출 조직 구축
- Perplexity, 섀도 AI
- v0의 X 게시물, Vercel AI Gateway를 통한 모델 선택
- Warp, 소프트웨어 팩토리 모델 도입하기
- Kimi Code, 버전 0.43.1 릴리스 노트
- Gemini CLI, 버전 v0.60.0 릴리스 노트
- GitHub 변경 기록, Copilot의 사용자 지정 속성 제안
- Grok Imagine의 X 게시물, 이미지 속 텍스트 편집
- MiniMax의 X 게시물, SGLang-Diffusion 및 VDN-H3를 사용한 H3
- Google Research, Retrieve-for-Train
- NVIDIA, 밀집 모델 또는 MoE
- NVIDIA, Docker, Kubernetes 및 Slurm을 지원하는 FLARE
- Sakana AI, Marlin 업데이트
- Hugging Face, PEFT의 ShadowPEFT
- Hugging Face, RiverRider와 파일 위치 탐색
- Hugging Face, EcoHash와 추측 디코딩
- Hugging Face, DINO-X