검색

Claude Platform, 정식 출시로 전환, GitHub Copilot이 Slack에 등장, DeepSeek가 멀티모달 모델 출시

ai-powered-markdown-translator

gpt-5.4-mini로 fr에서 ko로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

에이전트 인프라 구성 요소들에게는 큰 하루였다. Anthropic은 Claude Platform에서 computer use, browser tool, Skills API, Files API를 베타에서 정식으로 전환했고, GitHub Copilot은 Slack과 Microsoft Teams에 자리를 잡았다. 모델 측면에서는 DeepSeek가 첫 멀티모달 모델을 공개했고, Pika Labs는 전례 없는 가성비를 내세운 음성 합성기를 출시했다. 그 사이에 대규모 에고센트릭 데이터셋, 음성 인식 벤치마크 편향에 대한 연구, 그리고 Google DeepMind, GitHub, Z.ai, Qwen, Harvey, 비디오/오디오 생성 도구 전반의 주목할 만한 업데이트들이 이어졌다.


Claude Platform: computer use, browser tool, Skills API 및 Files API 정식 출시

8월 20일 — Anthropic은 Claude Platform에서 에이전트를 구축하기 위한 네 가지 구성 요소인 computer use, browser tool, Skills API, Files API를 정식 출시한다고 발표했다. 표방하는 목표는 API가 없는 애플리케이션에서 작업을 자동화할 때 필요한 왕복 횟수를 줄이고, 버전이 관리되는 skills와 재사용 가능한 파일을 기반으로 Claude Managed Agents를 구축할 수 있게 하는 데 있다.

새로운 computer_toolset_20260801을 통해 Claude는 작업 하나마다 따로 왕복하는 대신, 클릭, 입력, 키 입력, 스크린샷을 한 턴에 연속으로 수행할 수 있다. Anthropic에 따르면 조기 접근 고객들은 작업당 왕복 횟수가 20~40% 감소하는 효과를 봤다. browser tool도 browser_toolset_20260801과 함께 진화했다. 이제는 레이아웃이 조금만 바뀌어도 취약한 픽셀 좌표를 겨냥하는 대신, Claude가 페이지 구조를 받아 요소 참조를 통해 동작할 수 있다.

API 측면에서 Skills API는 팀의 절차를 한 번 업로드해 버전 관리하고, 특정 version_id 또는 latest에 고정할 수 있게 해준다. Files API는 expires_in_seconds 매개변수와 5배 더 높은 속도 제한(분당 500 요청), 그리고 조직당 1TB 할당량을 제공한다. Anthropic은 또한 Managed Agents용 AG-UI 어댑터를 공개했는데, 이는 각 대화 스레드를 관리형 세션에 매핑하고 텍스트, 도구 호출, 추론을 인터페이스로 스트리밍한다.

구성 요소오늘의 새로운 내용
Computer usecomputer_toolset_20260801, 작업당 왕복 횟수 최대 -40%
Browser toolbrowser_toolset_20260801, 페이지 요소 참조 기반 타기팅
Skills API버전 관리, version_id 또는 latest에 고정
Files API분당 500 요청(x5), 조직당 1TB 할당량

🔗 Claude Platform 공지


GitHub Copilot이 Slack과 Microsoft Teams에 도입

8월 21일 — GitHub Copilot이 Slack과 Microsoft Teams에서 공개 프리뷰로 제공된다. 두 경우 모두 원리는 동일하다. 다이렉트 메시지, 채널, 스레드에서 @GitHub을 언급하면 코드와 GitHub 활동에 대한 질문에 답하고, 버그 보고서를 분류하고, 실패 원인을 조사하고, 안전한 클라우드 샌드박스에서 변경 사항을 구현한 뒤, 원본 대화로 연결되는 링크와 함께 pull request를 열 수 있는 클라우드 에이전트 세션이 열린다.

Slack에서는 통합이 같은 주말에 출시된 Slack의 새로운 agentic 서비스인 Slack Code에 기반한다. GitHub Copilot은 팀이 원본 대화를 어지럽히지 않고 diff를 검토하고 렌더링 미리보기를 확인할 수 있는 전용 코드 채널을 열 수 있다. Teams에서는 하나의 대화가 모두가 함께 따라가고 방향을 제시할 수 있는 집단 에이전트 세션으로 바뀌며, 팀이 다른 일을 하는 동안 작업은 클라우드 샌드박스에서 비동기적으로 계속 진행된다.

이 기능은 Copilot Business 또는 Enterprise 요금제를 사용하는 조직에만 제공된다. 관리자는 Copilot 클라우드 에이전트 정책을 활성화하고 Slack 또는 Teams용 앱을 설치해야 하며, 저장소 관리자는 에이전트가 생성한 pull request를 병합하기 전에 승인을 요구할 수 있다. 사용량은 AI 크레딧을 소모하며, 클라우드 샌드박스는 구성 가능한 예산과 함께 별도 과금된다.

🔗 Slack의 GitHub Copilot · 🔗 Teams의 GitHub Copilot


DeepSeek-V4-Flash-Vision-Exp : API에서 공개된 DeepSeek의 첫 멀티모달 모델

8월 21일 — DeepSeek가 실험적 멀티모달 모델인 DeepSeek-V4-Flash-Vision-Exp를 온라인에 공개했으며, 식별자는 deepseek-v4-flash-vision-exp이다. 순수 텍스트 능력—에이전트, 추론, 세계 지식—에서는 이 모델이 DeepSeek-V4-Flash와 동등하다. 새로움은 다른 곳에 있다. 멀티모달 에이전트 벤치마크에서 DeepSeek는 V4-Flash에 비해 뚜렷한 도약을 보였다고 밝히며, 성능이 Opus-4.8에 가까워졌다고 설명했다.

API 측 멀티모달 지원은 완전하다. 텍스트 + 이미지 혼합 입력(base64, 외부 URL, 또는 같은 날 출시된 새로운 무료 Files API를 통해 가능)과 기존 세 가지 형식(Chat Completions, Messages, Responses)을 모두 지원한다. 요금은 V4-Flash 요금표를 따르며, 이미지 토큰화는 이미지당 최대 384토큰으로 제한된다. Files API를 사용하면 이미지를 한 번만 업로드하고 file_id로 참조할 수 있어, 반복적인 에이전트 사용에서 대역폭을 절약할 수 있다. 8월 13일에 출시된 오픈 소스 에이전트 하니스인 DeepSeek Harness 0.1.1도 같은 날 업데이트되어 새 모델을 기본적으로 지원한다.

항목세부 사항
모델deepseek-v4-flash-vision-exp
텍스트 능력DeepSeek-V4-Flash와 동등
멀티모달 능력멀티모달 에이전트 벤치마크에서 Opus-4.8에 근접
이미지 요금이미지당 최대 384토큰, V4-Flash 가격
지원 APIChat Completions, Messages, Responses
하니스DeepSeek Harness 0.1.1(기본 지원)

DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.

🇰🇷 DeepSeek-V4-Flash-Vision-Exp가 이제 DeepSeek API 플랫폼에서 제공됩니다! 이 실험적 멀티모달 모델은 에이전트, 추론, 세계 지식을 포함한 텍스트 능력에서 DeepSeek-V4-Flash와 동등합니다. 멀티모달 에이전트 벤치마크에서 V4-Flash-Vision-Exp는 V4-Flash에 비해 큰 도약을 보여, 멀티모달 에이전트 성능을 Opus-4.8 수준에 더 가깝게 끌어올렸습니다.@deepseek_ai X에서


Pika Speech : 초당 1.2초 수준의 3B 음성 합성, ElevenLabs v3 대비 최대 9배 저렴

8월 21일 — Pika Labs가 Pika Audio 라인업을 확장해 Pika Speech를 출시했다. 이는 30억 파라미터 규모의 음성 합성 모델이다. 핵심 강점은 속도다. 실시간 계수(RTF) 0.02로, 로컬 장문 테스트에서 스튜디오 품질의 48kHz 음성 1분을 약 1.2초에 생성하며, 최대 5분 분량의 연속 음성 요청도 처리할 수 있다.

리듬 제어 측면에서 Pika Speech는 독특하다. 대부분의 TTS 시스템처럼 생성 후 오디오를 늘리거나 줄이는 방식이 아니라, 모델이 «발화 종료 잠재벡터»(EOS latent)라는 최종 목표 이미지에 배치된 앵커를 통해 리듬과 지속 시간을 직접 제어한다. 이 앵커를 더 앞당기면 속도가 압축되고, 더 뒤로 미루면 텍스트가 더 여유 있게 흘러간다. 아키텍처 측면에서는 flow matching과 분포 매칭을 통한 distillation, FlashAttention-3, 그리고 다섯 개의 문장 구간이 하나의 구간보다 5배가 아니라 약 2배 수준의 비용만 들게 하는 «token packing»을 결합했다.

비용 측면에서 Pika는 ElevenLabs v3 대비 최대 9배, Cartesia와 ElevenLabs Turbo 대비 4.5배, Fish Audio 대비 2배의 우위를 주장하지만, 그 비율 외의 정확한 방법론은 자세히 밝히지 않았다. 이 모델은 Pika API Club을 통해 이용할 수 있다.

Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.

🇰🇷 Pika Speech를 이야기해보자. 30억 파라미터의 음성 합성 모델로, 실시간 계수는 0.02다. […] Pika Speech는 스튜디오 품질의 48kHz 음성 1분을 약 1.2초에 생성하며, 최대 5분까지의 요청을 지원한다. 이 효율성 덕분에 ElevenLabs v3보다 최대 9배, Cartesia와 ElevenLabs Turbo보다 4.5배, Fish Audio보다 2배 더 비용 효율적이다.@pika_labs X에서

🔗 아키텍처 상세


EgoSuite-Open100K : 최대 규모의 공개 인간 에고센트릭 데이터셋

8월 21일 — Lightwheel AI는 Hugging Face와 협력해, 완전히 주석이 달린 인간 에고센트릭 데이터셋으로는 공개된 것 중 최대 규모라고 소개되는 EgoSuite-Open100K를 오픈 소스로 공개했다. 목표는 1인칭 인간 데이터 10만 시간이며, 그중 첫 1만 시간은 이미 제공되고 나머지는 단계적으로 공개된다.

이 데이터셋은 1만 5천 개 이상의 실제 장면—주방, 침실, 창고, 조립 라인 등—에 걸친 1만 5천 개 이상의 작업을 포함하며, 7개의 환경 범주와 128개의 장면 유형으로 정리되어 있다. 각 시퀀스에는 손 자세, 신체 자세, 하위 작업 수준의 의미 정보가 주석으로 달려 있고, 일부 코퍼스는 손목 카메라 커버리지도 제공한다. 라이선스 측면에서 특히 주목할 점은, 많은 연구용 데이터셋과 달리 EgoSuite-Open100K가 학술용뿐 아니라 상업적 학습용으로도 라이선스가 부여되어 있다는 것이다.

제작자들은 이 데이터셋을 로보틱스와 구현형 AI를 위한 더 큰 데이터 인프라의 첫 번째 공개 구성 요소로 제시한다. 핵심 아이디어는 물리 모델의 스케일링이 이제 대규모 공유 인간 데이터 접근성에 달려 있다는 것이다.

🔗 Lightwheel AI 공지 · 🔗 Hugging Face 공유


Claude Security가 Claude Mythos 5로 전환

8월 21일 — Anthropic이 취약점 스캐닝 도구인 Claude SecurityClaude Mythos 5에서 실행하도록 했으며, 모든 Claude Enterprise 고객을 대상으로 공개 베타로 제공한다. 핵심 메시지는 Anthropic의 가장 강력한 보안 모델을 별도 모델 접근 없이 자체 코드베이스에 적용할 수 있다는 점이다. 스캔은 기존 플랜에서 표준 토큰 사용량으로 과금된다.

실제로 이 도구는 GitHub 저장소를 대상으로 작동하고, Mythos 5는 파일 간 데이터 흐름을 추적하고 구성 요소 간 상호작용을 추론하면서 코드를 분석한다. 각 결과에는 CWE 분류, 신뢰도 수준, 심각도 평가, 그리고 제안된 수정안이 함께 제공되며, 이는 웹의 Claude Code에서 바로 열린다. Anthropic은 이와 함께 오픈 소스 보안용 3,500만 달러 규모의 크레딧을 제공하는 Defender Advantage Fund를 출범시키고, 향후 몇 주 안에 Cyber Verification Program을 확장할 계획이다.

🔗 Claude Security 공지


GPT-5.6 Sol 가격 정책: OpenAI가 API 가격을 인하, GitHub Copilot도 뒤따라

8월 21일 — OpenAI가 앞으로 3개월 동안 GPT-5.6 Sol의 API 및 크레딧 가격을 20% 이상 인하한다. 이 조치는 이미 API 측에서 적용되고 있으며, 하루 동안 Codex와 ChatGPT Work에도 배포된다. 작업 기반(token-based) 요금제를 사용하는 Codex 이용자의 경우, 구매한 크레딧이 더 오래 간다. 반면 Pro, Plus, Business 구독에 포함된 사용량은 변함이 없다. 따라서 이번 인하는 주로 API 개발자와 토큰 기준 과금 사용자에게 이익이 된다.

GitHub Copilot에서 GPT-5.6 Sol 50% 할인

이와 동시에 GitHub는 별도의 프로모션을 안내했다. 9월 3일까지 GitHub Copilot에서 GPT-5.6 Sol를 50% 할인하며, 앱, CLI, IDE에서 사용할 수 있다. 이는 Copilot 측의 일회성 할인으로, 위에서 설명한 OpenAI의 영구적인 가격 인하와는 혼동하면 안 된다. 서로 다른 두 회사가 같은 모델에 대해 서로 다른 메커니즘을 적용하는 것이다.

🔗 OpenAI 가격 인하 · 🔗 GitHub Copilot 프로모션


GLM-5.3 (Max), Code Arena: WebDev에서 상승

8월 20일 — LMArena에 따르면 Z.ai의 **GLM-5.3 (Max)**가 웹 개발 작업에서 모델을 평가하는 Code Arena: WebDev 순위의 파레토 경계(품질/비용 비율)를 움직였다. 1597점으로, 이 모델은 공개 가중치 모델이 공개된 뒤 기준으로는 2위, 전체 범주에서는 8위에 오를 것으로 보인다.

모델가격($/M tokens)Code Arena: WebDev 점수
GLM-5.3 (Max)$3,651597
Qwen3.8 (Max)$5,00
Gemini-3.7-flash-high$2,86더 낮은 점수
DeepSeek-v4-flash-high$1,10더 낮은 점수

백만 토큰당 $3,65인 GLM-5.3 (Max)는 가격대가 Qwen3.8 (Max)와 비슷하면서도, 이 순위에서는 Gemini-3.7-flash-high와 DeepSeek-v4-flash-high를 앞선다. 이는 이미 알려진 Terminal-Bench와 일반 Agent Arena 결과를 보완하는, 에이전트식 웹 개발 영역에서 Z.ai의 경쟁력을 보여주는 또 하나의 신호다.

🔗 LMArena 공지


Harvey, Kimi K3 기반 법률 모델 Tenet 출시

8월 20일 — Harvey가 법률용으로 후학습한 첫 모델 Tenet을 공개했다. 이 모델은 Fireworks AI와 함께 공공 법률 데이터, 합성 데이터, 그리고 장기 법률 업무를 흉내 낸 인간 전문가 데이터로 후학습된 Kimi K3(Moonshot AI) 기반이다.

Harvey는 이 후학습으로 Tenet의 완전 성공률이 LAB 벤치마크에서 82%, LAB Contracts에서 22% 향상되었다고 밝히며, 기본 Kimi K3 대비 성과라고 설명했다. LAB Contracts에서는 최첨단 성능을, 전체 LAB에서는 2위를 기록했다. Tenet의 운영 비용은 시장에서 가장 성능이 좋은 기초 모델의 4분의 1보다 낮다고 한다. 추가로 Harvey는 M&A 실사, 표 검토, 로펌 지식에 특화된 세 개의 하위 에이전트도 학습시켰다.

🔗 Harvey 공지


Georgia Tech, Olmo 3의 사회적 추론 기원 추적

8월 21일 — Georgia Tech 연구진은 Ai2의 Olmo 3 스택이 가중치, Dolma 3 사전학습 코퍼스(문서 12억 6천만 개), 인프라까지 완전히 공개되어 있다는 점을 활용해, 모델의 능력과 그 능력을 만들어낸 텍스트를 통계적으로 연결했다. 이는 폐쇄형 모델에서는 불가능한 실험이다.

이 방법은 Dolma 3에서 샘플링한 약 568만 개 문서에 적용한 영향 함수에 기반한다. 핵심 결과는 대화와 상호작용적 글쓰기가 풍부한 텍스트가 사실 지식보다 사회적 추론 성능에 더 큰 영향을 미친다는 점이다. 또한 가장 영향력이 큰 문학 문서를 제거하자 SocialIQA 벤치마크 성능이 유의미하게 하락해, 인과관계가 확인되었다.

🔗 Ai2 기사


오픈소스 ASR 모델에서 « benchmark optimization » 편향 발견

8월 21일 — Hume AI 연구진이 Hugging Face 블로그에 공개한 연구는 음성 인식에서의 방법론적 편향을 다룬다. 일부 모델이 공개 벤치마크의 기준 전사를 충실히 옮기기보다, 그 전사를 재현하도록 최적화된 것처럼 보인다는 것이다.

테스트한 11개의 오픈소스 ASR 모델 중 약 40%의 VoxPopuli 발췌본에서 참조 데이터에 오류가 있었고, 11개 중 6개 모델은 오디오를 올바르게 전사하는 대신 그 오류를 그대로 재현했다. LibriSpeech에서는 가려진 숫자를 복원하는 비율이 30~40%에 달해, 일부 모델이 음성을 듣기보다 텍스트를 « 메우고 » 있음을 시사했다. 결론은 비공개 평가 세트의 사용과 훈련 데이터와 테스트 데이터의 더 엄격한 분리를 권고한다.

🔗 Hugging Face 연구


SenseNova-U1.5-8B-MoT: VAE나 DiT가 없는 개방형 이미지 모델

8월 21일 — SenseNova는 성능이 Nano Banana 2와 비슷하다고 주장되는 이미지 생성 모델을 가중치 공개 형태로 발표했다. 기술적 핵심은 아키텍처에 있다. VAE도 없고, 별도의 텍스트 인코더도 없고, DiT도 없다. 이 모델은 텍스트와 이미지 토큰이 서로 다른 가중치를 사용하며 서로를 기대하는 « mixture of transformers »에 기반하고, 노이즈 제거는 압축된 잠재 공간이 아니라 픽셀 공간에서 직접 이루어진다.

이 접근은 텍스트-이미지 확산 모델의 표준 스택과는 대조적이며, 가중치 공개 덕분에 커뮤니티가 발표된 성능 비교를 독립적으로 검증할 수 있게 된다.

🔗 SenseNova 발표


Diffusers 0.40.0: Modular Diffusers, 실험 단계 종료

8월 21일 — Hugging Face가 Diffusers 0.40.0을 출시했다. 가장 구조적인 변화는 라이브러리의 모듈형 파이프라인 시스템인 Modular Diffusers가 실험 단계에서 벗어났다는 점이다. 이번 버전은 최근 공개된 여러 모델(LTX2.5, MiniMax H3, MiniMax Music 3, Wan Animate 2)의 통합을 추가하고, 일부 모델에 대한 텐서 병렬 처리 지원과 두 가지 새로운 양자화 백엔드(SDNQ, Nunchaku-Lite)도 포함한다.

🔗 Diffusers 0.40.0 발표


Google DeepMind, Fenris Creations와 게임 속 AI 탐색

8월 21일 — Google DeepMind는 스튜디오 Fenris Creations와 연구 파트너십을 발표했다. 이는 Atari를 정복하고 StarCraft II에서 Grandmaster 수준에 도달하기까지, 게임을 AI 실험의 장으로 활용해 온 15년의 작업 연장선에 있다. 3D 세계를 이해하도록 에이전트를 학습시킨 SIMA 이후, DeepMind는 지속적인 세계 속에서 실제 인간적 역학을 탐색하는 내비게이션을 연구하고자 한다.

이 파트너십은 네 가지 열린 과제를 겨냥한다. 지속 학습(이전 기술을 잊지 않으면서 새 기술을 습득하기), 현재의 컨텍스트 창을 훨씬 넘어서는 깊은 메모리 시스템, 장기 계획(주, 월, 년 단위), 그리고 다중 에이전트 역학(협력, 협상, 경제, emergent behavior)이다. 장기 목표는 두 가지다. 개발자와 함께 새로운 게임 경험을 만들고, 그 진전을 실제 세계의 문제와 과학적 발견에 재활용하는 것이다.

🔗 Google DeepMind 발표


Runway Ruby: SDR 비디오를 16비트 HDR로 변환

8월 21일 — Runway가 Ruby를 출시했다. 이 모델은 SDR(standard dynamic range) 비디오를 16비트 HDR로 변환하며, EXR 시퀀스 또는 ProRes/HEVC 10-12비트로 출력한다. 색 공간은 BT.2020이며 PQ 또는 HLG를 지원한다. 이는 전문 후반 작업과 HDR 방송에서 사용되는 표준이다.

Ruby는 사용자가 업로드한 비디오와 Runway가 생성한 출력물 모두에서 작동하며, 최대 30초로 제한된다. 이 기능은 현재 Max 및 Enterprise 요금제에서 즉시 이용할 수 있다.

🔗 Runway Ruby 발표


NVIDIA AVO, ARC-AGI-3 벤치마크에서 100% 주장

8월 21일 — NVIDIA가 AVO를 발표했다. AVO는 범용 코드 에이전트이며, 인터랙티브 추론 벤치마크인 ARC-AGI-3에서 **100%**를 기록했다. NVIDIA에 따르면 AVO는 벤치마크의 25개 공개 환경에 걸친 183개 레벨을 명시적 지시, 언급된 규칙, 사전 정의된 목표 없이 완료했다.

AVO는 검사, 계획, 구현, 평가의 연속 루프를 통해 동작하며, 메모리, 도구, 실행 피드백을 활용해 시간이 지남에 따라 학습한 내용을 바탕으로 쌓아 간다. 이는 새 컨텍스트 창마다 처음부터 다시 시작하는 대신, 긴 작업에서도 진행을 유지하도록 설계된 접근이다.

🔗 ARC-AGI-3 결과


HeyGen Look Packs: 얼굴은 유지한 채 옷차림과 배경 변경

8월 21일 — HeyGen이 Look Packs를 출시했다. 이 기능은 아바타 비디오의 옷차림과 배경을 바꾸면서도 사람의 얼굴은 충실히 유지한다. 대부분의 생성 모델이 외형을 바꿀 때 얼굴 특징도 함께 바꾼다는 점이 이 기능의 배경이다.

목표 용도는 부동산, 법률, 피트니스, 교육, 웰니스 등 다양한 전문 맥락에서 개인 브랜드의 일관성을 유지하는 것이다. 따라서 B2B 콘텐츠 제작자는 각 산업에 맞는 옷차림과 배경으로 비디오를 만들면서도, 비디오마다 동일한 인물로 인식되게 할 수 있다. 이번 발표는 최근 며칠간 이어진 HeyGen의 활발한 발표 흐름(8월 20일 Retouch, 8월 18~19일 Brand Kits 및 4K 업스케일)과 맞닿아 있다.

🔗 Look Packs 발표


Amp, 토큰 소비를 설명하는 Explain Usage 출시

8월 21일 — Amp가 Explain Usage를 추가했다. 이 기능은 내장 어시스턴트인 Puck에게 자신의 토큰, 크레딧, orb 크기 소비를 직접 분석해 달라고 요청할 수 있게 한다. 사용자는 « 오늘 어떤 threads가 가장 많은 토큰을 소비했나요? » 같은 질문을 자연어로 던지면, Puck가 개인 사용 데이터와 thread별 메트릭을 읽고 답한다.

진입점은 두 가지다. Puck에게 직접 질문하거나, 사용량 페이지의 전용 버튼을 클릭할 수 있다. 원시 데이터를 선호하는 사용자를 위해 Amp는 CLI(amp usage --details, amp threads usage <thread-id> --details)를 통해서도 이 정보를 제공한다.

🔗 Explain Usage


v0(Vercel), 100개 이상 서비스 연결을 위한 Vercel Connect 추가

8월 21일v0에서 만든 앱과 에이전트는 이제 Vercel Connect를 통해 Slack, GitHub, Salesforce를 비롯한 100개 이상의 타사 서비스에 직접 연결할 수 있다. 개발자가 인증 흐름을 직접 관리할 필요는 없다.

이 메커니즘은 짧은 수명의 토큰과 연결된 재사용 가능한 팀용 커넥터에 기반한다. 팀 측에서 한 번 커넥터를 설정하면, 새로 생성되는 앱이나 에이전트는 매번 전체 인증을 다시 요청하는 대신 이를 재사용할 수 있다. 이는 v0를 단순한 분리형 인터페이스가 아니라 기업의 소프트웨어 스택에 통합된 에이전트를 생성할 수 있는 플랫폼으로 자리매김시킨다.

🔗 Vercel Connect


Codex와 ChatGPT Work의 공유 thread

8월 20일 — Codex와 ChatGPT Work가 « 공유 thread »를 도입했다. 이는 단순한 최종 결과가 아니라, 한 세션의 전체 추론 과정—접근 방식, 결정, 맥락—을 보여주는 읽기 전용 링크다. 목적은 코드 리뷰, 깊은 기술 탐색, 팀원 간 프로젝트 인수인계 시 흩어진 스크린샷만으로 pull request의 맥락을 다시 구성하는 일을 피하는 데 있다.

이 기능은 ChatGPT Sites(다중 편집, URL 개인화) 관련 최근 발표의 연장선에 있으며, Codex/ChatGPT Work를 팀 작업 도구로서 더 강하게 포지셔닝한다.

🔗 공유 thread


GPT-Image-2 미리보기에서 투명 배경 지원

8월 20일GPT-Image-2 API가 이제 미리보기로 투명 배경 이미지를 생성할 수 있다. 실무적으로는 제품 비주얼, 그래픽 디자인 요소, 웹사이트 목업, 마케팅 캠페인처럼 재사용 가능한 에셋을 만들고, 이후 수동으로 배경을 따지 않고도 어떤 배경 위에든 다시 배치할 수 있다.

🔗 투명 배경


간단 뉴스

  • Zed — Antigravity를 Zed의 ACP Registry에서 한 번의 클릭으로 설치할 수 있다. 🔗 Tweet
  • trackio 0.36 — Hugging Face가 새로운 로그 가능 데이터 타입 지원을 추가하는 업데이트를 발표했으며, 그 외의 자세한 설명은 없다. 🔗 Tweet
  • Google DeepMind가 보는 AI « full-stack » — Paige Bailey가 Google의 end-to-end 접근을 인프라, 보안, 연구, 모델/도구, 제품의 다섯 층으로 나눈다. 🔗 Google 기사
  • GitHub — 차단된 사용자 관리가 개선되었다. 긴 목록에서 이름 검색, 정렬, 페이지네이션을 지원한다. 🔗 Changelog
  • GitHub — 저장소 사이드바에서 views, projects, milestones 고정 기능이 일반 제공 상태가 되었고, 여러 관련 개선(반응 아바타, 대시보드 밀도)도 함께 제공된다. 🔗 Changelog
  • Manus는 일일 한도 내에서 8월 28일(SGT)까지 Manus 1.6 Lite와 Manus 1.6의 무료 액세스를 연장한다. 🔗 Tweet
  • Manus는 기업 독립 전환을 앞두고, 알림을 받은 사용자들에게 8월 23일 7시 59분(SGT) 이전에 데이터를 저장하라고 상기시킨다. 🔗 Tweet
  • Genspark는 9월 30일까지 프로모션을 진행한다. Design + GenTeam은 -90%, GenMail은 무료, Slides Ultra Mode는 -50%다. 🔗 Tweet
  • NVIDIA는 에이전틱 스택의 보안 심층 분석에서, 에이전트의 하네스(무엇을 하려고 하는지)와 인프라(실제로 무엇을 할 수 있는지)의 구분을 자세히 설명한다. 🔗 Tweet
  • NVIDIA는 DGX Spark에서 열린 Seattle Spark Hack Series의 결과를 공개했다. 수상 프로젝트는 Nemotron과 NemoClaw를 활용한 재난 대응, 보건, 오프라인 생존을 다뤘다. 🔗 Tweet
  • NVIDIA Cosmos 3 — Cosmos Labs 영상이 파트너 Aigen과 Linker Vision에서 진행된 Cosmos 3의 post-training을 보여준다. 🔗 Tweet
  • Luma Labs는 GMI Cloud와 함께 9월 14일 개최하는 Summer Signal에서 창의적 에이전트에 대해 발표할 예정이다. 🔗 Tweet
  • Synthesia — CEO가 결과를 통한 AI 채택 측정에 관한 Forbes Tech 기사에 인용되었다. 🔗 Tweet
  • Qwen3.8-27B는 커뮤니티의 상승세를 이어가고 있다. SGLang cookbook에 새로운 NVFP4 + DFlash2 추론 레시피가 추가되었고, Unsloth가 경량 버전을 공개했으며, Cline 코드 에이전트 순위에서 4일 만에 1위를 차지했고, NVIDIA DGX Station은 BF16 서비스에서 집계 피크로 초당 2713개 이상의 토큰을 보고했다. 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
  • Qwen3.8-Max는 이제 UI 생성용 Kilo Code 도구에서 사용할 수 있다. 🔗 Tweet
  • Kimi Work는 재무 분석가를 위한 두 번째 튜토리얼을 공개했다. 투자자 대시보드, 재무 모델 업데이트, 배치 보고서 생성이 포함된다. 🔗 Tweet
  • GLM-5.3은 계속 성장 중이다. 공식 DeepSWE 랭킹에서 69점을 기록했고, WorkBuddy 플랫폼에서 제공되며, Z.ai는 8월 23일 18시(PT)까지 Build Week를 연장해 처음으로 가입한 50,000명의 ZCode 사용자에게 1억 토큰을 무료로 제공한다. 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
  • GPT-5.6 Sol — Router, Cloudflare AI Gateway, OpenCode Zen의 세 타사 플랫폼이 각각 9월 중순까지 -50%를 제공하며, 이미 Devin, OpenRouter, v0에서 적용 중인 할인에 더해진다. 🔗 Cloudflare AI Gateway

이것이 의미하는 바

오늘의 Anthropic-GitHub 발표는 하나의 큰 흐름을 보여준다. 에이전틱 인프라가 실험 단계를 벗어나고 있다. Claude Platform의 computer use와 browser tool이 GA에 들어간 데 더해 Copilot이 Slack과 Teams에 들어오면서, 대형 공급업체들은 더 이상 모델만 파는 것이 아니라 팀이 이미 매일 사용하는 도구 안에서 행동할 수 있는 에이전트를 판다는 점을 시사한다. 매번 전용 API 통합을 거칠 필요도 없다. 이는 능력의 변화이기도 하지만 배포 방식의 변화이기도 하다. 이제 에이전트는 작업이 이루어지는 곳으로 간다. 작업이 에이전트에게 오기를 요구하지 않는다.

모델 측면에서는 DeepSeek-V4-Flash-Vision-Exp가 멀티모달이 이제 차별점이 아니라 기대되는 표준이 되었음을 확인시켜 준다. 경제성에 초점을 둔 플레이어(V4-Flash)들조차 이를 기본적으로 통합하고 있으며, 성능은 최고 수준의 폐쇄형 모델에 가까워지고 있다. 코드 에이전트 벤치마크(GLM-5.3의 Code Arena: WebDev, Qwen3.8-27B의 Cline)에서의 경쟁은 개발 도구 쪽에서도 같은 역동성을 보여준다. 개방형 모델과 폐쇄형 모델 간 가격 격차가 좁혀지면서, OpenAI는 그 여파로 GPT-5.6 Sol의 API 가격을 20% 이상 낮추고 있다.

가중치만이 아니라 데이터와 학습 인프라까지 포함한 완전한 개방으로의 움직임은 계속해서 과학적 결실을 맺고 있다. Georgia Tech의 Olmo 3 연구는 폐쇄형 모델에서는 애초에 불가능했을 것이고, Hume AI의 ASR 벤치마크 편향 연구는 리더보드 점수가 실제 전사 품질을 보장하지 않는다는 점을 상기시킨다. 산업계가 기록적인 점수를 쏟아내는 지금, 이 두 가지는 유용한 경고다.

마지막으로, 상업적 라이선스가 붙은 대규모 데이터셋의 확대는—오늘의 EgoSuite-Open100K를 비롯해 최근 몇 주의 여러 유사 발표 이후—실제 인간 데이터에 대한 접근이 합성 데이터만큼이나 로봇공학과 embodied AI의 전략적 쟁점이 되고 있음을 보여준다. 이는 대규모 언어 모델에서 계산 자원이 중요했던 것과 같은 수준의 문제다.


출처