검색

GitHub, 8월 17일 장애를 되짚다, Meta AI는 WildArtifactBench를 출시, Pika는 오디오 모델을 공개

ai-powered-markdown-translator

fr에서 ko로 번역된 기사, gpt-5.4-mini로.

GitHub에서 프로젝트 보기 ↗

2026년 8월 20일, GitHub의 CTO는 8월 17일 장애(7시간 47분, 이달의 두 번째 주요 사고)에 대한 자세한 보고서를 공개하고 Azure로의 마이그레이션을 가속화한다. Meta AI는 멀티모달 에이전트를 위한 새로운 평가 프레임워크인 WildArtifactBench를 소개하고, Muse Spark 1.2의 확장된 데모도 함께 선보인다. Pika Labs는 Suno, ElevenLabs, Stable Audio와의 비교 벤치마크 수치를 포함해 오디오 모델 전체 라인업(Music, SFX, Soundtrack)을 자세히 공개한다. 이 세 가지 발표를 중심으로 Anthropic은 Claude Academy와 관리형 에이전트를 강화하고, Mistral은 새로운 문서 검색 계층을 출시하며, 그 밖에도 개발, 개방형 모델, 미디어 생성 전반을 아우르는 15여 개의 추가 소식이 이어진다.


GitHub, 8월 17일 7시간 47분 장애를 상세히 설명하고 신뢰성 계획을 가속화하다

8월 20일 — GitHub의 CTO인 Vladimir Fedorov는 2026년 8월 17일에 발생한 장애에 대한 보고서를 공개했다. 이 장애는 7시간 47분 동안 지속되었으며 github.com, 인증, GitHub Actions, API, pull request, issue, Copilot에 영향을 미쳤다. 이는 8월 6일의 Actions 장애에 이어 이달의 두 번째 중대한 사고다. 두 사건 모두 코드나 설정 변경으로 인해 발생한 것이 아니라, 용량 한계로 인한 장애였다.

이번 사고는 전례 없는 트래픽 급증이 GitHub의 Central US 데이터센터에 있는 핵심 인프라 구성요소의 용량을 초과하면서 시작되었다. 그 압박은 시스템 전반으로 퍼져 인증 실패를 일으켰다. 대부분의 서비스는 당일 안에 복구되었지만, 일부 Copilot 서비스는 더 오래 걸렸다. 해당 서비스에서 발생한 오류가 클라이언트 측 재시도 루프를 촉발해 복구 중 트래픽을 증폭시켰기 때문이다.

Fedorov는 이번 사고를 플랫폼 성장과 연결한다. 4월 이후 월간 commit 수는 14억 개에서 29억 개로 늘었다. 3월과 4월 이후 GitHub는 300만 개 이상의 CPU 코어와 120페타바이트의 스토리지를 추가했으며, Azure로의 마이그레이션도 가속화했다. 현재 Azure는 전체 부하의 58%를 처리해 5월의 12%와 비교해 크게 늘었다. 즉각적인 대응으로 GitHub는 서비스 간 재시도 제한을 일관되게 적용하고 있다.

On August 17, GitHub experienced a significant outage that disrupted developers and organizations around the world. If you were trying to ship software that day, we let you down.

🇰🇷 8월 17일, GitHub에서 중대한 장애가 발생해 전 세계의 개발자와 조직에 영향을 미쳤습니다. 그날 소프트웨어를 배포하려던 분들께, 우리는 실망을 안겨드렸습니다.@Vlad_GitHub X에서

🔗 8월 17일 장애와 앞으로의 과제 (github.blog)


Meta AI, WildArtifactBench를 공개하고 Muse Spark 1.2 데모를 확장하다

8월 20일 — Meta AI는 10개의 트윗으로 구성된 스레드에서 Muse Spark 1.2의 멀티모달 기능에 대한 확장된 데모와, 멀티모달 에이전트를 위한 새로운 내부 평가 프레임워크인 WildArtifactBench의 출시를 함께 소개한다. 이 모델은 멀티모달 관찰을 분석하고 도구를 호출해, 플라스틱 오리를 찾는 이중 팔 로봇을 안내한 뒤 책상을 정리하는 장면으로 보여 주며, 립스틱을 잘 정리하기 위해 헤어브러시와 메이크업 브러시를 구분하는 예시도 포함된다.

두 가지 구체적인 역량이 강조된다. 하나는 이미지에서 웹페이지와 게임 같은 디지털 산출물을 생성하는 능력으로, 코드 비교가 아니라 실제 렌더링 결과를 기준으로 평가된다. 다른 하나는 Muse Image와 Muse Video와 병행하여 메타 내부에서 Muse Spark를 미디어 생성에 활용하는 사례다.

이 스레드는 WildArtifactBench로 마무리된다. 정답 기반의 엄격한 채점표 대신, 이 프레임워크는 인간과 에이전트 기반 선호 심사자의 승률과 Elo 점수를 사용해 실용적인 멀티모달 워크플로를 포괄한다. Meta는 오늘 기준으로 벤치마크의 10개 과제와 설계 원칙 문서를 공개한다.

Today we’re also previewing WildArtifactBench, an internal evaluation framework designed to assess agents on complex, real-world tasks across diverse deliverable formats. By using win rates and Elo scores from human and agentic preference judges rather than strict ground-truth rubrics, it expands task coverage across practical multimodal workflows.

🇰🇷 오늘 저희는 다양한 형태의 결과물을 통해 복잡한 실제 과제에서 에이전트를 평가하도록 설계된 내부 평가 프레임워크인 WildArtifactBench도 소개합니다. 정답 기반의 엄격한 채점표 대신 인간 및 에이전트 기반 선호 심사자의 승률과 Elo 점수를 사용함으로써, 이 프레임워크는 과제 범위를 실용적인 멀티모달 워크플로로 확장합니다.@AIatMeta X에서

🔗 전체 스레드 @AIatMeta


Pika, Suno, ElevenLabs, Stable Audio와 비교한 Pika Audio Models 라인업을 상세히 공개하다

8월 18일-20일 — 8월 14일에 «Pika Audio Models» 라인업을 발표한 뒤, Pika Labs는 이번 주에 수치를 포함한 세 가지 제품을 자세히 공개했다.

Pika Music(8월 20일)은 텍스트, 가사, 음성 참조, 음악 참조의 네 가지 입력 모달리티를 받아 하나의 latent diffusion 디코더에서 결합할 수 있다. Audiobox Aesthetics에서 시장 선도 수준에 가까운 점수를 기록했으며, 90초짜리 노래를 평균 6.25초 만에 생성해 재생 시간 기준으로 약 14.5배 빠르다. Pika SFX(8월 19일)는 1초 미만에 음향 효과를 생성하며, 경쟁사 대비 최대 95% 저렴하다. Pika Soundtrack(8월 18일)은 latent token으로 압축된 비디오를 바탕으로 음악, 내레이션, 음향 효과를 이미지에 맞춰 동기화하며, 67개 시퀀스 패널에서 시청각 정렬 1위를 차지했다.

오디오 모델핵심 지표Pika경쟁사
Pika MusicAudiobox Aesthetics (production)8,064Suno : 8,151
Pika Music속도 (90초 노래)6,25 s~14,5x 재생 시간
Pika SFX평균 지연 시간 (50 prompts)0,847 sElevenLabs v2 : 2,47 s
Pika SFX평균 지연 시간 (50 prompts)0,847 sStable Audio 3 SFX : 2,64 s
Pika Soundtrack의미 정렬 (ImageBind)0,245767개 시퀀스 패널 최고

세 모델 모두 Pika API Club을 통해 이용할 수 있다.

On our fixed-lyrics benchmark, Pika Music reached the top tier of Audiobox Aesthetics: Content Enjoyment: 7.403, Production Quality: 8.064. For context, Suno scored 7.412 and 8.151 on those respective measures.

🇰🇷 고정 가사 벤치마크에서 Pika Music은 Audiobox Aesthetics에서 가장 높은 수준을 달성했습니다. 콘텐츠 선호도는 7.403, 제작 품질은 8.064입니다. 비교를 위해 Suno는 동일한 지표에서 각각 7.412와 8.151을 기록했습니다.@pika_labs X에서

🔗 Pika Music (8월 20일) · Pika Soundtrack (8월 18일) · Pika SFX (8월 19일)


Anthropic, Claude Academy, 관리형 에이전트, Claude Code를 강화하다

Claude Academy가 출시되다

8월 20일 — Anthropic은 Claude Academy를 출시한다. 이 플랫폼은 AI를 처음 접하는 사람부터 일상적으로 이미 Claude를 사용하는 사람까지, 모든 수준을 위한 무료 공개 강의와 튜토리얼을 제공한다. 이 նախաձեռն은 단순한 제품 문서가 아니라 단계적으로 배울 수 있는 학습 경로를 지향하며, 초보자와 고급 사용자 모두에게 동일한 접근성을 제공한다. 관련 게시물은 Anthropic의 AI 학습 철학과 이 접근 방식에서 Claude Academy가 차지하는 위치를 자세히 설명하며, 회사가 제품 출시와 더불어 Claude를 중심으로 교육 이니셔티브를 계속 확장하고 있는 맥락을 보여 준다.

🔗 @claudeai 공지

Claude Managed Agents에 대한 세 가지 업데이트

8월 19일 — Anthropic은 Claude Managed Agents(Claude Developer Platform)에 세 가지 변화를 발표한다. 이제 메모리를 Self-Hosted Sandboxes와 함께 사용할 수 있어, 자체 호스팅 샌드박스에서 수행한 작업을 이후 세션에 저장할 수 있다. 또한 web_searchweb_fetch 도구는 이제 allowed_domains 또는 blocked_domains 매개변수를 지원해, 에이전트가 방문할 수 있는 사이트를 정확히 제한할 수 있다. 마지막으로 Console의 세션 뷰어는 멀티 에이전트 세션에 맞게 재설계되어, 에이전트별 한 줄 미니맵, 반복 단위로 묶인 스트리밍 전사, 스레드와 세션당 달러 비용을 표시하는 인스펙터를 제공한다.

🔗 @ClaudeDevs 공지

Claude Code — 새로운 Concise 출력 스타일

8월 20일 — Claude Code는 새로운 «Concise» 출력 스타일을 제공한다. 이 스타일을 활성화하면 Claude는 응답의 앞부분에 결과를 우선 배치하고 기본적으로 짧게 답하되, 사용자가 명시적으로 요청하면 전체 세부 내용을 제공한다. 활성화는 /config → Output style에서 하거나, "outputStyle": "Concise"settings.json에 직접 설정해 할 수 있다. 이는 터미널에서 더 빠르게 읽을 수 있는 응답을 원하는 사용자에게 일상적으로 유용한 설정으로, 명시적인 요청이 있을 때 특정 지점을 더 깊게 파고들 수 있는 가능성은 그대로 유지한다.

🔗 @ClaudeDevs 공지


Cognition의 Devin, 코드 전용 Slack 채널을 추가하다

8월 20일 — Cognition은 Slack과의 공식 출시 파트너십의 일환으로 «Slack Code in Devin»을 선보인다. 이제 에이전트는 각 코드 작업마다 전용 Slack 채널을 선제적으로 생성해, 기존 팀 채널의 대화에 섞이지 않고 작업에 집중할 수 있도록 한다. Cognition은 Slack에서의 행동에 맞춰 Devin의 «성격»을 특별히 다시 다듬었다고 밝히며, 이는 터미널이나 IDE가 아니라 팀 채팅 맥락에 맞는 어조 조정이라고 설명한다. 이번 발표는 Devin을 이미 제품팀과 비기술 팀이 협업하는 도구 안에 자리매김하게 하며, 기존 통합(GitHub, Linear)을 보완한다.

🔗 @cognition 공지


개방형 모델: Liquid AI, Sakana AI, 그리고 로보틱스를 위한 대규모 데이터셋

Liquid AI의 LFM2.5-DSpark, 최대 3.2배 추론 가속

8월 20일 — Liquid AI는 LFM2.5-DSpark를 공개했다. 이는 약 3억 파라미터의 «draft» 모델로, specualtive decoding을 통해 LFM2.5 계열의 세 모델 추론을 품질 손실 없이 가속한다. 출력 시퀀스는 설계상 기준 greedy decoding과 동일하게 유지된다. H100 GPU에서 측정한 평균 가속은 LFM2.5-2.6B에서 2.67배(323 → 864 tok/s), LFM2.5-1.2B에서 2.10배, LFM2.5-8B-A1B에서 2.54배다. 여러 도구를 사용하는 시나리오에서는 함수 호출 지연 시간이 평균 57% 감소한다. 체크포인트는 safetensors와 GGUF로 제공되며, llama.cpp에 day-one 지원이 있고 SGLang에 직접 통합된다.

🔗 Hugging Face의 LFM2.5-DSpark

Sakana Translate, 차세대 Sakana Namazu로 전환하다

8월 20일 — Sakana AI의 무료 일본어-영어-중국어 번역 서비스가 차세대 Namazu로 전환되며, 새로워진 기반 모델과 개선된 학습 방법을 결합한다. 내부 도구 TransEvalnia로 평가한 160개의 일본어-영어 번역 과제에서 Sakana Translate는 비교 대상 각 경쟁 시스템보다 50%가 넘는 경우에 더 우수하다고 평가되었다. 기존의 세 가지 기능(최대 약 5,000자까지의 스트리밍 번역, 스타일 차이(diff)를 포함한 교정, 번역 관련 Q&A)은 계속 무료이며 이제 새 모델에서 동작한다.

🔗 Sakana Translate 공지

HiPHI, 로보틱스를 위한 대규모 개방형 인간 동작 데이터셋

8월 19일 — Noitom Robotics는 연구용으로 HiPHI를 무료 공개한다. 이 데이터셋은 물체 상호작용이 포함된 고정밀 인간 동작 캡처 617.5시간으로, 회사에 따르면 지금까지 공개된 동종 데이터셋 중 가장 큰 규모 중 하나다. 이 데이터셋으로 학습된 정책은 이미 #PhysicalAI라는 이름 아래 실제 Unitree G1 로봇에서 동작하고 있다. 이런 개방형 자원은 물리 AI와 로보틱스를 위한 데이터셋 구축이라는 더 큰 흐름에 속하며, 이 발표는 Hugging Face 생태계에서도 공유되었다.

🔗 @noitomrobotics 공지


미디어 생성: HeyGen, Black Forest Labs, Ideogram, NVIDIA

HeyGen, 아바타 리터치(Retouch)를 출시하다

8월 20일 — HeyGen은 아바타 리터치 도구를 비디오 편집기에 직접 통합했다. 이 기능은 잡티나 주름 같은 결점을 수정하고 메이크업과 조명을 조정할 수 있으며, 원본 아바타의 정체성을 유지하도록 리터치 수준을 제어할 수 있다. 목표는 외모 문제만을 이유로 다시 촬영하는 일을 줄이는 것이다. 한 번 리터치한 뒤에는 이후의 모든 비디오에 그 결과물을 재사용하는 방식이다. HeyGen은 리터치 후에도 아바타가 알아볼 수 있어야 한다는 점을 강조한다. 즉, 다른 얼굴을 생성하는 것이 아니라 기존의 이미지를 다듬는 것이다.

🔗 @HeyGen 공지

Black Forest Labs, FLUX Video Upscale(2K/4K)을 출시하다

8월 20일 — Black Forest Labs는 FLUX 3 Video에 네이티브 업스케일링 모듈을 추가해, 더 선명한 얼굴, 더 깔끔한 텍스처, 더 많은 배경 디테일을 유지하면서 2K/4K 영상으로 생성 또는 변환할 수 있게 했다. 이는 FLUX로 생성된 영상뿐 아니라 외부 영상에도 적용되며, 서드파티 업스케일링 솔루션보다 빠르다고 한다. API와 전용 데모를 통해 이용할 수 있다.

🔗 @bfl_ai 공지

Ideogram, Runware에서 양자화된 공개 모델과 이미지 배경 제거기를 공개하다

8월 20일 — Runware는 두 개의 새로운 Ideogram 모델을 호스팅한다. Ideogram 4.0q는 Ideogram 4.0의 가중치가 공개된 양자화 버전(93억 파라미터)으로, 바운딩 박스를 통한 레이아웃 제어, 구조화된 JSON 프롬프팅, LoRA 지원을 제공한다. 또 다른 모델인 Ideogram Background Remover는 어떤 이미지든 투명 PNG 배경 제거 결과를 제공하며, 특히 타이포그래피와 로고에서 경계 보존이 우수하다.

🔗 @runware 공지

NVIDIA, cuOpt로 가장 빠른 오픈 소스 솔버를 주장하다

8월 19일 — NVIDIA는 자사의 오픈 소스 최적화 솔버 cuOpt가 인정받는 업계 기준인 Hans Mittelmann 벤치마크에서 가장 빠르다고 주장한다. 이는 조합 최적화와 선형 최적화의 세 가지 문제 범주에 해당한다. 회사는 커뮤니티가 GitHub에서 직접 프로젝트를 시험해 보라고 권장하며, 하드웨어를 중심으로 소프트웨어 도구를 개방해 온 전략의 연장선에 있다고 설명한다. cuOpt는 특히 대규모 물류 및 계획 문제처럼 해법 속도가 직접적으로 운영 비용에 영향을 미치는 사용 사례를 겨냥한다.

🔗 @NVIDIAAI 공지


Mistral, Kimi, GLM-5.3: 문서 검색과 비용/성능 경쟁력

Mistral, 반복적 문서 검색 레이어인 Agentic Search를 출시

8월 20일 — Mistral은 기존 RAG의 한계를 넘어서는 문서 검색 레이어인 Agentic Search를 발표했다. 이는 반복(iteration) 없이 한 번만 검색하는 방식에 의존하는 기존 RAG의 한계를 겨냥한 것이다. 이 시스템은 파일 작업에서 영감을 받은 다섯 가지 도구(search, open, navigate, read, grep)를 모델에 제공하며, 기존 인덱스와 함께 작동하고, fine-tuning이 필요 없으며, 모델에 구애받지 않는다 — Mistral Medium 3.5와 Z.ai의 GLM-5.2로 테스트되었다. FinanceBench(SEC 제출 문서 368건)에서 Mistral Medium 3.5의 정확도는 26.7%에서 86%로 상승했고, p90 지연 시간은 255초에서 154초로 감소했다. OfficeQA Pro에서는 GLM-5.2가 정확도 45.6포인트를 얻었다. Mistral Search Toolkit을 통해 제공되며, Studio와 Vibe에 통합되어 있다.

🔗 mistral.ai의 Agentic Search

Agent Arena의 비용/성능 파레토 프런티어에서 Kimi K3가 선두

8월 19일 — Agent Arena(LMArena)는 실제 장기 과제에 대한 에이전트 평가를 위해 비용/성능 파레토 프런티어를 공개했다. Moonshot의 Kimi K3(Max)는 성능 향상 +10.53%로 4위를 차지했으며, 과제당 중앙값 비용은 0.62 USD로 상위 8개 모델 중 가장 낮았다. 이는 과제당 3.37 USD에 불과하게 더 높은 점수(+12.0%)를 기록한 Claude Opus 5(Max)보다 한참 낮다. Grok 4.5는 과제당 0.22 USD에 +6.1%를 기록했고, Qwen-3.8 Max는 과제당 0.33 USD에 +6.3%를 기록했다.

🔗 @arena 순위

Z.ai의 GLM-5.3이 AutoClaw에 기본 통합

8월 20일 — Z.ai의 작업 에이전트인 AutoClaw가 8월 18일 출시된 GLM-5.3을 기본 통합했다. 자신의 구독을 연결한 GLM Coding Plan 사용자는 1.5배의 임시 할당량 부스트와 월간 AutoClaw 크레딧(Lite 5K / Pro 10K / Max 26K)을 받는다. 신규 사용자는 26K AutoClaw 크레딧(20 USD 상당)을 받으며, 이는 30일간 유효하다. GLM-5.3은 또한 공식 DeepSWE 순위에서 69점을 획득했으며, 이는 같은 날 외부 개발자가 보고했다.

🔗 @AutoClawAIer의 발표


OpenAI, 유럽에서 ChatGPT desktop, ChatGPT Sites, Codex SDK를 확장

ChatGPT desktop(Mac), 유럽에서 Computer History, 멀티 앱 메모리, Record & Replay 확장

8월 20일 — OpenAI는 유럽(EEA, 영국, 스위스)에서 Mac용 ChatGPT desktop 앱의 세 가지 기능을 확장한다. 이 기능들은 그동안 미국에만 제한되어 있었다: Pro, Business, Enterprise 사용자를 위한 Computer History(이미 8월 13일 출시), ChatGPT가 사용자의 앱과 웹사이트 전반의 활동을 기억할 수 있게 해주는 멀티 앱 메모리, 그리고 작업 흐름을 설명하는 대신 보여줌으로써 재사용 가능한 능력으로 바꾸는 Record & Replay로, ChatGPT Work와 Codex용이다.

🔗 @OpenAI의 발표

ChatGPT Sites: URL 맞춤 설정과 Codex를 통한 팀 협업

8월 20일 — ChatGPT에 통합된 웹사이트 제작 도구인 ChatGPT Sites는 이제 게시된 사이트의 URL을 맞춤 설정할 수 있어, 프로젝트를 더 잘 반영하고 더 쉽게 알아보고 공유할 수 있다. OpenAI는 또한 동료를 편집자로 초대해 한 프로젝트에서 여러 사람이 함께 만들고 게시할 수 있는 기능도 추가했다. 이 협업 모드에서 Codex는 Git 관리와 지속적 통합을 백그라운드에서 처리하므로, 기술적 배경이 없는 팀도 버전 관리나 배포를 직접 다루지 않고 사이트에서 협업할 수 있다.

🔗 @OpenAIDevs의 발표

ChatGPT Work와 Codex를 위한 새로운 Exa 플러그인

8월 20일 — OpenAI는 Exa AI Labs와 함께 개발한 플러그인을 출시해 ChatGPT Work와 Codex가 1,000억 개 이상의 웹페이지, 연구 논문, 문서에 접근할 수 있게 했다. 이 플러그인은 OpenAI의 에이전트 생태계를 위한 타사 플러그인 통합 전략이 8월 초 Agent Plugins 출시와 함께 시작된 흐름을 이어가며, Codex와 ChatGPT Work 에이전트의 정보 검색 능력을 기존 소스 범위 너머로 확장한다.

🔗 @OpenAIDevs의 발표

Codex SDK: Cisco App Builder와 Thrive Holdings/Crete 고객 사례

8월 20일 — OpenAI는 Codex SDK의 두 가지 배포 사례를 강조한다. Cisco는 이를 App Builder에 사용해 고객이 자연어로 Cisco Cloud Control용 맞춤 애플리케이션을 만들 수 있게 한다. 또한 Thrive Holdings는 Crete와 함께 7,000건의 신고서를 처리한 세금 준비 시스템을 구축해 준비 시간을 약 3분의 1로 줄였다. OpenAI는 또한 오픈 소스 Codex 하네스의 더 넓은 활용도 강조하는데, 이는 기존 내부 도구에 팀들이 통합해 사용하고 있으며, 이 경우 자체 애플리케이션이 인터페이스, 컨텍스트, 승인 절차를 처리하고 하네스는 에이전트 루프를 담당한다.

🔗 @OpenAIDevs의 발표


짧은 소식

  • Claude Managed Agents용 AG-UI 어댑터 — CopilotKit와 함께 새 cookbook이 공개되었으며, 각 대화 스레드를 텍스트, 도구, 추론 스트리밍을 포함한 관리형 세션에 매핑한다. 🔗 출처
  • 자연어로 Auto Mode 구성하기 — Claude Code의 Auto Mode 규칙은 자연어로 작성할 수 있으며, $defaults를 추가하면 내장 규칙이 유지된다. 🔗 출처
  • Claude Desktop이 약 2배 더 빠르게 시작 — 백그라운드 시작 시 throttling 수정으로, 창이 숨겨져 있어도 부팅이 최대 속도로 진행된다. 🔗 출처
  • v0(Vercel) — GPT-5.6 Sol 및 Fast mode 50% 할인 — 2026년 9월 18일까지 진행되는 가격 프로모션. 🔗 출처
  • Gemini에서 무료 SAT 모의고사 제공 — 새 학기 안내: The Princeton Review가 검증한 콘텐츠, 즉시 채점과 정답 해설 제공. 🔗 출처
  • Visual Studio 2026이 포함된 Windows 11 arm64 이미지가 일반 제공 상태로 전환 — 표준 및 larger GitHub-hosted runner에서 제공. 🔗 출처
  • Code scanning에 ‘Mitigated’ 거부 사유 추가 — 외부 통제 수단이 위험을 완화할 때 경고를 닫을 수 있도록. 🔗 출처
  • GitHub Code Quality 전용 GitHub Actions 경로 — 이제 기록과 사용 보고가 다른 실행과 분리됨. 🔗 출처
  • 감사 로그에서 GitHub Code Quality 활성화 추적 — 활성화, 비활성화, 설정 변경을 추적하는 세 가지 새 이벤트 추가. 🔗 출처
  • CodeQL 2.26.3이 GitHub Actions 쿼리 개선 — JavaScript, TypeScript, Vue 소스 모델링. 🔗 출처
  • Luma가 에이전시 고객 사례(Aperture) 상세 공개 — 인텔리전스, 인간 검증, 피드백 루프로 구성된 3단계 시스템을 통해 고객획득비용 75% 감소 및 광고 예산 9배 확대. 🔗 출처
  • NVIDIA, Firefox에 GeForce NOW 개방 — Ultimate 구독자는 최대 1440p/120fps, Gallipoli를 포함한 12개의 신규 게임 제공. 🔗 출처
  • Suno, 오프라인 플레이리스트 추가 — 전날 발표한 플레이리스트 개편에 더해 제공. 🔗 출처
  • Qwen3.8-27B가 Harvey의 에이전트 법률 벤치마크 선두 — Legal Agent Benchmark의 1위 오픈웨이트 모델. 🔗 출처
  • AI Futures: 변혁적 AI 거버넌스에 관한 OpenAI 새 블로그 — 변혁적 AI와 관련된 권력 집중 위험을 탐구. 🔗 출처
  • Stampli, ChatGPT Work와 Codex로 제품 출시 가속화 — Deep Finance 제품을 6주 만에 출시, 제작 시간은 추정 243시간에서 77시간으로 감소. 🔗 출처

이것이 의미하는 것

AI 인프라는 알고리즘 한계가 아니라 용량 한계에 도달하고 있다. 8월 17일 GitHub 장애는 버그가 아니다. 4개월 만에 트래픽이 두 배(월간 커밋 14억 개에서 29억 개로) 늘어난 플랫폼이 Azure 마이그레이션과 수백만 개의 CPU 코어 추가로 용량 부채를 따라잡는 과정이다. 규모와 신뢰성 사이의 긴장은 모델 측면에서도 동일하게 나타난다. Meta AI의 WildArtifactBench는 엄격한 정답 기반 채점 표를 버리고 Elo 점수로 전환했는데, 이는 실제 멀티모달 에이전트 평가가 이제는 기존의 진실값 기반 벤치마크로는 측정하기 어려운 수준에 이르렀다는 점을 인정한 셈이다.

경쟁의 중심은 이제 단순한 절대 성능보다 비용/성능 비율로 옮겨가고 있다. Agent Arena의 파레토 프런티어에서 Kimi K3(Max)는 과제당 비용이 5분의 1 수준인데도 Claude Opus 5(Max)와 거의 같은 점수를 얻었다. Mistral 역시 문서 검색에서 같은 논리를 적용한다. Agentic Search는 단일 패스 RAG를 반복 가능한 시스템으로 바꿔, 금융 문서처럼 밀도가 높은 자료에서 fine-tuning 없이 정확도를 세 배로 끌어올린다. 그리고 Liquid AI는 로컬 추론 쪽으로 초점을 맞추며, 3억 파라미터 규모의 draft 모델이 speculative decoding으로 훨씬 더 큰 모델보다 속도를 두 배로 높인다.

에이전트 플랫폼은 단순한 채팅 인터페이스에 머무르지 않고 기업 업무 흐름 전반으로 영향력을 넓히고 있다. OpenAI는 Exa, Record & Replay, Cisco와 Thrive Holdings의 Codex SDK 같은 통합 요소를 계속 쌓아가고 있고, Anthropic은 관리형 에이전트에 대한 허용/차단 도메인 같은 거버넌스 통제를 추가하며, Cognition은 Devin을 Slack에 직접 고정하고 있다. 이는 기술팀이 아닌 팀이 에이전트에게 업무를 맡길 때 기본 계층이 되겠다는, 같은 무대 위의 서로 다른 세 가지 베팅이다.

마지막으로 미디어 생성은 빠른 속도로 일상화되고 있다. Pika는 사운드 이펙트에서 Suno와 거의 동등한 벤치마크를 공개하면서 ElevenLabs보다 최대 95% 저렴하다고 밝히고, Ideogram은 오픈웨이트 이미지 모델을 타사 인프라(Runware) 위에 올리며, Sakana AI는 160개의 정밀 과제에서 번역 성능을 경쟁사와 비교한다. 차별화는 더 이상 모델을 단순히 제공할 수 있느냐가 아니라, 공개되고 검증 가능하며 점점 더 세분화된 벤치마크 수치로 판가름난다.


출처