ai-powered-markdown-translatorgpt-5.4-mini로 fr에서 ko로 번역된 기사.
이번 주 Meta는 Muse Glimmer를 공개했다. 이는 300억 개 매개변수의 오픈 웨이트 멀티모달 에이전트형 모델로, Hugging Face는 물론 NVIDIA의 GPU 가속 엔드포인트를 통해서도 즉시 사용할 수 있다. OpenAI는 사이버보안 프로그램 Daybreak를 재구성하고 GPT-5.6-Cyber를 출시했는데, 이 모델은 이미 Chrome의 JavaScript 엔진에서 전례 없는 취약점을 찾아내는 데 기여했다. 또 다른 주목할 만한 소식은 공개되지 않은 Claude의 연구용 버전이 리만 가설과 관련된 수학 문제를 진전시켰고, 형식 증명까지 검증되었다는 점이다. 그 밖에도 Anthropic의 가격 정책, 개발자 도구, 기업용 음성 AI, AI 네이티브 금융 소식이 이어진다.
Meta, NVIDIA를 통해 제공되는 오픈 웨이트 30B 에이전트형 모델 Muse Glimmer 공개
Meta는 Muse Glimmer를 공개했다. 이는 300억 개 매개변수의 밀집형 멀티모달 모델로, 20억 개의 비전 인코더와 280억 개의 텍스트 디코더로 구성되어 있으며, 일반 소비자용 하드웨어—Mac 또는 성능 좋은 GPU가 탑재된 PC—에서 로컬로 지속 실행되도록 최적화되어 있다. 가중치는 Apache 2.0 라이선스로 배포된다. 이 모델은 12만 토큰이 넘는 컨텍스트 윈도우를 처리하며, NVIDIA에 따르면 단일 GPU에서 초당 최대 2만 토큰을 처리할 수 있다. Alexandr Wang(Meta Superintelligence Labs)은 이 모델이 에이전트 신뢰성 저하 없이 24GB VRAM에서 실행된다고 설명했다.
기술적으로 Muse Glimmer는 슬라이딩 윈도우 어텐션과 풀 어텐션을 결합하고, 메모리 캐시를 16배 줄이는 Gated Grouped-Query Attention 아키텍처를 사용하며, 2~4배 더 빠른 생성을 가능하게 하는 경량 DFlash 초안 모델을 포함한다. 지원은 transformers, llama.cpp, vLLM에서 첫날부터 제공되며, 양자화된 GGUF 가중치와 Hugging Face Inference Endpoints를 통한 배포도 가능하다.
| 기술적 특성 | 측정값 |
|---|---|
| 매개변수 | 30B(인코더 2B + 디코더 28B) |
| 라이선스 | Apache 2.0 |
| 컨텍스트 윈도우 | 120,000+ 토큰 |
| 최소 VRAM | 24 GB |
| 처리량(1 GPU) | 최대 20,000 토큰/s |
| MCP Atlas(에이전트형) | 75.5(경쟁사 54.2–62.5 대비) |
NVIDIA는 Muse Glimmer를 즉시 시험해 볼 수 있도록 GPU 가속 액세스 포인트를 열었으며, 에지, 데스크톱, 워크스테이션 플랫폼에 최적화된 환경을 제공한다. 이는 가중치 다운로드에 더해지는 실질적인 접근 경로다.
Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows. […] we’re releasing model weights under a permissive Apache 2.0 license.
🇰🇷 로컬하고 지속적인 에이전트 워크플로에 최적화된 300억 개 매개변수의 오픈 웨이트 모델 Muse Glimmer를 소개합니다. […] 우리는 이 모델의 가중치를 허용적 Apache 2.0 라이선스로 공개합니다. — @AIatMeta X에서
🔗 NVIDIA가 Muse Glimmer용 GPU 가속 엔드포인트를 제공하다
OpenAI, Daybreak를 확장하고 GPT-5.6-Cyber를 출시, Chrome에서 전례 없는 CVE 발견
OpenAI는 자사의 사이버보안 프로그램 Daybreak를 두 단계의 접근 권한으로 재구성하고, GPT-5.6 Sol을 기반으로 한 특화 모델 GPT-5.6-Cyber를 출시했다. 표방하는 목표는 공격자 측의 공격 능력이 널리 퍼지기 전에 신뢰할 수 있는 방어자에게 최첨단 지능을 제공하는 것이다.
| 접근 수준 | 사용 모델 | 대상 |
|---|---|---|
| Daybreak Blue | GPT-5.6 Sol(시스템 가드레일 해제) | 대부분의 방어자를 위한 권장 진입점 |
| Daybreak Red | GPT-5.6-Cyber(신규) | 숙련된 보안 연구자, 승인된 고급 작업 |
GPT-5.6-Cyber는 고위험 이중 용도 요청(예: 운영 중인 시스템에 대한 펜테스트)에서 거부율을 낮추며, ExploitGym 2에서 GPT-5.6 Sol과 이전 GPT-5.5 Cyber를 능가한다. 실제 조건에서 이 모델은 Chrome의 JavaScript 엔진인 V8에서 메모리를 손상시키고 샌드박스에서 탈출할 수 있게 하는 전례 없는 두 가지 취약점을 찾아냈고, Google에 조정된 공개를 거친 뒤 해당 취약점은 수정되어 CVE-2026-15903으로 등록되었다. 또한 인기 있는 모바일 운영체제에서 최소 5개의 취약점, 인기 있는 데이터베이스에서 3개의 치명적 취약점, 그리고 인기 있는 운영체제 커널에서 400개가 넘는 권한 상승 취약점을 식별했다. 이들 수정 작업은 Daybreak 파트너들과 함께 진행 중이다.
OpenAI는 2026년 9월 1일부터 모든 개인 Daybreak 계정에 하드웨어 보안 키를 의무화하며, Daybreak Cyber Partner 프로그램은 이미 Accenture, IBM, KPMG 같은 서비스 제공업체와 Palo Alto Networks, CrowdStrike, Cisco 같은 보안 벤더를 연결해 이 모델들을 자사 서비스에 통합하고 있다.
We’re expanding our cybersecurity initiative Daybreak and introducing GPT-5.6-Cyber, a new model for advanced, authorized cybersecurity work.
🇰🇷 우리는 사이버보안 이니셔티브 Daybreak를 확장하고, 고급 승인된 사이버보안 작업을 위한 새로운 모델 GPT-5.6-Cyber를 출시합니다. — @OpenAI X에서
🔗 방어 창이 좁아지는 가운데 Daybreak를 확장하다
Claude, 리만 가설을 해결하지는 못했지만 그 위에서 진전을 보이다
Anthropic은 공개되지 않은 Claude의 연구용 버전에게 클레이 수학연구소의 밀레니엄 문제 7개 중 하나인 리만 가설에 도전하게 했다(각각 상금 100만 달러). Claude는 문제를 해결하지는 못했지만, 관련 질문 하나에서는 진전을 보였다. 리만 제타 함수의 영점 중 가설을 만족하는 비율의 하한을 41.6%에서 67.2%로 끌어올린 것이다.
이 작업은 총 3,100만 개의 출력 토큰에 걸친 두 번의 세션으로 진행되었다. 첫 번째 세션에서는 650개의 초기 아이디어가 생성되었지만 모두 실패했다. 두 번째 시도에서는 Claude가 수학적 전개, 아이디어 제안, 검증, 작성 업무를 수행하는 60개의 전문 하위 에이전트를 조정하고, 2,400개의 셸 명령을 실행했으며, 자신의 접근법을 검증하기 위해 arXiv에서 54편의 논문을 내려받았다. 결과는 Anthropic의 수학자 2명에게 먼저 검토된 뒤, 외부 전문가 Brian Conrey와 Dan Goldston의 검토도 거쳤다. Claude는 Lean에서 형식적으로 검증된 증명을 만들어 표준 검증을 통과했다.
이 결과는 전형적인 벤치마크의 범위를 벗어난다. 수십 년간 풀리지 않은 문제에서 측정 가능한 개선이 있었고, 독립 검증과 형식 증명이 뒤따랐다는 점은, Anthropic이 이제 소프트웨어 엔지니어링의 전통적 과제보다 기초 수학 문제에서 자사 연구 모델을 시험하고 있음을 보여준다.
We asked an unreleased research version of Claude to take a stab at the Riemann hypothesis. It didn’t solve it, but it did make strides on a related problem: it increased the lower bound for the fraction of zeros of the Riemann zeta function that satisfy the hypothesis from 41.6% to 67.2%.
🇰🇷 우리는 공개되지 않은 Claude의 연구용 버전에게 리만 가설에 도전해 보도록 했습니다. 해결하지는 못했지만 관련 문제에서 진전을 이뤘습니다. 리만 제타 함수의 영점 중 가설을 만족하는 비율의 하한을 41.6%에서 67.2%로 끌어올린 것입니다. — @AnthropicAI X에서
🔗 Anthropic 연구 블로그의 상세한 방법론 설명
Anthropic: 가격 정책과 보안
Sonnet 5의 출시 가격이 영구화되다
Anthropic은 Claude Sonnet 5의 출시 가격—입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러—가 영구적으로 유지된다고 확인했다. 이 모델은 6월에 이 가격이 프로모션으로 제시된 채 출시되었고, 2026년 8월 31일까지 유효할 예정이었다. Anthropic은 이로써 이 출시 가격을 기준으로 비용을 산정해 온 팀들이 안고 있던 불확실성을 해소했다. 이 모델에서 새 학기 시즌을 앞두고 가격 인상은 없으며, 대량 토큰 사용 사례에서 경쟁사 대비 가격 경쟁력을 공고히 한다.
🔗 공지
Anthropic에 따르면 프롬프트 인젝션은 «대체로 해결»되었다
Anthropic의 Claude Code 제품 책임자인 Boris Cherny는 프롬프트 인젝션—사용자와 AI 에이전트를 상대로 한 가장 흔한 공격 기법으로, 악성 웹사이트나 문서가 모델이 실행하는 숨은 지시문을 끼워 넣는 방식—이 이제 Claude 모델에서 실무적으로는 대체로 해결되었다고 말한다. 그는 이 진전이 주로 모델 학습에서 비롯되었고, 여러 겹의 보안 분류기를 추가로 결합한 결과라고 설명한다. 모델 + 탐지기(probe) + 자동 모드의 조합은 공격 성공률을 0%로 낮추며, 이 구성이 8월 14일부로 Claude Code의 기본 권한 모드가 된다고 한다. 이는 세부 방법론이 포함된 정식 연구 논문이 아니라 X에서의 공개 발언이다.
🔗 트윗
개발자 도구: Amp는 OpenAI로 전환하고, Copilot Chat은 개선되다
ChatGPT 구독이 연결되면 Amp가 모드 시스템을 OpenAI로 변경하다
에이전트형 코드 도구 Amp가 ChatGPT 구독이 계정에 연결된 경우 자사의 모드 라우팅 로직(«the Dial»)을 변경한다. 구독이 연결되어 있으면 low, medium, high 모드는 GLM-5.2나 Claude Fable 대신 OpenAI 모델로 전환된다(로우 모드와 코드 리뷰에는 GPT-5.6 Terra, 에이전트와 하이 모드 오라클에는 GPT-5.6 Sol 사용). 연결된 구독이 없으면 아무것도 바뀌지 않는다. Amp는 오라클 모델로 Claude Fable을 포기한 이유로 경계 모델 간 성능의 수렴을 들며, 공동창업자 @sqs는 향후 테스트가 Fable과 사용 중인 OpenAI 모델 간의 80배 가격 차이를 정당화할 가능성이 낮다고 본다. Ultra 모드는 영향을 받지 않으며 계속 Claude Fable에서 실행된다.
github.com의 Copilot Chat: 대화 제어 기능 개선
GitHub는 github.com의 Copilot Chat을 모든 요금제에 대해 일반 제공 상태로 업데이트하며 세 가지 개선을 적용한다. 최근 대화에 대한 접근이 쉬워지고, 응답 생성 중에도 대화 창을 축소했다가 다시 열어 대화를 이어갈 수 있으며, 토큰 사용량 표시가 세션별·메시지별 상세 정보와 함께 채팅에 직접 나타난다. 이 조정은 주요 기능 추가라기보다는 사용성 개선에 가깝지만, 제한된 Copilot 할당량을 받는 계정이 일상적으로 사용하는 데 실질적으로 유용하다.
🔗 웹에서의 Copilot이 대화 제어 기능을 확장하다
오픈 소스 생태계와 추론
NVIDIA, 12개 언어용 오픈 TTS인 Magpie TTS Multilingual 공개
NVIDIA는 약 3억 5,700만 개 매개변수의 오픈 웨이트 음성 합성 모델 Magpie TTS Multilingual을 NVIDIA Open Model License로 공개했다. 이 모델은 프랑스어를 포함한 12개 언어를 지원하며, 각 언어마다 남성·여성 음성을 제공한다. 첫 소리까지의 지연 시간은 B200 GPU에서 단일 스트림 기준 32ms(64개 동시 스트림에서는 239ms), H100에서는 47ms, A100에서는 79ms이며, 실시간 계수는 최대 320배다. 문자 오류율도 프랑스어는 2.70%에서 1.54%로, 스페인어는 1.14%에서 0.60%로 낮아졌다. Hugging Face의 오픈 웨이트 또는 프로덕션에서 NVIDIA NIM을 통해 배포할 수 있다.
지식 증류 기법으로 필요한 GPU 메모리를 최대 15배까지 줄이다
Multiverse Computing은 교사의 로그잇을 오프라인으로 캐시하고, 전체 어휘 × 시퀀스 길이 행렬을 물리적으로 만들지 않는 결합 KL 손실 함수를 사용하는 지식 증류 기법을 공개했다. 결과적으로 32K 컨텍스트 토큰에서 GPU 메모리가 85.2GB에서 5.45GB로 줄어 최대 15.6배 감소했고, GPT-OSS 20B 모델의 증류는 GPU 노드 4개에서 1개로 줄어들었으며, 반복 시간도 약 5배 단축되었다. GPT-OSS 120B와 Kimi-K3(2.8T 매개변수)에 적용했을 때, 이 기법은 BoolQ와 HellaSwag에서 교사 모델 정확도의 약 90%를 유지했다. 코드는 GitHub에 오픈 소스로 공개되어 있다.
🔗 대규모로 실행할 수 있을 만큼 지식 증류를 저렴하게 만들기
DeepSeek-V4-Flash, Together AI를 통한 Ollama 클라우드에서 사용 가능
Together AI는 이제 Ollama 클라우드에서 DeepSeek-V4-Flash 뒤의 추론 인프라를 제공하며, 이 모델의 오픈 웨이트 버전에 대해 현재 사용 가능한 최고 성능 호스팅으로 소개된다. 이 제공 방식은 데이터 보존 0 정책과 미국 및 유럽연합 내 호스팅을 내세워, 중국 인프라에 의존하지 않고 DeepSeek-V4-Flash를 사용하려는 기업에 주권 측면의 이점을 강조한다. 이는 이미 Together AI에서 직접 제공되던 DeepSeek-V4-Flash 가용성에 더해지는 새로운 배포 채널이다.
🔗 트윗
Sakana AI, Gemma 4 기반으로 오케스트레이터 Fugu를 학습시키다
Sakana AI는 자사의 멀티 에이전트 오케스트레이션 제품 Fugu의 오케스트레이터 모델 새 버전을 공개했다. 이번 버전은 이미 제공 중인 교체 가능한 모델 풀에 더해 오픈 모델 Gemma 4를 기반으로 학습되었다. 작업을 분배하는 작은 오케스트레이터 모델과 실제 처리를 수행하는 모델 풀이라는 2계층 아키텍처는 ICLR 2026에서 소개된 Trinity와 Conductor 연구를 바탕으로 한다. 내부 평가는 이전 버전과 동등한 오케스트레이션 성능을 보이면서도 비용이 감소했음을 보여준다. Sakana AI는 일본의 디지털 주권 요구에 대응하기 위해 장기적으로 자체 오케스트레이터 모델도 목표로 하고 있다.
Together AI, 실시간 추론을 위한 Cursor와의 파트너십을 상세히 설명하다
Together AI는 Cursor와 공동 집필한 글을 통해 추론 인프라 파트너십을 설명한다. 편집기에 통합된 에이전트는 개발자가 파일을 적극적으로 편집하는 동안 코드를 생성하며, 이는 엄격한 지연 시간 제약을 요구한다. 즉, 모델 응답이 편집기의 피드백 루프 안에 들어오되 작업 흐름을 끊어서는 안 된다. 이 글은 Together AI가 이러한 목표를 대규모로 충족하기 위해 어떻게 인프라를 구축했는지 보여주며, AI 보조 개발 도구를 위한 전용 추론 서비스의 구체적인 사용 사례를 제시한다.
🔗 트윗
생성형 미디어: Deutsche Telekom의 ElevenLabs, MiniMax가 H3를 설명하다
ElevenLabs, Deutsche Telekom에 자사의 AI 음성 기술을 배포하다
ElevenLabs는 유럽 최대 통신사인 Deutsche Telekom과의 파트너십을 발표하고, 자사의 AI 음성 기술을 세 가지 수준—컨택센터, 소비자용 애플리케이션, 그리고 네트워크 자체—에 통합한다. AI 통화 도우미는 ElevenLabs에서 구동되며 네트워크에 직접 통합되어 있어 전용 앱 없이 통화가 가능한 모든 모바일 기기에서 사용할 수 있다. 통화 중 실시간 지원, 실시간 번역, 통화 전사/요약도 제공된다. 이 파트너십은 2025년 초 앱 기능 묶음으로 시작되었고, 이후 Deutsche Telekom 서비스의 핵심으로 통합되었으며, 향후 확장도 예정되어 있다.
🔗 트윗
MiniMax는 H3의 오픈소스 로드맵을 자세히 설명한다
Reddit AMA 세션 이후, MiniMax는 자사의 영상 모델 H3에 대한 오픈소스 로드맵 요약을 공개했다. 저작권 문제가 정리되면 Apache-2.0 라이선스로의 전환이 « 검토 중 »이며, 이에 더해 완전한 기술 보고서도 곧 나올 예정이다. MiniMax는 또한 768p 결과를 2K로 다시 올릴 수 있는 잠재 공간 재생성 모델인 H3-Regenerate-2K의 가중치 공개, sparse attention 구현, 저지연 4-NFE/8-NFE 변형의 연구, 그리고 H3 계열에서 파생된 통합 이미지 생성/편집 모델도 계획하고 있다. Ref2VA 워크플로는 이미 클립을 이어 붙여 60초짜리 비디오를 만드는 데 사용할 수 있다.
🔗 트윗
멀티모달 에이전트와 AI 네이티브 금융
Qwen-MM-Plugins: 멀티모달 네이티브 에이전트를 만들기
AlibabaQwen은 Qwen-MM-Plugins를 발표했다. 이는 어떤 에이전트 실행 환경(_agent harness)이든 멀티모달 네이티브로 만들기 위한 플러그인 패밀리로, 이미지·비디오·문서 읽기, 비디오 편집, 3D/CAD 파일 작업을 지원한다. 핵심 아이디어는, 독립된 멀티모달 모델을 쓰는 대신 개발자가 이미 사용 중인 환경에 플러그인 계층을 덧붙이는 것이다. 이번 발표는 벤치마크, 가격, 정확한 제공 일정은 밝히지 않았으며, 데모 비디오를 곁들인 제품 티저 단계에 머문다. 이번 출시는 새로운 원시 모델 가중치가 아니라 멀티모달 에이전트 도구 쪽으로 오퍼링을 확장하는 2026년 Qwen 전략을 이어간다.
🔗 트윗
AI 네이티브 금융 기능을 구축하기 위한 다섯 가지 교훈
OpenAI의 CFO 사라 프라이어는 AI 네이티브 금융 기능을 구축하기 위한 다섯 가지 교훈을 공유했다. 목표는 두 가지다. 하나는 제로데이 클로즈(회사 재무를 실시간으로 보고, 조정되고, 추적 가능한 상태로 닫는 것), 다른 하나는 지속적 예측이다. 교훈은 다음과 같다. 모두에게 접근 권한을 주고, 그것을 쓰고 싶어지는 이유를 만들어라. 이는 투자자 실사 질문에 답하는 맞춤형 GPT인 IR-GPT를 낳은 금융 해커톤으로 예시된다. 상향식 실험과 하향식 전략을 결합하라. 정적인 스프레드시트를 넘어, 활동의 완전한 맥락 위에 구축된 살아 있는 도구를 활용하라. 모든 워크플로에 명확한 책임 구조를 세워라. 그리고 AI의 투자수익률을 측정하라.
ChatGPT Business에 Premium 좌석이 도입된다
OpenAI가 ChatGPT Business에 Premium 좌석을 출시한다. 가장 활발한 사용자에게는 Standard 좌석보다 5배 많은 사용량이 제공되며, 5시간 사용 제한도 없다.
| 좌석 유형 | 월 요금 | 연 요금(월 환산) |
|---|---|---|
| Standard | $25/사용자 | $20/사용자 |
| Premium | $125/사용자 | $100/사용자 |
기업은 하나의 작업 공간 안에서 Standard 좌석과 Premium 좌석을 섞어 사용할 수 있다. 출시 프로모션으로, 2026년 8월 20일 이전에 가입한 작업 공간 소유자는 추가된 Premium 좌석마다 $100의 크레딧을 받는다(5개 좌석까지 총 $500). 정식 일반 출시 전에 조기 접근도 가능하다.
🔗 ChatGPT Business용 Premium 좌석
짧은 소식
- Claude Code — CPU 및 메모리 성능 향상: 팀은 최근 몇 달 사이 CPU 사용량과 메모리, 특히 99퍼센타일(P99 RSS)에서 큰 개선이 있었다고 밝혔지만, 구체적인 수치는 공개하지 않았다. 🔗 트윗
- Replit CEO, Platformer에서 “self-driving company”를 설명: Amjad Masad는 내부 봇과 사람 대신 앱을 사용하는 에이전트가 이끄는 회사라는 자신의 비전을 자세히 설명했다. 🔗 트윗
- Sakana AI, RSI Lab을 물리 AI로 확장: 이 회사는 물리 AI를 위한 월드 모델을 만들고자 하며, 도쿄에서 정규직과 인턴을 채용하고 있다. 🔗 트윗
- FC 바이에른 뮌헨, Google Pixel과 Gemini와 파트너십 체결: 정확한 성격은 공개되지 않은 파트너십이 발표됐다(스폰서십, 제품 통합 등). 🔗 트윗
- Gemini, 미국 농업 박람회 방문 팁 제공: Google Blog의 라이프스타일 기사로, Gemini의 기존 활용법 다섯 가지(경로, Ask Maps, AI Mode, Gemini Live, 사진 편집)를 소개하며 새로운 기능은 언급하지 않는다. 🔗 Google Blog
- 인도에서 GitHub 청구 방식 변경: 이제 고객은 Reserve Bank of India 규정을 준수하는 전자 위임을 통해 등록된 카드로 자동 반복 결제를 활성화할 수 있다. 🔗 Changelog
- GitHub, 스레드별 맞춤 구독을 폐기: 이제 Subscribed/Not subscribed 상태만 남고, 기존의 맞춤 구독은 자동으로 Subscribed로 전환된다. 🔗 Changelog
- NVIDIA, GB200에서 Qwen 3.5용 vLLM 최적화: 최적화 결과 GPU당 초당 25,000 토큰에 도달했으며, Qwen 3.8 출시를 앞두고 있다. 🔗 트윗
- Codex Build Week — 프로젝트와 수상작 공개 예정: OpenAI는 참가자들이 Codex로 아이디어를 실제 프로젝트로 바꿨다고 밝혔으며, 수상작 발표는 추후 진행된다. 🔗 트윗
- OpenAI의 텍사스 주지사에게 보낸 서한: 회사는 텍사스에서 책임 있는 AI 인프라 개발에 대한 약속을 자세히 설명했다. 🔗 OpenAI
- Model ML, GPT-5.6 Sol로 금융 작업 가속: 이 컨설팅사는 추적 가능한 PowerPoint 덱과 Excel 스프레드시트 묶음의 생산을 자동화했으며, Excel 워크플로에서 Opus 5보다 토큰 사용량을 36% 줄였다. 🔗 OpenAI
의미하는 바
오픈 가중치 경쟁은 더 빠르고 더 다양해지고 있다. Meta(Muse Glimmer), Alibaba(Qwen-MM-Plugins), MiniMax(H3 로드맵), Sakana AI(Fugu on Gemma 4)가 같은 주에 모두 닫힌 모델이 아니라 재사용 가능한 구성요소를 내놓고 있다. 흐름은 텍스트를 넘어서고 있다. NVIDIA는 3억 5,700만 파라미터 규모의 다국어 TTS를 공개했고, Sakana AI는 디지털 주권을 이유로 명시적으로 이 선택을 정당화했다. 이 논리는 Together AI가 EU와 미국에서 DeepSeek-V4-Flash를 호스팅하는 이유로도 다시 등장한다.
AI 안전은 연구실을 넘어 실제 프로덕션으로 옮겨가고 있다. OpenAI의 GPT-5.6-Cyber는 벤치마크 점수에만 머물지 않고 V8의 실제 CVE 하나와 다른 곳의 수백 개 취약점을 수정하게 만들었다. 동시에 9월부터는 하드웨어 키 의무화라는 강화된 접근 체계를 동반한다. 반대로 Anthropic은 모델 + 분류기 스택을 통해 방어 측면에서 프롬프트 인젝션을 무력화했다고 주장한다. 한쪽은 도구화된 공격, 다른 한쪽은 강화된 방어라는 두 접근은 안전이 더 이상 부차적 이슈가 아니라 제품 차별화의 독립적 축이 되고 있음을 보여준다.
인프라 측면에서는 추론 경제성이 계속 팽팽해지고 있다. Multiverse Computing의 지식 증류 기법은 필요한 GPU 메모리를 15분의 1로 줄이고, Together AI는 Cursor와의 파트너십을 강화해 코드 편집에서 엄격한 지연 시간 제약을 맞추려 한다. Anthropic은 Sonnet 5의 가격을 장기적으로 안정화했다. 이 움직임들을 함께 보면, 에이전트형·상호작용형 사용 사례가 일반화될수록 추론 비용에 지속적인 압력이 가해지고 있음을 알 수 있다.
마지막으로, AI는 기초 연구만큼이나 기업의 지원 기능에도 자리 잡고 있다. OpenAI는 자사 재무가 어떻게 AI 네이티브가 되는지 문서화하고, 강화된 ChatGPT Business 좌석을 출시했다. 동시에 Model ML은 Excel 워크플로에서 실제 토큰 절감 효과를 보고했다. 스펙트럼의 반대편에서는, 공식적으로 검증되고 외부 수학자들이 검토한 Claude의 리만 가설 결과가 이 모델들이 제품 활용 사례를 넘어 기초 연구 문제에도 쓰이고 있음을 상기시킨다.
출처
- Meta, Muse Glimmer 출시
- NVIDIA — GPU 가속 Muse Glimmer 엔드포인트
- OpenAI — 사이버 방어 창이 좁아지는 가운데 Daybreak 확장
- OpenAI — X에서 Daybreak/GPT-5.6-Cyber 발표
- Anthropic — X에서 Riemann 발표
- Anthropic — Riemann 연구 글
- Anthropic — Sonnet 5 영구 가격
- Anthropic — 프롬프트 인젝션 대폭 해결
- Amp — We changed the Dial
- GitHub — 웹에서 Copilot 대화 제어 확장
- NVIDIA — Magpie TTS Multilingual
- Multiverse Computing — 지식 증류
- Together AI — Ollama에서 DeepSeek-V4-Flash
- Sakana AI — Fugu × Gemma 4
- Together AI — Cursor 파트너십
- ElevenLabs — Deutsche Telekom 파트너십
- MiniMax — H3 로드맵
- Alibaba_Qwen — Qwen-MM-Plugins
- OpenAI — AI 네이티브 금융 기능 구축하기
- OpenAI — ChatGPT Business용 Premium 좌석
- Claude Code — CPU/메모리 성능 향상
- Replit — self-driving company
- Sakana AI — 물리 AI RSI Lab
- FC 바이에른 뮌헨 × Google Pixel × Gemini
- Google Blog — Gemini와 농업 박람회
- GitHub — 인도에서의 청구
- GitHub — 스레드별 구독 폐기
- vLLM/NVIDIA — Qwen 3.5 최적화
- OpenAIDevs — Codex Build Week
- OpenAI — 텍사스 주지사에게 보낸 서한
- OpenAI — Model ML