ai-powered-markdown-translatorgpt-5.4-mini로 fr에서 ko로 번역된 기사.
이번 주는 Demis Hassabis가 최전선 AI의 거버넌스에 대해 입장을 밝히고, NVIDIA가 Blackwell의 효율성 향상을 수치로 제시한 두 개의 발표와 에이전트가 주도하는 새로운 연구 방식, 그리고 Amazon Bedrock에서의 GPT-5.6 일반 제공이 주목을 받았습니다. 그 밖의 소식으로는 OCR, 비전-언어, 삼진수 양자화를 포함한 여러 오픈 모델 물결, GitHub와 Manus 측의 여러 도구 관련 새 기능, 그리고 Perplexity가 WANDR 벤치마크를 오픈 소스로 공개한 소식이 있습니다.
Demis Hassabis, 최전선 AI를 위한 프레임워크와 Standards Body를 제안
7월 14일 — X에 게시한 긴 글에서 Google DeepMind의 공동창립자이자 CEO인 Demis Hassabis는 범용 인공지능(AGI)으로 향하는 경로에 대해 입장을 밝혔습니다. 그는 인간 두뇌의 모든 인지 능력을 갖춘 시스템은 불과 몇 년밖에 남지 않았을 수 있다고 보며, 이 변화의 규모를 전기나 불의 발견에 비유하고, 산업혁명보다 10배 큰 영향에 10배 빠른 속도가 더해질 수 있다고 말합니다.
그러나 그는 경고합니다. 현재의 상업적·지정학적 경쟁은 너무 치열해 사이버 보안, 나아가 핵 및 생물학적 위험을 제대로 이해할 시간도, 점점 더 자율화되고 자기 개선까지 가능한 시스템을 통제할 시간을 주지 않는다는 것입니다.
그의 핵심 제안은 최전선 모델 평가를 전담하는 Standards Body를 만드는 것입니다. 이는 미국 연방 정부가 감독하는 공공-민간 파트너십을 모델로 하며, 금융 분야의 FINRA와 비슷한 형태로 운영되고, 독립적인 기술 전문가와 오픈 소스 대표가 포함된 이사회를 두는 구상입니다. 주로 민간 자금으로 운영되는 이 구조는 최고 수준의 기술 인재를 유치하고, 대규모 테스트에 필요한 컴퓨팅 자원을 조달하는 데 목적이 있습니다. Hassabis는 미국이 이 구상을 시작하기에 가장 적합한 나라라고 보면서도, 안전 문제에 대해서는 국제적 협력을 촉구합니다.
If you stop to think about it, we’ve essentially found a way to make sand think. It’s miraculous. The magnitude of this technology’s impact will be unprecedented, perhaps 10x of the Industrial Revolution at 10x the speed.
🇰🇷 생각해 보면, 우리는 사실상 모래가 생각하도록 만드는 방법을 찾아낸 셈입니다. 정말 기적입니다. 이 기술의 영향력은 전례가 없을 것이며, 아마도 산업혁명보다 10배 크고 10배 더 빠를 것입니다. — @demishassabis X에서
NVIDIA — 와트당 성능, AI 인프라 효율의 핵심 지표
7월 14일 — NVIDIA는 와트당 성능을 AI 인프라 효율의 기준 지표로 내세웁니다. 전력 가용성이 가장 큰 제약인 상황에서, 이 비율이 고정된 전력 한도 안에서 AI 공장이 얼마나 많은 토큰을 생산할 수 있는지, 따라서 매출과 수익성을 결정하기 때문입니다.
회사는 Hopper 세대와 비교한 Blackwell NVL72 플랫폼의 성능 향상을 수치로 제시했습니다:
| 평가 모델 | 와트당 성능 향상 (Blackwell NVL72 vs Hopper) |
|---|---|
| DeepSeek V4 Pro | 최대 25배 |
| GLM 5.1 | 최대 20배 |
| Kimi K2.6 (긴 에이전트성 작업) | 최대 10배 |
이러한 향상의 일부는 8 GPU 단위의 GPU 도메인(Hopper)에서 72 GPU 통합 랙으로 전환한 데서 비롯되며, 여섯 번째 세대 NVLink Switch가 네트워크 내 계산(SHARP 기술)을 통합합니다. 하드웨어를 넘어서 소프트웨어 최적화도 계속 큰 효과를 내고 있습니다. TensorRT-LLM, Dynamo, SGLang, vLLM 스택을 통해 단 한 달 만에 DeepSeek V4에서 추가로 최대 5배의 성능 향상을 얻었다고 합니다.
전력 인프라 측면에서는 DSX MaxLPS 기술이 미온수 냉각과 동적 전력 제어를 통해 동일한 전력 예산에서 최대 40% 더 많은 GPU를 가동할 수 있게 해준다고 합니다. 현재는 네트워크에서 끌어온 전력의 약 60%만이 실제로 유용한 AI 작업으로 전환된다고 알려져 있습니다. NVIDIA는 이 접근을 차세대 Vera Rubin 플랫폼의 맥락에서 소개하며, Anthropic, OpenAI, CoreWeave, Perplexity, Fireworks AI의 운영 배포 사례를 언급합니다.
NVIDIA — Nemotron Labs: 에이전트 역량이 주도하는 자율 RL 연구
7월 14일 — NVIDIA는 NeMo RL, NeMo Gym, 재사용 가능한 스킬을 기반으로 한 에이전트 주도 강화학습 연구 시연인 “RL Autoresearch”를 선보였습니다. 원리는 간단합니다. 코딩 에이전트에게 목표와 시간 예산을 주고, 학습 환경을 스스로 만들게 한 뒤 모델을 학습하고 평가하게 하며, 연구자는 전체 방향만 감독하는 방식입니다.
시연 예시에서 에이전트는 비전 모델이 색깔 별을 세도록 학습해야 했습니다. Qwen3-VL-2B 모델은 정확도가 25%에서 96.9%로 상승했고, 에이전트는 연구자가 지시하지 않았음에도 다음에 수행할 실험을 스스로 제안했습니다.
자율 연구가 아니라 사후 학습에 해당하는 두 번째 예시는 비슷한 활용을 보여줍니다. 원래는 zero-shot 평가에서 보였음에도 신호등을 감지하지 못하던 Cosmos 3 Nano 모델을, WTS 검증 작업(날씨·교통·신호를 통합한 주행 시나리오)을 위해 LoRA로 사후 학습했습니다. 정확도는 LoRA 후 54.41%에서 87.14%로 오르고, 여기에 NVIDIA TAO AutoML을 더하자 93.35%까지 상승했으며, 전체 과정은 하루도 걸리지 않았습니다.
We gave a coding agent a goal and a time budget: build a training environment and teach a vision model to count colored stars.
🇰🇷 우리는 코딩 에이전트에게 목표와 시간 예산을 주었습니다: 학습 환경을 만들고, 비전 모델이 색깔 별을 세도록 학습시키라는 것이었습니다. — @NVIDIAAI X에서
오픈 모델 & 연구
이번 주 오픈 모델과 연구 분야에서는 Hugging Face, Together AI, Sakana AI가 주도한 일곱 건의 발표가 있었습니다.
| 평가 모델 | 배포처 | 파라미터 수 | 라이선스 | 핵심 벤치마크 |
|---|---|---|---|---|
| OvisOCR2 | 독립 저자(HF) | 0.9 billion | Apache 2.0 | OmniDocBench v1.6에서 96.58 |
| MOSS-VL-Realtime | Open_MOSS | 11 billion | Apache 2.0 | 256,000 토큰 컨텍스트 |
| Ternary Bonsai 27B | PrismML | 약 27.3 billion (ternary) | Together AI에서 무료 | MATH-500에서 99.20 |
OvisOCR2: 0.9 billion 파라미터 문서 인식
OvisOCR2는 OmniDocBench v1.6에서 96.58점을 주장하며, OCR, 레이아웃 탐지, 분석을 따로 처리하는 파이프라인형 시스템을 넘어서는 최초의 엔드투엔드 모델이라고 소개됩니다. 작성자는 Hugging Face Jobs를 활용해 로컬 GPU 없이 어떤 데이터셋이든 OCR을 통해 markdown으로 변환하는 레시피를 제안합니다. 다만 이 점수와 “최초의 엔드투엔드 모델”이라는 표현은 발표 트윗에서 나온 것이며, 완전한 모델 카드로 검증된 것은 아닙니다.
MOSS-VL-Realtime: 실시간 영상용 오픈 비전-언어 모델
Open_MOSS 팀은 정지 이미지가 아니라 지속적인 비디오 스트림 분석을 위해 설계된 11 billion 파라미터 비전-언어 모델을 공개했습니다. 이 모델은 응답을 생성하는 동안에도 비디오를 계속 관찰하고, 화면 상황이 변하면 답변을 수정할 수 있으며, 충분한 근거가 없으면 침묵을 선택합니다. Base, Instruct, Realtime 변형 모두 Apache 2.0으로 공개되며, SGLang과 LMSYS 팀의 day-0 지원이 제공됩니다.
LeRobot v0.6.0: 깊이 정보 기본 지원
Hugging Face의 오픈 소스 로보틱스 라이브러리는 depth에 대한 엔드투엔드 네이티브 지원을 추가합니다. Intel RealSense 카메라를 연결하고 use_depth: true를 활성화하면 깊이 맵이 RGB 스트림과 자동 동기화되고, 12비트로 양자화되어 무손실 HEVC로 인코딩됩니다. 이 기능은 SO-100/101, Koch, OpenArm, reBot, Unitree G1을 지원합니다.
Sakana Marlin: 전략 연구를 위한 “Virtual CSO”
Sakana AI는 AB-MCTS 엔진과 AI Scientist 유형의 흐름을 통해 약 8시간에 걸친 심층 추론을 수행해, 요약이 아니라 구조화된 전략 옵션을 도출하는 자율 연구 에이전트를 출시합니다. 결과물에는 보고서, 부록, 참고문헌, 슬라이드가 포함됩니다. 제품은 베타 단계이며, 사용량 기반 과금(크레딧당 98엔) 또는 견적 기반 엔터프라이즈 플랜이 제공됩니다.
Ternary Bonsai 27B: 휴대용 형식의 삼진수 양자화
PrismML은 Qwen3.6 27B의 삼진수 양자화 파생 모델을 공개했습니다. g128 형식, 가중치당 1.71비트, FP16 기반 대비 약 9.4배 더 작으며, 완전 정밀도 대비 품질의 95%를 유지한다고 배포처는 주장합니다.
| 평가 벤치마크 | 점수 |
|---|---|
| MATH-500 | 99.20 |
| AIME 2025 | 90.84 |
| HumanEval+ | 93.90 |
| 평균(15개 thinking 벤치마크) | 80.49 |
이 모델은 262,000 토큰 컨텍스트와 시각 입력을 지원하며, Together AI의 서버리스 인프라에서 무료로 제공됩니다.
Flash-BoN: diffusion을 위한 best-of-N 재해석
Sayak Paul(Hugging Face)은 샘플링 시 확장에 있어 best-of-N이 생각보다 더 강력한 기준선임을 보여줍니다. 다만 함수 평가 횟수만이 아니라 실제 실행 시간도 함께 측정해야 한다는 조건이 있습니다. 팀은 중간 검증을 반복하기보다 샘플의 더 넓은 탐색을 우선하는 Flash-BoN을 소개합니다.
Hugging Face, ZeroGPU를 모든 사용자에게 개방
ZeroGPU 데모(GPU를 요청 시 무료로 사용하는 방식)에 대한 접근이 이제 모든 Hugging Face 사용자에게 제공되며, 자연어 프롬프트만으로 데모를 직접 만들 수 있는 agent skill도 함께 지원됩니다.
GitHub, Copilot & Manus
코드 스캐닝이 pull request에 AI 보안 탐지를 표시
7월 14일 — GitHub code scanning이 이제 AI가 보조한 보안 탐지를 pull request에 직접 표시하며, CodeQL이 지원하지 않는 언어와 프레임워크까지 범위를 넓혔습니다. 이 기능은 공개 프리뷰 단계이며, 정보 제공용입니다. 병합을 차단하지 않으며, default setup CodeQL이 활성화되어 있어야 하고, Copilot 라이선스가 필요하며, 탐지가 발생한 경우에만 AI 크레딧을 사용합니다.
Dependabot에 기본 지연 기간 도입
7월 14일 — Dependabot은 이제 새 버전이 공개된 뒤 기본적으로 3일을 기다렸다가 업데이트 pull request를 열어 공급망 공격 노출을 줄입니다. 이 지연은 cooldown의 .github/dependabot.yml 옵션으로 설정할 수 있으며, 보안 업데이트는 여전히 즉시 적용됩니다. 이 기능은 GitHub Enterprise Server 3.23부터 제공될 예정입니다.
GitHub Copilot 앱의 /security-review
7월 14일 — /security-review 명령이 GitHub Copilot 앱에서 공개 프리뷰로 제공됩니다. 이 명령은 현재 진행 중인 코드 변경을 분석해 심각도와 신뢰도 수준별로 분류된 결과를 반환하며, 앱을 떠나지 않고 바로 적용할 수 있는 제안도 함께 제공합니다. 주입, cross-site scripting, path traversal을 포함해 검사하며, Free, Pro, Business, Enterprise 플랜에서 사용할 수 있습니다.
Manus, 이제 네이티브 .pptx를 생성
7월 14일 — 이전에는 슬라이드를 생성한 뒤 .pptx로 변환하던 Manus가 이제 PowerPoint 파일을 바로 네이티브 형식으로 생성합니다. 그래프는 실제로 편집 가능하며 값이 바뀌면 다시 그려지고, 레이블·눈금선·범례를 켜거나 끌 수 있습니다.
🔗 Manus 발표
Manus, 생성된 사이트의 자동 게시 기능 출시
7월 13일 — 새 auto-publish 옵션은 생성된 사이트의 성공한 각 빌드를 온라인 URL에 자동 배포하며, 기본적으로 비활성화되어 있습니다. 변경 대기열과 결합하면, 빌드와 프로덕션 반영 사이의 마지막 수동 단계를 없애줍니다.
🔗 Manus 발표
이미지 & 비디오 생성
Wan-Dancer-14B: 오픈 소스 댄스 비디오 생성
7월 14일 — Alibaba가 Wan-Dancer-14B를 오픈 소스로 공개했습니다. 이 모델은 로컬에서 실행 가능하며, 장시간 리듬감 있는 댄스 비디오 생성에 특화되어 있고, 단순한 클립이 아니라 긴 시퀀스에서 동작과 음악의 동기화에 초점을 맞춥니다.
HeyGen: 실시간 아바타를 위한 단어 단위 타임스탬프
7월 14일 — HeyGen은 자사 Avatar Realtime API의 비공개 흐름을 문서화했습니다. 단어 단위 타임스탬프 채널({mot, début, fin})을 통해 제스처와 발화를 정밀하게 동기화할 수 있습니다. 텍스트 전송 확인은 약 70ms 안에 도착하지만, 실제로 그 단어가 발화되기까지는 몇 초가 걸리므로 초당 약 네 번 재계산되는 앵커링이 필요합니다. 이 메커니즘은 24시간 스트리밍된 Twitch 방송을 통해 검증되었고, 실시간으로 9,269개의 판정이 내려졌습니다.
HeyGen — Figma → HyperFrames, 9/30일차
7월 14일 — /figma 스킬은 Figma 파일에서 에셋, 브랜드 토큰, 모션 컴포넌트, 타임라인, 스토리보드를 직접 가져옵니다. 데모에서 팀은 이름이 지정된 27개의 색상과 스타일을 가져와, 8개 프레임으로 된 스토리보드를 실시간으로 해석되는 촬영 스크립트처럼 재구성했습니다.
NVIDIA — Nemotron: 고객 기업들의 수치화된 성과
7월 14일 — NVIDIA가 오픈 모델 Nemotron을 둘러싼 여러 고객 사례를 수치와 함께 공개했습니다. H Company는 Holotron 3 Nano로 OSWorld-Verified에서 76%가 넘는 정확도를 달성했고, Harvey는 Nemotron 3 Ultra를 사후 학습하여 실행당 비용을 폐쇄형 대안보다 최소 10배 낮췄습니다. Arcee AI는 유사한 폐쇄형 모델보다 약 20배 저렴하면서도 PinchBench에서 2위를 기록했다고 주장합니다. Abridge와 YTL AI Labs는 각각 임상 대화와 말레이어를 위해 이를 맞춤화했습니다.
Anthropic
Claude for Teachers: 미국 K-12 교사를 위한 무료 접근
7월 14일 — Anthropic은 미국에서 검증된 K-12 교사에게 Claude의 프리미엄 기능을 무료로 제공합니다. 50개 주의 표준에 맞춘 검증된 프로그램과 연결되는 Learning Commons의 교수 스킬 라이브러리도 함께 제공됩니다. 대화 내용은 절대 모델 학습에 사용되지 않으며, 학생 데이터는 FERPA를 준수하는 처리 계약으로 보호됩니다.
Artifacts: 공개 공유, 멀티플레이어 편집, Claude Tag를 통한 생성
7월 13일 — Artifacts에 공개 공유(링크가 있는 누구나 열람 가능), 동시 멀티플레이어 편집(Team 및 Enterprise 요금제), 그리고 Slack의 Claude Tag에서 스레드 한 번의 요청으로 생성하는 기능이 추가됩니다.
OpenAI
Amazon Bedrock에서 일반 제공되는 GPT-5.6
7월 13일 — 7월 9일 출시된 세 가지 GPT-5.6 모델 — Sol(플래그십 추론), Terra(중간급), Luna(빠른 추론) — 이 이제 성능, 보안, 확장성을 위해 설계된 Bedrock의 새로운 추론 엔진에서 Amazon Bedrock의 일반 제공 상태로 제공됩니다. 이를 통해 ChatGPT, OpenAI 직접 API, 그리고 서드파티 통합(Copilot, M365, Warp, Cursor, Devin)과 함께 GPT-5.6에 접근할 수 있는 경로가 더 넓어집니다.
🔗 AWS 발표
JetBrains AI의 기본 권장 에이전트가 된 Codex
7월 14일 — JetBrains는 JetBrains AI(IntelliJ IDEA, PyCharm, WebStorm)에서 Codex를 기본 권장 에이전트로 지정합니다. 이는 독점적 선택이 아니며 — 사용자는 언제든 다른 에이전트로 전환할 수 있습니다 — 모델이 진화함에 따라 매달 재평가됩니다.
Gemini
영국에서 출시된 Google Chrome의 Gemini
7월 14일 — Gemini는 영국에서 열려 있는 Chrome의 어떤 탭에서든 맥락 전환 없이 사용할 수 있게 됩니다. 페이지 요약, 탭 간 콘텐츠 비교, 화면에 표시된 내용에 대한 질문 응답이 가능합니다.
동남아시아 첫 Gemini 보고서: 기록적인 채택과 Gemini Spark
7월 14일 — Google은 첫 번째 “Gemini Southeast Asia Report”를 공개합니다. 주요 6개 시장(인도네시아, 말레이시아, 필리핀, 싱가포르, 태국, 베트남)에서 활성 사용자가 1년 만에 두 배 이상 증가했고, 쿼리의 거의 70%가 현지 언어로 제출되었으며, 지난 1년간 Nano Banana를 통해 50억 장의 이미지가 생성되었습니다. 이와 함께 Google은 해당 지역 Advanced 구독자를 위해 로컬 언어로 Workspace 작업을 처리할 수 있는 능동형 에이전트 Gemini Spark를 배포합니다.
개발 도구 및 에이전트
Fable 5로 라우팅하는 미리보기 에이전트 Devin Fusion
7월 13일 — Cognition은 Devin Cloud에서 사용할 수 있는 미리보기 에이전트 Devin Fusion을 출시합니다. 이 에이전트에서는 하나의 모델이 단일 프리미엄 모델로 모든 작업을 수행하는 대신, 더 경제적인 모델에 작업을 위임하는 관리자의 역할을 합니다. 팀에 따르면 Fable 5는 완전한 사양을 작성해 작업을 위임하는 관리자처럼 동작하는 반면, Opus 4.8 같은 다른 모델은 과도하게 개입하고 컨텍스트를 포화시키는 경향이 있습니다. 그 결과 단가가 더 높은 Fable 5를 사용하더라도 작업당 비용은 Opus 4.8보다 낮아집니다. 다만 연속 디버깅에서는 절감 효과를 얻기가 여전히 더 어렵습니다.
Perplexity, WANDR 벤치마크를 오픈 소스로 공개
7월 14일 — Perplexity는 광범위하고 심층적인 연구 작업에서 검색 에이전트를 평가하기 위해 설계된 내부 벤치마크 WANDR(Wide ANd Deep Research)를 공개합니다. 이 벤치마크는 500개 과제, 개별적으로 검증 가능한 170,495개 기록, 그리고 세 단계의 난이도로 구성됩니다. 채점기는 인용된 각 페이지를 다시 가져와 모든 주장에 근거 증거가 있는지 확인합니다. 테스트한 6개의 프로덕션 시스템에서 결과는 modest합니다. 소프트 F1은 0.363, 스트릭트 F1은 0.133에 그쳤고, 작업당 비용은 설정에 따라 0.03달러에서 324.83달러까지 달랐습니다.
🔗 Perplexity X 발표 · GitHub 벤치마크
간단 소식
- Anthropic이 캐나다에서 지역 기관들과 협력해 새로운 AI 연구를 지원하기 위해 1,000만 캐나다달러를 투자합니다. 🔗 출처
- Cognition이 Windsurf 인수 1주년을 기념합니다. 연간 반복 매출은 7,300만 달러에서 5억 달러 이상으로 증가했고, 2,000만 줄이 넘는 코드가 작성되었으며, Devin Desktop 브랜드로 통합되었습니다. 🔗 출처
- Amp(Sourcegraph)가 모든 사용자와 내부 팀 모두를 위해 에이전트 모드 사용 현황을 실시간으로 보여주는 공개 대시보드를 공개합니다. 🔗 출처
- Warp가 MCP를 통해 Sentry를 통합해, 터미널을 벗어나지 않고도 근본 원인 분석(Seer)과 pull request 생성을 연속으로 수행할 수 있게 합니다. 🔗 출처
- Composio가 Warp에 합류해 에이전트를 Gmail, Slack, Linear, Google Calendar 등 1,000개 이상의 애플리케이션에 연결합니다. 🔗 출처
- Zach Lloyd(Warp CEO)가 상호작용형 에이전트에서 소프트웨어 전 생명주기를 자동화하는 “cloud software factories”로의 전환에 대한 에세이를 게시합니다. 🔗 출처
- Hugging Face Jobs가 이제 업로드를 리포지토리로 먼저 올리지 않고도
-v dossier:/chemin를 통해 Job 안에 로컬 폴더를 직접 마운트할 수 있게 합니다. 🔗 출처 - llama.cpp가 10,000번째 릴리스(release)를 맞이했으며, 추가 기술 세부 사항은 없습니다. 🔗 출처
- LlamaCoder v4(Together AI)가 하나의 프롬프트로 완전한 애플리케이션을 생성하며, 새로운 WebAssembly 렌더링 엔진과 함께 GLM 5.2를 기반으로 재구성되었고 무료이자 오픈 소스입니다. 🔗 출처
- NotebookLM이 향후 상세 발표를 앞두고 최근 기능(Drive 자동 동기화, 노트북 고정, 슬라이드 재정렬, 모바일 공유)을 정리합니다. 🔗 출처
- GitHub가 2026년 7월 20일 예정된 커밋터당 월 10달러 인상 전에 Code Quality 라이선스 비용(활성 커밋터, 월별 예상치)을 이제 추정할 수 있게 합니다. 🔗 출처
- NVIDIA가 모델 크기와 GPU 성능 간의 시너지를 다루는 새로운 시리즈 “AI Model Co-Design”을 시작합니다. 🔗 출처
- Kling AI가 Ash Koosha가 연출한 스튜디오 Fountain 0의 두 번째 AI 장편 영화 ODYSEEUS: The Fall의 트레일러를 공개합니다. 🔗 출처
- OpenAI가 에이전트 시대의 AI 투자 운영을 위한 Enterprise 가이드를 공개하며, 지출한 달러당 유의미한 작업량 측정에 초점을 맞춥니다. 🔗 출처
- OpenAI가 영업팀이 파이프라인 노트, 회의 준비, 막힌 거래 진단에 ChatGPT Work를 어떻게 사용하는지 설명합니다. 🔗 출처
- OpenAI가 데이터 사이언스 팀이 근본 원인 노트, 영향 요약, 대시보드 사양에 ChatGPT Work를 어떻게 사용하는지 설명합니다. 🔗 출처
- Cohere가 Hugging Face 해커톤을 공동 후원하며 두 프로젝트를 시상합니다. Tiny Army(2등, Thousand-Token Wood 트랙)와 Eyas(영상 감시 에이전트, 최고 에이전트상)입니다. 🔗 출처
이것이 의미하는 바
하드웨어 관점에서 NVIDIA는 메시지를 하나의 핵심으로 수렴시키고 있습니다. 더 이상 실리콘이 아니라 전력량이 AI 팩토리의 수익성을 결정하는 제약이라는 것입니다. Blackwell의 와트당 성능 향상(DeepSeek V4 Pro에서 최대 25배)과 수십 배 저렴하다고 수치화된 Nemotron 고객 사례는 같은 이야기를 전합니다. 즉, 절대 성능보다 에너지 효율과 토큰당 비용이 주된 판매 포인트가 되고 있습니다. RL Autoresearch 데모도 같은 방향으로, 지금까지 크게 수작업에 의존하던 연구-훈련-평가 루프 자체를 자동화하려 합니다.
오픈 모델 측면에서 이번 주는 빠르게 세분화되는 틈새를 보여줍니다. 초경량 문서 인식(OvisOCR2), 연속 비디오 이해(MOSS-VL-Realtime), 네이티브 깊이 정보를 갖춘 로보틱스(LeRobot), 그리고 특히 Bonsai 27B의 3진 양자화는 270억 파라미터급 멀티모달 역량을 스마트폰 수준의 메모리 점유로 담아냅니다. Hugging Face, Together AI, Sakana AI, 독립 팀들이 내놓은 이러한 발표들은, 오픈 소스 생태계가 폐쇄형 모델의 성능을 계속 바짝 추격하면서도 추론 비용은 크게 낮추고 있음을 보여줍니다.
거버넌스 측면에서는 Demis Hassabis의 발언이 보통의 제품 발표 톤과 확연히 다릅니다. 그는 현재의 상업적 경쟁이 위험에 대한 집단적 이해를 앞서가고 있다고 분명히 말하며, 단순한 신중론이 아니라 FINRA에서 영감을 받은 Standards Body라는 구체적 메커니즘을 제안합니다. 이런 제안이 다른 제품 출시가 한창인 주간에 Google DeepMind CEO로부터 나왔다는 점은, 업계 전반을 관통하는 상업적 속도와 규제적 선제 대응 사이의 긴장을 잘 보여줍니다.
마지막으로 개발자 도구는 더 강력한 단일 모델로의 경쟁보다 모델 간 위임을 중심으로 재편되고 있습니다. Devin Fusion은 저렴한 실행 모델에 위임하는 관리자 모델에 기대고, GitHub는 AI 보조 보안 스캐닝을 pull request 안으로 직접 확장하며, Perplexity는 검색 에이전트의 실제 한계를 객관화하기 위해 WANDR 벤치마크를 공개합니다. 이는 현재의 최고 시스템조차 대규모 사실 검증 작업에서 완전한 신뢰성에는 아직 한참 못 미친다는 유용한 상기입니다.
출처
- Demis Hassabis — X에서의 발표
- Demis Hassabis — X 전체 기사
- NVIDIA — 와트당 성능
- NVIDIA — RL Autoresearch
- NVIDIA — Nemotron Labs 발표
- OvisOCR2
- MOSS-VL-Realtime
- LeRobot v0.6.0
- Sakana Marlin
- Ternary Bonsai 27B
- Flash-BoN
- Hugging Face ZeroGPU
- GitHub — PR에서의 AI 보안 스캐닝
- GitHub — Dependabot cooldown
- GitHub — Copilot 앱의 /security-review
- Manus — 기본 .pptx
- Manus — 자동 게시
- Alibaba Wan-Dancer-14B
- HeyGen — 단어별 타임스탬프
- HeyGen — Figma → HyperFrames
- NVIDIA — Nemotron 고객 피드백
- Claude for Teachers
- Artifacts — 공개 공유
- Amazon Bedrock의 GPT-5.6
- JetBrains AI의 Codex
- Chrome의 Gemini(UK)
- 동남아시아 Gemini 보고서
- Devin Fusion
- Perplexity WANDR
- Anthropic — 캐나다의 AI 연구
- Cognition — Windsurf 인수 1년 후
- Amp — 실시간 사용량
- Warp x Sentry
- Warp의 Composio
- Warp — cloud software factories
- Hugging Face Jobs — 로컬 폴더 마운트
- llama.cpp — 10,000번째 release
- LlamaCoder v4
- NotebookLM — 요약
- GitHub Code Quality — 라이선스 추정
- NVIDIA — AI Model Co-Design
- Kling AI — ODYSEEUS: The Fall
- OpenAI — AI 투자
- OpenAI — 영업용 ChatGPT Work
- OpenAI — 데이터 사이언스용 ChatGPT Work
- Cohere — Hugging Face 해커톤