ai-powered-markdown-translatorgpt-5.6-sol로 프랑스어에서 한국어로 번역된 기사.
9월 21일 월요일의 주인공은 xAI다. Grok 4.7이 출시되고, 모델 발표와 도구 도입 사이에 아무런 지연 없이 당일 Cursor와 GitHub Copilot에서 제공되기 시작했다. OpenAI도 같은 날 8월 28일부터 훈련한 내부 모델이 미해결 수학 문제 100여 개를 풀었다고 공개했으며, Fields Medal 수상자 27명이 서명한 성명이 나온 뒤 수학자 자문단을 출범시켰다. Google은 Googlebook의 사전 주문을 시작했고, ElevenLabs는 영상 편집기 중심에 편집 에이전트를 배치했으며, Hugging Face는 3배에서 30배 빨라진 토큰화 라이브러리를 다시 공개했다.
xAI가 Grok 4.7을 출시하고 당일 Cursor와 GitHub Copilot에 도입
9월 21일 — xAI가 코드 및 지식 작업을 위한 자사의 최고 성능 모델 Grok 4.7을 출시했다. 기본 모델은 Grok 4.6보다 크며, 강화 학습(reinforcement learning) 단계는 여러 시간이 걸리는 문제에 가중치를 둔 작업 조합을 대상으로 더 길게 진행됐다. xAI는 이 모델이 자체 작업을 더 잘 검증하고 긴 컨텍스트를 더 안정적으로 처리할 것으로 기대한다.
수치는 압도적인 우위보다는 엇갈린 특성을 보여준다. 요금은 바뀌지 않았다. 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러로 Grok 4.6과 같으며, GPT-5.6 Sol 입력 요금의 절반이자 Fable 5.1 입력 요금의 5분의 1이다. 핵심 주장은 바로 이 가격 대비 성능에 있다.
| 공개된 측정 항목 | Grok 4.7 (xHigh) | Grok 4.6 (High) | GPT-5.6 Sol (Max) | Fable 5.1 (Max) |
|---|---|---|---|---|
| CursorBench 4.0 | 46,3 % | 40,4 % | 41,7 % | 51,8 % |
| Terminal-Bench 4.0 | 38,0 % | 20,3 % | 37,3 % | 57,9 % |
| EEBench(전기공학) | 64,0 % | 53,0 % | 39,4 % | 56,4 % |
| 입력 요금(달러 / 토큰 100만 개) | 2 | 2 | 4 | 10 |
| 출력 요금(달러 / 토큰 100만 개) | 6 | 6 | 20 | 50 |
API는 500,000토큰의 컨텍스트와 low부터 xhigh까지 네 단계의 추론 노력을 지원하는 grok-4.7을 제공한다. 프롬프트가 200,000토큰을 넘으면 요금이 두 배가 된다. xAI는 완전히 새로 설계된 보호 체계도 강조한다. LatchBio 생물보안 벤치마크에서 62.4%로 1위를 기록했으며, HackerBench v0.3에서는 위험한 이중 용도 사이버 프롬프트의 3.3%만 통과시켰다.
두 통합 서비스에서는 즉시 배포됐다. Cursor는 첫날부터 이 모델을 제공한다. 이는 8월 14일 마무리된 SpaceX의 Anysphere 인수에 따른 결과다. 모델 자체는 여전히 xAI의 것이다. 같은 날 Cursor 블로그에 게시된 글은 한 문장뿐이며 x.ai의 전체 발표로 연결된다. Cursor의 장기 작업 벤치마크인 CursorBench 4.0에서 Grok 4.7이 요금 인상 없이 46.3%를 기록했다고 강조한 주체도 xAI다. GitHub Copilot 역시 VS Code부터 Xcode까지 모든 환경에서 Pro부터 Enterprise까지의 요금제를 대상으로 모델을 배포했다. 여기서는 과금 방식에 주의해야 한다. Grok 4.7에는 요청 배수 체계가 적용되지 않고, 사용량에 따라 공급자의 공개 요금이 그대로 부과된다. 새 모델이 기본으로 활성화되므로 지출을 관리하려면 단순히 아무것도 하지 않는 데 그치지 않고 모델 정책에서 직접 조치해야 한다.
🔗 Grok 4.7 — xAI 🔗 이제 GitHub Copilot에서 이용할 수 있는 Grok 4.7
OpenAI가 수학자 자문단을 출범시키고 해결된 미해결 문제 100여 개를 공개
9월 21일 — OpenAI는 수학자들이 직접 구성하고 Princeton의 Institute for Advanced Study가 운영하는 독립적인 수학자 9인 자문단과 협력한다고 발표했다. 그러나 발표 자체보다 그 배경이 더 중요하다.
On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.
🇰🇷 8월 28일, 저희는 새로운 내부 모델의 훈련을 시작했습니다. Navier-Stokes 밀레니엄 문제를 해결한 데 이어, 이 모델은 이제 수학의 거의 모든 분야에서 오랫동안 풀리지 않았던 미해결 문제 100여 개를 해결했습니다. — OpenAI, 수학 및 인공지능 자문단
이 모델의 이름은 공개되지 않았으며, OpenAI는 이러한 발전 속도가 자사의 수학자들조차 놀라게 했다고 밝혔다. 이 같은 가속은 정면으로 반발을 불러왔다. 9월 11일, 「수학 분야 AI의 심각한 정렬 실패」라는 제목의 성명이 Zenodo DOI와 함께 공개됐고, Terence Tao, Peter Scholze, Cédric Villani를 비롯한 Fields Medal 수상자 27명이 서명했다. 이들의 주장은 모델이 틀린다는 것이 아니다. 중대한 문제를 해결하는 일은 늘 새로운 이해가 생겼음을 나타냈고, 이후 공동체가 이를 다듬어 가르칠 수 있는 지식으로 만들었다. 서명자들은 참이거나 거짓인 명제를 대량으로 생산하면 이러한 토양을 살리는 대신 파괴할 수 있으며, 성급한 발표 때문에 제대로 작성할 시간조차 확보하지 못할 것을 우려한다.
이 체계는 독립성 측면에서 탄탄하다. 자문단은 요청받지 않은 의견을 제시하고, OpenAI가 수학에 미치는 영향을 공개적으로 논평하며, 회사의 승인 없이 구성원을 변경할 수 있다. 구성원들은 OpenAI로부터 보수도 받지 않는다. 하지만 OpenAI가 같은 문단 끝에 덧붙인 문장은 여전히 남는다. 자문단은 회사 내부 발전의 속도에 관해서는 조언하지 않는다. 따라서 자문 범위는 결과의 생산이 아닌 공개에만 적용된다. 즉, 항의를 촉발한 바로 그 부분만 제외된다. Martin Hairer는 성명 서명자이자 자문단 구성원으로 양쪽 명단에 모두 이름을 올렸다.
Gemini를 중심으로 설계된 Google 노트북 제품군 Googlebook
9월 21일 — Google이 독자적인 제품 범주로 소개하는 Googlebook의 사전 주문을 시작했다. Android 기술 스택과 ChromeOS에서 물려받은 데스크톱 기반을 결합하고, 전체를 Gemini 중심으로 설계했다. Acer, ASUS, Dell, HP, Lenovo가 제조한 다섯 모델이 899달러부터 동시에 출시된다. 배송은 미국에서 10월 4일, 캐나다, 영국, 아일랜드, 프랑스, 독일, 호주에서는 10월 5일 시작된다.
| 발표된 사양 | 값 |
|---|---|
| 시작 가격 | 899달러 |
| 프로세서 | Intel Core Ultra Series 3 또는 Snapdragon X Elite |
| NPU | 45 TOPS 초과 |
| 메모리 | 기본 16GB, 최대 32GB |
| 배터리 사용 시간 | 영상 최대 14시간, 웹 탐색 최대 16시간 |
| 소프트웨어 지원 | 최대 10년간 업데이트 |
이 기기만의 Gemini 기능은 세 가지다. 커서를 흔들어 실행하는 Magic Pointer는 화면에 표시된 요소에 Gemini를 불러온다. 의심스러운 이메일을 분석하거나 여러 이미지를 결합하는 식이다. Google은 이 기능이 요청할 때만 활성화되며 비활성화할 수도 있다고 설명한다. Rambler는 문장 도중 언어를 바꾸더라도 두서없는 받아쓰기 내용을 제목과 작업 목록이 포함된 구조화된 텍스트로 바꾼다. Create My Widget은 자연어 설명으로 데스크톱 위젯을 생성한다.
개발자를 위해 모든 기기에는 Google의 개발 에이전트 플랫폼 Antigravity와 완전한 터미널을 갖춘 격리형 Linux 환경이 기본 제공된다. 문서에는 이 환경에서 Claude Code나 Antigravity CLI를 실행할 수 있다고 명시돼 있다. 이 격리는 Level 5 인증을 받은 pKVM 하이퍼바이저를 기반으로 하며, Google은 이를 해당 제품 범주 최초라고 소개한다. 여기에 Titan 하드웨어 신뢰 기반이 더해진다. 나머지는 Android 휴대전화와의 연속성이 채운다. 모바일에서 시작한 작업을 이어서 할 수 있고, 모바일 앱을 데스크톱 창으로 스트리밍할 수 있다. 각 Googlebook에는 저장 공간 5TB가 포함된 Google AI Pro 12개월, YouTube Premium과 Photoshop 3개월, GeForce NOW 1년 이용권이 포함된다.
ElevenLabs가 Studio 4.0에 편집 에이전트를 도입
9월 21일 — ElevenLabs가 영상 편집기 업데이트인 Studio 4.0을 ElevenCreative에 출시했다. 핵심 발상은 한 문장으로 요약된다. 모든 작업을 한곳에서 처리한다는 것이다. 영상, 이미지, 음성, 음악, 음향 효과를 프로젝트 안에서 직접 생성할 수 있고, 편집기를 벗어나지 않고도 ElevenCreative의 모든 모델을 호출할 수 있으며, 편집과 자막 작업을 거쳐 내보내기까지 동일한 인터페이스에서 연속으로 진행된다. 전체를 다시 생성하지 않고도 한 장면만 수정할 수 있으며, 자막은 편집 타임라인(timeline)의 다른 클립과 똑같이 다룰 수 있다.
가장 큰 구조적 변화는 모든 프로젝트에서 공동 편집자로 참여하는 Studio Agent다.
Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.
🇰🇷 Studio Agent는 모든 프로젝트에 내장된 AI 공동 편집자입니다. 원하는 변경 사항을 설명하면 편집을 수행합니다. 원할 때 개입해 직접 컷을 편집한 다음, 타임라인을 다시 에이전트에게 넘기세요. — @ElevenLabs의 X 게시물
이러한 상호 전환이 이 도구를 불투명한 생성 방식과 구별한다. 편집자는 원할 때 제어권을 되찾았다가 다시 타임라인을 넘길 수 있다. 타임라인 자체도 광고 캠페인, 튜토리얼, 짧은 형식의 시리즈 같은 다중 장면 및 다중 트랙 프로젝트에 맞춰 재구축됐다. 프레임 단위 확대, 클립 맞춤 정렬, 나머지 요소의 동기화를 깨뜨리지 않는 클립 그룹 이동을 지원한다. 팀 댓글도 별도 대화 흐름에 흩어지는 대신 특정 클립이나 자산에 직접 달 수 있다.
추적을 위해 짚어둘 점이 있다. 확인 당시 발표는 X의 메시지 6개짜리 스레드로만 존재했다. ElevenLabs 블로그의 최신 글은 9월 10일 게시물이었고, 문서 변경 기록의 최신 항목은 14일자였다.
Hugging Face, 동일한 식별자를 유지하면서 3배에서 30배 빨라진 tokenizers v1 공개
9월 21일 — Hugging Face가 모델이 텍스트를 읽기 전에 이를 정수 배열로 변환하는 Rust 라이브러리 tokenizers v1의 출시 후보 버전을 공개했다. 출발점은 단순하다. 토큰화는 머신러닝 파이프라인에서 한 번도 병목이 아니었지만, 모델이 빨라지면서 균형이 달라지고 있으며 프로세서를 기다리는 GPU는 유휴 상태의 GPU라는 것이다.
| 측정 지표 | 측정값 |
|---|---|
| 단일 스레드에서 v0.23 대비 인코딩 속도 향상 | 3배에서 30배 |
| 측정 장비 | Apple M4 Max |
| 범위의 최저 및 최고 | t5-base 및 gpt2 |
| 8개 worker에서의 확장 효율 | 선형 대비 76% |
| 생성된 토큰 식별자 | v0.23과 동일 |
| 출시 후보 버전 설치 | cargo add tokenizers --pre |
팀이 자체적으로 부과한 제약은 성능 향상 자체보다 더 흥미롭다. v1은 v0.23과 정확히 동일한 토큰 식별자를 생성하고, API와 어휘, 병합 순위(merge ranks)도 바뀌지 않으며, 라이브러리는 BPE에 특화되지 않고 범용성을 유지한다. 따라서 업데이트에는 설치된 버전을 바꾸는 것 외에 아무것도 필요하지 않다.
주요 작업은 여섯 가지 변경 사항에 집중돼 있으며, 그중 가장 이례적인 것은 bitcannon이다. 텍스트를 사전 토큰으로 분할하는 정규 표현식은 tokenizer와 함께 제공되는 고정 매개변수다. 인코딩할 때마다 범용 엔진이 이를 해석하게 할 이유가 없다. 이에 Hugging Face는 분할 함수를 직접 작성해 SIMD 비트 스트림에서 동작하도록 했다. 레지스터 연산 한 번으로 64바이트를 판정한다. 그 대가도 명확히 인정한다. 인식되는 패턴인 GPT-2, cl100k, o200k, Tekken, DeepSeek만 이점을 누리고, 나머지는 기존 regex 경로를 유지한다. 이것이 3배에서 30배까지 차이가 벌어지는 이유다. 여기에 할당과 분기 없는 병합 루프, 실행 스레드별 로컬 단어 캐시, 네이티브 병렬 처리도 추가됐다. ExecuTorch와 llama.cpp를 위한 추론 전용 C 및 C++ 바인딩은 1.0.0 이전에 제공될 예정이다.
🔗 tokenizers v1: 측정으로 확인한 인코딩, 디코딩 및 확장성
Devin Cloud, 에이전트 머신의 SSH 접근과 함께 터미널에 도입
9월 21일 — Cognition이 터미널에 Devin Cloud를 개방했다. devin --cloud 또는 진행 중인 세션에서 /cloud을 사용하면 CLI를 벗어나지 않고도 클라우드 세션을 생성하고 제어하며 재개할 수 있다. 이 메커니즘은 양방향 명령을 기반으로 한다. /handoff은 진행 중인 작업을 Mac, Linux 또는 Windows 기반 Devin 가상 머신으로 전송하며, 클라우드에서 실행하면 반대로 pull request 브랜치를 가져온다. 클라우드 세션은 이를 시작한 터미널이 종료된 뒤에도 유지된다.
And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.
🇰🇷 그리고 처음으로 Devin의 전용 가상 머신에 SSH로 접속한 다음, /handoff를 사용해 작업을 자신의 기기로 다시 가져오세요. — @cognition의 X 게시물
devin ssh은 에이전트가 구축한 환경에 대한 완전한 접근을 제공한다. 코드를 수정하고, 개발 서버를 실행하고, 포트를 전달하며, scp으로 파일을 가져올 수 있다. 실행 환경은 더 이상 블랙박스가 아니다. SWE-2 세션은 10월 8일까지 Devin Cloud에서 무료다.
Qwen Code v0.24.3, Web Shell을 계측하고 JDBC로 세션을 영속화
9월 21일 — Qwen Code가 v0.24.2 출시 다음 날 v0.24.3으로 업데이트됐다. pull request 31건이 포함됐으며 호환성을 깨뜨리는 변경은 없다. 눈에 띄는 작업의 핵심은 Web Shell이다. 실행 결과가 더 이상 일반 텍스트가 아니라 명령, 출력, 실행 세부 정보, 경과 시간을 구분하는 구조로 제공된다. 기본적으로 비활성화된 trajectory 탭에서는 턴별 소요 시간, 첫 token까지 걸린 시간, token 수, 각 도구 호출의 소요 시간을 확인할 수 있다.
눈에 잘 띄지 않는 부분이 아마도 구조적으로는 가장 중요하다. runtime에 연결과 세션을 위한 JDBC 영속성이 추가돼 여러 broker 프로세스가 상태를 공유하고 재시작 후에도 세션 소유권을 유지할 수 있다. 또한 runtime 도구는 변경 불가능한 workspace 정책과 함께 bwrap을 통해 라우팅된다. 이는 전날 도입된 sandbox의 직접적인 후속 조치이며, 관련 설정은 여전히 외부에 노출되지 않는다. 같은 날 TypeScript SDK v0.1.14에 이 CLI가 포함됐고 Qwen Code Desktop v0.24.3도 뒤따랐다.
Hugging Face, 코딩 에이전트를 위한 저장소 메모리 relore 공개
9월 21일 — Hugging Face가 코딩 에이전트에 저장소의 기억을 제공하는 도구 relore를 Apache-2.0 라이선스로 공개했다. 출발점은 한 사건이었다. 9월 8일에 열린 Transformers 티켓 #48630에는 이미 두 개의 수정안이 제안된 상태였지만, 회사의 지속적 통합 에이전트는 세 번째 수정안을 작성하려 했다. 정보는 전부 GitHub에 있었지만 티켓, pull request, 출발점인 티켓에서는 보이지 않는 댓글에 흩어져 있었다.
relore는 누가 무엇을 말했는지 기록해 이 이력을 인덱싱한다. 유지관리자의 결정은 기여자의 가설과 같은 가중치를 갖지 않으며, 기계가 생성한 콘텐츠는 기본적으로 제외된다. 작업용 clone은 인덱스와 나란히 유지되고 동일한 HTTP API를 통해 제공되며, 요청은 로컬에서 처리된다. GitHub에 접속하는 것은 수집 단계뿐이다. 명령은 다음과 같이 작동한다. inflight은 티켓을 종결한다고 주장하는 스레드를 나열하고, search --trust authoritative은 회귀의 원인이 된 PR #39847을 찾아냈으며, why는 코드 한 줄에서 출발해 그 주변의 검토 댓글을 찾아낸다. 실제 환경 테스트에서 에이전트는 defs가 파일 전체를 읽는 것보다 더 나은 개요를 token의 5%만으로 제공했다고 보고했다.
Perplexity, 사용자 오류로 Computer를 사후 훈련하고 동영상 기능 추가
9월 21일 — Perplexity Research가 자사 에이전트 Computer를 구동하는 모델을 실제 사용자 세션으로 사후 훈련하는 방법을 상세히 공개했다. 해당 모델이 GLM 5.2라는 사실도 이 글에서 함께 드러났다. 합성 환경은 통제하기 쉽고 검증하기 쉬운 작업을 만들지만, 실제 세션은 합성 환경에서 얻을 수 없는 두 가지 신호, 즉 사용자의 수정과 도구가 반환한 오류를 제공한다. 개인 데이터가 포함된 세션과 훈련을 거부한 사용자의 세션은 표본 추출 전에 제외된다.
그런 다음 각 턴에는 세 가지 처리 방식 중 하나가 적용된다. 성공한 세션에서 오류가 없는 턴에는 교차 엔트로피 모방을, 유효한 힌트가 있는 오류 턴에는 Kullback-Leibler 발산을 통한 교정을 적용하며, 나머지는 단순히 context에 유지한다. 동일한 가중치 집합이 교사와 학생 역할을 모두 하지만 힌트는 교사만 볼 수 있다. 자동 심사기 세 개가 원인으로 추정되는 턴을 제안하고 그중 최소 두 개가 같은 결론에 도달해야 한다. 불만이 제기되기 직전의 마지막 턴이 실제 원인인 경우는 약 절반뿐이기 때문이다.
| 도구 오류율 | 측정값 |
|---|---|
| 오프라인, 원본 GLM 5.2 | 2,79 % |
| 오프라인, 거부 표본 추출만 적용 | 1,35 % |
| 오프라인, 자기 증류 적용 | 0,87 % |
| 온라인, 두 checkpoint 사이 | 2,24 %에서 1,77 %로, 상대적으로 21,2 % 감소 |
저자들은 이 수치가 입증하지 못하는 부분을 명확히 밝힌다. 오프라인에서 비교한 checkpoint들은 동일한 데이터로 훈련되지 않았고, 작업별 결과는 엇갈리며, 사용자 불만족도 역시 유의미하게 변하지 않았다. 각 실험군에 약 10만 명이 참여한 A/B 테스트에서 2,58 %와 2,54 %였다.
같은 날 Computer에는 동영상 생성 기능도 추가됐다. 두 외부 모델인 MiniMax H3와 ByteDance Seedance 2.5가 이를 담당한다. 캠페인 영상, 제품 시연, 소셜 미디어용 시각 자료 등 완성된 동영상이 같은 요청으로 생성된 텍스트 및 이미지와 동일한 스레드에 제공된다. Pro와 Max 구독자가 이용할 수 있으며, 무료 접근이나 API 제공에 대한 언급은 없다.
🔗 실제 환경의 실수로부터 학습하기 🔗 Perplexity Computer와 동영상 모델
Gemini Notebook, Live Chat과 Interactive Learning Overviews 전면 확대
9월 21일 — Gemini Notebook이 같은 날 두 단계의 배포 이정표를 넘었다. Live Chat은 모바일 Ultra 구독자에게 100% 배포됐다. 최신 Google 오디오 모델을 기반으로 약 100개 언어로 notebook과 실시간 음성 대화를 나눌 수 있으며, 거의 완전히 손을 쓰지 않고 단계별 안내를 받을 수 있다. 몇 시간 뒤 Interactive Learning Overviews도 점진적 배포를 마치고 구독 조건 없이 모든 사용자에게 제공되기 시작했다. Reports 아래에 위치한 이 기능은 출처 요약과 studio 산출물을 하나의 대화형 공간에 모은다.
두 기능은 새로운 학습 도구 발표가 있었던 9월 15일에 처음 공개됐다. 21일의 게시물에는 새로운 기능이 추가되지 않았다. 첫 번째 기능은 완전한 배포를, 두 번째 기능은 모든 사용자에 대한 개방을 공식화했을 뿐이다.
🔗 Live Chat 100% 배포 🔗 모든 사용자에게 개방된 Interactive Learning Overviews
Google.org, 교사 AI 교육에 400만 달러 지원
9월 21일 — Google.org가 뉴욕에서 열린 유엔 총회를 계기로 Digital Promise에 400만 달러를 지원한다고 발표했다. 이 지원은 올해 앞서 발표된 무료 교육 프로그램 Google AI Educator Series를 확대한다. 이 프로그램은 미국의 초·중등 및 고등교육 교사 600만 명을 대상으로 한다. ISTE와 함께 교사가 다른 교사를 교육하는 방식으로 설계됐으며, 특정 제품이 아니라 도구 간에 전이할 수 있는 역량에 초점을 맞춘다. 디지털 배지로 인증되는 자기 주도형 모듈로 학습할 수 있다.
Digital Promise는 세 가지 영역에서 참여한다. 주 교육기관과 교육구에 맞게 교육을 조정하고, 학부 단계 교사를 위해 community college 네트워크와 협력하며, 고등교육 교사에게 실제로 도움이 되는 요소가 무엇인지 2년에 걸쳐 연구한다. 연구 결과는 무료 공개 안내서로 출간될 예정이다.
Runway, Workflows를 compositing·투명도·depth map으로 확장
9월 21일 — Runway가 애플리케이션에서 구성할 수 있는 연속 작업 기능인 Workflows에 후반 제작용 블록 다섯 가지를 추가했다. Compositing, Alpha, HDR, Depth Map, RGB Depth다. 발표의 요지는 한 문장으로 정리된다. 단계 사이에 다른 도구로 이동하지 않고 한곳에서 제작 공정(pipeline)의 더 많은 부분을 구축할 수 있다는 것이다. compositing과 alpha channel 관리는 여러 이미지 layer를 결합하는 데 쓰이며, 두 형태의 depth map은 카메라와의 거리에 따라 달라지는 효과를 제어하는 기하학적 신호로 활용된다. 발표는 31초 분량의 시연과 함께 X에서 이뤄졌으며, 확인 당시 Runway 뉴스 페이지에는 이에 대응하는 게시물이 없었다.
NVIDIA, AI 공장의 전력 공급과 냉각을 인증하는 DSX Ready 공개
9월 21일 — NVIDIA가 AI 공장을 위한 자사 DSX 참조 architecture의 요구사항에 따라 협력사 제품을 인증하는 프로그램 DSX Ready를 공개했다. 출발점은 현실적이다. 오늘날 전력 공급, 냉각, 용수, 부지, 전력망이 건설업체가 실제로 배포할 수 있는 규모를 좌우하며, 전체 설계와 잘 맞지 않는 장비로는 연산 용량을 유용한 생산 성과로 전환할 수 없다.
| 인증 부문 | 출시 협력사 | 인증 절차 |
|---|---|---|
| battery 기반 에너지 저장 | Hitachi Energy, LG Energy Solution, Tesla | 협력사 테스트, NVIDIA 검토 및 승인 |
| 냉각 분배 장치 | LG Electronics, LiquidStack, Vertiv | 자체 인증 절차 |
NVIDIA는 이 인증의 의미에 명확한 한계를 둔다. 인증 통과가 현장 단위의 engineering을 대체하지 않으며, 현장의 안정성을 보장하지도 않는다. infrastructure와 software를 아우르는 다른 부문도 점진적으로 추가될 예정이다.
NVIDIA, 에이전트 보안을 계층별 engineering 문제로 다뤄
9월 21일 — NVIDIA가 에이전트 시스템의 보안에 관한 입장을 발표했다. 보안은 engineering 문제이므로 명확히 정의된 요구사항, 적용 가능한 통제, 지정된 책임자, 보호 조치가 제대로 작동한다는 증거가 필요하다는 것이다. stack은 세 계층으로 나뉜다. 모델은 역량을 제공하고, harness는 context와 도구, workflow를 구성하며, 실행 환경은 작업이 이뤄지는 infrastructure를 제공한다. 각 계층에는 고유한 통제가 적용된다.
제시된 사례는 이해하기 쉽다. 한 에이전트가 고객 기록을 업데이트하다가 첨부 문서에서 악의적인 지시를 발견하고, 승인되지 않은 대상으로 데이터를 내보내려 한다. 이때 NVIDIA가 요구하는 것은 전송을 차단하는 네트워크 정책과 시도된 도구 호출, 권한 결정, 결과를 보존하는 보호된 로그다. 기록을 업데이트할 권한이 데이터를 내보낼 권한까지 포함하는 것은 아니며, 에이전트는 접근 권한을 요청할 수는 있어도 스스로 부여할 수는 없다. 도구 측면에서는 OpenShell이 에이전트의 손이 닿지 않는 곳에서 정책을 적용하고, Cisco는 그 위에 DefenseClaw를 배치하며, JFrog는 에이전트가 접근하는 skill을 검증한다.
같은 날 두 번째 게시물은 동일한 논리를 물리 AI에 적용하고 이를 Halos 기반과 연결했다. 이 내용은 두 가지 시장 전망과 함께 아래 단신에 포함돼 있다.
Earth-2, 지역 관측 자료를 동화해 기상 예보 갱신
9월 21일 — NVIDIA가 자체 측정 자료를 이미 보유한 산업 분야를 위한 Earth-2의 AI 기반 데이터 동화 도구 튜토리얼을 공개했다. 대상은 풍력·태양광 발전소, 지역 radar와 sensor, 위성 관측 자료 등이다. 첫 번째 기법인 SDA는 CorrDiff와 StormCast 같은 diffusion 모델에 적용된다. 각 노이즈 제거 단계에서 중간 결과를 관측값과 비교하고 다음 단계를 유도하며, 재훈련은 필요하지 않다.
| 측정 기법 | 범위와 해상도 | 사례에서 보고된 개선 효과 |
|---|---|---|
| CorrDiff-SDA | 유럽, 0,25도에서 2,2 km로 | 제외된 관측소에서 풍속 RMSE 54 % 감소 |
| StormCast-SDA | 미국 본토, 3 km, HRRR로 초기화 | 6개 time step에서 풍속 RMSE 7,2 % 감소 |
| HealDA | 전 지구, 1도 HEALPix grid | 전 지구 대기 상태를 몇 초 만에 추정 |
가장 큰 이점은 운영 측면에 있다. 수치 분석은 상당한 연산 시간을 요구하고 정해진 시각에만 나오지만, SDA는 관측 자료를 지속적으로 통합해 현재 시각과의 간극을 메운다. HealDA는 각 데이터 흐름을 시공간상의 point cloud로 처리하고, 이를 목표 grid에 집계한 뒤 vision transformer 유형의 backbone network에 전달한다.
Multiverse Computing, Ising glass처럼 block을 가지치기해 MMLU 23점 향상
9월 21일 — transformer block 전체를 제거하는 것은 대규모 언어 모델을 가속하는 가장 저렴한 방법 중 하나이자 가장 과격한 방법 중 하나다. 모델의 길이가 말 그대로 짧아지지만, 잘못된 block을 제거하면 성능이 무너진다. Multiverse Computing은 질문 자체가 잘못됐다고 주장한다. 기존 방식은 magnitude, sensitivity, block influence를 기준으로 각 block을 개별 평가한다. 저자들은 이를 mean field 접근법이라고 부르지만, 실제로 block 하나를 제거했을 때의 효과는 동시에 제거되는 다른 block에 따라 달라진다.
따라서 선택 과정은 제약 조건이 있는 binary optimization 문제로 바뀌며, 이를 Ising glass에 투영한다. 이는 모든 요소가 서로 상호작용하고 위쪽을 향한 spin의 수가 고정된 무질서한 spin 시스템이다. 실용적 이점은 한 문장으로 요약된다. 이 시스템의 energy는 가지치기된 모델이 얻을 score를 저렴하게 근사하므로, benchmark에서 단 하나도 직접 평가하지 않고도 매우 많은 후보 구성을 순위화할 수 있다. 저자들은 Llama-3.3-70B-Instruct를 50 % 압축했을 때 가장 우수한 경쟁 방식보다 MMLU가 약 23 percentage point 높았다고 주장한다.
단신
NVIDIA는 9월 21일에 게시물과 메시지 7건을 공개했다. 이 중 3건은 위에서 다뤘고, 기술 발표가 없는 나머지 4건은 여기에 정리한다.
- NVIDIA, 물리적 AI의 모든 계층에 보안 필요성 강조 — ABI Research가 전망한 2035년까지 설치될 레벨 3~5 자율주행차 4,900만 대와 Omdia가 전망한 2026년부터 2035년까지 배치될 산업용 로봇 약 6,000만 대라는 두 가지 시장 예측을 근거로 한 입장문이다. 여기서 네 가지 보안 요구사항을 NVIDIA Halos 기반에 연결한다. 🔗 출처
- NVIDIA, 이집트 AI 생태계의 규모 확대 조명 — EMEA 부사장 Paolo Guglielmini의 개회사와 함께 Grand Egyptian Museum에서 열린 리셉션이다. 도입부는 특히 남아프리카공화국, 모로코, 나이지리아에서 AI 팩토리가 가동되기 시작했다고 전한다. 🔗 출처
- NVIDIA, 저탄소 에너지에 AI를 적용하는 기업 5곳 소개 — New York Climate Week를 맞아 핵융합 가속부터 재활용된 전기차 배터리의 재사용까지 조망한 내용이다. ThinkLabs AI는 전력망 연결 소요 시간을 단축하기 위해 CUDA에서 디지털 트윈과 에이전트를 구축한다. 🔗 출처
- NVIDIA, GTC Berlin Golden Tickets 수상자 발표 — 2026년 10월 20일부터 22일까지 열리는 콘퍼런스를 위해 심사위원단이 선정한 수상자 6명이다. 기술적인 내용은 없다. 🔗 출처
- Qwen-Image-2.1, 출시 첫날부터 vLLM, SGLang, ComfyUI, Hugging Face에서 제공 — SGLang-Diffusion은 CPU 오프로딩을 사용해 24GB RTX 4090 한 대에서 모델을 구동하며, 1024×1024 이미지를 18.7초 만에 생성하고 22.7GiB를 점유한다. vLLM은 이 모델을 Qwen3-VL-8B와 결합된 71억 매개변수 규모의 diffusion transformer로 설명한다. 🔗 출처
- OpenAI Academy, 교육 과정 4개 추가 — Build with AI, Lead AI Adoption, AI for Educators, AI for College Students가 Apply AI at Work에 합류한다. 각 과정은 배지를 부여하는 평가로 마무리되며, 개발자 과정은 Codex 운용과 API 기반 구축을 구분한다. 🔗 출처
- Runway, San Francisco에서 API 해커톤 개최 — Runway AI Summit과 함께 9월 30일 Masonic에서 하루 동안 열리며, 발표 자료나 승인 절차 없이 에이전트, 애플리케이션 또는 창의적인 워크플로를 구축한다. 🔗 출처
- HeyGen, Google DeepMind 및 Kaggle과 구축한 벤치마크 Code2Video 조명 — 이 평가는 코드 작성과는 별개의 질문, 즉 해당 코드가 볼 만한 영상을 만들어 내는지를 측정한다. 코드 생성을 기반으로 하는 에이전트형 영상 스택 관련 게시물의 댓글로 공개됐다. 🔗 출처
- Suno, 간단한 설명만으로 적용하는 음향 효과 시연 — 따뜻한 포화 효과부터 더 실험적인 결과물까지 보여 주는 1분짜리 시연이다. 기능 이름도, 해당 요금제도, 관련 블로그 게시물도 없어 출시라기보다는 제품 소개에 가깝다. 🔗 출처
- Discord에서 Gemini 쇼핑 기능 실시간 시연 — 공식 Discord 서버에서 9월 22일 화요일 오전 11시 PT에 열리는 세션으로, 구매 준비, 선택지 비교, 사진을 활용한 검색을 다룬다. 새로운 기능은 없다. 🔗 출처
- Together AI와 Ollama, 오픈 코드 에이전트 세션 발표 — Ollama의 Parth Sareen과 Together AI의 Zain Hasan이 오픈 모델 기반 코드 에이전트를 프로덕션에 배포하는 방법을 다룰 예정이다. 메시지에는 날짜와 장소가 없다. 🔗 출처
- 중단된 Boris-2 학습 2건, 오픈 가중치로 공개 — 첫 번째 학습은 Muon과 AdamW 그래디언트의 비호환성 때문에 300억 토큰에서 손실이 3.100 아래로 내려가지 않았고, 두 번째 학습은 약 70억 토큰에서 중단됐다. 모델 자체보다 실패담이 더 유익하다. 🔗 출처
- 판정 모델의 방향성 편향을 검증하는 사전 등록 프로토콜 — 가설은 서술형 텍스트에서 오류가 감정의 인코딩보다 감정을 직접 명시하는 쪽으로 치우친다는 것이다. 모든 데이터 수집에 앞서 프로토콜을 공개했으며, 구성개념을 철회하게 만들 결과와 저자가 밝힌 이해상충도 포함한다. 🔗 출처
- 오픈 구성 요소로 재현한 Jev, 0.6점 차이로 실패 — 프로그래밍을 할 줄 모른다고 밝힌 한 사용자가 CPU에서만 작동하는 오픈 스택으로 Jev를 재구축하기 위해 하루 동안의 실험을 Claude Code에 맡겼다. 실패한 접근법은 8개였으며, 그는 이를 성공한 접근법보다 더 유익하다고 평가한다. 🔗 출처
- Jevini, 의사결정의 설계와 실행 분리 — 대형 추론 모델이 형식이 지정된 판단의 버전 관리 그래프를 설계하고, 소형 의사결정 모델이 새로운 상황마다 이를 실행한다. 공급업체의 홍보성 콘텐츠이므로 그에 맞게 받아들여야 한다. 🔗 출처
- Cohere, 제품 발표 없이 브랜드 홍보 이어가 — 9월 20일 게시물은 공동 창업자 Aidan Gomez의 의도로 소개된 내용을 재구성하며 AI for Empowerment 캠페인을 이어가고, 21일의 이미지 2장은 Waterloo에서 열린 학생 해커톤 Hack The North에 참가하게 된 회사의 여정을 전한다. 모델도, 기능도, 가격도 없다. 🔗 캠페인 · 🔗 해커톤
이것이 의미하는 바
출시 당일 제공이 배포의 표준이 되고 있다. Grok 4.7은 기다리지 않는다. 발표 당일부터 Cursor와 GitHub Copilot에서 사용할 수 있으며, Qwen-Image-2.1도 출시 직후 vLLM, SGLang, ComfyUI, Hugging Face에서 제공됐다. 모델 공개부터 일상적인 도구에서 사용할 수 있기까지 몇 주씩 걸리던 지연 시간은 0에 가까워지고 있다. Cursor에서는 8월 14일부터 편집기와 연구소가 같은 그룹에 속하게 됐기 때문이고, 다른 곳에서는 발표 전에 통합을 준비하기 때문이다. 이제 흥미로운 질문은 모델이 언제 도착하느냐가 아니라, 도착한 뒤 비용이 얼마나 드느냐다.
Copilot의 과금 방식이 바꾸는 지점이 바로 이것이다. Grok 4.7은 요청 승수 체계에서 벗어나 xAI의 공개 요금에 따라 사용량 기준으로 과금된다. 신규 모델 자동 활성화와 결합하면 비용 관련 결정이 플랫폼 관리 영역으로 넘어간다. 아무 조치도 하지 않는 것은 제3자 공급업체의 요금표에 연동된 지출 항목을 열어 두는 것과 같다. xAI 측의 논리도 대칭적이다. 입력 요금은 Grok 4.6과 동일한 2달러이고 Terminal-Bench에서 실질적인 성능 향상을 이뤘지만, 장시간 코드 작업에서는 Fable 5.1에 뒤진다. 여기서 판매하는 것은 1위라는 지위가 아니라 가격 대비 성능이다.
에이전트 분야에서는 서로 동떨어진 세 가지 발표가 같은 전환을 보여 준다. 실행 환경이 더 이상 블랙박스가 아닌 것이다. devin ssh는 에이전트의 가상 머신을 대화형 세션에 개방하고, relore는 현재 코드 상태뿐 아니라 저장소의 과거 결정에 대한 기억을 에이전트에 제공한다. Perplexity는 사용자 환경에서 실패했던 정확한 대화 차례를 활용해 모델을 사후 학습하며, Qwen Code는 bwrap을 통해 도구를 라우팅한다. NVIDIA는 에이전트 보안이 에이전트의 손이 닿지 않는 곳에서 계층별로 이루어져야 하고, 로그가 증거 역할을 해야 한다고 주장하며 이러한 움직임에 이론적 틀을 제공한다. 검사 가능한 에이전트와 제약을 받는 에이전트는 같은 필요의 양면이다.
OpenAI의 발표가 제기하면서도 다루지 않은 질문은 여전히 남아 있다. 한 달도 되지 않아 100개가 넘는 미해결 문제를 푼 내부 모델에 대해 나온 제도적 대응은 독립적이고 무보수이며 자유롭게 의견을 낼 수 있는 자문단이었다. 그러나 그 임무에서는 내부 발전의 속도, 즉 Fields Medal 수상자 27명이 항의한 바로 그 사안을 명시적으로 제외했다. 이날의 다른 소식들과 비교하면 시사하는 바가 크다. 놀라운 성과가 나오는 속도를 논의하는 동안, 한 tokenization 라이브러리는 동일한 ID를 보장하면서 3배에서 30배의 성능 향상을 이루고, 한 압축 기법은 spin glass에서 착안해 압축률 50%에서 MMLU 점수를 23점 높인다. 이런 작업은 제목을 장식하지 못하지만, 내일의 추론 비용을 결정하는 것은 바로 이런 작업이다.
출처
- Grok 4.7 — xAI
- X의 @SpaceXAI, Grok 4.7 발표
- 이제 GitHub Copilot에서 Grok 4.7 사용 가능
- 수학 및 인공지능 자문단
- 수학 분야 AI의 심각한 불일치
- Googlebook 사전 주문
- X의 ElevenLabs, Studio 4.0
- X의 ElevenLabs, Studio Agent
- tokenizers v1: 측정된 인코딩, 디코딩 및 확장성
- 터미널에서 사용하는 Devin Cloud
- X의 Cognition, devin ssh
- Qwen Code v0.24.3 릴리스 노트
- relore, 코딩 에이전트를 위한 저장소 메모리
- 현실 세계의 실수에서 학습하기
- X의 Perplexity, Computer의 영상 모델
- X의 Gemini Notebook, Live Chat
- X의 Gemini Notebook, Interactive Learning Overviews
- Google.org와 Digital Promise
- X의 Runway, 확장된 Workflows
- NVIDIA DSX Ready
- 에이전트 스택 보안
- NVIDIA, 물리적 AI 보안과 Halos 기반
- Earth-2의 데이터 동화
- 물리학자처럼 LLM 가지치기
- NVIDIA, 이집트 AI 생태계
- NVIDIA, 기업 5곳과 저탄소 에너지
- X의 NVIDIA AI, GTC Berlin Golden Tickets
- X의 Alibaba Qwen, Qwen-Image-2.1 지원
- 새로운 학습 과정으로 확장되는 OpenAI Academy
- X의 Runway, API 해커톤
- X의 HeyGen, Code2Video 벤치마크
- X의 Suno, 자연어로 설명한 음향 효과
- X의 Gemini App, 쇼핑 기능 시연
- X의 Together AI, Ollama와 함께하는 세션
- Boris-2-0907 및 Boris-2-0917
- 요약 편향: LLM 판정 모델의 방향성 실패에 대한 사전 등록 검증
- 오픈 CPU 전용 스택과 Jev를 벤치마크한 결과
- 의사결정 회로 엔지니어링
- X의 Cohere, AI for Empowerment 캠페인
- X의 Cohere, Hack The North