검색

Runway, 코드 없이 인터페이스를 생성하는 모델 Solaris 공개, ChatGPT Ads 연간 환산 매출 10억 달러 달성, Together AI 사우디아라비아에서 250 MW 계약 체결

인공지능으로 생성된 기사
Runway, 코드 없이 인터페이스를 생성하는 모델 Solaris 공개, ChatGPT Ads 연간 환산 매출 10억 달러 달성, Together AI 사우디아라비아에서 250 MW 계약 체결

ai-powered-markdown-translator

gpt-5.6-sol을 사용하여 프랑스어에서 한국어로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

8월 30일과 31일에 발표된 소식은 모두 18건이며, 날짜별 분포는 매우 불균형하다. 일요일에는 공식 발표가 전혀 없었고, 거의 모든 내용이 월요일에 공개됐다. 30일 자 기사에서 언급한 X 장애 이후 당시 접근할 수 없었던 계정들을 사흘 치에 걸쳐 다시 확인했지만, 누락된 발표는 발견되지 않았다.

세 가지 흐름이 두드러진다. 먼저 Runway가 세계 최초의 인터페이스 월드 모델이라는 새로운 유형의 모델을 선보였다. 이어 OpenAI의 광고 사업이 연간 환산 매출 10억 달러를 달성했고 Together AI가 250 MW 규모의 인프라 계약을 체결하는 등 두 가지 경제적 이정표가 세워졌다. 마지막으로 GitHub, NVIDIA, Amp를 중심으로 개발자 도구의 새로운 주기가 나타났으며, Hugging Face 커뮤니티 블로그에 공개된 연구 세 편이 이를 보완했다.


Runway, 최초의 인터페이스 월드 모델 Solaris 공개

8월 31일 — Runway가 연구소에서 인터페이스 월드 모델(Interface World Models)이라고 부르는 모델 계열의 첫 제품 Solaris를 공개했다. 원리는 한 문장으로 요약된다. 나중에 인터페이스를 표시할 코드를 생성하는 대신, 모델이 인터페이스를 프레임별로 직접 생성하고 클릭과 드래그 앤드 드롭에 실시간으로 반응한다.

이러한 발상은 소프트웨어 제작 과정에 관한 관찰에서 출발한다. 모형은 무언가를 수행하기 전에 먼저 코드로 변환되어야 하며, 이 변환에는 두 가지 대가가 따른다. 모든 동작을 미리 정의해야 하므로 첫 사용자가 등장하기도 전에 소프트웨어가 고정되고, 원래 설계의 풍부한 시각적 표현도 변환 과정에서 손실된다. Solaris는 중간 단계를 제거해 이미지 전체를 인터페이스로 만든다.

기술적으로 이 모델은 Runway의 동영상 모델 Gen-4.5를 기반으로 하며, 범용 월드 모델 GWM-1을 확장한다. 사용자의 입력은 텍스트나 이미지와 마찬가지로 다음 프레임을 조건화하므로, 어떠한 동작도 프로그래밍하지 않은 상태에서 행동과 그에 따른 시각적 결과의 관계를 학습한다. 실시간 처리를 구현하려면 세 단계가 필요했다. 생성을 프레임별 자기회귀 방식으로 전환하고, 다단계 노이즈 제거를 몇 단계로 증류한 뒤, 빠른 모델을 자체 출력으로 학습했다. LLM이 장면의 전개를 결정하는 동안 월드 모델이 렌더링을 수행한다.

참가자가 평가한 기준Solaris코드로 구현한 인터페이스(Claude Opus 5)동등하다는 평가
요청한 지시의 준수61 %24 %13 %
장면 속 동작의 자연스러움71 %21 %6 %
기술적 특성측정값
기반 모델GWM-1을 확장한 Gen-4.5
지원 해상도720p
상호작용 기준약 0.5초의 지연 시간
사용자 연구참가자 250명, 예시 30개, 약 7,500건의 쌍대 비교 평가
재구성 Benchmark인터페이스 30개, 구조적 유사도(SSIM) 및 DINOv3 디스크립터

단순한 지시 준수보다 동작의 자연스러움에서 격차가 훨씬 크게 나타났으며, Runway는 이를 두 접근 방식 사이의 근본적인 차이로 해석한다. 코드로 구현한 인터페이스도 요청한 변경 사항을 재현하는 경우가 많지만 이를 별개의 업데이트로 처리하는 반면, 객체의 동작을 학습한 모델은 나머지 장면과 일관된 반응을 생성한다. 연구소는 조금 더 예상 밖인 두 번째 용도도 제시한다. 지속적으로 재생성되는 환경이 에이전트에게 한 번도 존재한 적 없는 배치를 포함해 끊임없이 변화하는 인터페이스를 제공하는 에이전트 학습이다.

Runway는 Solaris가 아직 하지 못하는 일도 상세히 설명하며, 그 목록은 상당하다. 안정적이고 읽기 쉬운 텍스트는 여전히 동영상 생성에서 가장 어려운 문제 중 하나인 반면 인터페이스는 다른 어떤 분야보다 텍스트에 크게 의존한다. 사실에 근거한 결과를 내려면 검증된 데이터로 생성을 조건화해야 하며, 장시간 세션의 일관성도 여전히 연구 과제다. 생성된 인터페이스가 보조 기술 및 접근성 API와 연동되도록 만드는 작업도 남아 있다. 협력사들과 공개 출시를 준비 중이며, 조기 접근은 양식을 통해 신청할 수 있다.

Today, we’re sharing new research on Solaris, our first Interface World Model. Solaris is a new kind of operating system that generates interactive interfaces frame by frame, in real time, with no code.

🇰🇷 오늘 저희는 최초의 Interface World Model인 Solaris에 관한 새로운 연구 결과를 공유합니다. Solaris는 코드 없이 실시간으로 대화형 인터페이스를 프레임별로 생성하는 새로운 유형의 운영체제입니다.@runwayml의 X 게시물

🔗 Runway — Solaris 소개


ChatGPT Ads, 연간 환산 매출 10억 달러 달성 및 네 개 신규 지역에서 셀프서비스 개방

8월 31일 — OpenAI가 ChatGPT에 통합된 광고 플랫폼 ChatGPT Ads에 관한 게시물을 공개하고, 출시 후 200일도 되지 않아 연간 환산 매출(annualized revenue run rate) 10억 달러를 달성했다고 발표했다. 여기서 중요한 차이를 먼저 짚어야 한다. 실제로 10억 달러를 벌었다는 뜻이 아니라 최근 기간의 매출을 12개월 기준으로 환산한 수치다. 설립된 지 200일도 되지 않은 광고 플랫폼은 구조상 이 속도로 1년 치 매출을 올릴 수 없다. Ads Manager를 통한 셀프서비스 구매는 이날 늦게 인도, 유럽, 중동, 북아프리카로 확대될 예정이다.

OpenAI는 광고를 일반 소비자용 구독, 기업용 상품, 사용량 기반 API와 함께 사업 모델의 핵심 축 중 하나로 설명하며, 매주 10억 명이 넘는 활성 사용자가 ChatGPT를 이용할 수 있게 해주는 무료 등급의 재원과 광고를 명시적으로 연결한다. 이 체계에는 네 가지 원칙이 적용된다. 광고는 항상 명확하게 표시되고 답변과 분리되며, 광고가 제공되는 답변에 영향을 주지 않고, 광고주는 비공개 대화에 접근할 수 없으며, 사용자가 광고 경험의 개인화 수준을 제어한다.

OpenAI가 공개한 지표발표된 수치
연간 환산 매출 속도(추정치)10억 달러
출시 이후 경과 기간200일 미만
플랫폼 광고주수만 곳
기존 지원 국가40개국 이상
셀프서비스가 개방되는 신규 시장인도, 유럽, 중동, 북아프리카
기술 및 측정 협력사50곳 이상
ChatGPT 주간 활성 사용자10억 명 이상
28일 기준 광고비 수익률 사례전자상거래 광고주 한 곳에서 3배
신규 고객에게서 발생한 광고 트래픽기술 협력사 한 곳에서 80 % 이상

OpenAI가 설명한 발전 경로는 관리형 판매에서 누구나 접근할 수 있는 플랫폼으로의 전환이다. 초기 모델은 대행사와 협력사를 중심으로 운영됐으나, 5월 Ads Manager가 출시되면서 광고 플랫폼이 중소기업에 개방됐고 이제 이들이 사업에서 상당한 비중을 차지한다. 도구 측면에서는 CPC 입찰과 결과 최적화 입찰(outcome-optimized bidding)이 캠페인의 대부분을 차지하며, Pixel과 Conversions API가 측정의 기반으로 사용된다. OpenAI는 미국 외 지역의 광고주가 차지하는 매출 비중도 증가하고 있다고 밝혔다.

앞으로 회사는 새로운 시장, 형식, 목표, 구매 옵션을 출시할 예정이며, 기업이 ChatGPT 안에서 소비자와 더욱 자연스럽게 소통할 방법을 모색하겠다고 밝혔다. 이는 현재 광고보다 대화에서 덜 분리된 형식을 뜻한다.

🔗 OpenAI — AI 접근성 확대의 이정표


Together AI: 사우디아라비아에서 250 MW 확보, GLM-5.3 에이전트 지수 공동 1위 및 신규 고객 유치

8월 31일 — Together AI가 HUMAIN과 함께 건설하는 사우디아라비아의 250 MW 규모 데이터 센터 인프라 계약 체결을 발표했다. 연구소는 이 센터의 운영으로 연간 50억 달러의 매출을 기대하며, 이 계약을 오픈 소스를 위해 체결된 최대 규모의 AI 인프라 계약 중 하나라고 설명한다. 이 게시물은 연구소 계정 상단에 고정돼 있어 평소 모델 중심의 홍보와 차이를 보인다.

발표문이 동사 없이 세 문장을 나열해 50억 달러의 주체를 모호하게 만들기 때문에 이 수치는 주의해서 해석해야 한다. New York Times의 보도가 이를 분명히 한다. 이 금액은 회사가 아니라 해당 데이터 센터에서 기대되는 매출을 의미한다. 같은 기사에서 2026년 7월 Together AI의 기업 가치가 83억 달러였다고 전한 점을 보더라도 그 규모를 확인할 수 있다. 이 정도 가치로 평가받는 회사가 연간 50억 달러의 매출을 올리는 것은 아니다.

계약 구조 자체도 주목할 만하다. 이는 컴퓨팅 용량을 구매하는 계약이 아니기 때문이다. 역시 New York Times에 따르면 HUMAIN은 250 MW와 더불어 반도체 120,000개를 제공하고, Together AI는 그 칩을 운용하면서 그 대가로 매출 일부를 지급한다. 따라서 연구소는 인프라에 자금을 대는 대신 매출의 일부를 제공하고 이를 이용한다. 이는 해당 글에서 모든 회사가 자체적으로 수십억 달러를 조달하는 경쟁과 컴퓨팅 자원을 확보하게 해주는 협력 관계를 대비하며 주장한 내용과 정확히 일치한다. 지난해 무함마드 빈 살만 왕세자의 주도로 설립된 HUMAIN은 AI 산업을 구축하고 석유에 대한 국가 의존도를 줄이려는 사우디아라비아의 노력에 속한다.

게시물에서 전개한 주장의 초점은 규모보다 병목 현상의 성격에 맞춰져 있다. Together AI는 에너지를 현재의 실질적인 병목 현상으로 묘사하며, 이번 계약을 자사 규모의 기업이 자체 재무 구조만으로는 조달할 수 없는 수준의 자원에 접근하는 수단으로 설명한다. 연구소는 이 구조를 오랫동안 Hyperscaler가 인프라에 자금을 지원해 온 폐쇄형 연구소의 모델과 명시적으로 대비한다.

이러한 해석은 생태계에서 Together AI가 차지하는 독특한 위치를 보여준다. 이 연구소는 Frontier Model을 공개하지 않고 DeepSeek, GLM, Kimi, MiniMax, Nemotron 등 다른 곳의 모델을 제공한다. 따라서 제약 요인은 연구가 아니라 개방형 가중치 모델을 독점 API보다 낮은 가격에 제공하는 데 필요한 가용 컴퓨팅 용량이다. 250 MW 계약은 이 문제를 직접 해결한다.

계약 요소보고된 수치
데이터 센터 용량250 MW
HUMAIN이 제공하는 반도체120,000
데이터 센터의 예상 연간 매출50억 달러
HUMAIN에 지급하는 대가Together AI 매출의 일부
2026년 7월 Together AI의 기업 가치83억 달러
산업 협력사HUMAIN
위치사우디아라비아
발표 날짜 및 시각2026년 8월 31일 13:26 UTC

Together AI가 게시물에서 언급하지 않은 마지막 사항도 있다. 같은 기사에서는 사우디아라비아에 시설을 설치함으로써 미국에서 데이터 센터 건설을 추진할 때 마주치는 반발에서 벗어날 수 있다고 지적한다.

We just signed one of the largest AI infrastructure deals for open source, period. 250MW data center. $5B+ in annualized revenue. Built with @HUMAIN in Saudi Arabia.

🇰🇷 저희는 방금 오픈 소스를 위한 역대 최대 규모의 AI 인프라 계약 중 하나를 체결했습니다. 이견의 여지가 없습니다. 250 MW 규모의 데이터 센터입니다. 연간 환산 매출은 50억 달러가 넘습니다. 사우디아라비아에서 @HUMAIN과 함께 건설합니다.@togethercompute의 X 게시물

GLM-5.3, Artificial Analysis 에이전트 지수 공동 1위 달성

8월 31일 — GLM-5.3이 뉴스에 등장한 지 엿새째다. Z.ai가 8월 28일 가중치를 공개하고 29일 Together AI의 Serverless API에 모델이 출시된 데 이어, 이번에는 외부 순위에서 두각을 나타냈다. 이 모델은 Artificial Analysis 에이전트 지수에서 59점을 기록했다. Together AI는 결과를 정확히 표현했다. GLM-5.3은 공동 1위(ties for the top spot)에 올랐으며 GPT-5.6 Sol과 Claude Fable 5를 앞섰다(beating). 따라서 이 두 모델보다 높은 점수를 기록한 것이며, 역시 59점을 받은 Claude Opus 5와는 공동 선두다.

가장 시사적인 부분은 방법론이다. Z.ai는 새로운 기반 모델을 학습하지 않았다. GLM-5.2 기반을 유지하면서 장기 환경의 수 확대, 과제 다양성 증대, RL에 투입하는 Compute 확대라는 세 축을 동시에 확장한 사후 학습만으로 모든 성능 향상을 이뤘다.

평가 모델에이전트 지수 점수
GLM-5.3 (max)59
Claude Opus 5 (max)59
GLM-5.3 Flash58
GPT-5.6 Sol (max)58
Claude Fable 5 (Fallback 포함)57

🔗 @togethercompute의 게시물

Greptile, Together AI를 주요 추론 제공업체로 선정

8월 31일 — 이날의 마지막 소식은 비교적 규모가 작다. 11,000개가 넘는 팀에서 사용하는 AI 코드 검토 도구 Greptile이 Together AI를 주요 추론 제공업체로 선정했다. 이 도구는 저장소의 전체 맥락을 바탕으로 Pull Request를 분석하며, 긴 Context와 대량의 Token으로 구성된 작업 부하 특성을 지닌다. 개방형 가중치 모델과 독점 API 사이의 비용 차이가 결정적인 영향을 미치는 바로 그런 용도다.

🔗 @togethercompute의 게시물


VS Code의 GitHub Copilot: 8월의 네 가지 버전을 하나의 변경 로그로 요약

8월 31일 — GitHub가 v1.132부터 v1.135까지 네 가지 편집기 버전을 아우르는 Visual Studio Code용 Copilot의 2026년 8월 요약을 공개했다. 이번 주기의 핵심은 여러 에이전트를 활용한 작업 구성이다. Agents 창은 단순한 대화 목록을 넘어, 여러 세션이 공존하고 이전 상태 그대로 복원되는 공간으로 바뀐다.

세션 측면에서는 채팅을 가로 또는 세로 그룹으로 나란히 배치할 수 있으며, 다시 돌아오면 레이아웃이 복원된다. /btw 명령은 기본 대화가 계속 실행되는 동안 해당 대화의 컨텍스트와 프롬프트 캐시를 공유하는 보조 대화를 연다. 이를 통해 실행 중인 에이전트를 중단하지 않고 부수적인 질문을 할 수 있다. 대화 기록 여백에서 이용할 수 있는 프롬프트 타임라인 컨트롤을 사용하면 특정 프롬프트로 바로 이동하고 그 결과로 발생한 파일 변경 사항을 다시 확인할 수 있다. Agent Host를 통해 여러 VS Code 창을 동일한 세션에 연결할 수 있으며, 실험적 명령인 /rubber-duck은 보완 모델에 요청해 놓친 세부 사항과 경계 사례를 찾아낸다.

두 가지 사항은 편집기 내 Claude의 역할과 직접 관련된다. 실험적 설정을 사용하면 API 키로 Claude가 구성된 경우 GitHub에 로그인하지 않고도 Agents 창을 열 수 있으며, Claude 세션에서는 언제든 Anthropic 구독 모델과 Copilot 구독 모델 사이를 전환할 수 있다. 또한 VS Code는 Agent Plugins 1.0 표준을 준수하고 다른 호환 에이전트 클라이언트에서도 사용할 수 있는 이식형 에이전트 플러그인 설치를 지원한다.

변경 로그 영역주요 신기능
세션 및 워크플로나란히 배치되는 채팅, /btw, 프롬프트 타임라인, Agent Plugins 1.0, /rubber-duck, Agent Host
VS Code의 ClaudeAPI 키를 통한 GitHub 로그인 없는 Agents 창, Anthropic과 Copilot 모델 간 전환
채팅 및 검토대화 기록 검색, 고정 스크롤, 하이브리드 Markdown 편집기, 모델별 토큰
내장 브라우저HTML 요소 일괄 주석, 자동 새로고침, 기본 HTML 편집기
받아쓰기기기 내 다국어 처리, 정리 지침, 셸에 맞춘 정리

마지막으로 채팅에는 길어진 대화에 필요했던 읽기 도구가 추가된다. 대소문자 구분, 단어 단위 및 정규식을 지원하는 전체 대화 기록 텍스트 검색, 현재 프롬프트가 계속 보이도록 유지하는 고정 스크롤, 그리고 응답 하단에 마우스를 올렸을 때 입력·캐시된 입력·출력을 구분해 보여주는 모델별 토큰 사용량 표시가 제공된다. 캐시 여부에 따라 과금이 달라진 이후 특히 유용한 가시성이다. 내장 브라우저에서는 페이지의 여러 HTML 요소를 선택하고 주석을 달아 인터페이스 피드백을 일괄 처리할 수 있다. 받아쓰기는 기기 내에서 여러 언어로 실행되며, 터미널에서 받아쓸 때 말한 문장 부호를 삽입하는 대신 명령 구문을 보존한다.

🔗 GitHub 변경 로그 — VS Code용 Copilot, 2026년 8월 버전


NVIDIA, 생물학과 자율주행차에 자사 소프트웨어 구성 요소 도입

8월 31일 — NVIDIA가 Anthropic과 진행한 통합 작업을 설명하는 튜토리얼을 공개했다. 이제 Anthropic의 과학 연구 작업 공간인 Claude Science에서 BioNeMo Agent Toolkit을 사용할 수 있다. 이 작업이 해결하려는 문제는 전문 도구의 활용이다. 범용 에이전트는 단백질 접힘 작업이 필요하다는 사실을 인식할 수는 있지만, 어떤 모델을 실행해야 하는지, 요청을 어떻게 구성해야 하는지, 어떤 매개변수가 중요한지는 알지 못할 수 있다. 이 툴킷은 생물학, 화학, 유전체학, 신약 개발 분야에서 10년 넘게 축적된 BioNeMo 모델, 라이브러리 및 워크플로를 에이전트가 호출할 수 있는 skills로 패키징한다. NVIDIA는 내부 벤치마크에서 작업 정확도가 60%에서 100%로 상승했고 토큰 효율은 약 두 배가 됐다고 밝혔다.

튜토리얼은 세 가지 NIM 마이크로서비스를 연계한다. 먼저 MSA Search로 진화적 컨텍스트를 구성한 뒤 OpenFold3와 Boltz-2를 사용해 구조를 각각 독립적으로 예측한다. 가장 인상적인 시연은 다중 서열 정렬의 역할을 보여준다. 이 과정이 없으면 두 모델 모두에서 인터페이스 신뢰도가 급락하며, 샘플링 예산을 늘려도 결과는 달라지지 않는다. 두 가지 한계도 짚을 필요가 있다. 하나는 L40S 또는 H100 GPU와 약 700GB의 저장 공간이 필요한 하드웨어 장벽이다. 다른 하나는 해석에 대한 NVIDIA의 신중한 태도로, 신뢰도 점수가 상호작용을 입증하는 것은 아니며 두 독립 모델의 수렴은 강력한 가설이지 증거는 아니라고 강조한다.

인터페이스 신뢰도 측정값(iPTM)OpenFold3Boltz-2
MSA 정렬을 적용한 이종다량체0,850,82
MSA 정렬을 적용하지 않은 이종다량체0,140,19
코어의 Cα RMSD, 단량체 대비 이종다량체0,68 Å0,65 Å

🔗 NVIDIA 튜토리얼 — Claude Science의 BioNeMo NIM

Omniverse NuRec, 아직 존재하지 않는 차량에 인식 스택 적용

8월 31일 — 같은 날 NVIDIA는 자율주행을 다룬 두 번째 기술 튜토리얼을 공개했다. 출발점은 인식 스택이 이를 탑재한 차량에 맞춰 형성된다는 사실이다. SUV용 스택을 세단에 옮기면 센서 위치, 보정, 시야각, 가림 및 차체 형상이 모두 달라지므로 세상을 인식하는 방식도 달라진다. 각 차량 라인마다 실제 데이터 세트를 수집하고 주석을 다는 작업은 비용이 많이 들며, 개발 초기에는 불가능한 경우도 많다.

Omniverse NuRec은 이미 기록된 주행 경로를 재사용하는 방식을 제안한다. 각 장면을 재구성한 뒤 대상 차량의 센서 구성 관점에서 다시 렌더링한다. 그러면 팀은 새로운 카메라 배치에서 시나리오가 어떻게 보일지, 형상 변화로 인해 어디에 사각지대가 생기는지 파악할 수 있다. NVIDIA는 실제 주행 데이터가 성능의 기준을 잡고 검증하는 데 여전히 필수적이라고 명시한다. 합성 데이터는 전용 데이터 세트가 존재하기 전에 모델을 조정하는 데 사용되며, 이를 대체하지는 않는다. 장면은 USDZ 형식으로 Hugging Face에 배포되며 코드 에이전트용 skills 저장소가 함께 제공된다.

🔗 NVIDIA 튜토리얼 — Omniverse NuRec


Amp, 모든 스레드에 음성·영상 통화방 연결

8월 31일 — Amp가 각 스레드에 실시간 대화방을 연결한다. Space to Talk이라는 이 기능은 스레드 자체에 연결된 음성 및 영상 공간을 연다. Enter 키만 누르면 입장해 카메라를 켜고 화면을 공유할 수 있으며, 에이전트는 같은 스레드에서 작업을 계속한다.

강조되는 장점은 중간 단계의 제거이며, 이는 여름부터 Amp가 이어온 협업 방향을 확장한다. 먼저 팀원 간 orb 제어권 공유 기능인 Multiplayer가 7월 22일에 도입됐고, 이어 스레드에서 멘션으로 직접 초대하는 Pass the Orb to the Left Hand Side가 8월 19일에 나왔다. 스레드는 팀과 에이전트가 만나는 단일 거점이 된다. 한편 Amp는 기능 범위가 아직 열려 있다고 밝힌다. 브레인스토밍, 화이트보드, Puck 및 다른 에이전트와의 대화는 향후 방향으로 언급됐을 뿐, 출시된 기능은 아니다.

No links to paste, no calendar invite, no other app. The call lives where the work lives.

🇰🇷 붙여 넣을 링크도, 캘린더 초대도, 다른 애플리케이션도 필요 없습니다. 통화는 작업이 있는 바로 그곳에서 이루어집니다.Amp, Space to Talk 안내


VLANeXt, vision-language-action 모델을 위한 통합 코드베이스

8월 31일 — 한 연구팀이 Hugging Face 블로그에 vision-language-action(VLA) 모델 연구용 코드베이스인 VLANeXt를 공개했다. 이 모델의 원리는 간단하다. vision-language 모델이 로봇이 보는 것과 자연어 지시를 연결한 뒤, 이를 바탕으로 물리적 세계에서 수행할 행동을 도출한다.

해결하려는 문제는 방법론적이다. 이 분야는 빠르게 발전하지만 파편화되고 있다. 논문마다 backbone, policy head, 행동 표현, 학습 전략 및 평가 프로토콜이 달라진다. 뛰어난 결과가 많이 보고되고 있지만, 변수를 분리해 검증하기 어려워 실제로 무엇이 VLA 모델의 성능을 높이는지 판단하기는 여전히 어렵다.

저자들은 또 다른 아키텍처를 추가하는 대신 RT-2 / OpenVLA 유형의 기준 코드베이스에서 출발해 설계 공간을 체계적으로 탐색하고 하나의 구성법을 도출했다. 이 작업은 ICML 논문 「VLANeXt: Recipes for Building Strong VLA Models」로 이어졌다. 이후 코드베이스는 이 연구를 넘어 다양한 크기의 backbone, 잠재 행동 학습, 잠재 공간 예측 모델링 및 세계-행동 모델링까지 확장됐다. VLANeXt-LAM, -S, -L, -XL, -JEPA, -WAM의 여섯 가지 출발점을 제공한다.

🔗 Hugging Face 게시물


단신

  • Claude Code 2.1.252, 수정 사항만 포함된 버전 — 신기능 없이 네 가지 문제를 수정했다. 일부 Mac에서 Bash 명령이 실패하는 문제, .claude/settings.local.json 파일이 없는 프로젝트에서 ‘always allow’ 선택이 저장되지 않는 문제, claude.ai 연결 상태가 좋지 않을 때 도구 실행이 끝난 뒤 Remote Control 세션이 몇 분간 멈추는 문제, 출력량이 많은 백그라운드 작업 알림으로 API 요청 크기 제한을 초과하는 문제다. 🔗 Claude Code CHANGELOG
  • Flow, 데스크톱에서 첫 프레임과 마지막 프레임 제어 기능 제공 — Google Flow는 8월 27일 모델과 함께 소개된 Gemini Omni 1.1 Flash의 첫 프레임 및 마지막 프레임 제어 기능을 이제 데스크톱에서 사용할 수 있다고 밝혔다. 강조된 활용법은 양쪽 끝에 동일한 이미지를 지정해 반복 영상을 만드는 것이다. 🔗 @FlowbyGoogle 게시물
  • Grok Imagine 대회 참가 마지막 날 — xAI는 8월 17일 시작된 영상 대회의 마감일이 당일이라고 알렸다. 참가자는 모델의 영상 및 음성 기능을 부각하는 호메로스의 오디세이 속 장면을 제작해야 했다. 상위 세 작품에는 총 175,000달러가 각각 100,000달러, 50,000달러, 25,000달러로 나뉘어 수여된다. 🔗 @grok 게시물
  • QwenCloud, Arena 마감 및 방콕 세션 발표 — 국경 간 전자상거래용 콘텐츠 생성 에이전트를 주제로 한 Qwen Cloud Arena 챌린지가 800명 넘는 참가자를 기록한 뒤 베이징 시간 자정에 제출을 마감했으며, 검토 단계는 다음 날 시작됐다. 몇 시간 전 QwenCloud는 9월 4일 방콕 Qwen Conference에서 세션을 연다고 발표했다. 홍콩에서 이미 소개한 웹사이트, Skills, CLI의 세 가지 진입점을 동일하게 내세운다. 🔗 Arena 마감 · 🔗 방콕 세션
  • GitHub, 개발자의 접근성 조정에 관한 설문 시작 — GitHub는 장애가 있다고 밝히거나 접근성 도구 사용자라고 여길 것을 요구하지 않으면서, 좋은 환경에서 일할 수 있도록 돕는 도구, 제품 설정 및 개인별 조정 방식을 파악하려 한다. 응답 기한은 9월 30일까지다. AI와는 관련 없는 주제다. 🔗 @github 게시물
  • otoSpeech Task, 과제와 함께 공개된 전이중 코퍼스 — 영어 화자 2명의 대화 20시간, 7개 협업 과제에 걸친 58개 세션, 타임스탬프가 지정된 11,025개 이벤트로 구성되며 CC BY 4.0 라이선스로 제공된다. 각 화자가 본 이미지, 수행한 행동 및 기준 응답이 오디오와 동일한 타임라인에 기록된다는 점이 특징이다. 🔗 Hugging Face 게시물
  • YOLO26-RGB, 깊이 head에서 파생된 비 제거 모델 — YOLO26-depth의 1채널 깊이 head를 3채널 RGB 복원 head로 교체해 만든 두 가지 비 제거 모델이다. 하나는 매개변수 5,25M개로 1080p에서 약 109장/초를 처리하며, 다른 하나는 12,13M개로 약 92장/초를 처리하면서 품질이 0,1dB 더 높다. 🔗 Hugging Face 게시물

이것이 의미하는 것

인터페이스를 만들어 내는 코드가 아니라 인터페이스 자체를 생성한다. Solaris는 설계와 실행 사이의 경계를 옮긴다. 현재의 전체 소프트웨어 체인은 번역에 의존한다. 목업이 코드가 되고, 코드가 화면을 만들어 낸다. Runway는 이 번역에 따르는 비용을 측정했다. 스크린샷을 바탕으로 재구성해야 하는 인터페이스 30개를 대상으로 한 실험에서, 테스트한 모든 멀티모달 모델이 정보를 잃었으며 시각적 요소가 풍부할수록 품질 저하가 더 심해졌다. 중간 단계를 없애겠다는 것은 급진적인 제안이며, 연구소가 직접 열거한 한계는 이 접근 방식이 어디에서 막히는지를 보여 준다. 텍스트가 제자리에 머물지 않고, 사실에 근거한다는 보장이 없으며, 생성된 이미지는 스크린 리더에 어떤 구조도 제공하지 않으므로 접근성을 처음부터 구축해야 한다. 이는 마무리 작업의 문제가 아니라 근본적인 장애물이다.

같은 날 발표된, 컴퓨팅 비용을 지불하는 두 가지 방식. OpenAI는 광고 사업에서 연간 환산 매출 10억 달러의 속도를 기록하고 있다고 밝혔다. 이는 실제로 받은 금액이 아니라 12개월 기준의 추정치다. 또한 주간 사용자 수가 10억 명을 넘는다고 주장하는 서비스의 무료 등급을 광고로 지원하면서, 이를 구독과 동등한 경제적 축으로 내세운다. 한편 Together AI는 사용자층을 수익화하지도, 용량을 추가로 구매하지도 않는다. 매출 일부를 제공하는 대가로 사우디아라비아에서 250 MW와 칩 120,000개를 확보하며, 에너지를 업계의 실질적인 병목으로 지목한다. 두 회사는 같은 제약에 가치 사슬의 정반대 양끝에서 대응하고 있으며, 어느 쪽의 해법도 중립적이지 않다. 한쪽은 제품에 상업적 이해관계를 끼워 넣고, 다른 쪽은 정치적 저항이 덜한 곳으로 인프라를 옮긴다.

에이전트 경쟁은 이제 사전 훈련 이후에 벌어진다. Artificial Analysis의 에이전트 지수에서 GLM-5.3이 거둔 성과는 무엇보다 그것을 달성한 방식에 의미가 있다. Z.ai는 GLM-5.2 기반을 그대로 유지하고 사후 훈련만 확장했다. 장기 지평 환경, 과제의 다양성, RL 컴퓨팅이 그 대상이었다. 에이전트 순위표의 선두권에 오르기 위해 더 이상 기반 모델을 다시 훈련할 필요가 없다면, 가장 큰 비용 항목이 순위를 좌우하는 유일한 요인이 아니게 되고 모델의 업데이트 주기도 그만큼 짧아진다. 이는 이 모델이 28일 오픈 가중치 공개부터 31일 해당 순위 진입까지 6일 동안 거친 일련의 과정을 가장 경제적으로 설명해 주기도 한다.

개발자 도구는 여러 에이전트를 동시에 활용하는 방향으로 재편되고 있다. Copilot의 변경 기록은 한 주기 전체에 걸쳐 Agents 창을 대화 목록이 아닌 작업 공간으로 다룬다. 나란히 배치된 채팅, 프롬프트 캐시를 공유하는 보조 대화, 프롬프트 타임라인, 하나의 세션에 연결된 여러 창이 그 예다. Amp는 에이전트가 작업하는 바로 그곳에서 사람이 논의할 수 있도록 스레드에 통화 공간을 연결한다. 마지막으로 NVIDIA는 10년간 축적한 과학 라이브러리를 호출 가능한 skills로 패키징하고, 주행 장면 재구성을 위한 두 번째 skills 저장소를 제공한다. 서로 매우 다른 세 기업이 같은 생각으로 수렴하고 있다. 이제 에이전트에 부족한 것은 모델의 역량이 아니라, 에이전트에 제공할 수 있는 공유 컨텍스트와 전문 도구다.


출처