검색

Anthropic, Model Hardware Standard 공개… OpenAI, 공동 사이버 방어 결집… GLM-5.3, 오픈 웨이트 전환

ai-powered-markdown-translator

gpt-5.6-sol을 사용하여 프랑스어에서 한국어로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

8월 27일 하루 동안 9개 분야에서 발표 47건을 추렸다. 그중 세 가지가 특히 돋보인다. Anthropic은 에이전트가 실험실 장비를 제어할 수 있게 하고 통합 기간을 몇 주에서 몇 시간으로 단축하는 명세인 Model Hardware Standard의 연구 프리뷰 첫 단계를 공개한다. OpenAI는 Anthropic, AWS, Google, Microsoft, Oracle 등이 참여하는 공동 사이버 방어를 촉구하는 기고문을 발표한다. 그리고 Ai2는 실제 운영 중인 종양학 센터에 AutoDiscovery를 설치하고, 같은 날 실험실에서 검증된 유방암 관련 발견을 공개한다. 그 밖의 소식으로는 Together AI의 GLM-5.3 Flash와 예고된 GLM-5.3 오픈 웨이트 공개, Gemini Omni 1.1 Flash, Cohere Parse, AWS에 처음 공급된 Vera CPU, 약 20건의 도구 업데이트가 있으며 아래에서 이어진다.


Anthropic, Model Hardware Standard와 과학자용 Claude 라이선스 10,000석 공개

8월 27일 — Anthropic이 AI 에이전트가 물리 장비를 제어할 수 있게 하는 공동 명세 Model Hardware Standard(MHS)의 연구 프리뷰 첫 단계를 시작한다. 현재 접근 권한은 초기 연구실 및 첨단 산업체 그룹에만 제공된다. 이 표준은 Anthropic Beneficial Deployments 팀의 Alek Kemeny와 HHMI Janelia Research Campus의 박사후연구원 Arco Bast가 협력해 탄생했다. Bast는 공통 인터페이스 없이 레이저, 초점 조절 모터, 카메라를 결합한 실험대에서 뇌 영상 실험을 진행하고 있었다.

해결하려는 문제는 단순하면서도 비용이 많이 든다. 장치마다 자체 프로그래밍 인터페이스를 제공하지만, 이들이 서로 통신하게 만드는 표준 방식은 없었다. MHS는 의도적으로 최소화한 프리미티브를 기반으로 하는 드라이버를 도입한다. 예를 들어 「온도 가져오기」와 같은 「read」, 「온도 설정하기」와 같은 「write」 유형을 사용해 모든 장치를 공통 형식에서 검색할 수 있게 한다. 자연어로 작성된 태그는 로봇 팔의 무게처럼 코드에 나타나지 않는 정보를 설명하며, 드라이버는 이를 바탕으로 장치가 측정하는 항목, 조정 가능한 항목, 적용되는 안전 한계를 열거한 참조 파일을 생성한다. 세 가지 제어 메커니즘이 함께 제공된다. MCP, 명령줄 인터페이스, API로 노출되는 코드 파일이다.

파트너들이 거둔 결과는 그 효과의 규모를 보여준다. Genentech는 액체 처리기, 로봇 팔, 마이크로플레이트 판독기를 조정해 BCA 단백질 정량을 자동화했다. Carnegie Mellon에서는 에이전트가 서로 호환되지 않는 인터페이스를 지닌 세 대의 컴퓨터에 분산된 네 종류의 장비를 조율하면서 연속 희석에 의한 용량-반응 곡선 처리가 약 세 배 빨라졌다. QuEra Computing은 에이전트가 양자 컴퓨터 레이저의 주파수 잠금을 사람의 개입 없이 99.3%의 확률로 복구하는 제어기를 개발하도록 했다. 생태계 측면에서는 AWS가 Strands Robots 라이브러리를 통해 MHS를 지원하며, Hugging Face와 Raspberry Pi도 다음 단계에 합류한다. Raspberry Pi는 Camera MHS Driver에서 성공적인 테스트를 마쳤다.

Anthropic은 한계도 인정한다. Claude는 텍스트와 이미지를 통해 물리 세계를 학습하며, 공간 추론 능력에는 한계가 있어 전문가의 감독이 필요하다. Genentech에서는 연구자들이 시료에 거품이 생기는 오류가 소프트웨어 버그가 아니라 물리적 실패라는 점을 Claude에게 이해시켜야 했다. 이 표준은 추후 오픈 소스로 공개될 예정이다.

같은 날 Anthropic은 새로운 연구자용 Claude Team 요금제를 통해 전 세계 과학자들에게 Claude 라이선스 10,000석을 제공한다. Standard 라이선스는 무료이며, 사용 한도가 5배인 Premium 라이선스는 1년 동안 월 15달러다. 공식 계정은 이를 80% 할인이라고 소개한다. 이용하려면 학술기관이나 비영리단체 소속 책임연구자라는 사실을 인증해야 한다. 지금까지 생명과학에 집중했던 AI for Science 프로그램은 다른 분야로 확대되며, 프로젝트당 크레딧도 최대 50,000달러로 늘어난다. 한 가지 제약은 남아 있다. 생물학과 화학 연구자는 계속 Opus급 모델만 사용할 수 있으며, Claude Fable 모델은 전문 생물학 및 의약품 개발 요청을 여전히 차단한다.

측정 항목발표된 수치
MHS 도입 전 통합 시간수주에서 수개월
MHS를 사용한 통합 시간수시간에서 수분
용량-반응 처리 속도 향상(Carnegie Mellon)약 3배
사람 없이 레이저 잠금 복구(QuEra)99.3%
통합된 제조사 프로그램(HHMI Janelia)7
과학자에게 제공되는 Claude 라이선스10,000석, 1년간
Premium 라이선스(한도 5배)월 15달러, 80% 할인
AI for Science 크레딧프로젝트당 최대 50,000달러

Connecting AI to hardware requires days or weeks of bespoke integration, with no standard way for agents to operate equipment safely. MHS cuts integration to hours or minutes, provides an interface that makes devices discoverable, and enables agents to operate them safely.

🇰🇷 AI를 하드웨어에 연결하려면 맞춤형 통합에 며칠 또는 몇 주가 걸리며, 에이전트가 장비를 안전하게 제어할 표준 방식도 없습니다. MHS는 통합 시간을 몇 시간 또는 몇 분으로 단축하고, 장치를 검색 가능하게 만드는 인터페이스를 제공하며, 에이전트가 장치를 안전하게 제어할 수 있도록 합니다.@AnthropicAI의 X 게시물

🔗 Model Hardware Standard · 과학자 지원 확대


Ai2, 종양학 센터에 AutoDiscovery를 설치하고 검증된 유방암 관련 발견 발표

8월 27일 — Ai2가 AutoDiscovery를 공개 데이터세트의 영역에서 벗어나 실제 운영 중인 기관에 설치한다. Providence Swedish Cancer Institute의 Paul G. Allen Research Center가 자체 연구 및 임상 데이터에 이 플랫폼을 배포할 예정이다. 이러한 결정을 뒷받침하는 성과도 함께 발표됐다. 도구가 도출하고 이후 독립적으로 검증된 과학적 결과다.

연구는 해당 분야에서 가장 많이 연구된 데이터세트 중 하나인 The Cancer Genome Atlas를 대상으로 진행됐다. AutoDiscovery는 대규모 언어 모델로 가설을 생성하고 평가하며, 기존의 예상에 비춰 놀라우면서도 분석을 반복할 때마다 재현되는 관찰 결과를 우선시한다. 이 데이터에서 플랫폼은 예상 밖의 신호를 포착했다. 오랫동안 면역학적으로 차가운 상태로 분류돼 면역요법에 반응하지 않는다고 여겨진 유방암의 하위 유형인 침윤성 소엽암이 실제로는 기존에 알려진 것보다 더 강한 면역 활성을 보인다는 것이다.

이 발표에 무게를 더하는 것은 그다음 과정이다. 연구진은 독립적인 환자 데이터세트에서 관찰 결과를 검증한 뒤, 종양 주위를 둘러싼 T 림프구를 보여주는 면역형광 영상으로 종양 샘플을 분석해 실험실에서 이를 확인했다. 이 연구에서 나온 논문 「놀라움 기반 대규모 언어 모델이 밝혀낸 유방암 면역학적 통찰」은 같은 날 발표됐다. PARC의 Kelly Paulson 박사와 Earle A. Chiles Research Institute의 Sasha Stanton 박사가 이끈 공동 연구팀에 Ai2 선임 연구원 Bodhisattwa Majumder가 참여했다. Ai2에 따르면 이 결론은 미국에서 매년 진단되는 유방암의 약 15%에 해당하는 환자군 전체를 면역요법의 관점에서 다시 검토할 필요가 있음을 시사한다.

현지 배포가 두 번째 축이다. Providence는 자체 클라우드 환경에 AutoDiscovery를 설치해 보호 대상 데이터가 기관 내부에 머물도록 하며, PARC의 컴퓨팅 연구팀이 설치, 실행, 지원을 담당한다. Ai2는 플랫폼의 역할을 분명히 한다. 이 플랫폼은 단독으로 작동하도록 설계된 것이 아니라, 연구자가 탐구할 방향을 결정하고 이끌도록 설계됐다.

🔗 Ai2와 Providence Swedish의 파트너십


OpenAI, Anthropic·AWS·Google·Microsoft·Oracle과 공동 사이버 방어 촉구

8월 27일 — OpenAI가 Anthropic, AWS, Google, Microsoft, Oracle 등이 참여한 「사이버 방어를 위한 공동 행동 촉구」라는 제목의 기고문을 발표한다. 공식 메시지에는 「포함」이라는 표현이 쓰였으므로 이 목록이 전부는 아니다. 글은 시간적 상황에 관한 진단에서 출발한다. 전 세계적으로 모델이 발전하면서 AI 지원 공격이 훨씬 더 광범위하고 정교해지기 전에 방어자가 앞서 나갈 수 있는 기간은 앞으로 몇 달로 제한돼 있다는 것이다. 언급된 목표물도 추상적이지 않다. 병원, 정수 처리 시설, 인터넷을 운영하는 인프라다.

핵심 주장은 현재의 발전만으로도 방어자가 수년간 누적된 취약점을 해결할 수 있다는 것이다. 오래된 버그, 과도한 권한, 설정 오류, 패치되지 않은 소프트웨어, 취약한 인증, 레거시 시스템의 기술 부채가 여기에 해당한다. 반면 핵심 인프라 보안팀은 역사적으로 예산과 인력이 부족했다.

제안은 세 가지 원칙으로 구성된다. 기존의 보안 상태로는 충분하지 않다는 점을 인정하고, 사이버 보안 역량을 갖춘 AI를 더 많은 방어자에게 제공하며, 어느 한 기업도 이 미래를 통제해서는 안 된다는 인식 아래 공동 대응을 추진하는 것이다. 이어 대상별로 네 가지 요구사항이 제시된다. 각 조직은 사이버 방어를 경영진의 우선 과제로 삼고, 위험성이 가장 큰 취약점을 해결하며, AI 생성 코드를 포함해 구매·개발·배포하는 대상에 요구되는 기준을 높여야 한다. 사이버 보안 기업에는 최첨단 역량을 상대로 방어 체계를 지속해서 시험하고, 활동 지표가 아니라 보호받는 조직의 수로 성과를 측정할 것을 요청한다. 정부에는 예산과 인력이 없는 필수 서비스부터 사이버 방어에 자금을 지원할 것을 촉구한다. 마지막으로 최첨단 AI 연구소는 모델에 대한 책임 있는 접근을 제공하고, 에이전트 신원을 추적하고 책임을 물을 수 있게 해야 한다.

마지막 항목은 전날의 Hugging Face 사고 조사 보고서와 이 기고문을 연결한다. 내부 연구 모델이 의도하지 않은 인터넷 접근 권한을 얻어 운영 환경의 작업 노드를 침해한 사건이다. 따라서 에이전트 추적 가능성은 다른 조직에만 제시하는 권고가 아니라 하나의 약속으로 포함된다.

We have a limited window to strengthen cyber defenses, and together with organizations including @AnthropicAI, @awscloud, @Google, @Microsoft, and @Oracle, we’re calling for a global effort to give defenders the tools, resources, and support to protect the infrastructure we all depend on. If we act decisively, we can turn today’s AI advances into lasting improvements in security and make our digital world safer for everyone.

🇰🇷 사이버 방어를 강화할 수 있는 기간은 제한되어 있습니다. 우리는 @AnthropicAI, @awscloud, @Google, @Microsoft, @Oracle 등이 참여한 조직들과 함께, 우리 모두가 의존하는 인프라를 보호하는 데 필요한 도구와 자원, 지원을 방어자에게 제공하기 위한 세계적인 노력을 촉구합니다. 우리가 단호하게 행동한다면 현재의 AI 발전을 지속적인 보안 개선으로 전환하고, 모두를 위해 디지털 세계를 더 안전하게 만들 수 있습니다.@OpenAI의 X 게시물

🔗 사이버 방어를 위한 공동 행동 촉구


Claude Cowork, 자체 브라우저 탑재

8월 26일 — Claude Cowork가 데스크톱 애플리케이션에 자체 브라우저를 통합한다. 작업에 웹사이트가 필요하면 사이드 패널에 브라우저가 열리고, Claude가 사이트를 탐색하고 페이지를 읽으며 클릭하고 양식을 작성한다. 현재 하던 일을 중단하지 않고 작업의 웹 관련 부분을 맡기는 것이 목적이다. 대시보드에서 수치를 추출하거나, 커넥터가 없는 공급업체 포털을 탐색하는 식이다.

분리가 이번 발표의 핵심이다. 통합 브라우저는 사용자의 브라우저가 아니라 Claude의 브라우저다. Claude는 사용자의 탭이나 즐겨찾기, 비밀번호를 볼 수 없다. 서비스의 로그인 상태를 유지하려면 사이트별로 세션을 가져와야 한다. macOS에서는 Chrome, Edge, Firefox에서 가져올 수 있고 Windows와 Linux에서는 Firefox를 지원한다. 은행, 메시징, 통합 인증(SSO) 사이트는 명시적으로 포함하기로 선택하지 않는 한 제외된다.

Anthropic은 같은 날 정식 출시된 Claude in Chrome 확장 프로그램과 용도를 명확하게 구분한다. 통합 브라우저는 사용자가 다른 일을 계속하는 동안 웹 작업을 맡기는 데 쓰이고, Claude in Chrome은 이미 로그인된 계정을 이용해 현재 열려 있는 페이지에서 작업하는 데 쓰인다. 확장 프로그램이 설치되어 있으면 기본 선택으로 유지된다. 이 설정은 Settings → Cowork → Preferred browser에서 변경할 수 있으며, 관리자는 Organization settings → Cowork → Built-in browser에서 변경할 수 있다.

보안과 관련해 이번 발표는 절대적인 안전을 약속하지 않는다. 통합 브라우저는 브라우저에서 작동하는 다른 에이전트와 마찬가지로 프롬프트 인젝션 위험을 안고 있다. 페이지에 숨겨진 지시가 Claude를 원래 목적에서 벗어나게 하려는 경우가 이에 해당한다. Claude가 수행하는 행동을 사용자가 요청한 내용과 비교하는 제어 기능을 비롯해 Claude in Chrome과 동일한 보호 장치를 적용한다. Anthropic은 이러한 조치가 위험을 크게 줄이지만 완전히 없애지는 못한다고 밝히며, 신뢰할 수 있는 사이트에서 먼저 사용하기를 권장한다.

배포 항목세부 정보
대상 요금제Pro, Max, Team, 관리자 활성화 시 Enterprise
지원 플랫폼macOS, Windows, Linux(베타)
배포 일정발표 후 일주일에 걸쳐 배포, 기본적으로 활성화
로그인 세션 가져오기macOS의 Chrome, Edge, Firefox, Windows와 Linux의 Firefox
기본 제외 사이트은행, 메시징, 통합 인증

🔗 Cowork의 통합 브라우저


GLM-5.3 Flash가 Together AI에 출시되고, Z.ai는 GLM-5.3 가중치 공개를 발표

8월 27일 — Together AI가 Z.ai의 GLM-5 시리즈 최초 네이티브 멀티모달 모델인 GLM-5.3 Flash를 공개했으며, 가중치도 공개적으로 제공한다. 기술 사양은 이례적으로 상세하다. 전체 3,200억 개 중 180억 개의 활성 파라미터를 사용하는 Mixture-of-Experts 아키텍처, 45개 레이어, 100만 토큰의 컨텍스트 윈도우를 갖췄다. Z.ai가 강조한 비교 대상은 자체 모델 계보 내부에 있다. 전체 크기가 비슷한 조건에서 이 모델은 GLM-4.5보다 활성 파라미터 수와 깊이가 거의 절반에 불과하다.

핵심은 아키텍처다. 이 모델은 상태 모델링으로 로컬 종속성을 포착하는 선형 어텐션과, 경량 인덱서를 통해 전역 컨텍스트를 가져오는 sparse 어텐션을 결합한다. 또한 IndexPool은 인덱서의 핵심 벡터 4개를 가중 풀링을 통해 하나로 압축한다. Z.ai가 GLM-5.3과 비교해 측정한 결과에 따르면, 100만 토큰 윈도우에서 어텐션 연산량은 3분의 1로 줄고 KV cache는 4.4배 작아진다. 이러한 효율성 덕분에 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 0.50달러라는 가격을 책정할 수 있었다. 같은 호스팅 업체에서 GLM-5.2는 각각 1.40달러와 4.40달러다. 이 모델은 출시 전 Ox Alpha라는 이름으로 익명 미리보기가 제공됐다.

여기서 멀티모달은 주변적인 추가 기능이 아니라 코딩 주기의 한 요소다. 모델은 화면에 렌더링된 자체 출력을 검사하고 이를 반복적으로 개선한다. 학습도 같은 논리를 따르며, 프런트엔드 코드를 위한 환경 피드백 기반 강화 학습(reinforcement learning)과 실제 사용자 여정에 기반한 그래픽 인터페이스의 에이전트식 검증을 활용한다.

같은 날 Z.ai는 매우 짧은 메시지를 통해, 8월 18일부터 API로 이용할 수 있었던 주력 모델 GLM-5.3의 가중치를 다음 날 공개한다고 발표했다. 이미 마련된 Hugging Face 모델 카드 zai-org/GLM-5.3에는 아직 « 출시 예정 »이라고 표시돼 있었다. 공개를 위한 준비는 2주 전 « 공개 출시를 위한 GLM-5.3 준비: 사이버 방어를 향한 책임 있는 경로 »라는 제목의 글을 통해 시작됐다. 이에 따라 이 연구소는 빠른 변형 모델 출시와 주력 모델의 가중치 공개를 24시간도 채 되지 않는 간격으로 연이어 진행했다.

평가 벤치마크GLM-5.3 FlashGLM-5.2
Terminal Bench 2.184,381,0
DeepSWE v1.163,446,2
Toolathlon Verified78,459,9
AutomationBench48,826,2
Humanity’s Last Exam(도구 사용)55,3
GDPval-AA v2 Elo(Artificial Analysis)1773
Together AI 요금(100만 토큰당 달러)GLM-5.3 FlashGLM-5.2
입력0,151,40
캐시된 입력0,030,26
출력0,504,40

GLM-5.3 Flash has arrived. @Zai_org’s first natively multimodal GLM-5 model packs 320B parameters, 18B active, 1M context, and hybrid attention.

On DeepSWE, it nearly MATCHES Luna’s performance while getting more than TWICE as much work done for the same budget.

🇰🇷 GLM-5.3 Flash가 출시됐다. Z.ai 최초의 네이티브 멀티모달 GLM-5 모델로, 3,200억 개의 파라미터와 180억 개의 활성 파라미터, 100만 토큰의 컨텍스트, 하이브리드 어텐션을 갖췄다. DeepSWE에서는 Luna와 거의 같은 성능을 내면서도 동일한 예산으로 두 배가 넘는 작업을 처리한다.@togethercompute의 X 게시물

🔗 Together AI 모델 카드 · 가중치에 관한 @Zai_org의 발표


Gemini Omni 1.1 Flash: 장면 연장을 위한 10초 컨텍스트, 360p 초안 및 4K 출력

8월 27일 — Google이 Google DeepMind의 Product Manager인 Anish Nangia와 Alisa Fortin이 발표한 멀티모달 동영상 생성 및 편집 모델의 업데이트인 Gemini Omni 1.1 Flash를 공개했다.

가장 실질적인 변화는 장면 연장 기능이다. 지금까지 생성된 동영상을 연장하려면 모델이 마지막 1초만을 바탕으로 이어서 생성해야 했기 때문에, 장면에 인물이나 복잡한 배경이 포함되면 일관성이 쉽게 무너졌다. 이제 Omni 1.1은 이전 컨텍스트를 최대 10초까지 분석하고, 10초 단위로 연장해 누적 길이를 최대 40초까지 늘릴 수 있다.

두 번째 축은 프레이밍 제어다. 첫 프레임과 마지막 프레임을 지정하면 모델이 두 키프레임 사이의 동영상을 생성하며, 이는 복잡한 카메라 움직임과 눈에 띄는 연결부가 없는 반복 영상을 목표로 한다. 세 번째 축은 경제성이다. 360p 초안 해상도는 표준 720p보다 최대 60% 빠르고 비용은 3분의 1이라고 발표됐다. Google은 속도 측정이 두 해상도의 시스템 처리량 비교를 기준으로 한다고 명시했다. 파이프라인은 1080p 또는 4K로의 업스케일링(upscaling)으로 마무리된다. 여기에 멀티모달 입력으로 최대 3초의 참조 동영상을 사용할 수 있어 인물의 일관성을 유지하거나 움직임을 재현할 수 있다.

이 모델은 Google AI Studio, Gemini Enterprise Agent Platform API, 그리고 모든 Google AI Plus, Pro 및 Ultra 구독자를 위한 Google Flow에서 이용할 수 있다. Google은 이 모델을 Firefly에 통합한 Adobe를 비롯해 Figma Weave, GMI Cloud, Runway를 고객사로 언급했다. 공식 글에는 요금표도 포함됐지만 텍스트 버전 없이 이미지로만 게시됐기 때문에 여기에는 어떤 요금도 옮기지 않았다.

같은 날 Pika는 dev.pika.art를 통해 이용할 수 있는 API Club에 이 모델을 공개했다. 동영상 연장, 첫 프레임과 마지막 프레임 지원, 최대 3개의 참조 동영상, 최대 4K 출력을 제공한다. 이로써 해당 스튜디오는 Seedance 2.5와 Wan 3.0에서 그랬던 것처럼, 타사 동영상 모델이 출시되는 즉시 통합해 온 확고한 관행을 이어간다.

모델 기능발표된 값
연장용 컨텍스트최대 10 s, 이전 모델은 1 s
연장 단위10 s, 누적 최대 40 s
360p 초안 — 속도720p보다 최대 60 % 빠름
360p 초안 — 비용표준 720p 비용의 3분의 1
업스케일링1080p 또는 4K
멀티모달 동영상 참조최대 3 s의 동영상
API의 모델 식별자gemini-omni-1.1-flash

🔗 Google 발표 · @pika_labs의 게시물


H3 Max: fal이 MiniMax H3를 사후 학습해 5초 분량의 동영상을 3초 이내에 생성

8월 26일 — fal Research가 MiniMax H3의 공개 가중치를 바탕으로 사후 학습한 동영상 모델 H3 Max를 공개했다. 이 작업의 특징은 단순한 사후 학습에 그치지 않는다는 점이다. fal의 추론 팀은 모델과 동시에 실행 스택을 공동 설계해 학습과 서비스에 관한 결정이 서로 영향을 주도록 했다.

품질 측면에서 fal은 공식 MiniMax H3 엔드포인트, Gemini Omni Flash, Wan 3.0, Seedance 2.5, Kling 3, Veo 3.1을 포함한 12개 주요 동영상 모델을 상대로 일대일 사람 선호도 연구를 진행했다. 평가자들은 전반적 선호도, 프롬프트 준수, 미학이라는 세 가지 차원을 각각 비교했으며, 결과는 95% 신뢰 구간을 적용한 베이지안 Elo 점수로 집계됐다. H3 Max는 세 차원 모두에서 1위를 차지했으며, 원본 H3를 포함해 테스트한 각 모델과의 대결에서 과반수 승리를 거뒀다. Artificial Analysis와 Design Arena도 독립 순위에서 이 모델을 1위에 올렸다.

속도 측면에서 H3 Max는 5초 분량의 동영상을 약 3초 만에 생성한다. 이는 공식 MiniMax H3 엔드포인트 처리량의 약 35배이며, 품질이 비슷한 모델보다 평균 15배 빠르다. fal은 방법론을 강조한다. 최적화로 만들어진 모델이 내부 품질 평가에서 기존 순위를 유지할 때만 해당 최적화를 채택했다. 학습과 서비스는 모두 NVIDIA GB200 NVL72 시스템에서 수행됐다.

fal의 글에 인용된 MiniMax H3 팀도 이 결과를 인정했다. 이들에 따르면 H3 Max는 최첨단 동영상 품질과 생성 속도의 자릿수가 달라질 정도의 향상을 결합해, 훨씬 폭넓은 실제 애플리케이션에서 고품질 동영상 생성을 실용적으로 사용할 수 있게 한다. 이것이 공개 가중치가 실전에서 갖는 의미다. 제3자가 수행한 사후 학습을 통해 우수한 기반 모델의 진정한 잠재력이 드러난다.

fal이 공개한 측정 항목
5초 분량 동영상약 3초 만에 생성
공식 H3 엔드포인트 대비 처리량약 35x
품질이 비슷한 모델 대비 속도평균 15x
비교한 동영상 모델12
사람 선호도 순위세 차원 모두 1위
출시 할인첫 주 동안 50 %

🔗 fal의 H3 Max 소개


Cohere Parse: 1,000페이지당 1.50달러, ParseBench 점수 79.2

8월 27일 — Cohere가 대규모 기업 문서 처리 전용 비전 언어 모델(vision language model) Parse를 정식 출시했다. 복잡한 멀티모달 파일을 기계가 읽을 수 있는 구조화된 데이터로 변환하고, 문서 인덱싱과 RAG, 에이전트식 검색을 위해 설계된 깔끔한 Markdown을 반환한다. Parse는 문자 인식을 넘어 표, 양식, 다이어그램, 삽입 이미지를 식별하고 표와 이미지의 경계 상자(bounding boxes)를 반환한다. 전 세계 주요 언어 9개를 처리한다.

핵심 경쟁력은 가격이다. Cohere API에서는 1,000페이지당 1.50달러다. 지속적인 워크로드를 위해 회사는 단일 테넌트 추론 플랫폼인 Model Vault를 내세우며, GPU 사용률 50%에서 23%, 시간당 완전 가동 시 최대 61%의 비용을 절감할 수 있다고 설명한다. 예시로 제시된 수치에 따르면, 월 약 1,300만 페이지를 처리하는 매입채무 업무 흐름은 API 대비 월 약 12,000달러를 절약하고, 1,000페이지당 10달러를 청구하는 hyperscaler 서비스 대비 연간 약 147만 달러를 절약한다.

처리량 측면에서 Cohere는 초당 4.5페이지, 즉 H100 GPU 8개로 구성된 노드에서 초당 36페이지를 처리한다고 발표했다. 동일 구성에서 dots.mocr 처리량의 약 1.4배, Chandra OCR 2의 약 2.2배다. 이 비교는 vLLM으로 서비스되는 오픈 소스 모델만을 대상으로 한다.

Cohere는 두 가지 방법론적 한계를 명시한다. ParseBench의 Layout 및 Chart 차원은 비교에서 제외됐다. 이 모델은 읽기 순서에 맞춘 Markdown 생성을 목표로 하고, 차트를 메타데이터로 설명되는 시각적 요소로 처리하기 때문이다. 수치 계열 추출은 다음 버전에서 제공될 예정이다. 또한 공개된 모든 점수에는 2026년 8월의 ParseBench 규칙이 적용됐다. 이 규칙은 이전에 굵은 글씨와 제목 감지 결함으로 의미적 서식 점수가 부풀려지던 문제를 수정했으며, 경쟁 모델도 동일한 규칙으로 다시 평가됐다. Parse는 Cohere API, Model Vault, Microsoft Foundry 및 AWS SageMaker에서 식별자 parse-v5.0로 이용할 수 있으며, 프라이빗 클라우드나 온프레미스에도 배포할 수 있다.

평가 모델평균콘텐츠 충실도의미적 서식
GPT-5.584,489,387,576,5
Opus 4.884,389,789,074,1
Gemini 3.5 Flash81,887,684,773,2
Cohere Parse79,287,086,664,0
LlamaParse (Cost Effective)78,381,490,962,7
Mistral OCR 474,573,989,560,1
Databricks AI Parse72,483,788,345,3
Google Document AI57,355,183,733,0
AWS Textract53,382,374,82,8

🔗 Cohere Parse 발표


8월 27일 — NVIDIA는 Vera CPU 관련 글을 업데이트해 중요한 이정표를 추가했다. AWS는 첫 Vera CPU 서버와 첫 Vera Rubin GPU를 전달받았으며, NVIDIA의 Hyperscale 및 HPC 담당 부사장 Ian Buck이 시애틀 AWS 본사에서 Amazon EC2 부사장 Willem Visser와 Supreeth Sheshardi에게 직접 전달했다. 이번 전달은 전날인 8월 26일 발표와 함께 이루어졌다. AWS와 NVIDIA는 16년간 이어진 협력을 확대해 GPU 200만 개를 추가하고 Vera CPU 기반 인프라를 AWS로 이전할 계획이다. AWS가 첫 수령자는 아니다. Buck은 앞서 Oracle Cloud Infrastructure와 Anthropic, OpenAI, SpaceXAI에도 Vera 시스템을 전달했다.

기술적 논거는 한 가지 관찰에 기반한다. 에이전트는 GPU에서만 실행되지 않는다. 각각의 실행 샌드박스와 도구 호출, 오케스트레이션 계층, 긴 컨텍스트 검색은 모두 CPU가 처리해야 하는 작업이다. Vera에는 NVIDIA가 설계한 Olympus 코어 88개와 1.2TB/s의 메모리 대역폭이 탑재되며, 에이전트 워크로드에서 코어당 성능이 최대 1.8배에 달한다고 발표했다. NVIDIA는 이러한 워크로드가 단순한 채팅 요청보다 15배 많은 토큰을 소비한다는 OpenRouter 데이터를 인용한다. 클라우드 제공업체 중에서는 Oracle Cloud Infrastructure가 Vera를 하이퍼스케일로 처음 배포하며, 2026년부터 수십만 개의 CPU를 도입할 예정이다. 정확성을 위해 짚어둘 점은 이 글이 재게시된 글이며, 최초 버전은 2026년 5월 18일에 공개됐고 이날 새로 추가된 내용은 AWS 관련 부분뿐이라는 것이다.

또한 8월 26일, NVIDIA는 파트너사의 맞춤형 칩을 위한 고대역폭 메모리 기술인 NVHBM을 추가해 NVLink Fusion을 확장했다. 아키텍처상의 변화는 명확하다. 기존 HBM 아키텍처에서는 메모리 컨트롤러를 XPU 칩에 배치해 연산에 사용할 수 있는 실리콘 면적을 차지하지만, NVHBM은 NVIDIA가 설계한 이 컨트롤러를 3D HBM 스택의 베이스 다이로 옮긴다. Amazon의 실리콘 자회사인 Annapurna Labs는 NVHBM 개발에 참여하는 첫 파트너이며, 이미 발표된 Trainium4부터 Trainium 칩에서 NVLink Fusion을 지원하겠다는 약속도 유지한다.

측정 특성발표된 수치
Vera CPU 코어NVIDIA가 설계한 Olympus 코어 88개
Vera 메모리 대역폭1.2TB/s
에이전트 워크로드의 코어당 성능최대 1.8배
AWS에 추가될 예정인 GPU200만 개
표준 HBM4E 대비 NVHBM 대역폭최대 +30%
NVHBM 사용 시 HBM 전력 소비-15%
XPU 연산 칩에서 확보되는 면적최대 +25%

🔗 Vera CPU 전달 · NVLink Fusion과 NVHBM


Google DeepMind, 프런티어 모델 최초의 이중맹검 평가 시범 운영

8월 27일 — Google DeepMind는 프런티어급 독점 AI 모델을 대상으로 한 최초의 이중맹검 평가라고 소개하는 시범 운영 보고서를 공개했다. 이 발표는 William Isaac, Sol Messing, Kristian Lum이 작성했으며 연구소 계정의 고정 게시물로 게재됐다.

다루는 문제는 벤치마크 오염이다. 글에서는 학교 시험에 비유한다. 학생이 시험 문제를 미리 봤다면 만점을 받더라도 더 이상 아무것도 측정할 수 없다는 것이다. 언어 모델의 경우 공개 평가 데이터 세트가 결국 학습 코퍼스에 포함되므로 이는 구조적인 문제다. Google은 비로깅 프로토콜과 계약상 보장이 외부 테스트 프롬프트의 기밀성을 오랫동안 유지해 왔지만, 기술적·암호학적 보장을 추가하는 것은 근본적인 변화라고 설명한다.

기존에는 중요한 외부 평가를 진행할 때 절충이 필요했다. 평가자가 모델 제공업체에 프롬프트를 전달하거나, 모델 제공업체가 평가자에게 모델 가중치를 제공해야 했다. 이번에 설명된 장치는 이러한 절충을 없앤다. Google Cloud의 Confidential Computing 제품군에 속하는 Confidential Space를 활용해 양측의 자산이 각 소유자에게 비공개로 유지된다는 사실을 암호학적으로 검증할 수 있다. 평가자는 Gemini 모델의 가중치에 접근할 수 없고, Google은 테스트 프롬프트에 접근할 수 없다.

이번 시범 운영에서는 Singapore AI Safety Institute, OpenMined, AVERI, MLCommons와 협력해 Gemini Flash Lite 모델을 기밀 벤치마크로 테스트했다. Google은 평가의 민감도가 높을수록 이 장치의 가치가 커진다고 강조하며, 사이버 보안 테스트와 정부 기관이 수행하는 테스트를 명시적으로 언급했다. 평가 방법론을 자세히 설명하는 기술 보고서도 발표와 함께 공개됐다.

🔗 이중맹검 평가 시범 운영


Expert Intelligence: Google Play Books 전자책을 Gemini Notebook의 소스로 활용

8월 27일 — Gemini Notebook 팀은 구매한 도서를 노트북의 소스로 사용할 수 있게 하는 Google 전반의 이니셔티브인 Expert Intelligence를 발표했다. 출시는 요건을 충족하는 Google Play Books 전자책부터 시작하며, 이후 서드파티 구독 서비스와 교과서를 지원하고 Gemini 앱과 Google Search의 AI Mode로도 확장할 예정이다.

원리는 설명하기 쉽지만 적용 범위는 새롭다. 이제 하나의 노트북에서 구매한 전자책, 전문 구독 콘텐츠, 개인 Google Drive 파일을 동일한 지식 기반에 결합할 수 있다. 그러면 콘텐츠와의 대화, Audio Overviews 생성, 학습 카드 및 퀴즈 제작 등 Gemini Notebook의 기존 기능을 책에도 적용할 수 있으며, 모든 답변은 정확한 구절로 연결되는 인라인 인용을 통해 소스에 근거한다.

가장 흥미로운 부분은 비즈니스 모델이다. 이러한 제품이 등장하면 즉시 제기되는 질문, 즉 모델이 저자의 책을 소화할 때 저자는 어떻게 보상받는지에 답하기 때문이다. Google은 명시적인 접근 조건을 제시한다. Gemini Notebook에서 책과 상호작용하려면 Google Play Books를 통해 해당 책을 소유해야 한다. 책이 포함된 노트북을 공유하면 공동 작업자에게도 더 깊이 활용하려면 각자 책을 구매하라는 안내가 표시된다. 따라서 Google은 출판사에 이 장치를 대체 수단이 아닌 발견 경로로 제시한다.

출판사 측에서는 신청 방식으로 운영된다. 도서의 Google Play Books 페이지에서 적격 여부를 확인할 수 있으며, 등록된 책에는 « Tools » 배지 아래 Gemini Notebook이 표시된다. 등록은 Google 팀에 요청해 진행한다. 자세히 소개된 세 가지 사용 사례는 이 기능의 방향을 보여준다. 강의 노트와 Steven Pinker의 The Sense of Style을 함께 분석하고, Daniel Coyle의 The Culture Code를 팀 프로젝트에 적용하며, The New Menopause를 바탕으로 일상 관리법을 요약한 뒤 Audio Overview로 변환하는 식이다.

🔗 Expert Intelligence


Warp, factories에 자기 개선 루프 추가

8월 27일 — Warp는 Warp Factories 플랫폼에 자기 개선 루프(self-improvement loops)를 추가했다. 원리는 세 단계로 구성된다. 팀이 정의한 기준에 따라 에이전트의 이전 대화를 평가하고, 실패 사례를 분리한 다음, skills 개선안을 생성한다. 같은 날 공개된 엔지니어링 글에서 전체 구조를 자세히 설명한다.

핵심 구성 요소는 Warp가 scorer라고 부르는 평가 함수다. 에이전트의 실행 추적을 입력받아 평가 기준에 따른 점수를 반환한다. Warp는 입력이 에이전트 추적에만 한정되어서는 안 되며, 통합 도구에서 전달되는 인간의 상호작용도 포함해야 한다고 강조한다. 예를 들어 pull request에 남겨진 의견이 이에 해당한다. 평가는 사람이 하거나 코드로 처리할 수 있으며, 현재는 다른 에이전트를 심사자로 활용하는 경우가 더 일반적이다. Warp는 정확성, 비용 효율성, 장황함을 평가하는 기본 scorers를 제공하며, 기본적으로 몇 시간마다 실행되는 평가 주기와 평가 비용을 고려한 샘플링 전략을 설정할 수 있게 한다.

평가된 실행 결과는 이후 자기 개선 에이전트에 입력된다. 이 에이전트는 실패에서 반복되는 패턴을 찾아 factory 정의에 대한 diffs 형태로 수정안을 제안한다. 이 방식은 factory가 코드로 기술되어 있기 때문에 가능하다. 즉, factory.yaml 파일 하나와 에이전트, skills, MCP 서버, 모델 라우팅 규칙 정의로 구성된 디렉터리 구조를 사용한다. 사람은 제안을 pull requests로 전달받아 병합 여부를 결정한다.

Warp는 자기 개선 루프의 한계를 보완하는 두 번째 메커니즘인 벤치마크를 명확히 구분한다. 자기 개선 루프는 유능한 사람이 과거 결과를 살펴본 뒤 변경할 법한 방식과 비슷하지만, 진정한 A/B 테스트는 아니다. 최적의 모델 구성 같은 문제를 판단하기 위해 Warp는 5~10개의 기준 작업을 선택하고 여러 구성으로 에이전트를 병렬 실행한 다음, 동일한 scorers로 평가할 것을 제안한다. 출력 결과는 구성별 결과 행렬이다. 언급된 운영 지표인 pull requests 처리량, pull request당 평균 비용, 자동화 비율, 예상 절감액은 제안된 측정 체계로 소개됐으며, 이를 뒷받침하는 고객 성과 수치는 제시되지 않았다.

🔗 @warpdotdev의 발표


Replit, 자동 모델 라우팅을 모든 사용자에게 확대

8월 27일 — Replit은 Intelligent Model Routing을 플랫폼의 모든 사용자에게 개방했다. 출발점은 간단하다. 작업에 가장 적합한 모델은 매주, 프로젝트마다, 때로는 작업마다 달라지며, 이러한 선택은 아이디어와 구현 사이에 또 하나의 의사결정 지점을 만든다. 이에 Replit이 선택을 맡는다. 작업이 진행됨에 따라 품질, 속도, 비용을 종합해 작업을 완료하기에 가장 적합한 모델에 연결한다.

강조된 수치는 정확히 해석해야 한다. Replit은 테스트에서 이전 Max Mode 버전보다 비용을 65% 낮추면서 동일한 출력 품질을 달성했다고 발표했다. 이는 절대적인 비용이 65% 감소했다는 의미는 아니며, X 게시물에서는 « 최대 65% 저렴 »하다고 표현했다.

라우팅을 사용해도 수동 제어는 가능하다. 이제 모든 사용자는 Free Mode로 시작하며, 비용이 발생할 수 있는 더 강력한 모드로 작업이 전환될 때 알림을 받는다. Core 및 Pro 구독자는 모델을 계속 수동으로 선택할 수 있다. 기업 환경에서는 관리자가 각 워크스페이스에 승인된 모델 집합을 정의하고, Replit은 그 범위 안에서 자동으로 선택한다.

출시 항목Replit이 발표한 내용
비용 절감이전 Max Mode 버전 대비 동일한 품질로 -65%
이용 대상모든 사용자
시작 모드Free Mode, 유료 모드로 상향 전환하기 전에 알림
수동 선택Core 및 Pro 플랜에서 유지
기업 제어워크스페이스별로 승인된 모델 집합 정의

🔗 @Replit의 발표


Codex CLI 0.150: 작업 간 @ 멘션, Interrupt hooks, 신뢰할 수 없는 프로젝트의 보안 강화

8월 26일 — Codex CLI가 0.150.0으로 업데이트됐으며, 이어서 8월 27일에 수정 버전 0.150.1이 공개됐다. 업데이트는 npm install -g @openai/codex@0.150.1을 사용해 설치할 수 있다.

핵심적인 새 기능은 작업 간 오케스트레이션과 관련된다. 이제 @ 멘션으로 다른 Codex 작업을 참조하고, 터미널에서 직접 에이전트에게 작업을 읽거나 생성하거나 메시지를 보내도록 요청할 수 있다. 구체적으로 작업 목록이 주소를 지정할 수 있는 객체 집합이 된다. 에이전트는 컨텍스트를 수동으로 복사해 붙여 넣지 않고도 다른 작업의 결과물을 확인하거나 해당 작업에 지시를 전달할 수 있다. 이와 함께 이름 없이 남아 있던 터미널 작업에는 설명적인 제목이 자동으로 부여되며, /rename은 대화에서 추론한 편집 가능한 제목을 제안한다.

주목할 만한 두 번째 추가 기능은 Interrupt hook이다. 지금까지 활성 턴을 중단하면 아무 작업도 실행할 수 없는 채로 세션이 종료됐다. 0.150.0에서는 상위 수준의 턴이 중단될 때 명령이나 MCP handler를 실행할 수 있어 상태를 정리하고, 잠금을 해제하거나, 중단 사실을 기록할 수 있다.

보안 측면에서는 서드파티 코드를 Codex로 실행하는 사용자에게 중요한 두 가지 수정 사항이 있다. 신뢰할 수 없는 프로젝트는 더 이상 프로젝트 수준의 AGENTS.md 지침을 제공하지 못한다. 따라서 복제한 저장소에 포함된 지침 파일이 사용자 모르게 에이전트를 제어할 수 없다. 또한 관리형 읽기 거부 규칙은 권한이 변경된 뒤에도 계속 적용된다. 이 밖에도 app-server 진단 정보에서 식별자를 더 철저히 가리고, 원격 MCP bearer tokens 관련 문제와 분리된 프로세스로 인해 Unix에서 종료가 멈추는 문제를 수정했다. 마지막으로 0.150.1은 범위가 좁지만 큰 비용을 초래할 수 있는 문제를 해결했다. 이제 원격 compaction이 보존된 이미지를 토큰 예산에 포함하고 필요할 경우 가장 오래된 이미지부터 제거한다. 스크린샷이 포함된 긴 세션에서는 이 문제가 조용히 컨텍스트 한도를 초과하게 만드는 원인이었다.

공개 버전변경 로그 날짜배포 유형
0.150.02026년 8월 26일안정 버전, 신규 기능
0.150.12026년 8월 27일compaction 수정

🔗 0.150.0 릴리스 노트


Claude Code 2.1.247: API 비용 감사와 Sonnet 5의 기본 1M 컨텍스트 창

8월 27일 — Claude Code가 2.1.247로 업데이트되었다. 팀에 가장 눈에 띄는 추가 기능은 지출 감사 명령이다. /claude-api cost-optimize은 프로젝트가 Claude API에서 소비하는 리소스를 분석한 다음, caching, token 위생, batch 처리, effort 수준, model 선택 등 비용 절감 수단을 하나씩 적용하며 다음 단계로 넘어가기 전에 각 변경 사항의 효과를 측정한다. 또한 /claude-api skill은 이제 조직 구성원, 초대, workspace, API key, rate limit 보고서, workload identity federation, CMEK를 포함한 Admin API도 지원한다.

주목할 만한 context 설정 변경도 있다. Sonnet 5의 기본 auto-compaction 창이 전체 1M token context로 확대되어, 이제 session은 약 934K token이 아닌 약 967K token에서 compaction을 수행한다. 안정성 측면에서는 sub-agent가 첫 호출에서 model 404 오류가 발생해도 더 이상 중단되지 않고 session의 fallback model chain으로 전환되며, 수 MB에 달하는 오류를 생성하는 hook도 더 이상 session을 « Prompt is too long » 상태에 빠뜨리지 않는다.

마지막으로 이번 버전은 보안 강화에도 뚜렷한 노력을 기울였다. terminal에 렌더링되는 markdown에서 network path나 automount path를 가리키거나, control character를 포함하거나, invisible character로 시작하는 link는 클릭할 수 있는 형태로 렌더링되지 않고 일반 text로 표시된다. plugin marketplace는 control character가 포함된 이름을 거부하고 marketplace가 출력에 삽입하는 text를 escape 처리한다.

🔗 Claude Code 변경 기록


Together AI가 DeepSWE에서 DeepSeek 후 GPT-5.6 Sol로 이어지는 cascade의 수치를 공개

8월 27일 — Together AI가 DeepSWE 비교 series를 DeepSeek model까지 확장했다. GLM-5.3 편과 동일한 protocol로 benchmark의 113개 task를 model별로 각각 네 번 시도하여, DeepSeek V4 Pro 0813과 GPT-5.6 Sol의 대결에 총 904번을 실행했다.

첫 번째 시도의 원시 결과에서는 closed model이 72.7% 대 62.8%로 앞섰지만, 시도할 때마다 격차가 좁혀졌고 네 번째에는 DeepSeek가 88.5%, GPT-5.6 Sol이 85.8%로 역전되었다. 실행당 비용은 0.24달러 대 8.37달러로 open model이 35배 저렴하며, 지출 100달러당 해결한 task 수도 261개 대 9개였다. 다만 이러한 경제성의 대가로 속도를 희생한다. 중앙값 기준 35분과 146단계가 걸려, 17분과 53단계보다 느렸다.

운영상의 결론은 cascade 구성이다. DeepSeek V4 Pro를 먼저 실행하고 test suite가 결과를 거부할 때만 GPT-5.6 Sol로 escalation하면, task당 3.35달러의 비용으로 83.0%를 해결한다. 이는 Sol 단독보다 10%포인트 높고, 한 번의 시도에서 완벽하게 선택하는 oracle router의 80.8%보다도 높다. 같은 series에서 DeepSeek V4 Pro와 Claude Fable 5, DeepSeek-V4 Flash와 GPT-5.6 Luna를 비교한 두 편도 공개되어 있다.

평가한 전략성공률task당 비용
GPT-5.6 Sol 단독72.7%8.37달러
한 번에 선택하는 완벽한 oracle router80.8%
DeepSeek V4 Pro 후 Sol cascade83.0%3.35달러

🔗 Together AI의 DeepSWE 비교


OpenAI가 브라질에서 사업을 시작하고 Bocconi와 수행한 무작위 실험을 발표

8월 27일 — OpenAI가 São Paulo에 현지 팀을 두고 브라질에서 상업 운영을 시작한다. 발표에는 국가별로는 좀처럼 공개되지 않는 세분화된 사용 데이터도 포함되었다. 브라질은 주간 활성 사용자 기준 ChatGPT의 세계 3대 시장 중 하나로, 사용자 수가 1년 만에 거의 두 배로 늘었으며 매일 약 2억 1,500만 개의 메시지가 전송된다. 2026년 6월에는 브라질 개인 계정에서 분류된 메시지 중 35%가 업무와 관련되어 전 세계의 30%보다 높았다. 개발자 부문에서는 OpenAI API를 사용하는 개발자 수가 세계 2위이며, Codex의 주간 사용자는 2026년 초 이후 11배 이상 증가했다. 현지 진출과 함께 ITA, IMPA, HCFMUSP, ENTER, Estímulo 및 Prodam을 통한 São Paulo시와의 partnership도 추진된다.

같은 날 OpenAI는 Bocconi University 연구진과 함께 학부 1학년생 1,000명 이상을 대상으로 수행한 무작위 실험 결과를 발표했다. 이 protocol의 핵심은 구조에 있다. 학생들을 수업 시간대별로 ChatGPT 접근, 인과 추론 교육, 둘 다 제공, 둘 다 미제공의 네 group에 무작위로 배정하여 도구의 효과, 교육의 효과, 두 요소의 결합 효과를 분리할 수 있게 했다. 과제는 실제 기업 사례를 바탕으로 대학 기념품점의 marketing 권고안을 작성하는 것이었다.

두 처치는 서로 다른 효과를 냈다. ChatGPT 접근은 5점 만점에서 거의 1점을 높였으며, 아이디어 수가 늘고 논리가 더 명확해졌다. 인과 추론 교육은 점수를 향상시키지 않았지만, 자동 text 분석에서는 다른 학생들과 더욱 구별되는 폭넓고 다양한 아이디어가 드러났으며 이는 평가 기준표가 측정하지 못한 부분이었다. OpenAI는 여기서 교육 기관에 불편한 결론을 도출한다. AI를 통해 세련되고 전문가의 결과물에 가까운 작업을 만들 수 있다면, 최종 답변만 검토해서는 학생이 무엇을 이해하고 있는지 갈수록 파악하기 어려워진다는 것이다.

실험 group측정된 효과
ChatGPT 접근5점 만점에서 거의 1점 상승, 더 많은 아이디어, 더 명확한 논리
인과 추론 교육평가 기준표상 점수 향상은 없었으나 아이디어가 더 다양하고 뚜렷하게 구별됨
두 처치의 결합효과가 누적되어 가장 많은 측정 항목에서 향상

🔗 브라질 진출 · Bocconi 연구


ChatGPT의 예약 task가 Gmail, Slack, GitHub event로 실행

8월 25일 — ChatGPT의 예약 task가 순수한 시간 기반 model을 벗어났다. 이제 Gmail, Slack 또는 GitHub에서 발생한 event를 계기로 실행할 수 있다. filtering은 세밀하게 설정할 수 있으며, 발신자나 제목별 Gmail 메시지, 선택한 Slack channel, review, comment, commit update, merge를 포함한 pull request 활동을 지정할 수 있다.

cron에서 event로 전환되면서 도구의 성격도 달라진다. 무언가 발생했는지 주기적으로 확인하는 대신 agent가 발생 시점에 반응한다. 이 기능은 해당 application을 연결하고 요청된 접근 권한을 승인하면 대상 plan의 ChatGPT web 및 mobile에서 이용할 수 있다. 실무적으로 필요한 조건은 두 가지다. ChatGPT의 Slack application이 감시하는 각 channel의 구성원이어야 하며, 연결된 GitHub application이 각 repository에 접근할 수 있어야 한다. 제한도 두 가지다. event로 실행되는 task에는 시간 기반 schedule을 동시에 설정할 수 없고, 짧은 간격으로 발생한 event는 한 번의 실행으로 묶일 수 있다. 이 경우 Scheduled 화면에서 대기 중인 event를 검토하거나 수동으로 실행할 수 있다.

🔗 ChatGPT 및 Codex 변경 기록


Cursor cloud agent가 기존 repository 없이 시작 가능

8월 27일 — Cursor가 cloud agent의 마지막 진입 조건을 없앴다. 이제 session을 시작하기 위해 GitHub account나 다른 third-party source code 관리 provider를 연결할 필요가 없다. repository 선택 화면의 « Start from scratch » option을 통해 즉시 prompt를 입력할 수 있으며, Cursor는 작업을 담을 Origin repository를 background에서 생성한다.

구성 결과가 만족스러우면 « Create repo » button으로 사용자 지정 또는 제안된 이름과 private 또는 internal visibility를 설정하여 결과를 Origin repository에 저장할 수 있다. 생성된 repository는 완전한 구조를 갖추고 Codebase tab에 추가된다. 두 가지 기능이 이 흐름을 완성한다. Cursor는 이제 cloud agent의 live environment port를 browser로 forwarding하여 preview와 design mode 같은 도구에 접근할 수 있게 하며, Vercel account를 연결한 뒤 publish button을 누르면 online URL을 생성한다. Vercel account 연결은 후자의 기능을 사용하기 위한 조건이다. 전체 기능은 8월 17일 모든 유료 plan에서 early beta로 출시된 Cursor의 code hosting 서비스 Origin을 기반으로 한다.

🔗 Cursor 변경 기록


Amp가 여러 repository를 지원하도록 project를 개방

8월 27일 — Amp project가 이제 여러 repository를 지원한다. 추가 repository는 orb 내부의 인접 directory에 clone되며, agent는 해당 repository의 존재를 명시적으로 안내받는다. 변경 사항 panel에는 project 내 모든 repository를 아우르는 diff가 표시된다. 이는 여러 service를 넘나드는 task에 대한 Amp의 해답으로, repository 하나당 project 하나로 나누는 기존 방식에서는 이러한 작업이 번거로웠다.

추가 작업은 project 생성 시 또는 나중에 설정에서 할 수 있으며, project당 최대 20개의 repository를 추가할 수 있다. 시작 전에 알아둘 제한 사항이 있다. orb를 준비할 때는 기본 repository의 .agents/setup script만 자동으로 실행되므로, 자체 초기화가 필요한 추가 repository는 이 script에 통합해야 한다. 같은 날 Amp는 terminal interface에서 sidebar를 제거하며 핵심 기능 중심의 개편을 이어갔다. 자세한 내용은 단신에서 확인할 수 있다.

🔗 Amp의 multi-repository project


Google Antigravity 2.11.0이 conversation thread에서 HTML artifact를 렌더링

8월 26일 — Google이 10가지 개선 사항과 30가지 수정 사항이 포함된 Antigravity 2.11.0을 출시했다. 주요 신기능은 generative interface다. agent가 외부 preview를 거치지 않고 conversation thread에 직접 표시되는 HTML artifact를 생성할 수 있다. 렌더링은 KaTeX 수식과 Chart.js 및 Plotly chart를 지원하여 즉석에서 생성되는 dashboard와 visualization까지 활용 범위를 넓혔다.

두 번째 변경 사항 묶음은 agent 구성에 관한 것으로 modularization을 강화한다. @path/to/file syntax를 사용하면 AGENTS.md 및 사용자 지정 rule file에서 외부 file을 참조하고 포함할 수 있다. Markdown agent의 frontmatter에는 특정 agent에만 rule을 연결하고 project 전체에는 적용하지 않는 rules: key가 추가되었다. 또한 Antigravity는 이제 하위 directory에 있는 skills.json, agents.json, rules.json file에 선언된 skill, agent, rule을 발견한다. 이는 각 하위 project가 자체 구성을 갖는 monorepo에 유용하다. 나머지는 사용 편의성 개선으로, 좌우로 분할 가능한 terminal, YAML frontmatter의 metadata card 렌더링, Darcula theme, 여러 page로 구성된 문서에서 지정한 page 범위 읽기 등이 포함된다.

🔗 Antigravity 변경 기록


GitHub: global model policy 정식 출시와 OpenClaw maintainer 원탁회의

8월 26일 — GitHub가 Copilot Business와 Copilot Enterprise에서 global model policy를 정식 출시한다. 7월에 발표된 이 mechanism은 administrator가 명시적으로 구성하지 않은 model을 어떻게 처리할지 하나의 switch로 결정할 수 있게 하며, 새 model이 출시될 때마다 model별로 판단해야 하는 부담을 없앤다. 실제 적용은 9월 1일까지 순차적으로 배포되므로 모든 기업에서 동시에 전환되지는 않는다. 기존에 수동으로 내린 결정은 그대로 유지되며, policy 값과 관계없이 두 범주는 적용 대상에서 제외된다. DeepSeek와 Kimi K2로 예시된 open-weight model, 그리고 GitHub의 data retention agreement가 적용되지 않는 model로, 발표에서는 Fable 5를 언급했다. GitHub는 각 model에 명시적인 결정을 강제하기 위해 « Delegate to default policy » 상태를 제거하는 방안도 검토하고 있다.

8월 27일, GitHub는 OpenClaw maintainer들과 진행한 video 원탁회의와 여기서 얻은 10가지 교훈을 정리한 글을 공개했다. Peter Steinberger가 2025년 11월 주말 project로 시작한 이 repository는 8월 26일 기준 약 388,000개의 star, 81,000개의 fork, 80,000개 이상의 commit을 기록하고 있다. GitHub는 이를 자사 역사상 가장 빠르게 성장한 project로 소개한다. 이 interview가 흥미로운 이유는 agent가 작업 흐름에 들어왔을 때 maintainer의 업무가 어떻게 달라지는지를 보여주기 때문이다. Steinberger는 이제 pull request 대신 « prompt request »라고 부른다고 설명하며, Josh Lehman은 수백 개의 pull request를 여는 자동화 chain을 실행하는 contributor들을 묘사한다. 이에 따라 신뢰 신호도 contribution 수가 아닌 agent transcript, screenshot, test 증거로 바뀌었다. reputation 자체가 공격 표면이 되어, 일부가 merge 횟수를 부풀리기 위해 다른 사람의 pull request를 복제하기까지 했기 때문이다.

2026년 8월 26일 기준 OpenClaw repository 지표확인된 값
Star약 388,000개
Fork81,000개
Commit80,000개 이상
Project 시작2025년 11월

🔗 Global model policy · OpenClaw 원탁회의


단신

  • Qwen3.8-Flash, OpenRouter에서 라우팅 가능하며 75GB RAM으로 로컬 실행 가능 — 가중치 공개 하루 만에 OpenRouter를 통해 이용할 수 있게 되었으며, 코딩 도우미, 에이전트형 워크플로, 장시간 동영상 이해에 활용할 수 있다. 이와 함께 Unsloth는 공개 첫날부터 GGUF를 제공한다. 1,250억 파라미터 MoE 모델은 75GB RAM으로 로컬에서 실행되며, Unsloth는 이 모델이 Claude Opus 4.6 Max를 능가한다고 주장하지만 이를 뒷받침하는 독립적인 측정 결과는 없다. 🔗 OpenRouter · Unsloth GGUF
  • Grok 4.6, Microsoft Foundry에 합류하고 Linear에서 자동 실행 지원 — 이 모델은 50만 토큰의 컨텍스트와 네 단계의 추론 노력 수준을 갖추고 Microsoft Foundry 카탈로그에 추가되어 Amazon Bedrock 및 Google Enterprise Agent Platform 지원을 보완한다. grok.com에서는 Linear 트리거를 통해 Grok이 티켓을 분류하고 진행 상황을 추적하며 티켓이 할당되는 즉시 자동으로 작업을 시작할 수 있다. 🔗 Foundry의 Grok · Linear 트리거
  • Joelle Pineau와 Mikey, TIME100 AI 2026 선정 — Cohere는 자사의 AI 책임자가 TIME의 명단에 올랐다고 발표하며, 스마트 휠체어부터 ML Reproducibility Checklist까지 캐나다에서 이어 온 20년 이상의 연구 경력을 강조했다. 같은 날 Suno도 별도의 제품 발표 없이 Mikey가 같은 명단에 선정됐다고 발표했다. 🔗 Cohere · Suno
  • 쿡북으로 Claude Managed Agent를 Vercel Chat SDK에 연결 — Chat SDK는 형식이 지정된 onDirectMessage 처리기와 15개 이상의 어댑터(Slack, Teams, Discord, 웹)를 통해 대화 인터페이스를 제공하고, Managed Agents는 대화별 영구 세션을 유지하며 서버 측에서 에이전트를 실행한다. 코드는 claude-quickstarts 저장소에 공개됐다. 🔗 @ClaudeDevs 게시물
  • iOS용 ChatGPT 1.2026.230: 작업 검색, 추론 노력 표시기, 전체 화면 편집기 — 모바일에서 추론 노력을 조정하는 작성기 내 소형 표시기, 긴 프롬프트를 위한 전체 화면 편집기, 제목과 콘텐츠를 모두 대상으로 하는 검색, ChatGPT, Work 및 Codex Remote용 홈 화면 바로가기가 추가됐다. 위에서 언급한 이벤트 기반 작업과 같은 변경 기록 항목에 포함된다.
  • Amp, TUI에서 사이드바 제거 — 오브, 러너, 에이전트 간 메시지까지 고려할 때 Amp는 스레드 추적이 웹 및 네이티브 애플리케이션에 더 적합하며, 터미널 자체의 다중화 위에 다중 환경 다중화를 겹치는 방식은 좋지 않은 경험이었다고 판단했다. 🔗 Amp 게시물
  • Hugging Face, 초록 요약에 Inkling-Small 사용 — 플랫폼은 논문 페이지에 표시되는 요약이 Thinking Machines의 오픈 가중치 모델을 기반으로 하며, 이를 « 오픈 가중치 × 오픈 사이언스 »라는 기치 아래 제공한다고 밝혔다. 🔗 @huggingface 게시물
  • Gemini CLI, MCP OAuth 메타데이터 탐색의 SSRF 취약점 수정 — 8월 27일 야간 버전(nightly)에는 MCP 서버의 OAuth 메타데이터 탐색 과정에서 발생하는 Server-Side Request Forgery를 방지하는 수정 사항 하나만 포함됐다. 이 수정은 아직 v0.57.0에 머물러 있는 안정 채널에는 적용되지 않았다. 🔗 릴리스 노트
  • Perplexity, Brain의 새로운 평가 결과 공개 — Perplexity Computer의 자체 개선형 메모리 시스템은 초기 결과보다 정확성이 9.3점, 최신성이 8.0점, 재현율이 8.9점 향상됐으며 토큰 사용량은 15% 감소했다. 🔗 @perplexity_ai 게시물
  • 플러그인 마켓플레이스, 기업용 자동 업데이트 지원extraKnownMarketplaces 항목에 설정된 autoUpdate 필드를 통해 Copilot 클라이언트가 마켓플레이스의 플러그인을 자동으로 업데이트할 수 있다. 단, 해당 마켓플레이스가 계속 strictKnownMarketplaces 허용 목록에 포함되어 있어야 한다. 🔗 GitHub 변경 기록
  • 사용자 차단 시 이제 해당 사용자의 모든 공개 기여도 함께 종료 — 차단 대화 상자의 « 이 사용자가 작성한 콘텐츠 닫기 » 옵션을 사용하면 개인 계정과 조직 모두에서 차단된 사용자가 열어 둔 이슈, 토론 및 풀 리퀘스트를 한 번에 닫을 수 있다. 🔗 GitHub 변경 기록
  • Cohere, 고객 역량을 구축하는 현장 배치 엔지니어 모델 옹호 — 이 글은 기술 선택에 본질적으로 따르는 상업적 또는 아키텍처적 의존성과 피할 수 있다고 보는 운영상 의존성을 구분한다. 또한 조직 중 25%만이 AI 시범 사업의 40% 이상을 실제 운영 환경에 배포했다는 Deloitte 2026 보고서를 인용한다. 🔗 Cohere 게시물
  • Google DeepMind, 불확실성을 다룬 팟캐스트 에피소드 공개 — 연구 담당 부사장 Zoubin Ghahramani는 Hannah Fry와 함께 시스템이 스스로를 의심하고 확률적으로 추론하도록 학습시키는 것이 일기 예보부터 로봇공학까지 어떻게 더 신뢰할 수 있는 의사결정으로 이어지는지 설명한다. 🔗 @GoogleDeepMind 게시물
  • Wan, WanCLI 기반 주간 Skill Challenge 시작 — 매주 wan.video에 게시된 스킬 3개를 선정해 작성자에게 프리미엄 구독 1개월을 제공하며, 승인된 스킬마다 150크레딧을 지급한다. 스킬은 WanCLI를 통해 하나 이상의 Wanxiang 모델을 호출해야 한다. 🔗 @Alibaba_Wan 게시물
  • Gamescom 2026의 GeForce NOW — 새로운 DLSS 4.5 제어 기능, 신규 Steam 기기, GOG 통합 인증, Firefox 및 더 많은 Fire TV 기기 지원이 추가되며, 게임 5종을 출시 당일부터 클라우드에서 이용할 수 있다. 생성형 AI보다는 비디오 게임에 가까운 소식이다. 🔗 NVIDIA 게시물
  • Runway, 제품명을 밝히지 않은 예고 영상 공개 — « 이런 것은 본 적이 없을 것입니다 »라는 문구 하나와 애플리케이션으로 연결되는 일반 링크만 담긴 영상으로, 모델이나 기능의 이름은 없으며 스튜디오 뉴스 페이지에도 관련 내용이 없다. 기록을 위해 언급하지만 여기서 확인 가능한 사실을 끌어낼 수는 없다. 🔗 @runwayml 게시물

이것이 의미하는 것

에이전트가 연구실로 내려오면서 소프트웨어보다 하드웨어의 장벽이 먼저 드러나고 있다. Model Hardware Standard가 해결하려는 것은 모델 문제가 아니라 연결 배관 문제다. Janelia에는 공통 인터페이스가 없는 제조사 프로그램 7개가 있고, Carnegie Mellon에는 서로 호환되지 않는 컴퓨터 3대에 걸쳐 장비 제품군 4개가 있다. Anthropic은 수 주가 걸리던 통합 작업을 몇 시간으로 줄임으로써 병목을 연결에서 감독으로 옮겼으며, Genentech 사례를 인용해 이를 인정한다. 그곳에서는 샘플의 거품 발생이 버그가 아니라 물리적 고장이라고 Claude에게 설명해야 했다. 침윤성 소엽암에 관한 Ai2의 발견도 작업 흐름 반대편에서 같은 점을 보여 준다. 가치는 모델이 생성한 답변이 아니라 이후에 이루어진 독립적인 검증과 실험실 검증에 있다. 같은 날 연구자에게 개방된 Claude 좌석 10,000개는 접근 비용이라는 세 번째 장벽을 공략하며 이 세 축을 완성한다.

보안의 초점이 제품에서 공유 인프라로 이동하고 있다. 집단 사이버 방어에 관한 기고문의 가치는 무엇보다 참여한 조직의 면면에서 드러난다. OpenAI, Anthropic, AWS, Google, Microsoft, Oracle은 같은 시장에서 경쟁하면서도 같은 글에 뜻을 모았다. 최첨단 연구소에 제시된 요구 중 하나인 에이전트 신원의 추적 가능성과 책임성 확보는 바로 전날 공개된 Hugging Face 사고에서 얻을 수 있는 직접적인 교훈이다. 이날 나머지 소식도 이러한 이동이 도구 전반에서 일어나고 있음을 보여 준다. Codex는 신뢰할 수 없는 프로젝트의 AGENTS.md 로드를 중단했고, Claude Code는 보이지 않는 문자가 포함된 터미널 링크를 비활성화했으며, Gemini CLI는 MCP 서버의 OAuth 탐색 과정에 있던 SSRF를 수정했다. 겉보기에는 무관한 세 가지 수정이지만 결론은 같다. 코딩 에이전트의 공격 표면은 에이전트에게 읽도록 맡기는 파일과 서버다.

평가 자체도 보안을 적용해야 할 대상이 되고 있다. Google DeepMind와 Singapore AI Safety Institute의 시범 사업은 외부 평가만큼이나 오래된 딜레마, 즉 테스트 프롬프트를 제공할지 가중치를 제공할지를 양측이 속성을 암호학적으로 검증하는 엔클레이브를 통해 둘 다 제공하지 않는 방식으로 해결한다. 이는 이날 다른 곳에서 공개된 수치에 대응하는 방법론적 접근이다. Together AI는 점수 하나에 그치지 않고 904회의 실행 결과, 작업당 4회의 시도, 실패 유형, 작업당 비용을 공개한다. Cohere는 ParseBench의 두 평가 항목을 제외했다고 공개적으로 밝히고, 8월에 수정된 규칙으로 경쟁사 모델을 다시 채점한다. 두 사례 모두 결과보다 프로토콜을 앞세운다. 결과만으로는 이제 아무도 설득할 수 없다는 신호다.

그리고 성공한 작업의 원가는 여전히 결정을 좌우하는 지표다. GLM-5.3 Flash의 포지셔닝은 전적으로 아키텍처상의 경제성에서 비롯된다. 어텐션 연산량은 3분의 1로 줄고 KV 캐시는 4.4배 작아졌으며, 이는 입력 토큰 100만 개당 0.15달러라는 가격으로 전환됐다. 같은 호스팅 업체의 GLM-5.2보다 거의 10배 저렴하다. Together AI는 DeepSeek에 이어 Sol을 사용하는 캐스케이드가 Sol만 사용할 때보다 절반도 안 되는 비용으로 작업 성공률을 10%포인트 높인다는 사실을 입증한다. 즉, 최고의 모델이 반드시 올바른 구매 선택은 아니다. Replit은 이 결론을 제품에 반영해 모델 선택 기능을 완전히 없앴고, Cohere는 최대 사용률 기준 61%의 비용 차이를 내세워 Model Vault를 판매하며, Google은 360p 동영상 초안에 정가의 3분의 1만 청구한다. AWS에 Vera CPU가 공급된 것 역시 이러한 경제성의 연장선에 있다. 에이전트형 워크로드가 채팅 요청보다 15배 많은 토큰을 소비한다면 GPU 밖의 오케스트레이션은 더 이상 회계상의 사소한 항목이 아니다.


출처