검색

OpenAI는 Astra의 사이버 위험 앞에서 모델 배포를 늦추고, Warp는 Warp Factories를 출시하며, Claude Code는 Design 스킬을 출시한다

인공지능으로 생성된 기사
OpenAI는 Astra의 사이버 위험 앞에서 모델 배포를 늦추고, Warp는 Warp Factories를 출시하며, Claude Code는 Design 스킬을 출시한다

ai-powered-markdown-translator

gpt-5.4-mini로 fr에서 ko로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

2026년 8월 18일, OpenAI는 Astra라는 이름의 모델이 지닌 중대한 사이버 역량에 직면해 자사의 최신 모델 학습 속도를 늦춘 이유를 설명하는 보고서를 공개했고, Warp는 기업을 위한 에이전틱 인프라를 열었으며, Claude Code는 인터페이스 디자인 스킬을 출시했다. 이 세 가지 주요 발표를 중심으로, Anthropic, 코드 도구, 오픈 IA 연구, 미디어 생성 플랫폼을 아우르는 18개의 추가 소식이 이어졌다.


OpenAI는 Astra의 중대한 사이버 역량에 직면해 모델 배포를 늦춘다

8월 18일 — OpenAI는 자사가 최근 모델들의 배포를 늦춘 이유를 설명한다. 이 결정에는 두 가지 사건이 영향을 미쳤다. 하나는 모델 평가 중 발생한 OpenAI-Hugging Face 보안 사고였고, 다른 하나는 다음 세대 모델 가운데 하나인 Astra가 Preparedness Framework에서 정의한 « 중대한 사이버 역량 » 기준을 넘을 수 있다는 예비 증거였다.

OpenAI는 배포용 최신 모델에 대한 강화학습(RL) 훈련을 2주간 중단해, 연구 환경을 강화하고 red-teaming을 수행하는 시간을 가졌다. 예정된 가장 큰 경계 RL 실행은 더 작은 규모의 훈련이 새로운 보호 장치를 검증할 때까지 보류된 상태다.

보호세부 내용
모니터링토큰 단위 분류기, 30분 이내 경보 목표
정렬유해하거나 승인되지 않은 행동 감소
보안네트워크 격리 강화, 신뢰할 수 없는 코드를 위한 샌드박스
추가 비용약 20%의 모니터링된 추론 계산 추가

이 모니터링은 « Sol » 수준부터 모든 RL 훈련과 도구를 사용하는 모든 평가에 의무이며, 8월 7일부터는 Astra의 도구 사용 추론 전체에 추가 요구사항이 적용된다. OpenAI는 Hugging Face 사고에 대한 기술 보고서와 외부 기관들과 함께하는 Preparedness Framework의 발전을 예고했다.

As models become more capable, the risks associated with developing and testing them internally also grow. We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research environments and expanded monitoring coverage. Our largest planned frontier RL run remains on hold while smaller-scale training and evaluations validate these safeguards and establish more evidence of alignment.

🇰🇷 모델이 더 강력해질수록, 개발과 내부 테스트에 수반되는 위험도 함께 커집니다. 우리는 배포용 최신 모델에 대한 강화학습(RL)을 2주간 일시 중단하고, 연구 환경을 강화하고 red-teaming을 수행하며 모니터링 범위를 확장하는 데 시간을 할애했습니다. 예정된 가장 큰 경계 RL 실행은 더 작은 규모의 훈련과 평가가 이 보호 장치들을 검증하고 더 많은 정렬 증거를 구축하는 동안 보류됩니다.@OpenAI X에서

🔗 OpenAI — 모델 개발 속도 조절


Warp는 클라우드 소프트웨어 팩토리를 위한 Warp Factories를 출시한다

8월 18일 — Warp는 소프트웨어 수명 주기 전반에 걸친 자동화 루프를 자체적으로 구축하는 기업을 위한 개방형 인프라인 Warp Factories를 발표했다. 클라우드 에이전트가 작업을 분류하고, 명세를 만들고, 구현하며, 검토하고, 검증하고, 인간은 핵심 의사결정 지점에서 루프 안에 남는다. 이번 발표는 엔지니어링 책임자들이 제기한 두 가지 문제를 짚는다. 코드 에이전트의 장기적 ROI를 측정하기 어렵다는 점, 그리고 각 개발자가 제각기 에이전트를 구성할 때 보안 사각지대가 생긴다는 거버넌스 문제다.

기술적으로 factories는 코드처럼 설정된다. 주장하는 비유는 « 에이전트 구성용 Terraform »이며, Claude Code나 Codex를 하네스로 직접 쓰는 것을 포함해 어떤 모델이나 하네스도 받아들인다. 에이전트는 Linux와 Mac에서 computer use 접근 권한을 가져 버그를 재현하고 변경의 수정을 증명할 수 있으며, pull request에 기록을 공유한다. 대시보드, API, SDK는 비용과 속도를 측정하고, 구성 가능한 자기개선 에이전트도 제공한다.

Warp는 현재 자사 내부 작업의 약 **30%**를 자체 factories로 자동화하고 있다고 밝히며, 이 비율이 빠르게 성장할 것으로 본다. 회사는 오늘부터 제한된 수의 기업에 접근 권한을 열고, 일부 선별 고객에게는 1만 달러 규모의 factory 사용 크레딧을 제공한다.

Introducing Warp Factories: open, flexible infrastructure for building cloud software factories. - Configure your factory as code - Use any model and any harness - Measure quality with evals and benchmarks on your own data - Built-in self-improvement and memory

🇰🇷 Warp Factories 소개: 클라우드 소프트웨어 팩토리를 구축하기 위한 개방적이고 유연한 인프라입니다. 팩토리를 코드처럼 구성하세요. 어떤 모델이든, 어떤 하네스든 사용하세요. 자체 데이터에 대한 평가와 벤치마크로 품질을 측정하세요. 자기개선과 메모리가 기본으로 내장되어 있습니다.@warpdotdev X에서

🔗 Warp Factories 발표


Claude Code는 초기 연구 단계에서 /design 스킬을 출시한다

8월 17일 — Anthropic은 현재 초기 연구 단계에 있는 Claude Code용 새 스킬 /design를 출시한다. 이 기능은 기존 artifacts 시스템 위에 구축된 Claude Design의 아트보드 워크플로를 CLI와 Desktop 애플리케이션으로 가져온다. /design 명령은 사용자 인터페이스 제안들을 나타내는 여러 개의 편집 가능한 아트보드를 생성한다. 사용자는 마음에 드는 것을 고르고, 조정한 뒤, Claude에게 코드에 구현해 달라고 요청할 수 있다.

이번 출시는 Claude Code를 인터페이스 디자인 용도에 더 가깝게 만든다. 그동안 이런 용도는 전용 도구에 더 가까웠지만, 이제 터미널이나 Desktop에서 개발자의 작업 흐름에 직접 통합된다. 이 기능은 Pro, Max, Team, Enterprise 플랜에서 사용할 수 있으며, 테스트하려면 Claude Code 업데이트가 필요하다. 이번 출시 발표 외에 추가 세부 정보(연구 미리보기의 제한 사항, 로드맵, 시각적 예시)는 제공되지 않았다.

Claude Code can design now. The new /design skill (research preview) brings Claude Design’s artboard workflow into the CLI and Desktop, built on artifacts. Run /design to get editable artboards for your UI — pick one, tweak it, then have Claude implement it.

🇰🇷 이제 Claude Code가 인터페이스를 설계할 수 있습니다. 새로운 /design 스킬(초기 연구)은 Claude Design의 아트보드 워크플로를 artifacts 위에 구축된 CLI와 Desktop으로 가져옵니다. /design을 실행해 인터페이스용 편집 가능한 아트보드를 받아보세요 — 하나를 고르고, 조정한 뒤, Claude에게 구현해 달라고 요청하세요.@ClaudeDevs X에서

🔗 Pro, Max, Team, Enterprise 이용 가능


Anthropic: Cowork 전면 확대, 제한 연장, CPU 최적화

오늘 Anthropic의 세 가지 발표는 Claude Code와 Cowork의 접근성과 성능에 관한 것이다.

Claude Cowork, 모든 유료 플랜에서 모바일과 웹으로 이용 가능

8월 18일 — Anthropic의 협업 환경인 Claude Cowork가 이제 모든 유료 플랜(Pro, Max, Team, Enterprise)에서 모바일과 웹으로 접근 가능해졌다. 그동안 desktop, web, mobile 사이의 공유 사이드 패널을 중심으로 주로 언급되던 기능이었는데, 이번 발표는 새로운 기능 추가라기보다 접근 범위의 확대를 의미한다. 유료 사용자는 이제 이 세 진입점 어디에서든 Cowork 세션을 이어갈 수 있으며, 인터페이스나 모바일 제한에 대한 추가 설명은 없다.

🔗 Claude Cowork 발표

Claude Code 주간 한도 50% 상향, 8월 31일까지 연장

8월 18일 — Anthropic은 Claude Code의 주간 사용 한도를 50% 올린 조치를 8월 31일까지 연장한다. 이는 원래 일시적 조치였다. 팀은 이 변경을 영구화하길 바라지만, 자사 모델에 대한 높은 수요 때문에 앞으로 몇 주 안에 용량 압박이 생길 수 있다고 경고하며 최종 결정을 위한 확정 날짜는 제시하지 않았다. 이번 발표는 Claude Code의 성능과 사용에 관한 최근의 일련의 공지 흐름에 속하며, 제품 인프라에 대한 수요 압박이 계속되고 있음을 보여준다.

🔗 Claude Code 한도 발표

Claude Code CLI, p99에서 CPU 사용량을 절반으로 줄이다

8월 18일 — 이제 수정 사항은 Bun의 가비지 컬렉터(garbage collector)가 실행되기 전에 프로세스의 유휴 상태를 기다리도록 만든다. 이전에는 고정 타이머로 트리거되어, Claude Code가 CPU를 가장 많이 사용하는 대화 중간에 실행될 가능성이 있었다. 결과적으로 CLI는 이제 99퍼센타일에서 CPU 사용량이 절반으로 줄었으며, 이는 8월 초에 발표된 다른 성능 최적화의 연장선상에 있다.

🔗 CPU 최적화 발표


코드 에이전트: 음성 채팅과 네이티브 SSH

Amp와 Warp는 새로운 상호작용 모드로 코드 에이전트를 보강한다.

Amp, Puck과의 실시간 음성 채팅 출시

8월 18일 — Amp가 자사 보조 에이전트 Puck과의 실시간 음성 대화를 추가했다. 이 기능은 gpt-realtime-2.1로 구동되며, 이미 존재하는 Puck 에이전트(GPT-5.6 Sol 기반)에 작업을 넘기고, 전체 텍스트는 대화 스레드에 계속 표시되는 동안 응답을 음성으로 요약한다. Amp는 여러 사용 사례를 강조한다. 병렬 작업 조율, 진행 상황 확인, 관련 Slack 메시지를 소리 내어 읽기 등 사무실이나 이동 중 모두에 유용하다는 것이다.

🔗 Puck과 대화하기

Amp, 월 10달러 교육용 요금제 출시

8월 18일 — 학생과 교사는 이제 Amp Megawatt Edu에 월 10달러로 구독할 수 있으며, 이는 일반 요금의 절반이다. 이 요금제에는 Amp의 경계 에이전트, orbs(감시 없이 작동하는 에이전트를 위한 원격 머신), 무제한 코드 호스팅(public 및 private), 연간 750시간의 orb 사용, 월 10달러의 크레딧이 포함된다. 구독자는 기존 ChatGPT 구독을 연결해 GPT-5.6에 접근하거나, X Premium+/SuperGrok 구독을 연결해 Grok 4.6을 사용할 수 있다. 학생 신분에 대한 엄격한 검증은 시행되지 않는다.

🔗 Amp Megawatt Edu

Warp Agent CLI, 네이티브 SSH 지원 추가

8월 17일 — 무료로 다운로드할 수 있고 BYOK 및 Grok 구독과 호환되는 Warp Agent CLI는 이제 에이전트를 이미 활성화된 SSH 세션 안으로 직접 초대할 수 있다. vim, SQL REPL, 또는 다른 텍스트 인터페이스에서도 가능하며, 단발성 명령 실행에만 제한되지 않는다. 원격 머신에는 별도의 CLI가 필요하지 않다. 세션 안에서 에이전트와 바로 함께 작업하려면 ! ssh 명령만 입력하면 된다.

🔗 Warp Agent CLI 및 SSH


OpenAI: 청소년, 전 세계 DevDay, 그리고 에이전틱 영향

오늘 OpenAI의 네 가지 발표는 청소년 사용자 보호, 국제화, 그리고 Codex의 실제 영향에 관한 것이다.

ChatGPT for Teens: 강화된 보호와 CodeAI와의 교육 파트너십

8월 18일 — OpenAI가 ChatGPT for Teens를 출시했다. 이 경험은 청소년을 위해 설계되었으며, Study Mode, 숙제 우회 시도를 감지할 수 있는 쇼트컷 방지 알림, 퀴즈와 교육용 시각화, 그리고 청소년이나 부모가 예약할 수 있는 Study Hours를 결합한다. 시스템은 미성년자로 추정되는 모든 사용자를 자동으로 이 경험으로 전환하며, system cards에는 새로운 « 18세 미만 » 평가(자해, 섭식 장애, 폭력, 성적 콘텐츠)가 공개되었다. 동시에 CodeAI와의 시그니처 파트너십은 1년간 아동 발달 자문위원회, « Hour of AI » 프로그램 확장, 고등학생을 위한 « Builders Challenge », 무료 강좌 « AI Foundations » 지원을 예고한다.

🔗 ChatGPT for Teens

DevDay Exchange: OpenAI가 개발자 행사를 전 세계로 확장한다

8월 18일2026년 10월부터 OpenAI는 벵갈루루, 도쿄, 서울, 베를린, 파리, 런던, 상파울루, 멕시코시티의 8개 도시에서 개발자 행사 시리즈인 DevDay Exchange를 시작한다. 목표는 빌더들이 실제 프로젝트를 공유하고, API, Codex, ChatGPT Work 같은 도구를 만드는 OpenAI 팀과 직접 만날 수 있게 하는 것이다. 현재 시점에서는 정확한 형식이나 등록에 대한 세부 정보는 제공되지 않았다.

🔗 DevDay Exchange

Asana, Codex로 2주 만에 5년치 엔지니어링 작업 수행

8월 18일 — Asana는 프런트엔드 스택 현대화를 막고 있던 오래된 테스트 시스템인 Enzyme을 제거하는 데 Codex를 사용했다. 약 5년의 작업과 600만 달러로 추정되던 프로젝트는 2주 달력 기간에 걸친 1.5주의 엔지니어링 노력으로 끝났고, 총 비용은 약 1만 2천 달러였다. 다섯 문장짜리 프롬프트에서 출발해 최대 네 개의 Codex 에이전트가 코드베이스의 서로 다른 복사본에서 병렬로 작업했고, 한 명의 엔지니어가 매일 두 번씩 각 변경 사항을 검증했다.

🔗 Asana 사례 연구

OpenAI, 국가 안보에서 AI에 대한 민주적 통제를 강화하기 위한 이니셔티브 출범

8월 18일 — OpenAI는 교육, 기술 지원, OpenAI 크레딧을 통해 민주적 통제 기관들이 국가 안보 분야에서의 AI 사용을 감시할 수 있도록 돕는 500만 달러 규모의 이니셔티브를 발표했다. 이 작업은 세 가지 원칙에 의해 이끌린다. AI는 기관의 판단을 대체하는 것이 아니라 강화해야 하고, 정부의 사용은 승인된 감독 기관이 추적 가능해야 하며, AI는 이런 기관들이 필요한 규모로 행동할 수 있게 해야 한다는 것이다. 1년 동안 OpenAI는 AI 지원 정부 의사결정 추적 도구를 시범 운영할 계획이며, 참여 기관은 증거에 대한 통제권을 유지한다.

🔗 민주적 통제와 국가 안보


연구와 개방형 모델

네 편의 연구 발표는 가중치와 데이터의 개방성이 무엇을 입증할 수 있게 하는지 보여준다.

Sentence Transformers v6.0: ColBERT 멀티벡터 모델이 1급 시민으로

8월 18일 — Hugging Face가 Sentence Transformers 6.0 버전을 공개하며 MultiVectorEncoder를 추가했다. 이를 통해 ColBERT 스타일의 late-interaction 모델이 이미 지원되는 dense, sparse, re-ranker 모델과 동등한 위치에 놓인다. 문서의 각 토큰은 고유한 벡터를 유지하고, 최종 점수는 각 질의 토큰의 최대 유사도(MaxSim 연산자)를 합산한다. NanoBEIR 벤치마크(13개 데이터셋)에서 멀티벡터 버전은 평균 NDCG@10 0.6868을 기록해, 동등한 dense 버전의 0.6764를 앞섰지만, 더 많은 저장 공간이 필요했다(4,874개 passage에 대해 압축 후 약 92MB). 라이브러리는 fp16 정밀도에서 처리량을 2.44배 높이는 Flash Attention 지원도 추가했다.

🔗 Sentence Transformers v6.0

Ai2: Olmo 3가 LLM의 의료 응답에서 형태학적 지름길을 드러내다

8월 18일 — UT Austin, Northeastern University, MD Anderson Cancer Center의 연구자들은 Ai2의 완전 개방형 모델인 Olmo 3(7B Instruct)를 사용해, 모델이 의약품 관련 질문에 실제 지식을 바탕으로 답하는지, 아니면 이름의 구조를 활용하는지(예를 들어 접미사 « -pril »은 ACE 억제제를 뜻함)를 확인했다. 테스트한 의약품의 **51~59%**에서 실제 약물명에 대한 모델의 응답은 가상의 이름에 대한 응답과 거의 구별되지 않았다. Olmo의 가중치, 데이터, 중간 체크포인트에 접근할 수 있었기에 이 지름길을 훈련 데이터까지 추적할 수 있었으며, 이는 폐쇄형 모델에서는 불가능한 추적 가능성이었다.

🔗 Olmo 3 및 형태학적 지름길

IBM Research: 모델에 따라 에이전트 메모리 보정하기

8월 18일 — IBM Research의 ALTK-Evolve 시리즈의 새로운 논문은 에이전트 메모리, 즉 에이전트의 과거 작업에서 추출한 지침은 기반 모델의 성능에 맞게 조절되어야 한다는 점을 보여준다. 8개 모델에 대해 테스트한 결과: gpt-oss-120b는 대상 선택형 검색을 통해 토큰을 단 **+5%**만 더 사용하고도 작업 완료율이 +16.1포인트 증가했으며, DeepSeek-V3.2는 지침 전체 주입으로 +9.5포인트 향상되었고, GLM-5는 측정 가능한 이득이 전혀 없어 포화 상태의 사례로 나타났다. 직관에 반하는 결론은, 가장 비용이 적게 드는 전략이 종종 가장 약한 모델에서 최고의 정확도를 제공한다는 점이다.

🔗 ALTK-Evolve — 에이전트 메모리

AlphaEvolve가 행렬 곱셈의 새로운 기록에 기여하다

8월 18일 — Google DeepMind는 행렬을 곱하는 가장 빠른 이론적 속도를 나타내는 지수인 오메가(ω)에 대해 새로운 기록, 즉 ω < 2,371177을 발표했다. 이 결과는 Google DeepMind, 학계 협력자들, 그리고 이미 여러 알고리즘을 2025년에 개선한 것으로 알려진 Gemini 기반 코딩 에이전트 AlphaEvolve의 공동 노력에서 나왔다. 행렬 곱셈은 AI 모델의 학습과 추론을 포함해 현대 컴퓨팅의 많은 부분을 떠받치고 있으므로, 이 지수에 대한 이론적 개선은 단순한 학술 연구를 넘어선 의미를 갖는다.

🔗 새로운 오메가 기록


추론 경제학: A/B 테스트와 비용 계단식

Together AI의 두 논문은 모델을 실제 서비스에 배포하고 비교하는 데 드는 실제 비용을 측정한다.

Together AI, 엔드포인트 수준에서 모델 A/B 테스트를 시작하다

8월 18일 — Together AI는 A/B 테스트를 애플리케이션 코드가 아니라 엔드포인트 계층에 직접 통합한다. 즉, 하나의 실험이 기준 모델과 최대 20개 변형을 연결하며, 각 변형은 복제본 수와 무관하게 고정된 트래픽 비율(95/5, 80/20, 50/50)을 가진다. 업데이트는 etag 보호를 통해 동시 덮어쓰기를 방지하면서 30~60초 안에 반영된다. 승자가 확인되면 블루-그린 배포로 승격한 뒤 실험을 삭제하며, 그러면 나머지 클라이언트 측 정리 로직 없이 트래픽의 100%가 다시 기준 모델로 돌아간다.

🔗 Together AI A/B 테스트

DeepSeek V4 Pro와 GPT-5.6 Sol, Claude Fable 5의 DeepSWE 대결: 비용과 계단식 전략

8월 17/18일 — Together AI는 소프트웨어 공학 벤치마크인 DeepSWE에서 DeepSeek V4 Pro 0813을 GPT-5.6 Sol 및 Claude Fable 5와 비교한, 각각 904회 롤아웃(113개 과제, 4회 시도)으로 구성된 두 개의 독립 벤치마크를 공개했다.

비교Pass@1 ProPass@1 경쟁 모델Pro 롤아웃 비용경쟁 모델 비용Pro-first 계단식
Pro vs GPT-5.6 Sol62,8 %72,7 %0,24 $8,37 $ (35x)과제당 3,35 $로 83,0 %
Pro vs Claude Fable 562,8 %69,7 %0,24 $21,63 $ (90x)과제당 8,28 $로 82,7 %

pass@4에서는 두 경우 모두 Pro가 다시 우위를 되찾는다(Sol 대비 88,5% 대 85,8%, Fable 대비 88,5% 대 84,1%). « Pro-first » 계단식 전략, 즉 Pro를 먼저 실행하고 실패할 때만 상위 모델로 넘기는 방식은 비용의 극히 일부만으로 단일 모델 성능을 모두 능가한다.

🔗 DeepSWE 벤치마크 — GPT-5.6 Sol


이메일 및 생성형 오디오 제품

이메일로 접근 가능한 Perplexity Computer

8월 18일 — Perplexity의 액션 에이전트인 Computer가 모든 사용자에게 이메일로도 접근 가능해졌다. 어떤 대화 스레드든 computer@perplexity.com을 보내거나, 전달하거나, 참조에 넣기만 하면 작업을 시작할 수 있다. 이메일로 실행되는 각 작업은 일반 Computer 세션처럼 동작하며, 웹과 모바일에서 확인할 수 있고, 앱에서 시작된 작업과 동일한 감사 로그를 제공한다.

🔗 이메일로 Computer 사용

Stability AI, DAW 플러그인과 Stable Audio 3.0용 새로운 웹 인터페이스를 출시하다

8월 18일 — Stability AI는 Stable Audio 3.0을 위한 베타 도구 두 가지를 발표했다. 두 도구 모두 사용자가 출력물에 대한 권리를 보유하는 « commercially-safe » 모델을 기반으로 한다. DAW 플러그인(macOS AU/VST3, Apple Silicon 및 Intel)은 오디오를 템포에 맞춰 동기화된 악기 트랙으로 직접 생성하며, 최대 6분 길이의 짧은 시퀀스를 지원한다. stableaudio.com의 향상된 웹 인터페이스는 생성 결과를 조정하기 위한 방향성 프롬프트, 오디오-투-오디오 변환, 멀티트랙 믹싱, 트랙별 효과를 추가한다. 이러한 도구들은 Stable Audio를 전문 음악 제작 워크플로에 더 가깝게 만들며, 이미 Suno와 Pika가 경쟁 서비스를 제공하는 영역에 자리한다.

🔗 Stable Audio 3.0 — 새 도구


짧은 소식

  • Hugging Face Hub, 모델 300만 개를 돌파하다 — 개방형 모델의 대표 커뮤니티 플랫폼에서 또 하나의 이정표를 세웠다. 🔗 트윗
  • Sakana Namazu가 OpenRouter와 Vercel AI Gateway에서 제공되다 — Sakana Chat을 구동하는 일본어 및 업무 맥락 특화 모델이 이 두 배포 플랫폼에서 접근 가능해졌다. 🔗 트윗
  • Ai2, 8월 20일 웨비나 전에 MolmoMotion을 미리 공개하다 — 자연어 지시로부터 3D 궤적을 예측하는 Molmo의 확장판으로, 향후 공개될 가중치와 데이터가 예고되었다. 🔗 트윗
  • Together AI: 개방형 모델 채택이 가속화되다 — Together AI가 인용한 Brex 연구에 따르면, AI를 제공하는 소프트웨어 업체 25곳 중 14곳이 가장 빠르게 성장하는 업체들이다. Together에서의 토큰 사용량은 1년 만에 월 30억에서 40조로 증가했다. 🔗 트윗
  • Josh Woodward가 Gemini 앱 로드맵을 설명하다 — Workspace 도구의 재검토 테스트, Gemini 3.7 Flash를 통한 향상된 tool calling, 새로운 Projects 인터페이스, 그리고 현재 지원되는 49개 커넥터가 포함된다. 🔗 트윗
  • HeyGen이 Brand Kits를 출시하다 — 생성된 모든 아바타 영상이 재작업 없이 브랜드 가이드라인을 준수하도록, 미리 구성된 글꼴, 로고, hex 코드, 발음 가이드를 제공한다. 🔗 트윗
  • NVIDIA, Codex 에이전트로 TensorRT Model Connect를 구축하다 — Hugging Face 모델을 TensorRT로 변환하는 사전 버전 도구로, 인간의 감독 아래 Codex 에이전트만으로 전부 개발된 오픈 소스 프로젝트다. 🔗 트윗
  • Cohere — Aidan Gomez, 디지털 주권에 대해 말하다 — CEO는 세계 기술 시장이 소수의 주체에 집중되는 상황을 경고하며, 단일 장애 지점을 피해야 한다고 주장한다. 🔗 트윗

이것이 의미하는 바

AI 거버넌스는 이제 원칙이 아니라 구체적인 수치로 표현되고 있다. OpenAI가 Astra의 사이버 역량에 대해 2주간 중단을 두는 조치, 국가 안보 분야의 민주적 통제를 지원하기 위한 500만 달러 규모의 이니셔티브, 그리고 ChatGPT for Teens의 강화된 보호 장치는 하나의 흐름을 이룬다. 즉, 연구소들이 스스로 설정한 기준선을 20%의 계산 비용 증가, 30분 이내 경고 같은 검증 가능한 수치와 함께 공개적으로 문서화하고 있다는 뜻이다.

에이전트 인프라 자체가 하나의 제품이 되고 있다. Warp Factories는 기업용 코딩 에이전트를 위한 거버넌스와 ROI 측정 계층을 제공하고, Claude Code는 /design으로 인터페이스 설계까지 범위를 넓히며, Amp는 Puck 에이전트에 음성 계층을 더하고 Warp는 SSH 활성 세션에 자사 에이전트를 연결한다. 이 네 가지 사례에서 핵심은 코드 생성 그 이상이다. 에이전트가 전체 워크플로에 직접 개입할 수 있도록 하되, 거버넌스와 인간의 통제를 함께 내장하는 데 있다.

가중치와 데이터의 개방성은 폐쇄형 모델이 제공할 수 없는 과학적 가치를 계속 만들어낸다. Ai2가 제약 분야에서 발견한 LLM의 형태학적 지름길은 Olmo 3가 훈련 데이터를 공개하고 있었기에 가능했고, IBM Research의 에이전트 메모리 논문은 재현 가능한 테스트를 통해 모델별 차이(gpt-oss-120b, DeepSeek-V3.2, GLM-5)를 수치로 보여주었으며, Hugging Face Hub의 모델 300만 개 달성은 이 개방형 생태계가 얼마나 큰 규모로 확장되고 있는지를 보여준다.

추론 비용은 순수 성능보다 제품 선택을 계속 좌우하고 있다. GPT-5.6 Sol과 Claude Fable 5를 상대로 DeepSeek V4 Pro는 pass@1에서는 뒤처지지만, 가성비에서는 크게 앞서며, 단순한 « Pro-first » 계단식 전략만으로도 정확도 격차의 대부분을 비용의 일부로 좁힌다. Together AI는 엔드포인트 수준의 A/B 테스트로 이러한 논리를 인프라 자체로 확장한다. 즉, 프로덕션에서의 모델 비교가 이제는 애플리케이션 코드의 문제가 아니라 플랫폼 기능이 되었다.


출처