ai-powered-markdown-translatorgpt-5.4-mini로 fr에서 ko로 번역된 기사.
2026년 7월 30일은 두 가지 연구 성과가 주도한다. Anthropic의 내부 연구 모델인 Claude Mythos는 NIST의 양자내성 후보와 AES의 약화된 버전에서 전례 없는 암호학적 취약점을 발견했고, Google DeepMind는 하나의 작업을 여러 로봇이 협업해 수행할 수 있는 Gemini Robotics ER 2를 출시했다. 이 두 주제를 중심으로 OpenAI의 GPT-5.6 가격 인하, GitHub와 Devin에서의 스택형 pull request 동시 채택, 여러 오픈 모델 출시(Thinking Machines, Sakana AI, LightOn), 그리고 에이전트 측의 대규모 업데이트(Perplexity, Genspark, Gemini)가 이어진다.
Claude Mythos가 전례 없는 암호학적 취약점을 발견하다 (HAWK, AES)
7월 30일 — Anthropic은 Frontier Red Team의 연구를 공개하며, Claude Mythos Preview가 자사의 가장 진보했지만 상용화되지 않은 내부 연구 모델로서, OpenSSL 같은 라이브러리에서 Claude가 이미 찾아낼 수 있던 단순한 구현 버그를 넘어 두 개의 주요 암호 알고리즘에서 전례 없는 수학적 취약점을 발견했다고 밝혔다. 이 발표는 7월 28일 X에 게시되었고, 이후 완전한 블로그 글로 자세히 설명되었다.
첫 번째 결과는 HAWK에 대한 개선된 공격이다. HAWK는 NIST(미국 표준화 기관)의 포스트 양자 디지털 서명 대회 3차 라운드 후보이다. 60시간의 작업과 약 10만 달러의 API 비용으로, 모델은 HAWK-256의 유효 키 크기를 절반으로 줄이는 공격을 찾아냈다. 전체 공격의 추정 비용은 2^64 연산에서 2^38 연산으로 내려갔다. 두 번째 결과는 10라운드 중 7라운드로 줄인 AES-128 버전에 대한 것이다. *Möbius Bridge(뫼비우스 브리지)*라는 이름의 새로운 기법은 알려진 최선의 공격보다 200배에서 800배 빠르게 만들었으며, 비용도 비슷했다. 모델은 처음에는 이 과제가 불가능하다고 판단했지만 연구진의 독려 아래 계속 시도했고, 이후 연구진이 결과 검증에 수백 시간을 들였다.
Anthropic은 실제 운영 중인 시스템은 영향을 받지 않는다고 강조한다. HAWK는 아직 배포되지 않은 후보일 뿐이며, AES에 대한 공격도 약화된 암호 버전에만 적용된다. 완전한 10라운드 AES는 깨지지 않았다. 예비 결과는 LEA(13라운드에서 1시간도 안 되어 키 복구), Serpent-128(6라운드 완전 공격), 그리고 Salsa20, Poseidon, SHA-1에서의 더 제한적인 성과도 보여준다.
이 연구를 더 발전시키기 위해 Anthropic은 ETH Zurich, Tel Aviv University, TU Berlin과 협력해 모델의 암호분석 능력을 측정하기 위한 벤치마크인 CryptanalysisBench를 구축한다.
| 암호 대상 | 얻어진 결과 |
|---|---|
| HAWK-256 (포스트 양자 서명) | 유효 키 크기 절반으로 감소 (2^64 → 2^38), 60시간 만에 발견 |
| 10라운드 중 7라운드로 줄인 AES-128 | Möbius Bridge 기법을 통해 200배에서 800배 더 빠른 공격 |
| 24라운드 중 13라운드로 줄인 LEA | 데스크톱 컴퓨터에서 1시간도 안 되어 키 복구 |
| 32라운드 중 6라운드로 줄인 Serpent-128 | 새로운 완전 키 복구 공격 |
| Salsa20, Poseidon, SHA-1 | 알려진 최선의 공격보다 10배 미만의 향상 |
Google DeepMind가 Gemini Robotics ER 2를 출시하다
7월 30일 — Google DeepMind는 로봇에게 고수준의 두뇌를 제공하기 위한 가장 유능한 모델인 Gemini Robotics ER 2(Embodied Reasoning, 구현된 추론)를 출시한다. 이 모델은 물리적 세계를 이해하고, 사람과 대화하며, 여러 단계의 작업을 계획한 뒤, 하위 수준의 비전-언어-행동 모델에 운동 실행을 위임한다. 또한 Google Search나 개발자가 정의한 함수 같은 도구를 기본적으로 호출할 수 있다.
이전 버전(ER 1.6)과 비교했을 때 가장 큰 진전은 연속 비디오 이해다. 실시간 비디오 스트림을 관찰하는 동안 로봇은 자신의 진행 상황을 추적하고, 오류가 생기면 적응하며, 다음 단계로 넘어갈 정확한 시점을 알 수 있다. Google은 또한 다중 로봇 협업을 도입한다. 서로 다른 기계들(예를 들어 바퀴형 로봇과 휴머노이드)은 공유된 의미 이해를 통해 복잡한 작업을 나누어 맡는다. 이는 Apptronik의 Apollo 2 로봇과 Franka F3 Duo가 두 대로 차고를 정리하는 시연으로 입증되었다.
성능 측면에서 이 모델은 작업 진행 분류에서 57.4%의 정확도와, 행동해야 할 적절한 시점을 감지하는 데 91.3%의 정확도(평균 오차 0.96초)를 달성하며, 비슷한 정확도의 더 큰 모델들보다 실행 속도가 4배 빠르다. 안전성 측면에서 Google은 이것이 지금까지의 모델 중 가장 안전하다고 밝힌다. 사람이 가까이 다가오면 휴머노이드 로봇을 올바르게 정지시키고, 구역이 비워진 뒤에야 다시 작업을 재개한다.
이 모델은 오늘부터 Gemini API와 Google AI Studio를 통해 개발자에게 제공되며, Gemini Enterprise Agent 플랫폼에서는 제한된 조기 접근이 가능하다. Boston Dynamics의 Spot 로봇이 음성 명령으로 간식을 가지러 가는 시연도 GitHub의 코드와 함께 문서화되어 있다.
| 성능 지표 | 측정 결과 |
|---|---|
| 작업 진행 분류 | 57.4% 정확도 |
| 행동할 적절한 시점 감지 | 91.3% 정확도, 평균 오차 0.96초 |
| 더 큰 모델 대비 실행 속도 | 4배 빠름 |
Cursor: 클라우드 에이전트가 병합된 pull request의 56%를 완료하다
7월 30일 — Cursor는 클라우드 에이전트의 채택에 관한 인상적인 내부 수치를 공유한다. 12월에는 병합된 pull request 10개 중 1개만이 클라우드 에이전트에서 나왔지만, 오늘은 그 비율이 56%에 이른다. 회사는 이 성장을 에이전트에게 자체 클라우드 머신을 제공하고, 실행 환경을 스스로 수정하고 개선할 수 있게 한 데서 비롯된 것으로 본다. 그 결과 에이전트는 더 긴 엔지니어링 작업을 처음부터 끝까지 수행할 수 있다.
In December, 1 in 10 of our merged PRs came from cloud agents. Today, it’s 56%, as we use cloud agents to complete longer engineering tasks from start to finish. We got here by giving agents their own cloud computers and letting them fix and improve their environments.
🇰🇷 12월에는 병합된 PR 10개 중 1개만 클라우드 에이전트에서 나왔습니다. 오늘은 클라우드 에이전트를 활용해 더 긴 엔지니어링 작업을 처음부터 끝까지 수행함으로써 그 비율이 56%에 이르렀습니다. 우리는 에이전트에게 자체 클라우드 컴퓨터를 제공하고, 그들이 환경을 수정하고 개선하도록 허용함으로써 여기에 도달했습니다. — @cursor_ai X에서
스택형 pull request가 GitHub에서 프리뷰로 제공되고, Devin이 같은 날 이를 채택하다
7월 30일 — 하나의 워크플로우를 둘러싼 두 개의 별도 발표가 같은 날 나왔다. 큰 변경을 여러 개의 더 작은 pull request로 나누어, 각각 독립적으로 검토할 수 있게 하는 방식이다.
GitHub가 stacked pull request를 일반화하다
GitHub는 stacked pull requests를 모든 저장소에서 공개 프리뷰로 제공한다. 거대한 pull request 하나나 수동으로 rebase해야 하는 여러 브랜치 대신, 변경 사항은 정렬된 계층으로 분해되며, 각 계층은 검토 중인 위치를 전체 구조 속에서 보여주는 « stack map »을 통해 검토할 수 있고, 이후 한 번의 작업으로 병합할 수 있다. 가장 위의 계층을 병합하면 그 아래의 모든 항목이 자동으로 함께 반영되고, 중간 계층을 병합하면 열려 있는 아래쪽 계층들이 자동으로 rebase 및 재대상 지정되며, 기존 브랜치 보호는 그대로 유지된다. 이 기능은 github.com, CLI(확장 gh-stack), 모바일 앱에서 사용할 수 있으며, 전용 기능 gh-stack를 통해 GitHub Copilot 같은 코딩 에이전트에서도 바로 사용할 수 있다.
Devin(Cognition)이 이를 기본 지원하다
같은 날, Cognition의 소프트웨어 엔지니어링 에이전트 Devin은 GitHub의 stacked PR을 기본적으로 지원한다고 발표한다. 즉, 큰 변경을 더 작은 diff로 나누고, 전체 스택을 가로지르며 리뷰 코멘트를 처리하고 수정하며, 한 계층이 바뀌면 하위 변경 사항을 자동으로 rebase한다. 플랫폼 쪽과 에이전트 쪽의 동시 채택은 이 새로운 리뷰 모델이 인간 개발자뿐 아니라 자율 에이전트가 주도하는 워크플로우에도 곧바로 자리 잡고 있음을 보여준다.
Amp Labs가 Westpac 은행과 파트너십을 맺다
7월 29일 — Sourcegraph의 독립 스핀오프인 Amp의 서비스/컨설팅 부문인 Amp Labs는 Westpac과의 파트너십을 발표한다. Westpac은 200년이 넘는 역사를 가진 호주에서 가장 오래된 은행 중 하나다. 목표는 은행이 기술을 구축하고 제공하는 방식을 바꾸는 것으로, 특히 수백만 명이 사용하는 데이터 시스템의 마이그레이션과 현대화에 초점을 맞춘다. 전담 팀이 시드니 현지에서 Westpac 엔지니어들과 함께 일하게 된다. 기사에는 Block, Ethereum Foundation, Google, Canva 출신으로 구성된 프로젝트 창립 팀이 소개되며, 시드니 현지 채용도 시작된다. 이 파트너십은 단순한 소프트웨어 구독을 넘어 코딩 에이전트 주변의 서비스 제공이 커지고 있음을 보여준다. Amp Labs는 이제 자사 에이전트에 기반한 현장 상주 인력을 판매한다.
GPT-5.6 API 가격 인하, Sol의 Fast 모드
7월 30일 — 전날 얻은 효율성 향상(GPT-5.6 Sol이 이미 생산용 핵심 코드를 스스로 최적화한 내용, 이미 다룸)을 바탕으로 OpenAI는 GPT-5.6 Luna(가장 빠르고 저렴한 모델)의 API 가격을 80% 인하하고, GPT-5.6 Terra(일반 사용에 적합한 균형형 모델)의 가격을 20% 인하한다. 이러한 인하 효과는 Codex와 ChatGPT Work 구독의 크레딧 소모에도 반영되지만, 할당량이나 구독 가격은 변경되지 않는다.
OpenAI는 또한 API에 Fast 모드를 도입하여 Priority Processing 상품을 대체한다. GPT-5.6 Sol의 경우, 이 모드는 표준 처리보다 최대 2.5배 빠른 속도를 제공하며, 가격은 두 배지만 지능 수준은 변하지 않는다. 기존의 « priority » 태그가 붙은 요청은 자동으로 이 새로운 모드로 전환된다. Replit, Notion, Ramp, Blitzy, Cognition, Dust를 포함한 여러 기업 고객이 사례로 언급된다.
| 모델 및 모드 | 7월 30일부터의 가격 |
|---|---|
| GPT-5.6 Terra (입력 / 출력) | 백만 토큰당 2달러 및 12달러 |
| GPT-5.6 Luna (입력 / 출력) | 백만 토큰당 0.20달러 및 1.20달러 |
| GPT-5.6 Sol, Fast 모드 | 최대 2.5배 빠름, 가격은 두 배 |
GPT‑5.6 Luna is the closest we’ve come to intelligence too cheap to meter. I’ve never seen a model this affordable be this powerful — it’s unlocking use cases for Replit we didn’t expect to build for a long time.
🇰🇷 GPT-5.6 Luna는 측정하기에는 너무 저렴한 지능에 가장 가까운 것입니다. 이렇게 저렴한 모델이 이렇게 강력한 것을 본 적이 없습니다. 이는 Replit에게 우리가 한동안은 만들 수 없다고 생각했던 사용 사례를 열어 줍니다. — Michele Catasta, Replit의 사장 겸 Head of AI — OpenAI 인용
두 가지 API 설정이 ARC-AGI-3에서 GPT-5.6 Sol의 점수를 세 배로 끌어올리다
7월 29일 — OpenAI는 2D 퍼즐 벤치마크 ARC-AGI-3에서 GPT-5.6 Sol(7.8%)과 GPT-5.5(0.4%)의 초기 낮은 점수에 대한 분석을 발표한다. 한편 Sol은 열린 수학 문제를 풀고 복잡한 비디오 게임도 이겨냈다. 조사에 따르면 벤치마크의 공식 하니스는 각 동작 후 모델의 비공개 추론을 삭제하고, 슬라이딩 윈도우로 히스토리를 잘라 버리기 때문에, 과거의 생각과 행동을 기억하지 못하게 된다.
OpenAI의 Responses API(실제로 ChatGPT와 Codex에서 생산 환경에 사용되는 것)를 사용해 하니스를 다시 구성하고, 추론 보존과 자르기 대신 압축을 활성화하자, 공개 집합에서 GPT-5.6 Sol의 점수는 13.3%에서 38.3%로 상승했고, 출력 토큰 수는 6분의 1로 줄었다. 인간 기준은 48%로 추정된다. OpenAI는 여기서 일반적인 권고를 도출한다. 실제 사용에 가까운 평가를 얻으려면 오래된 Chat Completions API보다 Responses API를 사용하라는 것이다.
| 테스트된 구성 | 얻은 점수 (ARC-AGI-3) |
|---|---|
| 벤치마크 공식 하니스 | 13.3% |
| 추론 보존 및 압축 | 38.3% (출력 토큰 6분의 1) |
| 추정 인간 기준 | 48% |
Visual Studio의 GitHub Copilot: 7월 결산
7월 30일 — GitHub는 GitHub Copilot in Visual Studio 2026에 대한 월간 요약을 공개하며 네 가지 새 기능을 소개한다. 새로운 **Agent(Preview)**가 Copilot Chat 선택기 안에 나타나는데, 이는 GitHub Copilot CLI를 구동하는 것과 같은 Copilot SDK 위에 구축되어 더 짧은 응답과 더 적은 왕복으로 작업을 성공시키는 것을 약속한다. 해당 워크로드가 설치되면, 관련 내부 팀이 작성한 .NET 및 Azure 내장 스킬이 도구 선택기의 « Built-in » 범주에 자동으로 나타난다(기본 비활성화). Review Selection 기능은 코드를 선택한 뒤 마우스 오른쪽 버튼을 클릭하면 바로 활용 가능한 인라인 코멘트를 얻을 수 있게 한다. 마지막으로, 조직 수준 맞춤 지침을 통해 조직 소유자가 모든 저장소에 자동 적용되는 공유 설정을 정의할 수 있다. 이는 Business 및 Enterprise 요금제 전용이며, 나머지 세 가지 새 기능은 모든 요금제에서 제공된다.
🔗 7월 결산 — Visual Studio의 GitHub Copilot
Genspark, AI Workspace 6.0용 지속 메모리 SecondBrain 공개
7월 29일 — Genspark는 COO Wen Sang의 언론 인터뷰를 통해, 이미 7월 20일에 출시된 AI Workspace 6.0의 기능 SecondBrain을 소개했다. 핵심은 AI 에이전트의 « 메모리 문제 »다. 에이전트가 한 세션에서 다음 세션으로 프로젝트의 맥락을 잊어버린다는 점이다. 사용자의 명시적 허가가 있으면 SecondBrain은 이메일, 캘린더, 대화 기록, 회의 노트, 그리고 Gmail, Slack, Notion, HubSpot, Microsoft 365… 같은 외부 도구에 연결되어 Genspark의 Super Agent가 활용할 수 있는 개인 맥락 계층을 구성한다. 문서화된 실제 활용 사례도 여러 가지다. 주간 자동 요약, 참석자 맥락이 포함된 회의 전 브리핑, 또는 연결된 모든 소스에 걸친 횡단 검색 등이 그것이다. Genspark는 이 소프트웨어를 별도 판매되는 물리적 녹음 장치인 SecondBrain Note와 구분하며, 이는 여러 입력 채널 중 하나에 불과한 선택적 진입점일 뿐이라고 설명한다.
Perplexity, Computer에서 Spaces의 진화형 Projects 출시
7월 30일 — Perplexity는 에이전트 오케스트레이션 환경인 Computer에서 Spaces를 Projects로 대체했다. 이는 장기 작업을 위한 지속형 작업 공간으로, 후속 작업들이 처음부터 다시 시작하지 않고도 이어받을 수 있도록 공유형 계층 파일 시스템을 갖추고 있다. Projects는 Computer의 자기 개선형 메모리 시스템인 Brain과 연결되며, Brain은 각 작업 사이에 Project의 파일과 세션을 다시 읽어 다음 작업이 누적된 맥락을 바탕으로 시작되게 한다. 협업 측면도 강조된다. 팀의 여러 구성원이 같은 Project에서 작업할 수 있지만, 각자의 개인 메모리와 커넥터는 자신의 계정에 분리된 상태로 유지된다. Perplexity는 Google Drive, Notion, Linear, Snowflake, GitHub를 포함해 400개 이상의 도구와 연결 가능하다고 밝히며, Slack과 Microsoft Teams 통합도 제공한다. 기존 Spaces는 자동으로 이전되며, 오늘부터 모든 Computer 사용자가 이용할 수 있다.
🔗 Spaces가 Projects로 — Perplexity
Gemini Spark, Chrome에 통합되고 160개 이상 국가로 확대
7월 30일 — Google은 웹 작업 자동화 도우미인 Gemini Spark를 Chrome auto browse라는 이름의 직접 통합 기능과 함께 확장했다. 사용자의 허가가 있으면 Spark는 이제 브라우저에 연결된 계정과 저장된 비밀번호를 활용해, 번거로운 작업을 수행할 수 있다. 예를 들어 저장해 둔 아파트 방문 일정을 잡거나, 항공편을 검색하고 예약을 시작하는 일 등이 가능하다. Google은 이러한 작업이 prompt injection 시도에 대해 보호되며, 결제 같은 민감한 단계는 항상 사용자에게 되돌려 최종 확인을 받도록 설계되었다고 설명한다. 기능은 미국에서 시작되며, 이후 다른 지역으로 확대될 예정이다. 동시에 Spark 접근 권한은 오늘부터 160개 이상 추가 국가의 Google AI Pro 구독자에게도 확대된다. 이는 7월 23일 미국 한정 확대보다 훨씬 큰 범위다.
Nano Banana, Google Earth에 상륙
7월 30일 — Google Earth는 이제 Google의 이미지 생성 모델인 Nano Banana 2를 웹 인터페이스에 직접 통합한다. 사용자는 특정 장소로 확대하고 « create image »를 클릭한 뒤 보고 싶은 내용을 설명하기만 하면 된다. 그러면 모델은 일반적인 장면이 아니라 해당 장소의 실제 이미지 자료(위성, 항공, 3D 뷰)에 기반한 이미지를 생성한다. 이 기사에서는 다섯 가지 구체적 활용 사례를 다룬다. 역사적 장소 재현(서기 78년 당시의 폼페이 유적), 특정 장소를 위한 교육용 인포그래픽 제작, 부동산 또는 도시계획 프로젝트의 도면 생성, 공사 전 건설 프로젝트 시각화, 또는 단순히 장소를 상상적으로 재해석하는 것 등이 그것이다. 이 기능은 오늘부터 전 세계 모든 Google Earth 웹 사용자에게 제공되며, 지역 제한이나 별도 구독 단계는 없다.
🔗 Google Earth의 Nano Banana — Google
ElevenLabs, ElevenCreative Audiobooks에 Character Casting 도입
7월 30일 — ElevenLabs는 AI 오디오북 제작 도구 모음인 ElevenCreative Audiobooks에 Character Casting을 도입한다. 이 기능은 전체 원고를 가져온 뒤, 실제 텍스트의 대사에 대해 서로 다른 목소리를 직접 미리 들어보고 각 등장인물에 고유한 목소리를 지정할 수 있게 해준다. 목표는 AI 생성 오디오북 제작에서 지금까지 수작업이고 시간이 많이 들던 음성 캐스팅 과정을 단순화하는 것이다. 이제 스튜디오는 일반적인 데모 텍스트가 아니라 책 안에서 실제로 발화되는 대사에 맞춰 목소리를 조정할 수 있다.
🔗 Character Casting — ElevenLabs
Inkling-Small: Thinking Machines가 공개하고 NVIDIA가 같은 날 지원
7월 30일 — Mira Murati의 연구소 Thinking Machines가 Inkling-Small을 출시했다. 이는 Inkling의 압축 버전으로, 총 2760억 개의 파라미터, 120억 개의 활성 파라미터, NVFP4 양자화를 사용하며, Hugging Face에 따르면 더 큰 4배 규모의 Inkling과 비슷한 성능을 보이면서 코드에서는 더 좋은 결과를 낸다. 전체 가중치는 공개되며, Tinker를 통한 fine-tuning과 Tinker Playground(텍스트, 이미지, 오디오)에서의 시험이 가능하다. Hugging Face는 같은 날 벤치마크와 성능을 다룬 전용 블로그와 Hub의 모델 컬렉션으로 출시를 더욱 강조했다.
NVIDIA는 같은 날 NVIDIA NeMo와 DGX Station에서의 Inkling-Small 호환성을 발표해 fine-tuning을 지원했으며, NVFP4 형식의 전용 checkpoint를 Hugging Face에 직접 공개했다. 이렇게 출시 당일(day-0)부터 제공되는 하드웨어 지원은 이제 생태계가 제3의 개방형 모델을 중심으로 얼마나 빠르게 조율되는지를 보여준다. 연구소는 가중치를 공개하고, Hugging Face는 성능을 문서화하며, NVIDIA는 자사 fine-tuning 인프라의 호환성을 보장한다. 이 모든 것이 단 하루 안에 이뤄졌다.
| 기술적 특성 | 측정값 |
|---|---|
| 총 / 활성 파라미터 | 2760억 / 120억 |
| 양자화 | NVFP4 |
| day-0 하드웨어 호환성 | DGX Station의 NVIDIA NeMo |
Sakana AI와 NYU, Minecraft용 Dream-Cubed 데이터셋과 모델 공개
7월 29일 — Sakana AI는 뉴욕대학교(NYU)와 함께 Dream-Cubed : Controllable Generative Modeling in Minecraft by Training on Billions of Cubes를 공개했다. 기여는 두 가지다. 하나는 Minecraft 세계의 대규모 데이터셋으로, 절차적으로 생성된 지형과 인간의 동의를 얻어 제작된 맵에서 나온 수십억 개의 « cubes »를 포함한다. 다른 하나는 이 cubes를 언어 모델의 단어처럼 토큰화 단위로 삼아 학습한 transformers 계열 모델이다. 이 모델들은 큐브 단위 해상도의 상호작용형 3D 환경을 실시간으로 생성하고 편집할 수 있으며, 대상 영역을 지정한 inpainting, 대규모 outpainting, 사용자 조건 기반 생성이 가능하고, 임의 크기의 월드를 다룰 수 있다. 데이터셋, 학습 코드, 논문은 모두 공개되었다.
Together AI와 Y Combinator, YC 스타트업 전용 GPU 클러스터 출시
7월 30일 — Together AI와 Y Combinator는 YC 스타트업 포트폴리오를 위한 첫 전용 GPU 클러스터를 제공하는 파트너십을 발표했다. 목표는 젊은 AI 스타트업의 가장 큰 병목인 계산 자원 접근 문제를 해결하는 것이다. 특히 종종 전체 현금 보유액을 초과하는 수년짜리 compute 계약을 맺도록 강요하지 않으려는 데 있다. YC 포트폴리오 스타트업은 Together AI의 셀프서비스 포털을 통해 GPU를 예약, 프로비저닝, 관리할 수 있으며, 긴 약정 없이도 추론과 학습에 필요한 자원을 사용할 수 있고, 보통 장기 계약에만 제공되는 요금 혜택도 누릴 수 있다. 같은 날 Together AI는 오픈 소스 모델이 강화학습을 통해 파운데이션 모델 수준에 도달할 수 있는지 탐구하는 스타트업 Osmosis_AI의 첫 구체적 활용 사례도 소개했다.
🔗 YC 전용 GPU 클러스터 — Together AI
LightOn, Hugging Face 블로그에 mDenseOn & mLateOn 공개
7월 30일 — 프랑스 연구소 LightOn AI는 Hugging Face 블로그에 mDenseOn & mLateOn 컬렉션을 공개했다. 이는 단일 벡터 및 다중 벡터 정보 검색(retrieval) 모델과 관련 데이터셋으로, 다국어 검색, 긴 컨텍스트, 코드 검색에 특화되어 있으며, 총 18개 항목이 오픈 가중치로 발표되었다. 이번 공개는 7월 28일 LiquidAI(LFM2.5-Encoders)의 발표와 같은 흐름이다. 즉, 제3의 연구소가 공식 출시 채널로 Hugging Face 블로그를 사용하고, 모델 카드와 컬렉션을 Hub에 직접 호스팅하는 방식이다.
🔗 mDenseOn & mLateOn — Hugging Face 블로그
간단 소식
- Cognition, FrontierCode 1.1 업데이트 — GPT-5.6 Terra와 Luna의 새로운 가격 인하를 반영해, 이 시리즈는 이제 비용/성능 파레토 곡선 위에 자리하게 되었다. 🔗 출처
- Hugging Face, Trackio Logbooks 출시 — Trackio 0.34.0은 AI 실험의 코드, 에이전트 추적, 아티팩트를 재현 가능한 정적 HTML 번들 형태로 자동 캡처한다. 🔗 출처
- Antigravity CLI 1.1.8로 업데이트 — print 모드용 구조화된 출력 형식(json, stream-json), 사용자 정의 JSON 스키마 검증, 복합 명령에 대한 개선된 권한을 제공한다. 🔗 출처
- GitHub Models, 공식 종료 — playground, 모델 카탈로그, 추론 API, BYOK는 더 이상 어떤 고객도 이용할 수 없으며, GitHub는 Microsoft Foundry 또는 GitHub Copilot으로 안내한다. 🔗 출처
- GitHub, 원격 제어를 관리 장치로 제한 — 원격 제어 Copilot 세션을 위한 새로운 기업 설정
remoteControl(requireSSO / disabled / enabled)으로, private repository, MDM 또는 구성 파일을 통해 배포할 수 있다. 🔗 출처 - Kimi K3 (Max), Fullstack Code Arena 1위 — GPT-5.6 Sol (xHigh)과 Claude Fable 5를 제치고 선두에 올랐으며, 개방형 모델이 전체 개발 작업에서 폐쇄형 모델을 따라잡고 있다는 또 하나의 신호다(위의 Inkling-Small 참고). 🔗 출처
이것이 의미하는 바
기초 연구가 연구실 밖으로 나온다. Claude Mythos는 NIST의 양자내성 후보와 약화된 AES 버전에서 새로운 취약점을 찾아낸다. 이는 생산 환경에서 바로 악용 가능한 결함이 아니라 연구 돌파구에 가깝지만, 내부 연구 모델이 수십 년 동안 인간이 탐구해 온 분야를 얼마나 빠르게 진전시킬 수 있는지를 보여준다. 같은 날 Gemini Robotics ER 2는 구현형 로봇을 한 대의 지시에 따르는 수준에서 여러 기계가 서로 조율해 공동 작업을 수행하는 단계로 끌어올린다. Google Earth는 이미지 생성을 다시 현실 세계에 고정한다. Nano Banana는 더 이상 일반적인 장면을 그리지 않고, 특정 장소의 위성 이미지로부터 재구성이나 투영을 만든다. 한편 Gemini Spark는 Chrome을 통해 텍스트에서 사용자의 실제 웹 환경에 대한 구체적 행동으로 넘어간다. 7월 30일, AI가 순수한 대화 영역을 벗어나는 서로 다른 네 가지 방식이다.
추론 경제는 계속 개발자에게 유리한 방향으로 뒤집히고 있다. OpenAI는 GPT-5.6 Luna의 API 가격을 80%, Terra의 가격을 20% 내리면서, 두 배 더 비싸지만 2.5배 더 빠른 Fast 모드를 도입했다. 이는 실제 사용량에 맞춰 가격을 조정하는 상반된 두 방식이다. 같은 날 OpenAI의 분석은, 단순한 API 설정 변경(추론 유지, compaction)이 GPT-5.6 Sol의 ARC-AGI-3 점수를 세 배로 끌어올리면서 출력 토큰 사용량을 6분의 1로 줄인다는 것을 보여준다. 모델의 성능은 모델 자체만큼이나 그것을 실행하는 harness에 달려 있다. Cognition은 이를 즉각 반영해 자체 벤치마크 FrontierCode를 업데이트했고, 새로운 할인 정책 덕분에 GPT-5.6은 비용/성능 파레토 곡선 위에 다시 올라섰다.
개방형 모델은 계속 폐쇄형 모델을 따라잡고 있다. Thinking Machines는 출시 즉시 NVIDIA 하드웨어 지원이 가능한 Inkling-Small을 공개했고, Sakana AI와 NYU는 Minecraft용 생성형 데이터셋과 모델을 개방했으며, LightOn은 다국어 정보 검색 모델 컬렉션을 공개했다. 서로 다른 세 연구소가 같은 날 Hugging Face 블로그를 통해 연구를 발표하고 문서화한 것이다. 이미 Agent Arena에서 선두에 있던 Kimi K3 (Max)는 Fullstack Code Arena에서도 GPT-5.6 Sol과 Claude Fable 5를 제치고 1위를 차지했다. 그리고 Together AI와 Y Combinator는 이 생태계의 진짜 병목으로 남아 있는 계산 자원 접근 문제를 해결하기 위해, YC 포트폴리오의 AI 스타트업에 전용 GPU 클러스터를 제공하며 장기 약정을 요구하지 않는 방식을 택했다.
코드 에이전트의 산업화가 가속화되고 있다. Cursor에서는 클라우드 에이전트가 만든 병합된 pull request 비중이 12월의 10%에서 현재 56%로 늘었다. GitHub는 스태킹된 pull request를 공개 프리뷰로 일반화했고, Devin(Cognition)은 같은 날 이를 기본적으로 지원하기 시작했다. 플랫폼과 에이전트 양쪽에서 동시에 채택되는 동일한 리뷰 워크플로가 등장한 셈이다. Amp Labs는 이제 에이전트뿐 아니라 현장 상주 인력(시드니의 Westpac 현장 팀)까지 제공한다. 한편 GitHub는 Visual Studio의 Copilot에 SDK 기반 신규 에이전트를 더했다. Genspark와 Perplexity는 관련된 또 다른 문제인 메모리 문제를 해결하고 있다. SecondBrain과 Projects는 모두 에이전트에 세션 간 지속되는 맥락을 부여해, 매번 처음부터 다시 시작하지 않고도 긴 작업을 수행할 수 있게 한다.
출처
- Anthropic — X 발표
- Anthropic — 완전한 암호해독 연구
- Google DeepMind — Gemini Robotics ER 2
- Cursor — 병합된 PR의 56%
- GitHub — 스택형 pull request 프리뷰
- Cognition — Devin의 Stacked PR 지원
- Amp Labs — Westpac 파트너십
- OpenAI — GPT-5.6 가격 인하
- OpenAI — ARC-AGI-3 점수를 세 배로 끌어올린 두 가지 설정
- GitHub — Visual Studio의 Copilot, 7월 결산
- Genspark — SecondBrain
- Perplexity — Spaces가 Projects로 변경
- Google — Gemini Spark의 Chrome 통합
- Google — Google Earth의 Nano Banana
- ElevenLabs — Character Casting
- Thinking Machines — Inkling-Small
- NVIDIA — Inkling-Small용 NeMo/DGX 지원
- Sakana AI — Dream-Cubed
- Together AI — YC 전용 GPU 클러스터
- LightOn — mDenseOn & mLateOn
- Cognition — FrontierCode 1.1
- Hugging Face — Trackio Logbooks
- Google — Antigravity CLI 1.1.8
- GitHub — GitHub Models 종료
- GitHub — 원격 제어 제한
- Arena.ai — Fullstack Code Arena