ai-powered-markdown-translatorfr から ja へ翻訳された記事、gpt-5.4-mini による。
2026年7月30日は2つの研究的進展が主役となる。Anthropicの社内研究モデルであるClaude Mythosは、NISTの耐量子候補暗号とAESの弱体化版において前例のない暗号学的脆弱性を発見し、一方でGoogle DeepMindは、複数のロボットが同じ作業で協調できるGemini Robotics ER 2を発表した。この2つを中心に、OpenAIによるGPT-5.6の値下げ、GitHubとDevinでの積み重ね式プルリクエストの同時採用、複数のオープンモデルのリリース(Thinking Machines、Sakana AI、LightOn)、そしてエージェント関連の一連のアップデート(Perplexity、Genspark、Gemini)が展開される。
Claude Mythosが前例のない暗号学的脆弱性を発見(HAWK、AES)
7月30日 — AnthropicはFrontier Red Teamによる研究を公開し、Claude Mythos Preview、すなわち同社の最も高度で非商用の社内研究モデルが、OpenSSLのようなライブラリでClaudeがすでに見つけられていた実装バグを超えて、2つの主要な暗号アルゴリズムにおける未発見の数学的脆弱性を明らかにしたと発表した。この発表は7月28日にXで公開され、その後、詳細なブログ記事でも説明された。
最初の成果は、NIST(米国の標準化機関)の耐量子デジタル署名コンペティション第3ラウンド候補であるHAWKに対する改良攻撃である。60時間の作業と、API費用として約10万ドルをかけて、このモデルはHAWK-256の実効鍵サイズを半減させる攻撃を見つけた。完全攻撃に必要な推定コストは、2^64回から2^38回の演算へと下がる。2つ目の成果は、AES-128を10ラウンド中7ラウンドに削減した版に対するもので、Möbius Bridge(メビウス・ブリッジ) と名付けられた新技術が、既知の最良攻撃を200倍から800倍高速化した。こちらも費用は同程度で、当初モデルはその課題を不可能と判断したが、研究者の働きかけで粘り強く継続し、その後研究者側が結果の検証に数百時間を費やした。
Anthropicは、実運用中のシステムに影響はないと明言する。HAWKは未展開の候補にすぎず、AESへの攻撃も弱体化した暗号方式にのみ適用されるため、10ラウンド完全版のAESは破られていない。予備結果としては、LEA(13ラウンドで1時間未満で鍵回収)、Serpent-128(6ラウンドで完全攻撃)、さらにSalsa20、Poseidon、SHA-1に対する限定的な改善も報告されている。
これらの研究をさらに深めるため、AnthropicはETH Zurich、Tel Aviv University、TU Berlinと提携し、モデルの暗号解読能力を測定するためのベンチマークCryptanalysisBenchを構築する。
| 暗号対象 | 得られた結果 |
|---|---|
| HAWK-256(耐量子署名) | 実効鍵サイズが半減(2^64 → 2^38)、60時間で発見 |
| 10ラウンド中7ラウンドに削減したAES-128 | Möbius Bridge手法により200〜800倍高速な攻撃 |
| 24ラウンド中13ラウンドに削減したLEA | デスクトップPCで1時間未満の鍵回収 |
| 32ラウンド中6ラウンドに削減したSerpent-128 | 新たな完全鍵回収攻撃 |
| Salsa20、Poseidon、SHA-1 | 既知の最良攻撃に対して10倍未満の改善 |
Google DeepMindがGemini Robotics ER 2を発表
7月30日 — Google DeepMindは、ロボットに高次の頭脳を与えるための最も高性能なモデルであるGemini Robotics ER 2(Embodied Reasoning、身体化推論)を発表した。これは物理世界を理解し、人間と対話し、複数段階のタスクを計画し、その後、下位のvision-language-actionモデルに動作実行を委ねる。また、Google Searchや開発者定義の関数のようなツールもネイティブに呼び出せる。
前バージョン(ER 1.6)と比べた主な進化は、連続動画理解にある。ライブ映像ストリームを観察することで、ロボットは自分の進捗を追跡し、エラー発生時に適応し、次のステップに移るべき正確なタイミングを把握できる。Googleはさらにマルチロボット協調も導入した。異なる機械(たとえば車輪付きロボットとヒューマノイド)が共有された意味理解を通じてコミュニケーションを取り、複雑なタスクを分担する。これはApptronikのApollo 2とFranka F3 Duoのロボットで実演され、2台でガレージを片付けた。
性能面では、このモデルはタスク進行分類で57.4%の精度、適切な行動タイミングの検出で91.3%の精度(平均誤差0.96秒)を達成し、同等の精度を持つより大型のモデルに対して4倍の実行速度を示した。安全性については、Googleはこれが現時点で最も安全なモデルだと述べている。人が近づくとヒューマノイドを適切に停止し、区域が空くまで活動を再開しない。
このモデルは本日より、Gemini APIおよびGoogle AI Studioを通じて開発者向けに利用可能であり、Gemini Enterprise Agentプラットフォームでは限定的な先行アクセスも提供される。Boston DynamicsのSpotロボットが音声指示でスナックを取りに行くデモも、GitHub上のコード付きで公開されている。
| 性能指標 | 測定結果 |
|---|---|
| タスク進行の分類 | 57.4%の精度 |
| 行動すべき適切なタイミングの検出 | 91.3%の精度、平均誤差0.96秒 |
| 大型モデル比の実行速度 | 4倍高速 |
Cursor:クラウドエージェントがマージ済みプルリクエストの56%を完了
7月30日 — Cursorはクラウドエージェント採用に関する内部の注目すべき数値を共有した。12月には、マージされたプルリクエスト10件のうち1件だけがクラウドエージェントによるものだったが、現在はその割合が56%に達している。同社はこの進展を、エージェントに独自のクラウドマシンを与え、実行環境を自分で修正・改善できるようにしたことに帰している。これにより、より長いエンジニアリング作業を一気通貫で遂行できるようになった。
In December, 1 in 10 of our merged PRs came from cloud agents. Today, it’s 56%, as we use cloud agents to complete longer engineering tasks from start to finish. We got here by giving agents their own cloud computers and letting them fix and improve their environments.
🇯🇵 12月には、マージされたPR10件のうち1件がクラウドエージェントによるものでした。現在は56%です。これは、より長いエンジニアリング作業を最初から最後までやり遂げるためにクラウドエージェントを活用しているからです。私たちは、エージェントに専用のクラウドコンピュータを与え、環境を修正・改善できるようにすることで、ここまで来ました。 — @cursor_ai の X
GitHubの積み重ね式プルリクエストがプレビューに、Devinも同日に採用
7月30日 — 1つのワークフローをめぐって、同じ日に2つの異なる発表が行われた。大きな変更を、小さく独立してレビュー可能な複数のプルリクエストに分割するというものだ。
GitHubが stacked pull requests を一般向けプレビューへ
GitHubはstacked pull requestsを、すべてのリポジトリで公開プレビューに移行した。巨大なプルリクエスト1件や、手作業でリベースする複数ブランチの代わりに、変更は順序立てられた層に分割され、それぞれを「stack map」を通じてレビューできる。これは、レビュー中の層が全体のどこに位置するかを示し、その後1回の操作でまとめてマージできる。最上位の層をマージすると、その下にあるものは自動的にすべて着地し、中間の層をマージすると、残っている下位層が自動でリベースされ再ターゲットされる。既存のブランチ保護は失われない。この機能は、github.com、CLI(拡張機能 gh-stack)、モバイルアプリ、そしてGitHub Copilotのようなコーディングエージェントからも、専用機能 gh-stack を使って直接利用できる。
🔗 Stacked pull requests — GitHub
Devin(Cognition)も即日ネイティブ対応
同日、CognitionのソフトウェアエンジニアリングエージェントDevinは、GitHubのstacked PRsをネイティブにサポートすると発表した。大きな変更をより小さなdiffに分解し、パイル全体にわたってレビューコメントを処理・修正し、ある層が変化したときには下流の変更を自動でリベースする。プラットフォーム側とエージェント側が同時に採用したことは、この新しいレビュー手法が、自律エージェント主導のワークフローにそのまま入り込みつつあり、人間の開発者だけのものではないことを示している。
Amp LabsがWestpac銀行と提携
7月29日 — Ampのサービス/コンサルティング部門であり、Sourcegraphから独立したスピンオフであるAmp Labsは、オーストラリアで最も古い銀行の1つ、つまり200年以上の歴史を持つ企業であるWestpacとの提携を発表した。目的は、銀行が技術を構築し提供する方法を変革すること、とりわけ何百万人もの人々が利用するデータシステムの移行と近代化である。専任チームがシドニーの現地でWestpacのエンジニアと並んで作業する。記事では、Block、Ethereum Foundation、Google、Canva出身の創業チームも紹介され、シドニーでの現地採用も開始される。この提携は、単なるソフトウェアサブスクリプションを超えて、コーディングエージェントを中心としたサービス提供が拡大していることを示している。Amp Labsは今や、自社エージェントを基盤にした現地常駐の人的支援を販売している。
GPT-5.6 APIの価格引き下げ、SolにFastモード
7月30日 — 前日に得られた効率化の成果(GPT-5.6 Solが本番用コアを自ら最適化した件、既報)を踏まえ、OpenAIはGPT-5.6 Luna(最速かつ最安のモデル)のAPI価格を80%引き下げ、GPT-5.6 Terra(一般用途向けのバランス型モデル)を20%引き下げる。これらの値下げは、CodexおよびChatGPT Workのサブスクリプションにおけるクレジット消費にも反映されるが、利用枠やサブスクリプション価格に変更はない。
OpenAIはAPIにFastモードも導入する。これはPriority Processingの提供を置き換えるもので、GPT-5.6 Solでは標準処理の最大2.5倍の速度を、知能を変えずに、2倍の価格で提供する。既存の「priority」タグ付きリクエストは、自動的にこの新モードへ移行する。Replit、Notion、Ramp、Blitzy、Cognition、Dustなど、複数の企業顧客が証言として挙げられている。
| モデルとモード | 7月30日からの価格 |
|---|---|
| GPT-5.6 Terra(入力 / 出力) | 100万トークンあたり2ドルと12ドル |
| GPT-5.6 Luna(入力 / 出力) | 100万トークンあたり0.20ドルと1.20ドル |
| GPT-5.6 Sol、Fastモード | 最大2.5倍高速、価格は2倍 |
GPT‑5.6 Luna is the closest we’ve come to intelligence too cheap to meter. I’ve never seen a model this affordable be this powerful — it’s unlocking use cases for Replit we didn’t expect to build for a long time.
🇯🇵 GPT-5.6 Lunaは、測定するには安すぎる知能に最も近い存在です。これほど手頃なのに、これほど強力なモデルは見たことがありません。Replitにとって、これは長い間構築できないと思っていたユースケースを解き放つものです。 — Michele Catasta、President兼AI責任者、Replit — OpenAIによる引用
2つのAPI設定でGPT-5.6 SolのARC-AGI-3スコアが3倍に
7月29日 — OpenAIは、2DパズルベンチマークARC-AGI-3でのGPT-5.6 Sol(7.8%)とGPT-5.5(0.4%)の初期スコアが低かった理由について分析を公開した。一方でSolは、オープンな数学問題を解き、複雑なビデオゲームも打ち破っていた。調査によれば、ベンチマークの公式ハーネスは、各アクション後にモデルの私的推論を削除し、さらにスライディングウィンドウで履歴を切り詰めてしまうため、過去の思考や行動を記憶できなくなっていた。
OpenAIのResponses API(ChatGPTとCodexで本番利用されているもの)を用いてハーネスを再構築し、推論保持と切り詰めではなく圧縮を有効化すると、公開セットにおけるGPT-5.6 Solのスコアは13.3%から38.3%へ上昇し、出力トークンは6分の1になった。人間の参考値は48%と推定されている。OpenAIはここから一般的な推奨を導き出している。実運用に近い評価を得るには、旧来のChat Completions APIではなくResponses APIを使うべきだというものだ。
| テストした構成 | 得られたスコア(ARC-AGI-3) |
|---|---|
| ベンチマークの公式ハーネス | 13.3% |
| 推論保持と圧縮 | 38.3%(出力トークン6分の1) |
| 推定される人間の参考値 | 48% |
Visual StudioのGitHub Copilot:7月の振り返り
7月30日 — GitHubは、Visual Studio 2026のGitHub Copilotに関する月次アップデートを公開し、4つの新機能を紹介した。Copilot Chatのセレクタに新しいAgent (Preview)が追加され、GitHub Copilot CLIを支えるのと同じCopilot SDK上に構築されている。これにより、より短い応答と、少ない往復で完了するタスクが期待される。関連するワークロードがインストールされると、社内チームが作成した統合 .NET および Azure スキルが、自動的にツールセレクタの「Built-in」カテゴリに表示される(既定では無効)。Review Selection機能では、コードを選択して右クリックすると、実用的なインラインコメントを得られる。最後に、組織レベルのカスタム指示によって、組織所有者は共有された設定を定義し、すべてのリポジトリに自動適用できる。これはBusinessおよびEnterpriseプラン限定で、残る3つの新機能はすべてのプランで利用可能である。
🔗 7月の振り返り — Visual StudioのGitHub Copilot
Genspark、AI Workspace 6.0 向けの永続メモリ「SecondBrain」を発表
7月29日 — Genspark は、COO Wen Sang によるメディア向け発言を通じて、すでに7月20日に公開済みの AI Workspace 6.0 の一機能として SecondBrain を打ち出した。焦点は、AI エージェントがセッションをまたぐとプロジェクトの文脈を忘れてしまう「メモリ問題」にある。ユーザーの明示的な許可のもと、SecondBrain はメール、カレンダー、会話履歴、会議メモ、さらに Gmail、Slack、Notion、HubSpot、Microsoft 365 などの外部ツールに接続し、Genspark の Super Agent が利用できる個人向けコンテキスト層を構築する。具体的な用途としては、自動週次要約、参加者の文脈を含む会議前ブリーフ、接続済みソース全体を横断する検索などが示されている。Genspark はこのソフトウェアを、別売りの物理的な録音デバイスである SecondBrain Note と区別しており、後者はあくまで複数ある任意の入力チャネルの一つにすぎない。
Perplexity、Spaces の進化版として Projects を Computer に導入
7月30日 — Perplexity は、自社のエージェント・オーケストレーション環境である Computer において、「Spaces」を Projects に置き換える。これにより、長期的な作業のための永続的なワークスペースが提供され、共有された階層型ファイルシステム上で後続タスクがゼロからやり直すことなく積み上げられる。Projects は Computer の自己改善型メモリシステム Brain に接続し、タスク間で Project のファイルとセッションを読み返して、各新規タスクが蓄積済みの文脈から開始できるようにする。共同作業の側面も強調されており、チームの複数メンバーが同じ Project で作業しつつ、各自の個人メモリとコネクタは自分のアカウント内に分離されたまま維持される。Perplexity は 400 を超えるツール(Google Drive、Notion、Linear、Snowflake、GitHub など)への接続が可能だとし、Slack と Microsoft Teams の統合も挙げている。既存の Spaces は自動的に移行され、Computer の全ユーザーが本日から利用可能。
🔗 Spaces が Projects に — Perplexity
Gemini Spark、Chrome と統合し 160 以上の国・地域へ拡大
7月30日 — Google は、Web タスク自動化アシスタント Gemini Spark を、Chrome auto browse と名付けられた Chrome への直接統合によって拡張する。ユーザーの許可があれば、Spark はブラウザに保存されたログイン済みアカウントと保存パスワードを利用して、面倒な手続きを代行できるようになる。たとえば、保存済みのアパート内見を計画したり、航空券を検索して予約を開始したりできる。Google は、これらの操作はプロンプト注入攻撃から保護されており、支払いのような重要なステップは常にユーザーに戻して確認させると説明している。この機能は米国で開始され、今後ほかの地域にも拡大される予定だ。並行して、Spark へのアクセスは本日から Google AI Pro の加入者に対して 160 以上の追加国・地域へ広がる。これは、米国に限定されていた 7月23日の拡大よりもはるかに大きい展開である。
Nano Banana が Google Earth に登場
7月30日 — Google Earth は、Google の画像生成モデル Nano Banana 2 を Web インターフェースに直接統合した。場所をズームし、「create image」をクリックして、見たい内容を説明するだけでよい。モデルは、その場所の実際の画像(衛星・航空・3D の視点)に基づいた画像を生成し、ありふれた一般的なシーンではなく、その場所に根ざした表現を作り出す。記事では、具体的な用途として5つが紹介されている。歴史的遺跡の再現(西暦78年当時のポンペイ遺跡)、場所に関する教育用インフォグラフィックの作成、不動産や都市計画のプロジェクト図面の作成、工事前の建設計画の可視化、あるいは単純に場所を空想的に再解釈することだ。この機能は、地理的制限も特別な有料プランもなく、Google Earth の Web 版を使う全ユーザーに対して、今日から世界中で利用できる。
🔗 Google Earth の Nano Banana — Google
ElevenLabs、ElevenCreative Audiobooks に Character Casting を追加
7月30日 — ElevenLabs は、AI によるオーディオブック制作スイート ElevenCreative Audiobooks に Character Casting を導入する。この機能により、完全な原稿を取り込み、実際の本文中の対話に対して異なる音声を直接プレビューして、各登場人物に個別の声を割り当てることができる。目的は、AI 生成オーディオブック制作においてこれまで手作業で時間のかかっていたキャスティング作業を簡略化することにある。スタジオは今や、汎用的なデモ文ではなく、本の中で実際に発せられるセリフに合わせて声を決められる。
🔗 Character Casting — ElevenLabs
Inkling-Small: Thinking Machines が公開、NVIDIA も同日対応
7月30日 — Mira Murati の研究所である Thinking Machines は、Inkling-Small を公開した。これは Inkling の圧縮版で、合計 2760 億パラメータ、アクティブ 120 億パラメータ、NVFP4 量子化を採用し、Inkling と同等の性能を持ちながら、Hugging Face によればコードではより良い結果を示すという、4 倍大きいモデルである。完全な重みはオープンアクセスで公開され、Tinker を通じたファインチューニングや、Tinker Playground での試用(テキスト、画像、音声)が可能。Hugging Face は同日、この公開をベンチマークと性能に関する専用ブログ記事と、Hub 上のモデルコレクションで後押しした。
NVIDIA は同日に、DGX Station 上の NVIDIA NeMo との互換性を発表し、さらに NVFP4 形式の専用チェックポイントを Hugging Face に直接公開して、Inkling-Small のリリースを補強した。このように、発売初日から利用できるハードウェア対応は、今やオープンな第三者モデルを中心にエコシステムがどれほど迅速に連携するかを示している。研究所が重みを公開し、Hugging Face が性能を文書化し、NVIDIA が自社ファインチューニング基盤との互換性を保証する――それがたった1日で完結する。
| 技術的特徴 | 測定値 |
|---|---|
| 総パラメータ数 / アクティブ数 | 2760億 / 120億 |
| 量子化 | NVFP4 |
| day-0 ハードウェア互換性 | NVIDIA NeMo on DGX Station |
Sakana AI と NYU、Minecraft 向けのデータセットとモデル Dream-Cubed を公開
7月29日 — Sakana AI は、ニューヨーク大学(NYU)とともに Dream-Cubed : Controllable Generative Modeling in Minecraft by Training on Billions of Cubes を公開した。貢献は二つある。ひとつは Minecraft ワールドの大規模データセットで、手続き生成の地形や、同意を得た人間が構築したマップから得られた数百億単位の「キューブ」から成る。もうひとつは、言語モデリングにおける単語のように、これらのキューブをトークン化単位として学習した transformer 群である。これらのモデルにより、キューブ解像度でのインタラクティブな 3D 環境を、その場で生成・編集でき、狙いを定めた inpainting、大規模 outpainting、ユーザー条件付き生成を、任意サイズの世界に対して行える。データセット、学習コード、論文はオープンアクセスで公開されている。
Together AI と Y Combinator、YC スタートアップ向け専用 GPU クラスタを開始
7月30日 — Together AI と Y Combinator は、YC 配下のスタートアップ・ポートフォリオ向けに最初の専用 GPU クラスタを提供する提携を発表した。狙いは、若い AI スタートアップにとって最大のボトルネックである計算資源へのアクセスを解消することにある。多くの場合、彼らの総資金を超えるような複数年契約の compute 契約を結ばせる必要はない。YC ポートフォリオのスタートアップは、Together AI のセルフサービス・ポータルを通じて GPU を予約、プロビジョニング、管理でき、長期契約なしで、必要なときの推論や学習に利用できるうえ、通常は長期契約にのみ適用される料金を享受できる。同日、Together AI は最初の具体的な活用例として、オープンソースモデルが強化学習によって基盤モデルの水準に到達できるかを探るスタートアップ Osmosis_AI をこのクラスタ上で学習させていることを紹介した。
🔗 YC 専用 GPU クラスタ — Together AI
LightOn、Hugging Face のブログで mDenseOn & mLateOn を公開
7月30日 — フランスの研究所 LightOn AI は、Hugging Face のブログで mDenseOn & mLateOn コレクションを公開した。これは単一ベクトルおよびマルチベクトルの情報検索(retrieval)モデルと関連データセットであり、多言語検索、長文コンテキスト、コード検索に特化したものだ。全18要素がオープンウェイトとして公開されている。この公開は、7月28日の LiquidAI(LFM2.5-Encoders)の公開と同じ構図で、第三者研究所が Hugging Face ブログを公式ローンチ・チャネルとして使い、モデルカードとコレクションを直接 Hub にホストしている。
🔗 mDenseOn & mLateOn — Hugging Face ブログ
短報
- Cognition が FrontierCode 1.1 を更新 — GPT-5.6 Terra と Luna の新しい価格改定(上記参照)により、このシリーズはコスト/性能のパレート曲線上に位置づけられるようになった。 🔗 source
- Hugging Face が Trackio Logbooks を公開 — Trackio 0.34.0 は、AI 実験のコード、エージェントのトレース、成果物を、再現可能な静的 HTML バンドルとして自動的に記録する。 🔗 source
- Antigravity CLI が 1.1.8 に更新 — print モード向けの構造化出力形式(json、stream-json)、カスタム JSON スキーマによる検証、複合コマンドの権限強化が追加された。 🔗 source
- GitHub Models が正式に終了 — playground、モデルカタログ、推論 API、BYOK はいずれの顧客にも利用できなくなり、GitHub は Microsoft Foundry または GitHub Copilot へ誘導している。 🔗 source
- GitHub がリモート制御を管理対象デバイスに制限 — リモート制御 Copilot セッション向けの新しい企業設定
remoteControl(requireSSO / disabled / enabled)。プライベートリポジトリ、MDM、または設定ファイル経由で展開可能。 🔗 source - Kimi K3 (Max) が Fullstack Code Arena の首位に — GPT-5.6 Sol (xHigh) と Claude Fable 5 を上回り、Inkling-Small でも見られるように、オープンモデルが完全な開発タスクでクローズドモデルに追いつきつつあることを示す新たな兆候。 🔗 source
それが意味すること
基礎研究が研究室の外に出始めている。 Claude Mythos は、NIST の耐量子候補と AES の弱体化版にこれまで知られていなかった脆弱性を見つけた。これは研究上の突破口であり、実運用で悪用可能な欠陥ではないが、人間が何十年も研究してきた分野を、内部研究モデルがどれほどの速度で進めうるかを示している。同じ日、Gemini Robotics ER 2 は、身体化ロボティクスを「指示に従う単一ロボット」から、「複数の機械が相互に調整して共有タスクをこなす」段階へ引き上げた。Google Earth もまた、画像生成を現実世界に接地させた。Nano Banana はもはや汎用のシーンを描くのではなく、特定の場所の衛星画像から再現や投影を行う。一方で Gemini Spark は Chrome を介し、テキストからユーザーの現実の Web 上での具体的行動へと移行した。7月30日、AI が純粋な会話の領域を離れるための、四つの異なる方法が示された。
推論コストの経済は、引き続き開発者に有利な方向へ傾いている。 OpenAI は GPT-5.6 Luna の API 価格を 80%、Terra を 20% 引き下げる一方で、2倍高価だが 2.5 倍高速な Fast モードを導入した。これは、価格を実際の利用形態に合わせるための対照的な二つの方法である。同日、OpenAI の分析は、API の単純な設定変更(推論を維持し、コンパクションを有効化する)だけで、ARC-AGI-3 における GPT-5.6 Sol のスコアを3倍にしつつ、出力トークン消費を6分の1にできることを示した。モデルの性能は、モデルそのものと同じくらい、それを動かすハーネスにも左右される。Cognition はこれを受けて、自社ベンチマーク FrontierCode を更新し、新しい割引後の価格では GPT-5.6 がコスト/性能のパレート曲線上に乗ることを示した。
オープンモデルは、クローズドモデルに追いつき続けている。 Thinking Machines は、発売初日から NVIDIA のハードウェア対応付きで Inkling-Small を公開した。Sakana AI と NYU は Minecraft 向けのデータセットと生成モデルを開放し、LightOn は多言語情報検索モデルのコレクションを公開した。3つの別々の研究所が、同じチャネルである Hugging Face ブログを選び、同じ日に自分たちの研究を発表し、文書化したのである。Kimi K3 (Max) は、すでに Agent Arena のランキング首位にあるが、今回さらに Fullstack Code Arena でも GPT-5.6 Sol と Claude Fable 5 を抑えて1位を獲得した。そして Together AI は Y Combinator とともに、このエコシステムに残る真のボトルネックである計算資源へのアクセスに取り組み、YC ポートフォリオの AI スタートアップ向けに専用 GPU クラスタを提供し、複数年契約を強いることなくその問題を解消しようとしている。
コードエージェントの産業化が加速している。 Cursor では、マージされた PR のうちクラウドエージェント由来の割合が、12月の 10% から現在は 56% に達した。GitHub はスタック型 pull request を公開プレビューで一般提供し、Devin(Cognition)はその同日にネイティブ対応を開始した。プラットフォーム側とエージェント側の双方で、同じレビュー・ワークフローが同時に採用されたわけだ。Amp Labs は、エージェントに加えて現場での人的支援も売りにしており、Westpac 向けにはシドニーにチームを常駐させている。一方、GitHub は Copilot を Visual Studio で動く新しい SDK ベースのエージェントで拡張した。Genspark と Perplexity は、関連する別の課題である「メモリ」に取り組んでいる。SecondBrain と Projects はどちらも、セッション間で持続する文脈をエージェントに与え、毎回ゼロからやり直さずに長いタスクを遂行するための条件を整えている。
出典
- Anthropic — X での発表
- Anthropic — 暗号解読に関する完全な研究
- Google DeepMind — Gemini Robotics ER 2
- Cursor — マージ済み PR の 56%
- GitHub — スタック型 pull request のプレビュー
- Cognition — Devin がスタック型 PR を採用
- Amp Labs — Westpac との提携
- OpenAI — GPT-5.6 の価格引き下げ
- OpenAI — ARC-AGI-3 スコアを3倍にする2つの設定
- GitHub — Visual Studio の Copilot、7月のまとめ
- Genspark — SecondBrain
- Perplexity — Spaces が Projects に
- Google — Gemini Spark が Chrome に統合
- Google — Google Earth の Nano Banana
- ElevenLabs — Character Casting
- Thinking Machines — Inkling-Small
- NVIDIA — Inkling-Small 向け NeMo/DGX 対応
- Sakana AI — Dream-Cubed
- Together AI — YC 専用 GPU クラスタ
- LightOn — mDenseOn & mLateOn
- Cognition — FrontierCode 1.1
- Hugging Face — Trackio Logbooks
- Google — Antigravity CLI 1.1.8
- GitHub — GitHub Models の終了
- GitHub — リモート制御の制限
- Arena.ai — Fullstack Code Arena