ai-powered-markdown-translatorgemini-3.8-flash-mediumでフランス語から日本語に翻訳された記事。
9月30日水曜日、Googleは、出力上限が100万トークンに拡大され、Fairwind Programの信頼できるサイバー防衛担当者に先行展開されるフロンティアモデル、Gemini 4 Argonを発表しました。OpenAIは、自社モデルの保護された推論を抽出しようとする組織的なキャンペーンを阻止したと発表し、その中核はMoonshot AIに関連する個人によるものだとしています。Cohereは独自評価手法を備えたEmbed 5を投入し、Ideogram 4.5はアーティファクトのない連続した編集を約束、HeyGenはMiniMax H3をベースにした動画モデルをリリースしました。開発者向けには、Claude Code 2.1.286、Zed 1.22.0、VS Code 1.140が同日リリースされています。
Gemini 4 Argon:Googleの新たなフロンティアモデル、まずはサイバー防衛担当者向けに
9月30日 — Googleは、Google DeepMindのシニアバイスプレジデント兼GoogleのチーフAIアーキテクト(Chief AI Architect)であるKoray Kavukcuogluによるブログ記事で、新たなフロンティアモデル「Gemini 4 Argon」を発表しました。Argonは、実践的なソフトウェア工学、企業でのナレッジワーク(法務、金融)、サイバー防衛という3つの分野において、長期にわたる複雑なワークフロー(long-horizon workflows)での詳細な推論をサポートするように設計されています。
このモデルはまだ一般公開されていません。9月2日にGemini 3.8 Flash Cyberとともに発足したFairwind Programの信頼できるサイバー防衛担当者グループ向けに先行展開されており、Googleの内部チームと同様に、サイバーガードレール(cyber guardrails)なしで提供されます。開発者、企業、一般ユーザーへの提供は「可能な限り速やかに」行われる予定で、まずはAPIの有料顧客やGoogle AI Ultraの登録者から順次展開されますが、日時は発表されていません。それまでの間、GoogleはサイバーおよびCBRN(化学・生物・放射性物質・核)における有害なリクエストの拒否を強化し、モデルの思考連鎖やアクションの監視を強化するとともに、高リスクなトレーニングや評価を隔離されたサンドボックス内で実施しています。同社はまた、リリース前のモデルアクセスに関する米国政府の自主的なプロセスにも参加していると述べています。
Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.
🇯🇵 当社の新たなフロンティアモデル、Gemini 4 Argonをご紹介します。プログラミング、企業のナレッジワーク、サイバー防衛における複雑なワークフロー向けに設計されており、本日よりFairwind Programを通じて信頼できるテスターグループ向けに展開されます。 — Xの@GoogleDeepMind
料金はすでに決定されています。ローンチ価格は入力100万トークンあたり2ドル、出力10ドルで、これは前日に発表されたGPT-6.1 Solと同じ料金です。期間は明示されていませんが、この期間終了後は4ドルと20ドルになります。キャッシュされた入力は通常の入力よりも95%安価です。出力上限は以前の64Kから、Googleによると業界最高となる100万トークンへと引き上げられました。モデルは難解な問題を解決するために、同一の生成プロセス内で数十万トークンを出力できます。
| 100万トークンあたりの料金 | ローンチ価格 | ローンチ期間後の料金 |
|---|---|---|
| 入力 | 2ドル | 4ドル |
| 出力 | 10ドル | 20ドル |
Google DeepMindのページでは、ArgonをGPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5と19項目にわたって比較しています。Argonはそのうち13項目で最高スコアを獲得し、CWE-bench v1(68%)ではGPT-6 Astraと首位を分け合い、5項目で後れを取っています。エージェント型コーディングは最も激しい競争となっており、DeepSWE v1.1(77,9 %)とVibe Code Benchで首位に立った一方、FrontierSWE v2とTerminal-bench 4.0では4モデル中最下位となりました。ナレッジワークでは明らかなリードを見せており、特にHarveyのLegal Agent Benchmark(他の3モデルの最高6,7 %に対し19,6 %)や、256Kから1Mトークンの長文コンテキストで優位性を示しています。各行の最高スコアは太字で表記されています。
| 評価ベンチマーク(分野) | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index(ナレッジワーク) | 68,9 % | 63,1 % | 65,8 % | 67,0 % |
| AutomationBench(ナレッジワーク) | 51,3 % | 41,4 % | 31,4 % | 42,5 % |
| Vals Finance Agent v2(ナレッジワーク) | 65,4 % | 53,5 % | 58,9 % | 58,6 % |
| HarveyのLegal Agent Benchmark(ナレッジワーク) | 19,6 % | 5,4 % | 6,7 % | 3,8 % |
| DeepSWE v1.1(エージェント型コーディング) | 77,9 % | 74,1 % | 67,4 % | 74,2 % |
| FrontierSWE v2(エージェント型コーディング) | 55,0 % | 65,5 % | 56,3 % | 62,3 % |
| Vibe Code Bench(エージェント型コーディング) | 91,9 % | 89,6 % | 90,3 % | 90,3 % |
| Terminal-bench 4.0(エージェント型コーディング) | 57,4 % | 58,2 % | 57,9 % | 66,4 % |
| PostTrainBench(MLエンジニアリング) | 45,3 % | 44,3 % | 40,2 % | 49,3 % |
| Terminal-Bench Science 0.1(科学および数学) | 57,6 % | 68,1 % | 52,6 % | 63,3 % |
| LABBench 2(科学および数学) | 88,8 % | 85,4 % | 68,6 % | 73,1 % |
| RiemannBench(科学および数学) | 76,0 % | 72,0 % | 65,6 % | 69,6 % |
| GraphWalks BFS 128Kまで(長文コンテキスト、F1) | 99,7 % | 98,7 % | 91,4 % | 90,6 % |
| GraphWalks BFS 256K〜1M(長文コンテキスト、F1) | 84,2 % | 71,8 % | 65,0 % | 66,8 % |
| Agent’s Last Exam(コンピュータ操作) | 39,5 % | 34,2 % | — | 38,2 % |
| OSWorld-2.0、オフラインサブセット、部分スコア(コンピュータ操作) | 69,2 % | 72,6 % | — | — |
| Chartography(マルチモーダル理解) | 71,6 % | 71,0 % | 46,2 % | 66,3 % |
| LVBench(マルチモーダル理解) | 91,7 % | 87,5 % | 79,7 % | 83,7 % |
| CWE-bench v1(サイバーセキュリティ) | 68,0 % | 68,0 % | 58,0 % | 67,0 % |
Google社内では、すでに何千人もの従業員がこれを利用しています。Googleのオープンソース動画デコーダであるlibgav1において、Argonエージェントは既存のRust移植版の3万2000行におよぶSIMDコードを安全なRustコードに置き換えました。得られたデコーダは、動画出力の完全性を保ちながら、その移植版の2.7倍高速に動作します。別のエージェントはデータセンター向けにメモリ最適化を準備し、展開時には300 TiB以上のメモリが解放される見込みです。サイバーセキュリティ分野では、Wizが「Scan for Good」イニシアチブでArgonを活用しており、従来のフロンティアモデルが見逃していた、世界中の病院で使用されている医療ソフトウェアにおける機微な個人情報を危険にさらす重大な脆弱性を発見しました。
🔗 Gemini 4 Argon: our next era of frontier intelligence(Googleブログ) 🔗 Google DeepMindのGeminiページおよびベンチマーク一覧表
OpenAI、蒸留キャンペーンを阻止したと発表、中核はMoonshot AI関連の個人によるものと特定
9月30日 — OpenAIはセキュリティブログの記事において、自社モデルの保護された推論(protected reasoning)、すなわちモデルがタスクを処理するために生成する内部の思考プロセスを抽出することを目的とした組織的キャンペーンを発見・無力化したと発表しました。同社はこれを敵対的蒸留(adversarial distillation)とみなしています。これは、あるモデルの出力や推論を無断で体系的に利用し、別のモデルのトレーニング、再現、改善を行う行為を指します。
OpenAIによると、攻撃者は暗号化を破ったり、データベースを侵害したり、保存されたユーザーの会話に直接アクセスしたわけではありませんでした。彼らはやり取りを操作して保護された推論が可視化されるように仕向けました。例えば、ある会話の暗号化された推論をコピーし、別の会話でモデルに対してそれを復号して文字起こしするよう要求するなどの手法です。独立系の研究者らが責任ある開示を通じて同様の脆弱性を報告しており、これは8月10日にarXivへ提出された論文「Stealing Reasoning Traces from Proprietary LLM APIs」に記載されていましたが、OpenAIはこれらの攻撃経路が実在したことを認めています。
| キャンペーンの段階 | OpenAIが記録した日付または規模 |
|---|---|
| 低規模での活動開始 | 7月1日 |
| 活動のピーク | 7月24日および25日 |
| ピーク時に抽出パターンに一致したリクエスト数 | 4,000人以上のユーザーから16,000件 |
| このパターンに関連するグループ | 15,000人以上のユーザー |
| グループの完全な無力化 | 7月28日 |
関与者の特定について、ブログ記事は慎重な姿勢を保っています。すべての攻撃者が同一の主体に属しているとは断定されておらず、ピーク時の16,000件のリクエストも抽出の試みであり、必ずしも成功したとは限りません。しかしながらOpenAIは、活動の中核をKimiの開発元であるMoonshot AIに関連する個人によるものだとしています。
… we attribute a core cluster of the activity to individuals associated with Moonshot AI …
🇯🇵 …私たちはこの活動の中核を、Moonshot AIに関連する個人によるものだと特定しています… — OpenAI、Securityブログ記事
これを受けてOpenAIは、不正なアカウントを禁止または制限し、サインアップおよびインフラの制御を厳格化し、関連ネットワークの監視を拡大するとともに、ユーザー、ワークスペース、組織、モデルファミリ間での隠蔽された推論の保護を強化しました。他のユーザーの暗号化された推論を再生してその内容を復元可能にしていた経路を遮断し、推論を漏洩させる恐れのあるストリーミング(streaming)出力を検出して差し戻す制御を追加しました。調査結果はFrontier Model Forumおよび政府のチャネルを通じて共有されました。OpenAIによると、この手法は自社モデルに特有のものではなく、推論の移植や再生を可能にするあらゆるシステムが同様のリスクに直面する可能性があります。同社は、抽出された推論が元のモデルのガードレールを持たない別のモデルのトレーニングに悪用される恐れがあることから、敵対的蒸留を安全性および国家安全保障上のリスクとして位置づけています。この問題は目新しいものではありません。2月にはAnthropicが蒸留キャンペーンをDeepSeek、Moonshot AI、MiniMaxによるものと特定しており、9月24日からは推論抽出を含む複数カテゴリでブロックされたリクエストへの課金を開始しています。
🔗 arXivの論文「Stealing Reasoning Traces from Proprietary LLM APIs」
埋め込み:CohereがEmbed 5と新指標RCP-nDCG@10を発表、Perplexityはpplx-embed-v2-context-9b-previewを公開
9月30日 — Cohereはエンタープライズ検索向けの埋め込みモデルファミリー「Embed 5」を発表しました。同じ埋め込み空間を共有する2つのティアで構成されています。最高品質とオフラインインデックス作成向けの「Embed 5 Pro」、そしてインタラクティブな検索、大容量RAG、エージェント検索向けの「Embed 5 Fast」です。出力次元を同じに保つ限り、Proでコーパスをインデックス化した後、再インデックス化を行うことなくFastでクエリを実行できます。Cohereが推奨するこの構成は、40の開発用データセットにおいて、すべてをProで構築したシステムの品質を平均98.4%維持しており、すべてFastで構成したシステムの96.6%を上回っています。
両モデルとも最大128Kトークンを処理でき、テキスト、画像、またはその両方を単一のベクトルに融合した入力を受け付け、100以上の言語に対応し、float、int8、バイナリ形式で256〜2,048次元のベクトルを出力します。Cohereはint8の1,024次元を推奨しており、これはfloat32の2,048次元での8 KBに対して1ベクトルあたり1 KBとなります。価格は、Proがテキスト100万トークンあたり0.12ドル、Fastは3分の1安価な0.08ドルで、平均2.4倍のドキュメントスループットを実現します。画像は両モデルとも100万トークンあたり0.40ドルです。Embed 5は本日からCohere API、Model Vault、Microsoft Foundry、Amazon SageMaker、さらにNorthで利用可能で、vLLMを用いたプライベートデプロイも可能です。
| ベンチマーク(指標) | Embed 5 Pro | Embed 5 Fast | その他の言及されたモデル |
|---|---|---|---|
| ViDoRe V3、8ドメイン (RCP-nDCG@10) | 85,8 | 84,5 | Voyage 4 Large 83,7;Gemini Embedding 2 83,2;OpenAI text-embedding-3-large 75,5 |
| FinanceBench (RCP-nDCG@10) | 80,1 | 80,0 | ProはOpenAI text-embedding-3-largeを21.4ポイントリード |
| FinQA (RCP-nDCG@10) | 90,0 | 88,8 | — |
| ViDoRe V3 Finance (RCP-nDCG@10) | 85,0 | 83,9 | — |
| 分析済みPDF、スイート平均 (RCP-nDCG@10) | 84,8 | 83,4 | Voyage 4 Large 83,6;Gemini Embedding 2 80,8;Embed 4 78,6 |
| テキストと画像の融合、5データセット (nDCG@10) | 82,3 | 81,2 | Gemini Embedding 2 61,3 |
| ページ画像、金融5データセット (nDCG@10) | 77,0 | 73,2 | Embed 4 71,1;Voyage Multimodal 3.5 70,1;Gemini Embedding 2 56,7 |
| ヨーロッパ5言語 (nDCG@10またはRCP-nDCG@10) | 77 | — | Voyage 4 Large 76;Gemini Embedding 2 73 |
これらのスコアの大部分は、Cohereが同日公開した評価手法であるRCP-nDCG@10(下記参照)で示されています。記事の注記によると、これは固定された候補セットを並べ替えるため、第1段階の取得(リトリーバル)ではなくリランキングの品質を測定するものです。もう一つの多言語テーブルも注目に値します。Cohereはペルシャ語で最大13ポイント向上するなどEmbed 4からの進歩を強調していますが、対象となった10言語のうち、中国語を除く9言語でGemini Embedding 2がEmbed 5 Proを上回っており、Voyage 4 Largeも5言語で上回っています。Cohereは10月8日にX上のセッションでEmbed 5を紹介する予定です。
🔗 CohereのEmbed 5に関するブログ記事 · @cohereのXでの発表
RCP-nDCG@10:CohereがEmbed 5の測定に用いる新指標
9月30日 — Cohereは独自の検索評価手法「RCP-nDCG@10」(Rubric-Calibrated Preferences nDCG@10)も公開しました。その背景として、MTEBやBEIRの評価指標であるnDCGは、事前アノテーションされたドキュメントリスト(必然的に不完全)と結果を比較するため、アノテーションされていない関連ドキュメントが一切評価されないという問題があります。Cohereの調査では、無関係とマークされていたドキュメントの28%が人間によって有用と判断されました。RCP-nDCG@10は、調整されたAIジャッジに判定を委ねます。このジャッジはクエリごとに共通の5つのYes/No形式の質問に答え、ドキュメントをグループごとに比較します。46人のアノテーターによる289組のブラインド検証では、2つの指標で勝者が異なった場合、70%のケースで人間がRCP-nDCGの判定を支持しました。論文、コード、データセットが公開されており、MTEBのリードメンテナーも本指標の統合を発表しています。Cohereは、第5世代のEmbedおよび提供時期未定のRerankをこの指標に合わせて最適化したと述べており、従来のnDCG単独の評価ではこれらのモデルが必ずしも最高に見えない可能性があると注意を促しています。
🔗 CohereのRCP-nDCG@10に関するブログ記事 · GitHubのコードとデータ
Perplexityがpplx-embed-v2-context-9b-previewとベンチマーク「context-bench」を公開
9月30日 — Perplexityは、コンテキスト対応埋め込みモデル「pplx-embed-v2-context-9b-preview」をMITライセンスのもとHugging Face上でプレビュー公開しました。このモデルでは、ドキュメント全体のコンテキストを考慮しながら各チャンクをエンコードするため、「彼女」と書かれた箇所でも適切なエンティティに結びつけられたままになります。クエリごとに単一の正解チャンク(gold passage)を参照するのではなく、ドキュメントの各トークンをスコアリングするPerplexityのコンテキスト圧縮モデル(教師役)から学習します。これにより、回答とそれを裏付けるパッセージの双方を取得することを学習します。共同執筆者であるturbopufferのプライベートベンチマーク「context-bench」(2,099クエリ、38,894ドキュメント)におけるブラインドテストではvoyage-context-4を上回り、ConTEBでは全タスクで首位とはならなかったものの最高平均スコアを達成しました。Perplexityは、重みとインターフェースが変更される可能性があると注意を促しており、時期は未定ながらAPI経由の提供を準備しています。
| Perplexityが公表した測定項目 | pplx-embed-v2-context-9b-preview | voyage-context-4との差 |
|---|---|---|
| context-benchでの回答再現率 (K = 10) | 45,5 % | +14,4ポイント |
| context-benchでの証拠再現率 (K = 10) | 40,6 % | +5,0ポイント |
| 1ベクトルあたりのストレージ (1 024次元、int8) | 1 KB | float32のvoyage-context-4より8倍省サイズ |
🔗 Perplexity Researchのブログ記事 · Hugging Faceのモデル
Ideogram 4.5:連続した編集を想定して設計された画像編集モデル
9月30日 — Ideogramは「最も精度の高い編集モデル」と謳う「Ideogram 4.5」を発表しました。開発の背景には、既存の画像モデルでは編集を重ねるごとにアーティファクト、ピクセルのずれ、色ズレが加わり、複数回編集を行うとすぐに画像が使い物にならなくなるという課題がありました。Ideogram 4.5はこうした蓄積を排除し、複数ターンにわたる編集(multi-turn editing)を可能にするよう設計されています。
Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.
🇯🇵 最も精度の高い編集モデル、Ideogram 4.5をご紹介します。これまでの最先端モデルでは、編集を加えるたびにアーティファクト、ピクセルのずれ、色の変化が発生していました。Ideogram 4.5はアーティファクトの蓄積を排除し、複数ターンの編集を可能にします。Ideogram内、API、およびローンチパートナー経由で利用可能です。オープンウェイトも近日公開予定です。 — X上の@ideogram_ai
これを実証するため、IdeogramはGPT Image 2.5 Sunburst、Nano Banana Pro、Nano Banana 2と同じ連続編集を行った横並びの比較を公開しました。同社によれば、これらの競合モデルの出力はわずか数回の編集で使用不能になるとされています。この比較は視覚的なもので、数値スコアは示されていません。例としては、色と照明(構図を崩さずに影、反射、ハイライトが変化に追従)、テキスト変更、製品写真、インテリアデザイン、古い写真の段階的復元、スケッチや深度マップからの画像生成、切り抜きなどが挙げられています。
また、本モデルはあらゆる解像度での編集(Zoom editing)を導入しています。Ideogramの例では、2,420万画素(4,016 × 6,016ピクセル)の高解像度画像の一部エリアを画像を縮小することなく編集でき、境界線が維持されるため継ぎ目なく再統合できます。ターゲットを絞った編集向けに設計されているものの、一般的な編集でも非常に優れたパフォーマンスを発揮するとIdeogramは述べています。
| 発表項目 | 判明している詳細 |
|---|---|
| 提供状況 | 9月30日よりIdeogramおよびAPIで利用可能 |
| ローンチパートナー | PikaとLuma(同日発表) |
| オープンウェイト | 6月に公開されたIdeogram 4.0と同様に「近日公開」予定 |
| 料金 | 非公開 |
HeyGen Video:MiniMax H3ベースの動画モデル、APIで提供開始
9月30日 — HeyGenは、高額なコストをかけることなく本番品質の動画を求める企業向けの動画生成モデル「HeyGen Video」を発表しました。MiniMax H3をベースにHeyGenが事後学習(ポストトレーニング)を施したモデルで、テキストや画像から動画を生成し、同一の呼び出しで音声も同時に生成できます。HeyGenのAPIのほか、OpenRouter、Runware、ComfyUI経由で利用可能です。
価格面では、3つの数字が混在しています。カタログページによると、10月末までは標準価格の0.02ドルから50%割引となる1秒あたり0.01ドルから提供されます。一方、比較表ではローンチプロモーション前の音声付き768pのカタログ価格として1秒あたり0.03ドルが提示されています。この価格であっても、HeyGen Videoは比較対象となったモデルの中で最も安価です。
| 比較モデル | 1秒あたりのカタログ価格(768p、音声付き) | HeyGen内部のEloレーティング(HeyGen Video = 1,000) |
|---|---|---|
| HeyGen Video | 0,03ドル | 1 000 |
| Seedance 2.0 | 0,303ドル | 955 |
| H3 Max | 0,08ドル | 952 |
| H3 Max Turbo | 0,04ドル | 920 |
| H3 Max balanced | 0,08ドル | 860 |
| Kling 3.0 Pro | 0,168ドル | 857 |
| Veo 3.1 | 0,40ドル | 744 |
品質について、HeyGenはArtificial Analysis Arenaのプロンプトを用いた内部評価(4,800票)を根拠としており、自社モデルのEloレーティングを1,000に設定しています。H3 Maxとのブラインドによる好みの比較では、650票のうち55.8%がHeyGen Videoを支持しましたが、49〜62%の範囲であり同等の可能性も排除できません。画像から動画を生成する10秒間のクリップの場合、キャプション生成時間を除いた拡散トランスフォーマーの推論時間は3.7秒に短縮され、H3 Max Turboの4.1秒やH3 Maxの8.3秒を下回っています。
MiniMaxはこのローンチを歓迎するとともに、同日、広告向けに最適化された動画モデルであるCreatifyの「Boreal-H3」という別のH3派生モデルも紹介しました。
🔗 HeyGen Videoのカタログ · @HeyGenのXでの発表
汎用アシスタントとエージェント:Geminiのskills、Manus Flex、Grok Bot
Geminiアプリがskillsを導入、Gemsを置き換えへ
9月30日 — GoogleはGeminiアプリに「skills」を導入しました。一度指示を保存すれば、スラッシュに続けて名前を入力するだけで呼び出せます。Geminiは会話からスキルを作成したり、プロンプトが合致した際に自律的に実行したりすることも可能で、複数のスキルを組み合わせたり、各スキルに参照ファイル(プレーンテキスト、PDF、画像)を添付したりできます。すでにGemini Sparkに搭載されていた機能ですが、世界中のGeminiチャットにおいて、Google AIのすべてのプランティア、当面は18歳以上のユーザーを対象に展開され、Workspaceユーザーへの提供も今後数週間以内に行われる予定です。skillsはGemsを置き換えることになり、自動移行を伴いながら、個人アカウントでは11月以降、Workspace Business/Enterprise/Nonprofitでは2027年3月、Education向けでは2027年6月にGemsが廃止されます。ミニアプリ作成ツールのOpalも11月に終了し、移行対象外となる「Gems by Google Labs」も同様に終了します。
🔗 Let skills in Gemini tackle your most repetitive tasks(Googleブログ)
Manus Flex:Manusエージェントで独自のAPIキーを利用可能に
9月29日 — Manusは、サポートされている推論プロバイダーのAPIキーを使用してManusを利用できる「Manus Flex」(bring your own API key)を発表しました。従来、Manusはモデルを独自に選定し、エージェントハーネスとインフラを提供していました。Flexでは、プロバイダーのキーを使用して、同一のプロジェクト、ツール、実行環境、エージェントワークフローを動かすことができ、メインモデルや推論努力レベル(reasoning effort)を自由に選択できます。課金は分割され、推論費用はプロバイダーから直接請求される一方、タスクで消費されるその他のサービスやインフラについては引き続きManusクレジットが消費されます。OpenRouter、Fireworks、Modalの3社が推論パートナープログラム(Manus Flex Inference Partner Program)の初期メンバーとなります。Manus 2.0の発表翌日に公開されたこの記事には、プラン、価格、利用可能なモデルのリストは記載されていません。
Grok BotがCursorにコーディングを委譲、プルリクエストの管理も可能に
9月30日 — Team Botsの発表から2日後、SpaceXAIはソフトウェア開発向けにGrok Botを強化しました。@botアカウントのスレッドにおいて、同社はBotがコーディングタスクをCursorに委譲し、GitHubおよびOrigin(詳細は未記載)のプラグインを通じてプルリクエストを管理し、構築したもののデモ動画を共有できるようになったと発表しました。また、SpaceXAIは自社のエンジニアリングチームが使用しているBotをインストール可能なテンプレート(templates)として公開しており、それぞれにスキル、ルーチン、コネクタが付属しています。このスレッドにはプラン、価格、提供時期は明記されておらず、x.ai上にも関連ブログ記事は掲載されていません。Cursorとの連携自体は新しいものではなく、9月初旬にGrokおよびCursor Enterpriseの顧客向けにGrok Bot for Enterpriseが2週間無料で提供されていました。今回の変更点は、Bot自身がコーディング作業を委譲するようになったことです。
ロボティクスと世界モデル:RunwayのPraxis-1、Ai2のMolmoAct 2、NVIDIAのPhysis-Lang
Runway、重み公開の世界行動モデル「Praxis-1」を発表
9月30日 — Runwayは、実機ロボットの制御を目的とした初の重み公開(オープンウェイト)世界行動モデル(world action model)「Praxis-1」を発表しました。これは、SolarisやGWM Worlds 2といった同社の世界モデルと同じ動画事前学習を基盤にしており、ロボティクス開発者や研究者向けの汎用ポリシーモデルを目指しています。Runwayの狙いは、「ロボットの実演データは希少だが、動画データはほぼ無制限に存在する」という点にあります。同社のデモでは、同一のポリシーが再学習なしでスタジオからキッチンへと適応しています。現時点ではダウンロード提供はされておらず、Praxis-1はNoble Machines、Standard Bots、Ultra各社の自社ハードウェア上でテスト中であり、モデルの重みを含む一般公開は数か月以内に予定されています。
| Runwayが公表した指標 | 発表された結果 |
|---|---|
| 世界モデル内のシミュレーションと実世界の結果との相関 | 0.95 |
| Web動画を用いた調整後の最終配置誤差 | 16.1 cm |
| 遠隔操作ロボットの動画を用いた場合の同誤差 | 16.0 cm |
Ai2の「MolmoAct 2」、主催者によるファインチューニングを経てReality Checkで首位に
9月30日 — Ai2は、同社の完全オープンなロボティクスモデル「MolmoAct 2」が、実環境でのマニピュレーションを評価する独立ベンチマーク「Reality Check」の総合成功率で第1位になったと発表しました。ただし、モデルは主催者であるPoke & Wiggleによってベンチマークのタスク向けにファインチューニングされているという重要な留意点があります。同社が前日に立ち上げたReality Checkは、ミュンヘンのドイツ博物館に設置されたFR3 Duoステーションを使用し、10種類の環境(ネジの分別、DCコネクタの接続、ドライバーによるツールボックスの開錠など)で実ロボットによる14,400回の試行を行っています。「トレーニング領域外に配置されたオブジェクト」と「ステーションからの100時間のデータを用いた中間学習」の2つの評価軸は、依然として「近日公開」となっています。
| 評価対象モデル | 総合成功率 | 環境あたり約10回のデモ後の成功率 | 環境あたり約300回のデモ後の成功率 |
|---|---|---|---|
| MolmoAct 2 | 28 % | 4 % | 44 % |
| Pi 0.5 | 21 % | 5 % | 33 % |
| DiT-Flow | 19 % | 2 % | 29 % |
| GR00T N1.7 | 12 % | 4 % | 19 % |
🔗 Ai2のツイート · Reality Checkリーダーボード
Physis-Lang:世界モデルに物理法則を説明するキャプション
9月29日 — NVIDIA、MIT、オックスフォード大学の研究チームは、動画キャプションに物理的推論を追加して世界モデルを向上させるフレームワーク「Physis-Lang」を発表しました。キャプションによって原因、作用する物理法則、結果が明示されます。特化型のクリティック(批評器)が欠落した主張や根拠のない主張を検出し、エージェントがキャプション生成の指示を洗練させ、モデルの失敗例を基にその弱点を補う動画を検索します。NVIDIAによれば、再学習を行わずにプロンプトだけにこの推論を追加するだけで、Cosmos 3のPhyGenBenchスコアが5.62ポイント向上しました。学習を実施した場合、Cosmos3-SuperおよびCosmos3-Nano上のPhysis-Langは、Image-to-VideoのPhysics-IQ Verifiedランキングでトップ2を独占しました(従来の最高スコア42.7に対し、48.2および43.3)。PhyGenBenchとVideoPhy-2はGPT-5.5によって採点されており、VideoPhy-2のフルセットではVeo 3.1がわずかな優位性を維持しています。
| 動画物理ベンチマーク | Cosmos3-Nano | Veo 3.1 | Cosmos3-Nano上のPhysis-Lang |
|---|---|---|---|
| PhyGenBench | 61.67 | 65.63 | 71.04 |
| Physics-IQ Verified | 40.23 | 34.99 | 43.41 |
| VideoPhy-2 Hard | 48.31 | 58.43 | 62.36 |
| VideoPhy-2 フルセット | 60.41 | 68.87 | 68.02 |
🔗 Physis-Langプロジェクトページ · @NVIDIAAIによるXでの発表
オープンモデル:Hunmin-397B-A17B-CUAとJEV-27B-VL
Hunmin-397B-A17B-CUA、Qwen-CUAのエージェント能力を3970億パラメータのMoEに移植
9月30日 — Hugging Faceのコミュニティブログで、hojun Lee氏がmncai組織によりApache-2.0ライセンスで公開されたコンピュータ操作(computer use)モデル「Hunmin-397B-A17B-CUA」の詳細を報告しました。ただし著者自身が注記しているように、評価は独自環境による1回限りの実行であり、公開されているランキングとは直接比較できません(ベースモデルのOSWorldスコアは、OSWorld-Verifiedで公表されている62.2に対して48.16)。このモデルは、アクティブパラメータ数170億のMixture-of-ExpertsであるQwen3.5-397B-A17Bをベースにしており、プロジェクト全体が8基のB200を搭載した単一ノードで実行されました。チームはベースモデルと特化済みのQwen-CUAとの間の重みの差分を計算し、厳選したモジュールに対してその低ランク版のみを移植しました。この転移だけで、Qwen-CUAが抱えるビジュアルグラウンディングの弱点を受け継ぐことなく、OSWorld-316のスコアを48.84から68.25へと向上させました。その後のファインチューニングとGRPO強化学習により、さらに4.3ポイントが上乗せされています。
| 評価ベンチマーク(独自プロトコル) | ベース Qwen3.5-397B | Hunmin-CUA | Qwen-CUA(ソース) |
|---|---|---|---|
| OSWorld(360タスク) | 48.16 | 70.45 | 77.12 |
| WindowsAgentArena(153タスク) | 41.77 | 50.85 | 56.68 |
| ScreenSpot-Pro | 72.74 | 75.61 | 62.20 |
| KMMLU-Pro(韓国語) | 77.91 | 76.12 | 71.41 |
🔗 Hunmin-CUAのブログ記事 · Hugging Faceの重み
AutoTrust AI、画像判定も可能なオープン意思決定モデル「JEV-27B-VL」を公開
9月30日 — AutoTrust AIは、9月27日に発表したオープン意思決定モデルJEV-27Bの視覚対応版「JEV-27B-VL」をApache-2.0で公開しました。画像とテキストを提示して質問すると、約100ミリ秒のシングルパスで各選択肢のキャリブレーションされた確率を出力します。質問で求められれば、画像を確認しながら段階的な推論も行います。特筆すべきことに、その決定ヘッド(decision head)は学習中に画像を一切見ていません。主なテストとして、ショート動画アプリの公開データセットであるMicroLensにおいて、サムネイルのみから200人のユーザーに対して20本の候補動画をランキング付けしたところ、59,045人のユーザーで学習された協調フィルタリングと同等のAUCを記録し、トップ5内の正解動画率では上回りました。著者らは、この結果が200人のユーザーによる単一データセットに基づくものである点に留意を促しています。
| MicroLensでの推薦手法 | AUC | トップ5内の正解動画率 |
|---|---|---|
| JEV-27B-VL(サムネイルのみ、インタラクションデータなし) | 0.727 | 59 % |
| 59,045人のユーザーで学習した協調フィルタリング | 0.728 | 49 % |
| JEV-27B-VL(タイトルのみ) | 0.649 | 46 % |
| ランダム順 | 0.489 | 21 % |
リーダーボード:Hugging FaceのOpen TTS LeaderboardとLILTのAURORA
Hugging Face、オープンな音声合成ランキング「Open TTS Leaderboard」を開設
9月30日 — Hugging Faceは、オープンモデルおよび多言語モデルに焦点を当てた音声合成(text-to-speech、TTS)ランキング「Open TTS Leaderboard」を開設しました。Hub上には8,000以上のTTSモデルが存在しますが、標準的な指標とされている投票型アリーナはモデル増加のペースに追いついておらず、オープンモデルの掲載が過少となっています。記事によると、Artificial Analysisがランキング付けした92モデルのうち、重みが公開されているのは16モデルに過ぎません。そこでこのリーダーボードでは、主観投票の代わりに客観的な指標を採用しています。具体的には、明瞭度(入力テキストとQwen3 ASRによる書き起こしとの間の単語エラー率または文字エラー率)、速度(H200およびCPUでのバッチ推論と初回音声出力までの時間)、クローン音声の再現性(WavLM類似度)です。モデルの評価は数週間の投票を待つことなく数時間で完了します。英語ではKokoro-82M、supertonic-3、Fish Audioのs2-proがトップに立ち、多言語ではOmniVoice、s2-pro、Fun-CosyVoice3-0.5Bがリードしています。著者らは、自然さや表現力は測定対象外であると注記しており、評価スクリプトは「近日中に」公開される予定です。
🔗 Open TTS Leaderboardのブログ記事 · Hugging Faceのリーダーボード
LILT、エージェントタスクの多言語リーダーボード「AURORA」を開設
9月30日 — LILTは、最先端モデルを英語以外のエージェントタスクで測定するリーダーボード「AURORA」を開設しました。すべてのタスクは機械翻訳を使わず、ネイティブのエキスパートによって設計および検証されています。立ち上げ時には4つのベンチマークが含まれます。10言語・324のコーディングタスクからなる多言語版Terminal-Bench、カスタマーサポート向けの多言語版τ³-bench、長文脈での指示追従を評価するMultiChallenge、そしてエージェント的推論を評価するGAIA-v2-LILTです。Claude Opus 5.5は多言語Terminal-Benchをリードし、τ³-benchでも5言語すべてで首位を獲得しました。GAIAにおいて、各モデルは機械翻訳版と比較してLILT監査版で平均20.7ポイント高いスコアを記録しました。LILTによれば、この差は翻訳によって生じたエラーの大きさを示しています。また、同一の対話において、韓国語やアラビア語では英語と比べて約1.4倍のトークンが消費されることも確認されています。
| 評価対象モデル(多言語Terminal-Bench、抜粋) | 平均成功率 |
|---|---|
| Claude Opus 5.5 (effort high) | 76.4 % |
| Claude Opus 5 (effort high) | 73.5 % |
| Gemini 3.8 Flash | 67.3 % |
| GPT-6 Sol | 64.8 % |
| Command A+ | 4.3 % |
🔗 LILTによるAURORAのブログ記事 · AURORAリーダーボード
公共・エンタープライズ:Claude for Government、Anthropicの購買エージェント、America’s SBDCと提携するOpenAI
Claude for Governmentが一般提供開始
9月30日 — Claude for Governmentがベータ版を終了し、Anthropicは米国の連邦政府機関および州政府機関向けに一般提供(GA)を開始したと発表しました。7月からパブリックベータ版として提供されていたこのプラットフォームは、FedRAMP High認可環境内でClaudeのコーディング能力およびエージェント作業機能を提供し、商用顧客と同等の機能群を備えています。CLIのClaude CodeおよびClaude for Microsoft 365も早期アクセスで提供されます。シート単位のライセンスではなく、機関は固定枠で使用料を支払う形式で、確実な上限設定により割り当て予算の超過を防ぎます。またSCIMグループマッピングによってシート階層ごとにレート制限、金額上限、許可モデルを設定できます。ガバナンス面では、Anthropic側での機密性の高い操作には2名による承認が必要であり、利用状況のエクスポートにはメトリクスデータのみが含まれ、会話履歴は機関が管理するデバイス上に保持されます。Anthropicは価格を公開していません。
🔗 Claude for Governmentの一般提供開始(公式発表)
Anthropic、Managed Agentsで構築したエージェントがインバウンド商談に対応
9月30日 — Anthropicは、月間数万件に及ぶインバウンドの問い合わせ対応を、現在ベータ版のClaude Managed Agentsで構築した購買エージェントによって刷新した経緯を公開しました。「Contact Sales」や「Pricing」ページ、claude.ai内、そしてメール上で稼働し、いくつかの質問を行ったうえでプランとシート数を提案します。その後、購入手続きへ誘導するか、全履歴を引き継いで営業担当者にエスカレーションするか、あるいは単に回答を行うかを判断します(利用者は最初から人間の担当者を選択することも可能です)。Carl Johnson氏が執筆した記事によると、このエージェントは1日に数千件の対話を処理しており、エージェントを経由した見込み顧客が商談機会(オポチュニティ)化する割合は従来のフォームの2倍以上に達し、成約までの期間も約5日短縮されました。また、成約に営業担当者の介入を必要とする対話の割合は約半減しました。初版はわずか1名のエンジニアが数週間で構築しました。エージェントは小規模チームをEnterpriseプランではなくTeamプランへ案内することが多いものの、Anthropicはこれを意図的な選択として受け入れています。
🔗 Anthropicの営業チームがClaude Managed Agentsでインバウンドを再構築した方法
OpenAI、America’s SBDCと提携し中小企業に関するレポートを公開
9月30日 — OpenAIは、年間100万人の起業家を支援する全米中小企業育成センターネットワーク「America’s SBDC」との提携を発表しました。第1フェーズとして、9月23日にパイロット版が開始されたOpenAI Academyのコミュニティトレーナープログラム(Community Trainer Program)を通じて約150名のアドバイザーを育成し、SBDCネットワークで3時間のワークショップを実施して、対面で少なくとも1,000社の中小企業にアプローチすることを目指します。同日公開されたレポート「Small Businesses, Bigger Capabilities」では利用実態が数値化されており、9月9日〜15日の1週間で、従業員500人未満の企業の従業員約400万人がOpenAIの製品を利用しており、そのうち約5人に1人が従業員10人未満の企業に所属していました。8月には、ChatGPT WorkやCodexを中心とするエージェント型の出力トークンが中小企業による出力トークン全体の3分の2を占め、4月時点の3分の1から大幅に増加しました。
Runway Ads:成果報酬型広告のための自律型エンジン
9月30日 — Runwayは、有料広告キャンペーンのクリエイティブ制作をエンドツーエンドで担うRunway Adsを発表しました。広告アカウントとブランドキットを連携すると、Runway Agentを基盤とするこのツールが動画や静止画のクリエイティブを生成し、承認されたバリエーションをMeta、Google、TikTokに公開した上で、そのパフォーマンスを分析し、支出効果の高かった要素を中心に次のクリエイティブを生成します。チームが設定したルールに従って画面上のテキストを含む各クリエイティブをローカライズし、各フォーマットに合わせてリサイズし、自動ブランドチェックにかけた上で、予算の上限を遵守します。人間の承認がデフォルトで有効になっていますが、キャンペーン単位やバリエーションのタイプ単位で自動公開を有効にすることも可能です。
| 7月以降のRunway社内指標 | 記事で公表された結果 |
|---|---|
| 週あたりの広告数 | 77件から約900件へ |
| 広告費用対効果(ROAS) | 2倍 |
| コンバージョン | 約+34%、クリック率は横ばい |
| サブスクライバー獲得単価 | −41% |
Runway Adsは現在、一部の厳選されたエンタープライズパートナー向けにパイロット運用されています。発表ツイートでは今後数週間での広範な展開を予告しており、記事内には記載されていないものの、7月以降にARR(年間経常収益)を1億ドル押し上げる効果もあったと主張しています。
🔗 Runway Adsの記事 · @runwaymlのツイート
ElevenLabs、3億ドルの株式公開買付(テンダーオファー)を経て評価額220億ドルに
9月30日 — ElevenLabsは、従業員を対象とした3億ドルの株式公開買付(tender offer)を完了し、評価額は2月のシリーズD調達時の2倍となる220億ドルに達しました。今回の取引はWellingtonとT. Rowe Priceが主導し、Andreessen Horowitz、Lightspeed、ICONIQなどの既存投資家に加えて、EQT、Goldman Sachs、GIC、OTPP、Sapphire Ventures、BDT & MSDが出資に加わりました。エンタープライズ顧客が売上の55%を占めています。ElevenAgentsは週に1,500万件以上の会話を処理しており、これは2月比で3倍にあたり、同期間のARRも3倍以上に拡大しました。同社顧客の分析によると、音声エージェントはチャットエージェントと比べて問い合わせを31%迅速に解決しています。同社の従業員数は、評価額900万ドルだった初期ラウンドから4年を経て800人を超えています。
Vera Rubin NVL72がCoreWeaveで本番稼働、Cognitionは最大4.8倍のスループットを測定
9月30日 — サンフランシスコで開催された「CoreWeave Fully Connected」にて、NVIDIAはCoreWeaveにおけるVera Rubin NVL72の本番稼働の詳細を発表しました。Spectrum-X Ethernet 102.4Tネットワークを備えた同プラットフォームはCoreWeave Cloud上で利用可能となっており、同クラウドは今月初めに最初の本番ラックを受け取っていました。Devinの開発元であるCognitionは、同環境で本番ワークロードを実行する最初の顧客であり、FrontierCodeから抽出したタスクを用いた初期テストにおいて、GB200 NVL72と比較してSWE-2の推論総トークンスループットが最大4.8倍に達したことを確認しました。CoreWeaveは、エージェント向けに設計されたVera CPUも提供予定です。1ラックあたり128基のCPUと11,264コアを搭載し、11,000以上の分離環境を同時実行可能で、エージェントのサンドボックス起動時間は3倍以上高速化されます。さらにCoreWeaveは、本番環境からトレーニングへとフィードバックループを回すためにWeights & Biases、OpenPipe、marimoを統合した「CoreWeave Forge」を発表しました。同機能によるサーバーレス強化学習(serverless RL)は、1.4倍高速化され、コストが40%削減されると発表されています。
🔗 CoreWeaveとVera Rubinに関するNVIDIAの記事
コーディングエージェントと開発者ツール:Claude Code 2.1.286、Zed 1.22.0、Gemini CLI、VS Code 1.140、HydraFusion、およびgcloud向けMCPサーバー
Claude Code 2.1.286:VS Code内ブックマーク、リトライ上限、およびbareモードの厳格化
9月30日 — 19:10 UTCにリリースされたClaude Code 2.1.286には、49件のバグ修正を含む88項目の変更が含まれています。複数のリクエストがスタックしている場合、権限プロンプトにその位置(「2 of 5」など)が表示されるようになったほか、VS Code拡張機能には、Claudeの回答をサイドパネルに保持するブックマーク(bookmarks)、Claudeからの質問と選択された回答を一覧表示する「Questions」行、および質問カード内のオプションプレビューが追加されました。重要な動作変更が2点あります。モデル呼び出しのリトライをカバーする制限が一本化され(デフォルト設定で最大14リクエスト)、--bareはコマンドラインで明示的に指定されたMCPサーバーのみを接続するようになり、システムリマインダーやバックグラウンドタスクは接続されなくなりました。verifyという名前のスキルが存在する場合、ドキュメントやテストを除き、コミットの直前にClaudeがそれを実行するよう促されます。また、プラグインはGitリポジトリやディレクトリであるnpmソースを拒否するようになりました。さらに、APIがデフォルトモデルを拒否した場合、Claude Codeは各ターンで失敗する代わりに、同じ階層の前世代モデルで1回リトライするようになりました。
Zed 1.22.0:サブエージェントごとにモデルを設定可能に
9月30日 — Zedはサブエージェントに焦点を当てた安定版1.22.0をリリースしました。spawn_agentツールがオプションのパラメータmodelを受け付けるようになり、設定されたモデルや親から継承したモデルとは異なるモデルでサブエージェントを実行できるようになりました。また、各サブエージェントのカードに使用モデルが表示されるようになりました。サブエージェントはコンテキストも自動的に圧縮するため、Zedによれば、より長時間のタスクを維持できるようになります。モデル面では、OpenAI APIキーによるBYOKとしてGPT-6.1 Solが追加され、Grok 4.7がSuperGrokおよびxAIの推奨モデルとして安定版に移行し、OpenCode ZenおよびGoモデルのリストがオンザフライで取得されるようになりました。本バージョンでは、ターミナルでコマンドが完了するごとに約2MBのメモリがリークする問題が修正されたほか、アクティブなドックを閉じるショートカットが全プラットフォームでctrl-alt-wに変更されました。新機能18件、修正37件が含まれています。
Gemini CLI:v0.62.0が安定版に、確認なしでプランを実行するプレビュー版も登場
9月29日 — Gemini CLIは夜間(UTC)に2つのバージョンをリリースしました。v0.62.0は21:17に安定版となり、その19項目の変更には、9月16日から24日にかけて提示されたプレビュー版やnightly版の内容(MCPツール呼び出しの構造化タイトル、OAuthリフレッシュトークン(refresh token)の保持、Gemini 3.8 Flashおよび3.5 Flash Liteへの対応)が反映されています。新要素は20:58に公開されたプレビュー版v0.63.0-preview.0にあります。非インタラクティブモードにおいて、エージェントは確認を待たずに計画を作成・実行するようになりました(PR 29539)。これまではPlan Modeの指示により、ツールの呼び出しを一切行わず単なる調整メッセージを返す仕様となっていました。また、maxCharsの上限を0以下に設定することで、ツールの出力の切り捨てを無効化できるようになりました(PR 29542)。9月30日のnightly版は0.64.0シリーズを開始しました。PR 29549によると、ZedやOpenHandsなどのクライアントが請求額を約3倍過大に見積もっていたのに対し、ACPモードでCLIが標準の使用量を正しく報告するようになりました。
🔗 Gemini CLI v0.63.0-preview.0 · Gemini CLI v0.62.0
VS Code 1.140がCopilotハーネスを採用
9月30日 — Visual Studio Code 1.140が安定版としてリリースされ、Copilotハーネス(Copilot harness)が導入されました。Copilot SDKを基盤とするこのハーネスは、VS CodeのエージェントにGitHub CopilotアプリやCopilot CLIと同じ挙動と機能を提供します。また、Agent Host Protocolに基づく専用のホストプロセス内で動作するため、同じセッションに複数のウィンドウから参加することが可能です。リリースノートでは、一部のユーザーに対してすでにデフォルトで選択されている可能性があると注意を促しています。試験的機能として、マルチフォルダセッションにより各チャットに専用のフォルダやワークツリーが割り当てられるようになり、エージェントはOS、メモリ、CPU数、モデルに応じて選択されたリモートホストにセッションを委任できるようになりました。企業向けの管理機能として、管理者が要求する最小バージョンのチャット内での説明、管理設定(autoTier)によるAutoモードのデフォルトレベルの設定、およびCopilotのOpenTelemetryデータへのユーザー識別の追加(デフォルトは無効)の3点が導入されています。
HydraFusionがVS CodeおよびGitHub Copilotアプリに登場
9月30日 — GitHubは、9月4日にCopilot CLIで発表されたマルチモデルオーケストレーション「HydraFusion」を、VS Code(バージョン1.140以降、またはInsiders)およびGitHub Copilotアプリ(引き続きリサーチプレビュー中)へと拡大しました。HydraFusionはセレクター上でモデルと同様に選択できますが、それ自体は単一のモデルではありません。ワークフローの選択を最適化問題として扱い、3つのパターンのいずれかを採用します。Singleモードでは単一のモデルがタスクを解決し、Cascadeモードでは高効率モデルが作成した結果を品質チェックが承認するか、より強力なモデルへエスカレーションします。Critiqueモードでは、別のモデルファミリーから選ばれた読み取り専用の批評役がレビューを行い、その後作成役が一度修正します。Autoモードがリクエストごとにモデルを選択するのに対し、HydraFusionは単一のターン内で複数のモデルを連携させます。Copilot Pro、Pro+、Business、Enterpriseで利用可能となっており、BusinessおよびEnterpriseでは管理者がプレビューを有効化する必要があります。なお、GitHubは新たな数値を公表していません。
🔗 VS CodeおよびGitHub CopilotアプリにおけるHydraFusion
Google Cloud、gcloudとbqを実行するリモートMCPサーバーをプレビュー公開
Google Cloudは、管理対象のリモートMCPサーバー群に「Google Cloud CLI remote MCP server」をパブリックプレビューとして追加しました。これは、gcloudおよびbq(BigQuery)コマンドラインツールの数百に及ぶコマンドを、run_gcloud_commandとrun_bq_commandという2つのMCPツールに集約したものです。Googleがコマンドラインを採用した理由として挙げているのは、APIではオーケストレーションが必要となる複数ステップの処理が1つのコマンドにカプセル化されている点と、モデルがこれらのコマンドに関する公開ドキュメントで十分にトレーニングされている点の2点です。このリモートサーバーにより、エージェント環境にCLIをインストールする必要がなくなるため、Gemini Enterpriseのようなウェブホスト型エージェントプラットフォームでもこれらの操作が可能になります。コマンドは、ネットワークが制限されたプロキシの背後にある分離サンドボックス内で、環境認証情報(ambient credentials)を持たずに実行され、それぞれAgent IdentityまたはOAuth 2.0で認証された呼び出し元IDのIAM権限で実行されます。Model Armorによってプロンプトやレスポンスをフィルタリングでき、各呼び出しを監査ログに記録することも可能です。サーバー自体には利用料金がかからず、作成されたリソースと発生したデータ転送量のみが課金対象となります。
🔗 Google Cloud CLI remote MCP serverでエージェントを強化(Google Cloudブログ)
短報
- Codex CLI 0.159.2 — 9月29日23時57分(UTC)にリリースされたこのバージョンには、バックポートされた修正が1件のみ含まれています。Windowsにおいて、Codexがバックグラウンドプロセスやサンドボックス内のコマンドを起動する際に、コンソールウィンドウが点滅しなくなりました。🔗 ソース
- AmpにおけるPlaid — GPT-6 Astraを使用するAmpのモードに、OpenAIの超高速層に基づくPlaidが追加されました。Ampが提供する推論限定で、トークンあたりのコストが6倍になる代わりにリクエストが最大6倍高速化されます。サブエージェントは高速(fast)または標準(standard)の速度にとどまり、Ampは価格を公開していません。🔗 ソース
- WarpとFactories as Code — Warpは、自社のソフトウェアファクトリの設定を「エージェントのためのTerraform」と表現しています。1つのリポジトリでエージェント、自動化、アクセス権限、指標を記述します。factory.yamlフォーマットは8月下旬のもので、インタラクティブガイドではAWSやGCPへのフェデレーションアクセス、Webhook、Slack、Linear、Jiraの統合について詳しく解説しています。🔗 Warpのスレッド · 🔗 設定ガイド
- CrosbyにおけるDevin導入 — Cognitionの事例紹介によると、50人以上の弁護士に対して約12人のエンジニアを擁するニューヨークの法律事務所Crosbyは、インシデントへの一次対応をDevinに任せています。1日あたり20〜40件のバグやアラートを調査し、大半は約5分で処理され、Sentryのノイズが少なくとも50%削減されました。🔗 ソース
- claude.dev — Anthropicは、Claudeを使って開発を行う開発者の拠点としてclaude.devを正式に発表しました。技術的な詳細解説、Claude CodeやAPIのガイド、「Agents」「Engineering」「Playbooks」「Skills」のセクション、そして隠し要素としてのTerminalページが用意されています。同サイトの記事は9月22日からすでに共有されていました。🔗 ソース
- ChatGPT Sitesが編集可能に — 9月29日のリリースノートによると、公開されたSiteは「Edit site」で編集でき、PlusおよびProプランでは「Automations」からスケジュール設定が可能になりました。Enterpriseでは、プライベートSiteが接続されたアプリケーションを利用でき、プラグインごとにデフォルトで無効化されている「Allow use in Sites」設定が用意されています。🔗 ChatGPTリリースノート · 🔗 EnterpriseおよびEdu向けノート
- Kimi Work 3.2.15 — 9月30日のバージョンでは、内蔵ブラウザ内でのNotionおよびFeishuドキュメントの人間とAIによる共同編集に対応し、エージェントの進行ログをデフォルトで折りたたむようにしたほか、PPTの同時編集時におけるファイルの破損を修正しました。🔗 ソース
- Cueが財務管理に対応 — Manus 2.0とともにローンチされた個人向けエージェントアプリ「Cue」が、サブスクリプションや支出傾向の追跡、およびPlaidを介した銀行口座の自動管理に対応しました。対象国、プラン、利用条件は明記されていません。🔗 ソース
- GensparkにGPT-6.1 Solが登場 — Gensparkはローンチ翌日に「AI Chat」「Code Agent」「Claw」でGPT-6.1 Solを利用可能にしました。OpenAIのアピールポイント(API価格がAstraの5分の1で、同等レベルの知能)を踏襲していますが、プランやクレジット消費量は明記されていません。🔗 ソース
- Qwen3.8-27B-pi — Thomas Kim氏がPiハーネス向けにQwen3.8-27BのファインチューニングモデルをApache-2.0で公開しました。これは推論の取り組みレベル(effort level)の序列を正常化するもので、Terminal-Bench 2.1において、mediumレベルでベースモデルのxhigh(89タスク中67タスク)と同等の成果を出し、出力トークン数を約41%削減しています。🔗 ソース
- NebiusにおけるQwen3.8-27B — Qwenは、9月28日に発表されたNebius Token Factoryへの270億パラメータの密(dense)モデルの導入を告知しました。コーディング、リサーチ、エージェントワークフロー向けとされていますが、価格やスループットは公表されていません。🔗 ソース
- Bekko System One v0 — 舘野祐一(Yuichi Tateno)氏が、17M、68M、400Mパラメータの3つの意思決定モデル(最小の2つはブラウザ内で動作可能)とベンチマーク「S1MB」を公開しました。400MモデルはJev 1.13の59.59に対して50.60を記録したものの、汎化性能では96.27に対して54.48となりました。🔗 ソース
- ZooWork Instinct Tuned 4B — SRPはQwen3.5-4Bをベースに構築された40億パラメータの意思決定モデルをApache-2.0で公開しました。このモデルはデコードを行わずに1パスで選択肢をスコアリングします。開発中に使用されたJevBenchの公開タスクにおいて231問中198問(85.71%)を達成したと著者は明記しています。🔗 ソース
- Transformers v5.18.0 — Hugging Faceは、NVIDIAのNemotron 3 DiarizationおよびNemotronH Omni、NAVERのHyperCLOVAX Vision V2、GTEの4つのアーキテクチャを追加し、6件の破壊的変更を告知しました。🔗 ソース
- TaskSmith — Hugging Faceで強化学習環境を担当するAdithya S K氏が、プルリクエストを検証可能な強化学習(RL)環境に変換するオーケストレーターを公開しました。TRL、PEFT、Accelerate、Diffusers、Transformersから抽出された50の環境が、Harborタスクとして提供されます。🔗 ソース
- TraceML 0.4.1 — このオープンソースツールは、オプティマイザの更新グループ全体を測定できるようになりました。ResNet-50とT4 GPUでの検証では、データ読み込みの調整後、データ待ち時間がステップの23%から2ms未満へと短縮され、オーバーヘッドの中央値は0.35%にとどまりました。🔗 ソース
- ループ型Transformer — 54,106パラメータと260の検証可能なケースを持つトイモデルにおいて、80ブロックパスという同一の計算バジェットの下で、1ループでは260ケースすべてを学習したのに対し、2ループでは平均125.3、8ループでは37.0にとどまりました。パスの回数を増やしても学習の経済性は向上しませんでした。🔗 ソース
- 「ノー」と言える評価 — Eric Mey氏のチュートリアルでは、映画レビューの感情分析(SST-2)において、ホールドアウトデータで7ポイント上回っていたモデルが、重要な動作が悪化したために評価で不合格とされる様子が示されています。スクリプトはCPU上で1分未満で実行できます。🔗 ソース
- 1万件の合成保険加入者データ — Intelligent Actuariesは、生命保険の失効および解約に関する合成研究データをCC-BY-4.0で公開しました。10市場における架空の保険加入者1万人、計27,692件の2023〜2025年の保険年度レコードがSOA-LIMRA調査形式で収録されています。🔗 ソース
- cuObjectとSCADA Server SDK — NVIDIAは、CPUメモリを経由せずにRDMAでオブジェクトストレージにアクセスするcuObjectライブラリの一般提供を開始し、40社以上が参加するStorage-Nextイニシアチブにおいて、IBMがStorage Scaleでプロトタイプを作成したSCADA Server SDKを立ち上げました。🔗 ソース
- NeMo RelayとHermes Agent — Nous ResearchのTeknium氏と共同執筆されたNVIDIAのチュートリアルでは、Hermesエージェントの追跡が紹介されています。108回の実行において、ツール修正によりQwen3 Coder 30Bの成功数が27問中19問から22問に向上したものの、モデル呼び出し回数は3.8回から4.9回へと増加しました。🔗 ソース
- OpenClaw Enterprise向けOpenShell — NVIDIAは、OpenClaw Enterpriseのエージェントをガバナンスするためのオープンソース環境「OpenShell」を提案しました。OpenClaw Enterpriseは、OpenClaw財団がRed Hat、NVIDIA、OpenAIとともに前日に発表した、永続エージェント向けのオープンソースコントロールプレーンです。🔗 ソース
- GitHub Advanced Securityのトライアル — GitHub Teamのユーザーは、組織の概要(Overview)ページ、請求ページ、またはリスクアセスメント(Risk Assessment)から、GitHub Code SecurityおよびGitHub Secret Protectionのトライアルをセルフサービスで開始できるようになりました。期間は明記されていません。🔗 ソース
- GHE.comとX25519 — 2026年10月7日以降、データレジデンシー対応のGitHub Enterprise Cloudでは、鍵共有にX25519のみを提示するTLSクライアントの接続を拒否します。P-256およびP-384は引き続きサポートされ、SSHは影響を受けません。🔗 ソース
- Runwayにおける2つの導入事例 — フランスの飲料ブランドBonjourはRunwayを活用して500以上の広告バリエーションを制作し、5万ユーロ以上の制作費を再配分しました。World Juggling Federation(世界ジャグリング連盟)は、ESPN向けの1時間の番組パッケージ制作を1人の担当者に任せました。🔗 Bonjour · 🔗 World Juggling Federation
- LumaのAd Variants — Lumaは、同一キャンペーン内で完成した広告を複数のサイズや複数の市場向けに展開する機能をアピールしていますが、価格、プラン、提供開始時期、および公式記事は公開されていません。🔗 ソース
- Microduckの量産開始 — Pollen Roboticsは、シミュレーションで学習されたオープンソース強化学習スタックを採用する399ドルの小型二足歩行ロボット「Microduck」10,950台が、12月10日から1月10日にかけて週単位のバッチで生産ラインから出荷されると発表しました。🔗 ソース
- Cognitionの採用動向 — Devinの開発元であるCognitionは、Alex Stamos氏が最高情報セキュリティ責任者(CISO)に就任した翌日、元Snowflake最高収益責任者(CRO)のChris Degnan氏をチーフレベニューオフィサーとして迎えました。🔗 Chris Degnan · 🔗 Alex Stamos
- Claude Founder House — Anthropicは、SF Tech Week期間中のサンフランシスコ(10月6日〜8日、Terra Gallery)およびストックホルム(10月14日)で創業者向けイベントを開催し、講演、ワークショップ、同社のApplied AIチームとの個別相談セッションを実施します。🔗 ソース
- AI Engineer Paris — Mistralは、前週にStation Fで開催されたイベントを総括しました。900人以上の参加者、60人の登壇者、57のセッション、22のパートナーが集まり、製品の発表はありませんでした。🔗 ソース
- NVIDIAの博士課程フェローシップ — 2027-2028年度Graduate Fellowship Programの応募受付が2026年10月30日まで開始されており、博士課程の学生1人あたり最大60,000ドルが支給されます。2002年以降、220件以上のフェローシップが授与されています。🔗 ソース
これが意味するもの
今やセキュリティがフロンティアモデルのスケジュールを左右するようになっています。Gemini 4 ArgonはFairwind Programの論理を推し進めており、信頼できるサイバー防衛担当者にサイバーガードレールなしで先行提供され、その他への提供は保護策を強化する期間を設けた上で、具体的な時期は示されず「可能な限り速やかに」とされています。同日、OpenAIは問題のもう一つの側面を浮き彫りにしました。保護すべき対象はもはやモデルそのものだけでなく、その推論プロセス(reasoning)でもあるということです。単一のアクターによるものかどうかに関わらず、OpenAIがMoonshot AIの関係者に中核があるとみなす蒸留キャンペーンは、推論トレースを防衛すべき資産へと変貌させ、技術的な対抗策や研究所と政府の間での情報共有を促しています。
本日公表された数値の多くは、発表者自身が設計または実施した測定に基づいています。Cohereは同日に発表した指標を用いてEmbed 5を評価しており、従来の指標ではモデルの性能が劣って見える可能性があると自ら警告しています。HeyGenは独自のElo評価、Hunminは社内プロトコル(エージェントベンチマークは1回の実行のみ)に依存しており、Reality Checkでは主催者自らがモデルを微調整しています。これとは対照的に、Perplexityはturbopufferのプライベートベンチマークでモデルのブラインド評価を実施し、Open TTS LeaderboardやAURORAは投票や自動翻訳を検証可能なタスクと指標に置き換えています。2つのスコアを比較する前に、誰がそれを算出したのかを見極める必要があります。
画像および動画生成は、実用性とコストによって評価される傾向が強まっています。Ideogram 4.5が約束するのは、より美しい画像ではなく、連続した編集に耐えうる画像です。HeyGen Videoは秒単位で販売され、同社の価格表にあるどのモデルよりも安価であり、MiniMax H3のような基盤モデルからHeyGenやCreatifyに至る特化型モデルが生み出せることを示しています。Runway Adsは広告支出までのフローを完結させ、2月以降倍増したElevenLabsの企業価値は、対話型エージェントに対する企業の需要に支えられています。
開発者側では、ハーネスがモデルとは切り離された本格的なプロダクトになりつつあります。VS CodeはCopilotのハーネスを採用してエージェントをアプリやCLIと揃え、HydraFusionは同一ターン内で複数のモデルを連携させ、Zedはエージェントがサブエージェントごとにモデルを選択できるようにし、Manusは自社のハーネスをサードパーティプロバイダーのAPIキーに開放しています。Gemini CLIは非対話モードで人間の介入なしに計画を実行できるようになり、Claude Codeはスクリプト用途に向けて--bareを厳格化し、Google Cloudはサンドボックス内で呼び出し元のIAM権限を用いてgcloudやbqをエージェントに公開しています。この需要はインフラにまで及んでおり、CoreWeaveで稼働するVera Rubin NVL72の最初の本番顧客は、Devinの開発元であるCognitionです。
ソース
- Gemini 4 Argon: our next era of frontier intelligence(Googleブログ)
- Google DeepMindのGeminiページ
- @GoogleDeepMindによるGemini 4 Argonの発表
- 蒸留キャンペーンに関するOpenAIの投稿
- Stealing Reasoning Traces from Proprietary LLM APIs (arXiv)
- CohereのEmbed 5に関する投稿
- @cohereによるEmbed 5の発表
- CohereのRCP-nDCG@10に関する投稿
- GitHub上のRCP-nDCGのコードとデータ
- コンテキスト埋め込みに関するPerplexity Researchの投稿
- Hugging Face上のpplx-embed-v2-context-9b-preview
- @ideogram_aiによるIdeogram 4.5の発表
- Ideogram 4.5モデルページ
- HeyGen Videoカタログ
- @HeyGenによるHeyGen Videoの発表
- GeminiアプリのSkills(Googleブログ)
- Introducing Manus Flex
- @botによるGrok BotとCursorに関するスレッド
- Runway Research上のPraxis-1
- MolmoAct 2とReality Checkに関するAi2のツイート
- Poke & WiggleのReality Checkリーダーボード
- Physis-Langプロジェクトページ
- @NVIDIAAIによるPhysis-Langの発表
- Hunmin-CUAの投稿
- Hunmin-397B-A17B-CUAの重み
- JEV-27B-VLの投稿
- Open TTS Leaderboardの投稿
- Hugging Face上のOpen TTS Leaderboard
- LILTのAURORAに関する投稿
- AURORAランキング
- Claude for Government is now generally available
- How Anthropic’s sales team rebuilt inbound with Claude Managed Agents
- 中小企業に関するOpenAIの投稿
- Runway Adsに関する投稿
- Runway Adsに関する@runwaymlのツイート
- 株式公開買付けに関するElevenLabsの投稿
- CoreWeaveとVera Rubinに関するNVIDIAの投稿
- Claude Code 2.1.286のリリースノート
- Zed 1.22.0のリリースノート
- Gemini CLI v0.63.0-preview.0
- Gemini CLI v0.62.0
- VS Code 1.140のリリースノート
- HydraFusion in VS Code and the GitHub Copilot app
- Google Cloud CLIのリモートMCPサーバー(Google Cloudブログ)
- Codex CLI 0.159.2
- AmpにおけるPlaid Speed
- @warpdotdevによるFactories as Codeのスレッド
- Factories as Code, Warp
- DevinのCrosby導入事例
- @ClaudeDevsによるclaude.devの紹介
- ChatGPTのリリースノート
- ChatGPT EnterpriseおよびEduのリリースノート
- Kimi Workのリリースノート
- Cueと財務管理
- GensparkにおけるGPT-6.1 Sol
- Qwen3.8-27B-pi
- Nebius Token Factory上のQwen3.8-27B
- Bekko System One v0
- ZooWork Instinct Tuned 4B
- Transformers v5.18.0
- TaskSmith
- TraceML 0.4.1とTransformersのTrainer
- ループ型Transformerのトレーニング
- Write an eval that can say no
- 1万件の合成保険加入者データ
- cuObjectとSCADA Server SDK
- NeMo RelayとHermes Agent
- OpenClaw Enterprise向けOpenShell
- GitHub Team向けGitHub Advanced Securityのトライアル
- GHE.comにおけるX25519限定TLSのサポート終了
- BonjourのRunway導入事例
- World Juggling FederationのRunway導入事例
- LumaにおけるAd Variants
- Microduck, Pollen Robotics
- CognitionにおけるChris Degnan氏
- CognitionにおけるAlex Stamos氏
- Claude Founder House
- @MistralDevsによるAI Engineer Parisの総括
- NVIDIA Graduate Fellowships