検索

Gemini 3.8 Flashが3分の1の価格で最上位モデル級に、MetaのMuse Spark 1.3、Qwen3.8-Max-0902がCode Arena WebDevで首位

ai-powered-markdown-translator

gpt-5.6-solでフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

9月2日だけで49件の発表があり、この定点観測の開始以来3番目に多い一日となった。GoogleのGemini 3.8 Flash、Meta Superintelligence LabsのMuse Spark 1.3、AlibabaのQwen3.8-Max-0902という3つの主要モデルが同日に登場したが、いずれも単純なスコア競争を前面には押し出していない。

今回の記事には4つの潮流が流れている。まず価格であり、3件すべての発表で中心的な訴求点となった。次にローカル推論で、動画生成がデスクトップマシンで動くようになり、同じ夜にはApple Silicon向け推論エンジンのコードも公開された。さらに企業におけるモデルのガバナンスでは、GitHubがあるモデルにはデータ保持を義務付ける一方、その他すべてについては既定モデルを選択可能にしている。そしてサイバーセキュリティでは、選定された防御担当者に限定した専用モデルが登場し、あるアライアンスがLinux Foundationに加わった。


Gemini 3.8 Flashと3.8 Flash Cyber、同じ価格でより多くの処理をこなすモデル

9月2日 — Googleは、Tulsee Doshi(Senior Director, Product Management)とRaluca Ada Popa(Gemini Security Lead, Google DeepMind)の名で、Gemini 3.8 FlashとGemini 3.8 Flash Cyberという2つのモデルを発表した。Flashとしては6週間で3回目のリリースであり、3.7 Flashの登場からはわずか3週間しか経っていなかった。

両バリエーションは同じ基盤インテリジェンスを共有しており、Googleはコードと推論における進歩の一部を、サイバーセキュリティ分野での徹底的なトレーニングによるものだと明言している。防御モデルに向けた取り組みが、汎用モデルの性能も押し上げた。導入時の価格は3.7 Flashから据え置かれている。

Gemini 3.8 Flashの特性測定値
入力価格100万tokensあたり0.75ドル
出力価格100万tokensあたり3.75ドル
HLE-Verified54.9%

開発者が注目すべき点がある。Googleは率直に、このモデルはより多くのリソースを消費すると説明している。信頼性の向上は設計上の選択によるもので、複雑なタスクでは3.8 Flashが追加の推論ステップを実行し、ツールを反復的に呼び出す。そのため、推論努力を高いレベルに設定するとtokensの料金も増加する。Googleは、計算効率を優先するワークロードでは推論努力のレベルを下げるか、3.7 Flashを使い続けることを推奨している。旧バージョンも引き続き完全にサポートされる。

Cyber版はさらに異色だ。同日開始されたFairwindプログラムを通じて信頼できる防御担当者だけに提供され、自律的な脆弱性の発見、とりわけその自動修正を目的としている。

サイバーセキュリティ評価Gemini 3.8 Flash Cyber比較対象
CyberGym Pass@1(C/C++の脆弱性発見)86.2%GPT-5.5-Cyber 85.6% · Mythos 5 83.8% · GPT-5.6 Sol 83.6% · 3.5 Flash Cyber 77.5%
20言語を対象とした社内Benchmark70%超C/C++のみに限定されない、より広い対象範囲
CWE-Bench pass@1(修正、Collinear)47.2%最先端モデルは47.8%で首位だが、コストは大幅に高い

社内導入の数値も、絶対的な優位性よりコスト性能の位置付けを裏付けている。Chrome Securityチームは、はるかに大規模な最高クラスの商用モデルと比べて有効な修正を2.6倍多く生成した。Wizは、同社の侵入テストBenchmarkで再現率が7.5~9.7%高く、コストは2.3~5.2分の1だったと測定している。またCloud Vulnerability Researchチームは、通常なら調査に数か月を要する重大な基盤脆弱性を2時間未満で特定した。一方、汎用モデルはすでにAntigravity、Google AI Studio経由のGemini API、Android Studio、Stitchのインターフェース生成、Gemini Enterpriseに導入されているほか、Google AI ProおよびUltraの加入者向けにGeminiアプリ、Google SearchのAI Mode、Google Sheetsでも提供されている。

🔗 Gemini 3.8 Flashと3.8 Flash Cyberの発表

リリースを裏付けるCursorBenchのスコア

Cursorは発表から数時間後にGemini 3.8 Flashをモデル選択画面へ追加した。同社独自のBenchmarkは、エージェントとして動作する実環境でのモデル性能について、現時点で最良の評価材料を提供している。同日付のCursorBench更新履歴によると、3.8 FlashはGeminiの「Latest」バージョンに昇格し、3.7 Flashは二次的な位置付けになった。

モデルと推論努力レベルCursorBench 3.2スコアタスクあたりの平均コストタスクあたりのステップ数
Fable 5.1 Max73.4%9.64ドル70
Grok 4.6 Extra High70.8%2.81ドル46
Fable 5.1 High69.4%4.80ドル44
Opus 5 Extra High69.3%7.35ドル72
Gemini 3.8 Flash High69.2%2.38ドル161
Gemini 3.8 Flash Medium67.0%1.93ドル136
Gemini 3.7 Flash High61.6%1.20ドル99

要点は明快だ。Gemini 3.8 Flash Highは69.2%で、Fable 5.1 Highと同等のスコアを約半分の価格で、Opus 5 Extra Highと同等のスコアを3分の1の価格で達成している。前世代との差は7.6ポイントだ。ただし、ステップ数の列はGoogleの設計選択に伴う隠れたコストも示している。Fable 5.1 Highがタスクあたり44ステップなのに対し、こちらは161ステップだ。Cursor自身もページ下部で2つの注意点を示している。結果にはばらつきがあり、表示コストは請求書で実測したものではなく、100万tokensあたりの公開価格から算出したものだ。

🔗 CursorのGemini 3.8 Flash · 🔗 CursorBenchの結果


Meta Superintelligence Labsのエージェントモデル、Muse Spark 1.3

9月2日 — Meta Superintelligence LabsはMuse Spark 1.2の後継となるMuse Spark 1.3を公開し、同日中にMuse Codeと、dev.meta.aiから利用できるMeta Model APIへ導入した。Muse Voice Transcribeに続く、同研究所から2日連続のリリースとなる。

掲げられた重点はスコア競争ではなく、実用上の使いやすさだ。このモデルは、単一のスレッドで複数の作業の流れを扱いながら、長期にわたるタスクを継続できるよう設計されている。自由度の高い目標を与えられると、ツールを使って雑然とした矛盾する情報源から独自のコンテキストを構築し、計画の不足を修正し、学習した内容を記録する。最も珍しいのは協調に関する部分だ。Muse Spark 1.3は、指示が曖昧なときには確認質問を行い、行き詰まったときにはユーザーに助けを求め、影響を伴う操作の前には確認を取るようトレーニングされている。Metaのエンジニアによる比較では、バージョン1.2よりツール呼び出しが約20%少なく、tokensの使用量も25%少ない。これは料金に直接反映される差だ。

評価カテゴリーBenchmarkMuse Spark 1.3Muse Spark 1.2GPT-5.6 SolOpus 5
エージェントGDPVal-AA v2(知的作業)1754161517101824
エージェントOSWorld 2.0(デスクトップのエージェント操作)66.947.662.768.3
エージェントDeepSearchQA(エージェント型ブラウジング)89.485.993.090.4
エージェントAutomationBench(業務フロー全体)49.438.246.750.3
長文コンテキストMRCR 512K-1M98.155.573.8
コーディングDeepSWE v1.1(長期エージェント型コーディング)75.455.073.074.0
コーディングSWEAtlas CodeBase QnA59.446.253.552.7

この表は注意深く読む必要がある。Muse Spark 1.3は長文コンテキストとコーディングで明確に優位だが、ここで採用された4つのエージェント評価では、いずれもOpus 5が上回っている。さらに重要なのは、比較条件が同一ではない点であり、これはMetaが公開した評価方法にも明記されている。Muse Spark 1.3と1.2は推論努力レベルxhighで評価されたのに対し、Claude Opus 5とGPT-5.6 Solはmaxモードで評価された。唯一の例外はDeepSWE v1.1で、Muse Spark 1.3もmaxで測定された。しかし、まさにこのモードはまだ提供されておらず、Metaは追加の安全性試験が完了次第、利用可能になるとしている。

ロードマップの一節は、オープンエコシステムにとって注目に値する。

Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.

🇯🇵 さらに大規模なモデルやMuse Sparkのオープンウェイトなど、近日中にお届けする続報にご期待ください。@AIatMetaのXへの投稿

Metaがオープンウェイトのリリースを大幅に減らした一年を経て、この方針表明は注目に値する。ただし、対象となるバージョンはまだ不明で、日程も範囲も示されていない。

🔗 Muse Spark 1.3の紹介


Qwen3.8-Max-0902がCode Arena WebDevで首位に

9月2日 — Qwenは旗艦モデルのアップデートとなるQwen3.8-Max-0902を公開した。日付入りのsnapshotであり、qwen3.8-max-2026-09-02というaliasにも対応する。このモデルは、2兆4,000億parametersと100万tokensのcontext windowという8月版の構造的特徴を維持しつつ、「Coding & Cowork」に重点を置いた追加のpost-trainingを受けている。

モデルの特性公開値
Parameters2.4 T
Context window1 M tokens
最大入力991 K tokens(thinkingモードでは983 K)
最大出力131 K tokens
推論予算262 K tokens
入力および出力価格100万tokensあたり2ドルおよび6ドル
明示的cache読み取り100万tokensあたり0.17ドル
暗黙的cache読み取り100万tokensあたり0.25ドル
明示的cache作成100万tokensあたり2.50ドル
Rate limits1分あたり1 M tokens、1分あたり15 K requests

このモデルは画像、テキスト、動画を入力として受け付け、Responses APIを通じて5つの組み込みツールを提供する。code interpreter、画像から画像への検索、テキストから画像への検索、web extractor、web searchだ。同日からQwenCloudのAPI経由で利用できる。

同日、Arena.aiはCode Arena WebDevの結果を発表した。Qwen3.8-Max-0902は総合ランキングでいきなり首位に入り、1,691ポイントを獲得した。これは前バージョンを22ポイント上回り、Max設定のClaude Opus 5を3ポイント、Max設定のKimi K3を17ポイント上回る。100万tokensあたりの混合価格が5ドルで、このモデルはArenaのPareto frontier上で最高評価の位置を占めている。つまり、ランキング全体で最良のスコア対コスト比を実現している。

カテゴリー別の詳細を見ると、評価には少し違った側面が見える。Data & AnalyticsとConsumer Productでは1位、Brand & Marketing、Gaming、Simulationsでは2位、Content Creation ToolsとReference-Based Designでは3位だった。したがって、このモデルの強みは創造性中心のタスクよりも、データアプリケーションと一般消費者向け製品にある。Arenaは今後Agent Arenaのスコアも公開すると予告している。

🔗 Qwen3.8-Max-0902の発表


推論がクラウドを離れる:デスク上で動く動画生成、オープンライセンスのローカルエンジン

これは今日を貫く大きな潮流であり、個別の発表だけでは捉えきれない。2件の主要な公開と、より目立たない4件の動きが、昨日までデータセンターのGPUを必要としていた処理をローカルで動かすという同じ方向を示している。

9月2日 — Hao AI Lab(UCSD)のFastVideoチームは、オープン動画モデルMiniMax H3の蒸留版であるFastH3のローカル移植版を公開した。動画と音声を同時に生成するには、これまでデータセンターのGPUが必要だったが、現在はNVIDIA DGX Spark、QSFPリンクで接続した2台のDGX Spark、または36 GB以上のユニファイドメモリを搭載したApple Silicon Macで動作する。

主な制約は演算能力ではなくメモリだ。DGX Sparkは、約270 GB/sの128 GB LPDDR5Xユニファイドメモリを搭載している。これはデータセンター向けHBMの帯域幅のおよそ10分の1であり、実際に処理へ利用できるのは121 GBだ。そのため、パイプラインは段階的に処理を進める。まずプロンプトをエンコードし、テキストエンコーダーを解放してからTransformerを読み込み、ノイズ除去を行い、それを解放した後にVAEを読み込む。ディスクリートGPUでは、重みをホスト側へコピーすることでデバイスメモリを解放できるが、Sparkではコピー先も同じメモリプールになる。チームはこのコピーを廃止し、DiTをGPUへ直接読み込む方式を採用した。その結果、Transformerの読み込み時間は445秒から39秒へ、768×1344で124フレームを生成する実行時間は772秒から336秒へ短縮された。

テスト機初回生成反復生成
Apple M4 Max504 s465 s
DGX Spark264 s243 s
4x GB20010,2 s5,1 s

DGX Spark向けに公開されているvLLM-Omniの手順では、1024×576、5秒間の動画、50ステップの処理に1,881秒を要する。一方、4ステップのFastH3では268秒まで短縮され、約7倍高速になる。この比率は832×480で8.4倍まで上昇し、1344×768では7.9倍となる。M4 Maxでは、キャッシュされていないプロンプトのエンコードが約80秒から約17秒へ短縮され、TAEH3デコーダーによりデコード時間は102秒から1秒へ、ピークメモリは11.0 GiBから3.6 GiBへ削減される。MLXの重みはINT8、INT6、INT4形式でHugging Face上に公開され、今回初公開となるFastVideo Cookbookも付属する。次の対応対象として発表されたのは、5090と4090を含むRTXファミリーだ。

同日の夜、PerplexityはLilyをオープンソース化した。Lilyは、Mac上で同社のハイブリッド計算におけるオンデバイス部分を実行するローカル推論エンジンだ。このエンジンは前日に研究記事で発表されていたが、新たな点は、Apache-2.0ライセンスの下でperplexityai/pplx-gardenリポジトリにコードが公開され、fabric-libおよびpplx-unigramと並んだことにある。

コードからは、極端な特化を選んだ設計方針が確認できる。Lilyは汎用エンジンではない。読み込めるのは、グループサイズ64のMLX形式で4ビットのアフィン量子化を施したQwen3.6-35B-A3Bチェックポイント1種類だけであり、読み込み時に検証される。QwenのDenseチェックポイント、小型バリアント、BF16、GGUF、AWQ、GPTQ、int8、fp8は明示的に拒否される。Rustで記述され、起動時にソースからコンパイルされるMetalカーネルを使用し、実行経路ではPyTorchもMLXも利用しない。また、最低でもmacOS 26上で、ファミリー10以降のApple GPU、すなわちM5以降を必要とする。APIの範囲も同様に絞り込まれている。ルートは3つだけで、デコードは常にGreedy方式となり、サンプリングパラメーター、ストリーミング、ツール、マルチモーダルコンテンツは無視されるのではなく拒否される。この狭さこそが興味深い点だ。Perplexityが提供しているのはMLX-LMの競合ではなく、特定のプラットフォームとモデルに合わせて設計された専用エンジンが汎用フレームワークを上回ることの実証である。

同日に公開されたほかの4件も同じ方向を示しており、「短信」で取り上げている。17言語に対応する17~42 MBの翻訳モデルTranslatePsy-Nano、出力を1バイトも変えずにMoEモデルのエキスパートをNVMe上へ配置するi64 Systemsの取り組み、企業における小型モデルの適切なサイジングを支持するCohereの記事、そしてPerplexityのPortable Computerをローカルで実行することに焦点を当てたNVIDIAのDGX Sparkライブ配信だ。個別には大きな動きではないが、いずれも計算処理をデータセンターからデバイスへ移している。

🔗 FastH3をローカルで実行 · 🔗 Lilyのオープンソース化 · 🔗 pplx-gardenリポジトリ


AnthropicがClaude Commerce Agentsをオープンソース化

9月2日 — Anthropicは、コマースエージェント構築用のApache 2.0ライセンスによるリファレンスリポジトリ、Claude Commerce Agentsをオープンソースで公開した。この発表は、eコマースチームが導入計画を立てるホリデーシーズンに意図的に先駆けて行われた。

このブループリントには、2つの完全なエージェントが含まれる。ショッピングエージェントは企業のアプリケーション内で動作し、カタログを検索し、自然言語で示された要望に応じて商品一式を組み合わせ、顧客の好みを記憶し、商品、比較、カートを会話内に表示したうえで、チェックアウトへ引き継ぐ。また、同じスレッド内でカスタマーサービスの質問にも回答する。マーチャントエージェントは店舗運営チーム向けで、販売分析、キャンペーン前の在庫切れ商品の警告、履歴に基づく価格提案、キャンペーン文面の作成を行う。

リポジトリの要素提供内容
提供されるエージェントショッピングエージェント(顧客向け)とマーチャントエージェント(バックオフィス向け)
実行可能な業種別構成小売、旅行、通信、チケット販売
ランタイムMessages API、Claude Agent SDK、Claude Managed Agents(ベータ)
デプロイ先プラットフォームClaude API、Amazon Bedrock、Microsoft Foundry、Google Cloud Vertex AI
Claude Codeプラグインcommerce-builder@claude-commerce-agents
技術要件Python 3.11以降、Node 22
すでに確認された成果Claude上でショッピングエージェントを運用する小売業者では、カート金額が最大35%増加し、購入者が決済を完了する可能性が60%上昇

モデルが判断する内容と、実際に実行される内容との分離は、宣言上ではなく構造上のものだ。消費者側では、エージェントが呼び出すバックエンドインターフェースに決済メソッド自体が存在しない。マーチャント側では、各書き込みツールがサーバー側で生成された識別子を伴う保留中の変更を作成し、apply_change関数は、実際の人間による検証画面で承認された識別子に対してのみ完了する。Anthropicは、これはメンテナンスもコントリビューションの受け入れも行わないリファレンス実装であると明記している。追随すべき依存関係ではなく、フォークするための出発点だ。デモに登場する企業はすべて架空であり、注文の確定やカードへの請求は一切行われない。

🔗 Claude Commerce Agentsの発表 · 🔗 commerce-agentsリポジトリ

技術面:キャッシュ、レイテンシ、コードによるガードレール

同日に公開され、Ali ShazalとMatthew Koenが執筆したブループリント付属のエンジニアリングガイドは、小売業者、マーケットプレイス、旅行事業者との1年間の取り組みをまとめている。最初の助言は直感に反するものだ。多数の商品カテゴリーを扱う必要があるエージェントでも、分野ごとにサブエージェントを作成してはならない。コマースの会話は強く結合された単一のセッションであり、分割すると品質が低下する。能力はエージェント数を増やすことではなく、スキルによってもたらされる。

対象項目Anthropicが示した数値的目安
表示されるコマース応答出力500~700 tokens
キャッシュ済みtokensの読み取り新規tokensの10分の1のコスト
キャッシュへの書き込み約1.25倍の追加コスト、2回目の利用から償却
目標とするキャッシュ成功率90~99%
キャッシュ読み取り速度約100,000 tokensの規模で1.5~2倍高速
メモリによる向上内部評価スイートで事実想起率が13%向上
フローごとの評価ケース数最初は50~100件

モデル選択については、分析が中心となるマーチャントエージェントではOpusから、レイテンシの重要性が高い消費者向けエージェントではSonnetから始めることが推奨されている。その後、モデル呼び出し単位ではなく完了したタスク単位のコストを測定しながら、各モデルと各effortレベルについて評価スイート全体を実行する。安全性の節は明快だ。

The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.

🇯🇵 安全な振る舞いはプロンプトから始まるが、コマースにおいてプロンプトを安全性の適用場所にすることはできない。障害は金銭的なもので、多くの場合は取り消せず、プロンプト上のルールは1回のインジェクションや不適切なサンプルによって回避され得るにすぎない。Anthropic、「効果的なコマースエージェントの構造」ガイド

そのため、4つのルールがコードで適用され、3つのランタイムで共有できるよう一度だけ定義されている。モデルは準備を行うが、適用するのは人またはポリシーであること、書き込みとレンダリングはサーバーが発行した識別子のみを受け入れること、上限付きトランザクションはリクエストが繰り返されても上限を守ること、第三者コンテンツは無害化することだ。


Claude CodeとClaude Coworkでコンピューター操作がバックグラウンドへ

9月2日 — Claudeによるコンピューター操作(computer use)が画面を占有しなくなった。これまでは、この種のタスクを開始するとマシンを明け渡すような状態になり、Claudeが許可されたアプリケーションで作業している間、ほかのウィンドウは非表示になっていた。今後はClaude CoworkでもデスクトップアプリケーションのCodeタブでも、別の作業を続けながらタスクがバックグラウンドで進行する。

この変更はベータ版で、ProおよびMaxプランに限定され、macOSでのみ利用できる。一方、computer use自体は引き続きmacOSとWindowsでresearch previewとして提供されている。すでにこの機能を利用していた場合、何も有効化する必要はない。それ以外の場合はSettings > Generalから利用できるが、macOSではシステムのアクセシビリティ権限と画面収録権限も必要になる。

セキュリティの枠組みに変更はない。サンドボックス内で動作するBashツールとは異なり、computer useは実際のデスクトップ上で実行される。アクセスレベルは引き続きアプリケーションのカテゴリーごとに固定され、変更できない。ブラウザと取引プラットフォームでは閲覧のみ、ターミナルとIDEではクリックのみとなり、Claudeが画面操作ではなく専用ツールを使用するよう促される。それ以外ではフルコントロールが許可される。承認は現在のセッション中、またはDispatchから開始されたセッションでは30分間有効となる。

🔗 バックグラウンドcomputer useの発表


Cursorが顧客管理のマシン上でクラウドエージェントを実行可能に

9月2日 — CursorはJack Pertschuk名義の製品記事を公開し、顧客が所有するインフラストラクチャ上でクラウドエージェントを利用可能にした。これまでCursorのクラウドエージェントは、同社のクラウドにある専用仮想マシン上で動作していた。Self-Hosted Machinesでは、ツールの実行が企業ネットワーク内のマシンへ移る一方、エージェントループ、推論、計画は引き続きCursor側で行われる。

この施策を裏付ける数字が冒頭で示されている。現在、Cursorが社内でマージするpull requestsの60%以上をクラウドエージェントが作成している。こうしたエージェントが担う作業の割合が増えるにつれ、エージェントを実行するマシンは些細な問題ではなくなる。同社は、チームが自社マシンを利用する理由として3つの状況を挙げる。ソース管理システムや社内サービスへ直接接続してツールを実行する場合、GPUやiOS開発用Macなどの特殊なハードウェアが必要な場合、クラウドエージェントのイメージとしてパッケージ化しにくいオペレーティングシステムを動かす場合だ。

仕組みの側面技術的な詳細
登録コマンドagent worker start、長時間維持される外向きHTTPS接続
接続の方向Cursorが顧客ネットワークに対して内向き接続を開始することはない
利用可能な構成My Machines(個別のワークステーションまたはVM)とPools(チーム共有キュー)
非アクティブ後の再開スナップショットによる休止、同じworker識別子で復元
サンドボックス提供事業者AWS Lambda、Cloudflare、Coder、Daytona、E2B、Modal、Namespace、Vercel
コンピューター操作Macに加え、ChromeまたはChromium経由でLinuxにも対応

Poolsは、リクエストキューを監視し、チームが提供するスクリプトでマシンを起動するコントローラーによってスケールする。空きworkerがなければ、リクエストは待機する。マシンをリセットする場合と稼働させ続ける場合の中間策として、どちらもコストがかかる問題に対応するため、Cursorは休止機能を導入した。非アクティブなマシンはスナップショットを取得して停止され、再接続可能期間内に再開要求が届けば、そのスナップショットから復元される。Poolはリポジトリに紐づかないため、同じキューで複数のリポジトリに対応できる。

ただし、記事自体が注意点を示している。移動するのは実行環境だけだ。ツールの出力は推論のためCursorへ送信され、コードが含まれる場合がある。また、エージェントのトランスクリプトもCursor側で処理・保存される可能性がある。したがって、これは完全な隔離ではなく、実行場所の移動である。

🔗 Self-Hosted Machines


Claude Fable 5.1がインテグレーターで一般提供開始

9月1日と2日 — リリース当日、Claude Fable 5.1はGitHub Copilotで一般提供が開始され、その翌日にはGensparkがCode AgentとClawに統合した。同じモデルが2日間で2つのインテグレーターに採用された。これは個別の2件のニュースではなく、導入の波だ。

GitHubでは、Visual Studio Code、Visual Studio、Copilot CLI、coding agent、GitHub Copilotアプリ、github.com、iOSおよびAndroid版GitHub Mobile、JetBrains IDE、Xcode、Eclipseと幅広く対応し、Pro+、Max、Business、Enterpriseプランを対象に、段階的な展開とプロバイダーの公開料金に基づく課金が行われる。しかし、この提供開始で最も注目すべき点は技術面ではなく、契約面にある。

アクセス条件Fable 5.1に適用される内容
管理者ポリシーデフォルトでは無効、明示的な有効化が必要
データ保持Anthropicの安全性分類器のためデフォルトで必須
保持データの用途Anthropicモデルのトレーニングには不使用
その他のClaudeモデルFable 5とFable 5.1を除き、ゼロデータ保持を維持
ゼロデータ保持の適用除外対象企業は暦年末まで
適用除外終了後Enterprise Frontier Safeguardsが必要

CopilotのほかのClaudeモデルとは異なり、Fable 5.1ではデフォルトでデータ保持が必要となる。Anthropicは安全性分類器を稼働させるために、プロンプトと出力を保持する。そのため、ポリシーを有効化することは、この制約への明示的な同意を意味し、無効のままにするとモデルを利用できない。回避措置は一時的かつ限定的だ。対象企業は、AnthropicがEnterprise Frontier Safeguardsを展開するまで、暦年末までゼロデータ保持を維持できる。Enterprise Frontier Safeguardsでは、自動化された安全性監視と、顧客が管理するストレージおよび暗号化キーが提供される予定だ。対象資格はセルフサービスでは得られず、GitHubの営業チームを通す必要があり、サポートがこの手続きを迂回することはできない。また、承認されても自動的には何も有効化されない。

一方、Gensparkは、ベンチマークや料金の詳細を示さず、Genspark Code AgentとClawに初日から統合したとしている。同社は、モデルのリリース後数時間以内に切り替えたエージェント型プラットフォームの列に加わり、Cursor、Devin、Warp、v0、Amp、Perplexity Computerと肩を並べた。

🔗 GitHub CopilotのFable 5.1 · 🔗 Gensparkの発表


GitHub、品質を落とさずCopilotを低コスト化した方法を詳説

9月2日 — GitHubは、Napalys Kliciusの協力を得てErik Kristensenが執筆した、Copilotのコスト削減に関するエンジニアリング記事を公開した。この種の記事としては珍しく、数値を示し、失敗した実験を説明し、一見明白な最適化が裏目に出る理由を解説している。

冒頭の主張は直感に反する。単独のやり取りのtoken数を数えても効率は測れない。エージェントに必要な情報を省いた簡潔なツール応答は、コマンドの再実行を強いるため、タスク全体ではより遅く、より高コストになる。GitHubはこの落とし穴を、読み取り前にshell出力を短縮するユーティリティRTK(Rust Token Killer)で例示している。RTKは一部の応答を確かに短縮したが、その後の情報回収手順によってターン数が増えた。局所的に節約したtokenを全体で消費したのだ。RTKは導入されなかった。

評価された変更測定された効果
オフラインテストでの行番号削除推論コストが約5%減少
CLIの本番環境での行番号削除ユーザー当たりの平均日次コストが約3%減少
ツールtaskのプロンプト圧縮1ターン当たり1,300 token削減、アクティブ時間当たりの正規化コストが2.9%減少
完了したバックグラウンド処理結果の直接配信AI Creditsで測定したtoken関連使用量が約2.3%減少
Copilot code reviewでの行番号削除と圧縮それぞれレビュー当たりのプロンプトtokenが約5%減少
以前実施した共有ファイルツールへの移行レビューコストが約20%減少
RTK(Rust Token Killer)評価対象外、テスト構成では全体コストが増加

採用された圧縮ポリシーは意図的に保守的で、3つの柱からなる。ソースコードらしい出力はそのまま保持し、検索結果は何も削除せずに並べ替え、インストール、build、testで生じる反復的なノイズだけを圧縮する。初期バージョンにはgit diffの圧縮も含まれていたが、ベンチマークタスクでエージェントが元の出力を開き直すことが判明し、削除された。

最も示唆に富むのはプロンプト圧縮の一件だ。Copilotが自身の指示を反復的に書き換えるメタプロンプティングのループにより、ツールtaskのプロンプトは半分になった。しかし、最初のオンライン実験では、オフライン評価が見逃していた性能低下が明らかになった。そのループは並列処理に関する慎重な指示を厳格な順序付け規則に変えてしまい、独立したエージェントを直列化していた。修正では、ホワイトリストとブラックリストを、判断をモデルに委ねる1つの文に置き換えた。最後に、最も有用な教訓は、効果は製品間でそのまま移植できないということだ。Copilot code reviewで得られた好結果を基に指示セットを簡潔にしたところ、Copilot CLIではコストが増加した。

None of these changes made the model smarter. They removed work the model never needed to do.

🇯🇵 これらの変更のどれも、モデルをより賢くしたわけではない。モデルがそもそも行う必要のなかった作業を取り除いたのだ。GitHub Blog「AIコーディングのコスト効率を高める方法」


Copilotのモデルカタログが再編

9月1日と2日 — 同じ時期に公開された2件のchangelogは、同じ再編の両面を説明している。Copilotのカタログから何が外れるのか、そして今後誰がデフォルトモデルを決めるのかだ。

9月1日付で、Copilot Chat、オンライン編集、askモードとagentモード、コード補完など、Copilotの大半の機能において6つのモデルが非推奨となった。

廃止対象モデルGitHubが推奨する代替モデル
Gemini 3.1 ProGemini 3.7 Flash
Claude Opus 4.5Claude Opus 4.7、Claude Opus 4.8、Claude Opus 5
Claude Opus 4.6Claude Opus 4.7、Claude Opus 4.8、Claude Opus 5
Claude Sonnet 4.5Claude Sonnet 5
Claude Sonnet 4.6Claude Sonnet 5
Raptor MiniMAI-Code-1.1-Flash

例外が1つあり、Claude Sonnet 4.6は年間プランの個人契約者が引き続き利用できる。ユーザー側での操作は不要だが、Copilot Enterpriseの管理者は、ポリシーで代替モデルを明示的に有効化しなければならない場合がある。有効化しなければ、VS Codeにもgithub.comにも表示されない。

同時に、企業向けの管理設定では、新規会話のデフォルトとして任意のモデルを指定できるようになった。設定単位は企業よりさらに細かい。管理者はキーmodeloverridableとして宣言し、team-mappings.json内のチーム構成ファイルを編集することで、各チームが独自のデフォルトを選べるようにできる。対象外のユーザーにはグローバル設定が継承される。この機能はCopilot BusinessとCopilot Enterpriseで一般提供されており、GitHub Copilotアプリ、Copilot CLI、Visual Studio Codeで利用できる。

🔗 非推奨モデル · 🔗 企業向けデフォルトモデル


8月のShip Log:SlackとTeamsのCopilot、CLIでのメディア対応

9月1日と2日 — GitHubがXの記事として公開した月次まとめは宣伝色の強い内容だが、それまで報じられていなかった8月のリリースを明らかにしている。GitHub CopilotがSlackとMicrosoft Teamsから利用できるようになった。この統合により、Copilot CLIとGitHub Copilotアプリのエージェント機能がチームの会話に持ち込まれる。GitHubをメンションすれば、スレッドを離れずに変更を計画し、問題を調査し、コーディングタスクを引き渡せる。

8月のShip Logの項目リリース内容
SlackとMicrosoft TeamsのCopilotCopilot CLIとCopilotアプリのエージェント機能
Copilot code reviewのBalanced深度Liteと並んで一般提供、組織またはリポジトリ単位でデフォルトを設定可能
紹介された新モデルGemini 3.7 Flash、MAI-Code-1.1-Flash、Fireworks AIがホストするKimi K3
GPT-5.6 Solのキャンペーン9月3日まで半額
自動選択のキャンペーンCopilot Maxユーザーは30%割引
GitHub Copilot Day2026年9月10日

このまとめでは、Liteと並んで一般提供となったCopilot code reviewのBalanced深度についても説明している。Balancedはpull requestのより詳細な分析を、Liteは直接的な変更を対象としており、デフォルトの深度は組織またはリポジトリ単位で設定できる。

同月の別のリリースは、コマンドライン側の全体像を補完するものだ。gh v2.99.0から利用可能なGitHub CLIの反復指定可能なflag --attachは、ローカルの画像または動画をアップロードし、issue、pull request、コメント内でインライン参照する。この機能はMarkdownを書き込む6つのコマンドで動作する。実用性を高めているのは既存Markdownの処理方法だ。本文ですでに参照されているローカルパスはその場で書き換えられるため、![alt](./login.png)は代替テキストを保持したまま、アップロード済みassetを指すようになる。代替テキストはパス内の#の後に指定する。対応形式はPNG、JPEG、GIF、WebP、SVG、MP4、MOV、WebMで、有料プランの上限は画像が10 MB、動画が100 MB。今回のバージョンではGitHub Enterprise Serverはサポートされない。GitHubは、コーディングエージェントもこの機能を継承し、結果を説明するのではなく見せられるようになったと明記している。

🔗 2026年8月のShip Log · 🔗 GitHub CLIのメディア対応


Fairwind Program、信頼できる防御担当者限定のGoogleサイバー防御

9月2日 — Gemini 3.8 Flash Cyberと同じ日に、Googleはこのモデルの提供経路となるFairwind Programを開始した。セキュリティおよびプライバシー担当バイスプレジデントのFour Flynnが示した論理は、防御チームが直面する具体的なジレンマから始まる。大規模で高コスト、かつ企業のコードベースでは扱いにくいフロンティアモデルを採用するか、複雑な脆弱性の修正が苦手な、より小規模なオープンウェイトモデルで妥協するかという問題だ。

その答えは、Gemini 3.8 Flash CyberとGoogleの自動修正ハーネスCodeMenderを組み合わせることだ。中心となる主張は検出ではなく修復にある。弱点の発見は認識と恐怖を生むが、自動的に発見して修正すれば安全性が得られる。顧客組織の安全なcloud環境内で、数週間ではなく数分で検証済みかつ展開可能な修正を生成するとしている。

アクセスは意図的に段階化され、3つの優先対象が設けられている。政府および国家サイバー当局、医療、通信、エネルギー、金融ネットワークの重要インフラ事業者、そして中核的なテクノロジープラットフォームだ。参加組織は、アクセスを社内のサイバーセキュリティ、インシデント対応、侵入テストの各チームに限定し、多要素認証などの保護策を導入するという厳格な制約に同意する。Googleによれば、世界で650以上のパートナーが参加している。プログラム外でも、すべてのGoogle Cloud顧客は、AI Threat Defenseを補完する形で、Gemini Enterprise Agent Platform上の一般公開モデルとCodeMenderを利用できる。また同社は、Google.orgを通じたサイバーセキュリティへの累計資金提供額が1億ドルを超えたとしている。そのうち3,600万ドルは35のサイバークリニックに提供され、米国の1,250以上の病院、学区、自治体サービスを支援した。

🔗 Fairwind Program


Googleのコマンドラインツール:2日間で3つのバージョン

9月1日・2日 — Googleは2日間で同じ領域を対象とする3つのバージョンを公開した。その全体像からは、機能を減らし、隔離と安定性を重視するという明確な優先方針が見て取れる。

公開バージョン日付主な内容
Gemini CLI v0.58.09月1日セキュリティ中心の7件の変更、安定版チャンネルへ昇格
Antigravity CLI 1.1.239月1日2件の改善、11件の修正
Antigravity 2.12.09月2日7件の改善、9件の修正

Gemini CLIの安定版チャンネルはv0.58.0へ移行したが、preview版v0.59.0の公開から32分後だったため、この昇格はほとんど注目されなかった。内容はほぼ全面的に防御を目的としている。最も重要な修正はmacOSのサンドボックスに関するものだ。SeatbeltプロファイルがDockerおよびコンテナランタイムのソケットとバイナリを隔離するようになり、典型的な脱出経路が閉じられた。隔離されたプロセスがホストのDockerソケットへ到達できれば、実際にはそこから脱出できてしまうためだ。ほかにも中核部分を強化する変更が2つある。無視対象パスの管理におけるシンボリックリンクの評価が一貫したものになり、最上位の安全性検証機構が書き込みポリシー設定内で明示的に宣言されるようになった。

Antigravity 2.12.0には、2つの新機能が追加された。回答の引用機能では、回答の一部を強調表示し、次のpromptへcontextとして再投入できる。長時間に及ぶエージェントセッションで日常的に生じる問題への直接的な回答だ。また、有料ユーザー限定の/boostコマンドは、multi-agent reasoning pipelineによって思考の労力を強化する。この機能はGemini 3.8 Flashと同じ日に登場した。Googleは同モデルについて、より多くのtokensを消費する代わりに、より多くの処理を行うと明言している。両者の動きは、ユーザーが労力の水準を明示的に制御できるようにするという同じ方向を向いている。残りの変更は実際に不便だった点を改善するものだ。一般設定では、どのプロジェクトが設定を上書きしているかが示されるようになり、分割画面のterminalレイアウトはウィンドウの再読み込み後も維持され、音声入力中でもメッセージを送信できるようになった。

最後に、Antigravity CLI 1.1.23では、各ステップではなくサブ軌跡ごとに1回だけ軌跡メタデータを送信することでsubagentsのstreamingを軽量化し、/model内でゴーストテキストとして提示されるモデル名をTabで確定できるようになった。11件の修正からは、日常的に煩わしかった不具合が明らかになる。prompt hooksによるクラッシュ、Geminiモデル向けに履歴を再構築する際のtool call IDの欠落、読解可能なアクション説明ではなく一般的なタイトルを表示する権限確認promptなどだ。説明されていないアクションの許可を求めることになるため、これは深刻な問題である。また、enable_mcp_tools=trueで宣言されたsubagentsがMCP dispatcherの欠如によって失敗する問題も修正された。

🔗 Gemini CLI v0.58.0リリースノート · 🔗 Antigravity変更履歴


Gemini NotebookのShort Video Overviewsが70以上の言語に対応

9月1日 — Gemini NotebookはShort Video Overviewsを70以上の言語へ拡大し、新たに3種類の英語バリエーションを追加した。この機能はnotebookのソースを約60秒の縦型動画へ変換するもので、ユーザーの言語で生成できるようになった。

展開対象はwebとmobileで、引き続きUltraおよびProの契約者に限定される。同チームは同じスレッドで、Proユーザーへの提供はまだ完了していないと説明している。発表には、さらに2つの詳細が添えられた。notebook内のソース数はtokens消費量の計算に含まれず、Proユーザーは引き続き英語でCinematic Video Overviewsを生成できる。英語のみの対応から70言語への移行により、この機能はデモの域を脱し、英語圏以外でも実際に利用できるツールとなった。

🔗 Gemini Notebookの発表


エディターがモデルのマルチプレクサーへ

9月1日・2日 — 一見無関係な2つの発表が、同じ動きを描き出している。開発環境がサードパーティーモデルへのアクセスポイントとなり、差別化の軸がモデルの品質から、モデルを稼働させる条件へ移りつつある。

Zedは安定版1.18.0を公開した。最も重要な内容は、リリースノートのAIセクションにある。エディターは複数の最新リリースへ一挙に対応した。Amazon Bedrock上でGPT-5.6の100万tokensのcontext windowがサポートされ、Google AIモデルにGemini 3.5 Flash-Liteが、xAIモデルにGrok 4.5とGrok 4.6が加わり、前日に公開されたClaude Fable 5.1への対応も改善された。この4項目のうち2つは、リリースノートで外部からの貢献としてクレジットされている。さらに、エージェントを利用する作業に特有の使い勝手も改善された。切断された外部エージェント接続を再起動せずに再読み込みできるようになり、長時間のセッションにおけるメモリ消費量が減少し、接続エラーには到達できないホスト名が表示されるようになった。MCP serversを接続するユーザーにとって注目すべき修正もある。非標準のscopesを要求するserverではOAuth認証が失敗していた。

一方、Mistralはcoding agentであるVibe Codeで、ProおよびTeamプラン向けにGLM 5.2を開放した。注目すべき点はモデルそのものではなく、その提供方法にある。Mistralは自社のインフラを使用し、欧州でホストしている。そのため、Vibe CodeからGLM 5.2を利用する欧州の開発者は、リクエストをZ.aiのserversへ経由させず、Mistralが実行する推論を利用することになる。これは同社が8月から掲げてきた地域別推論という位置付けを具体化したものだ。さらに、Mistralは独自のDevstralファミリーを保有していながら、競合ラボが開発したopen-weightsモデルを自社ツールで提供することを選んでおり、二重の意味で示唆的である。

🔗 Zed 1.18.0リリースノート · 🔗 Vibe CodeのGLM 5.2


NVIDIA:2本のエンジニアリング記事と管轄を移すアライアンス

9月2日 — NVIDIAは同じ日に3つの記事を公開した。2つは技術関連、1つはガバナンス関連である。

モデルのco-designシリーズ第3回となる最初の記事では、speculative decodingを調整するための5つのルールを示している。この手法自体はよく知られている。小型のdraftモデルが複数のtokensを提案し、targetモデルがそれらを1回の並列passで検証する。実務上の問題として残るのは、tokensをいくつ先読みし、どの仕組みを使うかという点だ。検証中、計算量は(1 + D)に比例して増える一方、メモリアクセス量は変わらない。そのため、検証処理がmemory-boundからcompute-boundへ移行する地点までdraft長Dを増やす必要がある。代表的なexpert GEMMでは、D = 7とすることで、D = 0の場合に必要なbatch sizeの8分の1でこの領域へ到達できる。attentionがdecoding時間を支配する場合、最適な長さはD = 128/G − 1となる。ここでGは1つのKV headを共有するquery headsの数である。それを超える場合は、G × (1 + D)がattention kernelのtile sizeである128の倍数となる値を選ぶ方がよい。測定には、NVIDIAのspeculative decoding向けbenchmarkであるSPEED-Benchが使われた。Qwen 3.5 122B A10Bをtargetとした場合、外部draftモデルの35B A3Bは、D = 9でacceptance length 6を達成した。記事では、見落とされがちな点が強調されている。acceptanceが高くても、より大きな高速化につながるとは限らない。そして最後に注意が示されている。targetをfine-tuningすると出力分布が変化するため、特定のcheckpoint向けに学習されたdrafterは、target自体が改善していてもacceptanceが低下する可能性がある。

2本目の記事は、単一の例を中心に構成された6段階のCUDA最適化手順である。3枚のRGB画像をグレースケールへ変換し、32 × 32 pixelsの各tileについて中央値を計算する。出発点は意図的に不具合を含めたコードで、Compute Sanitizerが即座に問題を診断する。block indexを使うべき箇所でglobal indexを使用したことによる、shared memoryへの範囲外書き込みである。

最適化段階合計時間各段階の高速化率
初期コード6,8 s
CUB(DeviceTransformとBlockRadixSort)635 ms約10x
pooled memory containers約244 ms約2,6x
pinned memory25 ms約10x
画像ごとに1つのCUDA stream23 ms累計約300x

自作のbubble sortをcub::BlockRadixSortへ置き換えただけで、中央値の計算時間は2,142 sから773 µsへ短縮され、2717倍の高速化となった。これらの段階はいずれも低レベル最適化ではなく、APIの置き換えである。

最後に、NVIDIAが設立に貢献したOpen Secure AI AllianceがLinux Foundationへ加わる。このアライアンスが提示する主張は、従来の議論の焦点を移すものだ。エージェントは単なるlanguage modelではなく、models、contextを与えるharnesses、実行可能な範囲を制限するguardrailsから構成されるsoftware systemである。しかし、安全性に関する議論は主にmodel単体へ集中してきた一方で、セキュリティはシステム全体、すなわちharnesses、alignment mechanisms、execution environments、identity、policy、observability、recoveryに依存する。OpenSSFとの協力により、AI関連のincidentsおよびnear missesを機密扱いで収集する仕組みSAFE(Shared AI Findings Exchange)について、意見募集が開始されている。

🔗 Speculative decoding · 🔗 段階的なCUDA最適化 · 🔗 Open Secure AI Alliance


Equinix Inference Exchange、280のデータセンターでopen modelsを提供

9月2日 — Equinixは、NVIDIAとの協業を拡大し、Together AIを新たに加えた分散型AI推論プログラム、Equinix Inference Exchangeを発表した。この構成は3つの層からなる。EquinixはEquinix Fabricを通じてcloudsへ接続された物理基盤を提供し、NVIDIAは検証済みのenterprise reference architecturesを提供する。そしてTogether AIはその上でplatformを稼働させ、共有型deploymentまたは専用single-tenant environmentにおいて、200以上のopen source modelsへ対応する。

訴求点はモデルの選択ではなく、推論を実行する場所にある。対象とするuse casesは3つだ。latencyを低減するための都市圏edgeでの推論、closed proprietary modelsからopen alternativesへのworkloadsの移行、規制対象企業向けのsovereign AIである。その規模は、77の都市圏にまたがる280以上のdata centers、230のcloud on-ramps、相互接続された10,500社以上という数字から分かる。

ただし、スケジュールについては注意が必要だ。Equinixのプレスリリースには、このソリューションが2027年第1四半期から利用可能になると明記されている一方、Together AIのメッセージでは、同社のplatformがすでにEquinixの世界各地のdata centersで稼働していると説明されている。これは提携とroadmapの発表であり、サービス開始ではない。

🔗 Equinixのプレスリリース


BenchMIRT、benchmarksが実際に何を測定しているかを監査するAi2の手法

9月1日 — Ai2はBenchMIRTを公開した。この手法は、正面から扱われることの少ない問いを提示する。benchmarkは、本当に測定すると称する能力を測れているのか。最終scoreを基準に考えるのではなく、各設問の水準まで掘り下げ、心理測定学に由来する多次元版の項目反応理論(Item Response Theory)に基づいて、どの能力が実際に正答を左右するかを推定する。学習には、100のopen-weights models、16のbenchmarks、34,000問以上の結果が使用された。

最も確かな成果は方法論上のものだ。どのbenchmarkが何を測定する想定なのかを一切指定しなかったにもかかわらず、BenchMIRTは主要な2つの次元である安全性と一般推論を自ら抽出した。分析をゼロからやり直しても、同じ結果が得られた。

監査対象benchmark推論との相関安全性との相関監査結果
MMLU-Pro0,97-0,21公表された目的に合致
BBQ0,85-0,06安全性テストとされているが、推論能力に追従
WMDP-0,890,21危険な知識がないことを測定
ToxiGen0,40-0,32両方との関連が弱く、benchmarkは92 %で飽和

モデルが社会的ステレオタイプに依存するかどうかを検証するために設計されたBBQは、一般推論と0,85の相関がある一方、安全性とはまったく相関していない。そのため、低いscoreはモデルの振る舞いよりも推論能力を示している可能性がある。2つ目の成果は実用面にある。設問を識別力順に並べることで、Ai2は全体の10 %だけを残してもモデルの順位がほぼ維持されることを示した。また、この手法は未観測の設問への回答を79 %の確率で正しく予測し、単純な手法の70 %を上回った。明示されている限界は2つある。学習に使われたmodelsはすべて2025年3月以前のものであり、発見される次元は入力するbenchmarksの組み合わせに依存する。

🔗 BenchMIRT


Runway Dev MCP、coding agentがメディア統合を主導

9月2日 — RunwayはRunway Dev MCPを公開した。これは同社のdeveloper platformを、日常的に使用するcoding toolであるClaude、ChatGPT、Codex、Cursorへ直接接続するhosted MCP serverだ。主張は一文に集約される。統合を作成したエージェントが、その統合に適したモデルを選び、依存するtoolsを設定し、debugできるようになった。

このサービスは統合における3つの段階を網羅する。最初のAPI callを行う前に、エージェントはcatalogへ問い合わせ、プロジェクトで使用できるmodels、その価格、対応するinputsを確認する。続いて、選択したモデルの正確なrequest schemaを取得する。推測するのではなく、最初の試行から正しくcallすることが目的だ。本番環境では、cost、latency、qualityに応じて複数のmodelsから選択し、generationごとのcost limitを設定できるModel Routerを作成・設定する。また、特定のcallについてrouterがどのモデルを選んだかを確認できる。同じ仕組みはCharactersにも適用される。3つ目の段階はdebuggingだ。generationが失敗すると、エージェントは定義済みtoolでtaskを参照し、失敗の正確な理由を確認する。modérationによる拒否、assetのsize limit、不正なrequest bodyなどを把握したうえで修正し、再実行できる。QuickstartメニューではAPI keyを作成し、あらかじめ作成されたメッセージとともにClaude Code、Codex、Cursorを開く。

🔗 Runway Dev MCP


DreamX-Creator 1.0、1枚の画像からネイティブ2K音声・動画を生成

9月2日 — AlibabaのAMAPチームは、Apache 2.0ライセンスの70億パラメータモデルDreamX-Creator 1.0を発表した。1枚の画像とテキストプロンプトから、動画モデルと音声モデルをカスケード接続することなく、ネイティブ2Kの同期された動画ストリームと音声ストリームを生成する。

システムは3つの要素で構成される。段階的な共同学習と組み合わせ、2つのストリーム間の双方向インタラクションを可能にするゲート付きクロスモーダル注意機構(Gated Cross-Modal Attention)、モダリティを考慮したマルチモーダルフィードバックによる音声・動画強化学習、そして動きと音声の時間的同期を維持しながら動画を2K化する1段階の自己回帰的改良である。

現段階での公開内容は限定的だ。前日に初期化されたGitHubリポジトリには、プロジェクトの紹介とロードマップが収録され、技術レポートはarXivで公開されている。検証済みの重み、推論コード、設定、評価ツールは、依然として未達成のマイルストーンとして記載されている。この研究はWan2.2とOpenMOSSのMOVAを基盤としており、両者への謝辞が明記されている。

🔗 DreamX-Creator 1.0の発表


OpenAI API、急激なスケールアップとモデルの過負荷を区別

9月2日 — OpenAIは、これまでクライアントアプリケーションが区別できなかった2つの状況について、APIでの通知方法を変更した。

HTTPステータスエラーコード意味対処方法
429slow_downリクエスト量が急増しすぎたRetry-Afterに従って流量を減らし、その後徐々に増やす
503server_is_overloadedリクエストされたモデルが一時的に過負荷になっているRetry-Afterに従って再試行し、エラーが続く場合は待機時間を延ばす

この区別は、あらゆる再試行コードに直ちに実務的な影響を与える。ドキュメントによると、トラフィックが組織の1分あたりのリクエスト数とトークン数の制限内に収まっていても、slow_downエラーが発生する場合がある。これはクォータの枯渇を示すものではなく、増加が急激すぎると判断されたことを意味する。つまり、表示されている制限を一つも超えていなくても、アプリケーションが抑制される可能性がある。レート制限ガイドでは経験則として、トラフィックが毎分100万入力トークンに達した後は、15分ごとの増加率を50%以下に抑えることを推奨している。Retry-Afterヘッダーがない場合、OpenAIは、同じサービスの全インスタンスが同時に再試行するのを防ぐため、わずかなランダム遅延を加えた指数バックオフを推奨している。従量制トラフィックがこれらの制限に頻繁に達する組織にはScale Tierが、GPT-5.6以降のモデルについてはReserved Tierが案内されている。

🔗 OpenAI APIの変更履歴


短報

  • Claude Code 2.1.258 — 修正のみのリリース。2.1.255以降動作しなくなっていたmacOS 12 Montereyでの起動が復旧し、権限の再承認後にリモートセッションとスケジュール済みセッションが失敗する問題も解消された。🔗 変更履歴
  • Claude Campus Ambassadors — 今年は学部、大学院、博士課程・博士研究員という3つの異なる区分で応募を受け付けている。🔗 発表
  • Nokia、Cursorで5,000万行のコードを分析 — Core Networks部門のエンジニア2人が2週間で実施した。チームは当初、約12人の専門家を数か月間投入する必要があると見積もっていた。独立した測定手順を伴わない、ベンダーによる事例研究である。🔗 事例研究
  • TranslatePsy-Nano — Tether AI Researchは、コンパクトな翻訳モデルの2系列を公開した。9つのヨーロッパ言語向けのEuroNanoと、8つのアフリカ言語向けのAfriNanoで、各言語グループにつき単一のチェックポイントを使用し、42、31、17MBのバリエーションを用意している。🔗 発表
  • Puffin-World — 物理、幾何、外観という3つのネイティブ状態で世界を表現する統合マルチモーダルモデル。Puffin-16Mデータセットとともに公開された。🔗 紹介
  • NVMe上に常駐するMoEエキスパート — i64 Systemsは、SHA-256マニフェストによる検証を行いながらエキスパートの重みをNVMe上に保持し、リース経路と常駐経路の出力がバイト単位で一致することを測定した。🔗 技術記事
  • CiNet International ConferenceにSakana AIが登壇 — 最高技術責任者のLlion Jonesと研究者のKai Arulkumaranが、2026年10月5日から7日まで大阪で、神経科学と機械学習をつなぐ架け橋について講演する。🔗 発表
  • Gemini CLI、9月2日のnightly版 — 変更は1件のみで、ウェブ取得ユーティリティにおける宛先検証と接続ルーティングが改善された。8月末に始まったネットワーク強化の流れを引き継ぐものだ。🔗 リリースノート
  • MrBeast、Googleと複数年提携 — この契約により、Beast Industriesとの関係はYouTubeの枠を超え、GeminiとGoogle Healthへ拡大する。最初の動画は9月5日に公開され、Geminiを使ってジャングル、砂漠、北極圏で生き延びる内容となる。🔗 発表
  • Googleによる8月のAI発表まとめ — 月内にすでに取り上げられた内容を集約した月次記事で、独自の新情報はない。🔗 まとめ
  • Enterprise Live Migrationsが一般提供開始 — GitHub Enterprise Serverのリポジトリを、データ所在地を維持しながら、ほぼ無停止でクラウドへ移行できる。gh elm拡張機能で操作する。AIとは無関係だが、網羅性のために掲載する。🔗 変更履歴
  • ElevenLabs、Ashley Kramerを最高収益責任者に任命 — この期間に同社が公開した唯一の情報で、製品変更履歴は8月24日以降更新されていない。🔗 発表
  • NVIDIA、PerplexityのPortable ComputerでDGX Sparkのライブ配信を実施 — ローカル実行に26分を割いたが、説明文も文字起こしもない。この日、DGX Sparkをローカル移植先として扱った2件目のデモである。🔗 配信
  • Kling AI、MCPサーバーのElementsを解説 — ショット間でキャラクターの同一性を維持する方法についてのチュートリアル。製品解説であり、新規リリースではない。🔗 チュートリアル
  • Codex CLI 0.152.1 — 0.152.0から約20時間後に公開された修正版。Guardianの承認レビューが、モデルのメタデータを介して渡されるNode REPLのポリシーに準拠するようになった。🔗 リリースノート
  • Cohere、企業向け小型モデルへの賭けを擁護 — 同社は、Command R7B、33億5,000万パラメータのTiny Aya、Artificial AnalysisのCoding Indexで33.4を記録したNorth Mini Codeを取り上げ、適切な規模設定の重要性を訴えている。新規リリースはない。🔗 記事
  • Perplexity、2つの解説ガイドを公開 — パーソナルアシスタントとハルシネーション検出に関するガイド。後者では2段階の事後学習を説明しており、第1段階で製品としての振る舞いを育成し、第2段階でより難しい調査タスクを利用する。🔗 ガイド

これが意味すること

フロンティアモデルを含め、価格が主要な訴求点になった。 同じ日に3つのリリースがあったが、最高記録のスコアを前面に出したものは一つもない。GoogleはGemini 3.8 Flashで前世代の料金を据え置く一方、モデルがより多くのトークンを消費することを認めた。これは珍しい告白であり、論点を表示価格からタスクの実質コストへ移すものだ。Qwenは単純な首位ではなく、Arenaのパレートフロンティアの頂点にあることを明確に主張している。Metaは改善をベンチマークのポイント数ではなく、ツール呼び出しを20%、トークンを25%削減したと数値化した。そしてCursorBenchの表は、この日最も分かりやすい尺度を示している。Gemini 3.8 Flashは69.2%で、タスク当たりのコストが2.38ドルなのに対し、同等のスコアにはFable 5.1で4.80ドル、Opus 5で7.35ドルを要した。ただし、ステップ数の列は、その価格の代償が別の場所にあることを思い出させる。44ステップに対して161ステップだ。

ハーネスエンジニアリングが、測定可能な経済的レバーになりつつある。 GitHubの記事は、これらのモデルを基盤に開発する人にとって、この日最も有用な文書だ。モデル自体には手を加えず、それぞれ2~5%ずつ改善する4つの最適化を、失敗した実験も含めて記録している。Anthropicのエージェントエンジニアリングガイドも、別の角度から同じことを述べている。設計段階から90~99%のキャッシュ成功率を目標とし、呼び出し単位ではなく完了したタスク単位でコストを考えるべきだという。両者は、モデル競争に隠れがちな一点で一致している。同じモデルでもハーネスがコストの大きな部分を左右し、その改善効果は製品間でそのまま移植できない。GitHubは、コードレビューでは効果的だった最適化がCLIではコストを増加させた事例によって、これを実証している。

推論はワークステーションへ移り、計算を行う場所が設計パラメータになりつつある。 FastH3はMacやデスクトップマシンで動画生成を可能にし、Perplexityは1種類のハードウェアで1つのモデルだけを動かすエンジンのコードを公開した。Tetherは17MBの翻訳モデルを公開し、i64 SystemsはMoEのエキスパートをNVMe上に常駐させ、Cohereは適切な規模設定を提唱している。この動きは、レイテンシと主権を理由に280か所のデータセンターへ推論を分散するEquinix、NVIDIA、Together AIの上位レイヤーからの動きとも合流する。共通するのは小型化ではなく特化だ。Lilyが優位性を得ているのは、Apple Silicon上のQwen3.6-35B-A3B以外をすべて排除しているからであり、Perplexityは、この狭さを制約ではなく利点だと見込んでいる。

制御とガバナンスが厳格化し、今や技術だけでなく契約もその手段になっている。 GitHubはFable 5.1にデータ保持を義務付け、その免除措置は暦年末に失効する一方、企業内の各チームがデフォルトモデルを選択できるようにし、同じ日に6つのモデルをカタログから削除した。Cursorはエージェントの実行を顧客のネットワーク内へ移す一方、文字起こしは引き続き同社側で処理されると明記している。Googleは、書面による運用条件の下で、サイバー防御モデルを選定された650のパートナーに限定して提供している。Mistralは中国製モデルをヨーロッパから提供し、それ自体を売りにしている。最後にBenchMIRTは、こうした意思決定の一部を支える評価ツール自体にも監査が必要であることを示している。一般的推論と0.85の相関があり、安全性とは-0.06の相関しかない社会的バイアスのベンチマークは、そのラベルが示すものを測定していない。


情報源