検索

Google Cloudが業務向けGeminiエージェントを発表、HeyGen VoiceとClaude Managed Agentsの動的ワークフロー

ai-powered-markdown-translator

gpt-6.1-solを使用してフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

Google Cloudは10月8日、Gemini at Work 2026でGeminiエージェントを発表した。企業のあらゆる業務を1体で担うエージェントで、クラウド上で常時稼働し、GeminiモデルとClaudeモデルの両方を統括する。一方、HeyGenは初の自社開発音声モデルHeyGen Voiceを公開し、Artificial AnalysisのControlled Voiceランキングで首位に立った。AnthropicはClaude Managed Agentsで、1回の実行につき最大1 000体のエージェントを起動できるワークフローを公開した。コーディング分野では、Codexがユーザーの次のメッセージを予測する機能を獲得し、WindowsではMicrosoft Execution Containersを基盤とする新しいサンドボックスを採用した。


Google CloudがGeminiエージェントを発表、あらゆる業務を1体で担当

10月8日 — Google CloudはGemini at Work 2026でGeminiエージェントを発表し、業務向けの単一かつ汎用的なエージェントと説明した。1つの入力欄と1つのAPIから、質問への回答、知的作業、画像やメディアの作成、コードの記述と実行を行う。Google Cloudの最高経営責任者トーマス・クリアンが掲げる考え方は、一連の指示ではなく、目標をエージェントに任せるというものだ。

エージェントは単一の記憶を持ち、クラウド上で常時稼働する。ウェブ、iOS、Android、Windows、Mac、コマンドライン、Google Workspace、Microsoft 365、Slackに加え、外部アプリケーション内でインターフェースなし(headless)でも利用できる。数時間から数日かかるタスクも、パソコンを閉じた後に継続する。長時間の作業では、それぞれ独自のIDを持つ一時的なサブエージェントを作成する。また、独自の@agents.company.comアドレスとストレージを持ち、恒常的な役割を担う同僚エージェント(coworker agent)にもなれる。モデルの選択は別の選択肢となる。Googleによれば、エージェントはすでにGeminiモデルとAnthropicのClaudeモデルを統括しており、今後はほかの非公開モデルやオープンモデルにも対応する予定だ。金融向けと法務向けの業種別版もプレビューで登場する。金融向けには50以上の基本スキルがあり、すでにCME GroupとDeutsche Bankが利用している。

発表された制御要素Googleが説明する役割
各エージェントのID暗号学的に証明されたID、役割別の権限、エージェント自身の名義で記録される監査ログ
Agent Sandbox独自のネットワーク境界を備えた隔離実行
Agent Gatewayエージェントの全通信が通過するAI向けネットワークファイアウォール
リアルタイムの支出上限Cloud Billingでプロジェクトのエージェントを一時停止し、ワンクリックで再開

Google Cloudは利用実績も示した。約500社の顧客がそれぞれ年間1兆トークン以上を処理し、Fortune 100の約90 %がGemini Enterpriseを利用している。一方、記事にはエージェント自体の提供開始日や料金は記載されていない。Google Cloudが挙げているのは、モデルの動的な選択を試したスポーツブランドOnなど、先行試用した大手顧客のみだ。

🔗 Gemini at Work 2026(Google Cloudブログ)

Gemini EnterpriseでAntigravityの各ツールからClaude Opus 5.5とClaude Sonnet 5.5を利用可能に

10月8日 — 同日、Gemini Enterpriseのリリースノートで、管理者がAntigravity 2.0、Antigravity CLI、IDE向けAntigravity拡張機能でClaude Opus 5.5とClaude Sonnet 5.5を有効にできるようになった。管理者はGoogle Cloudコンソール内で直接利用規約に同意でき、別途Anthropicアカウントを用意する必要はない。

有効化の設定項目Googleが示した値
既定の状態外部モデルは無効、管理者が有効化
課金方式従量課金、プロジェクトの支出上限に含まれる
推論のロケーションglobal、us、eu
思考レベルLow、Medium(既定)、High、Max

開発者はGemini Enterpriseのライセンスを維持したまま、モデル選択欄でClaudeを選べる。外部モデルを利用する前に超過使用(超過分の従量課金)を有効にする必要があり、その費用は全モデル共通の支出上限に含まれる。同じページでは、シンガポールでGemini 3.8 Flashの一般提供を開始したことも発表されている。

🔗 Gemini Enterpriseのリリースノート


音声:HeyGen VoiceがControlled Voiceランキング首位に、Mistralがアラビア語向けモデルを2つ公開

10月9日 — HeyGenがHeyGen Voiceを公開した。ジョシュア・シューは、これまでアバターで知られていた同社が初めて自社開発した音声モデルだと説明している。モデルはHeyGen内とAPI経由で利用でき、料金は100万文字あたり30ドル。10月31日まではAPI利用者に割引が自動適用され、15ドルとなる。

その根拠となる評価は、HeyGenの発表より1分半早く結果を公開したArtificial Analysisによるものだ。全モデルが同じ8種類のクローン音声を使い、米国英語と英国英語で話すControlled Voiceランキングで、HeyGen Voiceは1 468回の登場に対してElo 1 201を獲得し、首位に立った。アシスタント部門、顧客サービス部門、英国英語でも1位となっている。

HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo

🇯🇵 HeyGen VoiceがArtificial AnalysisのControlled Voice TTS Arenaランキングで、AlibabaのQwen-Audio-3.1-TTS-PlusとElevenLabsのEleven v4 Turboを上回り、首位に立った。 — Xの@ArtificialAnlys

評価対象モデルControlled VoiceのElo(10月9日)100万文字あたりのAPI料金
HeyGen Voice1 20130ドル(10月31日まで15ドル)
Qwen-Audio-3.1-TTS-Plus1 18219,3ドル
Eleven v4 Turbo1 16640ドル
Eleven v41 16280ドル

この首位という評価には明確な範囲があり、音声クローニングが対象となっている。各提供元が独自の音声を使うProvider Voiceランキングでは、10月9日夜の時点でもEleven v4 TurboとEleven v4が首位を維持し、HeyGen Voiceは上位8モデルに入っていなかった。発音の安定性ではHeyGen Voiceは83,1 %を記録し、29モデル中10位となった。

APIでは音声クローニングが即座に行われる。録音を1つ用意するだけで、最初の3分間のみが使われ、学習なしで数秒後には音声が利用可能になる。音声合成は一括生成(44,1 kHzのWAVファイル)にもストリーミングにも対応し、Artificial Analysisが評価したのはAPIの既定設定だった。

🔗 HeyGenの発表

Voxtral Mini 4B Realtime ArabicとLIDstral Arabic:Mistralのアラビア語向けモデル2種

10月8日 — Mistralは発表を伴わずに、アラビア語に特化したApache 2.0ライセンスのオープンモデル2種をHugging Faceで公開した。Voxtral Mini 4B Realtime Arabicは、アラビア語の各方言と現代標準アラビア語をストリーミングで文字起こしし、話者が会話の途中で言語を切り替える場合(code-switching)にも対応する。Voxtral Mini 4B Realtimeを基に調整されており、パラメータ数は約44億。モデルの説明によれば、2026年1月に締結されたMistralとモロッコの提携の一環として、モロッコのデジタル移行・行政改革省と共同開発された。この提携からは、ISMAとDarija in the Wildという2つの新しいベンチマークも生まれている。

公開モデルモデルの機能モデルの説明に記載された結果
Voxtral Mini 4B Realtime Arabicアラビア語のストリーミング文字起こし480 msで7つのベンチマークにおける平均文字誤り率が8,82 %、Voxtral Transcribe Arabicは7,91 %
LIDstral Arabicプロセッサ上で言語と方言を識別、51クラスモロッコのダリジャでF1が88,67 %、GlotLID v3は71,28 %

🔗 Hugging FaceのVoxtral Mini 4B Realtime Arabic · Hugging FaceのLIDstral Arabic


Claude Managed Agents:1回の実行で最大1 000体のエージェントを使う動的ワークフロー

10月9日 — AnthropicはClaude Managed Agentsの動的ワークフロー(dynamic workflows)を公開ベータで提供開始した。これは新しいマルチエージェントの統括方式だ。セッションを主導するエージェントが自らプログラムを書き、サーバーがそれをバックグラウンドで実行して、多数のエージェントを段階ごとに起動し、最後に結果を組み合わせる。multiagent_20261001の種類を有効にすると、実行を開始するかどうかはエージェント自身が判断する。

1回の実行では最大1 000体のエージェントを起動でき、そのうち64体が同時に稼働する。実行の有効期間は既定で24時間で、1つのセッションで10件の実行を開いたままにできる。トークンはセッションと同じように課金され、その予算に算入される。Anthropicはトークン数が多くなる可能性があると注意を促し、116 000行のコードベースに70件のバグを埋め込んだ社内テストを紹介している。

Anthropicのテスト構成3回の試行で発見したバグ数
エージェント単体14、15、27
動的ワークフロー各試行で66

🔗 @ClaudeDevsの発表 · ワークフロー実行のドキュメント


コーディングエージェント:Codexのメッセージ予測とMXCサンドボックス、Claude Code 2.1.296、Vibe CLI 2.26.1

Codexに同日2つの新機能が加わる一方、AnthropicとMistralはコマンドラインエージェントの新バージョンを公開した。

Codexがユーザーの次のメッセージを予測、Pro加入者向けベータ

10月9日 — OpenAIはCodexのデスクトップアプリで、入力欄の予測機能(composer predictions)をベータ公開した。Codexが回答を終えると、現在のスレッドを基に作られた次のメッセージ候補が入力欄に表示されることがある。記憶や接続済みアプリから情報を取得することはない。Tabキーで候補を挿入でき、文章は編集可能で、自動送信されることもない。候補は単語ごとの補完ではなく、メッセージ全体を対象とする。

ベータの条件OpenAIが示した内容
プランと年齢個人向けChatGPT Pro、18歳以上
スレッドとモデルGPT-6 AstraまたはGPT-6.1 Solを使うローカルおよびSSHスレッド
既定の設定有効、General > Composer > Show predictionsで無効化可能
ベータ期間中の費用Codexの利用上限には算入されず、クレジットも消費しない

送信したメッセージは、採用した予測候補も含め、通常どおり利用量に計上される。この機能はChatにはない。

🔗 @OpenAIDevsの発表 · OpenAIのヘルプ記事

Windows版Codex:Microsoft Execution Containersを基盤とするサンドボックス

10月9日 — OpenAIはWindows版Codexに、Microsoft Execution Containers(MXC)を基盤とするサンドボックスモードを追加した。Microsoftは10月7日にMXCの一般提供を開始している。対応するWindows 11デバイス(24H2 build 26100.9278または25H2 build 26200.9278)が必要で、より迅速なセットアップ、より厳格なネットワーク制御、より細かなファイルアクセス設定を実現するとしている。

ドキュメントによれば、MXCが推奨実装となる。プロセスを標準機能で隔離し、管理者の承認を受けた設定、追加のWindowsアカウント、ローカルのファイアウォールルールを必要としない。elevatedとunelevatedの各モードは、従来方式の代替手段となる。デスクトップアプリは個人向けアカウントでは自動的にMXCを選択する。CLIや企業環境ではconfig.tomlのprefer_mxc = trueで有効化でき、管理者はallow_mxc = falseでブロックできる。ドキュメントには2つの制限が記載されている。管理対象のネットワークにはallow_local_binding = trueが必要で、フォアグラウンドのコマンドが終了すると、残っている子プロセスも停止する。

🔗 @OpenAIDevsの発表 · Windowsサンドボックスのドキュメント

Claude Code 2.1.296:サブエージェント独自のコンテキスト圧縮とワークフローエージェントのモデル統一

10月9日 — Claude Code 2.1.296には79件の項目があり、そのうち56件が修正で、ツイートによる告知はなかった。主にサブエージェントの制御を強化している。

このバージョンの新機能変更内容
autoCompactWindow(サブエージェント、--agents)サブエージェントがメインの会話より早くコンテキストを圧縮する
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODELワークフロー内の全エージェントで同じモデルを使用し、ほかのサブエージェントは各自のモデルを維持
Readのallow_largeオプションコンテキストが許す場合、大きなテキストファイルを1回の呼び出しで読み込む
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MSエラー529後の再試行間隔の上限を延長
MCPツールの説明を最初から送信既定の上限を2 048文字から4 096文字に拡大

/costとステータス行は、Sonnet 5.5のキャッシュ読み取りを100万トークンあたり0,10ドルとして計上するようになった。セキュリティ面では、管理対象のPreToolUseフックが呼び出しを拒否してもターンを終了しない問題、BASH_ARGV0を使う一部のコマンドをBashのチェックが自動承認する問題、Claude in Chromeの操作に対してクラウドセッションが自動モードのチェックを省略する問題を修正した。また、非UTF-8ファイルの非ASCII文字をすべて置き換えてしまうEditおよびNotebookEditによる変更も、拒否するようになった。

🔗 GitHubのClaude Code 2.1.296

Vibe CLI 2.26.1:ローカルのDevstralモデルを削除、非対話モードを拡充

10月9日 — 2.26.0から3日後、MistralはXへの投稿を伴わずにVibe CLI 2.26.1を公開した。パッチバージョンながら、85項目の更新(追加23件、変更24件、修正36件、削除2件)があり、そのうち37件はRustによる新しいインターフェースに関するものだ。同梱されていたローカルのDevstralモデルは削除された。このモデルを固定指定した設定が残っている場合は、警告を表示したうえで、既定のホスト型モデルに切り替わる。この既定モデルの推論レベルはoffとhighの2段階のみとなり、コンテキストウィンドウは256kと指定され、自動圧縮もこの値に合わせて動作する。

非対話モード vibe -p には、実行時間の上限、ファイルまたは標準入力からのプロンプト読み込み、終了のたびに書き出される export.json レポート、そして状況別の終了コードが追加された。終了コードは、使用方法や設定の誤りが1、インフラ障害が2、上限への到達またはモデルによる拒否が3となる。Rust CLIには、/proxy-setup、各ターンの要約を音声で読み上げるナレーター、/plugins、/whoamiが追加された。エージェントによるバックグラウンドプロセスやサブエージェントの利用を禁止する設定も新設され、Document Libraryコネクターは引き続き既定で無効になっている。

🔗 Vibe CLI 2.26.1のリリースノート


画像・動画・ゲームの生成:Qwen-Image-2.1-Turbo、MidjourneyのThinkingモード、SynthesiaのSyren、GoogleのPlayground

より高速で安価な画像モデル、自らの生成結果を見直す画像生成ツール、動画を編集するエージェント、コードを書かずにゲームを作れるプラットフォーム。

Qwen-Image-2.1-Turbo:ノイズ除去8ステップ、画像1枚あたり0,016ドル

10月9日 — Qwenは、Qwen-Image-2.1を高速化したチェックポイント(高速化チェックポイント)であるQwen-Image-2.1-Turboを公開した。同じ70億パラメーターのアーキテクチャで、8ステップのノイズ除去により画像を生成・編集する。Qwenによると、引き続き2K画像を生成でき、自然言語による編集にも対応するが、このバージョン固有の品質や速度を示す数値は公開されていない。モデルの重みはHugging FaceとModelScopeで、Qwenの研究用ライセンス(Qwen Research License)の下で公開されている。チェックポイントには8ステップのサンプリングスケジュールが組み込まれており、既定のCFGは1で動作する。

同日、QwenはQwen-Image-2.1 ProとTurboのAPIも正式に公開した。QwenCloudでは、Turboに毎分120リクエストの枠が与えられる。

APIで提供されるモデル(Model Studio)画像1枚あたりの料金無料の画像数
qwen-image-2.1-turbo0,016ドル10
qwen-image-2.1-pro0,04ドル10
qwen-image-2.0-pro0,075ドル100

🔗 Qwenの発表 · Hugging Faceのモデル紹介

MidjourneyがThinkingモードを試験導入、アルファ版サイトで共有フォルダーを公開

10月8日 — 夜に公開されたMidjourneyのアルファ版の変更履歴では、初期段階にある2つの機能が紹介された。現時点では、どちらもalpha.midjourney.com限定となる。1つ目は試験機能で、V8.2で生成または編集した画像に対し、Rerun (Thinking)ボタンを押すと、モデルが結果を確認し、プロンプトからのずれ(物体、レイアウト、人体構造、文字)を見つけて再生成する。Midjourneyは、プロンプトへの忠実度、文字の表現、一貫性が改善したとしており、汎用的なモードにすることを検討している。

2つ目はフォルダーの共有機能だ。フォルダー内で直接画像を生成できる共同編集者や、閲覧者を招待できるほか、リンクで共有したり、Midjourneyの全メンバーにフォルダーを公開したりできる。Midjourneyは、共有しても画像の公開範囲は変わらず、ステルスモードを使っていなければ、画像は引き続きExploreやプロフィールに表示される可能性があると説明している。

🔗 Midjourneyのアルファ版の変更履歴 · Thinkingモードの試験導入(Midjourney)

Syren:Synthesiaが動画制作をエージェントに委ねるベータ版を公開

10月9日 — Synthesiaは、無料アカウントを含む全顧客向けにSyrenのベータ版を公開した。作りたい動画を説明するか、文書、画像、動画、PowerPointのプレゼンテーション、YouTubeのリンクを渡すと、Syrenが動きのあるグラフィック(モーショングラフィックス)、アバター、ナレーション、音楽、補足映像(補足カット)を含む完成動画を生成する。その後は会話を通じて修正できる。Synthesiaの最高技術責任者ピーター・ヒルによると、エージェントは動画全体をコードとして記述し、6月からSynthesiaのアニメーションに使われている独自のレンダリングエンジンが、それをリアルタイムで再生する。

動画は最長3分で、横長と縦長の形式に対応し、ブラウザー内でレンダリングされる。料金はクレジット制だが、詳細な価格は示されておらず、Enterpriseの管理者はツールを無効にできる。記事では、既存の動画からブランドの特徴を自動学習する機能も近日提供予定とされている。Syrenは、エージェントが動画を制作する別の2つのツール、HeyGenのHyperFrames Studioから4日後、AnthropicのClaude Motionからは翌日の登場となる。

🔗 Syrenの紹介(Synthesia)

Playground:Googleがコードを書かずにゲームを作れるプラットフォームを公開

10月7日 — Googleは、数個のプロンプトで説明するだけで、コードを書かずにゲームを作り、遊び、共有できる実験的なゲームプラットフォーム、Playgroundを公開した。会話形式のインターフェースで、白紙の状態、改変できるサンプル、または案内付きの制作から始め、物理挙動、ルール、キャラクター、背景を指示に応じて調整できる。

ゲームはスマートフォンでもパソコンでもブラウザー内で動作し、非公開のままにする、リンクで共有する、Exploreギャラリーに掲載するといった選択ができる。一部のジャンルではランキングやマルチプレイヤーにも対応し、公開されるゲームはすべて安全性の審査を受ける。Playgroundは米国の18歳以上を対象に公開されており、ゲームを作成できる範囲はGoogle AIの契約プランによって異なる。より本格的な3Dゲーム向けのUnity Sparkとの連携も、近日中にクローズドベータ版として提供予定だ。Googleは、プラットフォームを動かすモデルを明らかにしていない。

🔗 Playgroundの紹介(Googleのブログ)


医療:AMIEの臨床研究がThe Lancetに掲載

10月8日 — Googleとベス・イスラエル・ディーコネス医療センター(BIDMC)は、Googleの診断用対話型AIであるAMIE(Articulate Medical Intelligence Explorer)の前向き実行可能性研究をThe Lancetに発表した。Googleによると、AMIEの研究がThe Lancet本誌に掲載されるのは初めてとなる。患者は急ぎの診察を受ける最大5日前からAMIEと対話し、その後、医師に対話の記録と要約が渡された。

研究の評価項目公表された結果
登録患者数(2025年4月〜11月)、その後の追跡対象者数114、その後98
安全上の理由による中止0
確認されたハルシネーション1
医師が診察の準備にAMIEが役立ったと評価した症例44例中33例(75 %)
最終診断と一致した診断(Google)90 %

単一施設で実施され、対照群がなく、Alphabetが資金を提供した研究であり、承認や実運用を意味するものではない。著者らは、より大規模な試験を求めている。

🔗 Googleの記事 · The Lancetの論文


OpenAIの研究:雇用関係を終了した研究者3人の書簡への回答

10月9日 — OpenAIは、研究部門の責任者らの名義で@OpenAINewsroomに掲載した声明で、前週に雇用関係を終了したとする研究者3人の書簡に回答した。OpenAIによると、内部調査の結果、3人は機密情報の取り扱いに関する明確な規則に違反しており、書簡で述べられている範囲を超えた信頼関係の破綻があったと判断した。OpenAIは決定を維持する。これらの決定は安全性への懸念を示したことや発言したこととは関係がなく、懸念を表明したことを理由に従業員を解雇することはないと主張している。

声明では、次のことも発表している。

We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.

🇯🇵 当社は現在、第三者の安全性評価機関との契約締結に向けて積極的に最終調整を進めており、今後数週間以内に詳細を発表します。 — Xの@OpenAINewsroom

OpenAIは、書簡の1点については同意するとしている。最先端モデルの監視可能性(監視できる性質)を維持するには、OpenAIを含む業界全体の取り組みが必要だという点だ。本記事はOpenAI側の説明を伝えるものであり、研究者らの書簡は確認していない。


オープンモデルの開発:ML Internで約103ドルの6モデル、Ai2のGPUスケジューラー

モデル開発に関する2つの実践報告。1つはエージェント、もう1つは計算クラスターについて。

ML Intern:約103ドルの計算費用で6つのオープンモデル

10月8日 — 本記事ではすでに10月1日と8日に別の観点から紹介したHuggingChatのML Internモードについて、Hugging Faceのブログで初めて数値を伴う成果報告が公開された。6つのプロジェクトを最初から最後まで実施し、計算費用は合計約103ドルだった。各プロジェクトは1つのメッセージから始まり、評価を経て、Hubでモデルを公開するところまで進む。エージェントは計画を立て、費用の発生する計算処理の前には必ず許可を求め、短いテストを実行してから、Hugging Faceのハードウェア上で学習、評価、公開を行う。

ML Internが作成したモデル公表された結果計算費用
Pocket Rewriter (0.8B)有効な出力が99,7 %、トークン数はQwen-Image 2.1の9B書き換えモデルの約4分の1約16ドル
Citrus Doctor (Qwen3.5-2B)柑橘類の病気の診断正解率が14,9 %から52,8 %に向上約1,90ドル
Qwen-Image 2.1用の2つのLoRA視点の角度を変更、落書きを指定された物体に置換約16ドルと24,30ドル
Huggy LoRA (FLUX.2 klein)キャラクター用LoRA約7,60ドル
Agate 4ステップ小型画像モデルを蒸留し、50ステップ(ガイダンスを含めると100回の処理)から4ステップに短縮約37ドル

🔗 Hugging Faceの記事

Ai2のGPUスケジューラー:待ち時間の中央値が5分から24秒に短縮

10月9日 — Ai2は、ジェレミー・トライバ執筆の記事で、GPUクラスターの新しいスケジューラーを詳しく紹介した。88〜1 024基のGPUで構成されるクラスター群にある数千基のNVIDIA H100、B200、B300を約150人の研究者が共有しており、需要は供給の2〜3倍に達する。従来の優先度方式では、処理を行わないタスクがGPUを「占拠」し、すべてのワークロードが最終的に最高優先度になっていた。

新しい仕組みは、研究組織の階層に沿って配分するGPU利用時間の予算、直近7日間を対象に計算する階層的な公平配分(公平なリソース配分)、そして「スケジューリング契約」に基づく。各ワークロードは、最大8時間の中断を受けない時間を申告し、その時間が過ぎると、実行を中断されて待ち行列に戻される可能性がある。未割り当ての時間は引き続き無料だが、いつでも実行を中断される可能性がある。

Ai2が測定した指標従来のスケジューラー新しいスケジューラー
最大のH100クラスターにおける待ち時間の中央値5分24秒
デバッグ用ワークロードの待ち時間のp902時間30秒
30日間で提供された割り当てGPU時間の割合—98 %

人手による対応が必要な修復は74 %減少した。Ai2は、以前なら1週間続けられた対話型セッションが8時間後には中断の対象になるといった制約を認めており、コードは公開していない。

🔗 Ai2の記事


意思決定モデル:pplx-decider-v1.1-27bがDecision Benchで首位、ほかの9モデルと統計的に同率

10月9日 — すでに10月6日と8日に取り上げたPerplexityの意思決定モデルが、外部評価の結果を得た。Atlan Frontier Labsのオープンソースのベンチマーク、Decision Bench(選択式の質問1 071問、データセット36件、順位付けされたモデル15件)で、pplx-decider-v1.1-27bは単純なスコアでは最高の94,5 %を記録し、費用も1 000件の意思決定あたり0,017ドルと最も低かった。ただし、このサイトでは95 %信頼区間が重なるモデルを同順位としているため、10モデルが首位を分け合っている。

Decision Benchで評価されたモデル測定された正解率1 000行あたりの費用
pplx-decider-v1.1-27b94,5 %0,017ドル
DeepSeek V4.1 Flash94,2 %0,683ドル
Gemini 3.5 Flash94,2 %3,32ドル
Jev 1.1393,8 %0,044ドル

Perplexityは、クリック操作を常にモデルではなくコードが決定するブラウザー操作エージェントの実践ガイド(実装例集)も公開しており、APIではv1.1がv1に置き換わる。

🔗 @perplexitydevsのスレッド · Decision Benchのランキング


Grok Botに専用のメールアドレス

10月9日 — SpaceXAIのエージェント、Grok Botが専用のメールアドレスを持つようになった。ボットはこのアドレスを使ってサービスに登録したり、利用者に代わって企業に連絡したり、誰かとの予定を調整したりできる。機能は同日から提供され、ボットにアドレスを求めるか、Xで@botにメンションすれば利用できる。チームで使う場合は、先に管理者が有効にする必要がある。

発表は@botアカウントのスレッドのみで行われ、@grokが共有しており、x.aiには記事がない。アドレスの形式やドメイン、対象プランは明らかにされていない。9月末にTeam Bots専用のSlack識別子が導入されたのに続き、エージェントは外部で活動するための独自の身元を得た。

🔗 Grok Botの発表


ElevenLabsがシンガポールに進出、東南アジアの拠点に

10月8日 — ElevenLabsはシンガポールへの進出を正式に発表した。東南アジア、さらにはアジア太平洋地域の拠点となるオフィスを開設する。記事では、すでに整っているインフラを強調している。7月から企業はシンガポールにデータを保存でき、データを保持しない選択肢や、地域内での遅延の低減も提供されている。

ElevenLabsは主に地域の顧客を紹介している。5つの市場で対話型AIによる見込み客の選別を行うFunding Societies、マレーシアのBoost Bank、フィリピンのSalmon Group、インドネシアのMNC Group、シンガポールの公立病院の60 %が利用する医療プラットフォームRezonateなどだ。従業員数は示されていない。今回の進出は、9月末と10月初めのブリュッセル、アムステルダムへの拠点開設に続くものとなる。

🔗 ElevenLabsの記事


短報

  • Claude Code の Projects — Anthropic は、ウェイトリストに登録した Pro と Max の全加入者にアクセスを開放した。Projects は引き続きベータ版で、ウェイトリストへの登録は今後も受け付け、対応可能な規模に応じて追加のアクセスを開放する。ドキュメントによると、Team と Enterprise ではまだ提供されていない。🔗 出典
  • エージェント自動化ガイド — claude.dev のガイドでは、Claude Managed Agents を使い、スケジュールに従って Slack チャンネルと GitHub のプルリクエストを読み取り、Slack に要約を投稿する参照実装を紹介している。読み取れない情報源を動きのない日と取り違えないことや、支出上限を通常の実行コストの3〜5倍に設定することなど、よくある障害への対策とともに、6つの構成要素を詳しく説明している。🔗 出典
  • Block と Claude Fable — Anthropic が公開したインタビューで、Block は Claude Fable が大規模なコード移行を設計し、最大数十の Opus や Sonnet モデルを指揮して、1回の移行で最大1,000件のプルリクエストをマージすると説明した。マージと本番環境への反映は引き続き人間のみが行い、デプロイには二重承認を求める。🔗 出典
  • Claude Enterprise の Compliance API — 会話エンドポイント(endpoints)は、既存のキーを使って、統合された Claude 体験の会話もベータ版として返すようになった。クラウドセッションで継続した会話も1つの会話として返され、Claude の作業は tool_use と tool_result のブロックに含まれる。🔗 出典
  • Codex CLI 0.162.1 — 0.162.0 の修正版で、複数行の非同期質問による TUI のクラッシュと、すでに起動していたバックグラウンドサーバーの機能設定が CLI と異なる場合の起動失敗を解消する。🔗 出典
  • ChatGPT Enterprise と Edu のロール別プラグイン設定 — ロールベースのアクセス制御(RBAC)が有効な場合、オーナーと管理者はロールごとにプラグインへのアクセスを設定できる。ワークスペースの設定は Available、Install、Disabled から選び、カスタムロールで Default を選ぶと、その設定を継承する。🔗 出典
  • Sophos と OpenAI Daybreak — サイバーセキュリティ企業 Sophos によると、Daybreak で構築したエージェントは、担当する案件の平均対応時間を約38分から約89秒に短縮し、MDR 案件の52 %を AI が最初から最後まで解決している。破壊的な操作は引き続き人間が監督する。🔗 出典
  • Asana と StackAI のブラウザー操作エージェント — Asana によると、Codex の GPT-6 Astra が約1週間でこのエージェントを最適化した。GPT-6.1 Sol ではテスト1回の実行コストが0.47ドル、所要時間が約4分となり、元の本番構成に比べてコストは76分の1、速度は5倍になった。🔗 出典
  • LegalOn と Codex — LegalOn Technologies は、GPT-5.5 の高速モードを無制限に使う運用から、GPT-6 Luna、GPT-6.1 Sol、GPT-6 Astra にタスクを振り分け、高速モードを必要に応じて使い、部門別・個人別の上限を設ける運用に切り替えたことで、Codex の1日当たりの推定コストを約65 %削減したとしている。🔗 出典
  • Gemini CLI v0.64.0-preview.1 — このプレビュー版では、無害なシェルコマンドに対する Untrusted Command Flags Detected 警告の誤検出を抑制する。読み取り専用オプションを対象から除外し、シェル変数を保持し、各サブコマンドに ALLOW ルールがある場合はループを許可する。10月9日にナイトリー版の公開はなく、安定版は引き続き v0.63.0。🔗 出典
  • Antigravity 2.22.0 — プラグインがサイドパネルに独自のインターフェースを表示できるようになった(UI Extensions)。サイドバー内のセクション間で会話をドラッグ&ドロップして整理でき、タイムスタンプには月名が表示される。🔗 出典
  • Gemini 3.7 Flash が非推奨に — Gemini API では、gemini-3.7-flash への呼び出しが gemini-3.8-flash にリダイレクトされる。旧エージェント deep-research-pro-preview-12-2025 は10月23日に停止され、deep-research-preview-04-2026 または deep-research-max-preview-04-2026 への移行が必要になる。🔗 出典
  • Google Flow Music の VST3・AU プラグイン — 10月6日分の補足。自然言語で作成する楽器やエフェクトである Spaces を、デジタルオーディオワークステーション(Digital Audio Workstations)向けのプラグインとして書き出せる。プロデューサーのクリス・リディック=タインズによる No Chaser プラグインなどがその例。🔗 出典
  • Google Earth AI と公衆衛生 — 10月6日分の補足。コンゴ民主共和国(RDC)でのエボラ出血熱流行時、地理空間推論エージェントの試作版により、世界保健機関(OMS)のアフリカ地域事務局は、危険にさらされた48の地域と45,500人超を数分で特定できた。PDFM モデルは、コレラのリスクがある地域も最大8週間前に特定する。🔗 出典
  • Copilot code review の課金 — 組織のオーナーは、AI Credits の有料利用が有効な場合、ライセンスを持つ所属メンバーが依頼したレビューで、そのメンバーの割り当てを消費する代わりに、リポジトリを所有する組織へ費用を請求できる。また、レビューの開始を、組織または企業が提供したライセンスの利用者に限定できる。🔗 出典
  • Copilot CLI 1.0.95 — 安定版となったこのバージョンは、macOS で Microsoft Entra のネイティブブローカーを使って認証し、必要に応じてブラウザーにフォールバックする。プレビュー版 1.0.96-0 では、各権限について、ユーザー、Assisted Permissions、ポリシー、無人実行時のフォールバックのいずれが判断したかをタイムラインに表示する。🔗 出典
  • GitHub MCP Server 2.0 — 10月6日分の補足。GitHub の公式 MCP サーバーは、Code Mode または Programmatic Tool Calling を使うエージェント向けに、出力スキーマ(output schemas)で記述された型付きの出力を返す。これらが通知されるのは、MCP 仕様 2026-07-28 以降に対応したクライアントのみ。🔗 出典
  • Genspark に Claude Haiku 5.5 — Genspark は AI Chat、Code Agent、Claw でこのモデルを提供し、Haiku 4.5 より実行コストが約75 %低いという Anthropic の説明を引用している。専用のプランや料金は示していない。🔗 出典
  • v0 向け Meta VR テンプレート — Meta は Vercel と共同で、Immersive Web SDK を基盤とする v0 テンプレートを公開した。体験を説明すると v0 がコードを書いてプレビューし、ワンクリックで Vercel にデプロイして Quest のブラウザーで開ける。2027年春に登場予定の Meta VR Glasses の視線と手の操作にも、すでに対応している。🔗 出典
  • v0 for teams — v0 は、チームメンバーの作業を見たり、会話に加わったり、共同で開発したりする方法を動画で紹介した。投稿では9月以降に段階的に追加された機能を取り上げており、新たな料金は示していない。🔗 出典
  • DeepSeek Harness 0.2.1-alpha.2 — 26回目のプレビュー版で、安定版はまだない。プラグインカタログは要求に応じて Claude Code と Codex のパッケージをインストールする。2つの実験的プラグイン(Git Worktrees、推論の翻訳)が追加され、グローバル指示は共有の AGENTS.md から読み込める。🔗 出典
  • OGX 1.5.0 — 4月に改名し、meta-llama 組織から独立した旧 Llama Stack が、DeepSeek と Fireworks AI 向けに /v1/messages API のネイティブな中継を追加した。Text-Embeddings-Inference プロバイダー、Exa と Serply のウェブ検索、MCP 2.x クライアントも追加され、互換性を損なう変更が4つある。🔗 出典
  • GenIA — Meta は、Tübingen AI Center と共同で進めたこの研究のコードを、非商用ライセンス CC BY-NC 4.0 で告知なく公開した。凍結された SAM 3D Objects の事前分布を推論時に整合させることで、再学習せずに、1枚の画像、少数の視点からの画像、または動画から3Dオブジェクトを再構築する。🔗 出典
  • Hub の decision-model ラベル — Hugging Face は意思決定モデルに専用のラベルを設け、Models ページにアイコンとフィルターを追加した。意思決定用の GGUF には、llama.cpp のメタデータに基づいて自動的にラベルが付く。🔗 出典
  • Darwin-27B-ZTC-v2 — VIDRAFT は、Apache-2.0 ライセンスの判定モデルの新バージョンが、System One Mosaic Benchmark(137のベンチマーク)で Borda スコア89.58を記録し、OpenJev-27B(87.50)と Jev 1.13(85.05)を上回って首位に立ったと発表した。これは開発者らが発表した順位で、公開ランキングのある時点の状況を示すものとして紹介されている。🔗 出典
  • 意思決定モデルの信頼度 — スティーブン・ソルカはコミュニティー記事で、OpenRouter 経由で問い合わせた GPT-6 Luna Decisions が、SHA-256 の照合600件すべてに「一致しない」と答え、正解率が50 %、平均信頼度が99.8 %だったことを示した。因果推論では、信頼度99 %の閾値で抽出した49件のうち47件が正答だったが、対象は全体の8.2 %にとどまる。🔗 出典
  • 強化学習環境としての openai-math — FineEnvs は、openai/math で公開された Lean で形式化済みの405件の成果のうち369件を Harbor 環境に移植した。エージェントは Lean 4 のサンドボックスで定理を証明する必要があり、Comparator は指定された命題そのものの完全な証明にのみ報酬を与える。Apache-2.0 ライセンスの実験的データセット。🔗 出典
  • JOSIE-2 — ギョクデニズ・ギュルメズは、選別した約3,000件の事例を使い、2台の Mac M4 で Qwen3.5 から事後学習した 2B、4B、9B のモデル群の技術報告書を公開した。推論モードでは JOSIE-2-4B が ARC-Challenge で95.5(+12.1)、TruthfulQA で69.2(+20.3)を記録したが、評価はこの2つのベンチマークのみ。🔗 出典
  • Gradio 6.30 — gr.Workflow にアプリケーションビューが追加され、Run this node コマンドはサブグラフ全体を再実行する代わりに、まだ有効な上流の結果を再利用する。gr.ImageEditor は読み込んだ画像のアルファチャンネルを保持する。🔗 出典
  • tokenizers 0.23.3 — Python パッケージのみの修正版で、huggingface_hub v2 を受け付けるようになり、リリースノートによると Transformers をインストールできるようになる。また、切り詰め処理に関する 0.23.1 の互換性を損なう変更を取り消す。🔗 出典
  • AI による科学論文の査読 — Sakana AI は TMLR に採択された論文を紹介した。ベンチマークでは、論文に矛盾する主張を挿入し、AI 査読者が発見できるかを検証する。Sakana AI の発表によると、同社の Multi-Layered Review は、評価対象となった他のシステムより多く検出したが、具体的な数値は示されていない。🔗 出典
  • Suno Studio — クリップが第1拍により正確に合い、プロジェクトのテンポに合わせて伸縮するようになった。フェードは指数曲線または対数曲線を選べるようになり、シンセサイザー、キーボード、プラグインの各ビューを切り離して、2台目の画面にも配置できる。Studio は Premier サブスクリプションに含まれる。🔗 出典
  • World Models’ Last Exam in Physics — Einsia による動画モデル向けの物理試験(40タスク、9カテゴリー、8モデル)で、Seedance 2.5 が100点中57.76で首位となった。続いて、MiniMax が最良のオープンモデルとする MiniMax H3(54.89)、NVIDIA の Cosmos 3 Super(42.46)が並ぶ。第三者によるベンチマーク。🔗 出典
  • エージェントが構築する Omniverse シミュレーション — NVIDIA のブログでは、同社のチームが GPT-6 Astra に、ある事例では Claude Fable 5 に、ovphysx、ovstage、ovrtx、ovui ライブラリーを使ったシミュレーションを構築させる取り組みを紹介している。約3日で作成・改善されたデジタルツインなどが含まれ、新製品の発表はない。🔗 出典
  • Shopify ストアの管理 — ストアを接続すると、Grok Bot が注文を確認し、在庫を追跡し、商品情報を最新の状態に保てる。プランや利用上限は示されていない。🔗 出典
  • X での検索 — 10月7日分の補足。Grok Bot は全ユーザー向けに、X コネクターを設定せずに X を検索、閲覧、監視できる。商品の反応を追跡したり、業界の週次要約を受け取ったりする用途が挙げられる。8月末時点では、まだアカウントの接続が必要だった。🔗 出典
  • Grokipedia v0.3 — 公式アカウントによると、Grok が執筆するこの百科事典は、読者から依頼された記事を1週間で4,400件超公開し、1日当たり2,200件超の変更を行っている。新規記事1件当たりの出典数は平均78件。現在は変更をリアルタイムで配信するページもある。🔗 出典
  • mistral CLI 0.8.0 — mistral apps deploy はワークフローのワーカーと全モジュールの一括デプロイにも対応し、API キー1つで継続的インテグレーションからも実行できる。mistral apps dev は Docker でローカルの Postgres データベースを起動する。その一方で、現在のディレクトリーにある .env は読み込まれなくなった。🔗 出典
  • Mistral Python SDK 3.2.0 — チャットとエージェントの呼び出しで、応答とプロンプトの両方について対数確率(logprobs)を指定できるようになった。top_k、反復ペナルティー、最小トークン数にも対応する。自動生成されたバージョンで、告知はない。🔗 出典
  • Qwen Code v0.25.1-preview.1 — 3日間で2回目となる v0.25.1 のプレビュー版で、新たに16の機能と27の修正が加わった。セッションを中心とした複数エージェントの協働や、完全な再検証を伴ってツール入力を変更する PreToolUse フックなどが含まれる。安定版はまだ公開されていない。🔗 出典
  • Perplexity の Agent API に Claude Haiku 5.5 — 10月7日分の補足。Agent API は anthropic/claude-haiku-5-5 に Anthropic と同じ料金で対応する。入力が100,000トークンまでの場合、100万トークン当たり入力0.10ドル、出力0.50ドルで、それを超える場合はそれぞれ0.50ドルと2.50ドル。🔗 出典
  • 共有推論か専用推論か — Embed と Rerank 向けの Cohere のガイドは、リクエスト数よりもリクエストの形態が重要だとし、NVIDIA A10 GPU 1基の専用インスタンスに対する損益分岐点の例を算出している。長文の文書では毎分約4リクエスト、カタログでは20、再ランキング(reranking)では29となる。🔗 出典
  • エージェントか MCP か — Perplexity は、判断を行うエージェントと、エージェントをツールにつなぐ MCP の違いを説明するガイドを公開した。選択肢を比較する表、オンラインストアの例、4つのリスクとその対策を掲載している。ガイドによると、Claude、ChatGPT、Cursor は Perplexity の MCP サーバーを通じて Computer にタスクを委任できる。🔗 出典

それが意味すること

今や1つのエージェントが多数のほかのエージェントを統括し、それぞれに固有の識別情報が与えられる。Geminiエージェントは、それぞれ独自の識別情報を持つサブエージェントを起動し、自身のアドレスを持つ同僚エージェントにもなれる。Claude Managed Agentsでは、最大1,000のエージェントを起動するプログラムをエージェント自身に書かせる。Grok Botには外部で活動するためのメールアドレスが与えられ、Blockは同じ移行作業に取り組む数十のモデルの指揮をClaude Fableに任せている。浮上している問いは、もはやエージェントに何ができるかではなく、どう管理するかだ。GoogleはAgent Gateway、Agent Sandbox、各エージェント名義の監査ログ、リアルタイムの支出上限で応え、Anthropicは上限に達するとすべての実行を一時停止するセッション予算で応え、OpenAIはネットワークとファイルへの制限をより厳しくしたWindowsサンドボックスで応えている。

複数モデルの活用は、プラットフォーム自体にも定着しつつある。Geminiを開発するGoogleは、自社のエージェントにClaudeモデルを統括させ、モデルの選択とエージェントの選択を明確に分けている。また、AntigravityでClaude Opus 5.5とSonnet 5.5を利用可能にし、自社モデルと同じ支出上限の枠内で課金している。GensparkとPerplexityのAgent APIは、Claude Haiku 5.5の公開から数日以内に対応を追加し、LegalOnは作業の性質に応じてコード作業をOpenAIの3つのモデルに振り分け、Blockはモデルを自動で選択する仕組みを構築している。

単位当たりのコストは下がり続け、各発表で具体的な数字が示されている。Qwen-Image-2.1-Turboは画像1枚当たり0.016ドルで、Pro版の2.5分の1。HeyGen Voiceは10月31日まで100万文字当たり15ドル、その後は30ドルで、Eleven v4 Turboを下回る。pplx-decider-v1.1-27bは1,000回の意思決定当たり0.017ドル。ML Internでは約103ドルの計算費用で6つのモデルがHubに公開された。一方、首位という結果は慎重に読み解く必要がある。HeyGen Voiceが1位なのは音声条件を統制したランキングだけであり、pplx-deciderは信頼区間が重なるほかの9モデルと同順位にある。

医療分野では、引き続き慎重さが求められる。The Lancetに掲載されたAMIEの研究は、単一施設で実施され、対照群がなく、Alphabetが資金を提供した実現可能性研究であり、患者98人を対象に、安全上の理由で中断された会話はなく、ハルシネーションが1件確認された。これは、著者ら自身が求めている、より大規模な試験に向けた一歩であり、承認や患者向けの実運用を意味するものではない。


出典