検索

Mistral Large 4がプレビュー公開、ClaudeがGoogle Docs、Sheets、Slidesに登場、Anthropicがサイバープログラムを拡大

ai-powered-markdown-translator

gpt-6.1-solでフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

Mistralが、1兆パラメータのマルチモーダルモデルMistral Large 4をプレビュー公開した。APIは本日から誰でも利用でき、重みは10月末に公開すると約束している。AnthropicはClaudeをGoogle Docs、Sheets、Slidesに組み込み、サイバー検証プログラムを3段階のアクセスに再編する。一方、Google DeepMindは、スマートフォン上で動作するオープンなマルチモーダル埋め込みモデルEmbeddingGemma 2を公開した。意思決定モデルにも動きがあった。OpenAIがDecisions APIをパブリックベータとして公開し、Perplexityが価格を半分に引き下げ、コミュニティのランキングが各モデルの優劣を示している。


Mistral Large 4:1兆パラメータのプレビュー、重みの公開は10月末と約束

10月6日 — Mistral AIがMistral Large 4の公開プレビューを開始した。通称はML4で、「極めて正式に」Chonkとも呼ばれる。同社史上最大のモデルであり、ネイティブにマルチモーダルな混合エキスパート (Mixture-of-Experts) アーキテクチャを採用する。パラメータ数は1兆 (1T) で、発表記事によると、そのうち490億が有効になる。100万トークンのコンテキストで、指示への対応、推論、エージェント機能を統合している。ドキュメントの仕様表には異なる数値が記載されているが、その差の説明はない。総パラメータ数は1兆500億、有効パラメータ数は520億で、さらに16億パラメータの視覚エンコーダーを備えるとしている。

APIは本日からMistral Studioで誰でも利用できるが、重みはまだ公開されていない。Mistralは、アーキテクチャと事後学習の詳細とともに、10月末までに公開すると約束している。それまでの間、サイバーセキュリティ責任者、審査済みのパートナー、政府当局が、モデレーションを緩和した状態でアクセスし、実際の運用環境でモデルを検証している。ML4は、Mistralの欧州データセンターに設置された3 800基のNVIDIA Grace Blackwell GPUでゼロから学習された。これらのデータセンターはプレビューの提供にも使われている。同社は、欧州法に基づき、全工程を自社で運用する欧州での展開を計画しており、このモデルを、30億ユーロのシリーズD資金調達で支えるロードマップの最初の節目と位置づけている。

主な訴求点はサイバーセキュリティだ。Mistralによると、ML4はArtificial Analysis Cyber Indexの上位5モデルに入り、そのテストの一つで82 %を記録した。このテストは、オープンソースソフトウェアの実際の脆弱性を再現してから修正するもので、全モデル中の最高スコアだという。同社は、Claude Opus 5.5とGPT-6 Astraについて、同じテストではタスクを拒否するため、スコアがほぼゼロになると主張している。

評価したベンチマークMistralが発表したスコアMistralが示した比較
DeepSWE v1.161,7 %—
Coding Agent Index(統合)49,8 %DeepSeek V4 Pro 0813とQwen3.8 Maxを上回る
Surge AIによる人間のブラインド評価(コード、5点満点)3,74、5モデル中2位Claude Opus 5 (4,22) に次ぐ
Cybench(40課題)93 %—
AA Cyber Index、脆弱性の再現と修正82 %全モデル中の最高スコア
AutomationBench(657の業務プロセス)59,9 %Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Proを上回る

発表記事と仕様表は価格についても食い違っている。記事のカードには、百万トークンあたり入力1,36ドル、出力4,18ドルと表示されている。一方、仕様表ではこれらの価格に取り消し線を付け、その横に半額を表示しているが、適用期間や説明はない。

ML4の特性発表記事による数値ドキュメントの仕様表による数値
総パラメータ数1 000(十億単位)1 050(十億単位)
有効パラメータ数49(十億単位)52(十億単位)
入力、百万トークンあたり1,36 ドル0,68 ドル(1,36に取り消し線)
出力、百万トークンあたり4,18 ドル2,09 ドル(4,18に取り消し線)

これらのスコアはすべてMistralが報告したものだ。同社は、プレビュー版の強化学習が、性能向上の頭打ちを示す兆候なく続いており、今後数週間で急速な進歩を見込んでいると述べている。

🔗 MistralによるMistral Large 4の発表記事 🔗 ドキュメント内のMistral Large 4仕様表


Claude for Google Workspace:ClaudeがDocs、Sheets、Slidesに登場

10月6日 — AnthropicがClaude for Google Workspaceを公開した。Google Docs、Sheets、SlidesのサイドパネルでClaudeを利用できるアドオン (add-on) で、すべての有料プラン向けにパブリックベータとして提供される。Claudeは開いているファイルを読み取り、現在の選択範囲(テキスト、セル、スライド)を認識し、その場でファイルを編集する。

GoogleアプリケーションClaudeができること
Docsその場での修正と文体の変更、大幅な書き換えでは適用または無視を選べる提案カード
Sheets数式、ピボットテーブル、ネイティブのグラフ、新しいタブ、結合やデータ整形のために範囲をPythonで処理
Slidesプレゼンテーションのレイアウトとテーマに沿ったスライド作成、重なりやはみ出しがある要素の確認

ユーザーは自律性の程度を選べる。デフォルトで有効な「編集前に確認」 (Ask before edits) モードでは、各変更に承認カードが表示される。「すべての編集を承認」 (Accept all edits) モードでは、Claudeが停止せずに作業を進める。Claudeアカウントに接続すると、サイドパネルで同じモデル、コネクター、スキル (skills) を利用できる。Enterpriseプランでは、Compliance API、顧客管理の暗号鍵 (CMEK)、OpenTelemetryによる監査データのエクスポートも、このアドオンに適用される。

Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.

🇯🇵 ClaudeがGoogle Docs、Sheets、Slidesで使えるようになり、これらのファイルもClaude内で開けます。Google Workspaceでは、Claudeがファイルの横にあるサイドパネルに表示され、開いている内容を読み取り、その場で編集します。各変更を適用する前に承認できます。 — @claudeaiのX投稿

逆方向の連携も同時に登場する。新しいGoogle Docs、Sheets、Slidesコネクターもベータ版で提供され、リンクを貼り付けるか、新しい文書の作成を依頼することで、ClaudeからGoogleのファイルを作成・編集できる。対応する構成では、会話の横にあるパネルでファイルが開き、ClaudeのアクセスはGoogleの共有権限に従う。アドオンはGoogle Workspace Marketplaceからインストールできる(拡張機能 > Claude > Claudeを開く)。管理者はGoogle Adminコンソールから展開することもできる。TeamとEnterpriseでは、まずオーナーがコネクターを有効にする必要がある。これによりGoogle WorkspaceはMicrosoft 365に続く形となる。Microsoft 365では、Excel、PowerPoint、Word向けClaudeが5月7日から一般提供されている。

🔗 AnthropicによるClaude for Google Workspaceの発表記事


Cyber Verification Program:AnthropicがOpus 5.5、Sonnet 5.5、Mythos 5.1を3段階のアクセスで提供

10月6日 — Anthropicがサイバー検証プログラム (Cyber Verification Program、CVP) を再編する。このプログラムでは、審査済みのセキュリティ専門家に、一般向けモデルではブロックされる機能を提供する。過去6か月間は二つの仕組みが並行して存在していた。特に重要性の高いソフトウェアを担う組織にClaude Mythosへのアクセスを提供するProject Glasswingと、OpusおよびSonnetのガードレールを緩和する単一レベルのCVPだ。これらが3段階に統合され、すべてのレベルでClaude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1、および今後のモデルにアクセスできる。一方、一般提供されるモデル(Opus 5.5、Fable 5.1、Sonnet 5.5)は、サイバー関連作業の大半をブロックする慎重なガードレールを維持する。

アクセスレベル対象となる用途対象者と所要期間
Defense Accessセキュリティ運用センター、インシデント対応、マルウェアのリバースエンジニアリング、脆弱性分析セキュリティチーム、あらゆる規模の重要インフラ、オープンソースの保守担当者、研究者;数日
Red Team Access防御用途に加え、許可された侵入テストと攻撃シミュレーション演習 (red teaming)組織のみ。テストする権限のあるシステムが対象;数週間
Specialized Access安全に関わるシステムのテスト:航空、電力網、通信、銀行間送金、行政ネットワーク米国政府とともに個別審査する少数の組織;Glasswingの参加組織は移行

Red Team Accessでも、ランサムウェアの展開など、物理的な被害や大規模な障害を引き起こしうる行為は、引き続きリアルタイムでブロックされる。設定を検証するため、Anthropicは各レベルのガードレールを適用したOpus 5.5に、複数段階のサイバー作業を評価するCyScenarioBenchを実施した(10課題、それぞれ5回試行)。

Anthropicがテストした構成(Opus 5.5)CyScenarioBenchの結果(50回の試行)
CVP未適用すべてのタスクが最初のプロンプトでブロック
Defense Access46回の試行がいずれかの時点でブロック、4回成功
Red Team Accessブロックなし、34課題に成功。ガードレールなしのモデルの成功率67,6 %と同等

記事ではGlasswingの最初の総括も示している。Anthropicによると、数字は部分的なものだが、4月から7月にパートナーが少なくとも129 000件の検証済み脆弱性を発見し、Anthropicのオープンソース解析でさらに5 500件を発見した。このうち33 000件超が重大または高リスクに分類されている。これらの数字はパートナーからの33件の報告に基づいており、Anthropicは実際の影響が「少なくとも5倍大きい」と見積もっている。同日に公開された事例で、Comcastは、Claude Mythos Previewを使って258のシステムと約1億7千万行のコードを評価し、認証に関する重大な脆弱性を発見したと述べている。また、Booz Allenのアナリストは12日間で138のリポジトリを調査した。

運用面では、不正利用を監視するため、このプログラムはデータの保持を必須としている。今秋後半にEnterprise Frontier Safeguards (EFS) が導入されれば、これらのデータを顧客が管理するクラウド内に保持できるようになる。すでにFable 5.1またはMythos 5.1をデータ保持なしで利用している組織は、CVPでも同じ設定を利用できる。プログラムはClaude Platform、Vertex AI、Microsoft Foundryで提供され、Amazon BedrockではEFSの利用条件を満たす顧客のみが対象となる。個人での申請は有料プランのDefense Accessに限られる。このレベルでは、12月15日までにフィッシング耐性のある多要素認証を導入し、APIキーの使用をやめる必要がある。ウェビナーは10月14日の9時(PT)に予定されている。

🔗 AnthropicによるCyber Verification Programの発表記事 🔗 Cyber Verification Programのヘルプページ 🔗 ComcastとBooz AllenによるClaude Mythosの活用


EmbeddingGemma 2:Googleのオープンなエンベディングモデルがマルチモーダルに

10月6日 — Google DeepMindが、端末上で動作するよう設計されたオープンなエンベディングモデルの第2世代、EmbeddingGemma 2を公開した。Googleによると2,000万回以上ダウンロードされた初代EmbeddingGemmaは、テキストのみを処理していた。新モデルは、テキスト(コードを含む)、画像、動画、音声を、単独でも組み合わせても、同じ768次元の空間に射影する。Gemma 4のアーキテクチャを基盤とし、Apache 2.0ライセンスで公開されている。

Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.

🇯🇵 端末上でエンベディングを生成する、当社初のマルチモーダルにネイティブ対応したオープンモデル、EmbeddingGemma 2をご紹介します。テキストの枠を超え、コード、画像、音声、動画を共通の空間に統合します。 — Xの@GoogleDeepMind

モデルのパラメータ数は7億4,000万だが、モジュール構成になっている。270Mのテキスト処理コアに、必要に応じて画像エンコーダー(170M)と音声エンコーダー(300M)を追加する。したがって、テキスト専用のアプリケーションが読み込むのは270Mのパラメータだけだ。量子化した場合、Googleの測定ではPixel 11 Pro上のアクティブなRAM使用量は、テキスト用の重みで約191 Mo、マルチモーダルモデル全体で567 Moとなる。

EmbeddingGemma 2の特性Googleが公表した値
総パラメータ数740M(テキスト270M、画像170M、音声300M)
ベクトルの次元数768、512、256、128に切り詰め可能
コンテキストウィンドウ8K tokens、初代の4倍
Pixel 11 Pro上のアクティブなRAM使用量(量子化済み)テキストのみで約191 Mo、マルチモーダルで567 Mo
MTEB Code78,68、初代は68,76
多言語MTEB v261,36、初代は61,15

「マトリョーシカ型」の表現学習(Matryoshka Representation Learning)によりベクトルを短縮でき、保存に必要な容量を最大6分の1に抑えられる。モデルカードによると、256次元までは品質への影響が小さく、128次元は主にテキストのみの用途に適している。最も顕著な改善はコード処理で、GoogleによるとMTEB Codeで約10ポイント向上した一方、多言語テキストの性能は従来と同程度にとどまる。

想定される用途は、完全にローカルで行う検索と検索拡張生成(RAG)だ。たとえば、音声メモを手がかりに動画の該当箇所を見つけられる。このモデルはGemma 4とテキスト分割器(tokenizer)および音声エンコーダーを共有するため、両モデルを同時に動かす際のメモリ使用量を抑えられる。重みはHugging FaceとKaggleで公開されている。Gemini Enterprise Agent PlatformのModel Gardenへの追加は「近日中」と予告されているが、日付は示されていない。公開時点でTransformers(バージョン5.19.0)、sentence-transformers、MLX、vLLM、llama.cpp、Ollama、LM Studioが対応しており、ブラウザーでもtransformers.jsを通じて利用できる。

🔗 Googleブログの発表 🔗 EmbeddingGemma 2のモデルカード 🔗 Hugging Faceで公開されている重み


意思決定モデル:OpenAIがDecisions APIを公開、PerplexityがDecider v1.1を公開して料金を半額に、Decision Index 0.3が両モデルを評価

自由形式の回答を作成する代わりに、選択肢を選んだり入力を採点したりする意思決定モデルにとって、動きの多い一日となった。2社が提供内容と料金を見直し、この分野のコミュニティランキングも評価方法を変更した。

OpenAIのDecisions APIが公開ベータに

10月6日 — DevDayで限定公開されてから1週間後、OpenAIのDecisions APIが公開ベータに移行した。一般提供は「今後数週間以内」を予定している。唯一の対応モデルであるGPT-6 Lunaを使い、専用エンドポイント(POST /v1/decisions)を通じて、テキスト、画像、または両方に対する選択式などの質問に答える。OpenAIによると、型が定義された回答はResponses APIより約10倍速く返される。この日の新情報は料金で、入力100万トークンあたり0.10ドル、出力とキャッシュは無料となる。リージョン指定の処理と長いコンテキストには追加料金がかかる。

質問の種類想定用途返される結果
述語(predicate)写真に写った商品の破損など、条件を確認する条件が真である確率を0から1で返す
選択(choice)提供された一覧から選択肢を選ぶ選んだ選択肢、各選択肢の確率、信頼度指標
スコア(score)インシデントの重大度など、順序のある段階で評価する確率で重み付けした段階の平均値

1回のリクエストで、同じ入力に対して複数の質問を行える。画像はbase64で送信する必要があり、ホストされた画像のURLやファイル識別子は使えない。このAPIは、対象となる顧客に対してデータを保持しない機能(Zero Data Retention)とHIPAAに準拠した用途をサポートし、データの保存地域として米国と欧州に対応している。

🔗 Decisions APIのガイド 🔗 OpenAI APIの変更履歴

Perplexityのpplx-decider-v1.1-27bと料金の半額化

10月6日 — 独自のDecisions APIを公開してから5日後、Perplexityは開発者向けアカウント@perplexitydevsのスレッドで、同APIを動かすモデルの更新を発表した。Hugging FaceでApache 2.0ライセンスの下、重みを公開したpplx-decider-v1.1-27bは、v1の基盤であるQwen3.8-27Bを維持し、250kトークンのコンテキストでテキストと画像を読み取る。また、完全アテンション層の因果マスク(causal mask)を解除している。このモデルを提供するようになったDecisions APIの料金は、入力100万トークンあたり0.02ドルで、v1の0.04ドルの半額となった。出力は引き続き無料だ。

Decision Indexのカテゴリ(Hugging Faceのモデルカード)Jevのスコアv1のスコアv1.1のスコア
知識(知識)51,440,948,18
言語(言語)62,063,569,45
情報検索(検索)55,454,961,26
ツール(ツール)75,179,378,88
芸術(芸術)37,739,444,66
加重総合スコア57,956,461,56

モデルカードによると、総合スコアは56,4から61,56に上がり、TypeSafe AIの意思決定モデルJevの57,9を上回った。ただし、知識分野では引き続きJevが優位に立っている。Perplexityは、新しいDecision Index 0.3でも最高スコアを獲得したと主張している。自前でホストするには、約49 Gioの重みを格納できるGPUと、提供されている実装が必要だ。標準的な因果推論では、測定された動作を再現できないためである。

🔗 Xの@perplexitydevsのスレッド 🔗 Hugging Faceのpplx-decider-v1.1-27b

Decision Index 0.3

10月6日 — Hugging Faceのエンジニアapolinarioが、JevのDecision Modelを再現するオープンな意思決定モデルのコミュニティランキング、Decision Indexのバージョン0.3を公開した。現在は112モデルを収録し、そのうち111モデルがオープンな再現モデルで、NVIDIA RTX PRO 6000上で動作する。評価方法も変更された。完全スコア(フルスコア)は、37の公開ベンチマーク、同じ能力を測る非公開テスト、新しい分野の非公開タスクを組み合わせる。これにより、既知のベンチマークでの成績だけでなく、能力を順位に反映させる。画像処理のタブも新たに追加された。

表示順位ランクインしたモデル完全スコア
1Perplexity Decider v1.1 (27B)62,8
2Fastino GLiDE 推論なし (28B)60,2
基準Jev60,1
3Torchcast Decision 27B59,9
4deck31b (Gemma 4 31B)59,0

Decider v1.1の2つのスコアは別のものだ。61,56はPerplexityのモデルカードが公表した値で、62,8はこのランキングが新しい方法で算出した値である。非公開テストは、その性質上、公開されていない。

🔗 Xでのapolinarioの発表 🔗 Decision Index 0.3


コンピューター操作:OpenAIがIroncladの契約業務でGPT-6 Astraを訓練

10月6日 — OpenAIは、業務ソフトウェア内でのエージェントの有効性を高めるため、ソフトウェア企業との共同研究を開始した。コンピューター操作(computer use)に関する取り組みで、最初の提携先はAI支援による契約業務を専門とするIroncladだ。両社のチームは、法務、営業、購買に関する11のタスクを定義した。OpenAIによると、熟練ユーザーでもそれぞれ30〜40分を要するタスクで、8〜50の基準で評価される。Ironcladは自社ソフトウェアのホスト環境を提供し、モデルはその環境で、SECのEDGARデータベースにある公開契約書から作成した合成タスクを用いて、強化学習による訓練を受けた。

OpenAIによる11タスクの測定GPT-5.6 Sol(推論 High)GPT-6 Astra(推論 Max)
平均スコア41,6 %55,0 % (+32 %)
1回の試行にかかる推定平均時間(シミュレーション)37,0 minutes19,2 minutes (-48 %)

GPT-6 Astraは、これらのタスクで訓練されたOpenAI初のフロンティアモデルであり、開発中に使用された内部モデルは63,7 %を達成した。これらはOpenAIが示した数値で、時間は想定した処理速度に基づくシミュレーション値であり、顧客環境で実測したものではない。OpenAIは他のソフトウェア企業にも、現在のエージェントがまだ安定して成功できないタスクを提案するよう呼びかけている。

🔗 Ironcladとの共同研究に関するOpenAIの記事


APIとプラットフォーム:OpenAI APIの利用階層とBAA、PerplexityのAgent APIでの文書と画像、BedrockのGLM-5.3

推論サービスを購入する開発者に関わる変更が4件ある。OpenAI APIの利用条件、PerplexityのAgent APIのツール、AWSのカタログに追加された新しいオープンモデルだ。

OpenAI APIの利用階層が5段階から3段階に

10月6日 — OpenAIは、APIの高いレート制限(rate limits)へのアクセスを簡素化する。有料の利用階層は5段階からBuild、Launch、Growの3段階になる。最上位のGrowには、APIへの累計支払い額が500ドルで到達できる。従来の最上位階層では1,000ドルが必要だった。すでに有料階層を利用している組織は、操作不要で自動的に移行され、その後はクレジットの累計購入額が基準に達すると上位階層に移る。無料階層の上限は引き続き月100ドルだ。

利用階層累計購入額の基準月間利用上限Astra、Sol、Terra(1分あたりのリクエスト数とトークン数)Luna(1分あたりのリクエスト数とトークン数)
Build5ドル500ドル5 000と1 000 0005 000と2 000 000
Launch100ドル5 000ドル10 000と4 000 00010 000と10 000 000
Grow500ドル200 000ドル15 000と40 000 00030 000と180 000 000

🔗 Xの@OpenAIDevsのスレッド 🔗 レート制限のドキュメント

OpenAI APIのBAAとHIPAA準拠サポートがセルフサービスで利用可能に

10月5日 — OpenAI APIで保護対象の医療情報を扱う組織は、米国のHIPAA法が求める業務提携契約(Business Associate Agreement、BAA)を自ら締結できるようになった。「設定 > 組織 > 一般」で管理者が標準BAAに同意し、HIPAA準拠サポートを有効にでき、企業向け契約は不要だ。このセルフサービスを利用できるのは、一定のAPI利用実績がある対象組織に限られる。また、有効化後はこの設定画面から取り消せない。個別の契約条項は引き続きメールで申請する必要があり、1〜2営業日以内に回答される。OpenAIは、BAAへの署名だけでアプリケーションが準拠するわけではないことと、ChatGPT Business向けのBAAは提供していないことを改めて説明している。

🔗 APIのBAAに関するOpenAIのヘルプ記事

PerplexityのAgent APIが文書の読み取りと画像検索に対応

10月5日 — Perplexity APIの変更履歴に、夜遅く3件の項目が追加された。Agent APIは、PDF、DOC、DOCX、TXT、RTF文書を入力として受け付けるようになった。文書はリクエストに含めるか、公開HTTPS URLで指定でき、対応状況は選択したモデルと提供事業者によって異なる。新しいツールimage_searchはウェブ上の画像を検索し、画像のアドレスと掲載元ページのアドレスを含む構造化された結果を返す。1回の呼び出しで1〜30枚、既定では5枚を取得でき、ドメインと形式のフィルターを備え、安全な検索が既定で有効になっている。料金は成功した呼び出し1,000回あたり2.50ドルで、失敗した呼び出しには課金されない。3件目は費用の内訳に関する修正だ。応答にサンドボックス内で行われた抽出処理の費用が詳しく表示されるようになり、GPT-6 Lunaの料金は変わらない。

🔗 Perplexity APIの変更履歴 🔗 image_searchツールのドキュメント

Z.aiのGLM-5.3がAmazon Bedrockに登場

10月6日 — Z.aiは、重みを公開している主力モデルGLM-5.3のAmazon Bedrockへの追加を発表した。AWSの紹介ページでは、提供開始日を10月5日としている。7,440億パラメータの混合エキスパートモデルで、1トークンあたり約400億パラメータがアクティブになる。コンテキストは100万トークン、出力は最大128,000トークンに対応する。利用できるのは対象となる顧客に限られ、AWSの担当チームを通じて申し込む。モデルはリージョン間推論(米国またはグローバルのプロファイル)でのみ提供され、1,024トークン以上のプロンプトキャッシュと、Standard、Priority、Flex、Reservedのサービス階層に対応する。紹介ページには料金が記載されておらず、Bedrockの料金ページを案内している。GLM-5.3は、ここ2週間でBedrockに追加されたKimi K3(9月22日)とGrok 4.7(9月28日)に続くモデルだ。

🔗 Amazon BedrockのGLM 5.3紹介ページ 🔗 XでのZ.aiの発表


コーディングエージェント:Claude Code 2.1.290〜2.1.292、クラウドセッション、Vibe CLI 2.26.0、Antigravity、Replit

ターミナルからエディターまで、コーディングエージェントに5件の更新があった。20時間足らずで公開されたClaude Codeの3つのバージョン、クラウドセッションのガイド、Rustによる新しいインターフェースが充実したVibe CLI、VS Code向けAntigravity拡張機能、そしてユーザーのすべてのプロジェクトを参照できるようになったReplitだ。

Claude Code 2.1.290 から 2.1.292

10月5日・6日 — 10月5日23時33分 UTC に公開された Claude Code 2.1.290 は、190 項目、うち修正 131 件を含む大規模なリリースだ。claude attach と claude logs では、セッションの識別子の代わりに名前の一部を指定できるようになり、/claude-api managed-agents-onboard はウェブページに記述された Managed Agents のモデルを ant apply ファイルに変換する。対話型セッションのウェブ検索枠は 200 回で尽きることがなくなり、1 時間あたり 100 回のペースで補充される。推論の努力レベルが中(medium)の場合、/code-review は Opus 5.5 と Sonnet 5.5 で CLAUDE.md の規約からの逸脱も指摘する。Slack では Claude Tag に高速モード(!fast)が加わり、Claude in Chrome の browser_batch 呼び出しには従来の 60 秒に代わって 90 秒が与えられる。また、WebFetch は 100,000 文字を超えるテキストを通知なしに切り捨てなくなった。pyright と、より多くの形式の ps で許可が求められるようになり、権限に関する複数の脆弱性も修正された。対象は、シェルによって展開される rg と git grep のワイルドカード、作業フォルダー外へリンクされた CLAUDE.md、ユーザーの mod による組織の mod の回避だ。4 時間後には 2.1.291 が公開され、2 件のリグレッションを修正した。一方は 2.1.290 で発生した、クラウドセッションで許可プロンプトへの応答が失われる問題、もう一方は 2.1.288 で発生した、終了時にセッションの最後のメッセージが失われる問題だ。

10月6日18時59分 UTC に公開された 2.1.292(92 項目、うち修正 64 件)は、Agent ツールに effort パラメーターを追加し、指定した努力レベルでサブエージェントを起動できるようにした。また、必要に応じてマーケットプレイス(拡張機能の配布サイト)を追加してからプラグインをインストールする claude plugin install --marketplace も加わった。ローカルの MCP サーバー(stdio)は、既定でプロトコル 2026-07-28 をネゴシエーションするようになった(元に戻すには MCP_PROTOCOL_NEGOTIATION=legacy)。CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS は 529 エラー時の再試行を長く続けるようになり、mod にはプロンプトの自動補完イベントとプロンプトキャッシュが加わった。セキュリティ面では、PreToolUse フックによる承認と自動モードが、ネットワークパス(UNC)の読み取り時に許可プロンプトを迂回しなくなり、フックが書き込んだ <system-reminder> タグは Claude に渡る前にエスケープされる。Artifact ツールが一覧表示するアーティファクト数は、ようやく 50 件から 200 件になり、Code Review は統計をリポジトリ別に表示するようになった。2.1.290、2.1.292 ともに X では告知されていない。

Claude Code のバージョン公開日時(UTC)変更項目数主な新機能
2.1.29010月5日、23 h 33190、うち修正 131 件名前によるセッション指定、managed-agents-onboard、WebSearch 枠の補充
2.1.29110月6日、3 h 55修正 2 件2 件のリグレッションを修正
2.1.29210月6日、18 h 5992、うち修正 64 件サブエージェントの努力レベル、1 コマンドでプラグインとマーケットプレイスを追加、MCP 2026-07-28

🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292

Claude Code のクラウドセッションガイド

10月6日 — Claude Code のクラウドセッションがプレビュー版として公開されてから 2 週間後、Anthropic はアディ・オスマニによる実践ガイドを claude.dev に公開した。各タスクは、約 4 vCPU、16 GB の RAM、30 GB のディスクを備えた新しい仮想マシン上で実行され、リポジトリは新しいブランチにクローンされる。Pro、Max、Team、Enterprise の各プランでは追加の計算料金はかからない。ガイドは 7 つの用途を紹介している。未処理のタスク一覧(バックログ)を並列で消化する、繰り返し実行して修正の有効性を確認する、ローカルで計画を立ててから claude --teleport でセッションを再開する、スマートフォンから進捗を追う、CI の失敗とレビューコメントへの対応を Auto-fix に任せる、定例処理を起動する、安全性の低いコードを使い捨ての VM で実行する、というものだ。デモでは、最初の起動から 87 秒後に 3 つのセッションがすべて完了した。1 つのプロジェクトでは、1 日あたり最大 200 件の新しい会話スレッド(会話の流れ)を開始できる。ガイドは GitHub への接続も詳しく説明している。GitHub でのログインと Claude GitHub アプリのインストールは別々の権限であり、プライベートリポジトリにアクセスできるのは後者だけだ。100 ドル(Pro)または 250 ドル(Max)のボーナスクレジットは、10月7日23時59分 PT までに受け取る必要があり、11月4日に失効する。

🔗 claude.dev のクラウドセッション実践ガイド 🔗 ボーナスクレジットに関する @ClaudeDevs の再案内

Vibe CLI 2.26.0

10月6日 — Mistral は、コマンドラインで動くコーディングエージェント Vibe CLI 2.26.0 を、2.25.8 から 13 日後に公開した。X での告知はない。追加 33 件、変更 23 件、修正 91 件を含む大規模な更新で、全 147 項目のうち 72 項目が Rust で書かれた新しいインターフェースに関するものだ。初回起動ウィザード、音声モード(/voice)、/loop を使って自然言語で指定する定期実行プロンプト、/teleport による Vibe Code Web へのセッション送信、vibe update コマンドが含まれる。Vibe は新しい実行エンジンである Unified Harness 上で常に動作するようになり、これが存在しない場合は明示的なエラーを出して停止する。従来のエンジンへ通知なしに切り替わることはなくなった。プラグインは独自の MCP サーバーを同梱できるようになり、~/.vibe/.env に保存された予備の API キーは所有者だけが読み取れるようになった。また、Rust CLI は利用状況のテレメトリー(起動時間、使用したコマンド、検出したターミナル)を Mistral に送信するようになった。

🔗 Mistral Vibe v2.26.0 のリリースノート

VS Code 向け Antigravity 拡張機能 1.7.0

10月5日 — Google は、Visual Studio Code 向け Antigravity 拡張機能のバージョン 1.7.0 を公開した。この拡張機能は、Google Antigravity のエージェントを Microsoft のエディターに導入するもので、サイドパネルでの会話、インラインの差分レビュー、対話型の計画に対応し、VS Code 1.90 以降で利用できる。変更履歴によると 9 月初旬からほぼ毎週更新されているが、ここではこれまで取り上げていなかった。今回の 1.7.0(改善 6 件、修正 9 件)はコードレビューを強化している。Accept と Reject の判断をキーボードで取り消し・やり直しできるようになり、左右に並べて表示する差分エディターには Accept All と Reject All のボタンが加わった。また、VS Code の自動保存(Auto Save)が進行中のレビューを上書きしたり終了させたりすることがなくなった。Windows では、ウィンドウが前面にない場合にタスクの完了をネイティブ通知で知らせる。また、Google Cloud Workstations と Cloud Shell に対話型の認証が加わった。同日、Visual Studio 向け拡張機能も 1.0.261005.0 に更新され、送信するフィードバックに診断ログを添付するようになった。

🔗 Google Antigravity の変更履歴

Replit が全プロジェクトのコンテキストを把握

10月6日 — Replit は、ユーザーのすべてのプロジェクトのコンテキストを把握できるようになったと発表した。新しい会話から、既存のプロジェクトを探す、そのプロジェクトに機能を追加する、あるプロジェクトを別のプロジェクトの参考にするといった依頼ができる。Replit は関連ファイルを読み取り、変更をバックグラウンドタスク(背後で実行する処理)として開始し、変更内容を確認するためのリンクを提示する。紹介された例はコードそのものにとどまらない。「Partner Marketing Hub」の配色を、コーヒーブランドのほかの 2 つのプロジェクトに適用するものだ。告知は動画付きの投稿 1 件のみで、ブログ記事、ドキュメント、料金の案内はない。

🔗 Replit による X での発表


GitHub のスタック型プルリクエストが一般提供へ

10月6日 — GitHub は、7月30日からパブリックプレビューで提供していたスタック型プルリクエスト(積み重ねたプルリクエスト)を、github.com のすべてのプランで利用できるようにした。大きな変更を小さなプルリクエストに分割し、個別にレビューしてからまとめてマージする仕組みだ。GitHub Enterprise Server には今後のバージョンで導入される。GitHub によると、スタックを使うリポジトリは、条件の近いほかのリポジトリより 9 % 多くのコードをマージしている。また、上位 1 % のリポジトリの 3 分の 2 超がこの機能を利用し、マージまでの時間は 5 % 短縮されているという。

正式版では、マージ時の手間が減った。メインブランチが更新されても、「Rebase stack」は変更のないコードへの承認を維持し、署名付きの置き換えコミットを生成する。スタックはマージキュー(マージの待ち行列)を 1 つのグループとして通過し、ベースブランチが削除されたスタックは、閉じられる代わりに対象ブランチが変更される。スタック全体の自動マージは「今後数週間のうちに」追加される予定だ。コマンドラインやエージェントからの利用に向けて、GitHub CLI の gh stack 拡張機能は Git のワークツリーに対応している。

🔗 スタック型プルリクエストに関する GitHub の変更履歴


多言語モデル:Cohere の Tiny Aya L2-Thinker と TII の Falcon-OCR-Arabic

2 つの小型モデルが、大規模モデルでは十分に対応できていない言語を対象としている。一方はユーザーの言語で推論し、もう一方はアラビア語の文書を読み取る。

Cohere の Tiny Aya L2-Thinker

10月6日 — Cohere は、モデルがどの言語で推論するかという問題に取り組んでいる。スペイン語、アラビア語、スワヒリ語で質問されても、大半のモデルは英語で考えてから回答する。同社の研究用モデル Tiny Aya L2-Thinker(33.5 億パラメーター)は、60 言語において 93 % 超の割合でプロンプトの言語を使って推論する。その鍵はデータの組み合わせにある。gpt-oss-120b が生成した約 170 万件の英語の推論例だけでは、ユーザーの言語で推論する割合は 12.8 % にとどまる。44 言語それぞれに約 5,000 件の翻訳例を加えると、この割合は 86.1 % に上がり、推論を含まない多言語データによって同じ挙動がほかの言語にも広がる。英語で推論する対となるモデルと比べると、6 つのベンチマークのうち 5 つで精度の低下は最大でも 2〜3 ポイントにとどまる。競技数学の PolyMath だけは、強化学習の段階を経ていないため、より大きく低下する。思考に使うトークン数は平均 5,000 未満だ。モデルとデータは、非商用ライセンス CC-BY-NC 4.0 の下で Hugging Face に公開されている。ブログ記事は 9月9日の arXiv 論文を紹介している。

🔗 Tiny Aya L2-Thinker に関する Cohere の研究記事

TII の Falcon-OCR-Arabic

10月6日 — Falcon モデルを開発するアラブ首長国連邦の研究機関 TII は、Hugging Face のブログで、テキスト認識モデル Falcon OCR のアラビア語版 Falcon-OCR-Arabic を紹介した。2 億 7,000 万のパラメーターと早期融合型アーキテクチャを維持し、実際の文書と合成文書からなるアラビア語データで教師ありファインチューニングを行った後、強化学習で適応させた。TII 自身が作成した評価セット(実際の文書 11,974 件、15 カテゴリー)では、比較した 17 モデル中 2 位となり、公式文書、行政手続きの書式、領収書、請求書では 1 位となった。

TII が評価したモデルテキストの正確性Table TEDS スコア
Gemini 3.5 Flash84,34 %51,30 %
Falcon-OCR-Arabic (270M)81,87 %59,95 %
Claude Opus 5.579,22 %43,98 %
GPT Astra75,02 %51,23 %
Chandra OCR 2(専用 OCR で最高)61,67 %32,63 %

記事で案内されているのは試用環境(プレイグラウンド)だけだ。確認した時点では Hub に Falcon-OCR-Arabic の重みは公開されておらず、ライセンスの記載もない。

🔗 Falcon-OCR-Arabic に関する TII の記事


Hugging Face のライブラリ:Diffusers 0.41.0 が Qwen-Image 2.1 を統合、Transformers v5.19.0 が EmbeddingGemma 2 に対応

Hugging Face の主要なモデルライブラリ 2 つが、同じ日に新バージョンを公開した。

Diffusers 0.41.0 と Qwen-Image 2.1

10月6日 — Hugging Face の拡散モデル向けライブラリ Diffusers 0.41.0 は、画像生成と編集を統合した Alibaba のモデル Qwen-Image 2.1 に対応した。70 億パラメーターの視覚生成コンポーネントを備え、画像生成、編集、背景が透明な画像の生成(ネイティブ RGBA 出力)、LoRA の学習に直接利用できるようになった。チームはリリースの頻度も変更する。Transformers と同様に、Diffusers は今後、新しいモデルの登場に合わせてマイナーバージョンを公開し、パッチバージョンは修正だけに使う。テンソル並列での読み込みでは、各 GPU が自分の担当する重みだけを読み取れる。また、このバージョンには LTX-2.5 DFR パイプラインと Cosmos 3 向けの最適化が加わった。一方、ONNX 対応は非推奨となり、Optimum への移行が推奨される。

🔗 Diffusers 0.41.0 のリリースノート

Transformers v5.19.0

10月6日 — v5.18.0 から 6 日後、Transformers v5.19.0 は前述の EmbeddingGemma 2 に対応した。短縮可能なベクトルと、読み込み時に無効化できる視覚・音声エンコーダーを備える。分散学習では、エキスパート並列にトークンの振り分け(トークンの配送)が加わり、Qwen3 MoE と Mellum で既定で有効になる。並列度をテンソル並列と同じにする必要がなくなり、Trainer もこのモードで動作する。キャッシュはレイヤーごとに設定できるようになり、異なる構成のレイヤーを持つモデルに役立つ。また、継続的なバッチ処理(連続バッチ処理)が XPU に対応した。このバージョンには互換性を損なう変更が 6 件あり、すべての MoE でルーターのロジットを返すようになることや、paged| プレフィックスの段階的な廃止が含まれる。

🔗 Transformers v5.19.0 のリリースノート


音声エージェント:ElevenLabs が ElevenAgents Architect をアルファ版で公開

10月6日 — ElevenLabs は、対話型エージェントのプラットフォーム ElevenAgents に、Architect という専門家を組み込んだ。チームは音声やテキストで Architect に話しかけ、音声・テキストエージェントの構築や改善を支援してもらえる。Architect は ElevenAgents のすべての設定(ナレッジベース、プロンプト、処理の流れ、音声、ガードレール、ツール、シミュレーション)と、それらがどう相互に作用するかを把握している。質問、失敗したテスト、人間への引き継ぎの増加、ElevenAgents Spotlight が指摘した問題などを提示すると、会話の文字起こしを分析し、原因を突き止め、変更を提案し、その変更を検証するシミュレーションを作成する。簡単な説明からエージェントを構築することもできる。すべての変更は、バージョン管理された取り消し可能な下書きとして提示され、承認なしに本番環境へ反映されることはない。Architect は製品内から利用できるほか、Claude、Claude Code、ChatGPT、Cursor、Grok Bot からもアクセスできる。アルファ版としてすでに利用可能だが、料金や成果の数値は公表されていない。

🔗 ElevenAgents Architect に関する ElevenLabs の記事


動画生成:Black Forest Labsによると、FLUX 3がPhysics-IQ Verifiedで首位

10月6日 — Black Forest Labsは、Google DeepMindのベンチマークPhysics-IQで首位を獲得したと発表した。このベンチマークは、動画モデルが物理世界をどれだけ理解しているかを測るもので、実際の実験を撮影した映像の冒頭をモデルに見せ、流体、光学、固体力学に関するその後の展開を予測させる。基準となるランキングPhysics-IQ Verifiedは、Anates Labsが管理している。動画から動画を生成する部門では、FLUX 3 [large]がNVIDIAのCosmos3を大きく上回る一方、動画1本あたりの費用は高い。

モデルと手法(動画から動画)Physics-IQ Verifiedのスコア標準化した動画1本あたりの費用
FLUX 3 [large]、8回の生成のうち最良の結果64,35 %16,43 ドル
FLUX 3 [large]61,11 %2,08 ドル
Cosmos3 Super (NVIDIA)50,80 %0,82 ドル
Cosmos3 Nano (NVIDIA)43,00 %0,82 ドル

画像から動画を生成する部門でも、FLUX 3 [large]は、NVIDIAが9月29日に首位と発表していた手法Physis-Langを上回った。FLUX 3 [large]はプロプライエタリモデルで、このスレッドでは、このモデルの提供開始日も料金も示されていない。

🔗 Xの@bfl_aiのスレッド 🔗 Physics-IQ Verifiedのランキング


一般公開の評価:GeoGuess BenchとRSI Arena

一般の人が参加できる2つの評価が、従来のベンチマークとは異なる方法を採用している。一方はモデルにGeoGuessrをプレイさせ、もう一方はエージェントが訓練したモデルを一般の人の投票で評価する。

GeoGuess Bench

10月6日 — Together AIで開発者体験を担当するハッサンが、モデルにGeoGuessrをプレイさせる個人プロジェクトの評価基盤GeoGuess Benchを公開した。各モデルは同じ210枚の街路写真を見てピンを置き、ゲームの採点式に従って、5ラウンドの1ゲームにつき最大25 000点を獲得する。Claude Opus 5.5が首位に立ち、Claude Fable 5.1が僅差で続く。意外な結果を示したのはMetaの重みが公開されたモデルMuse Glimmer 30Bで、3位に入り、1ゲームあたりの費用が約45分の1でありながらGPT-6 Astraを上回った。

GeoGuess Benchでの順位評価対象モデル25 000点満点のスコア1ゲームあたりの費用
1Claude Opus 5.523 4120,064 ドル
2Claude Fable 5.123 3070,115 ドル
3Muse Glimmer 30B(オープン)22 4070,0049 ドル
4GPT-6 Astra21 5620,223 ドル
5GPT-6.1 Sol21 1940,042 ドル
6GLM-5.3 Flash(オープン)21 1830,0087 ドル

GLM-5.3 Flashも、約5分の1の費用でGPT-6.1 Solとほぼ同等の結果を出した。これは、オープンモデルの推論サービスを提供するTogether AIの社員による個人プロジェクトであり、同社による評価ではない。Geminiのモデルは含まれておらず、コードはGitHubで公開されている。

🔗 Xのハッサンによる発表 🔗 GeoGuess Bench

RSI Arena

10月6日 — ジチェン・チェンが、今回はHugging Faceと共同で、RSI Arena(自己改善を再帰的に繰り返す仕組み、再帰的自己改善)の新たなラウンドを発表した。AIエージェントにはGPUと、より優れたモデルを訓練するという唯一の課題が与えられた。エージェントは自らデータを選び、コードを書き、実験を進めた。最初の訓練ラウンドが終了し、一般の人もこのサイクルに参加する。モデル同士が一対一で対戦し、各参加者が投票し、エージェントはそのフィードバックを次の実験に生かす。Hugging FaceのInference Endpointsが各モデルをリアルタイムで提供し、サイトにはGPT-6 Astra、Grok 4.7、DeepSeek V4.1 Flash、GLM-5.3、Muse Spark 1.3など10のエージェントが掲載されている。ダッシュボードには、API費用が予算300ドルに対して286,60ドル、GPU時間が上限1 000時間に対して755,17時間と表示されていた。チームは、エージェントが訓練した各モデルをHubで公開し、実験終了時にはデータ、コード、各エージェントの研究過程全体を含むすべての成果物も公開すると約束している。

🔗 Xのジチェン・チェンによる発表 🔗 RSI Arena


GPUインフラ:NVIDIAがAICR v1.0を公開

10月6日 — NVIDIAがAI Cluster Runtime(AICR)のバージョン1.0を公開した。GPUを使うKubernetesクラスターを手探りで構成する状況の解消を目指すオープンプロジェクトだ。アクセラレーターを使うクラスターは、それぞれ独立したバージョンを持つ数十のコンポーネント(カーネル、ドライバー、コンテナ実行環境、ネットワーク、ストレージ、オペレーター、ライブラリ)に依存し、ある環境で動く組み合わせが別の環境ではエラーを表面化させずに失敗することがある。AICRは、バージョンを固定して検証した構成レシピをHelm、Argo CD、Flux、Helmfile向けに生成し、テストしたハードウェアでの検証を証明する署名付きの記録を添えることで対応する。v1.0では互換性の保証範囲を定めている。CLI、REST API、Go SDK、デプロイ用パッケージの構造、成果物のスキーマが安定したインターフェースとなり、互換性を損なう変更には新たなメジャーバージョンが必要になる。NVIDIAによると、貢献者は100人を超え、その半数近くが社外の人だという。Pulumi Labsや、Mirantisの複数クラスター管理ツールk0rdentでの統合事例も挙げている。

🔗 NVIDIAの技術ブログ記事


Claude Startups:最大7 000ドル相当の製品とクレジット、45 000ドル相当のStartup Stack

10月6日 — Anthropicが、Claudeを使って事業を構築する創業者向けプログラムClaude Startupsの対象を拡大し、設立から5年未満、または過去2年間に資金調達を行ったスタートアップに開放した。

プログラムの特典Anthropicが公表した価値
Claude Teamを1年間、Premiumを最大5席まで6 000 ドル(5席、1席あたり月額100 ドル)
1回限りのAPIクレジット、承認後すぐに利用可能1 000 ドル
Claudeの製品とクレジットの合計最大7 000 ドル
Claude Startup Stack(提携企業の特典)最大45 000 ドル

Claude Teamの1年間の特典は、Teamを初めて利用する企業が対象で、実際の価値は席数と席の種類によって変わる。この日新たに登場したClaude Startup Stackは、Linear、Lovable、ElevenLabs、Granola、Hexなど、Claudeを使って製品を構築する企業の割引やクレジットをまとめたものだ。上限額は、2026年9月時点の定価で計算したすべての特典の合計額に相当し、すべての特典を併用できるわけではない。プログラムには、AnthropicのApplied AIチームとの相談枠、Claude Marketplaceへの紹介ページ掲載の支援、イベントへの参加機会も加わる。

🔗 Claude Startupsに関するAnthropicの記事 🔗 Claude Startup Stackに関する@claudeaiのスレッド


短報

  • Claude Projectsとローカルフォルダー — Anthropicのダン・ファインが、Claude Projectsのクラウドセッションから、コンピューター上の承認済みフォルダーに接続できるようになったと発表した。フォルダーには、タスクで必要になったときだけアクセスする。10月5日から段階的に展開されており、ボリス・チェルニーによると、チームは完了まであと少し(もう少し)だという。🔗 出典 · 🔗 ボリス・チェルニー
  • SlackのグループメッセージにClaude — Slackのグループメッセージ(グループのダイレクトメッセージ)に、通常の参加者と同じようにClaudeを追加できるようになった。Claudeはスレッド内で返答し、その後もスレッドを追い続ける。また、呼びかけた人の個人用コネクターを利用できる。対象プランや提供時期の詳細は示されていない。🔗 出典
  • ボリス・チェルニーのプロンプトの書き方 — ボリス・チェルニーが、Home Depotを取り上げたポッドキャストAcquiredのエピソードに連動する対話型サイトを、水彩画も含めてOpus 5.5に作らせた。本人によると、プロンプトに秘訣はなく、何が欲しいか、どれだけの労力をかけるか、結果をどう検証するかをモデルに伝えればよいという。🔗 連動サイト · 🔗 プロンプトの書き方
  • AtlassianとOpenAI — 新たな契約により、GPT-6 Astraを含むGPT-6ファミリーの最先端モデルが、AtlassianのプラットフォームとRovoのエージェントを支える。Atlassianではすでに3 000人を超える開発者がCodexを利用しており、Jiraとのさらに深い統合も検討中だ。契約金額は公表されていない。🔗 出典
  • iOS版ChatGPTにCodexウィジェット — 10月2日公開のiOS版ChatGPT 1.2026.267で、選択したコンピューターの最近のCodexタスクを表示するホーム画面ウィジェットが追加された。利用枠の残量とリセット時刻を表示するウィジェットも加わり、こちらはロック画面でも使える。キーボードを開いたままにする設定も追加された。🔗 出典
  • Gemini CLI v0.63.0とv0.64.0-preview.0 — 安定版v0.63.0は、9月29日のプレビュー版の15項目をそのまま引き継いでいる。プレビュー版v0.64.0-preview.0は、9月30日から10月3日までのナイトリー版の16項目をまとめたものだ。新たな内容はなく、10月6日のナイトリー版には変更項目がない。🔗 出典
  • MistralのPython SDK 3.1.0 — APIから自動生成されたこのバージョンでは、可観測性モジュールに14の評価操作がベータ版として追加された。RunsのメソッドはWorkflows.runsの配下に移るため、マイナーバージョンの変更だけであっても、既存のコードが動かなくなる可能性がある。🔗 出典
  • Qwen Code v0.25.1-preview.0 — v0.25.0の翌日に公開されたこのプレビュー版には、13の機能追加と27の修正が含まれる。実験的なKubernetes実行環境、Managed Agent向けのシェルコマンドとバックグラウンド監視、同名のサーバーを許可しなくなったMCPルールなどがある。🔗 出典
  • SpaceXAIのTypeScript SDK 0.2.2 — 10月5日に告知なしで公開されたこのバージョンの変更は1つだけで、retryBeforeOutputオプションが、JSONを受け取るストリーミングなし(ストリーミング)のcreate()呼び出しにも適用される。🔗 出典
  • Falcon-Emirati-7B、アラブ首長国連邦の方言に対応 — TIIがFalcon-H1-Arabic 7Bをアラブ首長国連邦のアラビア語方言に特化させた。1 173問からなる評価基盤Alyahで84,83 %を記録し、Gemini 3.7 Flashによる判定では方言への忠実度が0,52となった。ALLaM、Gemma 3 27B、Jais-2、Fanar-2では、最も高くても0,05だった。このモデルはTIIのチャットプラットフォームでのみ提供されている。🔗 出典
  • Datasets 5.1.0 — 10月5日に公開されたこのデータセットライブラリは、強化学習環境Harbor、列指向形式Vortex、5つの生物学向け形式(FASTA、FASTQ、GenBank、PDB、mmCIF)を読み込めるようになった。また、アーカイブから隣接するディレクトリへ書き込めてしまう脆弱性を修正した。🔗 出典
  • TRL v1.14.2 — この修正版は、気づかないうちに訓練結果が歪む問題を直す。vLLMを使わない場合、GRPO、RLOO、Distillationは、GemmaやPhi-3.5のようなモデルでターンの終わりに停止せず、その後のテキスト全体を最大長まで学習していた。クラッシュする問題も3件修正された。🔗 出典
  • Jevで選挙運動メールを分類 — コミュニティへの投稿で、スティーブン・ソルカが政治関連のメールをJevで分類した。実際のメール100通のうち99通を正しく判定し、偽陽性は1件だった。続いて、CPU上で動作する2 260万パラメーターのSetFit分類器を使ったところ、試験的な評価では98 %だったが、難しい事例では23件中18件だった。🔗 出典
  • 10月16日にOpen Together — vLLMとHugging Faceが、オープンソース開発者の集まりOpen Togetherを開催する。10月16日金曜日にサンフランシスコでOpen Source AI Weekの幕開けを飾るイベントで、ジェフ・ブーディエによると、キャンセル待ちは150人に上り、定員は倍増された。🔗 出典 · 🔗 ジェフ・ブーディエ
  • Copilot CLI 1.0.93-2 — このプレビュー版では、ネットワークリクエストを管理対象のドメインに制限する企業向け設定permissions.limitToが追加された。モデル選択欄ではGPT-6.1 Sol、GPT-6 Astra、Luna、Claude 5.5の各モデルが目立つようになり、ユーザー設定は~/.copilot/settings.jsonからのみ読み込むようになった。🔗 出典
  • セキュリティ概要にAI Scan — 組織と企業の管理者は、GitHubのセキュリティ概要(セキュリティの全体像)で、プルリクエストのAI解析(プルリクエスト向けAI Scan)を有効にしているリポジトリを確認できるようになった。2つのフィルターと、CSVエクスポートの列も追加された。🔗 出典
  • シークレット検出:Lovable、Pydantic、Supabase — GitHubのシークレット検出(シークレットのスキャン)が、5つの新しいシークレットの種類に対応した。LovableのAPIキー、Logfireトークン、Pydantic AI Gatewayのキー、2種類のSupabaseトークンが含まれる。Lovable Labsもパートナープログラムに参加した。🔗 出典
  • Devinの10月5日のリリースノート — 主に細かな改善だ。セッションのワークスペースにTerminalタブが追加され、FilesまたはTerminalを開くとDevinが再び動き出す。Devin Reviewの処理量レベルを起動アクションから設定できるようになり、コード解析(コードスキャン)をAPI v3またはDevinのMCP経由で識別子を指定して取得できるようになった。🔗 出典
  • Delta独自のworktree — Deltaのブログで、コンラッド・アーウィンが、このツールがGitのworktreeを置き換える理由を説明している。各スレッドのworktreeはDeltaDBに登録され、人、エージェント、マシンの間で複製される。複数のエージェントが同じブランチで作業し、バージョン管理された.agents/prepareスクリプトが各チェックアウトの準備を行う。記事に伴う新バージョンの公開はない。🔗 出典
  • v0:個人アカウントをチームのワークスペースへ — v0の個人アカウントがチームのワークスペースになり、会話、プロジェクト、設定は自動的に移行される。ただし、ドキュメントでは、チーム用テンプレートなどの一部機能はPlus、Business、Enterpriseプランに限定されている。🔗 出典
  • v0とiOSでのChatGPTサブスクリプション — v0が9月29日から対応しているChatGPTサブスクリプションを、v0のiOSアプリでも使えるようになった。料金やそれ以上の詳細は示されていない。🔗 出典
  • Eleven v4とEleven v4 Turboが首位と2位 — ElevenLabsは、9月28日に公開した2つの音声合成モデルが、Artificial Analysisの音声合成(テキストから音声への変換)ランキングで上位2位を占めたと発表した。v4は公開時点ですでに首位だった。🔗 出典
  • HeyGen Videoが2Kに対応 — 公開から1週間で、HeyGen Videoが2K解像度に対応した。HeyGenによると、OpenRouterの動画ランキングで利用量が首位だという。2K専用の料金は示されておらず、カタログページには引き続き、10月末まで1秒あたり0,01ドルと表示されている。🔗 出典
  • PikaにNano Banana 2.1 — Pikaが、GoogleのNano Bananaモデルの新バージョンNano Banana 2.1を、自社プラットフォームとPika API Clubに追加した。Pikaによると、画質と速度が向上している。料金や必要なクレジット数は示されていない。🔗 出典
  • DOCA GPUNetIO — NVIDIAは、DOCA GPUNetIOを、NCCL、NVSHMEM、NIXL/UCXで使うGPU主導ネットワーク(GDA-KI)の共通実装とする。完全版はDOCA SDKに含まれ、RDMA Verbsに重点を置いた軽量なオープンソースプロジェクトとしても提供される。🔗 出典
  • CUDAのGreen contexts — NVIDIAの技術記事が、重要なタスクのためにSMを予約する方法を紹介している。148 SMを備えたBlackwell GPUでは、8 SMを予約したカーネルの応答時間は0,007 msで、優先ストリーム(ストリーム)を使った場合の0,140 ms、優先度を設定しない場合の3,727 msより短い。 🔗 出典
  • 通信事業者におけるオープンモデル — NVIDIAは見解を示す記事で、回答者の89 %がオープンソースを重要と評価した2026年の通信業界調査と、SoftBank、AT&T、Indosatの証言を紹介している。新製品の発表はない。🔗 出典
  • Perplexityのコラボレーションツールガイド — Perplexityは、AIを搭載した10のコラボレーションツール(Slack、Loom、Confluence、Airtable、Notion、ClickUp、Asana、Monday.com、Trello、Miro)について、AI機能とそれらを含む料金プランを比較している。新しい製品機能の発表はない。🔗 出典

これが意味すること

意思決定モデルは、独自の価格競争とランキングを持つ、一つのカテゴリーとして確立しつつある。同じ日に、OpenAIはDecisions APIの入力料金を100万トークン当たり0.10ドルに設定し、Perplexityは自社の料金を5日前の半額となる0.02ドルに引き下げた。どちらも出力には課金しない。これらのモデルは文章を書くのではなく、選択や採点を行う。読み込む量に応じて料金を支払い、速さが求められるモデルであり、OpenAIはResponses APIと比べて約10倍速い応答を約束している。Decision Index 0.3はコミュニティの評価基準として機能し、新たに設けられた評価の半分を占める非公開部分は、既知のベンチマークでの成功ではなく、能力を測ることを目指している。その評価結果は、すでに提供企業の発信に影響を及ぼしている。Perplexityは発表でその結果を根拠にしているが、モデルの紹介ページに記載されたスコアはランキングのスコアと異なる。

AIはオフィスツールの中に入り込んでいる。オフィスツールがAIの中に移るという動きではない。ClaudeはExcel、PowerPoint、Wordに続いてGoogle Docs、Sheets、Slidesに入り、Slackのグループメッセージにも加わる。また、GPT-6モデルはAtlassianのRovoエージェントを動かすことになる。こうした統合では、問われるのはモデルの品質だけでなく、制御の仕組みでもある。変更のたびに承認を求めるモード、Googleの共有権限に従うコネクター、モジュールに適用されるEnterpriseの管理機能などがその例だ。同じ考え方は、本日登場したエージェント向けツールにも見られる。Antigravityの取り消し可能なレビュー判断から、ElevenAgents Architectのバージョン管理された草案まで、その仕組みは共通している。

サイバーセキュリティでは、認証の状況に応じてアクセス範囲が段階的に変わる。AnthropicのCVPが変更するのはモデルではなく、そのガードレールだ。CyScenarioBenchでは、同じOpus 5.5でも、未認証の場合は最初のプロンプトでタスクがブロックされる状態から、Red Team Accessでは50タスク中34タスクに成功する状態へと変わる。Mistralは、拒否しないモデルという別の主張を打ち出している。同社によるとClaude Opus 5.5とGPT-6 Astraが受験を拒否するサイバー分野のテストで、82 %を達成したという。両者の取り組みには共通点が一つある。サイバー分野の能力への最も広いアクセスは、まず認証済みの専門家に与えられる。Mistralでは重みの公開前にパートナーへ、Anthropicではプログラムの参加者へ提供される。

モデルの規模も、大小両端へと広がっている。大規模な側には、1兆パラメーターを持ち、10月末の重み公開が約束されているMistral Large 4がある。小規模な側には、スマートフォン上で約567 MBのRAMに収まるEmbeddingGemma 2、33億5,000万パラメーターのTiny Aya L2-Thinker、そして現時点ではデモのみの2億7,000万パラメーターのFalcon-OCR-Arabicがある。ただし、本日の数値の多くは提供企業自身が測定したものだ。Mistralのスコア、Black Forest Labsが主張する首位、TIIの自社ベンチマーク、Perplexityのモデル紹介ページ、OpenAIが採点したIroncladのタスク、GitHubが発表したマージの効率向上などが該当する。発表当日は、それが唯一利用できる測定結果であることも多い。独立した評価と照合できれば、その信頼性は高まる。Mistral Large 4の重みが公開されれば、まさにそうした検証が可能になる。


出典