検索

ChatGPTの全ユーザーにGPT-6、Claude Haiku 5.5登場、RTX Spark搭載PCの予約受付開始

ai-powered-markdown-translator

gpt-6.1-solを使用してフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

GPT-6とIntelligent UIがChatGPTの全ユーザーに提供されます。有料プランには10月7日からGPT-6 Solが、FreeとGoには10月8日からGPT-6 Lunaが登場します。Anthropicは、入力100万トークンあたり0,10ドルから利用できるClaude Haiku 5.5を追加し、5.5ファミリーを完成させました。一方、MicrosoftのWindowsイベントでは、RTX Spark搭載PCの予約受付が始まり、GitHub Copilotがまもなくローカルモデルにタスクを任せられるようになることが発表されました。OpenAIは、社内モデルが生み出した数学の研究成果をまとめた論文原稿722本も公開しています。


ChatGPTが全ユーザーにGPT-6とIntelligent UIを提供、音声ファイルの読み込みに対応し、College Plannerを準備

10月7日 — OpenAIは、GPT-6の提供対象をChatGPTの全ユーザーに拡大します。新しい基盤モデルの発表ではありません。GPT-6 SolとGPT-6 Lunaは、すでに9月から有料ユーザー向けに提供されていました(本サイトでは9月22日に紹介)。今回は、日常の会話向けに調整された両モデルの10月版がChatタブに登場します。Plus、Pro、Business、Enterpriseには10月7日からGPT-6 Solが、FreeとGoには10月8日からGPT-6 Lunaが提供されます。ChatGPTではGPT-5.6 SolとGPT-5.6 Lunaを置き換えますが、CodexとChatGPT Workは引き続き9月版を使用します。OpenAIによると、これにより毎週ChatGPTを利用する12億人以上のユーザーに提供することになります。

最も目立つ新機能はIntelligent UIです。GPT-6は、テキスト、視覚資料、操作できる要素(グラフ、ボタン、フォーム、対話型の図、地図)を組み合わせて回答し、依頼に応じて貯蓄計算機、割り勘ツール、ゲームなどの小さなツールも作成できます。シンプルな文章で十分な場合、ChatGPTは文章だけで回答します。OpenAIは、この仕組みにネイティブコンポーネントのライブラリと、生成の進行に合わせてインターフェースを表示するコンパイラを使用しています。Intelligent UIは、推論強度InstantからExtra Highまで利用でき、個別の利用枠はありません。ただし、GPT-6 Pro(GPT-6 Astraを搭載)が担当する推論強度Proと、macOSおよびWindowsの旧デスクトップアプリでは利用できません。

2つ目の変更は、ChatGPTが思考中やツールの使用中にも回答を始め、その後、新たなプロンプトなしで回答を補完できるようになったことです。OpenAIの社内評価によると、ウェブ検索が必要な質問では、GPT-6 InstantはGPT-5.6 Instantより平均44 %早く回答を開始します。また、GPT-6 Extra HighはGPT-5.6 Mediumと同じ待ち時間で回答を始めながら、総合スコアではGPT-5.6 Extra Highを上回ります。

プランまたは推論強度の設定ChatGPTで使用するモデル提供時期と補足
Plus、Pro、Business、EnterpriseGPT-6 Sol (Instant, Medium, High, Extra High)10月7日から世界各地で順次提供
Free、GoGPT-6 Luna10月8日から
推論強度Pro(100ドルおよび200ドルのPro、Business、Enterprise)GPT-6 Pro、GPT-6 Astraを搭載Intelligent UIは利用不可
ChatGPT Work、CodexGPT-6 SolとGPT-6 Lunaの9月版変更なし

安全性については、同日公開されたシステムカードで、これらのバージョンはPreparedness Frameworkに基づき、サイバーセキュリティと生物学・化学の能力が「High」に分類されています。自己改善の能力はこのしきい値に達していません。GPT-5.6の安全対策を引き継ぎつつ、複数ターンにわたるものを含め、制限を回避する試み(ジェイルブレイク)への耐性が向上しています。APIでは、スナップショットchat-latestがこの新しいChatGPTモデルを指すようになり、OpenAIは本番環境でGPT-6ファミリーを使うことを推奨しています。

GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.

🇯🇵 GPT-6とIntelligent UIが、現在ChatGPTのすべてのユーザーに向けて展開されています。ChatGPTのIntelligent UIは、迅速で対話的な回答を提供し、日常の疑問をより視覚的に示し、複雑な話題を理解しやすくするとともに、作業に合った対話型ツールをその場で利用できるようにします。 — X上の@OpenAI

🔗 すべての人にGPT-6とIntelligent UIを · システムカード、10月の更新 · ChatGPTのGPT-6とその他のモデル

ChatGPTで音声ファイルを利用

10月6日 — ChatGPTが音声ファイルの添付に対応しました。会話に録音を添付すると、文字起こし、要約、内容に関する回答を得られるほか、会議、インタビュー、授業の内容を整理したノートや、フォローアップメールの下書きにすることもできます。この機能はEnterpriseを含む有料プランと有料ワークスペースに限定され、Freeプランでは「現時点では」利用できません。対応形式はWAV、MP3、OGG、FLAC、AAC、M4A、PCMで、音声のみを含むWebMとMP4にも対応します。ファイルサイズの上限は1ファイルあたり512 MBです。OpenAIは、文字起こしに誤りが含まれる可能性があること、話者の識別はまだ信頼性が低いこと、言語によって性能が異なることを注意点として挙げています。

🔗 ChatGPTのリリースノート · ChatGPTへのファイルと音声のアップロード

ChatGPT for Teens:初の利用状況データと今後登場するCollege Planner

10月7日 — OpenAIは、18歳未満と判定されたアカウントに標準で適用されるChatGPT for Teensについて、初の経過報告を発表しました。同社によると、1週間で約120万人の10代のユーザーがLearning Visualizationsを、18万人以上がStudy Modeを利用しました。平均利用時間は1日15分未満で、3時間を超えて連続利用するユーザーは2 %未満です。新機能として発表されたCollege Plannerは「まもなく」登場し、まず米国で4年制大学への進学を目指す10年生から12年生の高校生に提供されます。出願要件、締め切り、タスク、奨学金を含む学費支援の申請手続きを、1つの計画にまとめられます。OpenAIはCollege Advising Corpsも支援し、Boston Children’s HospitalのDigital Wellness Labには3年間の支援を行いますが、金額は公表していません。

🔗 10代の学習、計画、AIの未来づくりを支援


Claude Haiku 5.5、AnthropicによるとHaiku 4.5より約75 %安価

10月7日 — Opus 5.5の発表から15日、Sonnet 5.5の発表から9日を経て、AnthropicはClaude Haiku 5.5(claude-haiku-5-5)を追加し、Claude 5.5ファミリーを完成させました。このモデルは、大量に処理し、コストを抑える必要があるタスク(要約、コンテキストの圧縮、データベースクエリ、分類)、コード作業でOpus 5.5やSonnet 5.5のサブエージェントを務める役割、リアルタイムの顧客対応やブラウザ操作など速度が重要な用途を想定しています。標準速度ではAnthropicで最も速いモデルですが、Fast ModeのOpusはさらに高速です。また、推論強度の設定(標準はmedium)を備えた初のHaikuであり、コンテキストは100万トークン、出力は最大128 000トークンに対応します。

料金は2段階です。プロンプトが100 000トークン以下の場合、Haiku 5.5は入力100万トークンあたり0,10ドル、出力は0,50ドルで、Haiku 4.5より90 %安価です。このしきい値を超えると、それぞれ0,50ドルと2,50ドルになり、50 %安価です。強調されている「約75 %」の節約は、Anthropicが算出した平均値です。Haiku 4.5に送られたリクエストの90 %はしきい値を下回っており、新しいトークン分割方式(トークナイザー)では同じ文章のトークン数が約30 %増えます。

料金の種類(100万トークンあたり)Haiku 5.5、プロンプトが100 000トークン以下Haiku 5.5、100 000トークン超Haiku 4.5
入力トークン0,10 ドル0,50 ドル1 ドル
出力トークン0,50 ドル2,50 ドル5 ドル
キャッシュの読み取り0,01 ドル0,05 ドル0,10 ドル
キャッシュの書き込み0,125 ドル0,625 ドル1,25 ドル

Anthropicが公開したベンチマークでは、Haiku 4.5との差は大きく、両モデルの結果が掲載されているすべての項目でHaiku 5.5はOpenAIのGPT-6 Lunaを上回っています。一方、Sonnet 5.5には及ばず、Anthropicは複雑なエージェントによるコード作業には、引き続きSonnet 5.5とOpus 5.5を推奨しています。

評価したベンチマーク(Anthropicの数値)Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
Terminal-Bench 4.0(エージェントによるコード作業)39,2 %0,0 %16,4 %70,6 %
OSWorld 2.1、オフラインの部分集合72,4 %15,7 %48,9 %83,9 %
Humanity’s Last Exam、ツールなし45,9 %10,2 %—56,9 %
FrontierCode 1.1, Main46,4 %—42,4 %52,1 %(推論強度Xhigh)
Chartography、ツールなし46,4 %6,4 %29,1 %61,6 %

6社の顧客が先行試用の結果を報告しています。HubSpotは自社のCRM評価群で過去最高となる92,8 %を記録し、AlphaSenseは400件のクエリでHaiku 4.5の0,76に対し0,84を記録、Boxは遅延が約半分になり、スコアが11ポイント向上したとしています。Haiku 4.5からの移行には作業が必要です。ガイドには、budget_tokens、パラメータtemperature、top_p、top_k、事前入力の廃止など11の変更点が記載されており、Claude Codeの/claude-api migrateコマンドがその一部を自動化します。安全性について、Anthropicは、サイバーセキュリティの安全対策がHaiku 4.5より厳格である一方、同社のほかの最近のモデルよりは少し緩やかだと説明しています。Sonnet 5.5より多くの防御目的のタスクが許可されますが、侵入テストは引き続きブロックされます。

今回のリリースに合わせて、料金も引き下げられます。Sonnet 5.5のキャッシュ読み取り料金は、10月7日から100万トークンあたり0,20ドルから0,10ドルになり、Anthropicによると、エージェントを使うタスクの多くでモデルの利用料金が約20 %安くなります。Haiku 5.5は、Claude API、Amazon Web Services、Google Cloud、Microsoft Azure、およびClaude Codeですでに利用できます。

Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.

🇯🇵 Claude Haiku 5.5の登場です。これまでに公開した小型モデルの中で、最も安価で、最も高速で、最も高性能なモデルです。平均すると、実行コストはClaude Haiku 4.5より約75 %安くなります。 — X上の@claudeai

🔗 Claude Haiku 5.5の発表 · Haiku 5.5への移行ガイド

CursorのHaiku 5.5:CursorBenchで48,4 %

10月7日 — Cursorは、Claude Haiku 5.5の発売当日から提供を開始し、モデル設定で有効にできます。Cursorによると、短いリクエストではClaude Haiku 4.5の10分の1の料金で利用できます。Cursorが自社サイトで公開するランキングCursorBenchでは、推論強度MaxのHaiku 5.5は、タスクあたり1,12ドルで成功率48,4 %を記録し、10位に入りました。すぐ下に位置するのは推論強度HighのSonnet 5.5で、Cursorは新料金を反映するため10月7日にコストを再計算しました。推論強度MaxのOpus 5も下回っています。ただし、Haiku 5.5はより多くの処理を行います。タスクあたり平均325 934トークン、163ステップを使うのに対し、推論強度HighのSonnet 5.5は37 391トークン、41ステップです。

Cursorが評価した構成順位CursorBenchのスコアタスクあたりのコスト
Opus 5.5、推論強度Max157,8 %13,43 ドル
Haiku 5.5、推論強度Max1048,4 %1,12 ドル
Sonnet 5.5、推論強度High1147,8 %1,20 ドル
Opus 5、推論強度Max1346,6 %11,95 ドル
Haiku 5.5、推論強度Low5430,9 %0,08 ドル

🔗 XでのCursorの発表 · CursorBenchのランキング


MaxとTeamプランに毎月100〜500ドルのAPIクレジット

10月7日 — Haiku 5.5と同じ記事で発表された、Claude Platformで利用できる月次クレジットがMaxとTeamの加入者向けに提供される。展開は数日かけて行われる。このクレジットは、APIを使って独自のツール、アプリケーション、エージェントを構築するために利用できる。@ClaudeDevsによると、Haiku 5.5を含むすべてのモデルに対応し、自分のコードでもサードパーティーのツールでも使える。

対象プラン月次APIクレジット
Max 5x100ドル
Max 20x200ドル
Team、Standardシート1シートあたり20ドル
Team、Premiumシート1シートあたり100ドル
Teamチームあたりの上限500ドル、共通枠として共有
Free、Pro、Enterprise対象外

Teamでは、各シートのクレジットが共通の枠に合算される。たとえばStandardシート3つとPremiumシート2つなら、毎月260ドルになる。クレジットは、Message Batches APIを含むClaude APIのすべてのモデルに加え、ConsoleのPlayground、Claude Managed Agents、Claude Agent SDKにも適用される。Claude Codeの対話型利用(ターミナル、IDE、デスクトップアプリ、ウェブ)、プランの上限を超える追加利用、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry経由で提供されるClaudeモデルは対象外で、Claude、Claude Code、Coworkの利用上限も変わらない。

受け取るには、対象プランの契約が少なくとも7日間継続している必要があり、そのうえでclaude.aiの請求設定からClaude Consoleの組織を連携する。支払い方法を追加する必要はない。連携できる組織は1つだけで、変更できるのはサポートのみ。クレジットは請求サイクルごとに更新され、繰り越しはできず、購入したクレジットより先に消費される。使い切ると次のクレジット付与まで呼び出しが停止するが、組織がクレジットを購入済み、または自動チャージを有効にしている場合は継続でき、Claudeのサブスクリプションには請求されない。Anthropicは5月、6月15日からプログラム経由の利用向けに月次クレジットを提供すると発表していた。ヘルプページでは、新しいクレジットはその「Agent SDKクレジット」とは異なると説明し、Agent SDKクレジットは利用できないとしている。

🔗 ヘルプページ:MaxとTeamプランの月次APIクレジット · @ClaudeDevsの発表


WindowsでローカルAI:NVIDIAがRTX Spark搭載パソコンの予約受付を開始し、DGX Station for Windowsを先行公開

10月7日 — NVIDIAとMicrosoftは、サンフランシスコで開催されたWindows AI and Surfaceイベントで、ジェンスン・フアンとサティア・ナデラの対談に合わせ、6月2日のBuildで発表したWindowsパソコン向けチップRTX Sparkの商用展開を開始した。ノートパソコンの予約受付は10月7日に始まり、10月16日に発売される。ミニパソコンは11月に続く予定だ。Acer、ASUS、Dell、HP、Lenovo、Microsoft、MSI、Gigabyteが製品を準備しており、Microsoftはこのチップを搭載するSurface Laptop Ultraを披露した。NVIDIAの記事には価格の記載がない。

RTX Sparkは、Blackwell RTX GPUとGrace CPUを600 Go/sで接続し、FP4で1ペタフロップのAI演算性能と最大128 Goのユニファイドメモリを備える。NVIDIAは、クラウドにデータを送信せず、利用量の計測もなく、大規模モデルをローカルで実行できる点を強調している。サーバーと同じCUDAスタックを利用する。クリエイター向け機能(NVFP4、AV1および4:2:2のハードウェアエンコード)も備え、ゲームではDLSS 5により1440pで毎秒100フレームを超える動作を目指す。

企業向けには、同じく6月のBuildで発表したDGX Station for Windowsを先行公開した。NVIDIAはこれをWindowsエコシステム初のデスクトップAIスーパーコンピューターと位置づけている。Windowsを離れることなく、1兆パラメーター規模のモデルをローカルで実行でき、Linuxのツールも引き続きWSL経由で利用できる。発売日も価格も示されておらず、通知を受け取るための登録だけが用意されている。一方、Microsoftは、Windowsの制御下でエージェントをバックグラウンド実行する基盤Microsoft Execution Containers(MXC)を一般提供に移行する。

比較項目RTX SparkDGX Station for Windows
チップBlackwell RTX GPU(最大6 144コア)とGrace CPU(最大20コア)GB300 Grace Blackwell Ultra Desktopスーパーチップ
メモリ最大128 Go、ユニファイド748 Go、コヒーレント
FP4でのAI演算性能1ペタフロップ最大20ペタフロップ
発表された提供時期ノートパソコンは予約受付中、10月16日発売。ミニパソコンは11月先行公開、発売日と価格は未定

🔗 Windowsイベントに関するNVIDIAの記事


Windowsでローカル開発:CopilotがMAI Code 1.1 Flashへ振り分け、サンドボックスは一般提供へ、Replitはデスクトップアプリを準備

10月7日 — GitHub Copilotはまもなく、開発者のマシンで動くモデルとクラウド上のモデルを自動で選択できるようになる。Microsoft Command Lineブログに掲載されたMicrosoftとGitHubの記事によると、この振り分け機能は「月末までに」提供される予定で、現時点では利用できない。GitHubは、すでに複数のモデルにタスクを振り分けているオーケストレーターProject HydraFusionの次の段階と位置づけ、AIクレジットの節約につながると説明しているが、具体的な削減量は示していない。

Copilot CLI、GitHub Copilotアプリ、VS Codeでは、2つの使い方が予定されている。Autoモードでは、タスクの文脈とキャッシュの状態に応じて、各ターンでローカル推論とクラウド推論を選択する。開発者がローカルモデルを直接指定することもでき、Windows MLプロバイダー経由のMAI Code 1.1 Flash、またはOpenAIのAPIと互換性のあるローカルの接続先(endpoint)で公開された任意のモデルを選べる。記事では、ローカル推論を使ってもセッションがオフラインになるわけではないと改めて説明している。

デモは、RTX Sparkを搭載したSurface Laptop Ultraで動作する。Microsoft AIはこの端末で、コードに特化した混合エキスパートモデル(mixture-of-experts)であるMAI Code 1.1 Flashのローカル版を実行している。総パラメーター数は1,370億で、そのうち68億がアクティブになる。重みあたり約3.3ビットに量子化したモデルの容量は53 Goで、クラウド版より80 %小さい。コンテキストが256 000トークンの場合、メモリ使用量のピークは75.5 Goとなる。

評価したベンチマーク(10月5日のMicrosoftのテスト)MAI Code 1.1 Flashデバイス上の量子化版GPT OSS 120B(UnslothのGGUF版)
SWE-Bench Verified(500タスク)72,6 %70,80 %32,0 %
Terminal-Bench 2.1(89タスク)62,9 %66,29 %23,6 %

Microsoftは、これらのテストをWindows ARM64向けのllama.cpp実行環境で行ったと説明し、結果はデバイスや設定によって異なるとしている。最初の機能はすでにターミナルで利用できる。Copilot CLIのプレビュー版1.0.94-0以降では、/modelコマンドがローカルのOllamaインスタンスにあるモデルを検出する。確認なしに追加されることはなく、Ollamaとモデルは事前にインストールされている必要がある。候補として表示されるのは、ツール呼び出しとストリーミング(streaming)に対応するモデルだけだ。

🔗 WindowsとGitHub Copilotにローカルモデルとサンドボックス化されたツールを導入 · GitHub Copilot CLIでローカルモデルを検出

Copilotのローカルサンドボックスが一般提供へ

10月7日 — GitHub Copilotのローカルサンドボックスは、6月2日に始まった公開プレビューを終え、Copilot CLI、GitHub Copilotアプリ、Agent Hostを経由するVS Codeのセッションで一般提供となる。追加費用はかからない。Copilotが起動するツールやコマンドは、開発者または所属組織が定めたポリシーに従い、ファイル、ネットワーク、GitとGitHub CLIの認証情報、その他のシステム機能へのアクセスを制限された状態で実行される。企業は、使用するモデルにかかわらず、開発者が緩和できない設定を強制できる。実行基盤のMicrosoft eXecution Container(MXC)はWindowsチームのオープンソースライブラリで、WindowsではProcessContainer、macOSではSeatbelt、Linuxではbubblewrapを利用し、仮想マシンは使わない。制約も明記されている。組み込みのファイル操作ツールはシステムではなくCopilot自身が制御し、リモートのMCPサーバーはローカルサンドボックスの対象外となる。

🔗 GitHub Copilotのローカルサンドボックスが一般提供開始

ReplitがWindowsでアプリケーションをローカル構築

10月7日 — ReplitはMicrosoftとともに、Windows上でユーザーのコンピューターに直接アプリケーションを構築・実行するデスクトップアプリのプレビューを発表した。Replitはすでにデスクトップアプリを提供していたが、今回の新機能はローカルでの構築にある。各ビルドは、Microsoft Execution ContainersとNVIDIAのオープンソース実行環境OpenShellを基盤とする独立したサンドボックスで動く。早期アクセスには順番待ちリストへの登録が必要で、提供日や料金は示されておらず、macOS版にも言及していない。Replitは10月7日のWindowsイベントのステージで、このプレビューを披露した。

🔗 XでのReplitの発表 · プレビューの順番待ちリスト


OpenAIが社内モデルによる数学的成果の原稿722件を公開

10月6日 — OpenAIは、一般公開されていない最先端の社内モデルが生成した数学的成果を大量に一括公開した。10月6日夜に発表されたGitHubリポジトリopenai/mathには、分野別に分類された372の成果群にまとめられた722件の原稿が収録されている。主要な成果に、補足の論証、系、別の証明が付属する場合もある。

成果の大半は、同じ手順から生まれた。モデルに約4 000問を与え、成果1件あたり平均でChatGPT Proの約3時間の思考に相当する計算を行った。OpenAIは、既存の数学評価で性能が飽和したため、評価対象を未解決の研究問題に広げたと説明している。この手順によらない研究が2件ある。リーマンゼータ関数の零点を含まない領域に関する研究は、読みやすさのために人間が文章を修正した。もう1件は、ホッジ予想の特殊な場合であるCMアーベル多様体についての証明だ。

OpenAIが公表した指標発表された値
公開された原稿数722
成果群の数372
モデルに与えた問題数約4 000
成果1件あたりの平均計算量ChatGPT Proの約3時間の思考に相当
公開された推論の要約数10

すべての成果が同じ方法で検証されているわけではない。多くの証明は、コンピューターで証明を検証できる言語Leanで形式化されているが、すべてではない。OpenAIは「形式化されていない成果の一部には誤りが含まれる可能性がある」と注意を促し、速やかに修正すると約束している。新たな形式化も順次追加する予定だ。公開された10件のモデルの推論要約では、πの無理数度、マーラー予想、標数2におけるカプランスキーの直接有限性予想、自由群因子の同型性などを扱っている。

公開の準備は、Institute for Advanced Studyの数学とAIに関する独立諮問グループとともに進められた。改訂と引用の手順を定め、訂正は新しい版として公開し、履歴を保存する。OpenAIは、これらの成果を対象とするワークショップ、会議、プログラムへの資金提供も発表した。また、成果を生成したモデルを科学者が「責任ある形で」利用できるよう取り組んでいると述べているが、予定は示していない。

We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.

🇯🇵 最先端の社内モデルが生成した、幅広い新しい数学的成果を公開します。Institute for Advanced Studyの数学と人工知能に関する独立諮問グループに相談し、その助言と公開された提言を踏まえて、これらの成果の公開方法を決めました。 — Xの@OpenAI

🔗 数学におけるAIの進歩を共有する · GitHubのopenai/mathリポジトリ


Perplexityがpplx-embed-v2-lateを公開、テキストと画像に対応するマルチベクトルエンベディング

10月7日 — Perplexity Researchがpplx-embed-v2-lateを公開した。パラメーター数0.6Bと9Bの2つの遅延相互作用(late interaction)型エンベディングモデルで、Hugging Face上でMITライセンスの下で提供される。密なエンベディングが各文書を1つのベクトルに圧縮するのに対し、これらのColBERT型モデルはトークンごとに128次元のベクトルを保持し、MaxSimで各クエリと文書の組み合わせを採点する。クエリの各トークンを、文書内で最も近いトークンと照合する仕組みだ。OCRを介さずにテキスト、画像、レンダリング済みのページ(PDF、スライド、スキャン)を検索するため、表、図、レイアウトを保持できる。

2つのサイズは共通のエンベディング空間を持つ。27Bの基盤モデルから作られた社内の18B教師モデルから、トークン単位で蒸留されているためだ。このため、9Bでインデックス化したコーパスを、0.6Bでエンコードしたクエリで検索できる。ViDoRe v3の画像評価では、この構成が63,5 %を達成し、両側に0.6Bを使った場合の62,3 %を上回る。クエリ時の追加コストはない。Qwen3.5-0.8Bをプルーニングして作られた0.6Bは、端末上でも動作する軽量なクエリエンコーダーとして使える。

評価対象のベンチマーク(Perplexityによる測定)9Bのスコア0.6Bのスコア比較対象
72の専門タスク (nDCG@10)81,3 %78,0 %9Bは次点のモデルを1,6ポイント上回る
Q2D-Web、ウェブ検索 (Recall@1000)74,8 %73,6 %nemotron-embed-8b:69,3 %
ViDoRe v3の画像評価 (nDCG@10)65,2 %62,3 %9Bを上回るのはEVIEのみ
BrowseComp+(GPT-OSS-120Bエージェント)64,0 %—次点のColBERT:4,9ポイント低い
MADQA(Gemini 3.5 Flashエージェント)92,4 %90,1 %Mixedbread Agentic Search:93,4 %

9Bがすべての評価で勝っているわけではなく、Perplexityもその点を明記している。ViDoRe v3の画像評価ではTencentのEVIEが、MIRACL-Visionと社内ベンチマークPPLX-Q2Iではgemini-embedding-2が上回る。MADQAではMixedbread Agentic Searchのスコアが高いが、Perplexityはこの差が同社の信頼区間内に収まると判断している。同社は、文書が長くなるほどストレージ使用量と採点コストが増えることも認めている。技術報告書は「今年後半」に公開予定で、遅延相互作用型、密な形式、文脈型のエンベディングをAPIプラットフォームで順次提供する計画だが、日程は示されていない。

🔗 Perplexity Researchの記事 · Hugging Face上のpplx-embed-v2-late-9b


コーディングエージェント:Claude Code 2.1.293、Codex CLI 0.161.0、iOS版Cursor、Antigravity 2.21.0、Warp Factories

5つのコーディングエージェントツールが進化する。Claude CodeはHaiku 5.5を採用し、Codex CLIはターミナルからMCPサーバーに接続できるようになる。CursorはiPhoneから操作でき、Antigravityはエージェントの操作をまとめて表示し、WarpはMicrosoftのツールに対応する。

Claude Code 2.1.293、標準のHaikuモデルをHaiku 5.5に変更

10月7日 — Haiku 5.5の発表から数分後に公開されたClaude Code 2.1.293は、Anthropic APIで使う標準のHaikuモデルをHaiku 5.5に変更した。カスタムサブエージェントを区別するため、subagentStatusLineのペイロードにagentTypeフィールドを追加し、modsが宣言したツールのスキーマを最初から公開するisDeferredオプションも加えた。主な内容は、全56項目のうち38項目を占める修正だ。Claudeがコンテキスト圧縮前の最後の操作を圧縮後に行ったものと誤認し、完了済みの作業を取り消したり、やり直したりすることがあった。パスに適用範囲を限定したルールや、階層内のCLAUDE.mdも、ClaudeがBashでcatまたはgrepを使ってファイルを読む際に読み込まれるようになる。MCPのHTTP接続によるメモリリークも解消された。最近の2つの変更(2.1.281の自動モードの拒否メッセージと、2.1.290のクラウドセッションに関する修正)は取り消され、Claude Tagのチャネルルールの上限は20から50に引き上げられた。

🔗 GitHub上のClaude Code 2.1.293

Codex CLI 0.161.0、Daybreakをオプションで有効化する方式に変更

10月7日 — Codex CLI 0.161.0は、10月5日の0.160.1以来となる最初の安定版だ。/mcp login <name>コマンドにより、現在のターミナルセッションを離れずにMCPサーバーに接続できるようになる。音声会話では、マイク、スピーカー、入力チャネルを選択できる。OpenAIのサイバー分野の製品群Daybreakは、オプションで有効化する方式に変わる。ユーザーが--enable cli_daybreak(またはfeatures.cli_daybreak=true)で有効にするまで、/daybreakの切り替えとステータス行のDaybreak状態表示は非表示となり、有効にしない場合はCyberへの自動ルーティングも省略される。codex exec --cyber-access-programでは、1ターンに限ってCyberのアクセスプログラムを選択できる。Amazon Bedrockでは、対応モデルでマルチエージェントV2と推論量Ultraが利用可能になり、Bedrock MantleがAWS GovCloudリージョンに対応する。修正は、権限、会話の再開、破損したSQLiteデータベースの検出に関するものだ。

🔗 GitHub上のCodex CLI 0.161.0

Cursor、iOSからコンピューター上のエージェントを操作

10月6日 — CursorのiOSアプリに、コンピューター上でローカル実行されているエージェントが表示されるようになった。各エージェントの作業内容を確認して応答でき、発表の投稿では新しいタスクの開始にも言及している。エージェントはコンピューター上に留まり、アプリがそこへ接続する。そのため、コンピューターの電源を入れたままオンラインにしておく必要がある。「このコンピューターをスリープさせない」設定を使うと、電源に接続して画面を開いている間、スリープを防げる。この機能は標準で有効だが、Enterprise組織では管理者が有効にする必要がある。ペアリングはデスクトップアプリで承認し、クラウドエージェントは必要ない。6月末に公開されたiOSアプリはクラウドエージェントを前面に打ち出していたが、今度はローカルエージェントにもスマートフォンからアクセスできるようになった。

🔗 Cursorの変更履歴

Antigravity 2.21.0、エージェントの操作をまとめて表示

10月6日 — GoogleのAntigravityアプリがバージョン2.21.0となり、9件の改善と14件の修正が加わった。高度な検索では、⌘+K(WindowsではCtrl+K)で会話の内容から目的の会話を探せる。スケジュールされたタスクのタブ(スケジュールされたタスク)は「自動化」に変わる。「今すぐ実行」で自動化を直ちに実行したり、「プロンプトで作成」でエージェントに新しい自動化の作成を案内してもらったりできる。エージェントが2つの応答の間に行うファイルの変更、ターミナルコマンド、読み取りは、短い要約を添えた1つの折りたたみ可能な行にまとめられる。修正対象には、エージェントが途中で切れたMP4またはMOV動画を読むと、その後の会話全体が失敗する問題や、Windowsのメモ帳またはPowerShellで保存した設定ファイルが機能しなくなる問題が含まれる。変更履歴では、各バージョンが全ユーザーに届くまで数日かかる場合があると案内している。

🔗 Antigravityの変更履歴

Warp Factories、Microsoft TeamsとAzure DevOpsに対応

10月7日 — Warpが、ソフトウェアファクトリー(software factories)プラットフォームのWarp FactoriesをMicrosoft TeamsとAzure DevOps Servicesに対応させた。Teamsでは、設定済みのチャネルやスレッドでWarpアプリにメンションすると、会話の文脈とともにタスクがファクトリーへ渡される。ファクトリーは同じスレッドで進捗を報告し、レビュー用のプルリクエストもそこへ返す。Azure DevOpsでは、作業項目(work item)やプルリクエストからファクトリーにメンションしたり、それらのイベントで実行を開始したりできる。各ファクトリーにはGit操作用の専用IDが与えられ、アクセスは選択したリポジトリに限定される。両方の連携機能は、Warp Factoriesのすべての顧客が利用できる。Warpは、この2つへのネイティブ対応を業界初として紹介している。一方、DevinはすでにTeamsとAzure DevOps Serverに連携していた。

🔗 Warpの記事


APIとプラットフォーム:Claude SDKのcomputer useとbrowser useのツールセット、Microsoft FoundryのGrok 4.7

ホスト型モデルを使って開発する開発者向けに、2つの発表があった。Anthropicはコンピューターやブラウザーの操作を簡素化し、Grok 4.7はMicrosoftで一般提供となる。

Claude SDKのcomputer useとbrowser useのツールセット

10月7日 — ClaudeのPythonとTypeScriptのSDKに、computer useとbrowser useのツールセット(toolsets)がベータ版として組み込まれた。これまでは、APIがClaudeのクリックや入力の意図を示し、各操作をコマンドへ変換するループを自分で書く必要があった。今後はSDKがこのループを処理する。開発者がBetaAbstractBrowserToolset20260801またはBetaAbstractComputerToolset20260801のサブクラスを作成し、操作ごとにメソッドを書くと、SDKが呼び出しを振り分け、指定されたURLとファイルのポリシーを適用し、承認を求め、モデルに返す結果を組み立てる。Anthropicは、すぐに使えるブラウザーやドライバーを提供しない。自前の自動化や、Browser Use、Browserbase、E2B、Daytonaのドライバーを接続する方式で、Chrome DevTools Protocolを使う最小構成の例がclaude-quickstartsリポジトリで公開されている。JavaScriptの実行とファイルの送信は標準で無効であり、URLポリシーを指定しなければ、どのアドレスも検証されない。

🔗 X上の@ClaudeDevsのスレッド · SDKツールセットのドキュメント

Grok 4.7、Microsoft Foundryで一般提供

10月7日 — 9月21日に公開されたSpaceXAIのモデルGrok 4.7がMicrosoft Foundryで利用可能になったと、@SpaceXAIが夜間に発表した。Microsoftのドキュメントでは、Azureが直接販売するモデルの中で一般提供に分類されている。テキストと画像の入力、入力と出力を合わせて500,000トークンのコンテキスト、ツール呼び出し、Chat CompletionsまたはResponses APIによるアクセスに対応し、推論量はlowからxhighまで、標準はhighとなる。Microsoftは、Grok 4.7以降のGrokモデルを少なくとも6か月間、一般提供することを約束している。Grok 4.6は引き続きプレビューとして掲載されている。10月7日夜の時点では、Azureの料金ページにGrok 4.7はまだ掲載されていなかった。Amazon Bedrock(9月28日)とGoogle Cloudのプレビュー提供(10月1日)に続き、Grok 4.7は3大クラウド事業者すべてで提供されることになる。

🔗 Microsoft FoundryでのGrokモデルのデプロイと使用


オープンモデル:Liquid AIのOpen d1、Natureに掲載されたAi2のBolmoとBwen 8B、Blama 8B

重みを公開する2つの発表があった。一方はネットワークのエッジで素早く判断するためのモデル、もう一方はテキストをバイト単位で読むモデルだ。

Open d1、Liquid AIのオープンな意思決定モデル

10月7日 — Liquid AIがOpen d1として意思決定モデル群を公開した。重みを公開する2つのモデルは、d1-3B(テキストと画像)とd1-omni-600M(テキストに画像または音声を組み合わせる)で、後者は初期の研究版となる。これらはテキストを生成せず、1回の処理で、許可された各回答に確率を割り当てる。Liquid AIによると、d1-3BはDecision Index 0.2.1で48,57を獲得し、100億パラメーター未満で最高のスコアを記録した。Decider 35B-A3B(47,11)を上回り、7つの公開データセットでの平均は82,9となる。NVIDIAと共同で測定した1問あたりのレイテンシーは、RTX 4090で8 ms、Jetson Orin Nanoで50 msであり、ネットワークのエッジ(edge)での利用を狙える。画像や音声のベンチマークは公開されていない。重みはLiquid AI独自のライセンス(lfm1.0)でHugging Face上に公開され、GGUF版も用意されている。9月29日のd1はAPI経由でしか利用できなかった。

🔗 Hugging Face上のLiquid AIの記事

Ai2のBolmoがNatureに掲載、Bwen 8BとBlama 8Bも紹介

10月7日 — Ai2が、サブワードではなくバイトを直接読む完全にオープンなモデル群Bolmoの手法をNatureで発表し、10月7日にオンライン公開された。バイトを読むことで、固定語彙の弱点(綴り、珍しい文字列、一部の文字体系)を避けられるが、これまではゼロからの全面的な学習が必要だった。これに対し、バイト化(byteifying)は、すでに高性能なサブワードモデルを出発点とし、短期間の追加学習で変換する。Olmoから作られたBolmo 1Bと7Bは12月に公開されたものだ。Ai2はさらに、8月26日からリポジトリが存在するBwen 8B(Qwen 3 8Bを基に作成、Apache-2.0ライセンス)とBlama 8B(Llama 3 8Bを基に作成、llama3ライセンス)、および新しいバイト処理層だけを学習する「Stage 1」のチェックポイントを紹介している。Ai2によると、2つのモデルはそれぞれ元のモデルに近い性能を示し、Bwen 8BはBolmo 7Bを上回るが、数値は公開されていない。

🔗 Ai2の記事


SynthID Detectorを一般公開、画像・動画・音声を検証可能に

10月7日 — Googleが、AI生成コンテンツ内の目に見えないSynthIDウォーターマークを検出するツール、SynthID Detectorを誰でも利用できるようにした。昨年、メディア関係者向けの初期版として発表されたツールで、synthid.comから世界中で英語で利用できる。画像、動画、音声ファイルをアップロードして使う。検証対象はGoogleと提携先のOpenAI、NVIDIA、Kakaoのコンテンツで、Appleも近く加わる。ポータルは、汎用的なAI検出ツールではないと注意を促している。SynthIDを使わないモデルで生成されたコンテンツや、大幅に編集されたコンテンツは「未検出」と判定されることがある。Googleによると、2023年以降にウォーターマークを付与した画像と動画は1800億件超、音声は240,000年分に達する。7月に発表した1000億件、60,000年分から増加し、Search、Geminiアプリ、Chromeでの検証は1日100万回を超える。

🔗 Google、AIコンテンツ向けSynthID Detectorの提供を拡大


セキュリティ:漏洩したシークレットを検出するGitHubの分類器

10月7日 — GitHubが、Microsoft Applied Sciencesと共同開発した、漏洩シークレットの検出に特化したファインチューニング済みModernBERT分類器を稼働させた。値の周囲のコードを読み、認証情報らしい値を見つける。識別可能な形式を持たないパスワードも対象だ。候補のバッチを2 ms未満で評価し、GitHubによると、プッシュ時にブロックできるシークレットを「2倍以上」に増やせる可能性がある。AIで検出したパスワードのアラートは、追加料金なしで直ちにこのモデルへ切り替わる。非公開プレビュー中のAIによるプッシュ保護は、対象となる組織向けに「今月後半」に提供予定だ。Copilotの/security-reviewコマンドによるチェックも「まもなく」非公開プレビューに入り、どちらもAIクレジットを使用する。GitHubのセキュリティ製品責任者Erin Havensの記事は、プルリクエストの3件に1件にAIエージェントが関与していること、そしてプッシュ保護が阻止できているのは、新たに検出されるシークレットの約30 %にとどまることを指摘している。

🔗 シークレット保護はソフトウェアの拡大に対応する必要がある


インフラ:GitHubがエージェントの活動に向けてGitを再構築

10月6日 — GitHubは、エージェントによる開発のペースに対応するため、Gitインフラを再構築しています。ブライアン・セレンザのエンジニアリング記事によると、Gitの総活動量は2025年9月から2026年8月にかけて、月間2182億イベントから4733億イベントに増加しました。2026年9月には開発者とエージェントが73億8000万件のコミットを作成し、1年前の5倍以上に達しました。プッシュも4.9倍に増えています。現在のアーキテクチャであるSpokesは、各リポジトリを複数のサーバーに複製し、更新のたびに多数決で承認します。そのため、読み取り用のコピーを増やすと書き込みが遅くなります。新しいアーキテクチャはストレージと計算を分離し、正本データをAzure Blob Storageに置き、軽量なプロセス(workers)がキャッシュから読み取り要求に応えます。GitHubの社内ベンチマークでは、書き込みスループットが最大35倍になっていますが、切り替え時期は示されていません。

🔗 エージェント規模の開発に向けたGitインフラの構築


音声AI:ElevenLabsがインドの州政府と覚書を締結

10月7日 — ElevenLabsは、ベンガルールで開催したサミットで、音声AIの試験導入に向け、インドの州政府との初の覚書(MOU)を締結しました。同社は州名を明かしておらず、日程、対象範囲、金額も示していません。発表はツイート1件のみで、ブログ記事はありません。併記された数字から、その狙いが見えてきます。過去1年間にElevenAgentsがインドで行った会話は1億件以上に上り、その70 %以上がヒンディー語、カンナダ語、タミル語、テルグ語でした。サミットには、企業幹部、開発者、パートナーが500人以上参加しました。

🔗 Xでの@ElevenLabsの発表


研究:エージェントの決定的なミスから立て直すNVIDIAの手法、PivotOPD

10月7日 — NVIDIAの研究者は、複数ターンにわたって行動するエージェント向けの学習手法、PivotOPDを発表しました。研究者らの分析では、ALFWorldで3つのQwen3モデルが失敗した事例の59 %に、早い段階で起き、その後エージェントが誤った方向に進み続ける原因となる「分岐点となるミス」が含まれていました。PivotOPDは、オンポリシー蒸留(on-policy distillation)を拡張したものです。分岐点となるミスが起きるたびに、教師モデルが正しい行動を示し、続くターンでの立て直しの行動も示すことで、生徒モデルはミスの回避とミスからの回復を学びます。13の比較手法に対し、1.7Bと8BのQwen3生徒モデルで、ALFWorld、WebShop、Search-based QAの平均スコアが最高となりました。また、再実行した72件の分岐点となるミスの72.7 %から回復し、通常の蒸留の20.3 %を上回りました。この改善はコーディングにも波及し、Nemotron-3.5の生徒モデルはSWE-Bench Verifiedで62.8 %から66.0 %に向上しました。論文はarXivに掲載されており、コードは近日公開予定です。

🔗 PivotOPDのプロジェクトページ


最適化:mPDLPがcuOptで巨大な線形計画問題を複数のGPUに分散

10月7日 — NVIDIAは、オープンソースの最適化ライブラリcuOptに、NVLinkで接続した複数のGPUに処理を分散する線形計画ソルバーmPDLPを追加しました。サプライチェーンや電力網など、大規模な計画問題を対象としています。相互に依存する変数と制約を同じGPUにまとめることで通信を抑え、GPU当たりのピークメモリ使用量を最大で6分の1に減らします。DGX B200の1ノードでは、PDLP計算が最大11.4倍、処理全体が最大4.2倍に高速化しました。D-PDLPとの比較では、大規模問題の大半でmPDLPが1.2〜2.5倍高速でしたが、最大規模の3つの問題事例と小規模問題では遅くなりました。Kinaxisは8基のH100で、1億3500万以上の変数を持つサプライチェーンを3.3倍高速に解き、PSRは8基のB200で、1億8500万変数のエネルギーモデルを5倍以上高速に解いています。

🔗 mPDLPに関するNVIDIAの記事


ロボティクス:ロボットがGB300のテストトレイを組み立てる

10月7日 — NVIDIAのSeattle Robotics Labは、出荷前にモジュールを検査するGB300のテストトレイを、ロボットに組み立てさせる取り組みを紹介しています。これらのシステムを製造するFoxconnとともに、2つの動作を対象に選びました。バスバーを設置して16か所でねじ留めする動作と、柔軟なケーブルに取り付けられた4つのコネクターを接続する動作です。Foxconnと定めた要件は、衝突なしで99.5 %の成功率を達成し、所要時間を熟練作業者の2倍以内に収めることです。ロボットはその水準に近づいていますが、まだ達していません。バスバーでは160秒で95 %超の成功率となり、目標の124秒には届きませんでした。コネクターではケーブル1本当たり40秒で、成功率は90〜95 %でした。チームは、従来型の認識・制御パイプライン、姿勢推定のDOPER、Isaac Labでの強化学習を組み合わせ、実機で補正しています。NVIDIAはDOPERとオーケストレーターTALOSの公開を約束していますが、時期は示していません。

🔗 GB300のトレイに関するNVIDIA技術ブログの記事


短報

  • ChatGPTのiOSアプリ1.2026.272 — 回答内にページのプレビューを直接表示し、Codexタスクのリンクをアプリ内で開きます。Codex Mobileでは、承認の選択画面を刷新し、長いスレッドのストリーミングを高速化しています。🔗 出典
  • Radisson Hotel Group — OpenAIの導入事例によると、Accenture Songと6週間で構築した同社のChatGPTプラグインは、2026年7〜8月に自然検索の約1.5倍のコンバージョン率を達成しました。また、ChatGPT内の広告キャンペーンで発生した支払い・予約イベントの54 %は、広告の表示だけに起因するとされています。🔗 出典
  • Jump Trading — このクオンツ取引会社は、多数のデータソースを突き合わせながら数日間にわたって実行されることもある分析をGPT-6 Astraのエージェントに任せ、最後に人が確認しています。OpenAIの導入事例には、改善効果の数値は示されていません。🔗 出典
  • ChatGPTのプラグイン拡張機能 — OpenAI Developersは、動画チュートリアルのスレッドで、tldrawとMagicPathに加え、Adobe、Canva、Figma、Shopify、Instacart、Atlassianを利用企業として挙げています。9月29日に発表されたこれらの拡張機能は、サイドバーからプラグインを起動し、@メンションに対応し、ファイルビューアーを追加します。🔗 出典
  • EveryとClaude Managed Agents — Everyのチームは、新しいモデルが登場するたびに各自のスキルを共有するため、全員がSlackで使う社内エージェントをClaude Managed Agents上に構築し、その後、購読者にも公開しました。Anthropicは動画インタビューを紹介していますが、数値は示していません。🔗 出典
  • Zed 1.23とプレビュー版1.24.1 — 1.23は、JSONLとNDJSONファイルのプレビュー機能を備えて安定版になりました。プレビュー版1.24.1では、ターミナルのタブをAgent Panelにドラッグでき、ツール、画像、思考に対応したカスタムのAmazon Bedrockモデルを利用でき、Gitタグを作成できます。また、Linuxのバイナリサイズを約23 %削減しています。🔗 出典
  • AmpのメタエージェントPuck — 複数の独立した会話に対応しました。+ボタンで新しい会話を開き、名前をクリックして会話を切り替えられます。3日間使われていない会話は別に整理されます。🔗 出典
  • Copilot CLI 1.0.93 — 安定版となり、セッションを再起動せずに、ターンの間でMCPサーバーの設定変更を反映します。また、/sandboxと—sandboxによるコマンドのサンドボックスを全ユーザーに開放しました。Copilot SDK 1.0.17も安定版になっています。🔗 出典
  • Copilotの使用状況指標 — 複数のIDEがCopilot SDK経由でセッションを処理するようになって以降、エージェントの活動が過少集計されていました。修正には更新が必要です。VS Code 1.139.0はすでに提供され、Visual Studio 18.12は10月、JetBrainsは10月末、EclipseとXcodeは11月までに対応予定です。失われたデータは復元されません。🔗 出典
  • Gemini CLI v0.65.0-nightly.20261007 — このナイトリー版は0.65.0系列の最初のリリースで、5件の修正を含み、そのうち2件はデータ損失への対策です。gemini mcp addが.gemini/settings.jsonを空にする可能性のあった信頼されていないフォルダーでは、プロジェクト設定が読み取り専用になります。また、再開したセッションをすぐに終了しても、その履歴が削除されなくなりました。🔗 出典
  • Transformers.js 4.3.1 — EmbeddingGemma 2の公開翌日、このライブラリは同モデルのマルチモーダル埋め込み(7億4000万パラメーター、768次元)を、WebGPUまたはWASMを使ってブラウザー内で直接、あるいはNode.js上で計算できるようになりました。🔗 出典
  • RL Environment Explorer — Hugging Faceのアディティヤ・S・Kが、FineEnvsのこのSpaceを紹介しました。Hub上の強化学習環境(OpenEnv、Harbor、MiMo、Verifiers、NeMo Gym)を閲覧、可視化、実行できます。タスクの登録数は1200万件以上で、その大半は少数の大規模なOpenEnv環境に由来します。🔗 出典
  • Seb-9B — スタス・ヴェレテンニコフが、Apache-2.0ライセンスのローカル意思決定モデルを公開しました。テキスト、JSON、画像を入力でき、選択肢は最大20個です。17の公開評価スイートで平均0.792を達成し、Jev 1.13の0.786を上回りました。測定はすべて作者自身が実施しており、学習データには評価ベンチマークの1つの学習部分が含まれていたものの、テスト事例は含まれていなかったと明記しています。🔗 出典
  • 2026年の国際オリンピアードでのNemotron — NVIDIAは、非公式参加でのIOI 2026の535.4点/600点と、金メダル基準が29点だったIMO 2026の30点/42点を支えた共通手法を詳しく説明しました。教師ありファインチューニング、強化学習、生成・検証・修正を繰り返すループを組み合わせています。また、200問を収録したベンチマークNemotron-IMO-Benchを公開しました。🔗 出典
  • Instadocs: AI Gone Wild — Netflixは、7月にHugging Faceが受けたサイバー攻撃を再現するこのドキュメンタリーを10月12日に公開すると発表しました。Netflixによると、攻撃はOpenAIの研究者が作成した自律エージェントによって行われました。🔗 出典
  • ChatGPTのアプリディレクトリにRunwayが登場 — プラグインをインストールし、Runwayアカウントを接続すると、会話内の@Runwayメンションで画像や動画の生成を依頼できます。Runwayは料金や消費クレジット数を示していません。🔗 出典
  • LumaのFace Swap — 既存のショット内の人物の顔を置き換え、最初から作り直さずに試行を重ねられる機能です。発表はツイート2件のみで、製品ページ、料金、モデルの詳細はありません。🔗 出典
  • DSX Air — NVIDIAは、このデジタルツイン上でAI工場の変更をテストする方法を紹介しています。エージェントが変更を適用し、設定、安全性、分離状態を検証して報告書を作成します。本番環境への反映には引き続き人による承認が必要です。手法を紹介する記事で、数値はありません。🔗 出典
  • cuPhoton — NVIDIAのチュートリアルでは、このオープンソースのツールキットをGPU上での天体画像解析に適用し、FITSファイルの読み込みから候補の確認までを扱っています。最大14,900倍という改善は一部の操作に関するもので、処理全体の高速化ではありません。🔗 出典
  • CosmosとSynthID — build.nvidia.com上のNVIDIA Cosmosモデルが生成したコンテンツにはSynthIDの透かしが埋め込まれており、Googleが公開した検出ツールを使って誰でも確認できるようになりました。🔗 出典
  • SpaceXAIのTypeScript SDK 0.2.3 — priorityと切り替えて使えるサービスレベルfastと、リリースノートに記載のない軽量動画モデルの識別子grok-imagine-video-1.5-liteを追加しました。モデル一覧ページのデータによると、このモデルは音声入力に対応せず、480pでの1秒当たりの料金はgrok-imagine-video-1.5の4分の1です。🔗 出典
  • RAGとLLMのガイド — Perplexityは、RAGとLLMを相互補完的なものとして説明し、RAGを3種類(単純型、モジュール型、高度型)に分け、LLMだけで十分な場合を示す学習ガイドを公開しました。新しい機能や数値はありません。🔗 出典

これが意味すること

小型モデルが大衆向けの主力製品になりつつあります。10月8日からChatGPTの無料ユーザーへの回答を担うのはGPT-6 Lunaです。Anthropicは、プロンプトが10万トークン未満の場合、Haiku 5.5の入力100万トークン当たりの料金を0.10ドルに設定し、Sonnet 5.5のキャッシュ読み取り料金も半額にします。日常の会話、サブエージェント、要約、コンテキスト圧縮など、処理量の大部分をこれらのモデルが担います。ただし、Cursorのランキングは、トークン単価だけではすべてを判断できないことを示しています。思考の強度をMaxにしたHaiku 5.5は、HighにしたSonnet 5.5の約9倍のトークンをタスクごとに消費し、タスク当たりの費用はわずかに低いだけです(1.12ドル対1.20ドル)。一方、MaxとTeamプランの月次APIクレジットは、契約者が自分のコードでこれらのモデルを試すきっかけになります。

AIは手元のコンピューターにも戻ってきています。RTX Sparkのノートパソコンは10月16日に登場し、DGX Station for Windowsはデスク上で最大20ペタフロップスを実現するとしています。Copilotは月末までに、一部のタスクをローカルで動くMAI Code 1.1 Flashに自ら任せる予定です。Replitも、ユーザーのマシン上でアプリケーションをビルドするようになりました。個人のコンピューターでコードを実行するエージェントにはセキュリティ上の課題があり、共通の構成要素が各所に登場しています。Windowsで一般提供されているMicrosoft Execution Containers(MXC)は、CopilotのコマンドとReplitのビルドの両方を隔離します。GitHubも、漏えいしたシークレットを検出する専用の分類器を導入し、Gitインフラを再構築しています。すでにプルリクエストの3件に1件にエージェントが関与し、コミット数が1年で5倍以上に増えたためです。

回答そのものもインターフェースになりつつあります。Intelligent UIにより、ChatGPTはグラフ、フォーム、その場で作る小さなツールで回答し、思考を終える前から応答を始めます。開発者向けでは、ClaudeのSDKがcomputer useとbrowser useのループに対応し、Cursorではコンピューター上で作業するエージェントの進行をiPhoneから確認し、返答できるようになりました。この3つの事例では、テキストはやり取りの一部にすぎません。AIが表示し、クリックし、報告し、ユーザーが監督します。

最後に、今日の数字の多くは、それを公表する当事者が測定したものです。Haiku 5.5のベンチマークはAnthropic、MAI Code 1.1 FlashのベンチマークはMicrosoft、Q2D-Webはそれを設計したPerplexity、Open d1のスコアはLiquid AI、書き込みスループット35倍という数字はGitHubの社内テストによるものです。OpenAI自身も、722本の原稿に含まれる形式化されていない結果には誤りがあり得ると注意を促しており、GPT-6の速度向上も社内評価に基づいています。こうした測定値は製品同士の位置関係を把握するうえで役立ちます。ツールの開発企業が他社のモデルを測定するCursorBenchのランキングのような外部評価によって、結果を照合できるようになるでしょう。


出典