検索

OpenAIが欧州連合でChatGPTとCodexのテキストに透かしを導入、Devinはセッション間で記憶を保持、GitHubがReviewBenchを公開

ai-powered-markdown-translator

gpt-6.1-solを使用してフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

OpenAIは今後数週間以内に、欧州連合の利用者向けにChatGPTとCodexのテキストへ不可視の透かしを追加する。生成されたテキストを機械で識別可能にするよう義務づけるAI Actへの対応であり、世界中のAPI利用者には本日からこの透かしを任意で利用できるようにする。エージェントの分野では、記憶の導入が進んでいる。CognitionはDevinにセッション間で持続するメモリを搭載し、その形式をオープン標準として公開。Cohereはセッションをまたいでコンテキストを保持するメモリを備えたNorth 2を発表した。GitHubはAIによるコードレビューのオープンなベンチマーク、ReviewBenchを公開した。オープンモデルの分野では、Reflection AIが5,010億パラメータのBeamを発表し、重みは10月中に後日公開するとしている。


OpenAIの不可視の透かし:欧州連合でChatGPTとCodexのテキストに付与、APIでは世界中で任意に利用可能

10月5日 — OpenAIは、テキストの来歴に関する欧州の規則への対応を公表した。AI Actは、生成AIの提供者に対し、生成するテキストを機械可読な形で識別可能にするよう義務づけている。OpenAIは段階的に対応する一方、現在のテキスト透かし技術には大きな制約があることを最初から明示している(大きな制約)。

対象者変更内容発表された日程
欧州連合のChatGPTおよびCodex利用者、すべてのプラン対象となるテキストに不可視の透かしを追加今後数週間以内
世界中のAPI利用者名称未公表の一部モデルで透かしを任意に有効化可能(オプトイン)、初期設定では無効10月5日から
承認された研究者および専門機関申請に基づき、個別に検出器へのアクセスを提供10月5日に申請受付開始

OpenAIはこれを世界共通の初期設定にはせず、クラウド事業者と協力して、各社が提供するOpenAIモデルでも今後数週間以内に同じ透かしを利用できるようにする。技術の名称はtextGrainで、モデルの単語選択に不可視の統計的な信号を加える。目に見える印や特殊文字は使わない。OpenAIによると、テキスト用SynthIDを含む、試験した他の手法と同等以上の性能を示すという。技術報告書は公開されており、OpenAIはコードの公開も予定している。一方、透かしの見逃しや誤検出のリスクがあるため、検出器は提供開始時点では一般公開されない。アクセスの提供は欧州委員会の実践規範(実践規範)に従う。

公開された数値からは、主に検出の限界が見えてくる。

測定条件公表された検出率
200 tokensの文章、心理学系の内容、目標誤検出率1 %約80 %
400 tokensの文章、心理学系の内容、目標誤検出率1 %約95 %
数学系の内容、同じ1 %のしきい値大幅に低い(数値はグラフ内のみで提示)
英語の400 tokensの文章(ELI5データセット)、編集なし約92 %
同じ文章で、単語の10 %を同義語に置換66 %
同じ文章で、単語の25 %を置換17 %

Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.

🇯🇵 透かしには限界があります。特に短い文章では、検出できないことがよくあります。文章を書き直したり翻訳したりすると、透かしが完全に消える場合があります。 — Xの@OpenAI

品質については、OpenAIはGPT-6 Astraの8つのベンチマークで、透かしの有無による有意な差を確認していない(GPQA Diamondでは94,44 %と93,94 %、Terminal-Bench 4.0では53,90 %と56,06 %)。記事では、透かしから分からないことも明示している。人間が担った作業の割合、テキストの所有権や責任、利用者の身元、内容の正確さは分からない。また、透かしがないことは、人間が書いた証拠にはならない。画像と音声については変更はない。openai.com/verifyとContent Provenance APIは引き続き組織向けに提供され、生成画像では5月19日からC2PAメタデータに加えてSynthIDも付与されている。

🔗 欧州連合におけるテキストの来歴に関するOpenAIの記事


コードエージェント:セッション間で記憶を保持するDevin、Cursor、Qwen Code、Together Link、IBM Bob

10月5日 — CognitionはDevinに、連動する2つの機能を導入した。セッションをまたいで持続するメモリのMemoryと、それを毎日整理し直す「夢」のDreamingだ。Memoryは、エージェントが各利用者と作業する中で学んだことを保持する。利用者の好み、修正内容、プロジェクトや作業手順から得た教訓などが対象となる。これはセッションの要約ではなく、短いメモの集まりであり、それぞれが教訓を学んだセッションに紐づいている。このメモリは個人用のままで、組織全体で共有される指示にはならない。

メモはMemory Driveに保存される。これは、リポジトリ、プロジェクト、テーマごとに分類されたMarkdownファイルを保持する永続的なGitリポジトリだ。意図的に短くしたMEMORY.mdファイルに、全般的な好みと他のメモの索引をまとめる。Devinは各セッションの開始時にこのファイルを受け取り、コードを探索するためのツールで必要なメモを探すため、アーカイブ全体をプロンプトに読み込む必要はない。各セッションはそれぞれ独自のGitコピーで作業する。Devinは他のセッションの更新をマージし、リビジョンの確認によって古い状態に基づく書き込みを拒否する。競合は黙って上書きされず、通知される。

Dreamingは毎日実行されるバックグラウンドセッションだ(Cognitionの投稿では夜間と明記)。Devinは自分のメモリを踏まえて過去の会話を読み返し、重複するメモを統合し、一時的な詳細を削除し、まだ記録されていない教訓を探し、どのセッションでも使われなかった記憶を削除する。devin.aiのCustomize → Memoryメニューから利用できる。記事ではDevin DesktopやDevin CLIには触れておらず、料金も発表していない。

Cognitionはこの形式を、MITライセンスのオープン標準Agent Memory Repoとしても公開した。貢献を受け付ける仕様には、各セッションの処理の流れ(メモリをクローンし、検索し、人間の介入なしに更新し、変更のたびにプッシュする)と、同一セッション内で複数のメモリを組み合わせる方法が記されている。各メモリは、それぞれ独自の権限と履歴を持つリポジトリに置かれる。挙げられた用途には、チームのメモリやエージェントの群れ(エージェントの群れ)がある。

In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)

🇯🇵 初期の実験では、私たちが頼んでもいないのに、Devinの群れがメモリを使って大規模に連携する様子が見られました(誰もハッキングしていないことはお約束します)。 — Xの@cognition

エージェントのメモリを整理し直す「夢」は、Anthropic(5月のClaude Managed Agents)やOpenAI(6月のChatGPTのメモリ)にもすでにあった。今回の違いは、Gitでバージョン管理されるファイルとしてメモリを保存し、他のエージェントも採用できる仕様として公開した点にある。

🔗 記憶と夢に関するCognitionの記事 🔗 Agent Memory Repoの仕様

Cursor:SDKのエージェントに実行中の指示を送る

10月5日 — Cursorは、TypeScriptやPythonのコードからエージェントを起動するためのSDKを拡張した。run.steer()メソッドは、エージェントの進行中のターンにメッセージを挿入する。その時点でサブエージェントが作業していれば、バックグラウンドに移って処理を続ける。バックグラウンドのサブエージェントも結果を報告する。親のターンが終わった時点で結果が失われるのではなく、同じ実行の追加ターンとして親エージェントに返される。

SDKの新機能変更履歴に記載された対象範囲
run.steer()、実行中の制御TypeScriptのローカルエージェント。クラウドエージェントでは、メッセージは通常の追加リクエストとして送信される
バックグラウンドのサブエージェントからの結果返却TypeScriptおよびPythonのローカルエージェント
カスタムツールのMCPアノテーション(readOnlyHint、destructiveHintなど)TypeScript。単なるヒントであり、SDKが遵守を強制するものではない
システムプロンプトの置換が可能、ルールとスキルは引き続き読み込まれるTypeScriptのローカルエージェント。アクセスはアカウントごとに有効化

これらの変更に伴う料金は発表されていない。

🔗 XのCursorの投稿スレッド 🔗 Cursor SDKの変更履歴

Qwen Code v0.25.0:ワークスペースエージェント、メールチャネル、Mem0メモリ

10月5日 — Qwenは、コマンドラインのプログラミングエージェントQwen Codeのv0.25.0を公開した。9月29日のv0.24.7以来初の安定版で、42の機能(うち23はManaged Agent向け)、79の修正を含み、既知の破壊的変更はない。特に目立つのは、いずれも明示的に有効化する必要がある3つの追加機能だ。ワークスペースエージェントがローカルで協力できるようになった。デーモンが各エージェントのターンを開始・再開し、Web Shellからエージェントとタスクを管理でき、会話中に@agentでエージェントを呼び出せる。これらの永続エージェントは、有効期限があり取り消しも可能な共有を通じて、A2A 1.0プロトコルにも対応する。さらに、Mem0メモリをCLIに直接接続できる。エンドポイントとキーを指定するだけで、Qwen Codeが対応するMCPサーバーを自ら登録する。メールチャネルも追加され、エージェントはIMAPとSMTPを使う専用のメールボックスを持てる。Code Modeは、モデルがまとめたBash呼び出しを並列実行する。TypeScript SDK v0.1.18とDesktopアプリv0.25.0も同じ朝に公開されたが、QwenからのXへの投稿はなかった。

🔗 Qwen Code v0.25.0のリリースノート

Together Link:Claude Code、Codex、OpenCode、Piをオープンモデルで利用

10月5日 — Together AIは、インストール済みのコードエージェントを、同社プラットフォームがホストするオープンモデルで動かすTogether Linkをベータ版として公開した。インストールコマンド(macOSまたはLinux)を実行すると、アカウントのキーを使ってClaude Code、Claude Desktop、Codex、OpenCode、Piを同社のAPIに接続する。ドキュメントにはChatGPT Desktopも記載されており、コマンド、ルーティング、モデル一覧は今後も変更される可能性があると説明されている。Autoモードのほかに4つのモデルが提供され、いずれもコンテキスト長は1Mトークンだ。

提供モデルClaude Codeの/modelメニューで対応する名称
Kimi K3Opus
GLM 5.3Fable
GLM 5.3 FlashSonnet
DeepSeek V4.1 FlashHaiku

初期設定のAutoモードは、利用者がAnthropicのキーを提供すると、難しいタスクをOpus 5.5に任せられる。ただし、このルーティングの説明は記事とドキュメントで異なる。記事では、プロンプトキャッシュを維持するためセッションごとに一度だけ選択するとしているのに対し、ドキュメントでは、Claude CodeとClaude Desktopに限りリクエストごとに振り分けるとしている。Together AIは、算出方法を公開せずに費用を50 %以上削減できると発表し、各セッションの終了後に実際の費用と、Opus 5.5を使った場合の費用を並べて表示する。

🔗 Together AIの記事 🔗 Together Linkのドキュメント

セルフホスト版IBM BobはNVIDIAのNemotron 3 Ultraを採用

10月5日 — IBMは、エージェント型開発アシスタントBobのセルフホスト版(自社環境での運用)が、Poolside Laguna S 2.1とともにNVIDIAのNemotron 3 Ultraを採用した理由を説明した。前週に一般提供を開始したこのオプションは、ネットワークから隔離された環境(エアギャップ環境)を含め、顧客のインフラ上でアシスタントを動かす。チームは4つの基準(必要なハードウェア資源、コードの精度、レイテンシ、重みの公開性)でモデルを評価した。Bobのエージェント実行基盤を使ってテストし、Anthropic、OpenAI、Googleの非公開モデルを比較基準とした。当初は冗長すぎたNemotronを、NVIDIAとともに調整した。調整対象はプロンプト、サンプリングパラメータ、推論設定、実行基盤の修正だ。IBMの社内テストによると、Blackwell GPU上のNemotron 3 Ultraは、ネットワーク経由で呼び出す最先端のSaaSモデルに比べ、レイテンシを最大で約4分の1に抑え、ツールのスキーマを厳密に遵守する。Laguna S 2.1は、性能と必要資源のバランスを理由に選ばれた。記事では精度のスコアは公開されていない。

🔗 セルフホスト版Bobに関するIBMの記事


ReviewBench:GitHubがAIコードレビュー向けのオープンベンチマークを公開

10月5日 — GitHubが、AIコードレビューエージェント向けのオープンベンチマークReviewBenchを研究段階のプレビュー版 (リサーチプレビュー) として公開した。専用サイトでは、完全なデータセット、ランキング、評価方法、判定役のプロンプトと設定、セルフサービスで利用できる実行ツールを公開している。記事の執筆者はミシェル・ジョウとアレハンドロ・カルデレラ・デ・ディエゴで、謝辞ではGitHubとMicrosoftがプロジェクトに関わったことが示されている。

コーパスは、187の公開オープンソースリポジトリから集めた、19のプログラミング言語にまたがる219件のプルリクエストで構成される。言語とリポジトリ規模の分布は、1億390万件のプルリクエストから算出したGitHubの分布を再現しており、中規模・大規模の変更を意図的に重く扱っている。正解データセット (ゴールデンセット) は、人間のレビュアー、後続のコミットから推定した問題、決定的な解析ツール、複数の最先端LLMを組み合わせて構築されている。指摘事項は判定役のLLMが検証し、記事によればClaude Sonnet 5が使われている。データセットの構築に関与していないシニアエンジニアが各指摘を再ラベル付けしたところ、判定は96.6%のケースでReviewBenchと一致した。正解データのみを対象に測定する「正解データに基づく」再現率 (グラウンデッド) が、主な比較指標となる。

GitHubの初回ランキングでは、Copilot code reviewが首位となっている:

評価対象のエージェント(設定)正解データに基づくF1正解データに基づく適合率正解データに基づく再現率実行日
Copilot Code Review (Balanced)40,1 %87,8 %26,0 %2026年10月1日
Devin AI37,0 %84,0 %23,8 %2026年9月28日
Qodo35,1 %85,3 %22,1 %2026年9月28日
Codex (GPT-5.6 Sol · Ultra)32,3 %87,0 %19,9 %2026年7月19日
Cubic27,3 %85,5 %16,3 %2026年6月29日
Greptile27,2 %86,1 %16,2 %2026年6月16日
Cursor17,3 %87,7 %9,6 %2026年9月27日

サイトによれば、これらの初回結果はReviewBenchチームが記載の日付に各社の公開製品を実行して得たもので、各社自身による実行や検証は行われていない。現在は誰でも自分のエージェントを提出できる。応募者がコンテナイメージとモデル用のキーを提供し、GitHubが判定役を提供する。25件のプルリクエストで試行した後、全件を3回実行する。スコアはメンテナーによる検証後に限って公開され、さらに、そのエージェントの従来のスコアを上回る場合か、初回の提出である場合に限られる。

GitHubは、Copilot code reviewの改善にもReviewBenchを活用している。A/Bテストでは、複数の独立した実行を組み合わせるLiteレベルのマルチモデルレビューにより、再現率が13.6%向上し、レビュー1回当たりのコストは8.0%低下した。変化の方向はオフライン評価の予測と一致した。一方、コメント数については記事内で矛盾があり、本文では+61%、グラフでは+25.0%とされている。

🔗 ReviewBenchに関するGitHubの記事 🔗 ReviewBenchのサイトとランキング


CohereがNorth 2を公開し、PwCと世界規模の提携を締結

10月5日 — Cohereが、企業向けAIエージェントプラットフォームNorthの新版、North 2を公開した。9月9日に「近日公開」と発表され、その後10月の提供が予告されていた。公開時のスレッドでは、新機能が15以上ある (15以上の新機能) としているが、記事にはこの件数は記載されていない。新版の中核は、複数の段階からなる自動化とエージェント向けに再設計された、新しいエージェント用ハーネス (エージェントハーネス) である。プラットフォームは引き続き特定のモデルに依存せず、Cohereのモデルも顧客自身のモデルも利用できる。

機能分野Cohereが挙げた新機能
エージェントプロンプトで作成し、組織内で共有できる再利用可能なエージェントと自動化;複数エージェントのオーケストレーション;セッション間でコンテキストを保持するメモリ
生産性スキル (Skills)、ライブラリ (Libraries)、プレゼンテーション、ダッシュボード、文書を生成するアプリケーション;7月末に公開されたAutomationsには、すぐに使えるテンプレートとビジュアルエディターを用意
コネクターSlack、SharePoint、OneDrive、Outlook、Exchange、Jira、Linear、Notion、GitHub;金融データ提供元(PitchBook、FactSetなど)への対応は予定段階
導入とセキュリティセルフホスト、VPC、ハイブリッド、オンプレミス、完全にネットワークから切り離された環境;SOC 2 Type 2、ISO 27001、ISO 42001;重要な判断を人間が承認する自律性ポリシー
ガバナンスNorth Adminコンソール、ユーザーまたはグループごとのリクエスト数とトークン消費量に応じた段階別の利用枠、上限到達前のアラート

Cohereは顧客として韓国のLG CNSとカナダのBell Cyberを挙げ、NVIDIAの生成AI責任者カリ・ブリスキのコメントとともに、NVIDIA BlackwellおよびHopper GPUでのモデルのスループット向上を強調しているが、数値は示していない。料金や導入日程も公表されておらず、記事は営業チームへのデモ予約を案内している。

🔗 North 2の公開記事 🔗 XでのNorth 2公開スレッド

カナダから始まるPwCとの世界規模の提携

10月5日 — 同日、PwCとCohereは、カナダから始まる世界規模の提携 (グローバルアライアンス) を発表した。トロント発のPwC Canadaのプレスリリースを、Cohereの短い記事が紹介している。役割分担は明確で、CohereはNorth、企業向けモデル、情報検索ツールを提供する。PwCは、ユースケースの選定から企業のデータやシステムへのAI統合まで、業界、規制、リスク管理、変革に関する専門知識を提供する。発表された用途には、企業内検索、知識へのアクセス、詳細調査、意思決定支援、タスクの自動化が含まれる。プライベートクラウド、オンプレミス、ネットワークから切り離された環境で利用でき、主に規制の厳しい業界を対象とする。リリースにはPwC Canadaのドメニク・マリーノとアニー・ヴェイエ、Cohereのエイダン・ゴメスのコメントが掲載されているが、金額、顧客、カナダ以外への展開日程は示されていない。Cohereは9月16日にOpenTextとも提携している。

🔗 PwCとの提携に関するCohereの記事 🔗 PwC Canadaのプレスリリース


オープンモデル:Beam、MetaEncoder-30B、植物ゲノミクスでのGemma 4

今日話題となった3つのオープンモデルは、それぞれ異なる段階にある。1つは公開が予告され、もう1つは発表なしで公開され、最後の1つは公開から1か月後に紹介された。

Beam:Reflection AIの5010億パラメータのオープンモデル

10月5日 — Reflection AIが、同社初の重みを公開するモデルBeamを発表した。5010億パラメータの疎なMoEで、うち230億パラメータが有効化される。コーディング、推論、エージェントとしてのタスク向けに設計され、全工程を通じてゼロから学習された。事前学習には23兆8000億トークンを使用した。強化学習段階では、NVIDIA GB300 GPUを1万500基、4週間にわたって使用し、1億件を超える実行軌跡 (ロールアウト) を生成した。

Reflection AIの表によると:

評価ベンチマークBeamNemotron 3 UltraGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
SWE-bench Verified80,970,7————
SWE Bench Pro v165,546,4——67,7—
Terminal Bench v2.180,156,488,288,386,690,6
DeepSWE v1.144,4—61,068,051,074,2

ダッシュは、記事にスコアの記載がないことを示す。Reflection AIは、GLM-5.2の3〜4分の1の推論計算量で同等の推論スコアを達成したと主張する一方、純粋な能力ではKimi K3が依然として上回ると認めている。現時点でダウンロードできるものはない。Beamは最終評価と敵対的テスト (レッドチーミング) の段階にあり、早期アクセスには登録が必要となる。重み、技術レポート、モデルカード、開発者向けツールは10月中の後日公開が予告されている。

🔗 Beamに関するReflection AIの記事

MetaEncoder-30B:Metaが発表なしで公開した意思決定エンコーダー

10月5日 — Metaは、Hugging Faceのfacebook組織でMetaEncoder-30Bを公開したが、発表は見つからなかった。リポジトリは9月30日に作成され、10月5日に更新されており、確認時点のダウンロード数はわずか2件だった。モデルカードでは、Jevの意思決定モデルの形式である、マルチモーダルな「System One」エンコーダーと説明されている。自然言語で記述したタスク(質問、指示、状態の説明、基準)と候補の一覧を、画像や動画を補助情報とするテキストとして入力すると、各候補を採点する。タスクと候補を別々にエンコードするため、比較は内積の計算だけで済み、最近傍探索のインデックスを使えば、モデルを再実行せずに数百万の候補を扱える。MetaEncoderは、Metaが8月に公開した、重みを公開するエージェントモデルMuse Glimmer 30Bを対照学習でファインチューニングしたもので、Apache 2.0ライセンスを継承している。ダウンロードには条件への同意が必要で、vLLMではテキストと画像を対象に提供できる。

評価ベンチマークモデルカードに記載されたスコア使用指標
JEVBench(オリジナル / 簡単 / 難しい)0,9444 / 1,0000 / 0,7387正解率
ImaJEV-Bench0,8958正解率
NanoBEIR0,6632NDCG_linear@10
MMEB-V3(画像 / 動画 / 視覚文書)0,7897 / 0,6046 / 0,8138Hit@1 / Hit@1 / NDCG@5

🔗 Hugging FaceのMetaEncoder-30Bモデルカード

Living ModelsがGemma 4とBOTANIC-1を組み合わせ、植物のDNAを解読

10月5日 — Googleは、@GoogleAIのX ArticleとGemmaverseの紹介ページで、パリを拠点とするAI生物学研究所Living Modelsの取り組みを紹介した。Gemma 4 E4Bが、Ollamaを介してNVIDIA L4 GPU 1基でローカルに動作し、分析(ターミナルでの処理パイプライン、データのフィルタリング、ツール呼び出し)を統括する。一方、320種の植物で事前学習したゲノム基盤モデルBOTANIC-1が変異の影響を評価し、非公開のゲノムデータはオンプレミスに保持される。事例研究は、INRAEでアドナン・ブアレムが行った発見を取り上げている。メロンのCmEIN3遺伝子で1文字が変わるだけで、雌花が両性花に変化する。X Articleによれば、2494件の候補点変異のうち、検証済みの変異が4分未満で、同率なしの単独首位になった。

テストした設定(20回実行)Recall@1
誘導なし0,00
専門家による誘導0,15
BOTANIC-1のスコアを使用0,90

Botanic1モデル(3億〜20億パラメータ)とbioRxivのプレプリントは9月初めに公開されている。今回の新しい点は、Googleによる紹介と結果の詳細である。

🔗 Google AIのX Article 🔗 Google DeepMindのGemmaverseページ


ChatGPTの広告:ビジュアル形式をテストし、効果測定を拡充

10月5日 — OpenAIは、ChatGPT向けのビジュアル広告形式を準備している。画像で、商品から得られる着想、その使い方、商品が実現する体験を示す。最初のテストは画像生成中に行われ、広告であることを明示し、生成中の画像とは分けて表示する。今月後半に米国で、最初の広告主グループを対象に開始する。OpenAIは、広告がChatGPTの回答に影響しないと改めて説明しており、同社によればChatGPTは毎週12億人に利用されている。

発表の中心は効果測定である。Hightouch、Tealium、LiveRampを介したコンバージョン送信、AppsFlyer、Adjust、Triple Whaleなど、名前を挙げた10社のアトリビューションパートナー、Haus、Measured、WorkMagicとの地域別の増分効果実験、レポートにおける広告表示後1日間のコンバージョン計測期間、シグナル品質指標 (Event Quality Score) が含まれる。ブランドセーフティについては、対象となる広告主が特定の語句を除外できる (Negative Phrases) ほか、DoubleVerifyとIntegral Ad Scienceとの試験的な評価も準備中である。ピクセルとConversions APIは、すでに5月5日から提供されている。

OpenAIが公開した結果公開値測定実施者
WeightWatchersの顧客獲得単価、有料検索広告のベンチマークとの比較−15,3 %DV Rockerbox
Doseブランドの増分購入のうち、新規顧客による購入67 %WorkMagic
ChatGPT Ads経由のPortland Leather訪問者のうち、ブランドにとって新規の訪問者93 %Triple Whale

🔗 新しい広告形式に関するOpenAIの記事 🔗 効果測定に関するAdsブログの記事


Perplexityの10月5日付変更履歴:Computer向けブラウザー拡張機能、Wiley、Stripe Projects

10月5日 — Perplexityが18項目の製品変更履歴を公開した。確認時点ではXでの告知はない。8項目はすでに取り上げた発表(Automations、Claude Opus 5.5、動画生成、American Express向けSkills、AMD上のPortable Computer、Fast Search、Agent APIのProfiles、Claude Fable 5.1)を再掲し、9項目目では10月1日のグラフにインタラクティブな3D解説を追加している。残る9項目は今回初めて発表された新機能だ:

初公開の新機能プラットフォームまたはバージョン対象ユーザー
Computerがブラウザーを操作できるChrome、Edge、Brave向け拡張機能(既定は引き続きComet)Mac向けPerplexity 26.38.0以降未公表
Computerのタスクを別々のタブやウィンドウで実行Mac向けPerplexity 26.37.1以降未公表
モバイルの処理強度モード(Light、Standard、High、Ultra)iOS 26.38.0およびAndroid 2.100.0以降Pro、Max、Enterprise Pro、Enterprise Max
Wileyの別途契約なしで同社の学術誌や書籍を利用PerplexityとComputer全プラン、プレミアム利用枠はプランによって異なる
GPT-6.1 Solを追加し、ComputerのLightモードもGPT-6 Solに代わって担当PerplexityとComputer対象の有料プラン契約者
最初のComputerタスクを始めるためのガイド付き会話Web新規の無料アカウント
入力欄からアプリを接続(アプリを接続)Web版Computer未公表
投資案件のデータルーム(ディールルーム)向けDocSendコネクターComputer対象のDocSendアカウント
Stripe Projects:StripeのCLIからPerplexity APIキーを作成StripeのCLIPerplexity APIの開発者

Stripe Projectsでは、1つのコマンドでプロジェクトを作成または関連付けし、キーを生成して.envファイルに書き込む。Perplexityは、この設定作業をClaude Code、Cursor、Codexに任せることを提案している。

🔗 Perplexityの10月5日付変更履歴


生成コンテンツ制作:Suno AlbumsとHeyGenのHyperFrames Studio

Sunoがアルバム機能を追加

10月5日 — Sunoが、これまでプラットフォームになかったアルバム機能を追加した。発表に伴う記事によると、この機能は自分の傑作曲をまとまった作品(フルレングスのプロジェクト)に仕上げるもので、アルバムとして使っていた曲のリスト(プレイリスト)をAlbumに変換できるようになった。Sunoは最初の5枚のアルバムとそのアーティストを紹介している:naenia(Oakwood///diskrot)、Old Soul(Isaiah Wallace)、phenomenal(KakerMix///diskrot)、Lost In a Dream(Dream Relic)、VOID(ECHLO)。提供元は、対象プラン、アルバムあたりの曲数、正確な提供開始日を明らかにしていない。6月には、Sunoはすでにプレイリスト、アルバム、ラジオを含むリスニング体験についてコミュニティに意見を求めていた。

🔗 SunoのXでの発表 🔗 見逃せない5枚のアルバム、Sunoブログ

HyperFrames Studio、エージェント向けに設計されたHeyGenの動画エディター

10月5日 — HTMLコードを動画に変換するHeyGenのオープンソースフレームワーク、HyperFramesがデスクトップアプリケーションになる。HyperFrames Studioは、エージェントのためにゼロから構築された動画エディターをうたう。作りたい動画を説明すると、エージェント(Claude Code、Codex、または独自のエージェント)が最初の編集版を作成し、その後は人間とエージェントが同じ時間軸(タイムライン)上で作業する。演出の指示はプロンプトよりも操作を通じて行う。画像内の要素を囲む、単語にコメントを固定する、自分でカットする、といった方法だ。アプリは4Kで書き出せ、数百の参考例とテンプレートを備えるという。HyperFramesのXアカウントによると無料で、ダウンロードできるのはmacOS版のみだ。コードから生成した動画を視覚的に編集できた7月のStudio Previewを発展させたものとなる。

🔗 HyperFrames Studioの発表 🔗 HeyGenによる紹介


短報

  • Warp Factoriesが一般提供へ — 秋のセミナーに関する10月3日の記事で、Warpはエージェント基盤のWarp Factoriesが早期アクセスから一般提供へ移行中だと説明したが、日程や料金は示していない。チームによると、これを活用して直近1か月のPRあたりのコストを70 %削減したという。🔗 出典
  • Devinの10月2日付リリースノート — Microsoft Teamsのアクセス設定が適用されるようになり、同じ重大度のセキュリティ指摘をワンクリックですべて選択できるようになった(API v3も対応)。提案されるプラグインは、インストール前にスキル、MCP、フック、ルールを表示する。大規模なPerforceリポジトリでの環境構築には3時間が認められるようになり、従来のように10分で失敗しなくなった。🔗 出典
  • ReplitにTikTok AdsのMCPを追加 — Replitが450以上の連携機能を集めたカタログにTikTok Adsを追加した。アカウントを接続すると、AgentがワークスペースからTikTok広告を作成・管理し、対象層にリーチして成果を測定できる。接続にクレジットは消費しない。🔗 出典
  • Replit上のCockle Finance — ReplitがCockle Financeについての動画を固定表示した。そのツールは、顧客の流入を追跡するためにダンと父親のスティーブがReplit上で構築したものだ。Replitによると、ダンは3か月で事業を15 %成長させたが、何を測定した数値かは示されていない。🔗 出典
  • Copilot CLI 1.0.92の安定版 — このバージョンはプレビュー版1.0.92-0から-5までの新機能をまとめたもの。今回初めて加わった変更では、Microsoft Entraへのサインイン後に使うアカウントをユーザーが選択でき、/logoutでこれらのOAuthセッションを終了できる。また、Entraで保護されたMCPサーバーは認証情報を自動更新する。🔗 出典
  • Codex CLI 0.160.1 — 0.160.0に対するこの修正版には、1件のバックポートだけが含まれる。リモート側の環境変数を明示的に設定したリモートのstdio MCPサーバーを起動する際に、WindowsのSYSTEMROOT、TEMP、TMP変数が保持される。これが最新の安定版で、0.161.0の安定版はまだ公開されていない。🔗 出典
  • Gemini CLIの10月5日付ナイトリー版 — 変更は一切ない。10月3日版と同じコミットから構築され、異なるのはバージョン番号だけだ。安定版(v0.62.0)とプレビュー版(v0.63.0-preview.0)の各チャンネルにも変更はない。🔗 出典
  • SpaceXAIのTypeScript SDK 0.2.1 — 10月2日に公開されたこのバージョンは、Standard Schemaのバリデーター(Zod、Valibot、ArkType)で構造化出力を検証するtoJson(schema)と、何も出力する前に失敗したストリーム形式(ストリーミング)のリクエストを再試行するretryBeforeOutputオプションを追加した。Retry-Afterヘッダーのない429応答では、待機時間が従来の250ミリ秒から、1秒を起点に最大30秒までとなった。🔗 出典
  • Claude Agent SDK上のCresta Conductor — Claudeを使って開発するスタートアップを紹介するAnthropicの連載で、CrestaがConductorを紹介した。Claude Agent SDKを基盤とする、自然言語で顧客対応エージェントを構築するツールだ。Crestaによると、初期の利用事例で初回導入にかかる時間を約半分に短縮したが、提供開始日や料金は示されていない。🔗 出典
  • npm:信頼済み公開設定の有効期限 — 10月2日から、一度も公開に使われていない信頼済み公開(トラステッドパブリッシング)の設定は作成から48時間後に失効する。また、npmはGitHub Actionsのissue_commentイベントから発行されたトークンも、pull_request_targetの場合と同様に拒否する。🔗 出典
  • npm:公開待ちへの登録でパッケージを作成可能に — 10月2日から、npm stage publishでまだ存在しないパッケージを作成できるようになった。ローカルセッションまたは権限を細かく指定したトークンを利用でき、公開待ちへの登録だけに限定したもの(保留のみ)も使える。最初のバージョンは、メンテナーが正式公開に移行するまでインストールできない。🔗 出典
  • PerplexityのAgent APIがFast Searchを採用 — Agent APIのlow、medium、highプリセットは、web_searchツールにFast Searchを使うようになった。料金は1,000回の呼び出しあたり2.50ドルから1ドルに下がり、約800 ms高速化した。xhighプリセットは標準検索を維持する。🔗 出典
  • PerplexityのRAGガイド — Perplexityが、検索拡張生成(検索によって補強された生成、RAG)の9つの事例と7つのアーキテクチャを紹介するガイドを公開した。ZendeskやGitHub Copilotなど他社の事例と並べて、自社のウェブインデックスとInstant Buyも紹介している。製品の新機能はない。🔗 出典
  • Cohereの従業員数 — 採用に関する投稿で示されたCohereの説明によると、同社の従業員数は2026年初頭の約400人から現在の800人超に増えた。🔗 出典
  • MetaのIsoVGRBenchとLogbook — facebookresearchが告知なしでIsoVGRBenchのコードを公開した。これは、1つの側面だけが異なる16,000組のペアで動画の報酬モデルを評価するものだ。同じクリップのフレーム順を入れ替えたものとの比較では、これらのモデルの応答はほぼランダムになる。非常に長い音声録音に含まれるイベントを扱うLogbookのコードも公開した。🔗 出典
  • FiftyOneがLeRobot v3データセットに対応 — ハープリート・サホタのコミュニティ記事によると、オープンソースのツールキットFiftyOneがLeRobot v3形式をネイティブに読み込めるようになった。変換ツールや動画のコピーは不要だ。デモでは、LeRobotのコミュニティデータセットに含まれる50種類のロボットから抽出した497エピソードを扱っている。🔗 出典
  • Ai2のFetchMan-data — 10月1日に告知なしで公開されたこのデータセットには、人型ロボットUnitree G1による物体把持のシミュレーション352,696エピソード(5,200万フレーム、902件の指示)が収録されている。MolmoSpacesで生成され、LeRobot v3形式、ODC-BYライセンスで提供される。🔗 出典
  • Hugging FaceのプロフィールにP(doom) — Hubのユーザーは、AIが存亡に関わる破局を引き起こす確率についての自分の推定値、P(doom)をプロフィールに表示できる。回答は調査に使われ、2週間後に集計・匿名化された結果だけが公開される。🔗 出典
  • hf-image拡張機能 — Hugging Faceが告知なしでCLIの拡張機能を公開した。同社のレジストリcr.hf.coでコンテナイメージを構築、プッシュ、プル、実行できる。非圧縮レイヤーはXetによって重複排除されるため、READMEによると、2 GBのレイヤーに100 MBの変更を加えても送信されるのは約100 MBだけだ。🔗 出典
  • ミロシュ・コトラールの3つの実験 — 3本のコミュニティ記事で、ミロシュ・コトラールは小型トランスフォーマーのKVキャッシュを2.71分の1のサイズに縮小し、次のトークンの一致率97.85 %を維持した。また、MoEルーティングでエキスパートが割り当てられないトークンの割合を13.84 %から8.09 %に下げたが、速度向上は一切なかった。🔗 出典
  • スティーブン・ユーによるLLM判定器の監査 — スティーブン・ユーが38,400サンプルを使い、自身の12B書き換えモデルのGRPO報酬で事実への忠実度を採点するGLM-5.3判定器を監査した。事実が変わったことの検出には信頼できるが、その重大性の評価にはばらつきがある。誤りを含む出力を数えると、当初の集計では見えなかった39 %の減少が確認された。🔗 出典
  • Sakana AIが東京でシンポジウム — Sakana AIが、10月26日に東京の一橋講堂で開催する無料シンポジウムの参加登録を開始した。使用言語は英語で、ユルゲン・シュミットフーバーの講演と、Sakana AIの最高経営責任者デイビッド・ハとの対談を予定している。🔗 出典
  • NVIDIA Inceptionのスタートアップと乳がん — NVIDIAが、診療の流れにAIを活用するInceptionプログラムのスタートアップ4社を紹介した。FDAの認可を受けた3D超音波検査装置ATUSAを開発するiSono Health(乳房1つあたり約2分、手作業では最大45分)、Whiterabbit.ai、Ataraxis AI、SimBioSysが含まれる。これらの技術の一部はFDAの承認を受けていない。🔗 出典

これが意味すること

テキストの出所を追跡できることが、規制上の義務になる。これまで生成コンテンツの追跡可能性は、主に画像と音声を対象とし、透かしや検証可能なメタデータで確保されてきた。AI Actはこの要件をテキストにも拡大し、OpenAIは段階的に対応している。欧州連合内ではChatGPTとCodexのテキストに透かしを標準で付け、APIでは任意の選択肢とし、検出器は承認された組織だけに提供する。公表された数値は、この慎重な姿勢の理由を示している。心理学分野の内容では400トークンの文章の約95 %が検出され、偽陽性率の目標は1 %だが、英語の400トークンの文章で単語の10 %を同義語に置き換えると、検出率は約92 %から66 %に下がり、書き換えや翻訳で透かしが消える可能性もある。透かしは出所の手がかりであって証拠ではなく、透かしがないことから書き手について何かを判断することはできない。

エージェントのメモリーが定着しつつあり、標準化も始まっている。Devinは学んだことをMarkdownファイルのGitリポジトリに保存し、Dreamingが毎日整理し直す。Cognitionは、他のエージェントも採用できるよう、その形式をMITライセンスで公開している。North 2はセッションをまたいでコンテキストを保持し、Qwen CodeはMem0をCLIに直接接続する。人間が読めるバージョン管理されたファイル、外部メモリーサービス、プラットフォーム内蔵機能と、方式は異なるが、どれも同じニーズに応えている。エージェントがセッションのたびにゼロからやり直さずに済むことだ。Cognitionの方式には実用上の利点がある。各メモが学習元のセッションを参照し、インターフェースで閲覧でき、Gitの履歴も残るため、エージェントが記憶した内容を読んで修正できる。

オープンモデルが、複数の経路でコーディングツールに入ってきている。Together LinkはClaude CodeやCodexを含む既存のエージェントに接続し、支出を半分以上削減できると発表している。IBMは、自社インフラで開発を行う企業向けに、Bobのセルフホスト版をNemotron 3 Ultra上で動かし、ネットワークから切り離された環境にも対応する。Reflection AIは、コードとエージェント型タスク向けに設計されたオープンモデルとしてBeamを紹介し、自社の表ではSWE-bench Verifiedで80.9としている。共通する訴求点は、素のスコアよりもコスト、レイテンシー、データの管理権にある。Reflection AIもスコアではKimi K3が依然上回ることを認めている。

本日の数値の多くは、公表した当事者自身が出したものだ。GitHubはReviewBenchを設計し、Copilot code reviewが首位になる最初のランキングを作成したが、他の提供元による実行や検証は行われていない。Nemotron 3 UltraのレイテンシーはIBMの社内テストによるもので、Together Linkの節約額とChatGPTの広告成果も、Together AIとOpenAIがそれぞれ発表した数値だ。ただし、GitHubはデータセット、判定器、測定方法を公開し、結果の提出も受け付けている。各提供元は自社のエージェントで測定をやり直せる。これによって、最初の順位が維持されるかどうかを判断できるようになる。


出典