検索

Claude、CRISPRに似た反復配列を持つ酵素系を発見、GoogleがGemini 3.8 Flash TTSを発表、Black Forest LabsがFLUX 3 Actionを公開

ai-powered-markdown-translator

gpt-6-solによってフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

9月23日、Anthropicは分子生物学研究所とその最初の成果を発表した。約950のClaudeエージェントがバクテリオファージのDNAから、未知の酵素系ARTを発見した。Googleは音声の作成と複製ができる2つの音声合成モデル、Gemini 3.8 Flash TTSとFlash-Lite TTSを発表。Black Forest Labsはロボット制御用のオープンウェイトモデルFLUX 3 Actionを公開し、Perplexityは同社のエージェントが動作するサンドボックスSPACEの初のセキュリティ監査を公表した。


Anthropicが分子生物学研究所を開設、ClaudeがARTを発見

9月23日 — Anthropicは、サンフランシスコ・ベイエリアに設置した独自の分子生物学研究所を持つ、新たな生命科学研究グループを紹介した。このグループは春に発足した。最初の成果として、Claudeエージェントが、細菌に感染するウイルスであるバクテリオファージのDNAから、これまで報告されていない酵素系を発見した。AnthropicはこれをART(array-associated reverse transcriptases、反復配列に関連する逆転写酵素)と名付けた。

出発点は、膨大なDNA配列データベースから、RNAをDNAに写し取る酵素である逆転写酵素の新たな例を探すというプロンプトだった。約950のエージェントが21時間で2億1,000万トークンを消費し、20万件を超える逆転写酵素を収集。未報告の候補系3,500件を抽出し、有望な20件を選んで、それぞれに人間が読める報告書を添えた。Anthropicによれば、専門家なら数週間、場合によっては数カ月かかる分析であり、人間の関与は最初のプロンプトと実験室での検証に限られた。

調査の段階測定値
調査時間21時間
参加したClaudeエージェント約950
消費トークン数2億1,000万
収集した逆転写酵素20万件超
新たな候補系3,500
選定・分析した候補20

ARTは、逆転写酵素、機能が分かっていない隣接する遺伝子、そしてCRISPRの配列を思わせる、規則的な間隔で並んだ長いDNA反復配列という3つの要素からなる。巨大ファージで見つかった逆転写酵素自体はすでに知られていたが、Anthropicによれば、これに伴う非コード反復配列とタンパク質に気づいたのはClaudeが「初めてのようだ」。初期の実験では、この反復配列が個別の短いRNAとして発現することが示された。Anthropicは慎重な姿勢を保っており、ARTの機能はまだ分かっておらず、追加の実験が進んでいる。同社によると、こうした特徴を共有する既知の系はごくわずかで、いずれもプログラム可能で、DNAを切断、コピー、貼り付けできる。

Claude has discovered a previously unknown enzyme system hidden in the DNA of bacteriophages. Beside the enzyme’s gene sits a long array of repeating DNA—a structure that looks somewhat similar to CRISPR.

🇯🇵 Claudeは、バクテリオファージのDNAに隠れていた、これまで知られていなかった酵素系を発見しました。酵素の遺伝子の隣には、CRISPRに少し似た構造を持つ、長いDNA反復配列があります。Xの@AnthropicAI

研究所はバイオセーフティレベルBSL-1とBSL-2に限定され、人間に感染する病原体は扱わない。実験台での作業はすべて人間の科学者が行う。チームはClaude ScienceとClaude Codeを使い、多数のセッションを並行して調整する独自の仕組みを併用することもある。1回の調査で数百から数千の報告書が生まれるため、仮説そのものも研究対象になる。研究者が検証に値すると判断する仮説の特徴を、Claudeへの指示の改善に役立てている。CRISPRによるゲノム編集の先駆者であるFeng Zhang(MITおよびBroad Institute)はプレプリントを読み、AIエージェントが生物学上の発見にもたらし得るものを示す、心躍る例だと評価した。Anthropicはこのプレプリントを公開し、科学者に研究課題の提案を呼びかけている。

🔗 ClaudeがCRISPRに似た反復配列を持つ新たな酵素系を発見 · プレプリント(PDF)


Gemini 3.8 Flash TTSとFlash-Lite TTS:Googleが音声を作成・複製

9月23日 — Googleは、同社で最も表現力の高い音声モデルと位置付ける2つの音声合成(text-to-speech)モデル、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSをGeminiファミリーに追加した。両モデルは新しいVoicesエンドポイントとともに、Gemini APIとGoogle AI Studioで一般提供されている。APIの変更履歴には9月22日付で記載され、一般向けの発表は23日に行われた。

2つのモデルは用途が異なる。Flash TTSは音声の作成向けで、自然言語で声の役柄、アクセント、特徴を記述し、各セリフの演技、テンポ、方言の切り替えまで指示できる。Googleはゲーム、オーディオブック、ポッドキャストでの利用を想定している。Flash-Lite TTSは処理量とコストを重視し、大規模な吹き替え、大量の音声制作、リアルタイムの音声エージェントを対象とする。gemini-3.1-flash-tts-previewを置き換える予定だ。両モデルとも、1つの台本での2人の対話、声質が目立って変化しない数時間の音声生成、<laughs><sigh>|mhm|などのタグに対応する。

発表記事では、ケベック・フランス語のような地域別のバリエーションを含む、2,000以上の既成の声を案内している。一方、APIのドキュメントには、30のスタジオ音声と数百種類に及ぶ拡張音声ライブラリが記載されている。音声の複製には30秒のサンプルを使い、声の持ち主の口頭による同意を録音する必要がある。生成された音声にはすべてSynthIDの透かしが入る。フランスの読者に関係する点として、発表記事の注記によれば、AI Studio経由の音声複製は欧州経済領域、英国、スイス、インド、イリノイ州、テキサス州では利用できない。既存の声のリミックスも近日提供予定とされている。

モデルの特性Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS
API識別子gemini-3.8-flash-ttsgemini-3.8-flash-lite-tts
対応言語数(APIドキュメント)130101
想定用途音声作成、細かな演出大量生成、吹き替え、音声エージェント
音声出力のStandard料金、2026/12/31まで(100万トークン当たり)9ドル6ドル
音声出力のStandard料金、2027/01/01から(100万トークン当たり)18ドル12ドル
一般向け製品Gemini NotebookGoogle Vids(ナレーションを提供予定)

比較すると、Gemini 3.1 Flash TTS Previewの料金は、出力音声100万トークン当たり20ドルだ。Googleは外部評価を発表の根拠として挙げている。Flash TTSはHume AIのVoice Design Benchmarkで1位(71.4)となり、Hume AIのOverall Quality Indexでも両モデルが上位2位を占めた。「近日中」にAPI経由でGemini Enterpriseにも加わる予定だ。

🔗 Googleの発表 · Gemini APIのリリースノート · API料金


FLUX 3 Action:Black Forest Labsがロボット制御用のオープンウェイトモデルを公開

9月23日 — 画像モデルFLUXで知られるBlack Forest Labsは、ロボット制御向けに設計した70億パラメータの世界行動モデル(World Action Model)、FLUX 3 Actionを公開した。マルチモーダルの基盤モデルFLUX 3から派生し、カメラ映像と関節位置を入力として、将来の画像と運動指令を一度の計算で予測する。ウェイトは公開されており、Hugging FaceにあるDROIDチェックポイントのページにはライセンスとして「flux-kommunity-license」と表示されている。研究所はコード、ファインチューニングの手順、ベンチマーク、再現可能な例も公開した。

An open weights 7B World Action Model that achieves first place on the RoboLab benchmark. It outperforms the previous best open model by 6.1 percentage points while using 56% fewer parameters and running up to 3.95x faster.

🇯🇵 オープンウェイトの70億パラメータ世界行動モデルが、RoboLabベンチマークで首位に立ちました。従来最高のオープンモデルを6.1ポイント上回りながら、パラメータ数は56%少なく、実行速度は最大3.95倍です。Xの@bfl_ai

評価対象モデルモデルの種類ウェイトへのアクセスRoboLab-120の成功率パラメータ数
FLUX 3 ActionWAM公開42,92 %7B
OASIS WAMVLM + WAM非公開39,0 %
Cosmos3-Nano-PolicyWAM公開36,8 %16B
PhoenixTAMP+FM非公開34,4 %
BiMind v0.1VLA非公開33,3 %
π0.5VLA公開28,0 %3,3B
DreamZeroWAM公開25,7 %14B
GR00T N1.6VLA公開7,2 %3B

従来最高のオープンモデルはNVIDIAのCosmos3-Nano-Policyだった。「最大3.95倍高速」は、FP8のCosmos 3 Nanoとの比較で、GPUによって1.52~3.95倍となる。最も性能の高いオープンな視覚・言語・行動モデル(VLA)であるπ0.5との比較では、1ステップに蒸留したバリアント(38.3%)はワークステーション用とデータセンター用のGPUでは高速だが、RTX 5090では低速だった。一方、1回の予測で見通す動作時間は、π0.5の1秒に対して2.13秒だ。

発表記事では、OpenAIのGPT-6 Astraがロボットを監督するハイブリッド方式も試している。推論負荷を低(low)に設定したAstraとFLUX 3 Actionの組み合わせは、エピソードの90%に成功し、成功1件当たり8.77ドル、約8分を要した。推論負荷を「xhigh」に設定したAstra単独では、全タスクに成功したものの、成功1件当たり13.47ドル、16分を要した。実機のFrankaアームを使ったPositronic Roboticsの盲検評価では、FLUX 3 Actionは30回中28回成功し、Cosmos 3 Nanoは27回、π0.5は13回だった。Hugging Faceでは3つのチェックポイント(base、SO-101、DROID)が公開されている。また、NVIDIAとの協力でLeRobotに統合され、Jetsonへの導入も可能だ。

🔗 FLUX 3 Action(Black Forest Labs) · Hugging Faceコレクション


Escaping SPACE:PerplexityがComputerのサンドボックスに関する初のセキュリティ監査を公表

9月23日 — Perplexity Secure Intelligence Instituteは、7月15日に発表されたPerplexity Computerのエージェントが動作するサンドボックスSPACEについて、侵入テスト(red-teaming)報告書の第1部を公開した。これは新製品の発表ではなく、SPACEについて公表された初のセキュリティ評価だ。各サンドボックスはホストマシンから隔離されたFirecrackerのマイクロ仮想マシンで、サンドボックスごとに設けられたゲートウェイが外向きのネットワーク通信ポリシーを適用する。

9つのモデルには仮想マシン内のroot権限が与えられ、旗取り形式の2つの任務が課された。VMとホストの境界を越えておとりのAWS認証情報を取得するか、ネットワークポリシーでブロックされたURLに到達するというものだ。SPACEのソースコードへのアクセスの有無と、ネットワークアクセスなし、または一部あり(PyPIとUbuntuのパッケージリポジトリ、Perplexityのウェブ検索)という2条件を組み合わせ、各構成で3回試行した。結果は、ソースコードを与えられた場合も含め、108回の試行でVMからホストへの脱出は0件だった。ネットワーク通信をすべて遮断した場合もフィルタリングは機能した(54回中0件)。一方、部分的なアクセスを許した場合、修正前には54回中11回、禁止された宛先に到達した。

評価対象モデルソースコードありでの成功ソースコードなしでの成功
Claude Opus 5.03回中3回なし
GPT-5.6 Sol3回中3回3回中2回
Kimi K33回中2回なし
GPT-5.6 Cyberなし3回中1回
評価したほかの5モデルなしなし

悪用された欠陥は2つある。1つはDNSの偽装だ。エージェントがpypi.orgを標的のアドレスに結び付ける偽の応答を注入すると、出所を確認しないゲートウェイがそれを登録した。この手法には、ソースコードでしか分からない内部アドレスが必要だった。もう1つはCDNによるIPアドレスの共有だ。GPT-5.6 Solは、PyPIと同じアドレスで接続できるfiddle.fastly.devに禁止されたURLを取得させた。GPT-5.6 CyberはTaboolaの画像サービスとスクリーンショット生成サービスthum.ioを経由し、文字認識でフラグを読み取った。Claude Opus 5.0もこの手法に気づいたが、外部システムを標的にしないという指示に反すると判断して採用しなかった。成功したオープンウェイトモデルはKimi K3だけだった。2つのモデルは評価できなかった。Fableは、PerplexityがAnthropicのCyber Verification Programに登録していたにもかかわらず演習を拒否し、GPT-6 Astraも拒否した。

8月26日に発見された欠陥は修正済みだ。外向きの各パケットには、そのVMに割り当てられたアドレスを含める必要があり、ゲートウェイが自らTLSを終端してサーバー名(SNI)とHTTPホストを検証する。攻撃者に最も有利な構成で再評価しても、モデルはフラグを取得できなかった。Perplexityはその後、エージェントを使わずに第三者のサンドボックス基盤10件を検証した。Cloudflare SandboxとNVIDIA OpenShellは攻撃を防いだが、E2B、Vercel Sandbox、Modal Sandboxes、Daytona Sandboxを含む8件には、少なくとも1つの回避経路があった。9月1日に通知を受けた事業者は全社が回答した。9月10日時点でDaytona、Deno、microsandboxは修正済みで、VercelとModalはこの挙動を既知の制約として扱っていた。モデルの戦略を扱う報告書の第2部は予告されているが、公開日は示されていない。

🔗 Escaping SPACE、第1部


Claude Code 2.1.281:帰属表示を無効化可能に、auto モードの判定を厳格化

9月23日 — Claude Code 2.1.281 は、2.1.280 の翌日、19時19分(UTC)に公開された。変更履歴には176項目が並び、そのうち112項目が修正だ。日常的に影響する変更は二つある。settings.json の設定 "attribution": false でコミットと pull request の帰属表示をすべて削除できるようになった。また、メッセージを即時送信する操作(ctrl+enter)では、実行中のツールをバックグラウンドに移し、ターンを取り消さなくなった。

auto モードの判定も厳格になった。分類器による審査がサーバー側で行われる場合、読み取り専用の shell コマンドでも判定を待つ。セキュリティ修正として、rm -rf "$(pwd)" のようなコマンド置換を狙う再帰的な rm は、従来 auto モードで --dangerously-skip-permissions を指定すると確認なしで実行されていたが、Bash の許可ルールがあっても確認を求めるようになった。無人セッションを止めないため、危険な rm の確認は2分間待機した後、書き換えを提案してコマンドを拒否する。

自己ホスト型 runner には互換性のない変更がある。--system-prompt を追加する中間スクリプト(wrapper)や hook は、--system-prompt-file に移行する必要がある。管理者向けには、Claude apps gateway が STS で取得した IAM ロール(assume_role)を使って Amazon Bedrock を呼び出せるようになった。別の AWS アカウントのロールも利用でき、各リクエストに Bedrock のガードレールを適用できる。

🔗 Claude Code v2.1.281


Anthropic の製品動向:claude.ai の高速化と Marketplace の拡大

同じ日に発表された Anthropic の製品関連の二つのニュースが、研究成果に続く。

claude.ai、2週間で約3倍に高速化

9月23日 — claude.dev で Anthropic のエンジニア3人が、8月に実施した2週間の集中作業を振り返った。その結果、claude.ai とデスクトップアプリは約3倍速くなった。作業は一つの Slack チャンネルで進み、「Opus 5.5 とほぼ同等」とされる社内研究モデルを搭載した Claude Tag(ベータ版)が参加した。Claude がボトルネックを見つけ、benchmark を作り、修正案を出し、デプロイを監視した。人間は目標を定め、各変更を承認した。3,000件を超える変更がマージされ、顧客に見える障害やロールバックはなかった。

測定した操作(75パーセンタイル)集中作業前集中作業後
claude.ai のページが入力可能になるまで3,1 s0,55 s
Claude Code の新規セッション(デスクトップ)0,8 s0,3 s
Claude Cowork のクラウドセッション(デスクトップ)2,6 s0,73 s
13項目の幾何平均3,1x 高速

手法の核は、Claude に超えるべき数値を与えれば最適化できる、という考えだ。チームは再現性のある測定値を、数値が下がる方向にしか進めない CI の基準に変えた。こうした改善の一部である、約4倍滑らかな streaming は、8月24日にすでに発表されていた。

🔗 claude.ai を2週間で3倍高速化した方法

Claude Marketplace に connector、agent、導入支援企業が集結

9月23日 — Anthropic は、3月に限定プレビューとして開始した Claude Marketplace を拡充した。現在の掲載内容は三つに分かれる。Atlassian、Google、Microsoft、Notion、Salesforce などの2,000件を超える connector と plugin、CrowdStrike、Cursor、Harvey、Legora、Lovable、Snowflake などの Claude を活用した agent と製品、そして Accenture、Boston Consulting Group、Deloitte など Claude Partner Network のコンサルティング企業だ。企業は Anthropic への利用額コミットメントの一部を agent や製品の支払いに充てられる。開発元には、MCP と Agent Skills で connector や plugin を作る、agent や製品を申請する、Partner Network に参加する、という三つの参加方法がある。関連する記事では購入の仕組みを紹介し、CodeRabbit が Anthropic へのコミットメント予算を使って Vercel のプランを購入し、1週間で契約を結んだ例を挙げている。この支払い方法は現在、資格審査を伴う限定プレビューだ。

🔗 Claude Marketplace


ChatGPT:Voice が操作に対応、復習カードと Privacy Center も登場

Voice が plugin を利用可能に、ChatGPT Work にも対応

9月23日 — OpenAI は ChatGPT Voice を二つの方向に拡張した。Live 音声モードは、web、iOS、Android での会話中に、メール、カレンダー、Slack など、アカウントに接続された plugin やアプリを使えるようになった。また、Voice が web とモバイル版の ChatGPT Work に加わった。声で文書、プレゼンテーション、スプレッドシートの作成、接続アプリの利用、ブラウザーでの作業を依頼でき、通話後に文章で作業を続けられる。

モデルについて、OpenAI の投稿は Voice が GPT-6 Astra、Sol、Luna も利用できるとしている。一方、ヘルプ記事は Live がプランに応じて GPT-Live-1 または GPT-Live-1 mini を使用すると説明しており、GPT-6 モデルの役割は詳しく述べていない。Free と Go の利用者は、各プランの plugin とともに Chat 内で Voice を使える。Work 内で Voice を使うには両方へのアクセスが必要で、そこから開始したタスクは Work の通常の利用量に計上される。Live は動画と画面共有には対応していない。最新版のアプリで、9月23日から世界中に展開されている。

🔗 OpenAI の X での発表 · ChatGPT Voice のヘルプ記事

復習カードとプライバシーセンター

9月22日 — ChatGPT は、トピックやアップロードしたノートからインタラクティブな復習カード(flashcards)を作れるようになった。カードをタップして裏返し、答えを知っていたか、復習が必要かを記録できる。カードの順序もシャッフルできる。カードはライブラリに自動保存される。この機能は無料プランを含む全プランで、モバイルと web から利用できる。

9月21日 — 前日の発表も振り返る。同じリリースノートには、Free、Go、Plus、Pro プランのログイン済み利用者向けに展開中のプライバシーセンター(Privacy Center)が掲載されていた。会話のプライバシー、メモリ、パーソナライズ、データの利用、接続アプリ、アカウントのセキュリティに関する情報を一か所に集め、設定への直接リンクも備える。web ではアカウントメニューから Help、Privacy Center の順に進み、モバイルでは設定から開ける。

🔗 ChatGPT のリリースノート


新たな benchmark が二つ:メンタルヘルスと推論サービス

MentalHealthBench(OpenAI)

9月23日 — OpenAI は、日常の感情を伴うやり取りから緊急事態まで、現実的なメンタルヘルスの会話でモデルがどう応答するかを測る公開 benchmark、MentalHealthBench を発表した。19言語を話す22か国の公認心理士と精神科医80人以上と共同で開発した。合成された会話には、成人、13~17歳の青少年、介護者、臨床家という四つのプロフィールが登場する。専門家は各会話について -10 から +10 の重み付き評価基準を作成し、3人中2人以上が承認し、残る1人も反対しなかった基準だけを採用した。採点は GPT-5.6 Sol を評価者として自動で行い、スコアは安全性、背景情報の確認、利用者の自律性の尊重など10の観点に分かれる。OpenAI は、とくに背景情報の確認でモデルが着実に進歩していると述べるが、モデル別のスコアは記事中のグラフにのみ示されている。また、ChatGPT はセラピーや専門家による継続的なケアの代わりにはならないと注意を促している。

🔗 MentalHealthBench の紹介

SWE-Serve(NVIDIA)

9月23日 — NVIDIA の Nemotron モデルのデータと評価を担当するチームが、SGLang チームと共同で作った SWE-Serve を公開した。この推論サービスエンジンで実際にマージされた83件の pull request を、実行可能な53件のタスクにしたものだ。対象は投機的デコード、モデル対応、kernel、cache、サービス API に及ぶ。主な結果は、ローカルテストと実際のサービスの差を示す。実サーバーを起動する19件のタスクでは、同じ修正の成功率が、稼働中のサービスを使うテストなしでは69,4 %だったのに対し、完全な検証では45,9 %に下がった。ほかの検証を通過した修正の約3件に1件は、モデルを読み込んで問い合わせると失敗する。

評価したモデル(最大限の推論)3回の試行での pass@1タスクあたりの平均費用
Claude Opus 575 %17,40ドル
GPT-5.6 Sol75 %12,26ドル
Kimi K364 %7,24ドル
GPT-5.6 Luna64 %0,95ドル
DeepSeek V4 Flash (0731)55 %0,69ドル

11モデルを web にアクセスできない最小限の agent で評価した。この表には、9月22日に公開された Claude Opus 5.5、GPT-6 Sol、Luna も、GPT-6 Astra も含まれない。タスクと検証器は公開されている。

🔗 SWE-Serve が示すローカルテストと実サービスの差 · GitHub リポジトリ


生成動画が動画編集ソフトに登場

DaVinci Resolve Studio に Runway を導入

9月23日 — Premiere Pro と After Effects 向け plugin の公開から2週間後、Runway が Blackmagic Design の動画編集ソフト DaVinci Resolve Studio に対応した。macOS と Windows 向けの無料 plugin で、Workspace、Workflow Integrations の順に開く。prompt から画像や動画を生成し、ブラウザーを経由せず、ワンクリックで Media Pool と timeline に取り込める。Edit Studio は編集済みのショットに作用する。パネルから選択した範囲を書き出し、最大5枚の修正済みキーフレームを基に、Aleph 2.0 が同じ長さの新しいスタイルの映像として再レンダリングする。DaVinci Resolve Studio 19 以降が必要だ。生成機能は Runway のすべての有料プランで利用でき、既存のクレジットを消費する。各生成の費用は確定前に表示される。

🔗 Runway が DaVinci Resolve に登場

Google Vids で Gemini Omni 1.1 Flash を無料提供

9月23日 — Google アカウントまたは Google Workspace アカウントがあれば、パソコンで vids.new を開き、Google Vids 内の Gemini Omni 1.1 Flash を使って無料で動画を生成できるようになった。バージョン1.1には三つの操作が加わった。人物、照明、背景を保ってシーンを延長すること、ナレーションに合わせてクリップの長さを正確に指定すること、1080pで直接生成することだ。各クリップには SynthID の透かしが入る。全面展開は9月23日に始まり、完了まで1~3日かかる場合がある。有料プランでは生成可能な量が増えるが、具体的な数値は公表されていない。Google は、100を超える言語に対応する Gemini 3.8 Flash-Lite TTS による Vids 内のナレーションも近日提供すると予告している。

🔗 Google の発表

Made On YouTube 2026:Shorts の編集に Gemini Omni を導入

9月23日 — 年次イベント Made On YouTube で、YouTube は Shorts と YouTube Create アプリ向けの対話型編集アシスタントに Gemini Omni を組み込んだ。簡単なテキスト指示で、発話部分のカット、音楽の同期、テキストのフックの追加、ショットの並べ替えができる。ライブ配信には自動吹き替え(Live auto-dubbing)が加わり、YouTube Music には会話しながら再生キューを作る Ask Music が、Podcast Lineup にはおすすめの podcast を AI が音声で紹介する週刊コンテンツが加わる。クリエイター向けには、自分の声と顔を守るための類似性検出も拡張される。提供時期が示されたのは、米国の視聴者向けに今秋登場するパーソナライズされたホームフィード(Custom Feeds)だけで、ほかの機能の具体的な日程はまだない。

🔗 Made On YouTube 2026 · Google のまとめ


アシスタントがほかのアプリと連携

Gemini:接続可能なアプリを新たに追加

9月23日 — Google は Gemini に接続できるアプリを新たに展開している。@GeminiApp のアカウントは、これらを MCP 接続と説明する。記事では、生産性向けの Airtable、Linear、monday.com、PandaDoc、Wispr AI、Zoho、制作向けの Adobe、Picsart、Squarespace、Webflow、日常生活向けの apartments.com、Experian、Peloton、SeatGeek という、3分野14サービスを挙げている。一方、@GeminiApp の投稿は新しいアプリを13件としている。これらのサービスは設定で有効にするか、会話中に @ を入力して呼び出せる。紹介された例には、Adobe を使った写真の照明の修正や、Experian を使った信用スコアの確認がある。記事は対象国や対象プランを明らかにしていない。

🔗 Google の発表 · @GeminiApp の発表

Meta の agent「Muse」:Shopify、PayPal、Expedia、Instacart に続き、ElevenLabs と HeyGen も

9月22日・23日 — Meta が9月8日に公開したパーソナル agent、Muse は、24時間足らずで商取引サービス向け connector を四つ発表した。公式アカウント @Muse によると、いずれも「近日中」に利用可能になるが、日付、料金、対象国は示されていない。23日には、生成メディア分野の ElevenLabs と HeyGen も参加を発表した。ElevenLabs は提供日を示しておらず、HeyGen は自社の MCP サーバーを利用する。

発表されたサービス発表で説明された用途発表元発表された提供時期
Shopifyweb 全体でワンステップ決済@Muse近日中
PayPal世界中で agent が管理する決済@Muse近日中
Expediaホテル予約@Muse近日中
Instacart食料品の宅配@Muse近日中
ElevenLabsナレーション、サウンドトラック、動画@ElevenLabs未発表
HeyGen自分の声を使った、公開準備が整ったアバター動画@HeyGen未発表

🔗 @Muse が発表した四つの connector · ElevenLabs が Muse に参加 · HeyGen が Muse に参加

Tesla 車と Google Slides、Sheets、Docs に Grok Bot を導入

9月22日 — Tesla は、SpaceXAI の agent である Grok Bot を同社の車に導入すると発表した。Connectors を使えば、運転者はハンドルから手を離さずに、Grok にメールの管理、カレンダーの整理、既存のファイル、会話、タスクの再開を任せられる。同日夜、@grok のアカウントもこの発表を紹介した。有効にするには、車内の Grok アプリにログインし、Grok のモバイルアプリかサイトから Connectors を追加した後、Grok Bot に必要な SuperGrok に加入する。投稿は対象車種や対象国を明らかにしていない。

同日、@bot のアカウントは、Grok Bot が Google Slides、Sheets、Docs にネイティブ接続できるようになったと発表した。メールの添付ファイルの扱いも改善され、ファイルの読み取りと追加が可能になったほか、web 閲覧を利用者のネットワーク経由で行える。SpaceXAI はタスクの高速化とデスクトップアプリの応答性向上も予告したが、裏付けとなる数値は示していない。

🔗 @grok による紹介 · Tesla の発表 · Grok Bot の投稿スレッド


Antigravity:ローカルの agent と /plan コマンド

SDK、Gemma 4 26Bでエージェントをローカル実行

9月23日 — PythonからGoogle Antigravityのエージェント機能を利用できるAntigravity SDKが、完全にローカルで動くワークフローに対応した。初期対応の対象は、24 GBを超えるVRAMまたはユニファイドメモリを備えたマシンで、LiteRT(Google AI Edge)を使って実行するGemma 4 26B A4B。LocalOpenAIAgentConfigは、Ollama、LM Studio、vLLMなど、OpenAI互換のあらゆるサーバーに接続できる。Googleは、API費用もレート制限もなく、コードがマシンの外に出ないことや、クラウドとローカルを組み合わせたワークフローを利点として挙げる。デモでは、Gemini 3.8 Flashがコードを見ることなく、脆弱性のある3つのモジュールの監査をクラウド上で95トークンを使って計画。その間、ローカルのGemma 4 26Bインスタンスが脆弱性を再現し、修正を書いて検証する。トークンの97.2%(3,322トークン)はローカルで処理される。これらの新機能は9月21日公開のSDK 0.1.18で導入された。同バージョンでは、エージェントが自律的に動けるよう、対話形式で質問するツールASK_QUESTIONもデフォルトのツールから外された。

🔗 Google Developersの発表

Antigravity 2.16.0と2.17.0、CLI 1.2.8と1.2.9

9月22日 — Antigravityアプリは同じ日に2つのバージョンを公開した。2.17.0では、コマンド/planが導入された。エージェントがコードを1行でも書く前に計画を作成し、利用者がそれを確認・修正できる。Plan Review Policyには、すべての計画を確認する、エージェントに判断を任せる、確認を省く、という3つのモードがある。また、ルール用に20,000トークンの予算を確保し、リポジトリごとの設定を.gemini/config.jsonから読み込む。従来の.agents/settings.jsonは参照されなくなった。2.16.0では、WSLディストリビューションへの接続、Word・Excel・PowerPoint文書のプロンプトへのドラッグ、サブエージェントのカード形式でのリアルタイム表示が可能になった。

アプリのバージョン改善の件数修正の件数主な新機能
2.16.01215WSL、Officeの添付ファイル、サブエージェントのカード
2.17.01110/plan、ルール用の20,000トークン予算

9月22日と23日 — ターミナル向けのCLI 1.2.9では、@構文でサブエージェントに直接メッセージを書けるようになり、headlessモードの動作も安定した。バックグラウンドタスクは、エージェントが非アクティブになってから数秒でキャンセルされず、最大30分間待機する。1.2.8ではコンテキストの圧縮を見直し、音声入力の上限を3分30秒に設定した。

🔗 Antigravityの変更履歴


Google DeepMind:Private AI Compute向けの暗号化された永続メモリ

9月23日 — Google DeepMindは、ハードウェアで隔離されたクラウド上のエンクレーブで処理を行うプラットフォーム「Private AI Compute」に、永続メモリを導入する仕組みを詳しく説明した。これまでプラットフォームは「ステートレス」で、タスクが終わるとすべてのコンテキストが消えていた。新しい層はクラウド上の暗号化された金庫のように機能し、鍵は利用者のデバイスにのみ保管される。Googleによれば、これによりGoogleを含め誰もデータにアクセスできない。モデルが情報を必要とすると、安全なエンクレーブが隔離されたメモリ内でデータを一時的に復号し、リクエストを処理して新しいコンテキストを記録した後、直ちに再暗号化する。例として、以前スマートグラスで見た組み立て手順をパソコン上で探し出す用途が挙げられている。

これは将来の構想として発表されたアーキテクチャであり、提供開始日も具体的な製品名も示されていない。信頼性の裏付けとして、Googleは更新版のホワイトペーパーに加え、デバイスが個人データを送信する前に確認できる、改ざん不可能なサーバーソフトウェアの公開台帳と、社名を明かしていない企業による独立監査の結果を公表した。

🔗 Google DeepMindの記事


Qwen:スマートフォン向けエージェントと低価格化した音声モデル

Qwen Intelligence、端末メーカー向けの3つのエージェント

9月23日 — Qwenは、まず端末メーカーを対象とするスマートフォン向けエージェント製品「Qwen Intelligence」を発表した。計画、実行、画像、メモリの各モジュールを必要に応じて組み合わせ、ルーティングによって計算をデバイスとクラウドに振り分ける。公開時点のエージェントは3つ。Mobile Plannerは複雑なタスクを計画し、Mobile-UseはAPIを優先して実行し、必要に応じてグラフィカルインターフェースを使う(Qwenによると、MobileWorldで82.1、AndroidDailyで97.2、エンドツーエンドの成功率は90%)。Mobile Creativeは3秒で画像を生成する。Qwenは4つのベンチマークを公開したが、エージェントの重みとコードは公開していない。Mobile-UseとMobile Creativeはすでに従量課金で提供され、Mobile Plannerの課金開始は「近日中」とされている。

評価対象のモデルまたはシステム(Qwenによる)MobilePA-Benchの総合スコア
Qwen-Planner-Agent 27B77,05 %
GPT-6 Astra76,84 %
Claude Opus 575,71 %
Claude Fable 574,53 %
GLM 5.373,88 %

🔗 QwenによるXでの発表 · Qwen-Planner-Agentのレポート

Qwen-Audio-3.1、最大95%の値下げ

9月23日 — Qwen-Audio-3.1では、Qwenの3つの音声モデル、音声認識(ASR)、音声合成(TTS)、リアルタイム会話(Realtime)が更新され、さらに2つが加わった。TTS-Nextは音声、効果音、背景音を1回の処理で生成する。ASR-Nextは話者を区別し、文字起こしにタイムスタンプを付け、感情や環境音を認識する。Realtimeは聞き取りと発話を同時に行い、途中で割り込むこともできる。QwenCloudでは、qwen-audio-3.1-realtime-plusの料金は入力音声100万トークン当たり6.4ドル、テキスト・音声出力100万トークン当たり24ドルで、コンテキスト長は262Kトークン。ファイルを対象とするASRは入力100万トークン当たり0.15ドル。公開されているAPIはこの2つだけで、ほかは「近日中」とされている。

モデルの系列発表された値下げ幅
TTS約70 %
Realtime約85 %
ASR最大95 %

🔗 Qwen-Audio-3.1のXでの発表 · QwenCloudのQwen-Audio-3.1-Realtime


Mistral Vibe:ChatとWorkを統合、CLIの権限管理を厳格化

ChatとWorkを統合、ナレッジベースはプレビュー版に

9月22日 — Mistralは、旧Le Chatに当たるアシスタント「Vibe」について、ブログ記事や投稿を伴わずに4件のリリースノートを公開した。中心となる変更は、ChatとWorkを1つの体験に統合したことだ。同じ場所で質問もタスクの開始もでき、モードの切り替えはFast / Thinkセレクターに置き換わる。SkillsはChat Agentsに代わり、Deep Researchもその1つになる。Free、Pro、Teamsアカウント向けの移行は9月14日に始まり、企業向けは10月1日から約6カ月をかけて進む。公開プレビュー版のエージェント型ナレッジベース(Agentic Knowledge Base)は、不透明だったメモリに代わり、閲覧・編集できるページと、呼び出された各情報の出典を提供する。Mini App Canvasはプロンプトから共有可能な小規模Reactアプリを生成する。また、有料プランのVibe WorkではExcelやCSVのスプレッドシートを扱えるようになる。

🔗 Mistralのリリースノート

Vibe CLI 2.25.8、権限チェックの回避を修正

9月23日 — Vibe CLI 2.25.8には、5件の追加と38件の修正が含まれ、そのうち複数は権限管理のセキュリティに関わる。相対パスによる許可リストでは、パスの末尾が同じというだけでファイルを許可しなくなった。シェルコマンドのワイルドカードでも、作業フォルダー外のパスの確認を回避できなくなった。また、親フォルダーへの許可はサブフォルダーに自動適用されなくなり、一部の承認要求が再び表示される可能性がある。リリースノートでは、18項目で言及される「Rust CLI」も初めて登場し、Vibe Codeのリモートプロジェクトの設定などが可能になった。企業向けには、組織が指定した設定がUnified Harnessのセッション開始時から適用される。Supabaseのようにクライアントシークレットを発行するMCPサーバーへのOAuth接続も修正された。

🔗 Vibe CLI 2.25.8のリリースノート


オープンソースとコマンドラインのコーディングエージェント

ZCode、セキュリティ問題を受けてオープンソース化

9月21日 — 追加情報:Z.aiは、コミュニティから指摘されたセキュリティ問題を受け、GLM-5.3の公式ツールと位置付けるエージェント型プログラミング基盤「ZCode」のコードを公開した。@zcode_aiのアカウントは、必要な修正を完了したと述べ、謝罪した。Apache-2.0ライセンスのリポジトリzai-org/ZCodeには、クライアント、バックエンドサービス、CLI、エージェントのランタイムが含まれ、9月23日時点で約6,500件のスターを集めていた。

With respect to the code data referenced by the community, we confirm that no such data is retained and that it has never been used for model training.

🇯🇵 コミュニティが言及したコードデータについて、当該データは一切保存されておらず、モデルの学習に使用されたこともないと確認しています。@zcode_aiのXへの投稿

ZCodeによると、その後2つの機関が状況を評価した。CAICTはAlibaba Cloud OSSの「zcode-prod」バケットにデータが残っていないとし、NSFOCUSはバケット自体とその中のオブジェクトが削除されたとした。両機関は、クライアントv3.14.0に修正が組み込まれ、Repo Wiki機能がなくなり、ローカルリポジトリのスナップショットをアップロードしていた処理が無効化されたことも確認した。Z.aiは、報奨金を伴う恒常的な脆弱性報告制度を発表し、評価報告書の全文を公開すると約束した。

🔗 GitHub上のZCodeのソースコード

Kimi Code 2.1.0、セキュリティを強化

9月23日 — MoonshotはKimi Code 2.1.0を公開した(新機能2件、修正18件)。目に見える新機能は、/settingsで選択でき、再起動後に有効になる実験的な全画面レイアウトだ。複数の修正でセキュリティも強化された。ファイルツールはシンボリックリンクを通じて作業フォルダーの外に出られなくなり、プロジェクトのローカル設定はワークスペースの承認後にのみ適用される。リポジトリのgit設定がバックグラウンドのgit操作中にコマンドを実行することも防がれ、ホームフォルダーやルートを指す追加フォルダーは拒否される。MCPサーバーのOAuthではオフラインアクセスを要求するようになり、毎時間の再認証が不要になった。同時にMoonshotは、Pythonで書かれた旧Kimi CLI(スター11,424件)をアーカイブした。旧CLIのバージョン1.51.0と1.52.0はKimi Codeへ案内する。

🔗 Kimi Code 2.1.0のリリースノート

DeepSeek Harness 0.1.7-rc.1、プレビュー版

9月23日 — DeepSeekは、8月13日に発表したMITライセンスのオープンソースのエージェント基盤「DeepSeek Harness」のv0.1.7-rc.1を公開した。これはリリース候補版(release candidate)で、リポジトリには8月以降21件のプレリリースがあるものの、現時点で安定版はない。主な追加機能は実験段階にある。Computer Useモードでは、エージェントがローカルのコンピューターを操作し、スクリーンショットを撮れる(Cua Driver MCPまたはネイティブドライバーを使用)。ブラウザー操作用には、Playwright MCP、Chrome DevTools MCP、Stagehandの3つのバックエンドが加わった。ウェブインターフェースには統合ターミナルと差分を使った変更レビューが追加された。headlessモードは標準入力からタスクを読み、イベントをJSONで出力する。エージェントはSSH経由でリモート環境でも作業できる。移行時には注意が必要で、DeepSeekの公式アダプターはMessages API専用になり、E2B実行バックエンドは廃止され、実験的なチームモードのメンバー数は8人から16人に増える。

🔗 DeepSeek Harness v0.1.7-rc.1

Gensparkのコーディングエージェント、GenCode

9月23日 — Gensparkは、Super Appに統合され、macOS、Windows、Linuxおよびコマンドラインで利用できるコーディングエージェント「GenCode」を発表した。中心となる特徴はモデルの選択肢だ。1つのアカウントから、APIキーを設定せずに、タスクごとにClaude、GPT、DeepSeek、または重みが公開されたモデルを選べる。Gensparkは、オープンモデルのコストは「10分の1から20分の1」だと説明する。GenCodeは、Claude Code用に作られた指示、ルール、メモリを1回の操作で引き継ぐ。npmパッケージ@genspark/gencodeのREADMEには、その出自が記されている。オープンソースのコーディングエージェントopencodeから派生したものだが、同プロジェクトとは無関係の独自製品であり、リポジトリ内の.opencode/フォルダーを意図的に共有している。各ステップの費用はGensparkクレジットで表示される。

🔗 GenCode · GensparkによるXでの発表


GitHub Copilot:支援付き承認とローカルのサンドボックス

JetBrains向けCopilot 1.18.0

9月22日 — JetBrains IDE向けCopilotのバージョン1.18.0では、支援付き承認(assisted approvals)が公開プレビューとして導入された。エージェントセッションでは、リスクが低いと判定されたツール呼び出しが自動で承認され、よりリスクの高い操作には引き続き利用者の判断が必要になる。過去のメッセージを編集し直すこともでき、その場合Copilotは新しい指示を送る前に会話とファイルの変更を巻き戻す。JetBrains向けCopilotで利用できるCodexエージェントには、変更前に進め方を確認、調整、承認できるプランモードが加わった。セッションでは組織や企業のSkillsと指示にも対応する。デフォルトで有効な組み込みのGitHub MCPサーバーは無効化できるようになった。JetBrains IDE 2025.1の利用者には、2026.1以降への更新を促す通知が表示される。

🔗 JetBrains向けCopilotの新機能

Copilotアプリ、ローカルセッションを隔離

9月23日 — GitHubのエージェント向けデスクトップアプリ「GitHub Copilotアプリ」に、ローカルのサンドボックスが公開プレビューとして追加された。プロジェクトごとに設定でき、ローカルセッションのコマンドがアクセスできる範囲を、ファイルシステム(読み書き可能、読み取り専用、アクセス禁止のフォルダー)、ネットワーク(インターネットとローカルネットワークへの外向きアクセス)、認証情報(HTTPS経由のGit、GitHub CLI)について制限する。企業が管理する設定でポリシーをさらに厳格化できる。OSが指定されたポリシーを適用できない場合、サンドボックスのシェルは保護なしで実行されず、エラーで停止する。サンドボックスはデフォルトで無効であり、プロジェクトの新しいセッション向けに有効化するか、進行中のセッションでは/sandbox onを使って有効化する。クラウドセッションとリモートホストには適用されず、設定もCopilot CLIの設定とは別になっている。

🔗 GitHub Copilotアプリのローカルサンドボックス


Cursor:本番環境への展開を担う2つのボット、トークンを7%削減

RolloutsとSecurity Review

9月23日 — Cursorは、コードのリリースにおける最終段階を担う二つのボットを発表した。TeamsとEnterpriseのプランで利用できる。Rolloutsは各pull requestが開かれた時点で監視計画(リスク、想定される影響、確認すべき兆候)を作成する。その後、デプロイのたびに計画をログ、メトリクス、トレースと照合し、環境ごとに「正常」「リグレッションを検出」「結論を出せない」のいずれかを判定する。リグレッションが起きた場合は疑わしい変更を特定し、承認を要する差し戻し用のPRを作成できるが、自らマージや差し戻しを行うことはない。Security Reviewは各pull requestを調べ、悪用可能な脆弱性(インジェクション、認証回避、コード内に残されたシークレット、SSRFなど)を報告する。それぞれに深刻度、攻撃経路、修正案が付く。10日間の試用クレジットでは、RolloutsをTeamsで約50件、Enterpriseで約500件の変更について試せる。

🔗 Cursorの変更履歴

品質を維持しながらトークンコストを7 %削減

9月23日 — Cursorは、品質を落とさずにユーザー向けエージェントのトークンコストを7 %削減した方法を説明した。最近のモデルには長い禁止事項の一覧が不要になったため、システムプロンプトを約66 %短縮し、実際のトラフィックを使ったA/Bテストで削減内容を検証した。会話の20 %未満でしか使われないものが大半を占める組み込みツールは、必要に応じて読み込む方式になった。

最適化の方法Cursorが測定した効果
システムプロンプトの簡素化プロンプトの約66 %を削除
組み込みツールを必要に応じて読み込み静的コンテキスト内の説明用トークンが60 %減少
明示的なキャッシュ境界コールドキャッシュでのミスが20 %減少
10行ごとに行番号を表示キャッシュから読み取るトークンが1.6 %減少
変更全体ユーザーのトークンコストが7 %減少

🔗 Cursorのブログ記事


NVIDIA:オープンな話者分離とAI Day Singapore

Nemotron 3 Diarizationは最大8人の話者を識別

9月23日 — NVIDIAは、会話の中で誰がいつ話しているかを、発話が重なる場合も含めて判定する、1億パラメータのオープンウェイトモデルNemotron 3 DiarizationをHugging Faceで公開した。追跡できる話者は最大8人で、前身のStreaming Sortformerの4人から増えた。後処理にもストリーミングにも対応し、バッファの遅延は30.4秒から0.32秒まで調整できる。発話内容は文字起こしせず、話者ごとの時間区間を出力するため、文字起こしモデルと組み合わせて使う。VoiceArenaのDiarization-Benchの初期結果では、話者分離の誤り率14.72 %で12システム中1位となり、次点は19.3 %だった。ただしNVIDIAによれば、この初期順位は今後変わる可能性がある。旧モデルと比べると、八つの評価データセットで誤り率が平均41 %低下した一方、CALLHOMEの二人での会話ではわずかに悪化した。ライセンスはOpenMDW 1.1。

公表された指標Nemotron 3 Diarization前モデル
追跡できる話者の最大数84
30.4 sでの処理速度(バッチサイズ32、RTX PRO 5000)リアルタイムの15 113倍2 619倍
30.4 sでのDIHARD IIIの誤り率12.73 %19.09 %

🔗 Hugging FaceブログのNemotron 3 Diarizationの記事

AI Day Singapore:東南アジアでのVera RubinとNemotron

9月22日 — NVIDIAは、9月22日と23日に開催されたAI Day Singaporeの期間中、22日午後7時30分(PT)に公開した記事で、Shopee、Garena、Moneeの親会社Sea Limitedを、モデルとエージェントの開発・展開をより大規模に進めるためにVera Rubinプラットフォームを採用したASEAN地域初の企業として紹介した。記事の残りでは、オープンモデルNemotronの現地向け展開を示している。AI Singaporeは地域の言語に特化したSEA-LIONシリーズをNemotronモデルへ拡張する。ベトナムではViettel AIがNemotron 3 Superをベトナム語向けにファインチューニングし、ベンチマークVMLUで首位に立った。タイではiApp TechnologyがNemotron 3 Nanoをタイ法向けに適応させ、オープンソースで公開したOpenThai 2.0 Legalを開発した。これは約43 000人が利用する法律相談チャットボットThanoyを動かしている。

🔗 AI Day SingaporeでNVIDIAとパートナーが東南アジア全域のAIの進展を紹介


障害を起こさずにAIを本番環境へ導入する

二つの発表に共通する考え方は、トラフィックを切り替えたりマシンを更新したりする前に、実際の負荷で検証することだ。

Together AIのカナリアデプロイ

9月22日 — Together AIは、9月15日の更新から利用可能になったDedicated Model Inferenceの段階的デプロイについて詳しく説明した。停止やURLの変更を伴わずに、エンドポイントの背後で提供するモデルを変更できる。用意された戦略は三つ。カナリア方式では新モデルへのトラフィックを段階的に増やす(既定では5 %、25 %、50 %、100 %)。ブルーグリーン方式では全トラフィックを一度に切り替え、段階的置換ではレプリカを一つずつ交換する。カナリア方式では各段階の後に、遅延またはエラー率を旧モデルと比較し、悪化していればデプロイを一時停止する。公開されたデモでは、Qwen2.5-7BからQwen3.5-9Bへの移行は、トラフィックが10 %に達した時点でp95遅延が137 %悪化したため停止した(1 740 ms対734 ms)。旧モデルへの復帰までに処理した6 800件のリクエストは、いずれも失敗しなかった。

🔗 カナリアデプロイ:停止せずに本番環境のモデルを更新

NVIDIAのNVCREとNodeWright

9月23日 — NVIDIAは、Kubernetes上のGPUクラスター向けに、AIファクトリープラットフォームのソフトウェア層DSX OSに属する二つのオープンソースプロジェクト(Apache 2.0)を紹介した。NVIDIA Cluster Readiness Engine(NVCRE)の出発点は、クラスターがすべてのヘルスチェックに合格しても、分散学習では失敗し得るという問題だ。そのため、トポロジーに応じて選んだノード群に実際の負荷(NCCL通信テスト、DCGM診断、NeMoの事前学習)をかけて稼働準備を確認し、問題のあるノードを特定する。診断モードでは、失敗したグループを二分しながら疑わしいノードを絞り込む。記事は負荷の例として、80億および560億パラメータのNemotron 5モデルを挙げているが、詳細は示していない。NodeWrightは、NVIDIAが本番環境で使っていた旧称Skyhookで、保護対象のジョブが終わるのを待ってからノードのシステム設定(カーネル設定、セキュリティエージェント、脆弱性修正)を更新する。更新は固定、線形、指数関数的な規模の波で進み、失敗したバッチが多すぎる場合は自動停止する。

🔗 AIの処理を開始する前にGPUクラスターの稼働準備を検証 · NodeWright


二つのオープンデータセット:複数人の会話と科学コーパス

Basis Conversations 1500

9月23日 — BasisはHugging FaceでBasis Conversations 1500を公開した。33か国の2 645人による自発的な会話1 502時間分で、英語からメグレル語、コサ語まで22言語を収録する。各会話には二人から四人が参加し、それぞれの音声が同期した個別トラック(FLAC 48 kHz)に記録されている。これにより、チームによればモデルがなお苦手とする発話の重なり、割り込み、発話の順番を研究できる。約100時間分には、人手による詳細な注釈(113 096件の判定)が付く。共感的またはいら立った声での相づち、気まずい沈黙、協調的または競合的な発話の重なりなどが対象だ。付属の文字起こしは自動生成であり、検証せずに学習の正解データとして使ってはならない。記事では商用・研究用途に自由に使えるデータセットとして紹介しているが、Basis独自のライセンス(basis-data-license-1.0)が適用され、アクセスには手動審査が必要となる。

🔗 Basis Conversations 1500

QVAC Genesis III

9月23日 — Tether AI Researchは、科学、技術、工学、数学分野の小規模モデルの事前学習に向けた合成コーパスの第3弾、QVAC Genesis IIIを公開した。430.6億トークンの追加により、全体では19分野にわたる約1億6 000万文書、1 914.3億トークンに達した。付随する論文はCOLM 2026に採択されている。この手法では、小規模な学習者モデルQwen3-1.7B-Baseに問題を解かせ、誤答は訂正の説明に、正答は各選択肢の分析につなげる。このコーパスでゼロから学習した17億パラメータのモデルは、同じトークン予算でCosmopedia-v2を使って学習した同一モデルを明確に上回った。コーパスは非商用ライセンス(CC-BY-NC 4.0)で公開され、それを使って学習したモデルはApache 2.0で公開すると発表されている。

評価したベンチマークCosmopedia-v2に対する改善(同じトークン予算)
ARC-Easy+28.57ポイント
ARC-Challenge+21.35ポイント
GPQA Diamond+2.52ポイント
MMLU STEM+15.03ポイント

🔗 QVAC Genesis III


気候と食料に向けたAI

Ai2とGlobal Fishing Watchがエージェントで海洋を監視

9月23日 — ニューヨークのClimate Weekで、Ai2とGlobal Fishing Watchは、AI、とりわけエージェントを海洋監視と漁業管理に導入するための提携を発表した。両組織はすでに協力しており、今後は共同開発に進む。共通の検出パイプライン、衛星画像をリアルタイムで分析する新たな視覚モデル、複数のデータソースを突き合わせるエージェントを開発する。Global Fishing Watchは、オープンモデルを基盤とするAi2の地球観測プラットフォームOlmoEarthを利用し、自社データへの注釈付けと独自モデルの学習を進める。Skylightによるリアルタイムの船舶検出結果は、海洋保護区の管理者向けポータルに取り込まれる。両チームは、分析担当者が船舶の履歴を尋ねられるShippyなどのエージェントも改良する。発表に日程や金額は示されていない。

🔗 Ai2とGlobal Fishing Watch、AIエージェントを海洋監視に導入するため提携

Google.orgとGates Foundation、2億人の小規模農家を対象に

9月18日・22日 — 追加情報:Google.orgとGates Foundationは、サハラ以南のアフリカと南アジアの小規模農家2億人に、気候、農業、言語に関するAIツールを届ける共同事業を拡大した。当初の目標は5 000万人だった。両者は合わせて1億ドルを拠出し、Googleの研究者とエンジニアが技術面で支援する。Gates Foundationの発表は9月18日付で、blog.googleが22日夜に取り上げた。このプログラムは、インドのWadhwani AIやDigital Greenなどの地域組織に資金を提供するほか、気候プラットフォームTomorrowNowへのAI予測の統合、1メートル未満の解像度での農地区画の地図化、40を超えるアフリカの言語でのオープンな音声・テキストデータセットを支援する。小規模農家は世界の食料の約35 %を生産している。

🔗 Google.orgの発表 · Gates Foundationのプレスリリース


短報

  • Anthropic、コードの近代化 — 「Notes from the Field」シリーズで、顧客企業に派遣されたAnthropicのエンジニア、Jonah EzekielとLexie Tonelliが、エージェントによるコードの近代化に備えるための6段階を提案した。目標の設定、テストによる「証明」、段階的な人間のレビュー、前提条件の整備、エージェントのワークフローの構築、そして開始だ。費用の数字は示さず、試験導入で測定するよう勧めている。🔗 出典
  • Boris Cherny、Claude Agent SDKをLeanで検証 — 22日夜、Claude CodeのBoris Chernyは、証明支援系Leanを使い、Opus 5.5にClaude Agent SDKを形式的に検証させたと報告した。短いプロンプトをいくつか与えた結果、バグや競合状態を修正する16件のpull requestが作られた。TLA+も使っているという。🔗 出典
  • Codex CLI 0.156.1 — 0.156.0の修正版で、CLIのモデル選択画面にGPT-6 SolとGPT-6 Lunaが追加された。レート制限に達した際の案内ではLunaを推奨するようになり、GPT-5.5とGPT-5.6からの移行も提案される。🔗 出典
  • AirbnbとGPT-6 Astra — 新たな契約により、Airbnbのエンジニアリング部門と製品部門は、GPT-6 Astraを含むOpenAIのモデルを、OpenAI APIとAmazon Bedrock経由でより広く利用できるようになる。最高技術責任者のAhmad Al-Dahleによると、両部門が提供する機能は1年前より約80%増えた。契約金額は公表されていない。🔗 出典
  • OpenAI Academyが2周年 — 2024年9月以降、250件以上のイベントを開き、400万人以上に届けてきた。OpenAIは、パートナー組織の従業員が評価を経てワークショップの進行方法を学ぶ、コミュニティ講師プログラム(Community Trainer Program)を試験運用している。🔗 出典
  • LEDディスプレーが音声アシスタントに — OpenAI Developersのブログで、Sid Rampallyは、Codexの助けを借りてRaspberry Piで制御する128 × 64ピクセルのLEDパネルを配線・プログラムした経緯を紹介した。GPT-Live-1が会話を担い、Responses APIを通じて検索と表示をGPT-5.6 Lunaに任せる。🔗 出典
  • MedGemmaのダウンロード数が1,000万件を突破 — Googleは、公開している医療モデルの現場での活用例を紹介した。ザンビアでは3,500人以上の女性を対象とした子宮頸がん検診、デリーのAIIMS病院では試験運用、インドネシアでは結核の検出に使われている。Googleは、モデルの出力を診断に直接用いるべきではないと注意を促している。🔗 出典
  • Google DocsのGemini Notebook — Docsで@を入力すると、ノートブックを情報源として指定できる。Geminiはその資料を根拠に、文中に出典を付けながら文章を作成し、Workspace Intelligenceを通じてメールやファイルの情報とも組み合わせる。Business StandardとPlus、Enterprise StandardとPlus、Education Plus、Google AI ProとUltraの契約者が利用できる。🔗 出典
  • Google Flowの6つのツール — Google Labsは、クリエイターがGoogle Flow Toolsで作った6つのツールを公開した。同期した効果音を作るMondo Sónico、動く字幕のCaptionCast、サムネイル用のThumbnailForge、3D表面にテクスチャを施すSurface、モーションデザイン用のCollageMotion ProとSwissFlow Studioだ。いずれも複製して改変できる。🔗 出典
  • Google Beam、フランスでも納入開始 — 対面しているような存在感の再現を目指すGoogleのビデオ通信プラットフォームBeamは、HPと共同で販売され、フランスを含む6か国で納入されている。パートナーは18社。社内調査では、チームのつながりが50%強まり、フォローアップ会議が21%減ったという。🔗 出典
  • Android EnterpriseとGeminiエージェント — Geminiは画面に表示された内容を踏まえ、アプリをまたぐ一連の作業を実行できる。一方、保護策によって個人用エージェントは仕事用プロファイルにアクセスできない。管理者は保有する全端末でAIによる自動化を制限または無効化できる。🔗 出典
  • AI Briefがフランス語に対応 — 利用者自身の言葉でGoogle AdsのAI Maxキャンペーンの作成を支援するAI Briefのクローズドベータが、フランス語、オランダ語、ドイツ語、イタリア語、日本語、ポルトガル語、スペイン語に対応した。🔗 出典
  • Gemini CLI、9月23日のnightly版 — 安定版ではなくnightly版で、Gemini 3.8 FlashとGemini 3.5 Flash Liteが追加された。APIキー、Vertex AI、またはゲートウェイ経由ですぐに利用でき、Googleアカウントでは実験用フラグを有効にすると使える。22日火曜日に安定版のリリースはなかった。🔗 出典
  • EcoHash、動画生成の最適化結果を測定 — 96 GBのRTX PRO 6000上で、EcoHashはMiniMax H3の動画生成時間を174.8秒から40.8秒に、Wan2.2のテキストからの動画生成時間を132.3秒から10.7秒に短縮した。後者には4ステップに蒸留したLoRAを使用した。試した10種類の設定のうち、2つのコンパイルモードを含む3種類では変化がなかった。🔗 出典
  • クリミア・タタール語、偏ったテストを回避 — クリミア・タタール語の音声認識モデルを開発する人物が、コーパス内で4冊のオーディオブックが重複していることを発見した。主要テストの音声抜粋の96.9%には、学習データ内に同一のものがあった。修正後、LoRAによる追加学習とデコーダーの調整を行い、単語誤り率は0.3463から0.1701に下がった。🔗 出典
  • Falcon-H1とmlx-lm — mlx-lm 0.31.3では、KVキャッシュを使わない場合、学習中にFalcon-H1の66層のうち最初の層しか実行されない。このためLoRAの学習は、実質1層のモデル上でエラーも警告もなく進んでしまう。修正は1行で済み、issueが作成されている。🔗 出典
  • エージェントとオープンソースへの貢献 — Hugging FaceのQuentin Gallouédecは、エージェントが作る貢献は実際の需要を示す手がかりを損ない、メンテナーのレビュー時間を奪うと考えている。無作為に選んだプロジェクトへエージェントを投入するのをやめ、まずそのプロジェクトを使うよう求めた。🔗 出典
  • Phionyx、IETFに草案を提出 — Phionyxの作者は、評価結果をシステム間で受け渡しても、その条件と限界を保てるようにするための個人草案、Claim-Preserving Exchange of AI Evaluation Evidenceを提出した。作業部会による採択には至っていない。🔗 出典
  • Kimi Work 3.2.12 — Moonshotのデスクトップエージェントでは、PPT、Excel、Word、Markdownファイル内の一部分を選択し、その箇所を指定して編集させられる。添付ファイルのサイズ制限も撤廃された。🔗 出典
  • Qwen-Image-2.1、オープンモデルの首位に — Arenaによると、Qwen-Image-2.1は画像編集で1,367点を獲得し、オープンモデル中1位、総合16位となった。テキストからの画像生成でも1,228点でオープンモデル中1位、総合17位となった。🔗 出典
  • CopilotアプリにOpenTelemetry — 管理者は、GitHub Copilotアプリのエージェントセッションのトレース(モデルへのリクエストや使用したツール)を、managed-settings.jsontelemetryプロパティを通じて監視ツールにエクスポートできる。プロンプトと応答の内容はデフォルトで除外される。🔗 出典
  • Copilot CLIとC++ — Copilot CLIのMicrosoft C++ Language Serverは、プロジェクト全体のシンボルについて永続的なインデックスを作成するようになり、デフォルトで有効になった。初回の作成には時間と多くのメモリを要する場合がある。GitHubは改善幅を数値で示していない。🔗 出典
  • 100万行のpull request — GitHubのエンジニアリング記事は、Copilotアプリが2,200ファイル、100万行以上、400件以上のコメントを含むpull requestをどう表示するかを説明した。コードの配置情報は事前に計算し、コメントの配置情報は表示領域の近くで測定する。🔗 出典
  • Genspark、Opus 5.5、GPT-6、Grok 4.7を追加 — 23日夜、GensparkはAI Chat、Code Agent、ClawでClaude Opus 5.5、Grok 4.7、GPT-6 Sol、GPT-6 Lunaを利用できるようにした。各モデルの提供元による説明を紹介しているが、プランや料金は明らかにしていない。🔗 出典
  • GitHubとYaleの調査 — 米国のGitHub利用者1,039人を対象とした調査で、71%がAIの環境への影響を懸念し、10人中8人が省エネルギーなコードを書くためのツールを求めていた。GitHubは、マーケティング情報の受信に同意した人々から選ばれた標本であり、代表性はないと説明している。🔗 出典
  • Zed 1.21.0 — 安定版では、自分のAPIキーを使ってClaude Opus 5.5とGPT-6 Astra、Sol、Lunaを利用できる。AgentパネルにはSuperGrokへの接続が追加され、エージェントの作業中はデフォルトで端末のスリープを防ぐ。🔗 出典
  • Warp — GPT-6 SolとLunaに続き、Claude Opus 5.5もWarpターミナルとWarp Agent CLIで利用できるようになった。Grokのサブスクリプションを接続する利用者はGrok 4.7も使える。提供開始の案内のみで、料金は示されていない。🔗 出典
  • Microsoft TeamsのDevin — これまでチャネルでの利用に限られていたDevinが、ダイレクトメッセージやグループチャットにも応答するようになった。チャネルからAutomationsを起動し、質問や承認を求めるカードも送れる。アプリに新たな権限は必要ない。🔗 出典
  • Scribe v2 Medical — 9月11日から利用可能だったElevenLabsの臨床向け文字起こしモデルが正式に発表され、新たな数値も示された。臨床音声ではScribe v2と比べて単語の誤りが35%少ないという。料金は1時間当たり0.22ドルから。🔗 出典
  • ElevenLabsからSora 2が終了 — ElevenLabsは、OpenAIが9月24日にSora APIを終了するため、スタジオからSora 2とSora 2 Proを削除する。この期限はOpenAIが3月24日に発表していた。影響を受けるワークフローは、Gemini Omni 1.1 Flashなど別の動画モデルへ移行する必要がある。🔗 出典
  • Cohere Model Vault、カナダで提供開始 — Cohereは、単一テナント専用の推論プラットフォームModel Vaultがカナダで利用可能になったと発表した。クラウドのリージョン、事業者、料金は明らかにしておらず、製品ページにもまだカナダの記載はない。🔗 出典
  • Cohereと変革の進め方 — CohereのKatherine Correiaは、AIを単なるツールではなく参加者として組み込み、作業を「検証可能」「判断が必要」「両者の混合」に分類し、用途ごとに管理するようブログ記事で提案した。製品や数値の発表はない。🔗 出典

これが意味すること

Anthropicの成果は、コーディングエージェントを基礎生物学の研究へと広げた。約950のClaudeエージェントが21時間で20万種類以上の逆転写酵素を選別し、人間が介入したのは最初にプロンプトを与えたときと、最後に実験を行ったときだけだった。ボトルネックは仮説の選別に移り、Anthropicはそれ自体を研究対象としている。ただし、慎重な評価が必要だ。ARTの機能は不明で、成果は現時点ではプレプリントとして発表されている。同じように、多数のエージェントを動かし、測定によって作業を方向づける手法は、3,000件以上の変更によってclaude.aiを高速化した集中的な開発作業や、Leanを使ったClaude Agent SDKの形式的検証にも見られる。

エージェントのサンドボックスの安全性が、公に議論される課題になっている。Perplexityの監査では、2つの境界が分けて検証された。仮想マシンの隔離は108回の試行すべてで維持された。一方、ネットワークのフィルタリングは、不十分なDNS検証やCDNの共有アドレスを悪用したモデルによって、54回中11回突破された。外部の10プラットフォームのうち8つには、少なくとも1つの回避手段があった。FableとGPT-6 Astraの2モデルは、この試行を拒否した。同じ日、GitHub Copilotアプリは、保護なしで動作させずエラーで停止するローカルサンドボックスを提供した。Claude Codeのautoモードは読み取り専用コマンドまで分類器にかけ、Vibe CLIとKimi Codeは権限確認の回避手段を塞いだ。その2日前には、ZCodeがコミュニティから指摘された問題を受けてコードを公開していた。

音声は、操作を実行するためのインターフェースになりつつある。Gemini 3.8 Flash TTSとFlash-Lite TTSの音声出力料金は、以前のプレビュー版の半額以下になった。2026年末までは100万トークン当たりそれぞれ9ドルと6ドルで、以前は20ドルだった。また、記録された同意を条件とする声の複製機能も追加されたが、欧州経済領域ではAI Studio経由で利用できない。Qwenは音声関連製品群の料金を70〜95%引き下げると発表し、NVIDIAは8人の話者を識別するモデルを公開した。Basisは声が重なり合う会話を1,500時間分公開している。一方、ChatGPT Voiceは、ChatGPT Workのプラグインとタスクを通じて、会話から操作の実行へと進んでいる。

最後に、物理世界で動くAIの公開も進んでいるが、条件は一様ではない。FLUX 3 Actionは、70億パラメータのモデルでRoboLab-120の首位に立ち、NVIDIAとともにLeRobotへ統合された。また、高速で信頼性の高いポリシーによって、高コストな推論の必要性を減らせることも示した。GPT-6 Astraを監督役に使った場合の成功1回当たりの費用は8.77ドルで、Astra単独では13.47ドルだった。ただし、「公開」の内容はそれぞれ異なる。FLUX 3 ActionとBasis Conversations 1500には独自のライセンスがあり、QVAC Genesis IIIは非商用ライセンスで、Qwen Intelligenceはモデルの重みを公開せずベンチマークだけを公開している。これらを再利用するなら、スコアと同じくらいライセンスが重要になる。


出典