検索

MetaがMuse Sparkを用いて執筆した数学論文6本を公開、PerplexityがDecisions APIを提供開始、AnthropicがClaude Frontier Academyを開設

ai-powered-markdown-translator

gpt-6.1-solを使用してフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

10月2日金曜日、Metaは、研究者が同社のモデルMuse Sparkを用いて作成した数学論文6本を公開した。Metaによれば、そのうち5本は未解決だった研究課題に答えるものだ。AnthropicはClaude Frontier Academyで10 000人の導入エンジニアを育成するために1億ドルを投じ、Claude Code 2.1.288を公開した。一方、NVIDIAは64 GBのDGX Sparkを4 999ドルから提供すると発表した。前夜の2件の発表も、この日の話題に加わった。確率で回答し、モデルの重みも公開されたPerplexityのDecisions APIと、初めてTPUを搭載して軌道に投入されるGoogleの衛星だ。


MetaがMuse Sparkを用いて執筆した数学論文6本を公開、Ai2がAstaBriefを公開、GoogleのAIがインフルエンザを予測

10月2日 — Metaは研究ブログで、研究者が同社独自のモデルMuse Sparkを用いて作成した数学論文6本を公開した。Metaによれば、そのうち5本はこれまで未解決だった研究課題に答えるものだが、記事ではどの1本が例外なのかを明らかにしていない。数学者たちはここ数か月、研究用の独自の補助構成(独自の研究支援の仕組み)を使わず、meta.aiのチャット画面でMuse Spark 1.1と1.2のThinkingモードを直接使用して研究を進めた。

Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?

🇯🇵 私たちのAIモデルが数学・物理学・化学の5つの競技会で金メダル水準の成績を収めた後、私たちはさらに難しい問いを立てました:問題が本当に未解決で、解決への道筋が存在しない場合でも、AIは貢献できるのでしょうか? — X上の@AIatMeta

示された手順は厳格だ。数学者のチームが研究を主導し、別のグループが成果を査読し、各論文で、主に研究者が執筆した箇所とAIが執筆した箇所を明示する。モデルの貢献は論文によって大きく異なり、補助的な計算から節全体の執筆まで幅がある。

数学分野Metaが発表した成果MetaによるMuse Sparkの貢献
確率論高次元のランダムなガウス点を通る楕円体を当てはめるための厳密な閾値証明戦略
微分方程式質量臨界型の双調和非線形シュレーディンガー方程式における、負のエネルギーを持つ球対称解の有限時間爆発。2015年以来の未解決問題計算、論証の検証、証明の修正
群論半アーベル群が必ずしもモノミアル群とは限らない:エム・キダ(2024)の予想に対する位数384の反例反例を発見した、GAPで記述した探索プログラム
最適化サイクルによる緩和が元の問題を正確に捉える条件を示す厳密な規則確率論的な定式化への変更、反例、証明戦略
算術物理学p進弦理論の2点関数が、テイト曲線よりはるかに広い曲線のクラスで高さ関数と一致証明の候補、技術的な3つの節の執筆
非結合代数可解な進化代数に関する予想への次元3の反例反例と別の特徴付け

Metaは、これらの問題のうち3つが他でも解決されていることを認めている。ガウス閾値については8月に公開された3本の研究、キダの予想の反例についてはAIエージェントNilradicalによる9月16日の報告、進化代数についてはフーとウェンによる反例がある。Metaによれば、同社の成果は別の手法で独立に得られたものだ。この発表に先立ち、OpenAIは9月21日、社内モデルが100件を超える未解決問題を解いたと述べていた。Metaは、一般向けのモデルをそのまま使用したことと、AIの貢献割合を透明に示したことを強調しており、すべての証明は引き続き数学者によって検証、修正、書き直しが行われている。

🔗 未解決の研究課題を共に解く(Meta AI Research)

AstaBrief 8B:Ai2が引用付き科学レポートを執筆するモデルを公開

10月2日 — Ai2は、研究上の問いと文献の抜粋を引用付き科学レポートに変換するモデル、AstaBrief 8Bを公開した。このモデルは現在、Ai2の科学向けエージェント型プラットフォームAstaの「レポートを生成」機能で、Claudeが動かすThinkingモードと並び、Fastモードを担っている。構成はシンプルだ。Qwen3-8Bを基に、ScholarQAパイプラインで生成した47 000件の例を使って教師あり微調整(SFT)を行い、その後、約6 000組のペアを使って直接選好最適化(DPO)を実施する。強化学習は使わない。モデルカードによればApache-2.0ライセンスの重みと、学習データが公開されており、研究室が独自の機器で実行できる。

モデルはレポートを1回の処理で執筆する。Astaのパイプライン全体では、レポート作成にかかる時間はFastモードで平均51,1秒、Thinkingモードで178,5秒であり、約3,5倍速い。小規模な人による評価(14問、研究者3人)では、総合的な好みでDR Tuluが優勢だったものの、研究者3人のうち2人は引用の正確さでAstaBriefを選んだ。Ai2は、学習と評価の大部分が2025年に行われたものであり、現在のモデルとの比較評価はやり直していないと注意を促している。

🔗 AstaBriefをオープンソース化(Ai2)

インフルエンザ:GoogleのAIで開発したモデルがCDCのFluSight評価で39モデル中首位

9月30日 — Googleは、同社のAIを使って開発したインフルエンザ予測モデルが、2025-2026年シーズンのFluSightで最高の成績を収めたと発表した。FluSightは、米国疾病予防管理センター(CDC)が10月から5月まで毎週、入院患者数の予測を集約する仕組みだ。CDCのシーズン終了報告もこれを裏付けている。34チームが提出した53モデルのうち、採用された39モデルでは、個別モデルの首位はGoogle_SAI-FluEnsで、相対WISは0,56だった。この指標は誤差を示し、低いほど予測が優れている。OHT_JHU-nbxdを含む3モデルが0,58で続いた。CDCが一般向けの情報発信に使用するFluSightのアンサンブルは第7位だった。

これらの予測は、GoogleのAIツールEmpirical Research Assistance(ERA)を使って開発された。ERAはさまざまな科学分野向けに最適化アルゴリズムを生成し、信頼されたテスターに公開されている。関連する研究論文では、LLMが導く木探索によって、自ら予測コードを記述、評価、改善する自律システムを説明している。このシステムはCOVID-19と呼吸器合胞体ウイルス(RSウイルス)のモデルも生成した。

🔗 Google Researchの記事 · CDCのFluSight 2025-2026報告書


PerplexityがDecisions APIを提供開始しpplx-decider-v1-27bを公開、llama.cppが意思決定モデルを提供

10月1日 — Perplexityは新しいAPI、Decisions APIを公開し、それを動かすモデルpplx-decider-v1-27bをApache 2.0ライセンスで公開した。発表は夕方、同社の開発者向けアカウント@perplexitydevsから行われた。この意思決定モデル(意思決定用モデル)は回答文を書く代わりに、固定された回答候補の集合に対する確率分布を返す。テキスト、JSON、画像を読み取るが、回答文を書いたり、コードを生成したり、推論過程を説明したりはしない。

質問には3種類が用意されている。noulは「はい」の確率を返し、choiceは1から255の選択肢から選び、各選択肢の確率と信頼度指標を返す。scoreは内容を最大10段階の尺度に位置付ける。1つのリクエストで同じ内容に対して最大128問を尋ねることができ、質問を含めた入力は262 144トークン未満でなければならない。料金は入力100万トークン当たり0,04ドルで、出力は無料、リクエストごとの料金もない。どのプランでも、各組織は毎秒10件のリクエストを送信できる。Perplexityは分類、ルーティング、評価基準に沿った採点を想定している。公式の実装例(実装例集)ではサポートチケットを振り分け、Decisions APIが最初の判断を行い、Agent APIがエスカレーションを処理する。

このモデルはQwen3.8-27Bを基に微調整されている。Hugging Faceに公開された重みを動かすには、約49 GiBを収容できるCUDA対応GPUに加え、作業用メモリが必要だ。モデルカードでは、別の意思決定モデルJevと、基盤モデルを11のベンチマークで比較しており、pplx-decider-v1-27bの結果はPerplexityのAPIを通じて測定されている。

ベンチマーク(正解率)JevのスコアQwen3.8-27B(基盤モデル)のスコアpplx-decider-v1-27bのスコア
WinoGrande90,70 %73,10 %83,30 %
FinancialPhraseBank76,98 %75,68 %84,18 %
RAGTruth77,27 %61,53 %88,80 %
JudgeBench78,57 %68,86 %78,29 %
BBH94,27 %72,80 %82,80 %
JevBench public hard73,27 %72,28 %70,30 %
TabFact89,80 %78,60 %90,60 %
ContractNLI77,45 %80,78 %80,78 %
Circa84,60 %87,00 %89,20 %
Belebele95,00 %93,20 %94,00 %
TruthfulQA binary92,00 %82,80 %85,40 %
総合(モデルカードによる)84,51 %74,76 %85,71 %

発表で強調された総合の行では、pplx-decider-v1-27bが85,71 %でJevの84,51 %を上回っているが、モデルカードはこの行の計算方法を明らかにしていない。公開された表によれば、JevはBBHやWinoGrandeを含む11ベンチマーク中6つで依然として優位にあり、JevBench public hardではPerplexityのモデルが基盤モデルさえ下回っている。

🔗 @perplexitydevsの発表 · Decisions APIのドキュメント · Hugging Face上のpplx-decider-v1-27b

llama.cppがJev互換のAPI /v1/systemoneで意思決定モデルを提供

10月2日 — llama.cppのサーバーは、新しいエンドポイント/v1/systemoneを通じて意思決定モデルを提供できるようになった。この機能は10月2日にマージされたPR第29818号で追加された。スアンソン・グエンとヴィクトル・ムスタールが執筆したggml-orgの記事は、その仕組みを説明している。状態(テキスト、JSON、スクリーンショット)と、型を指定した質問choice、score(2から10段階)、noul(はい・いいえ)を送ると、モデルは1回の処理で選択肢ごとの確率を返す。APIは、TypeSafeのモデルJevが導入したSystem One形式を採用しているため、既存のクライアントはベースURLを変更するだけで利用できる。ルーターモードでは、同じサーバー上で必要に応じて複数のモデルを読み込める。

対応する意思決定モデルモデルサイズ基盤モデル質問当たりの所要時間の中央値
Julia-1(50を超える言語に対応)144MmmBERT-small3 ms
Laya421MModernBERT-large5 ms
Kev-4B4BQwen3.5-4B-Base12 ms
lev4BQwen3.5-4B36 ms
OpenJev(画像も読み取る)27BQwen3.8-27B43 ms

所要時間はNVIDIA RTX PRO 6000で測定された。次に対応が予定されているモデルはClefだ。Cloudflareが10月1日に、Jev互換のAPIとともに発表した。ggml-orgは10月2日、Hugging FaceにClefとClef-flashのGGUFリポジトリを作成した。

🔗 llama.cppの新機能:意思決定モデル


AnthropicがClaude Frontier Academyを立ち上げ、1万人のエンジニア育成に1億ドルを拠出

10月2日 — Anthropicが、1億ドルの拠出を伴う研修プログラム、Claude Frontier Academyを立ち上げた。目標は、2027年末までに1万人の最先端の導入エンジニア(Frontier Deployed Engineers、FDE)を育成すること。最初の研修グループには、Accenture、Bain、Capgemini、Commonwealth Bank of Australia、Deloitte、McKinsey、Morgan Stanley、Novo Nordiskのエンジニアが参加する。

最初のプログラムであるFrontier Deployed Engineer Residencyは、医師の研修モデルを取り入れている。プログラムのページによると、まず4日間の集中研修から始まる。最初の3日間は対面で、架空の企業向けにClaudeを使ったシステムを構築し、その後、採点付きの試験を受けてClaude Resident Engineerのバッジを取得する。続いて、自分の組織でClaudeの導入を進める12週間の実地研修を行い、最後にClaude Frontier Deployed Engineerのバッジ取得に向けた最終評価を受ける。最初のバッジ授与は2027年初めを予定している。

参加は引き続き限定される。推薦による参加で、早期アクセスの対象は選ばれた顧客とパートナーに限られ、研修はサンフランシスコ、ニューヨーク、ロンドンで行われる。Academyは、3月に1億ドルの拠出とともに発足したClaude Partner Network(参加企業4万6000社、認定件数17万5000件超)を発展させるものだが、今回の資金枠がそれに追加されるものかどうかは記事に記されていない。

🔗 Anthropicの発表 · プログラムのページ


エージェント:Claude Code 2.1.288、CursorのGLM 5.3、Replit、DeepSeek Harness、評価ベンチマークSWE-sweep

Claude Code 2.1.288が対話型セッションのバックグラウンドコマンドの時間制限を撤廃

10月2日 — Claude Code 2.1.288には89件の変更が含まれ、そのうち64件が修正だ。最も目立つ変更は、バックグラウンドで実行するコマンドに関するもの。2.1.285で導入された時間制限(標準で30分、最大2時間)は、無人実行のセッション(-p、Agent SDK、CI、クラウド)だけに適用されるようになった。ターミナル、デスクトップアプリ、VS Codeでは、バックグラウンドコマンドを再び時間制限なしで実行できる。

Ctrl+Cで誤って消したプロンプトは上矢印キーで復元でき、/code-reviewは報告する問題の数を増減するための--max-findingsに対応し、claude project purgeはclaude purgeに変更された。また、前日に登場したモッドには、全画面表示で最後に選択したテキストを返す$.ui.selection()が追加された。応答の途中でAPIがタイムアウトした場合、非対話型セッションとサブエージェントは失敗するのではなく、部分的な応答から処理を再開する。セキュリティ面では、bash -cスクリプトに紛れ込ませた危険なrmが、bypassPermissionsモードでも確認なしには実行されなくなった。また、PreToolUseまたはPermissionRequestのフックで照合に失敗した場合、フックを無視せず、呼び出しをブロックするようになった。さらに、クライアント側の自動モード分類器は、Sonnet 5.5またはOpus 5.5を指定するANTHROPIC_DEFAULT_SONNET_MODEL変数を無視し、代わりにClaude Sonnet 5を使用するようになった。

リリースの6分後、@ClaudeDevsは組み込みモッドのYou should knowを紹介した。これは補助エージェントを起動し、見逃せない情報をプロンプトの上に表示するものだ。10月1日に紹介された6つの組み込みモッドにも含まれており、標準では引き続き無効になっている。

We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin

🇯🇵 Claude Codeに新しいプラグイン、You should Knowを追加します。見落とす可能性のある重要な情報がないかClaudeの出力を分析し、必要な情報を把握できるようにします。有効化するには次を実行してください:/plugin enable cc-plugin-you-should-know@builtin — Xの@ClaudeDevs

🔗 Claude Code 2.1.288のリリースノート

GLM 5.3とGLM 5.3 FlashがCursorに登場

10月1日 — Cursorが、Z.aiのオープンモデルであるGLM 5.3とGLM 5.3 Flashをモデル選択メニューに追加した。また、独自の評価ベンチマークでGLM 5.3 Maxがオープンモデルの首位になったと主張している。

GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.

🇯🇵 GLM 5.3とGLM 5.3 FlashがCursorで利用できるようになりました!GLM 5.3 Maxは、CursorBench 4.0で最も高い評価を得た重み公開モデルです。 — Xの@cursor_ai

添付のグラフは、CursorBench 4.0のスコアとタスク当たりの平均コストに基づいてモデルを配置しているが、ラベルが付いているのは「(max)」と記されたGLM 5.3の点だけで、スコアは42,6 %、タスク当たりのコストは5,05ドルとなっている。このグラフでは、GLM 5.3はClaude Opus 5.5、Claude Sonnet 5.5、Fable 5.1、Grok 4.7を下回っている。他のオープンモデルは掲載されておらず、GLM 5.3 Flashも載っていない。Cursorは、この順位を裏付ける料金、記事、評価方法のいずれも公開していない。

ReplitがAgentでGPT-6.1 SolとClaude Sonnet 5.5を、AI IntegrationsでJevを提供開始

10月2日 — Replitの変更履歴によると、Replit Agentで選べるモデルに最近の2モデルが追加された。PowerモードではClaude Sonnet 5.5、MaxモードではGPT-6.1 Solを利用できる。同じ更新では、pplx-decider-v1-27bとの比較ですでに言及されていた意思決定モデルのJevが、Replit AI Integrationsで利用可能になった。アプリはAPIキーを管理することなく、迅速で構造化された判断を使って、コンテンツの分類、リクエストの振り分け、見込み客の評価を行える。ドキュメントでは、JevがOpenRouter経由でjev-latestという識別子で提供されると説明している。設定画面はページ全体で開くようになり、Enterpriseアカウントでは、チーム(Workspace)ごとに例外を設けつつ、企業全体のルールを設定できる。更新内容に料金の記載はない。

🔗 Replitの10月2日の変更履歴

DeepSeek HarnessがmacOSとWindowsに対応

9月30日 — @DeepSeekHarnessのアカウントが、DeepSeekのオープンソースのエージェントハーネス、DeepSeek HarnessのmacOS・Windows向けデスクトップ版を発表した。10月2日には、公式アカウントの@deepseek_aiが発表を共有し、Linuxユーザーはnpmパッケージの@deepseek-ai/dshを使用すると説明した。インストーラーはDeepSeekのサイトからダウンロードでき、macOSはARMチップ搭載機、Windowsはx64に対応する。

PREVIEWと表示された公式ページでは、Harnessを世界中で利用できるオープンソースの公開プレビュー版として紹介している。Cordisフレームワークの「すべてがプラグイン」(すべてがプラグイン)というアーキテクチャに基づき、事務作業(ファイル、データ、文書、プレゼンテーション)、コーディング、出典を引用する調査、バックグラウンドタスクに対応する。会話を通じて新しいプラグインを書かせるCreatorモードも備える。今回の新しさは配布形態にある。9月29日のプレビュー版では、すでにデスクトップアプリにdshコマンドが組み込まれており、GitHubではまだ安定版が公開されていない。

🔗 @deepseek_aiの発表 · DeepSeek Harnessのページ

SWE-sweep:エージェントが修正対象のバグを自力で見つける評価ベンチマーク

10月1日 — Meta Superintelligence Labsの研究者が、ハーバード大学、ワシントン大学、スタンフォード大学とともにSWE-sweepを公開した。コーディングエージェントに対し、バグの種類や場所についてヒントを与えず、実際のリポジトリからバグを自力で発見し、できるだけ多く修正することを求めるベンチマークだ。データセットは100のリポジトリと4 068件のバグを対象とする。コードはMITライセンスで、Harborフレームワークに基づいており、著者にはオフィル・プレスとジョン・ヤンも名を連ねる。10月1日に作成されたリポジトリについて、まだ発表は出ていない。

9月24日に更新された、mini-SWE-agentを使って測定したランキングは、課題の難しさを示している。

順位評価モデル解決したバグ総費用
1Sol 5.6 (xhigh), OpenAI4,7 %7 230 dollars
2Luna 5.6 (xhigh), OpenAI2,5 %224 dollars
3Terra 5.6 (xhigh), OpenAI1,5 %357 dollars
4Luna 5.6 (high), OpenAI1,4 %28 dollars
5Opus 5 (xhigh), Anthropic1,3 %5 363 dollars

🔗 SWE-sweep


計算処理とハードウェア:初の軌道上TPU、DGX Spark 64 Go、Ascend 950向けDeepGEMMとDeepEP

Project Suncatcher:Googleの試作衛星が初のTPUを軌道へ運ぶ

10月1日 — 初の軌道上試験を発表してから1週間後、GoogleがProject Suncatcherの試作衛星を打ち上げた。これは、宇宙に大規模な機械学習インフラを置ける日が来るかを探る、長期的な研究プロジェクト(ムーンショット)だ。Planetと共同で製造した衛星は、SpaceXの相乗り打ち上げミッションTransporter-18で軌道に到達した。Googleのトラビス・ビールズによると、チームは通信を確立し、衛星は予定どおりに動作している。

今後数週間、GoogleはTPUが宇宙飛行の負荷や、極端な放射線・温度条件にどのように耐えるかを測定する。地上では、Trillium TPUがすでに5年間のミッションで受ける量を超える放射線に耐えていた。研究の詳細を説明する査読済み論文は、学術誌Jouleに掲載される。10月2日に打ち上げ情報を共有した@GoogleAIは、この計画の根拠を改めて示した。低軌道では太陽光がほぼ絶え間なく届き、衛星は地上の最大8倍の太陽光エネルギーを生み出せるという。発表された次の段階は、2027年に2基の衛星を使ってレーザー通信を試験することだ。

🔗 Project Suncatcherの試作衛星が軌道に到達 · Jouleに掲載された論文 · @GoogleAIの共有投稿

DGX Spark 64 Go:NVIDIAが10月23日発売の構成を追加

10月2日 — NVIDIAがDGX Sparkに、従来の128 Goモデルに加えて、64 Goの統合メモリを搭載する構成を追加した。10月23日金曜日から、パートナーメーカー6社のAcer、ASUS、Dell、Gigabyte、HP、MSIのみを通じて販売され、価格は4 999ドルからとなる。記事には128 Goモデルの現在の価格は記されていない。基本構成は変わらず、GB10 Grace Blackwellチップ、DGX OS、NVIDIA AIソフトウェアスタックを備え、本体上で最大1000億パラメーターのモデルを実行できる。

主な訴求点はクラスタ化だ。2台のConnectX-7ネットワークカードをQSFPケーブルで接続すると、両方のメモリを共有できる。

技術仕様DGX Spark 64 Go 1台DGX Spark 64 Go 2台のクラスタ
統合メモリ64 Go128 Goを共有
公称モデル規模最大100(十億単位)のパラメーター最大200(十億単位)のパラメーター
Qwen 3.8 27Bでの性能(NVIDIAの試験)基準最大1,7倍

NVIDIA SyncアプリのCluster Assistantがこの処理を担当し、本体を検出してネットワークを設定する。月末に登場予定のNVIDIA Sync Model Launcherは、1台またはクラスタ上でQwen3.8 27Bをダウンロードして起動し、そのモデルを使うようOpenCodeを設定する。

🔗 DGX Spark 64 Goに関するNVIDIAの記事

DeepSeekがDeepGEMMとDeepEPをHuaweiのAscend 950 NPUへ移植

9月29日・30日 — DeepSeekが発表を行わずに、計算ライブラリをHuaweiのAscend NPU向けに移植した2つの版をGitHubで公開した。READMEで初版の日付が9月30日とされているDeepGEMM-Ascendは、DeepGEMMと同一のAPIを再現している。Ascend 950シリーズ向けに、BF16、FP8、FP4の行列乗算、MQAのロジット、MegaMoEをMITライセンスで提供する。DeepEP-Ascendは、MoEモデルのエキスパート並列化(expert parallelism)に使う通信ライブラリを移植したもので、振り分け(dispatch)と再結合(combine)のall-to-all操作を備える。

Ascend 950DT上で、DeepEP-Ascendの振り分け速度は8ランクで373~375 Go/s、128ランクで313~320 Go/sと測定された。32ランクまでは、物理的な帯域幅上限の約90~95 %に達する。これらの数値は、DeepSeekに提供された概念実証用のハードウェアキット(HDK)と手動設定で得られたもので、いずれも一般には配布されていない。READMEでは商用版を案内しており、Huaweiは10月15日ごろの提供開始を予定している。

🔗 GitHubのDeepGEMM-Ascend · GitHubのDeepEP-Ascend


音声とオーディオ:Suno Speechがベータ公開、ElevenLabsがFedRAMP 20x Class A認証を取得

Suno Speechが話し声と背景音楽を同じトラックで生成

10月1日 — SunoがSpeechをベータ公開した。Suno内で、オリジナルの背景音楽に話し声を重ねた音声を作成する機能だ。アイデア、詩、文章を入力し、希望する声と音楽のスタイルを記述する。SunoはSpeechを、声と音楽を一緒に生成し、一貫した1本のトラックにまとめる初の音声モデルと紹介している。少人数のユーザーグループで1か月間試験した後、アプリの更新を経て、すべてのユーザーに公開された。

製品責任者のジャック・ブロディが執筆した記事は、主に個人向けの用途を挙げている。友人のメッセージを劇的な朗読に変える、音声メモに音楽を付ける、瞑想や寝る前の物語を作るといった用途だ。Sunoは、ベータ版にはまだ不完全な点があると説明している。イギリス英語のアクセントがオーストラリア英語寄りになったり、劇的な間が過度に強調されたりすることがある。料金、プラン、対応言語はいずれも明記されていない。

🔗 Speechの紹介(Suno)

ElevenLabsがElevenAgentsと音声APIでFedRAMP 20x Class A認証を取得

10月1日 — ElevenLabsがFedRAMP 20x Class A認証を取得した。これは、米国の連邦政府機関が、政府データを扱うクラウド製品を安全に利用できるか判断するための枠組みだ。対象はElevenAgentsとText to Speech、Speech to TextのAPIで、Zero Retention Modeで動作し、データを米国内に保存することが条件となる。認証によりElevenLabs for Governmentの提供範囲が広がり、同社はFedRAMP Marketplaceにも掲載された。ElevenLabsが引用するFedRAMPの説明によると、Class Aは政府機関の大半の非機密用途に十分な水準だ。ElevenLabsは、給付申請、許認可、税務、審理の文字起こしを例に挙げている。

ElevenLabsは、すでに行われている公共部門での導入を発表の裏付けとして示している。

紹介された公共部門の導入例ElevenLabsが発表した数値
全国雇用相談窓口(ウクライナ)25 %を対話型エージェントが処理
給付・雇用相談窓口(チェコ)1日約5 000件の電話の85 %を解決
ミッドランド市月当たりの不在着信が7 000件減少(予測)

🔗 ElevenLabsの記事


ChatGPT、米国の Free と Go ユーザーに Finances を提供

10月2日 — 個人のお金を管理する ChatGPT の専用スペース Finances が、米国の Free と Go プランにも拡大し、ウェブ、iOS、Android で利用できるようになった。この機能はすでに Plus と Pro の加入者向けに提供されていた。5月に Pro 加入者限定のプレビューとして登場し、9月21日には Plus と Pro の加入者向けに Experian のクレジットスコア追跡機能が追加された。今回、対象は Free、Go、Plus、Pro の各プランとなったが、引き続き米国限定となる。

仕組みは変わらない。銀行口座や投資口座は Plaid 経由で、信用情報レポートは Experian 経由で接続し、この2種類の接続は併用することも、個別に利用することもできる。Finances のページには、支出、請求、サブスクリプション、純資産、投資、クレジットスコアがまとめられる。会話では、ChatGPT が支出を分類し、サブスクリプションを見つけ、当月の状況を最近の傾向と比較する。税金については、情報を整理し、控除など検討すべき項目を示す。

🔗 ChatGPT のリリースノート · ChatGPT の Finances


SpaceXAI、公式 TypeScript SDK の実験版を公開

10月2日 — SpaceXAI は、公式 TypeScript SDK の最初の公開版を告知なしでリリースした。0.1.0 が UTC 16時57分に公開され、続いて UTC 18時25分に 0.2.0 が公開された。0.2.0 ではクライアントクラスの名前を xAI から SpaceXAI に変更している。これは、新しい社名にコードを合わせるための破壊的変更だ。SDK はすでに、Responses API(ストリーミング、コンパクション、複数ターンの会話)、プラットフォーム組み込みのツール(ウェブ検索と X 検索、コード実行、リモート MCP サーバー)、画像や動画の生成と編集、さらに Files、Batch、Voice の各 API に対応している。

SDK の項目確認された詳細
npm パッケージ@xai-official/sdk
ライセンスApache-2.0
前提条件Node.js 22.13 以降、ESM プロジェクト、実行時の依存関係なし
状態実験版、1.0 まではインターフェース未確定

デフォルトでは、クライアント側で秘密鍵が露出するのを防ぐため、SDK はブラウザーや Worker での実行を拒否する。これにより、TypeScript の開発者も公式 Python SDK に相当するものを利用できるようになった。Python SDK は9月24日にバージョン 1.20.0 がリリースされている。

🔗 SpaceXAI の TypeScript SDK の CHANGELOG · npm の @xai-official/sdk パッケージ


短報

  • v0 に GPT-6.1 Sol が登場 — モデルが公開された9月29日、Vercel のアプリ生成ツール v0 が GPT-6.1 Sol の提供を開始した。その数時間前には、ChatGPT のサブスクリプションを使った接続にも対応していた。発表には、料金や v0 独自の評価結果は示されていない。🔗 出典
  • Grok Build に新しいエージェントダッシュボード — 10月1日に発表されたこのダッシュボードは、/dashboard ですべてのエージェントを1画面に表示し、タスクを並列実行し、Ctrl+W でエージェントを専用の git worktree に配置する。Grok Build には6月15日に最初のダッシュボードが追加されていた。🔗 出典
  • Gemini CLI のナイトリー版 — 10月2日の v0.64.0-nightly に含まれるのは8件の修正のみ。Ctrl+C で進行中の操作を再びキャンセルできるようになり、~/.gemini/state.json の状態はアトミックに書き込まれ、破損した場合は .bak のバックアップから復元される。安定版とプレビュー版に変更はない。🔗 出典
  • GitHub Copilot から削除されたモデル — 9月3日の予告どおり、Gemini 3.5 Flash、Gemini 3.6 Flash、Kimi K2.7 Code、Claude Opus 4.7 が Copilot のすべての利用環境から削除される。GitHub は Gemini 3.8 Flash、Kimi K3 を推奨し、Claude Opus 5 に代えて、現在は Claude Opus 5.5 を案内している。🔗 出典
  • SKILL.md をテストする — ゴルダ・マヌエルはコミュニティの投稿で、スキルがコーディングエージェントに発見され、読み込まれ、役立っているかを確認する方法を提案している。測定結果は公開されていない。方法は、Claude Code または Codex が想定する場所への配置、3段階のリクエストによる有効化の確認、8つの指標でのスキルあり・なしの比較からなる。🔗 出典
  • Manus が Video Editor と Game Dev の詳細を紹介 — 10月1日の2つの投稿が Manus 2.0 を詳しく説明している。Manus Studio の Video Editor は動画の各要素を個別のトラックに配置し、125本のクリップを195か所のカットで10分50秒の映像に編集した。Game Dev はゲームをその場で調整する。料金も日程も示されていない。🔗 Video Editor · 🔗 Game Dev
  • ServiceNow の AutoSynthData — ServiceNow の CoreAI チームは、モデルの失敗をもとに検証済みの訓練タスクを生成する。EnterpriseOps Gym では、Gemma-4-26B-A4B-it の Pass@1 が Hybrid 領域で7.2ポイント上昇し、ITSM では18.77 %から27.18 %に向上した。コードもデータも公開されていない。🔗 出典
  • POCKET-Darwin-180B — VIDRAFT は、1800億パラメーターの MoE である Darwin-180B-RSI の4ビット GGUF 版を公開した。サイズは元の360 GB に対して111 GB。著者らによると、CPU のみで毎秒18.4~21トークン、8 GB の RTX 5060 を搭載したノートパソコンで毎秒4.17トークンを処理し、MMLU-Pro では元のモデルと同じ87.65 %を達成した。🔗 出典
  • GPT-6 モデルガイド — OpenAI がスタートアップ向けのガイドを公開した。最も難しい推論には GPT-6 Astra、複雑なコード、調査、コンピューター操作には GPT-6.1 Sol、大規模に実行する特定のタスクには GPT-6 Luna を推奨している。キャッシュされたトークンの料金は、モデルによって最大95 %安くなる。🔗 出典
  • iOS の ChatGPT がカメラから複数ページを1つの PDF にスキャン — 10月1日、順次提供中。
  • Chatham Financial と Codex — 資本市場のコンサルティング会社が、Codex を使って取引検証アプリを構築した。初期の測定によると、検証時間は約30分から4分未満に短縮された。同社のプラットフォーム Onyx は、GPT-5.6 Sol と Terra、GPT-5.4、GPT-4.1 を組み合わせている。🔗 出典
  • The Den と ChatGPT Work — 10月1日付の OpenAI の事例紹介によると、デンバーにある保護者向けクラブ The Den の経営チームは、Gmail、Slack、Google Drive に接続した ChatGPT Work により、週に10~15時間を節約している。助成金の申請にかかる時間は、3日から2時間になった。🔗 出典
  • Blackwell 上で動く GPT-6 Astra Ultrafast — NVIDIA は10月1日、OpenAI が9月29日に公開した GPT-6 Astra の Ultrafast が同社の Blackwell GPU 上で動作し、Astra Standard モードより最大8倍高速であると説明した。また、OpenAI は自社モデルを使って推論ソフトウェアを最適化している。新たな数値は示されていない。🔗 出典
  • CoreWeave の RL Rollouts — 9月30日に CoreWeave Forge とともに紹介され、10月2日に NVIDIA が取り上げたこのサービスは、NVIDIA Dynamo を基盤としている。強化学習による事後学習の最中に、新しいチェックポイントを稼働させたまま読み込む。Nemotron 3.5 Lightning では、モデルの再読み込みにかかる遅延が15倍改善された。🔗 出典
  • ElevenReader に Eleven v4 が登場 — 9月28日に公開された ElevenLabs の最も表現力豊かな音声モデルが、同社の読み上げアプリに登場する。記事、電子書籍、PDF を選んだ声で読み上げ、90以上の言語に対応する。iOS、Android、ウェブで利用できる。🔗 出典
  • Midjourney のアルファ版変更履歴 — 10月1日付の変更履歴は、フォルダーごとにプロンプトの設定を記憶する機能や、スタイル参照を1つのバッジにまとめる機能など、主に修正をまとめている。翌週には新しい共同作業ツールが登場すると予告されている。🔗 出典
  • Ramp Router で Grok 4.7 が半額 — 10月6日まで、LLM ゲートウェイ Ramp Router が Grok 4.7 を50 %割引で提供する。SpaceXAI もこのキャンペーンを紹介している。SpaceXAI の API では、このモデルの料金は100万トークンあたり入力2ドル、出力6ドルとなっている。🔗 出典
  • セキュリティアドバイザリへの非公開コメント — GitHub で、報告者に見せずにリポジトリのセキュリティアドバイザリへコメントできるようになった。閲覧できるのは書き込み権限を持つ人だけで、閲覧はログに記録される。コメント用の REST API も公開プレビューに入る。🔗 出典 · 🔗 REST API
  • GitHub Advisory Database の GraphQL API — SecurityAdvisory オブジェクトに、CVE 識別子や NVD による公開日など5つのフィールドが追加される。securityAdvisories クエリには、深刻度と撤回状態による2つのフィルターが追加され、REST API を経由し直す必要がなくなる。🔗 出典
  • GitHub Actions の macOS 14 イメージが終了 — 10月1日の発表によると、廃止は11月2日に実施される。それに先立ち、10月には UTC 14時から午前0時までの利用停止が8回予定されている。ワークフローは macos-15、または macos-26 を指す macos-latest に移行する必要がある。🔗 出典
  • 企業における AI の成熟度 — Perplexity がガイドを公開した。成熟度を4段階に分け、Gartner、Deloitte、Google Cloud の枠組みをまとめ、自己評価のための表を提示している。引用されている McKinsey の2026年調査によると、回答者の80 %が個人の生産性向上を認めている一方、EBIT への貢献を認めているのは37 %にとどまる。🔗 出典

これが意味すること

科学に応用される AI は、発表する側の基準とは別の基準で評価されるようになってきている。Meta は結果を並べるだけではない。各論文で AI が執筆した箇所を明示し、別の数学者グループが再確認を行い、投稿では3つの問題がほかでも解かれていたことを認めている。Google の AI を使って開発されたインフルエンザ予測モデルの価値は、CDC がシーズン全体を通じて、ほかの38モデルと比較した評価によって裏付けられている。Ai2 は AstaBrief の重みとデータを公開しているが、比較結果は2025年のものだと注意を促している。公開モデルは検証できるが、評価は古くなる。

意思決定モデルは、わずか数日のうちに独立したカテゴリーになりつつある。Jev、Liquid AI の d1、Cloudflare の Clef に続き、Perplexity は入力トークンに応じて課金される API とモデルの重みをともに提供している。llama.cpp は同じ System One 形式でこれらのモデルをローカル実行でき、Replit は API キーなしで Jev を連携機能に組み込んでいる。開発者にとっての利点は具体的だ。後から解析しなければならないテキストの回答ではなく、1回の処理で各選択肢の確率を取得できる。ただし、比較には慎重さが必要になる。モデルの説明ページの Overall 行では pplx-decider-v1-27b が Jev を上回っているが、公開された詳細では、11のベンチマークのうち6つで Jev が優位に立っている。

コーディングエージェントの進歩は、実際の自律性の向上よりも速い。SWE-sweep でリポジトリを単独で扱わせた場合、最良のモデルでも、発見して修正できるバグは4.7 %にとどまり、費用は7,000ドルを超える。Claude Code 2.1.288 は、89項目の大半を修正に充てている。そこには API のタイムアウト後の再開や、複数の権限ルールの厳格化が含まれ、メインエージェントの作業を監視するモッドも紹介している。Anthropic は、もう1つのボトルネックである人間の技能に取り組み、本番環境への導入まで進められるエンジニアの育成に1億ドルを投じる。一方、公開モデルもツールの中で存在感を増しており、Cursor には GLM 5.3 が、デスクトップには DeepSeek Harness が登場している。

最後に、計算用ハードウェアは3つの方向に多様化している。Google は、将来的に地上の最大8倍の太陽エネルギーを利用できる可能性がある TPU を軌道上でテストしている。NVIDIA は DGX Spark に64 GB 構成を追加し、2台を組み合わせて2000億パラメーターに対応できるようにした。DeepSeek は、Huawei の Ascend チップでも、同じ API で低水準ライブラリを利用できるようにしている。それぞれの方法で、モデルを動かせる場所とハードウェアの選択肢を広げている。


出典