検索

Meta、Muse Glimmer をオープンソースで公開、OpenAI はサイバー防御向け GPT-5.6-Cyber を発表、Claude がリーマン予想で進展

人工知能によって生成された記事
Meta、Muse Glimmer をオープンソースで公開、OpenAI はサイバー防御向け GPT-5.6-Cyber を発表、Claude がリーマン予想で進展

ai-powered-markdown-translator

gpt-5.4-miniを使ってfrからjaに翻訳された記事。

GitHub でプロジェクトを見る ↗

今週、Meta は Muse Glimmer を公開しました。これは、150億パラメータのマルチモーダルなエージェント型モデルで、オープンウェイトとして提供され、Hugging Face に加えて NVIDIA の GPU アクセラレーション対応エンドポイント経由でもすぐに利用できます。OpenAI はサイバーセキュリティプログラム Daybreak を再編し、GPT-5.6-Cyber を発表しました。これは、すでに Chrome の JavaScript エンジンで未確認の脆弱性発見につながったモデルです。もう一つの注目点として、未公開の Claude 研究版が、形式検証済みの証明付きで、リーマン予想に関連する数学問題を前進させました。ほかにも、Anthropic の料金体系、開発者向けツール、企業向け音声 AI、AI ネイティブ金融が取り上げられています。


Meta が Muse Glimmer を公開、NVIDIA 経由で利用可能な 30B オープンウェイトのエージェント型モデル

Meta は Muse Glimmer を公開しました。これは、30億パラメータの視覚エンコーダー + 280億パラメータのテキストデコーダーからなる、密なマルチモーダルモデルで、ローカルかつ常時稼働の用途、つまり高性能 GPU を搭載した Mac や PC などの一般向けハードウェア上で動作するよう最適化されています。重みは Apache 2.0 ライセンスで配布されます。このモデルは 120,000 トークン超のコンテキストウィンドウを扱え、NVIDIA によれば 1 GPU で毎秒最大 20,000 トークンに達します。Alexandr Wang(Meta Superintelligence Labs)は、エージェントとしての信頼性を損なうことなく 24 GB の VRAM で動作すると述べています。

技術面では、Muse Glimmer はスライディングウィンドウ注意機構と完全注意機構を組み合わせ、メモリキャッシュを 16 分の 1 に削減する Gated Grouped-Query Attention アーキテクチャと、生成を 2〜4 倍高速化する軽量な DFlash ブロッ​​プモデルを採用しています。サポートは day 0 から transformers、llama.cpp、vLLM で利用でき、量子化された GGUF 重みと、Hugging Face の Inference Endpoints 経由のデプロイにも対応しています。

技術仕様測定値
パラメータ30B(エンコーダー 2B + デコーダー 28B)
ライセンスApache 2.0
コンテキストウィンドウ120,000+ tokens
最低 VRAM24 GB
スループット(1 GPU)最大 20,000 tokens/s
MCP Atlas(エージェント型)75.5(競合は 54.2–62.5)

NVIDIA は Muse Glimmer を試すための GPU アクセラレーション対応アクセスポイントを直ちに公開し、edge、desktop、workstation 向けプラットフォーム向けに最適化しています。これは、重みのダウンロードに加えた実用的な提供形態です。

Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows. […] we’re releasing model weights under a permissive Apache 2.0 license.

🇯🇵 ローカルかつ常時稼働するエージェントのワークフロー向けに最適化された、300億パラメータのオープンウェイトモデル、Muse Glimmer を紹介します。[…] 私たちはこのモデルの重みを寛容な Apache 2.0 ライセンスで公開します。@AIatMeta on X

🔗 NVIDIA が Muse Glimmer 向けに GPU アクセラレーション対応エンドポイントを提供


OpenAI が Daybreak を拡張し、GPT-5.6-Cyber を発表、Chrome で未確認の CVE を発見

OpenAI はサイバーセキュリティプログラム Daybreak を 2 段階のアクセス権に再編し、GPT-5.6 Sol を基盤に構築した特化モデル GPT-5.6-Cyber を発表しました。掲げる目的は、攻撃側の能力が広く一般化する前に、信頼できる防御側の手に最先端の知能を届けることです。

アクセスレベル使用モデル対象ユーザー
Daybreak BlueGPT-5.6 Sol(システムガードレール解除)ほとんどの防御者向けの推奨入口
Daybreak RedGPT-5.6-Cyber(新)経験豊富なセキュリティ研究者、高度な許可済み作業

GPT-5.6-Cyber は、高リスクの dual-use リクエスト、たとえば本番システムに対する pentest などでの拒否を減らし、ExploitGym 2 では GPT-5.6 Sol および旧 GPT-5.5 Cyber を上回ります。実環境では、このモデルにより Chrome の JavaScript エンジン V8 における 2 つの未確認脆弱性が発見され、メモリ破壊とヒープ sandbox からの脱出が可能になりました。Google への調整済み開示後、この脆弱性は修正され、CVE-2026-15903 として記録されました。また、人気のあるモバイル OS で少なくとも 5 件の脆弱性、人気のあるデータベースで 3 件の重大脆弱性、さらに人気のある OS カーネルで 400 件以上の権限昇格脆弱性も特定しており、Daybreak のパートナーとともに修正作業が進行中です。

OpenAI は 2026年9月1日から、すべての個人向け Daybreak アカウントにハードウェア セキュリティ キーを義務付けます。また、Daybreak Cyber Partner プログラムでは、アクセンチュア、IBM、KPMG などのサービス事業者と、Palo Alto Networks、CrowdStrike、Cisco などのセキュリティ ベンダーがすでに連携し、これらのモデルを自社サービスへ統合しています。

We’re expanding our cybersecurity initiative Daybreak and introducing GPT-5.6-Cyber, a new model for advanced, authorized cybersecurity work.

🇯🇵 私たちはサイバーセキュリティ инициативの Daybreak を拡張し、高度かつ許可されたサイバーセキュリティ業務向けの新しいモデル GPT-5.6-Cyber を発表します。@OpenAI on X

🔗 サイバー防御の猶予が狭まる中で Daybreak を拡張する


Claude がリーマン予想で進展、ただし未解決のまま

Anthropic は、未公開の研究版 Claude に、Clay Mathematics Institute のミレニアム懸賞問題の 7 つのうちの 1 つであるリーマン仮説に取り組ませました(各 100 万ドル)。Claude は問題を解決しませんでしたが、関連する問いについて進展を示しました。つまり、リーマンゼータ関数の零点のうち仮説を満たす割合の下限を引き上げ、41.6% から 67.2% にしました。

作業は、合計 3100 万出力トークンに及ぶ 2 回のセッションで行われました。最初のセッションでは 650 の初期アイデアが生成されましたが、すべて失敗に終わりました。2 回目の試みでは、Claude は 60 個の専門サブエージェント(数学的展開、アイデア創出、検証、執筆)を調整し、2,400 の shell コマンドを実行し、方針を検証するために arXiv から 54 本の記事をダウンロードしました。その後、結果は Anthropic の 2 人の数学者によって再読され、さらに外部専門家の Brian Conrey と Dan Goldston によって検討されました。Claude は Lean で形式的に検証された 証明を作成し、標準の検証を通過しました。

この結果は、通常のベンチマークの枠を超えています。何十年も未解決だった問題に対する測定可能な改善、独立した検証、そして形式証明は、Anthropic が現在、自社の研究モデルを従来のソフトウェア工学タスクではなく、基礎数学の問題で試験していることを示しています。

We asked an unreleased research version of Claude to take a stab at the Riemann hypothesis. It didn’t solve it, but it did make strides on a related problem: it increased the lower bound for the fraction of zeros of the Riemann zeta function that satisfy the hypothesis from 41.6% to 67.2%.

🇯🇵 私たちは未公開の Claude 研究版に、リーマン仮説に挑戦させました。解くことはできませんでしたが、関連する問題で進展がありました。リーマンゼータ関数の零点のうち仮説を満たす割合の下限を 41.6% から 67.2% に引き上げたのです。@AnthropicAI on X

🔗 Anthropic の研究ブログにおける詳細な方法論


Anthropic:料金と安全性

Sonnet 5 の発売価格は恒久化

Anthropic は、Claude Sonnet 5 の発売価格が恒久化されることを確認しました。入力 100 万トークンあたり 2 ドル、出力 100 万トークンあたり 10 ドルです。このモデルは 6 月に、2026年8月31日まで有効なプロモーション価格として発表されていました。これにより、初期価格を前提にコストを組んでいたチームにとっての不確実性が解消されます。このモデルについて、学期始めに向けた値上げは予定されておらず、大量トークン利用における競争力をさらに強化します。

🔗 発表

Anthropic によると、プロンプト注入は「ほぼ解決済み」

Anthropic の Claude Code 製品責任者 Boris Cherny は、プロンプト注入、つまりユーザーや AI エージェントに対する最も一般的な攻撃手法であり、悪意あるサイトや文書がモデルによって実行される隠し指示を滑り込ませる手法は、Claude モデルにおいて現在 実用上ほぼ解決済み だと主張しています。彼は、この進展は主にモデルの訓練によるもので、複数の重ね合わせた安全分類器が補完していると述べています。モデル + 検出器(probe)+ 自動モードの組み合わせにより、攻撃成功率は 0% に戻るとされ、これは 8 月 14 日に Claude Code のデフォルト権限モードになります。これは X 上の公開発言であり、詳細な方法論を伴う正式な研究論文ではありません。

🔗 Tweet


開発ツール:Amp が OpenAI に切り替え、Copilot Chat が改善

ChatGPT のサブスクリプションが連携されると Amp がモードのルーティングを OpenAI に変更

エージェント型コードツール Amp は、アカウントが ChatGPT サブスクリプションに連携されている場合、「the Dial」のモードルーティングを変更します。連携済みサブスクリプションがある場合、low、medium、high の各モードは GLM-5.2 や Claude Fable ではなく OpenAI モデルに切り替わります。low モードとコードレビューには GPT-5.6 Terra、エージェントと high モードの oracle には GPT-5.6 Sol が使われます。連携されていない場合は変更なしです。Amp が oracle モデルとして Claude Fable をやめる理由として、フロンティアモデルの性能収束を挙げており、共同創業者 @sqs は、将来のテストでも Fable と使用中の OpenAI モデルとの 80 倍の価格差を正当化する可能性は低いと見ています。Ultra モードは対象外で、引き続き Claude Fable 上で動作します。

🔗 Dial を変更しました

github.com の Copilot Chat:会話制御が改善

GitHub は github.com 上の Copilot Chat を更新し、一般提供としてすべてのプランで 3 つの改善を追加しました。最近の会話へのアクセスが容易になり、応答生成中にチャットウィンドウを最小化してから再び開いて対話を続けられるようになりました。また、トークン消費インジケーターがチャット内に直接表示され、セッションごと、メッセージごとの内訳も確認できます。これらは大きな新機能というよりは操作性の改善ですが、Copilot の上限が限られたアカウントにとって、日常的な用途に応えるものです。

🔗 ウェブ版 Copilot が会話制御を拡張


オープンソース・エコシステムと推論

NVIDIA が Magpie TTS Multilingual を公開、12 言語対応のオープン TTS

NVIDIA は Magpie TTS Multilingual を公開しました。これは約 3億5700万パラメータのオープンウェイト音声合成モデルで、NVIDIA Open Model License の下で提供され、男性・女性それぞれの音声を含む 12 言語(フランス語を含む)をカバーします。最初の音声が出るまでの遅延は、GPU B200 上の単一ストリームで 32 ms、64 ストリーム同時では 239 ms、H100 では 47 ms、A100 では 79 ms で、実時間比は最大 320 倍です。文字誤り率も改善しており、フランス語では 2.70% から 1.54% に、スペイン語では 1.14% から 0.60% に低下しています。Hugging Face のオープンウェイト、または本番環境での NVIDIA NIM を通じてデプロイ可能です。

🔗 低遅延の多言語音声エージェントを構築する

蒸留技術により GPU メモリ要件を最大 15 倍削減

Multiverse Computing は、教師モデルの logits をオフラインでキャッシュする手法と、完全な 語彙 × シーケンス長 行列を生成せずに済む融合 KL 損失関数を組み合わせた知識蒸留技術を公開しました。その結果、32K トークンのコンテキストで GPU メモリは 85.2 GB から 5.45 GB へと減少し(最大 15.6 倍の削減)、GPT-OSS 20B の蒸留は 4 つの GPU ノードから 1 つに収まり、反復時間も約 5 倍短縮されました。GPT-OSS 120B と Kimi-K3(2.8T パラメータ)に適用した場合でも、BoolQ と HellaSwag で教師モデル精度のおよそ 90% を維持します。コードは GitHub でオープンソース公開されています。

🔗 大規模運用に耐えるほど安価に知識蒸留を行う

DeepSeek-V4-Flash が Together AI 経由で Ollama Cloud に登場

Together AI は、Ollama のクラウド上で DeepSeek-V4-Flash の背後にある推論インフラを提供するようになりました。これは、このオープンウェイトモデルに対して利用可能な中で最高性能のホスティングとして提示されています。この提供では、データ保持ゼロ方針と、米国および欧州連合でのホスティングが強調されており、中国のインフラに依存せずに DeepSeek-V4-Flash を使いたい企業にとって主権性の論点となっています。これは、すでに Together AI で直接利用可能だった DeepSeek-V4-Flash に加わる新しい配信経路です。

🔗 Tweet

Sakana AI が Gemma 4 ベースでオーケストレーター Fugu を訓練

Sakana AI は、自社のマルチエージェント・オーケストレーション製品 Fugu のオーケストレーター役モデルの新バージョンを公開しました。今回は、すでに提供されている交換可能なモデル群に加え、オープンモデル Gemma 4 を基盤として訓練されています。タスクを割り振る小型のオーケストレーターと、実際の処理を行うモデル群という 2 層アーキテクチャは、ICLR 2026 で発表された Trinity と Conductor の研究に基づいています。社内評価では、コスト削減を伴いつつ、前バージョンと同等のオーケストレーション性能が示されています。Sakana AI はまた、日本におけるデジタル主権の要件に応えるため、将来的には自社製オーケストレーター モデルも視野に入れています。

🔗 Fugu × Gemma 4

Together AI が Cursor とのリアルタイム推論パートナーシップを詳説

Together AI は Cursor と共同執筆した記事を公開し、推論インフラのパートナーシップを詳しく説明しています。エディタに統合されたエージェントは、開発者がファイルを編集中でもコードを生成しますが、これは厳しい遅延条件を伴います。つまり、モデルの応答は、ワークフローを壊さずにエディタのフィードバックループに収まらなければなりません。記事では、Together AI が大規模にこれらの目標を満たすためにどのようにインフラを構築したかが示されており、AI 支援開発ツール向け専用推論サービスの具体的なユースケースとなっています。

🔗 Tweet


生成メディア:ElevenLabs が Deutsche Telekom に、MiniMax が H3 を詳説

ElevenLabs が Deutsche Telekom に自社の AI 音声技術を導入

ElevenLabs は、ヨーロッパ最大の通信事業者である Deutsche Telekom との提携を発表し、自社の AI 音声技術を 3 つの層、すなわちコンタクトセンター、一般向けアプリ、そしてネットワークそのものに統合します。AI 通話アシスタントは ElevenLabs 上で動作し、ネットワークに直接組み込まれているため、専用アプリなしで通話可能なあらゆるモバイル端末から利用できます。通話中のライブ支援、リアルタイム翻訳、通話の文字起こし・要約も提供されます。この提携は 2025 年初頭にアプリ機能の集合として始まり、その後 Deutsche Telekom のサービスの中核への統合へと発展し、さらに拡張が予定されています。

🔗 Tweet

MiniMaxがH3のオープンソースロードマップを詳説

RedditでのAMAセッションの後、MiniMax は動画モデルH3のオープンソースロードマップの要点をまとめて公開した。著作権上の論点が整理され次第、Apache-2.0 ライセンスへの移行が「検討事項」とされており、詳細な技術レポートも今後公開される予定だ。MiniMaxはまた、H3-Regenerate-2Kの重みも公開する方針だという。これは潜在空間での再生成モデルで、768pの結果を2Kに再処理できるほか、sparse attention の実装、低レイテンシの4-NFE/8-NFE版の検討、さらにH3系統から派生した画像生成/編集の統合モデルも計画されている。Ref2VAワークフローはすでにクリップを連結して60秒動画を生成できる。

🔗 Tweet


マルチモーダルエージェントとAIネイティブ・ファイナンス

Qwen-MM-Plugins:マルチモーダル・ネイティブなエージェントを実現する

AlibabaQwen は Qwen-MM-Plugins を発表した。これは、あらゆるエージェント実行環境(_agent harness)をマルチモーダル・ネイティブにするためのプラグイン群で、画像、動画、文書の読み取り、動画編集、3D/CAOファイルの操作を対象としている。狙いは、単体のマルチモーダルモデルを置き換えることではなく、開発者がすでに使っている実行環境にプラグイン層を差し込むことだ。発表ではベンチマーク、価格、正確な提供開始時期は明らかにされておらず、製品ティーザーの段階にとどまっているが、デモ動画は公開されている。この発表は、2026年のQwen戦略をさらに押し進めるもので、同社の提供範囲を新しい生のモデル重みではなく、マルチモーダルなエージェント向けツール群へと拡張している。

🔗 Tweet

AIネイティブなファイナンス機能を構築するための5つの教訓

OpenAIのCFO、Sarah Friar は、AIネイティブなファイナンス機能を構築するための5つの教訓を共有した。焦点は2つで、ゼロ日締め(企業財務をリアルタイムで把握し、照合可能で追跡可能な状態にすること)と、継続予測である。教訓には、まず全員にアクセスを開放し、その利用理由を作ること――投資家のデューデリジェンスに関する質問へ答えるためのカスタムGPT、IR-GPT を生み出したファイナンス・ハッカソンが例として挙げられている――、下からの実験と上からの戦略を組み合わせること、静的なスプレッドシートを超えて事業全体の文脈に支えられた動的なツールへ移行すること、各ワークフローに明確な責任を組み込むこと、そしてAIの投資対効果を測定することが含まれる。

🔗 AIネイティブなファイナンス機能を構築する

ChatGPT BusinessにPremium席が登場

OpenAI は ChatGPT Business 向けに Premium 席を導入した。これにより、最も活発な利用者は Standard 席の5倍の利用量が与えられ、5時間ごとの利用制限もなくなる。

席の種類月額料金年額料金(月払い換算)
Standard$25/ユーザー$20/ユーザー
Premium$125/ユーザー$100/ユーザー

企業は、同じワークスペース内で Standard 席と Premium 席を組み合わせて利用できる。導入キャンペーンとして、2026年8月20日 までに登録したワークスペース所有者には、追加した Premium 席1つにつき $100 のクレジットが付与される(5席まで、最大 $500)。一般提供前に先行アクセスも可能だ。

🔗 ChatGPT Business向けPremium席


ブレース

  • Claude Code — CPUとメモリのパフォーマンス向上:同チームは、ここ数か月でCPU使用量とメモリ使用量の99パーセンタイル(P99 RSS)において大幅な改善があったと述べているが、具体的な数値は公開していない。🔗 Tweet
  • ReplitのCEOがPlatformerで「self-driving company」を説明:Amjad Masad は、社内ボットと、人間の代わりにアプリを使うエージェントによって運営される企業という自身のビジョンを詳しく語った。🔗 Tweet
  • Sakana AIがRSI LabをフィジカルAIへ拡張:同社はフィジカルAI向けのワールドモデル構築を目指し、東京で正社員とインターンを募集している。🔗 Tweet
  • FC Bayern MunichがGoogle PixelとGeminiと提携:提携は発表されたが、具体的な内容(スポンサーシップ、製品統合など)は明かされていない。🔗 Tweet
  • Gemini、アメリカの農業フェアの訪問アドバイス:Googleブログのライフスタイル記事で、既存のGeminiの5つの使い方(経路案内、Ask Maps、AI Mode、Gemini Live、写真編集)がまとめられているだけで、新機能はない。🔗 Google Blog
  • インドでのGitHub請求:登録済みカードによる自動の定期支払いを、インド準備銀行に準拠した電子委任を通じて有効化できるようになった。🔗 Changelog
  • GitHubがスレッド別のカスタム購読を廃止:今後は Subscribed/Not subscribed の状態のみが利用可能になり、既存のカスタム購読は自動的に Subscribed に移行する。🔗 Changelog
  • NVIDIAがGB200上のQwen 3.5向けにvLLMを最適化:これらの最適化により、Qwen 3.8の発売準備として、GPUあたり毎秒25,000トークンを達成している。🔗 Tweet
  • Codex Build Week — プロジェクトと受賞者は近日公開:OpenAIによると、参加者はCodexを使ってアイデアを実際のプロジェクトへと変えた。受賞者の発表はこれから行われる。🔗 Tweet
  • テキサス州知事宛てのOpenAIの書簡:同社は、同州における責任あるAIインフラ開発への取り組みを詳しく説明している。🔗 OpenAI
  • Model MLがGPT-5.6 Solでファイナンス業務を加速:同社は、追跡可能なPowerPointデッキとExcelブックの作成を自動化しており、ExcelワークフローではOpus 5より36%少ないトークンで済むとしている。🔗 OpenAI

何を意味するのか

オープンな重みをめぐる競争は加速し、より多様化している。Meta(Muse Glimmer)、Alibaba(Qwen-MM-Plugins)、MiniMax(H3ロードマップ)、Sakana AI(Gemma 4上のFugu)は、同じ週に、閉じたモデルではなく再利用可能な部品をそれぞれ公開した。この流れはテキストだけにとどまらない。NVIDIA は357Mパラメータの多言語TTSを公開し、Sakana AI はデジタル主権を明示的な理由として挙げている。これは、EUおよび米国でDeepSeek-V4-FlashをホスティングするTogether AI にも見られる論点だ。

AIの安全性は、研究室から実運用へと移りつつある。OpenAIのGPT-5.6-Cyberは単なるベンチマークスコアにとどまらず、V8の実際のCVEを修正し、さらに他所でも数百件の脆弱性修正に貢献した。しかも、9月以降はハードウェアキー必須という強化されたアクセス体制も伴う。対照的に、Anthropic はモデル+分類器の重ね合わせによって防御側のプロンプトインジェクションを無力化したと主張している。攻撃側のツール化されたアプローチと、防御側の強化されたアプローチという2つの補完的な道筋が示すのは、安全性がもはや副次的な話題ではなく、製品差別化の中核的な軸になりつつあるということだ。

インフラ面では、推論の経済性が引き続き厳しくなっている。Multiverse Computing の蒸留技術はGPUに必要なメモリを15分の1に削減し、Together AI はCursorとの提携を強化してコード編集における厳しいレイテンシ要件を満たそうとしている。Anthropic は Sonnet 5 の価格を長期的に安定化させた。これらの動きを総合すると、エージェント型・対話型の利用が一般化するにつれて、推論コストへの圧力が継続して高まっていることがわかる。

最後に、AIは基礎研究と同じくらい、企業のサポート部門にも深く入り込んでいる。OpenAI は自社のファイナンスがどのようにAIネイティブになっていくかを文書化し、強化版キャパシティを持つChatGPT Business席を提供開始した。一方で Model ML は、Excelワークフロー上で具体的なトークン削減を報告している。対極には、Claude によるリーマン予想への取り組みがある。これは形式検証され、外部の数学者によって査読されたもので、これら同じモデル群が、製品ユースケースとは遠く離れた基礎研究の問題にも挑んでいることを思い出させる。


ソース