検索

MiniMaxがH3を公開重み付きで発表、Together AIが1万倍のトークン成長を主張、GitHubがリスクのあるnpmトークンをロックダウン

人工知能によって生成された記事
MiniMaxがH3を公開重み付きで発表、Together AIが1万倍のトークン成長を主張、GitHubがリスクのあるnpmトークンをロックダウン

ai-powered-markdown-translator

gpt-5.4-miniを使用してfrからjaへ翻訳された記事。

GitHub でプロジェクトを見る ↗

MiniMaxはH3を発表した。これは、ネイティブなステレオ音声と「数日以内」に公開予定の重みを備えた、汎用マルチモーダルモデルだ。Together AIは提供トークン量が劇的に増加したと主張しており、一方でGitHubはアカウント乗っ取り攻撃の波を受けてnpmトークンのセキュリティを強化している。これら3つの話題を軸に、画像・動画生成(Runway、Wan Video、Luma、Black Forest Labs、Ideogram)、コードエージェント向けツール(Devin、Replit、GitHub Actions)、OpenAIとGoogleにおけるモデル移行の面で、きょうは特に話題が豊富だ。


MiniMax H3:汎用マルチモーダルモデル、公開重みも発表予定

7月31日 — MiniMaxはH3を発表した。これは汎用マルチモーダル生成モデルとして説明されている。以前の世代(Hailuo 01と02)がタスクごとに専門モデルを分けていたのに対し、H3はテキスト、画像、動画、音声が混在した文脈を理解できる単一モデルにこれらの能力を統合している。最大の特徴は、動画と同時に生成されるネイティブなステレオ音声で、2K解像度では最大15秒のシーケンスに対応する。

MiniMaxは、価格性能比で攻めた位置づけを強調している。2Kでは1秒あたりの価格が「主流」モデルの3分の1未満、768pでは同じモデルの720p価格の半分未満だという。H3は複数の独自基盤(Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-Context Regeneration)上に構築されており、画像から画像、画像から動画、音声から音声、動画から動画への動きの転送など、編集機能を汎用的に扱う。動画生成モデルでは弱点になりがちな、テキストやブランド要素の精密な再現もできる。

MiniMaxはモデルの重みを近日中に公開することも発表しており、これはハードウェア互換性を加速し、歴史的にクローズドモデルが支配してきた分野でオープンソースコミュニティを支える手段として位置づけられている。公開にあわせて、Runway、Pika、Leonardo.Ai、OpenRouter、Kreaなど約15のパートナーで初日から展開される。

特徴詳細
解像度既定で2K
最大時間15秒
音声ネイティブ・ステレオ、同時生成
2Kでの価格主流モデルの1秒あたり価格の3分の1未満
768pでの価格主流720pの価格の半分未満
公開重み「数日以内に」発表予定

MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities — Today, we’re launching MiniMax H3, a general-purpose multimodal generation model. H3 understands unified context across text, images, video, and audio, generating video with native stereo sound, up to 15 seconds at 2K resolution.

🇯🇵 MiniMax H3:タスクとモダリティの境界を消すオープンモデル — 本日、私たちは汎用マルチモーダル生成モデルであるMiniMax H3を発表します。H3は、テキスト、画像、動画、音声をまたいだ統一された文脈を理解し、2K解像度で最大15秒のネイティブ・ステレオ音声付き動画を生成します。@MiniMax_AI on X

🔗 追加のフィード — @MiniMax_AI on X


Grok Imagine Video 1.5がRunwayで利用可能に

8月1日 — Runwayは、xAIの生成モデルの動画版であるGrok Imagine Video 1.5をプラットフォームに直接組み込み、サードパーティモデルのカタログを拡充し続けている。この統合は、RunwayがMiniMax H3も前日に受け入れていたように、単独の自社Genモデルだけに頼るのではなく、複数のベンダーのフロンティアモデルを1つのクリエイティブ制作基盤に集約する方針の一環だ。

🔗 発表 — @runwayml on X


Wan Video(Alibaba)がスケッチとテキスト向けのRealtimeモードを発表

7月31日 — Alibabaはwan videoのLabsセクションで、描きながらラフな人物、四角形、いくつかの線をリアルなシーンへと変換できるRealtimeモードを公開した。明示的な生成ステップも「generate」ボタンも不要だ。同じ日にAlibabaは、テキスト向けの第2のRealtimeモードも発表した。ユーザーが説明文を入力するたびに画像がその場で更新され、読み込み画面なしで文ごとに変化していく。これら2つの機能により、画像生成の体験は従来のプロンプト/生成サイクルではなく、描画やワープロのような連続的な操作に近づいている。

🔗 発表 — @Alibaba_Wan on X


LumaがLayersを発表、Uni-1搭載のレイヤー編集で画像を加工

7月30日 — LumaはLuma Agents内で、同社のUni-1モデルを搭載したLayersを展開した。仕組みはこうだ。既存の画像(Luma生成でもユーザーがインポートしたものでもよい)からエージェントにレイヤーを抽出させ、その後、会話だけで特定の要素を変更し、残りの画像はそのまま維持する。目立たせたい商品、背景、テキストのいずれでも対応できる。Lumaはこの機能を2つの例で示している。1つは、単なる平坦なJPGからリブランディング用ポスターを全面再設計する例、もう1つは、照明や背景を崩さずにシーンへ単独の物体を追加する例だ。狙いは、画像全体を再生成して1つの細部を変えるのではなく、狙いを絞った反復的な修正を可能にすることにある。

🔗 発表 — @LumaLabsAI on X


Black Forest LabsがFLUX 3のプレビューを公開

7月30日 — FLUXモデルの開発元であるBlack Forest Labs(BFL)は、Nous ResearchのエージェントHermes上で48時間限定のアクセスを通じて、次期モデルFLUX 3の公開プレビューを初めて示した。このエージェントは複数の生成プランを連鎖させ、単一の最初から最後までのプロンプトから短編映画を完成させる。発表にあわせて、Nous Research主催の短編映画コンテストが今週いっぱい開催され、さらにその翌金曜日にはサンフランシスコで開かれるBFLイベントでFLUX 3が対面紹介される予定だ。BFLは現時点で、一般提供の時期もモデル能力の技術詳細も明らかにしていない。

🔗 発表 — @bfl_ai on X


IdeogramがPruna AIとともにPareto最適なモデル群P-Image-Ideogramを発表

7月30日 — IdeogramはPruna AIとの共同で、品質、速度、コストを同時に最適化した新しい画像モデル群「P-Image-Ideogram」を発表した。モデルは4つの品質モード(Very low、Low、Medium、High)を提供し、ネイティブ1Kおよび2K生成に対応、開始価格は1枚あたり0.003ドル、遅延はモードに応じて3〜8秒とされる。Design Arenaのランキング(ブラインドの人間投票)では、Ideogramは新たなPareto境界として、優先度/コストと優先度/速度の両面で優位性を主張している。1Kでは最も経済的なモードが約3秒の生成で0.3セント/枚となり、評価対象モデルの平均より約8.6倍高速だという。ComfyUI、Runware、Replicate、Leonardo.Ai、Together AIを含む約15のパートナープラットフォームで即時展開される。

品質モード解像度1Kでの価格おおよその遅延
Very lowネイティブ1K/2K0.3¢/枚約3秒
Lowネイティブ1K/2K0.75¢/枚約3秒
Mediumネイティブ1K/2K非公開最大8秒
Highネイティブ1K/2K非公開最大8秒

🔗 発表 — @ideogram_ai on X


DevinがOutpostsを発表、任意のコンピュータ上でアプリをネイティブ実行

7月31日 — Devinの開発元であるCognitionは、Outpostsと呼ばれる新機能を発表した。これにより、Devinエージェントは隔離されたクラウド環境だけに依存せず、任意のコンピュータ上でアプリを直接ネイティブに実行・テストできる。この能力は、前日に発表されたmacOSクラウドエージェント経由のネイティブiOSサポートなど、Cognitionによる最近のネイティブ実行に関する発表の延長線上にあり、ユーザーの端末固有のハードウェアやソフトウェア構成も含めて、Devinが最初から最後まで担えるタスクの範囲を広げることを目指している。

🔗 発表 — @cognition on X


ReplitがModel Selector、Follow-up Tasks、新しい利用状況ページを展開

7月31日 — Replitの週次まとめ「This Week in Replit」では、いくつかの新機能が紹介されている。Model SelectorはCoreとProプランで利用可能になり、独自モデルに加えて公開重みモデルも選べるようになった。ユーザーは自分で選択することも、Replitに自動推奨させることもできる。Follow-up Tasksは今週、全ユーザー向けに利用可能になる。タスク完了後、Agentが次の手順を提案し、ワンクリックでバックグラウンド実行できる。さらに2つの調整も加わった。日付、リソース、プロジェクト、ワークスペース、グループ、ユーザーごとにほぼリアルタイムで追跡できるよう再構築された利用状況ページと、ユーザーセッションの延長(デフォルトのログアウトが7日から14日に延長)だ。

機能ステータス
Model Selector稼働中、CoreとProプラン、公開モデルを含む
Follow-up Tasks全ユーザーに展開済み
利用状況ページ再構築済み、ほぼリアルタイム追跡
セッション期間7日から14日に延長

🔗 発表 — @Replit on X


Together AI:公開推論のスケールアップ

Together AIは今週、専用推論に関する発表を2つの異なる観点から相次いで行っている。1つは利用面での劇的な成長を示す数字、もう1つは基盤インフラの自動スケーリングに関する詳細な技術記事だ。

提供トークン数が1万倍超に増加

8月1日 — Together AIは印象的な成長数字を示している。提供トークン量は月300億から月400兆(400 trillion)へと増え、1万倍超になったという。同社はこの伸びを、閉じた独自APIではなく公開重みモデルへの大規模ワークロード移行によるものだと説明している。ただし、比較期間が明示されていないため、この数字の比較価値は限られる。

Josh had to stop @vipulved and ask him to repeat the number: @wolfejosh Together AI went from serving 30B tokens a month to 400T. Over 10,000x growth as AI-native companies and enterprises move scaled workloads to open model.

🇯🇵 Joshは@vipulvedの発言を止めて、その数字を繰り返すよう求めなければならなかった。Together AIは、月間提供トークン数が300億から400兆へと増加したのだ。これは1万倍超の成長であり、AIネイティブ企業や大口顧客が大規模ワークロードに公開モデルを採用したことによって後押しされた。@togethercompute on X

専用推論の自動スケーリングを制御するための8つの指標

7月31日 — Together AIは、Dedicated Model Inferenceの自動スケーリングに関する技術記事を公開した。出発点として示されるのは、Webの世界から受け継いだ従来の指標(CPU/GPU使用率)は、LLM推論エンジンの真の圧力を反映しないという点だ。GPUが60%使用率を示していても、そのキューはすでに飽和しているかもしれない。なぜなら使用率は計算強度を測るもので、待ち行列の負荷を測るものではないからだ。記事では、推論固有の8つの指標を3つのファミリー(同時実行、SLO、効率)にまとめて解説し、既定の指標として inflight_requests を推奨している。また、H100 GPUでのコールドスタートの実コストも数値化しており、ベースモデルで約86秒、18GBのfine-tuneで145秒、レプリカを1つ追加するのに約2.5分かかるという。

測定ステップ1×H100での所要時間
ベースモデルのデプロイ86 s
fine-tuneのデプロイ(18 Go)145 s
レプリカ1から2への増加約2.5分

🔗 技術記事全文


Ai2 — infini-gramベースの研究が、AI著作の書籍における借用言語を追跡

7月31日 — Ai2(Allen Institute for AI)は、自社のinfini-gramエンジンを基にした研究を紹介している。これは大規模なテキストコーパスを索引化し、任意のフレーズが何回正確に現れたかを数えることで、表現の出典候補をたどれるツールだ。Tuhin Chakrabarty(Stony Brook University)のチームは、「稀な表現」――Google Booksで最大5冊にしか現れず、インデックス化されたWebには存在しない言い回し――を抽出し、AI検出量の高い自費出版書、AI未検出の自費出版書、受賞歴のある文学の間でその出現率を比較した。その結果、AI含有量の高い書籍ほど稀な表現の割合が明らかに高く、学習データに由来するパターンへの依存がより強い可能性を示している。

評価グループ稀な表現のカバー率
自費出版上位200冊、AI高検出41.6 %
自費出版上位200冊、AI未検出37.2 %
受賞またはノミネート作品(参照群)19.1 %

🔗 全文記事 — Ai2


Gemini 3.5 Flash Cyber、制限付きアクセスのサイバーセキュリティ向けモデル

7月31日 — GoogleはFlash系モデル群にひそかに新顔を追加した。Gemini 3.5 Flash Cyberだ。今月発表された一般向けバージョン(3.6 Flash、3.5 Flash-Lite)とは異なり、このモデルはソフトウェアの脆弱性を大規模に検出・修正するという非常に特定の用途を狙っており、その用途にだけ最適化された低コストモデルとなっている。アクセスは政府機関と信頼できるパートナーに意図的に制限されており、誰でも使える商用製品というより、防御的なサイバーセキュリティ用ツールとなっている。この発表には、専用の製品ページも、ベンチマークも、アーキテクチャの詳細も付いていない。入手できる唯一の情報源は@GoogleAIの隔週まとめフィードであり、現時点で語れる内容の深さは限られる。

同じまとめフィードでは、Gemini Notebook(旧NotebookLM)内のCollections、つまりノートブックをまとめる新しい方法も発表されている。こちらも、画像や関連ドキュメントはなく、1文だけの紹介だ。

🔗 まとめフィード — @GoogleAI on X


Copilot が Gemini 2.5 Pro と Gemini 3 Flash を非推奨化

7月31日 — GitHub は、Copilot のすべての体験(Chat、インライン編集、ask モードと agent モード、コード補完)から Gemini 2.5 Pro と Gemini 3 Flash を削除します。ユーザー側の対応は不要で、モデルはセレクターから自動的に消えます。ユーザーには Gemini 3.1 Pro(Preview)と Gemini 3.6 Flash への切り替えが案内されています。管理面では、Enterprise 組織は、チームが VS Code と github.com 上の Copilot Chat のセレクターでこれらの代替モデルを利用できるようになる前に、モデルポリシーがそれらを許可しているか確認する必要があります。この非推奨化は、Copilot で提供されるモデルのローテーションが非常に速いことを示しており、前世代の Gemini は Google のより新しい反復に席を譲っています。

🔗 公式 changelog


npm が 2FA 回避用 GAT トークンを制限

7月31日 — GitHub は、二要素認証(2FA)を回避するよう設定された npm の granular access token(GAT)ができることを制限します。これまでは、この種のトークンが漏えいすると、別のトークンの作成、メンテナーの追加、パッケージのアクセス権変更など、アカウントを完全に乗っ取ることができました。今後は、こうした機微な操作には対話的な 2FA チャレンジが必要になります。これは、本来 2FA の対象外であるトークンでも同様です。この措置は直ちに有効で、さらに 2027年1月に第二段階が予定されています。その時点で、これらのトークンはパッケージを直接公開する能力も失うことになり、チームは信頼済み公開(trusted publishing、OIDC ベース)へ移行することになります。対象は npm トークンのみで、従来の GitHub トークン(PAT、GitHub App、Actions)は変更なしで引き続き動作します。これは、ここ数か月オープンソースのエコシステムで観測された npm パッケージ乗っ取り攻撃の波に対する直接的な対応です。

🔗 公式 changelog


GitHub Actions でアクションを参照するための self-repository 構文

7月30日 — GitHub Actions は、呼び出し元の workflow と同じリポジトリ内にある action や再利用可能な workflow を参照するための新しい構文、$/ を導入します。これまでは、この種の内部参照を行うには、./ を明示的な checkout ステップと組み合わせるか、バージョンを固定で埋め込む必要がありました。$/ では、参照は実行中の正確な commit に自動的に向かい、追加の checkout ステップなしで動作します。また、./ が使われていたあらゆる場面、つまり workflow ステップ、composite action、入れ子の composition、再利用可能な workflow の呼び出しでも機能します。この新機能には、2.336.0 以上の runner が必要です。主な利点は、組織が action を完全な commit SHA でピン留めするポリシーを適用しつつ、内部参照を実行中の ref に自動同期させられることです。

🔗 公式 changelog


OpenAI が 8月31日をもって ChatGPT から GPT-5.4 と GPT-5.4 mini を削除

7月31日 — OpenAI は、アカウントでログインした ChatGPT ユーザー向けインターフェースから、GPT-5.4 と GPT-5.4 mini を 8月31日付で削除すると発表しました。ただし、両モデルは OpenAI API では引き続き利用可能で、API キーで認証された Codex セッションでも利用できます。つまり、この変更は ChatGPT の app/web ユーザーに影響しますが、API や API キー付き Codex を使う開発者には影響しません。この発表は、7月末の GPT-5.6(Luna/Terra)の料金更新に続くもので、ChatGPT 系列を最新モデルへと急速に移行させる流れの一環です。

🔗 発表 — @OpenAIDevs on X


Codex CLI の ImageGen: 新しい lightbox と canvas

7月30日 — OpenAI Devs は、Codex CLI に組み込まれた ImageGen 機能を、新しい「lightbox」型インターフェースと専用 canvas で更新しました。この進化は、コンテキストを切り替えることなく、Codex のワークフロー内で生成画像の探索と調整をより簡単にすることを目的としています。これは新しいモデルというよりは UX の改善ですが、OpenAI で優先的に追跡されている CLI ツールに直接関わるものです。

🔗 発表 — @OpenAIDevs on X


速報

  • Amp — orbs の起動が 20% 高速化、Puck アシスタントを GPT-5.6 Sol に切り替え — Amp は、orbs(リモートマシン)の起動が約 20% 高速化したことを発表し、ユーザーからの非常に厳しいフィードバックを受けてアシスタント Puck を GPT-5.6 Sol に切り替えました。 🔗 source
  • Hugging Face が DeepSeek-V4-Flash-0731 向けの無料公開 endpoint を展開 — Hugging Face の従業員が、リリース当日に、OpenAI 互換で token 不要の無料 endpoint を公開し、モデルを試せるようにしました。 🔗 source
  • Sakana AI — OSINT Diver 2026 CTF で 5位 — Fugu-ultra 1.1 ベースの OSINT agent を使った Sakana AI の防御/情報収集チームが、参加 850 チーム超の中で 5位に入りました。 🔗 source
  • Together AI 上の Kimi K3 — OpenRouter による最安値と最高の cache 率 — OpenRouter のダッシュボードのデータによると、Together AI は Kimi K3 に対して最安水準の料金の 1 つを提示しており、prompt cache の成功率もトップクラスです。 🔗 source
  • オープンな動画モデル(Marlin-2B)が、約 10 ドルで 370 時間の公開アーカイブを検索可能に — コミュニティのメンバーが、Hugging Face Jobs 上で Marlin-2B を使って Prelinger Archives の 1,864 本の映画をインデックス化し、23,148 件の検索可能な瞬間を生成しました。 🔗 source
  • GitHub が開発者のアクセシビリティツール利用状況を調査 — 障害のある開発者を対象に、アクセシビリティ技術の利用状況について 2026年8月31日まで公開調査を実施しています。 🔗 source
  • Seedance 2.5 が Luma にも登場予定 — Luma は、Seedance 2.5 がまもなく自社プラットフォームに登場することを予告していますが、日付は明示されていません。 🔗 source
  • Ideogram Object Remover が Runware で利用可能に — Ideogram のオブジェクト削除ツールは、プロンプト不要で、OmniEraser ベンチマークにおける最高 FID スコアを主張しています。 🔗 source
  • SGLang が NVIDIA DGX Spark クラスターでの Inkling-Small 対応を追加 — ConnectX-7 で接続された 2 台の DGX Spark システム上で、同時実行 1 の条件で 24 tokens/秒のスループットを測定。 🔗 source
  • ChatGPT desktop — Activity ビューと動物アイコン経由の Voice ショートカット — 新しい Activity ビューは、保留中の会話とプロジェクト更新をまとめ、ChatGPT Voice へのショートカットも提供します。 🔗 source
  • 数学と理論計算機科学における 10 の進展 — OpenAI は、幾何学、暗号学、複雑性に関する未解決問題の 10 の成果を共有しています。詳細コンテンツは閲覧できず、ソースはロボットによりブロックされています。 🔗 source
  • ヨーロッパで責任ある AI を前進させる — OpenAI は、AI Act に向けたヨーロッパでの AI ガバナンスを支援するため、安全性、透明性、出自に関する実践を紹介しています。詳細コンテンツは閲覧できず、ソースはブロックされています。 🔗 source
  • Univé が ChatGPT Enterprise で AI 対応の労働力を構築 — オランダの保険会社 Univé による ChatGPT Enterprise 導入のケーススタディです。詳細コンテンツは閲覧できず、ソースはブロックされています。 🔗 source
  • OpenAI がカンボジアを拠点とする詐欺ネットワークを解体したと発表 — ChatGPT が投資詐欺、恋愛詐欺、ギャンブル詐欺、なりすましに悪用されていました。詳細コンテンツは閲覧できず、ソースはブロックされています。 🔗 source
  • avatarin が GPT-Realtime で 24/7 の retail agent を構築 — 山田電機向けの多言語カスタマーサポート。公式要約によると、2週間で 30,000 人のユーザー、ポジティブ評価 92%。詳細コンテンツは閲覧できず、ソースはブロックされています。 🔗 source

これが意味すること

メディア生成は、大規模配布と会話的編集への競争を加速させています。 MiniMax H3 は、テキスト/画像/動画/音声を統合したモデルと、数日以内に提供すると約束されたオープンウェイトを掲げ、約 15 のパートナーで day-0 展開を開始しました。同じ動きは Ideogram(P-Image-Ideogram、4 つの品質モード、画像 1 枚あたり 0.003 ドルから)、Wan Video(「generate」ボタンなしの Realtime モード)、Luma(Layers、会話による 1 レイヤーずつの編集)にも見られます。価値の源泉は、もはやモデルの生の品質だけではなく、反復速度と、ローンチ時点からのマルチプラットフォーム統合にあります。Black Forest Labs は、第三者 agent に限定した FLUX 3 の 48 時間先行プレビューで、一般提供ではなく制御された予告という逆のアプローチを取っています。

オープンモデルの推論は規模の段階を変え、利用実態は技術と同じくらい文書化されつつあります。 Together AI は、オープンモデルへの企業移行に支えられて、1か月で提供トークン量が 10,000 倍以上増えたと主張し、同時に LLM 推論における従来の autoscaling 指標の限界について詳細な技術記事を公開しています。これに加えて、infini-gram 上に構築された Ai2 の研究は、このオープンモデルの波に対して意外な光を当てます。自費出版書籍をもとに、AI 生成テキストが学習時に見られる表現とどれほど近いかを示しており、推論のスケーラビリティが生成物の独創性という根本的な問いを消し去るわけではないことを思い出させます。

コード agent のツール化とサプライチェーンのセキュリティは並行して進んでいますが、必ずしも同じ方向ではありません。 Devin は Outposts によって、実行範囲をあらゆるコンピュータへ拡大し、Replit は Follow-up Tasks や Model Selector といった自律機能を拡充し、GitHub Actions は $/ の構文で内部 action の参照を簡素化しました。同時に GitHub は、2FA 回避用に設定された token であっても対話的な 2FA チャレンジを課すことで npm のセキュリティを強化し、ここ数か月観測されたアカウント乗っ取りの波に直接対応しています。これは、agent の自動化が進む一方で、アクセス制御も並行して厳格化されていることを示すシグナルです。

2 つの主要プレイヤーが、それぞれ異なる理由で一部モデルへのアクセスを絞っています。 OpenAI は、8月31日から ChatGPT のログイン済みユーザー向けに GPT-5.4 と GPT-5.4 mini を削除しますが、API では引き続き利用可能です。これは純粋な廃止というより、ラインアップの整理です。Google は一方で、ソフトウェア脆弱性の検出と修正に特化した経済的モデル Gemini 3.5 Flash Cyber を、政府と信頼できるパートナーのみに限定しています。これは、一部の研究所が、防御用途に限定したモデルと一般向けモデルを明確に区別し始めていることを示しています。


ソース