検索

NVIDIAがAIインフラに5000億ドルを調達、AlibabaがQwen3.8-2.4T-A95Bをオープンウェイトで公開、ZedがDeltaを発表

人工知能によって生成された記事
NVIDIAがAIインフラに5000億ドルを調達、AlibabaがQwen3.8-2.4T-A95Bをオープンウェイトで公開、ZedがDeltaを発表

ai-powered-markdown-translator

fr から ja に翻訳された記事、gpt-5.4-mini で。

GitHub でプロジェクトを見る ↗

2026年8月12日、NVIDIAは次の10年に向けたAIインフラを構築するため、5000億ドルを超える資金調達提携を発表しました。一方、Alibabaは、2400億パラメータの推論モデルであるQwen3.8-2.4T-A95Bのオープンウェイトを公開しました。Zedは、エージェントとともにコーディングするためのマルチプレイヤー環境Deltaを発表し、Google DeepMindはPixel 11上で手話をテキストに翻訳するSL2Tを開始、そしてSunoはBMGと世界的パートナーシップを締結しました。さらに、CohereとLiquid AIによる新しいオープンモデル、開発ツール面での進展(Devin、Replit、GitHub Copilot)、および企業におけるエージェント型AIの採用に関するOpenAIの調査も取り上げます。


NVIDIA、AIインフラのために5000億ドル超を動員

8月12日 — NVIDIAは、Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs、KKRという金融・投資分野の6大プレーヤーと提携し、5000億ドル超の外部資本を動員することを目的とした独立した資金調達プラットフォームを整備すると発表しました。目的は、モデルの学習と推論に特化した巨大データセンターである「AI factories」の建設を長期にわたり支えることです。

NVIDIAはこの動きを、業界にとっての構造的な転換点だと位置づけています。AI計算能力の展開資金は、もはやテクノロジー企業自身の財務だけに依存するのではなく、業界の大手企業だけでなく一流金融機関に支えられた専用の資金調達ビークルにますます依存していく、という見方です。

この発表は、ここ数日でNVIDIAが詳説してきたインフラ関連の他の取り組みの延長線上にあります。たとえば、将来世代のアクセラレータ向け800ボルト直流給電アーキテクチャや、米国におけるAI専用地域ハブのNSFプログラムです。これは、クラウド大手各社がAIインフラ競争を加速させる中で、計算需要を支えるために必要な資本規模の大きさを改めて示しています。

🔗 NVIDIA公式投稿


Alibaba、2400億パラメータの推論モデルQwen3.8-2.4T-A95Bのオープンウェイトを公開

8月12日 — Alibabaは、月初にQwen3.8-Maxという名称で意図を示していた主力モデルQwen3.8-2.4T-A95Bのオープンウェイトを公開しました。今回は実際のウェイト公開であり、合計2400億パラメータ、トークンごとに95億がアクティブになる細粒度Mixture-of-Expertsモデルで、要求の厳しい推論およびエージェント系タスク向けに設計されています。

アーキテクチャは、フルアテンション層と線形アテンション層を交互に採用しています。前者はトークン同士の相互作用を担い、後者は境界付きの再帰状態を用いて、コンテキストが長くなるにつれてメモリを制御します。このモデルは最大100万トークンのコンテキスト窓と、最大128Kトークンの出力長をサポートし、タスクに応じて計算コストと応答品質を調整できる、深さ制御可能な推論モード(low/high/xhigh)も備えています。

NVIDIAは専用の技術記事でこの展開を詳述しており、GB300 NVL72(72基のBlackwell Ultra GPU)上でFP8精度時にGPUあたり毎秒4000トークン超というネイティブスループットを報告し、NVFP4最適化も今後予定しているとしています。

測定指標測定値
総パラメータ / アクティブ2400億 / 95億
コンテキスト窓最大100万トークン
GPUあたりのスループット毎秒4000トークン超(GB300 NVL72、FP8)
ユーザーあたりのスループット毎秒350トークン超
ウェイトの提供先Hugging Face、ModelScope

ウェイトはHugging FaceとModelScopeで利用可能で、SGLang、vLLM、NVIDIA Dynamo、NVIDIA NIMによるデプロイに対応しています。ファインチューニングはNVIDIA NeMo AutoModel(LoRAおよびSFT)経由で可能です。

🔗 NVIDIAのX上での発表 · NVIDIA技術記事


Zed、エージェントとともにコーディングするためのマルチプレイヤー環境Deltaを発表

8月12日 — Zedは、エージェントとともにコーディングし、生成された内容をレビューするためのマルチプレイヤー環境Deltaを発表しました。この製品は、7月初めに「コードのためのGoogle Docs」として早期アクセス公開されたDeltaDBを基盤としています。Deltaはその最初の具体的なアプリケーションであり、8月12日から私設ベータへの最初の招待が送付されています。

Deltaでは、エージェントとの会話自体がドキュメントになります。カーソルはスレッド内のどこでも機能し、コードエディタと同じキーボードショートカットが使えます。特定の箇所に返答したい場合は、そこにカーソルを置いて入力を始めるだけで、スレッド内のどの内容も手の届かない場所にはありません。

レビューは、作業が行われたまさにその場所で行われます。コードを書いたエージェントはスレッド内に残り続けるため、diffから意図を推測し直すのではなく、直接質問できます。スレッドはワンクリックで共有でき、チームメイトは完全な参加者として関わることができます。履歴を閲覧したり、プロンプトを共同編集したり、数日後に作業を再開したりしても、最後のコードが本当にコミットされたのかを気にする必要はありません。

Delta is built on DeltaDB, which keeps your code and conversation in sync for everyone in the thread, in real-time. It works with the git repo you already have. Every edit and conversation is captured between your commits.

🇯🇵 DeltaはDeltaDBを基盤としており、スレッド内の全員に対してコードと会話をリアルタイムで同期した状態に保ちます。これは、すでにお持ちのgitリポジトリで動作します。すべての編集と会話は、コミットの間に記録されます。@zeddotdev on X

Zedは今後数週間にわたり招待対象を段階的に拡大する予定です。ウェイトリストへの登録は受け付けています。

🔗 Xでの発表


SL2T:Google DeepMind、Pixel 11上で手話をテキストに翻訳

8月12日 — Google DeepMindは、手話を直接書き言葉のテキストへ変換するモデルSL2T(sign-language-to-text)を発表しました。この機能はAndroidに登場し、ユーザーはWeb検索、メッセージ作成、Geminiへの問い合わせのために、入力する代わりにGboardやLive Transcribeで直接手話を使えるようになります。

技術的には、このシステムはオンデバイスで動作するMediaPipe Holisticモデルに基づいており、映像の生データを記録するのではなく、身体の位置(手、腕、胴体、頭、顔)を追跡します。元の動画は直ちに削除され、翻訳のためにサーバーへ送られるのは姿勢の幾何学的座標だけです。この選択はプライバシーを守りつつ、中間アノテーションを介さずに座標から直接テキストへ翻訳することを可能にし、これまで既存システムの精度を制限していた課題を回避します。

このモデルは、50以上の手話をカバーする10万時間超のデータで学習されており、そのうち約25%はアメリカ手話(ASL)です。FLEURS-ASLベンチマークでは、SL2Tはゼロショットで70 BLEURTを達成し、Google DeepMindはこれをこれまで報告されたどのスコアよりも有意に高いと評価しています。

開発には、専用の諮問委員会を通じて各段階で聴覚障害者コミュニティが関与しており、能力と制約を詳述した共同インパクトレポートも共著されました。この機能は、Pixel 11上でASLから英語への変換から開始され、将来的には他の端末や手話にも対応予定です。

SL2T is state-of-the-art on academic benchmarks, plus it’s optimized for real-world use like one-handed signing while holding a phone. To protect privacy, it tracks body poses on-device, while our servers translate them into text.

🇯🇵 SL2Tは学術ベンチマークで最先端であり、片手でスマートフォンを持ちながら手話をするような実利用にも最適化されています。プライバシー保護のため、端末上で身体の姿勢を追跡し、サーバーがそのデータをテキストに翻訳します。@GoogleDeepMind on X

🔗 Google DeepMind公式発表


Suno、BMGと世界的パートナーシップを発表

8月12日 — Sunoは、世界有数のレコード会社兼音楽出版企業であるBMG(Bertelsmann Music Group)と世界的パートナーシップを締結したと発表しました。同社はこの契約を、アーティストやソングライターを迂回するのではなく、彼らを含む創造的エコシステムを築くための「landmark」(画期的な節目)だと位置づけています。

このパートナーシップは、特有の文脈の中にあります。Sunoは2024〜2025年にかけて、3大レコード会社であるUniversal Music Group、Warner Music Group、Sony Musicから、モデル学習において保護された録音物を無断使用したとして訴訟を起こされていました。したがって、BMGとの合意は、法廷での力比べではなく、音楽業界との交渉によるライセンス関係へと戦略的に転換したことを示します。これは、7月にRunwayとBertelsmannの間で結ばれた動画分野の合意によってすでに始まっていた流れでもあり、BMGはまさにその一部です。

プレスリリースでは、財務条件や契約の正確な範囲(学習に利用可能なカタログ、権利者への報酬、BMG所属アーティスト向けに提供されるツール)は明かされていません。これらの点は、今後のSunoおよびBMGの公式発表で明らかになる見込みです。

🔗 Xでの発表


エージェント型開発ツール:Devin、Replit、VS Code、JetBrains

いくつかのAI支援開発ツールが、8月12日に並行して前進しています。新しい利用可能モデル、インフラ制御、エージェント向けプラグインの標準化がその主なテーマです。

Grok 4.6がDevinで利用可能に、CognitionはOpus 5とFable 5の下に位置づけ

Cognitionは、Grok 4.6(xAI、同日発表)をDevinで利用可能なモデルとして追加しました。チームはこれをGrok 4.5に対する大幅な改善と位置づけ、自社の内部ランキングではGPT-5.6 Solより上、Opus 5とFable 5のすぐ下に置いています。Cognitionは、とりわけ深いコード探索と、変更前の根本原因分析に強みがあると強調しており、Devinがシステムを理解してから手を加える必要がある複雑なデバッグ作業に役立つとしています。

🔗 Xでの発表

Replit、ワークスペースのホスティング地域を選択可能に(Pro/Enterprise)

Replitは、ProおよびEnterpriseの顧客に対し、新しいワークスペースのホスティング地域を北米、ヨーロッパ、アジアの間で選択できるようにしました。目的は二つあります。開発中の体感レイテンシーを減らすこと、そして公開アプリのデータやプレビューの保存場所を制御できるようにすることです。これは企業環境ではしばしば必要とされる点です(コンプライアンス、ユーザーとの地理的近接性)。この機能は、すでに利用可能だった公開アプリの地域選択に追加されるもので、対象アカウントには即時提供されます。

🔗 Xでの発表

Agent Plugins 1.0がVS Code、Copilot CLI、Copilotアプリに登場

8月6日にAWS、Anysphere(Cursor)、Microsoft、OpenAI、Vercelとともに公開され、その後Googleがメンテナーとして加わったオープン標準Agent Plugins 1.0が、いまやVS Code、Copilot CLI、Copilotアプリに対応しました。一度だけパッケージ化されたプラグイン(エージェントの能力+MCPサーバー)は、Awesome Copilotマーケットプレイスからインストールでき、既存のCopilotプラグインを移行することなく、複数の互換クライアント間で変更なしに動作します。企業向けには、ガバナンスはmanaged-settings.jsonを通じて行われ、Copilot BusinessおよびEnterpriseプランで利用できます。

🔗 GitHubの変更履歴

JetBrains向けCopilotに永続メモリとローカルOllamaアクセスが追加

GitHub Copilot for JetBrainsは大きなアップデートを受けました。永続メモリにより、あるチャットセッションで得た有用な情報を別のセッションへ保存・呼び出しできるようになり、プロジェクトのコンテキストや好みを繰り返し説明する必要がなくなります。もう一つの注目すべき追加は、OllamaがBYOK(Bring Your Own Key)プロバイダーになることで、JetBrainsのモデル選択画面からローカル実行モデルに直接アクセスできるようになりました。企業はさらに、プラグインの利用可否、MCPアクセス、権限バイパス動作に関するサーバー側の制御も得られます。

🔗 GitHubの変更履歴


オープンモデルと組み込みAI

モデル面では、複数の研究機関がローカル推論と文書理解に最適化したオープン版を次々と公開しています。

Hugging Face:Transformers.jsの月間ダウンロード数が1000万を突破

Hugging FaceのCEOであるClément Delangueは、ブラウザ内で直接AIモデルを実行できるライブラリTransformers.jsが、月間ダウンロード数1000万を突破したと発表しました。これは、わずか6か月で約10倍の成長であり、3年前から社内で開発されてきたものです。Delangueはこの成長を、コスト、プライバシー、計算資源不足への耐性といった理由から、AIワークロードの一部がローカルへ移行するという、より広い潮流と結びつけています。投稿には追加の技術詳細はありません。これは既存プロジェクトの勢いに関する発表です。

🔗 公式ツイート

Ai2:OlmoEarth Studioでカスタム埋め込みのエクスポートが可能に

Ai2(Allen Institute for AI)は、OlmoEarth Studioに地球観測埋め込みベクトルの計算とエクスポートを追加しました。Nano(128次元、140万パラメータ)、Tiny(192次元、620万)、Base(768次元、8900万)の3種類です。Cloud-Optimized GeoTIFFとして保存されたこれらのベクトルは、標準的なGISツール(QGIS、GDAL、rasterio)でそのまま利用できます。実演されたユースケースには、類似検索、few-shotセグメンテーション――60個のラベル付きピクセルで学習した土地利用マップは、重み付きF1で0.84を達成――および時系列変化検出が含まれます。モデルとコードはHugging FaceとGitHubで公開されています。

🔗 Hugging Faceの記事

Liquid AI:エッジ向け視覚言語モデルLFM2.5-VL-3B

Liquid AIは、端末上での推論に最適化された31億パラメータの視覚言語モデルLFM2.5-VL-3Bを公開しました。これは、SigLIP2 400Mのビジュアルエンコーダと26億パラメータのテキストバックボーンを組み合わせ、約34兆トークンで学習されています。ベンチマークでは、MMBenchで81.0%(前版の80.0%から向上)、RefCOCOの参照アノテーションで87.9%、DocVQAで91.1%を記録しています。速度面では、CPU(M5 Max)で毎秒228トークン、モバイル(Galaxy S26 Ultra)で毎秒20トークンで、メモリ占有は約3GBです。モデルはHugging Faceで利用可能で、llama.cpp、MLX、vLLM、SGLangとの統合も用意されています。

🔗 Hugging Faceの記事

Cohere、最小のビジョン言語モデル「North Micro Vision」を発表

Cohere は North モデル群を North Micro Vision で拡張しました。これは現時点で同社最小のビジョン言語モデルです。24億パラメータのこのモデルは、高度な文書理解向けに設計され、Apache 2.0 ライセンスの下でオープンソースとして公開されています。重みは Hugging Face で利用可能です。小型ながら、ネイティブ解像度での視覚処理、画像とテキストを組み合わせたマルチターン会話、空間推論、多言語画像理解を備えています。Cohere は、広範な視覚理解ベンチマークにおいて Gemma 4 E2B と Ministral 3 3B を上回ると主張していますが、発表では具体的な数値は示していません。

🔗 X の発表


接続済みアシスタント:Gemini と Runway が統合を拡大

Gemini が 14 の新しい接続アプリを追加

Google は、設定から Gemini に直接接続できるアプリの一覧を拡大し、14 の新サービス をカタログに追加しました。これには Zoho Bigin、Granola、Wix、GetYourGuide、Ticketmaster、OpenTable、Pandora、iHeartRadio、Thumbtack、Zocdoc、Otter.ai が含まれます。サービスを接続したら、たとえば「Zocdoc で職場の近くの眼科の予約を探して」と Gemini に頼むだけで、アシスタントがそのサービスと直接やり取りします。展開は今後数週間かけて段階的に行われ、Gemini を複数のサードパーティサービスへの単一の入口にするという Google の戦略が続いています。

🔗 Google 公式発表

Runway が Agent を Figma、Dropbox、Notion と接続

Runway は、プラットフォームに組み込まれた制作アシスタントである Agent に FigmaDropboxNotion のコネクタを追加し、クリエイティブ資産が別々のツールに閉じ込められたままにならないようにしました。これにより Agent は、これらのサードパーティプラットフォームからデザイン、ファイル、ドキュメントを単一のワークスペースへ直接同期できるようになります。この機能は すべての有料プラン で利用可能で、既存のクリエイティブチームのツール群のエコシステムに接続されたメディア制作の中核ハブとして Agent を位置づけるという Runway の戦略の延長線上にあります。

🔗 X の発表


OpenAI の企業における agentic AI 採用に関する調査

OpenAI は、企業での AI 利用に関する補完的な 2 つの研究を公開しました。1 つは顧客における agentic AI の実態をまとめた実践的な概観「Enterprise Signals」、もう 1 つは企業、職種、シニアリティごとの採用の広がりを扱う付随の working paper です。中心となる結論は、利用が「支援」から「実行」へ移行しているということです。6 月には、Codex が企業顧客において Codex と ChatGPT を合わせた生成トークン量の 64% を生み出しました。最も先行する企業とそれ以外の差も広がっており、月間利用トップ 10% の「frontier firms」は、標準的な企業の 8.3 倍 の出力トークンをアクティブユーザー 1 人あたりで生成しています。1 月時点ではその比率は 2.6 倍でした。2 月以降、企業での Codex の週次ユーザー数は、法務で 108 倍、営業で 41 倍に増えた一方、エンジニアリングでは 5 倍にとどまっています。

🔗 OpenAI の完全な調査


短報

  • Grok 4.6 が v0(Vercel)で利用可能に — xAI の発表と同日、v0 はアプリ生成向けのモデルセレクタに Grok 4.6 を追加しました。🔗 Tweet
  • Open_MOSS が MOSS-VL の FP8/NF4 版を公開 — ローカル推論向けに量子化された MOSS-VL-Instruct と MOSS-VL-Realtime の各版で、VRAM 24 GB のみで動作します。🔗 Tweet
  • Google AI Studio が 8 月 12 日の皆既日食向け 3D ビジュアライザーを提供 — 月の影が地球上を移動する様子をリアルタイムで追跡し、Reykjavík または Valencia からのローカルな空のシミュレーションも可能です。🔗 Tweet
  • GitHub Enterprise Server 3.22 が release candidate に — オフライン環境での Copilot CLI、Enterprise Teams の一般提供、secret scanning と rulesets のための精緻化された制御が含まれます。🔗 Changelog
  • Rule insights が組織レベルで利用可能に(パブリックプレビュー) — rulesets の監査ダッシュボードが repository レベルを超えて拡張され、CSV 出力も可能です。🔗 Changelog
  • ブランチ保護ルールの rulesets への自動移行 — 「Convert to ruleset」ボタンにより、従来のルールを同等の ruleset に自動変換します。🔗 Changelog
  • Seedance 2.5 が Genspark の AI 動画エージェントに登場 — 30 秒の一括生成、最大 30 枚の画像、10 本の参照動画/音声クリップに対応します。🔗 Tweet
  • Grant Thornton での Genspark — 提案書生成を高速化 — 同社は 1 つのプロンプトから入札提案への回答を生成し、必ず人間によるレビューを行っています。🔗 Tweet
  • GitHub Monthly Enterprise Roundup — 2026 年 8 月版 — この roundup は、AI がコード補完から、エンドツーエンドでガバナンスされたエンジニアリングワークフローへ移行していることを強調しています。🔗 Tweet
  • LTX-2.5 が Runway で利用可能に — 8 月 11 日に公開された Lightricks の open world model が、Runway のモデルカタログに加わりました。🔗 Tweet
  • FLUX 3 が Luma で利用可能に — Black Forest Labs の最初の統合型マルチモーダルモデル(画像、動画、音声)が Luma に登場し、ネイティブな動画から音声への生成に対応しています。🔗 Tweet
  • Nemotron 3.5 Lightning が Perplexity の Agent API で利用可能に — NVIDIA の 30B MoE オープンモデルが、Perplexity の高ボリュームなエージェント実行層に加わりました。🔗 Tweet
  • Qwen-Image-3.0 が OpenArt で利用可能に — Alibaba の画像生成モデルが、新たなサードパーティプラットフォームで配布範囲を拡大しています。🔗 Tweet
  • Qwen3.8-Max が Legal Research Bench で 4 位に上昇 — このモデルは、法律調査に特化したランキングで 22 位から 4 位へと上がりました。🔗 Tweet
  • Daybreak モデル(サイバーセキュリティ)が Amazon Bedrock 経由で利用可能に — OpenAI の Daybreak Blue と Daybreak Red が、許可された防御者に対して Bedrock コンソールから直接利用可能です。🔗 OpenAI

何を意味するのか

AI インフラへの資金調達は規模を増しています。NVIDIA が Apollo、BlackRock、Goldman Sachs、KKR などの伝統的な金融プレーヤーから動員した 5,000 億ドルは、テクノロジー企業のバランスシートだけで賄うモデルから、専用の資本ビークルへと移行していることを示しています。このマクロ経済的な動きは、より具体的な現実と結びついています。同じ日に公開された Qwen3.8-2.4T-A95B は、NVIDIA GB300 インフラ上で GPU 1 基あたり毎秒 4,000 トークン超でネイティブに動作します。資本への欲求と計算需要は相互に支え合い、新たな巨大モデルが発表されるたびに、その投資の正当性がさらに高まっています。

オープンな重みの公開は、あらゆる規模へと広がり続けています。Alibaba の 2,4000 億パラメータのフロンティアモデルから、Cohere の 24 億パラメータの小型ビジョン言語モデル、さらにモバイルで動作するよう設計された Liquid AI の LFM2.5-VL-3B までがその例です。性能だけでなくサイズによるこの多様化は、Hugging Face が測定している勢いを裏づけています。Transformers.js は月間 1,000 万回ダウンロードされ、6 か月前の約 10 倍に達しました。これは、ローカル推論が実験段階を抜け、正式な本番オプションになりつつある証拠です。

AI 支援開発ツールは、より豊かなコラボレーション形式へと収束しています。Zed は Delta によりエージェントとのやり取りを共有・版管理された文書へと変え、GitHub は Agent Plugins 1.0 によって VS Code、Copilot CLI、JetBrains 全体でエージェントプラグインを標準化し、Devin と v0 は xAI での公開当日に Grok 4.6 を統合しました。共通するのは、これらのツールが単なる孤立したアシスタントではなく、基盤モデルの選択やセッション間の記憶がコード生成そのものと同じくらい重要な、相互運用可能なインフラ層になっていることです。

最後に、AI は日常的な用途や、押しつけではなく交渉による産業関係の中へ、より深く組み込まれています。Google DeepMind の SL2T は、プライバシーを考慮して設計されたアーキテクチャで Pixel 11 上の手話を直接翻訳し、Gemini と Runway は数十のサードパーティサービスへのコネクタを拡張しました。また Suno は BMG とライセンス契約を結び、2024〜2025 年の訴訟とは対照的な姿勢を示しました。これは、音楽業界が生成モデルと戦うのではなく、交渉する段階に入ったことを示すシグナルです。企業側では、OpenAI の調査が、この agentic な実行への移行が、最も先行する組織とそれ以外の組織の間で、すでに大きく開き始めていることを裏づけています。


ソース