ai-powered-markdown-translatorgpt-5.6-solでフランス語から日本語に翻訳された記事。
NVIDIA Researchは、5秒間の動画をその再生時間より短時間で生成する推論スタックSol-H3をApache 2.0ライセンスで公開した。同日、ある開発元はCPU向けに設計したモデル2系列をHugging Faceで公開したが、その主張を裏づける測定結果は何も示していない。一方、インドのチームは、各タイムスタンプが文書化された検証工程を経た雑音音声コーパスを公開した。また、Google Researchは、飛行機雲を回避する飛行経路の実証実験をアジアへ拡大している。
Sol-H3は5秒間の動画を1.653秒で生成し、再生よりも速い
9月7日 — NVIDIA ResearchのEfficient AIチームは、シンガポールの研究所と共同で、動画モデルMiniMax-H3向けの完全な推論スタックSol-H3を公開した。成果は一文で表せる。8基のB300 Blackwellアクセラレーターを搭載したシステム上で、1344×768、毎秒24フレームの5秒間の動画を、同じ処理でステレオ音声も生成しながら、1.653秒で作り出した。つまり、視聴者が見るより速くモデルが動画を生成する。
比較対象は完全なプロファイルであり、単なるattentionカーネルの変更ではない。基準プロファイルのBase H3 Denseは50 schedulerステップ、すなわちDiTネットワークの49回のforward passを要するが、Sol-H3はわずか4回しか使用しない。
| ハードウェア構成 | 生成時間 | Base H3、50ステップ | Sol-H3、4ステップ | 高速化 |
|---|---|---|---|---|
| 8× B300 | 5 s | 18.250 s | 1.653 s | 11.04× |
| 8× B300 | 10 s | 50.660 s | 3.732 s | 13.57× |
| 8× B300 | 15 s | 99.513 s | 6.612 s | 15.05× |
| 4× B300 | 5 s | 35.328 s | 2.918 s | 12.11× |
| 4× B300 | 15 s | 194.930 s | 12.542 s | 15.54× |
| 1× B300 | 5 s | 129.898 s | 13.745 s | 9.45× |
高速化は最大15.54倍に達し、4基のB300で15秒間の動画を生成した場合に記録された。測定手順は異例なほど明確だ。同一のpromptとseedを使い、ウォームアップ後に3回実行した中央値を採用している。計測にはテキストのencoding、DiTのdenoising、VAEのdecodingが含まれるが、モデルの読み込みと最終的なMP4 encodingは除外されている。
このスタックは、別々に開発された2つの要素を統合している。動画推論runtimeのSol-Engineと、再学習なしでその場で適用されるsparse attentionのSol-Attnだ。さらに、fused kernel、QKV projectionではINT8、出力ではFP8を用いるGPU間通信、並列化・batch化されたVAE decoding、AdaLNパラメーターのcacheが加わる。sparse attentionの準備時間は1.206ミリ秒から0.285ミリ秒へ、VAE decodingは7.55秒から0.602秒へ短縮され、GPUごとに約24 GBのメモリーが解放される。
この公開をデモの域を超えて利用可能にした決定が2つある。コードがApache 2.0ライセンスで公開されたこと、そしてMiniMax-H3向けにすでに学習済みのfew-step LoRAを同じruntimeへ接続できることだ。初日からReactorを通じて公開APIへアクセスできるため、試用のためだけに8基のB300を占有する必要もない。
For us, the bigger milestone is crossing from “fast generation” into “faster than playback.” That opens the path toward continuous 24 FPS generation and truly interactive video systems.
🇯🇵 私たちにとって真の節目は、「高速生成」から「再生より速い生成」への移行です。これにより、24 FPSでの連続生成と、真にインタラクティブな動画システムへの道が開かれます。 — X上の@xieenze_jr
🔗 NVIDIA ResearchのSol-H3プロジェクトページ
オープンコーパスがインドの58言語に含まれる実環境雑音106,892件にタイムスタンプを付与
9月7日 — Indian Institute of ScienceのARTPARKチームは、自然発話コーパスProject Vaaniに人手によるannotationを加えたVaani Noise Event Timestamp Datasetを公開した。各背景雑音には、その種類と開始・終了時刻がミリ秒単位で記録されている。
| コーパスの特性 | 値 |
|---|---|
| annotation済み音声の合計 | 122時間超 |
| タイムスタンプ付き雑音イベント | 106,892件、7カテゴリー |
| 発話segmentと話者 | 72,756 segment、38,541人 |
| 言語・地理的範囲 | 58言語、30州 |
| 検証済みデータセットと未加工データセット | 約22 hと約100 h |
手法上の要点はここにある。発話と雑音は一般的な携帯電話で同時に収録されており、合成雑音の挿入や事後的なmixingは行われていない。咳や笑い声など、発話ではない人間の音はsegmentの約38パーセントに現れるものの、持続時間は0.5秒未満だ。動物や交通の音はより少ないがはるかに長く、両者を合わせると雑音時間の最大部分を占める。各タイムスタンプは、annotation、整合性検証、内部での再検証を経たうえで、無作為抽出されたコーパスの10分の1に対する独立監査を受ける。1件でも不合格になれば、batch全体がやり直される。
CMS ManhattanがCPU向けモデル2系列を公開、裏づけるbenchmarkはなし
9月6日 — 開発元のCMS Manhattanは、GPUではなくCPUでの推論を目的とするopen-weightモデル2系列をHugging Faceで公開した。2本の記事はいずれもモデル開発元自身による投稿であり、以下の内容もすべてその主張として紹介する。
1つ目のJiRack Ultraシリーズは、開発元によればDeepSeek-R1-Distill-Qwen-32Bアーキテクチャから派生した、BitNet形式の1.58 bit ternary weightモデル4種で構成される。最も興味深い要素はquantizationではなくtokenizerだ。routing、tool calling、ロボット制御tag、media専用のtokenが追加されており、agentic systemと組み込みroboticsを対象としている。2つ目のJiRackDeltaNet_27bは、27 billion parameterのQwen 3.8をDeltaNetアーキテクチャへ移行したモデルで、full attentionとstate-space modelに近いGated DeltaNet layerを交互に配置し、262,144 tokensのcontextをうたっている。
| モデル系列 | 開発元が示すベース | 公開weightの形式 | ライセンスとpackaging |
|---|---|---|---|
| JiRack Ultra、4サイズ | DeepSeek-R1-Distill-Qwen-32B | 1.58 bit ternary weight、GGUF Q2_K~Q4_K_M | Hub上のweight、Docker image、subscription制interface |
| JiRack DeltaNet 27B | DeltaNetへ移行したQwen 3.8 27B | FP16から生成された通常のllama.cpp GGUF | MITライセンスのweight、Docker image、1ユーザーあたり年額12ドルのinterface |
読者が留意すべき点は2つある。DeltaNet repositoryにはternaryとbitnetのlabelが付いているものの、公開されたGGUF系列は独立したternary checkpointではなく、通常のllama.cpp quantizationに相当する。この点は記事自体も認めている。また、2本目の記事の見出しに掲げられたOpus 4.6 Maxに近い品質という主張は、いかなるbenchmark結果にも裏づけられていない。ドキュメントだけでなくモデルそのものを評価するには、まさに公開された比較測定が欠けている。
🔗 Hugging FaceのJiRack Ultraシリーズ
🔗 Hugging FaceのJiRack DeltaNet 27B
RL環境が2016年ではなく現在機能する理由
9月7日 — Sergio PaniegoはHugging Faceのblogで、ある不可解な観察から始まる回顧記事を公開した。2016年12月に発表されたOpenAI Universeの説明は、現在の最先端研究所の記事にそのまま掲載されても違和感がない。しかし、そのrepositoryはすでにarchiveされている。
時系列は、2012年のArcade Learning Environmentから、2016年のOpenAI Gymと、その最小限の語彙であるreset()とstep()へ進み、その後Farama Foundation傘下のGymnasiumへと引き継がれる。続いて分野別の波が訪れ、World of BitsからWebArena、さらにSWE-benchとTerminal-Benchへと展開する。多くの場合、taskはbenchmarkとして始まり、その後training groundへと変わる。
分析の核心は、2016年に欠けていた5つの要素にある。出発点にできるだけのpre-trained modelがなく、taskは能力の範囲外で、interfaceはmachineではなく人間を模しており、sparse rewardへ対処する手法もなく、使い捨てsandboxを数千単位でorchestrationすることも不可能だった。現在ではGRPOとverifiable rewardが4つ目を満たしている。記事は、MetaのPyTorchチームとHugging Faceが2025年10月に発表した標準interfaceのOpenEnvと、Prime IntellectやMechanizeが参入する環境市場を取り上げて締めくくられる。
GoogleがCathay Pacificの80便超を飛行機雲回避ルートで運航
9月7日 — Google Researchは、地域初の商業航空会社partnerとしてCathay Pacificを迎え、飛行機雲回避の実証実験をアジア太平洋地域へ拡大した。対策は理論上単純だ。高度をわずかに調整し、飛行機雲が熱を閉じ込める層状の雲として残り続ける、低温多湿の区域を避ける。
| 第1段階の測定項目 | 値 |
|---|---|
| Cathay Pacificのnetworkで対象となった便 | 100便超 |
| 実際に回避ルートを飛行した便 | 80便超 |
| 飛行機雲による温暖化影響の推定削減率 | 約40 % |
| 効果に占める香港・シンガポール航路の割合 | 50 %超 |
| 航空による気候影響に占める飛行機雲の割合 | 約3分の1 |
この仕組みは、Googleのmodelによる予測、衛星画像、高度な気象データを組み合わせている。予測は機内Wi-Fiと航空会社のElectronic Flight Folderを通じてcockpitへ送られ、通常の手順を妨げることはない。高度調整も定められた安全基準の範囲内にとどまる。Contrails.orgをpartnerに迎え、規模を拡大した第2段階も始まる。
Contrail mitigation remains one of the most immediately available, scalable, and cost-effective ways to reduce aviation’s climate footprint, and it can get started now, with today’s aircrafts and fuel.
🇯🇵 飛行機雲の緩和は、航空が気候に与える影響を減らすために、今すぐ利用でき、広く展開可能で、費用対効果にも優れた手段の1つであり続けています。そして、現在の航空機と燃料を使って、今すぐ始められます。 — Google ResearchのKemal ArmadaとMax Vogler
Gensparkが3製品にMuse Spark 1.3を追加
9月7日 — Gensparkは、MetaのモデルMuse Spark 1.3を、発表から5日後にAI Chat、Code Agent、Clawへ統合した。同platformは、選定理由としてMetaが示した2つの数値、tool callを20パーセント削減、token消費を25パーセント削減という指標を挙げている。いずれも、長時間のtaskをloopで処理するagentのコストへ直接影響するmetricだ。
真のsignalはその速度にある。Gensparkは6日間で、異なるproviderのモデル4種を統合した。9月2日のClaude Fable 5.1、3日のGemini 3.8 Flash、5日のGPT-6 Astra、そして7日のMuse Spark 1.3だ。同platformは、単一のモデルというより、各研究所のリリースを公開後わずか数日で取り込むorchestration layerとしての立場を強めている。
短報
- Replit、ロンドンに初の海外オフィスを開設 — ロンドン市長のSadiq Khan、英国政府、London & Partnersとともに、同拠点を欧州事業の中核と位置づけ、就業も教育も訓練も受けていないロンドンの若者を対象に、TLMAとスキル向上の試験プログラムを実施すると発表した。🔗 投稿
- 構成可能な並列処理のPythonライブラリ、Tolquane — 同一のグラフをコード変更なしでスレッド、プロセス、async、分散、逐次の各方式で実行でき、グローバルロックのないPython 3.14tでは基準速度の5.6倍を達成する一方、GILを使用するスレッドでは0.9倍となる。ブロッキングの排除を設計原則とし、ブロックされたノードを名指しするエラーも備える。🔗 記事
- エージェントスキルをインストールする専用アクション — Aidenのファームウェアは、スキルのURLを、準備、検証、アトミックな公開を行う単一のアクションへ送るようになった。実際のエージェントで再現すると、複数ツールにまたがっていたトレースが1回の呼び出しに短縮される。🔗 記事
- Together AI、タスク当たりのコストでGLM-5.3 FlashとGPT-5.6 Terraを比較 — Artificial Analysisの知能指数では同点だが、ホスティング事業者によればタスク当たりのコストは82パーセント低い。ただし、同社は算出方法も詳細な記事も公開しておらず、比較対象のモデル自体も同社が提供している。🔗 投稿
- ブラジルのAIエコシステムに向けた宣言 — 自然の生態系を比喩として同国のAIコミュニティを論じるポルトガル語の文章で、モデル、データセット、評価指標はいずれもない。網羅性のために掲載する。🔗 記事
- Google DeepMind、アジア太平洋地域のAI for the Planetアクセラレーターに16組織を選出 — 第1期はシンガポールでの集中研修(ブートキャンプ)から始まり、その後3か月にわたりAnthroKrishi、ForestCast、AlphaEarth Foundations、SpeciesNet、Perchの各モデルを利用できる。参加組織は自然保護、持続可能な農業、炭素対策の各分野に分かれる。🔗 記事
- GitHub、Copilotアプリのcanvasを再び紹介 — 8月17日付の記事を再掲し、canvasを作業状況が常に見える、共有された持続的な作業面として紹介している。あまり公開されない数値として、紹介された2つの事例は、それぞれ構築に2,000から3,000のAI Creditsを要したという。🔗 投稿
- GitHub、GitHub Universe向けの別名ジェネレーターを公開 — 2026年10月開催回に先立つ、コミュニティ向けの宣伝企画であり、AIにも製品機能にも関係しない。🔗 投稿
- Synthesia、ECCV 2026に向けた3つの研究領域を詳説 — 音声駆動型の生成アバター、音声認識に応用する音声研究、対話型アバターを、人間中心の世界モデルという旗印の下で進める。🔗 投稿
- Mati Staniszewski、会話型Turingテストの達成は6か月から12か月先と予測 — ElevenLabsの共同創業者兼最高経営責任者がGDIYポッドキャストで述べたもので、インタビューは同社の音声サービスによるフランス語吹き替え版でも提供されている。🔗 投稿
- QwenCloud、Qwen Conference Thailand 2026の開催報告を公開 — 9月4日にバンコクで約400人の顧客と開発者が参加し、登録から支払い、請求まで人の介入なしにエージェント自身が顧客となる、エンドツーエンドのデモが行われた。🔗 投稿
- Cohere、トロントを世界的AI拠点として扱うCNNの報道を紹介 — 製品発表を伴わない広報であり、CBREによる技術人材ランキングで同市が世界3位であること、カナダの国家戦略によって20億ドル超が投じられたこと、Anthropicのモデルに対する輸出規制後に顧客からの問い合わせが急増したとCohereが述べていることを取り上げている。🔗 投稿
これが意味すること
Sol-H3が超えたしきい値は、記録一覧に新たな数字を加えただけではない。映像クリップの生成に視聴時間以上を要する限り、動画生成はバッチ処理のままだ。実行し、待ち、視聴する。このしきい値を下回れば、視聴している最中に映像が作られるという、別種の用途が開ける。実務者にとって重要なのは、この高速化が新しいモデルによるものではない点だ。モデルは同じで、変わったのは推論スタックだけである。つまり15倍という差は重みではなく実行エンジニアリングにあり、Apache 2.0の下で公開され、既存のLoRAとの互換性も保たれている。
この日は、オープンウェイトを公開する2つの姿勢が対照をなした。一方には、品質に関する主張を比較可能な測定値で裏づけていない自己公開の記事が2本あり、リポジトリのラベルは実際に提供される形式と一致していない。さらに、タスク当たりのコスト比較は勝者となるモデルのホスティング事業者が発表したものの、手法は公開されていない。他方には、各タイムスタンプが監査工程を通り、チームが検証済みの22時間と未検証の100時間を明確に区別した音声コーパスがある。誰でも公開できるパブリックリポジトリでは、検証の厳密さだけが利用可能なシグナルとなり、その実現には人目を引く見出しを作る以上のコストがかかる。
RL環境の回顧とGensparkの統合速度は、規模こそ違えど同じ変化を物語っている。前者は、2016年の発想がなぜ今になって機能するのかを説明する。足りなかったのはアルゴリズムではなく、初期モデルから使い捨てのsandboxに至る周辺インフラだった。後者は、そのインフラが利用可能になったときに何が起きるかを示しており、あるプラットフォームが6日間で4社の4モデルを接続している。どちらの場合も、価値はモデルからその周辺レイヤーへ移り、そのレイヤーは、一方ではOpenEnv、他方では複数モデルのオーケストレーターによって標準化されつつある。
そして、モデル競争とは無関係な取り組みも残る。Cathay Pacificとの実証は、既存の航空機と燃料を対象としている。追加されたのは、適切なタイミングで操縦室に届けられる予測だけであり、対象便では約40パーセントの削減が見込まれている。Vaaniコーパスは58のインド諸語を網羅し、その中には雑音を含む音声資源がこれまで存在しなかった言語も複数ある。また、DeepMindのアジア太平洋アクセラレーターは、専門モデルを16の現場チームに提供する。この3つの取り組みには、打ち破るべきbenchmarkはない。制約は別の場所、つまり収集すべきデータと成功させるべき導入にあり、デモと測定可能な効果の差もそこで決まる。
情報源
- Sol-H3、Enze XieによるXでの発表
- Sol-H3プロジェクトページ、NVIDIA Research
- Reactor経由のSol-H3 APIアクセス
- Vaani Noise Event Timestamp Dataset、ARTPARK-IISc
- JiRack Ultraシリーズ、CMS Manhattan
- JiRack DeltaNet 27B、CMS Manhattan
- RL環境の歴史、Hugging Face
- 超長距離便における飛行機雲の回避、Google Research
- GensparkのMuse Spark 1.3
- Replit、ロンドンオフィスを開設
- Tolquane、Pythonの構成可能な並列処理
- Aidenファームウェアへのスキルの直接インストール
- Together AIによるGLM-5.3 FlashとGPT-5.6 Terraの比較
- ブラジルのAIエコシステムに向けた宣言
- アジア太平洋地域のAI for the Planetアクセラレーター、Google DeepMind
- Copilotアプリのcanvas
- GitHub Universe向け別名ジェネレーター
- ECCV 2026でのSynthesia
- GDIYポッドキャストのMati Staniszewski
- Qwen Conference Thailand 2026の開催報告
- Cohere、トロントに関するCNNの報道を紹介