検索

OpenAI、Astraのサイバーリスクを受けてモデルの出荷を抑制、WarpがWarp Factoriesを発表、Claude CodeがDesignスキルを開始

人工知能によって生成された記事
OpenAI、Astraのサイバーリスクを受けてモデルの出荷を抑制、WarpがWarp Factoriesを発表、Claude CodeがDesignスキルを開始

ai-powered-markdown-translator

gpt-5.4-miniを使用してfrからjaに翻訳された記事。

GitHub でプロジェクトを見る ↗

2026年8月18日、OpenAIは、Astraという名のモデルが持つ重要なサイバー能力に直面して最近のモデルの訓練をなぜ遅らせたのかを詳述する報告書を公開した。一方でWarpは企業向けのエージェント基盤を開き、Claude Codeはインターフェース設計スキルを開始した。これら3つの主要発表を中心に、Anthropic、コードツール、オープンなAI研究、メディア生成プラットフォームに関する18件の新情報が続く。


OpenAI、Astraの重要なサイバー能力を受けてモデルの展開を減速

8月18日 — OpenAIは、同社が最近のモデルの展開をなぜ遅らせたのかを説明した。背景には2つの出来事がある。1つはモデル評価中に発生したOpenAI-Hugging Faceのセキュリティインシデント、もう1つは次期モデルの1つであるAstraが、Preparedness Frameworkで定義された「重要なサイバー能力」の閾値を超える可能性を示す初期証拠だ。

OpenAIは、出荷対象の最新モデルに対する強化学習(RL)訓練で2週間の停止を実施し、その間に研究環境の強化とred-teamingを進めた。予定されていた最大規模のフロンティアRL実行は、より小規模な訓練で新しい防御策が検証されるまで停止されている。

保護詳細
監視トークン単位の分類器、30分以内を目標とするアラート
整合性有害または未承認のアクションの削減
セキュリティネットワーク分離の強化、信頼できないコード用サンドボックス
追加コスト監視対象の推論計算が約20%増加

この監視は、レベル「Sol」以上ではRL訓練とツールを伴う評価のすべてに必須であり、8月7日以降はAstraのツール付き推論にも追加要件が課されている。OpenAIは、Hugging Faceのインシデントに関する技術レポートと、外部組織と連携したPreparedness Frameworkの改訂を予定している。

As models become more capable, the risks associated with developing and testing them internally also grow. We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research environments and expanded monitoring coverage. Our largest planned frontier RL run remains on hold while smaller-scale training and evaluations validate these safeguards and establish more evidence of alignment.

🇯🇵 モデルがより高性能になるにつれて、開発中および社内テストに伴うリスクも高まります。私たちは、研究環境の強化とred-teaming、そして監視範囲の拡大に取り組むため、出荷対象の最新モデルに対する強化学習(RL)訓練を2週間一時停止しました。予定していた最大規模のフロンティアRL実行は、より小規模な訓練と評価によってこれらの防御策が検証され、整合性に関する証拠がさらに積み上がるまで停止したままです。@OpenAI on X

🔗 OpenAI — モデル開発のペース調整


Warp、クラウドソフトウェアファクトリー向けのWarp Factoriesを発表

8月18日 — Warpは、ソフトウェアライフサイクル全体にわたる自動化ループを自前で構築する企業向けに、オープンなインフラであるWarp Factoriesを発表した。クラウド上のエージェントが作業のトリアージ、仕様化、実装、レビュー、検証を行い、人間は重要な意思決定ポイントでループに残る。発表では、エンジニアリング責任者から上がっていた2つの課題が挙げられている。1つは、コードエージェントの投資対効果を長期的に測る難しさ、もう1つは、各開発者が独自のエージェントを設定することで生じるガバナンス上の死角だ。

技術面では、ファクトリーはコードとして構成される。アナロジーとしては「エージェント設定のためのTerraform」とされており、Claude CodeやCodexを含む任意のモデルやハーネスをそのまま利用できる。エージェントはLinuxとMac上でのcomputer useアクセスを持ち、バグの再現や変更の修正証明を行い、pull request上で記録を共有する。ダッシュボード、API、SDKによりコストと速度を測定でき、自己改善エージェントも設定可能だ。

Warpは現在、自社の内部ファクトリーを通じて業務の約30%を自動化していると述べ、この比率が急速に伸びると見込んでいる。同社は本日から限定数の企業にアクセスを開放し、一部の選定顧客には1万ドル相当のファクトリー利用クレジットを提供する。

Introducing Warp Factories: open, flexible infrastructure for building cloud software factories. - Configure your factory as code - Use any model and any harness - Measure quality with evals and benchmarks on your own data - Built-in self-improvement and memory

🇯🇵 Warp Factoriesの紹介:クラウドソフトウェアファクトリーを構築するための、オープンで柔軟なインフラです。ファクトリーをコードとして構成してください。任意のモデルと任意のハーネスを使用できます。自分のデータで評価とベンチマークを実行し、品質を測定できます。自己改善とメモリが組み込まれています。@warpdotdev on X

🔗 Warp Factoriesの発表


Claude Code、予備研究として/designスキルを開始

8月17日 — Anthropicは、現在予備研究段階にあるClaude Code向けの新しいスキル/designを開始した。この機能は、既存のartifactsシステム上に構築されたClaude DesignのartboardワークフローをCLIとDesktopアプリに取り込む。/designコマンドは、ユーザーインターフェース案を表す複数の編集可能なartboardを生成する。ユーザーは好みの案を選び、調整し、その後Claudeにコードへ実装させる。

この開始により、これまで専用ツールに向いていたインターフェース設計の用途がClaude Codeに近づき、ターミナルやDesktop上で開発者のワークフローに直接組み込まれる。機能はPro、Max、Team、Enterpriseプランで利用可能で、試すにはClaude Codeの更新が必要だ。発表以外の追加詳細(research previewの制限、ロードマップ、視覚例)は提供されていない。

Claude Code can design now. The new /design skill (research preview) brings Claude Design’s artboard workflow into the CLI and Desktop, built on artifacts. Run /design to get editable artboards for your UI — pick one, tweak it, then have Claude implement it.

🇯🇵 Claude Codeがついにインターフェースを設計できるようになりました。新しい/designスキル(予備研究)は、artifacts上に構築されたClaude DesignのartboardワークフローをCLIとDesktopにもたらします。/designを起動すると、インターフェース用の編集可能なartboardが生成されます。1つ選び、調整し、Claudeに実装させてください。@ClaudeDevs on X

🔗 Pro、Max、Team、Enterpriseでの利用可否


Anthropic:Coworkの一般展開、制限延長、CPU最適化

本日のAnthropicの3つの発表は、Claude CodeとCoworkのアクセス性とパフォーマンスに関するものだ。

Claude Coworkが全有料プランでモバイルとWebに対応

8月18日 — Anthropicのコラボレーション環境であるClaude Coworkが、すべての有料プラン(Pro、Max、Team、Enterprise)でモバイルとWebから利用可能になった。これまで主に、desktop・Web・mobile間で共有されるサイドパネルとして語られてきたが、今回の発表は新機能というよりアクセスの一般化を示す。つまり、有料ユーザーはこれら3つの入口のどれからでもCoworkセッションに戻れるようになったが、UIやモバイルの制限についての追加情報はない。

🔗 Claude Coworkの発表

Claude Codeの週次上限50%増加、8月31日まで延長

8月18日 — Anthropicは、Claude Codeの週次利用上限を50%引き上げる一時措置を8月31日まで延長した。チームはこの変更を恒久化したいと考えているが、モデルへの強い需要により今後数週間で容量制約が生じる可能性があるとしており、最終判断の確定時期は示していない。この発表は、Claude Codeの性能と利用をめぐる最近の一連の告知の一部であり、製品インフラに対する需要の継続的な圧力を反映している。

🔗 Claude Codeの制限に関する発表

Claude Code CLIのCPU使用量がp99で半減

8月18日 — 修正により、ツールのJavaScriptランタイムであるBunのガベージコレクタ(garbage collector)は、実行前にプロセスの非アクティブ状態を待つようになった。以前は固定タイマーで起動していたため、Claude Codeが最もCPUを使う会話ターンの最中に実行される可能性があった。その結果、CLIは現在、99パーセンタイルでのCPU使用量が半分になっており、これは8月初旬に公表された他のパフォーマンス最適化の流れを継ぐものだ。

🔗 CPU最適化の発表


コードエージェント:音声チャットとネイティブSSH

AmpとWarpは、新しい対話モードでコードエージェントを拡張した。

Amp、Puckとのリアルタイム音声チャットを開始

8月18日 — Ampは、エージェント兼アシスタントであるPuckとのリアルタイム音声会話を追加した。gpt-realtime-2.1によって動作し、既存のPuckエージェント(GPT-5.6 Sol搭載)に作業を委任し、全文はスレッドに表示し続けながら応答を音声で要約する。Ampは、並列作業の調整、進捗報告の取得、あるいは関連するSlackメッセージを音読させるといった用途を、オフィスでも外出先でも想定している。

🔗 Puckに話しかける

Amp、月額10ドルの教育向け料金を開始

8月18日 — 学生と教員は、通常料金の半額である月額10ドルAmp Megawatt Eduに登録できるようになった。このプランには、Ampのフロンティアエージェント、orbs(監視なしエージェント向けの遠隔マシン)、無制限のコードホスティング(公開・非公開)、年間750時間のorb利用、月額10ドル分のクレジットが含まれる。加入者は既存のChatGPTサブスクリプションを紐づけてGPT-5.6にアクセスするか、X Premium+/SuperGrokのサブスクリプションを紐づけてGrok 4.6を利用できる。学生ステータスの厳格な確認は行われない。

🔗 Amp Megawatt Edu

Warp Agent CLI、ネイティブSSH対応を追加

8月17日 — 無料でダウンロードでき、BYOKおよびGrokサブスクリプションに対応するWarp Agent CLIは、既にアクティブなSSHセッションにエージェントを直接招待できるようになった。vim、SQLのREPL、その他のテキストインターフェース内でも利用でき、単発のコマンド実行に限定されない。遠隔マシン側で追加のCLIは不要で、コマンド! sshを使えば、そのセッション内でエージェントと並んで作業できる。

🔗 Warp Agent CLIとSSH


OpenAI:ティーン、世界的なDevDay、エージェントの影響

本日のOpenAIの4つの発表は、若年ユーザーの安全性、国際展開、そしてCodexの具体的な効果に関するものだ。

ChatGPT for Teens:強化された保護とCodeAIとの教育パートナーシップ

8月18日 — OpenAIはChatGPT for Teensを開始した。これは、Study Mode、宿題の回避を検知できるショートカット防止リマインダー、クイズと教育用可視化、そしてティーンまたは保護者が設定できるStudy Hoursを組み合わせた、10代向けの体験だ。システムは、未成年と推定されるすべてのユーザーをこの体験に自動的に切り替え、新たな「18歳未満」評価をsystem cardsで公開する(自傷行為、摂食障害、暴力、性的コンテンツ)。同時に、CodeAIとの署名付きパートナーシップにより、1年間にわたる児童発達諮問委員会、「Hour of AI」プログラムの拡張、女子・男子高校生向けの「Builders Challenge」、無料コース「AI Foundations」への支援が行われる。

🔗 ChatGPT for Teens

DevDay Exchange:OpenAIが開発者イベントを世界展開

8月18日2026年10月から、OpenAIはDevDay Exchangeを開始する。これはBengaluru、Tokyo、Seoul、Berlin、Paris、London、São Paulo、Mexicoの8都市で開催される開発者イベントシリーズだ。掲げられた目的は、buildersが自分たちの実プロジェクトについて意見交換し、ツール(API、Codex、ChatGPT Work)を開発するOpenAIチームと直接会えるようにすること。現時点では、具体的な形式や申し込みに関する詳細は示されていない。

🔗 DevDay Exchange

Asana、Codexで5年分のエンジニアリング作業を2週間で完了

8月18日 — AsanaはCodexを使って、frontendスタックの近代化を妨げていた古いテストシステムEnzymeを取り除いた。約5年分の作業と600万ドルと見積もられていたプロジェクトは、暦上2週間にわたる1.5週間分のエンジニアリング作業で完了し、総コストは約1万2000ドルだった。5文のプロンプトから始まり、最大4体のCodexエージェントがコードベースの異なるコピー上で並行して作業し、1人のエンジニアが毎日2回各変更を検証した。

🔗 Asanaの事例研究

OpenAI、安全保障におけるAIの民主的統制を強化する取り組みを開始

8月18日 — OpenAIは、訓練、技術支援、OpenAIクレジットを通じて、安全保障におけるAI利用を民主的統制機関が監督できるよう支援するため、500万ドル規模の取り組みを発表した。この取り組みは3つの原則に導かれている。AIは機関の判断を置き換えるのではなく強化すべきこと、政府での利用は認可された監督機関に対して追跡可能であること、そしてAIはこれらの機関が必要な規模で行動できるようにすること。1年を通じて、OpenAIはAI支援による政府判断の追跡ツールを試験運用する予定であり、参加機関は証拠の管理権を保持する。

🔗 民主的統制と国家安全保障


研究とオープンモデル

4本の研究発表は、重みとデータを公開することで何が実証できるかを示している。

Sentence Transformers v6.0:ColBERT型マルチベクトルモデルが第一級に

8月18日 — Hugging FaceはSentence Transformersのバージョン6.0を公開し、MultiVectorEncoderを追加した。これにより、ColBERT風のlate interactionモデルが、既にサポートされているdense、sparse、re-rankerモデルと同じ位置づけになった。文書内の各トークンは独自のベクトルを保持し、最終スコアはクエリの各トークンの最大類似度(MaxSim演算子)を合計する。NanoBEIRベンチ(13データセット)では、multi-vector版の平均NDCG@10は0.6868で、対応するdense版の0.6764を上回ったが、ストレージは増加した(4,874パッセージで圧縮後約92MB)。また、このライブラリはFlash Attention対応を追加し、fp16精度でスループットを2.44倍にしている。

🔗 Sentence Transformers v6.0

Ai2 : Olmo 3、LLMの医療回答における形態学的ショートカットを明らかにする

8月18日 — UT Austin、Northeastern University、MD Anderson Cancer Centerの研究者たちは、Ai2の完全公開モデルであるOlmo 3(7B Instruct)を用いて、モデルが医薬品に関する質問に答える際に、真の知識に基づいているのか、それとも名前の構造を利用しているのかを検証した(たとえば、接尾辞「-pril」はACE阻害薬を示す)。テストした薬剤のうち**51〜59%**について、実在の薬剤名に対するモデルの応答は、架空の名前に対する応答とほとんど区別できなかった。Olmoの重み、データ、途中チェックポイントにアクセスできたことで、このショートカットを学習データまでたどることができた。これは、プロプライエタリなモデルでは不可能な追跡可能性である。

🔗 Olmo 3 と形態学的ショートカット

IBM Research : モデルに応じてエージェント記憶を調整する

8月18日 — IBM ResearchのALTK-Evolveシリーズの新しい論文は、エージェント記憶 — エージェントの過去の作業から蒸留された指示 — は、基盤となるモデルの能力に応じて配分する必要があることを示している。8つのモデルで検証したところ、gpt-oss-120bは、わずか+5%のトークン増で選択的な対象限定取得を行うだけで、タスク完了率が**+16.1ポイント向上した。DeepSeek-V3.2は、指示の完全注入で+9.5ポイント**改善した。GLM-5では測定可能な増加は見られず、飽和の事例となった。直感に反する発見として、最も低コストの戦略が、しばしば最も弱いモデルに対して最良の精度をもたらす。

🔗 ALTK-Evolve — エージェント記憶

AlphaEvolve が行列乗算の新記録に貢献

8月18日 — Google DeepMindは、行列乗算における理論上最速の速度指数であるオメガ(ω)について、ω < 2,371177 という新記録を発表した。この成果は、Google DeepMind、学術協力者、そして2025年に複数のアルゴリズムを改善したことで知られるGemini搭載のコーディングエージェントAlphaEvolveによる共同努力から生まれた。行列乗算は、AIモデルの学習や推論を含む現代コンピューティングの大部分を支えており、この指数に対する理論的改善は、単なる学術研究を超える意味を持つ。

🔗 オメガの新記録


推論の経済性 : A/Bテストとコストの連鎖

Together AIの2本の論文は、本番運用とモデル比較の実コストを測定している。

Together AI、エンドポイントレベルでのモデルA/Bテストを開始

8月18日 — Together AIは、A/Bテストをアプリケーションコードではなくエンドポイント層に直接統合した。1回の実験で、1つの制御モデルと最大20のバリアントを組み合わせ、それぞれに固定のトラフィック割合(95/5、80/20、50/50)を割り当て、レプリカ数とは独立に扱う。更新は30〜60秒で反映され、etagによる保護で同時上書きを防ぐ。勝者が特定されると、blue-greenデプロイで昇格され、その後実験は削除される。これにより、100%のトラフィックが制御モデルに戻り、クライアント側で片付ける残留ロジックは残らない。

🔗 Together AI の A/B テスト

DeepSeek V4 Pro、GPT-5.6 Sol と Claude Fable 5 を DeepSWE で比較 : コストとカスケード

8月17/18日 — Together AIは、各904回のロールアウト(113タスク、4回試行)からなる2つの独立ベンチマークを公開し、DeepSWE(ソフトウェア工学のベンチマーク)上で DeepSeek V4 Pro 0813 を GPT-5.6 Sol と Claude Fable 5 と比較した。

比較Pass@1 ProPass@1 競合Pro のロールアウトコスト競合のコストPro-first カスケード
Pro vs GPT-5.6 Sol62,8 %72,7 %0,24 $8,37 $ (35x)83,0 %、3,35 $/タスク
Pro vs Claude Fable 562,8 %69,7 %0,24 $21,63 $ (90x)82,7 %、8,28 $/タスク

pass@4では、Pro が両方のケースで優位に立つ(Sol に対して 88,5 % 対 85,8 %、Fable に対して 88,5 % 対 84,1 %)。「Pro-first」カスケード — まず Pro を実行し、失敗した場合のみ上位モデルにエスカレーションする — は、各モデル単体を上回りつつ、コストのごく一部で済む。

🔗 DeepSWE ベンチマーク — GPT-5.6 Sol


メールと生成音声の製品

Perplexity Computer がメールで利用可能に

8月18日 — PerplexityのアクションエージェントであるComputerが、すべてのユーザーに対してメール経由で利用可能になった。任意のスレッドで computer@perplexity.com を宛先に送る、転送する、またはCCに入れるだけでタスクを起動できる。メール経由の各タスクは通常のComputerセッションとして実行され、Webとモバイルから確認でき、アプリから開始したタスクと同じ監査ログを持つ。

🔗 メールで使うComputer

Stability AI、DAWプラグインとStable Audio 3.0向けの新しいWebインターフェースを発表

8月18日 — Stability AIは、Stable Audio 3.0向けの2つのベータ版ツールを発表した。どちらも、ユーザーが出力の権利を持つ「commercially-safe」モデルに基づいている。DAWプラグイン(macOS AU/VST3、Apple SiliconとIntel対応)は、テンポ同期したインストゥルメントトラックとして音声を直接生成し、最長6分の短いセクションを作成できる。stableaudio.com上の強化されたWebインターフェースは、生成結果を調整するための方向性プロンプト、audio-to-audio変換、マルチトラックミキシング、トラックごとのエフェクトを追加する。これらのツールは、Stable Audioをプロの音楽制作ワークフローに近づけるものであり、SunoやPikaがすでに競合製品を提供している領域に踏み込む。

🔗 Stable Audio 3.0 — 新ツール


ブレーズ

  • Hugging Face Hub が300万モデルを突破 — オープンモデルの主要コミュニティプラットフォームにとって新たな節目。🔗 Tweet
  • Sakana Namazu が OpenRouter と Vercel AI Gateway で利用可能に — Sakana Chat を支える、日本語と業務コンテキストに特化したモデルが、これら2つの配信プラットフォームで利用可能になる。🔗 Tweet
  • Ai2 が 8月20日のウェビナー前に MolmoMotion を先行公開 — 自然言語指示から3D軌道予測を行う Molmo の拡張版で、オープンな重みとデータが今後公開予定であることが発表された。🔗 Tweet
  • Together AI : オープンモデルの採用が加速 — Together AI が引用した Brex の調査によると、AIを提供する成長率上位25社のうち14社がソフトウェアベンダーだった。Together におけるトークン使用量は、1年で月300億から400兆へ増加した。🔗 Tweet
  • Josh Woodward が Gemini アプリのロードマップを詳述 — Workspace ツールの再設計をテスト中、Gemini 3.7 Flash による tool calling の改善、新しい Projects インターフェース、そして現在49のコネクタをサポート。🔗 Tweet
  • HeyGen が Brand Kits を発表 — フォント、ロゴ、16進コード、発音用語集を事前設定し、生成される各アバター動画がブランドガイドラインに沿うようにする。再編集は不要。🔗 Tweet
  • NVIDIA、Codex エージェントで TensorRT Model Connect を構築 — Hugging Face モデルを TensorRT に変換するプレビュー版ツールで、人間の監督の下、Codex エージェントのみを用いて完全に開発されたオープンソースプロジェクト。🔗 Tweet
  • Cohere — Aidan Gomez が語るデジタル主権 — CEOは、世界のテクノロジー市場が少数のプレイヤーに集中していることに警鐘を鳴らし、単一障害点を避ける必要性を訴えている。🔗 Tweet

それが意味すること

AIのガバナンスは、もはや原則ではなく具体的な測定値として表現されるようになっている。OpenAIがAstraのサイバー能力に対して2週間の停止措置を取ったこと、国家安全保障における民主的統制のために500万ドル規模の取り組みを始めたこと、そしてChatGPT for Teensの保護強化は、いずれも同じ流れを形作っている。研究所は、自らに課す上限を公開し、単なる意図表明ではなく検証可能な数値(計算コスト20%増、30分以内のアラート)を示している。

エージェント基盤そのものが、独立した製品になりつつある。Warp Factoriesは企業向けコーディングエージェントのためのガバナンスとROI測定の層を提供し、Claude Codeは /design によってUI設計へ適用範囲を広げ、AmpはPuckエージェントに音声レイヤーを追加し、Warpは稼働中のSSHセッションに自社エージェントを接続する。4つの例すべてにおいて、焦点はコード生成を超えている。エージェントにワークフロー全体への直接的な関与を与え、ガバナンスと人間の制御を組み込むことが課題である。

重みとデータの公開は、プロプライエタリモデルでは得られない科学的価値を生み続けている。Ai2による薬理学におけるLLMの形態学的ショートカットの発見は、Olmo 3 が学習データを公開していたからこそ可能だった。IBM Researchのエージェント記憶に関する論文は、再現可能なテストによってモデル別の差分効果(gpt-oss-120b、DeepSeek-V3.2、GLM-5)を数値化している。そしてHugging Face Hubでモデル数が300万に達したことは、このオープンなエコシステムの規模を示している。

推論コストは、純粋な性能以上に、引き続き製品の選択を左右している。GPT-5.6 Sol と Claude Fable 5 に対して、DeepSeek V4 Pro は pass@1 では劣るものの、品質と価格の比率では大きく上回る。単純な「Pro-first」カスケードで、精度差の大部分をコストのごく一部で埋めることができる。Together AIは、このロジックをエンドポイントレベルのA/Bテストとしてインフラ自体にまで押し広げている。つまり、本番環境でのモデル比較は、もはやアプリケーションコードの問題ではなく、プラットフォーム機能になっている。


出典