検索

ChatGPTがWhatsAppに再登場、GitHub Copilot CLIがより信頼性向上、AnthropicがClaudeの価値観を調査

ChatGPTがWhatsAppに再登場、GitHub Copilot CLIがより信頼性向上、AnthropicがClaudeの価値観を調査

ai-powered-markdown-translator

gpt-5.4-miniを使ってfrからjaに翻訳された記事。

GitHub でプロジェクトを見る ↗

OpenAIはヨーロッパでChatGPTをWhatsAppに戻し、さらに2つの新しいメッセージングアプリへ広げた。GitHubはCopilot CLIの信頼性を高め、Ampはエージェントがコードをコミットする方法を変えた。研究面では、Anthropicが言語ごとにClaudeが表す価値観の研究を公開し、Ai2とSakana AIはそれぞれ、運用中の海洋監視エージェントと、物理的集合知の実験を詳述している。


ChatGPTがEEEでWhatsAppに再登場、KakaoとViberにも拡張

7月13日 — ChatGPTは、当該地域での一時的な利用不可期間を経て、欧州経済領域(EEE)のWhatsAppで再び利用できるようになった。アクセスは認証済みの連絡先 1-800-CHATGPT を通じて行われ、質問の送信、画像の送信、音声メモの送信、画像生成、多数の言語でのChatGPT利用が、メッセージングアプリ内から直接できる。

OpenAIは並行して、ChatGPTの提供先を2つの新しいアプリにも広げる。韓国のKakaoと、対応市場でのViberだ。狙いは明快で、専用のChatGPTアプリやサイトへ誘導するのではなく、すでに日常的に使われているメッセージングアプリ内でアシスタントにアクセスできるようにすることだ。

🔗 発表 — @ChatGPTapp


GitHub Copilot CLI v1.0.42:サブエージェントへの委譲がより信頼性向上

7月13日 — GitHubはCopilot CLIの1.0.42+版を公開し、/update でインストールできる。この更新では、よりスマートなサブエージェント委譲(smarter subagent delegation)が導入され、技術的な測定方法の詳細は示されていないものの、コードセッションをより速く、より信頼できるものにすることを意図している。

測定された失敗の種類発表された削減率
ツール失敗-23%
検索失敗-27%
編集失敗-18%

GitHubは、これらの変更にもかかわらず品質の回帰は見られなかったと明言している。

🔗 発表 — @github


Ampのorbsがユーザーの代わりにコミットできるように

7月11日 — Ampはプロジェクト設定において、遠隔でエージェントを実行するマシンであるorbsがAmpではなくユーザーの名義でコミットできるオプションを追加し、コミットには co-authored-by の表記が付く。

You can now make Amp orbs commit as you, not Amp (+ co-authored-by you). It’s in project settings. Useful for, e.g., pushing to a repo where Vercel only deploys for known committers.

🇯🇵 これでAmpのorbsを、Ampの名義ではなくあなたの名義でコミットさせることができます(co-authored-by の表記付きで)。これはプロジェクト設定にあります。たとえば、Vercelが既知のコミッターに対してのみデプロイするリポジトリへ push したい場合に便利です。@sqs のX


Anthropicがモデルと言語ごとのClaudeの価値観を調査

7月13日 — Anthropicは、会話の中でClaudeが表す価値観に関する研究(誠実さや人間味など、3,000以上の価値観を特定)を、使用するモデルと言語によってどのように変化するかを分析する形で拡張した。この研究は、匿名化された30万件超の会話を4つの軸にまとめたものに基づいている。

軸(フランス語 / 原文)何を測るか
従順性 vs 慎重さ (Deference vs. Caution)ユーザーに従う傾向か、それを和らげる傾向か
温かみ vs 厳密さ (Warmth vs. Rigor)温かい口調か、証拠を求める厳しさか
深さ vs 簡潔さ (Depth vs. Brevity)詳しく展開した応答か、要点を絞った応答か
率直さ vs 実行 (Candor vs. Execution)直接的な批評か、単純な実行か

モデル間の差は比較的小さいままで(Sonnet 4.6はより陽気で肯定的、Opus 4.7は率直な批判にやや傾く)、最も顕著な違いは言語によって現れる。Claudeはヒンディー語とアラビア語では温かみ寄り、ロシア語では厳密さ寄りになり、ユーザーの主張に対して証拠を求めることがより多い。

🔗 発表 — @AnthropicAI


Ai2が海洋監視エージェントShippyの舞台裏を詳述

7月13日 — Ai2(AllenAI)は、海洋分野の監視のためにチームSkylightが構築したエージェントShippyについての実践的な振り返りを公開した。用途は、漁業イベントの検出、船舶の追跡、保護区域の監視などだ。このエージェントは現在、70か国以上で300以上のパートナーに利用されている。

The real work wasn’t the model. It was building a system we could trust to be correct, to stay within appropriate boundaries.

🇯🇵 本当の仕事はモデルではなかった。私たちが正しく、適切な範囲内に収まると信頼できるシステムを構築することだった。Ai2 Blog

技術的には、ShippyはOpenClaw(オープンソースのエージェントフレームワーク)を基盤に、Claude Opus 4.6をモデルとして用い、3つの要素――「魂」(システムプロンプトとガードレール)、「スキル」(skills)、「設定」(パラメータとモデル選択)――で構成されている。クライアントごとの分離は、各ユーザーセッションごとにKubernetesデプロイをプロビジョニングする社内プラットフォームMothershipによって実現され、評価はHarborフレームワークで行われる。そこではLLMジャッジが書かれた推論を伴って応答を採点する。


Sakana AIが約200個の物理ブロックを協調させて自分の形を認識させる

7月12日 — Sakana AIは、IT University of CopenhagenおよびAutodeskとともに、物理的集合知に関する研究を公開した。そこでは、「セルラーブロック」――同じニューラルネットワーク(ニューラルセルオートマトン、Neural Cellular Automata)をローカルに実行する立方体のハードウェアモジュール――が、中央制御装置なしに、自分たちが構成する全体形状を集団的に推論する。

At Sakana AI, a recurring theme in our research is collective intelligence: the observation that sophisticated, robust behavior can arise from many simple parts following local rules, with no central controller, as it does in a colony, a tissue, or a brain.

🇯🇵 Sakana AIでは、私たちの研究の繰り返し現れるテーマの1つが集合知です。つまり、中央制御装置がなくても、局所ルールに従う数多くの単純な要素から、洗練されて頑健な振る舞いが生まれうるという観察です。これは、コロニー、組織、脳で見られるのと同じです。Sakana AI Blog

約200個のブロックと4つの組み立て形状(飛行機、ギター、船、机)で試したところ、このシステムは60サイクル(約3分)で100%の分類精度を達成し、最大5%のモジュール故障にも耐え、構造損傷を94.8%の精度で検出し、シミュレーションでは18,000個超のキューブからなるグリッドへスケールした。


Google DeepMindがGoogle AntigravityでSkill「Predicting the Past」を紹介

7月13日 — Google DeepMindは、プログラミングの知識を一切必要とせずGoogle Antigravityで実行される「Predicting the Past」というSkillを詳述した。これは古代のテキストや遺物を解析する。文書化されたユースケースは3つある。Aeneasモデルを使った、1800年前のローマ時代の呪いの板(curse tablet)の年代特定と所在地の推定、ヨーロッパ全域にわたるAufaniae信仰のマッピング(スペインにある、ローマの退役軍人が建てた孤立した祭壇まで含む)、そして古代の鉛板からデュッセルドルフ神託所の訪問者ネットワークの再構築だ。

このSkillは毎回、予測の説明を生成し、専門家向けの碑文学的コメントのような形になる。

🔗 発表 — @GoogleDeepMind


短報

  • Ampが複数ユーザーで共同作業できるスレッドを準備中 — Ampのスレッドはすでに多くのクライアントから同時に追跡できるが、作成者のアカウント下でのみ可能だった。チームは同じスレッド上での複数アカウント共同作業に取り組んでいる。🔗 @sqs のX
  • AmpのネイティブmacOS版が開発中 — 現在のWebアプリと機能面で差はない見込みで、公開時期はまだ発表されていない。🔗 @sqs のX
  • GitHubがSSOページとOrganizationsページを分離 — ユーザー設定の統合ページを、分かりやすさのため2つの別ページに分割。🔗 GitHub Changelog
  • HeyGen CLI:コマンドラインで音楽と効果音 — ターミナルからHeyGenの音楽/SFXカタログを無料で検索・ダウンロードでき、動画のリズムに合わせて音を同期するエージェントのデモもある。🔗 @HeyGen のX

これが意味すること

配信は、一般向けアシスタントにとって再び戦場になっている。 EEEでのWhatsAppへのChatGPT再登場とKakao・Viberへの拡張は、OpenAIが自社インターフェースへの誘導よりも、すでに導入済みのアプリ内での存在感を重視していることを示している。これは機能よりも配信経路の論理だ。アシスタントは、欧州のような規制市場で一時中断を経たとしても、すでにユーザーがいる場所へ向かう。

エージェントの信頼性は、モデルの副産物ではなく、独立した設計軸になりつつある。 GitHubは新しいサブエージェント委譲の効果を具体的に数値化し(ツール失敗-23%、検索-27%、編集-18%)、Ai2もShippyを通じて同じ教訓を裏側から示している。つまり、本番での信頼性は、選ばれたモデルだけではなく、決定論的なツール、明示的なガードレール、分離されたインフラから生まれる。Ampのorbsがユーザー名義でコミットできるようになったことも、同じ運用上の関心に属する。既存のデプロイパイプラインにきれいに統合することだ。

モデルの振る舞いに関する研究は、テキストの外へ広がっている。 言語ごとのClaudeの価値観に関するAnthropicの研究は、文化的な差(ヒンディー語とアラビア語での温かみ、ロシア語での厳密さ)が、モデルのバージョン差よりも大きく効くことを示している。Sakana AIのセルラーブロックは、隣接しつつも異なる問いを投げかける。中央モデルなしに、同一の局所ルールを大規模に反復することで、知的で頑健な振る舞いを得られるのか――自己診断できる物理システムへの道筋になりうる。

ノーコードのAIは、非常に専門的な上級用途へ進んでいる。 Google DeepMindのSkill「Predicting the Past」が碑文学と考古学に適用されたことは、複雑なワークフローが、プログラミング知識のない研究者にも使えるようになっていく様子を示している。これにより、本来なら自力でこうしたツールを作れなかったユーザーにも、ニッチな分野が開かれていく。


ソース