搜索

ChatGPT 重返 WhatsApp,GitHub Copilot CLI 更可靠,Anthropic 研究 Claude 的价值观

ChatGPT 重返 WhatsApp,GitHub Copilot CLI 更可靠,Anthropic 研究 Claude 的价值观

ai-powered-markdown-translator

由 gpt-5.4-mini 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

OpenAI 将 ChatGPT 带回欧洲的 WhatsApp,并将其扩展到另外两款消息应用;GitHub 提升了 Copilot CLI 的可靠性;Amp 改变了其代理提交代码的方式。研究方面,Anthropic 发布了一项关于 Claude 按语言表达价值观的研究,而 Ai2 和 Sakana AI 则分别详细介绍了一个正在生产环境中运行的海事监控代理,以及一项物理集体智能实验。


ChatGPT 重返 EEE 内的 WhatsApp,并扩展到 Kakao 和 Viber

7 月 13 日 — ChatGPT 现已重新可在欧洲经济区(EEE)的 WhatsApp 中使用,此前该地区曾出现一段时间的不可用。访问方式是通过经过验证的联系人 1-800-CHATGPT,它允许用户提问、发送图片、发送语音笔记、生成图像,并在许多语言中直接在消息应用里使用 ChatGPT。

OpenAI 同时将 ChatGPT 的可用范围扩展到另外两款新应用:韩国的 Kakao,以及受支持市场中的 Viber。其策略很明确:让助手出现在人们日常已经在使用的消息应用中,而不是强迫用户转向专门的 ChatGPT 应用或网站。

🔗 公告 — @ChatGPTapp


GitHub Copilot CLI v1.0.42:对子代理的委派更可靠

7 月 13 日 — GitHub 发布了 Copilot CLI 1.0.42+ 版本,可通过命令 /update 安装。此次更新引入了更智能的子代理委派(smarter subagent delegation),旨在让代码会话更快、更可靠,但未提供该测量方法的技术细节。

测量的失败类型宣称的降低幅度
工具失败-23%
搜索失败-27%
编辑失败-18%

GitHub 说明,尽管进行了这些更改,但并未观察到质量回归。

🔗 公告 — @github


Amp 的 orbs 现在可以代表用户提交代码

7 月 11 日 — Amp 在其项目设置中新增了一个选项,允许 orbs(远程执行代理的机器)以用户身份而非 Amp 身份进行 commit,并在提交中附带 co-authored-by 标记。

You can now make Amp orbs commit as you, not Amp (+ co-authored-by you). It’s in project settings. Useful for, e.g., pushing to a repo where Vercel only deploys for known committers.

🇨🇳 你现在可以让 Amp 的 orbs 以你的名义而不是以 Amp 的名义进行 commit(并附带 co-authored-by 署名)。这是在项目设置里。比如说,这对推送到一个只有已知提交者才会被 Vercel 部署的仓库很有用。@sqs 在 X 上


Anthropic 按模型和语言研究 Claude 表达的价值观

7 月 13 日 — Anthropic 继续推进其关于 Claude 在对话中表达的价值观的研究(已识别出 3,000 多种价值观,如诚实或温暖感),分析它们如何随所用模型和语言而变化。该研究基于超过 30 万段匿名化对话,归纳为四个轴。

轴(法语 / 原文)它衡量什么
顺从 vs 谨慎(Deference vs. Caution倾向于遵从用户还是加以克制
温暖 vs 严谨(Warmth vs. Rigor语气温暖还是强调证据
深度 vs 简洁(Depth vs. Brevity回答详尽还是简明
坦率 vs 执行(Candor vs. Execution直接批评还是仅执行

模型之间的差异仍然不大(Sonnet 4.6 更活泼、更倾向于肯定,Opus 4.7 更倾向于直率批评),但最明显的差异出现在语言层面:Claude 在印地语和阿拉伯语中更偏向温暖,在俄语中更偏向严谨,也就是更常要求用户主张提供支撑证据。

🔗 公告 — @AnthropicAI


Ai2 详解其海事监控代理 Shippy 的幕后机制

7 月 13 日 — Ai2(AllenAI)发布了一篇关于 Shippy 的经验总结,这是其 Skylight 团队为海事领域监控而构建的代理:用于检测捕鱼事件、跟踪船只、识别保护区。该代理如今为 70 多个国家的 300 多个合作伙伴提供服务。

The real work wasn’t the model. It was building a system we could trust to be correct, to stay within appropriate boundaries.

🇨🇳 真正的工作并不是模型,而是构建一个我们能够信赖其正确性、并能保持在适当边界内的系统。Ai2 Blog

从技术上看,Shippy 基于 OpenClaw(开源代理框架),模型采用 Claude Opus 4.6,结构分为三部分——一个“灵魂”(系统提示词及其护栏)、“技能”(skills)和“配置”(参数与模型选择)。客户代理之间的隔离通过 Mothership 实现,这是一个自研平台,会为每个用户会话预置一个 Kubernetes 部署;评估则通过 Harbor 框架完成,其中由一个 LLM 裁判用书面推理来评分回答。


Sakana AI 让近 200 块物理积木协作识别自身形状

7 月 12 日 — Sakana AI 联合哥本哈根 IT 大学和 Autodesk 发布了一项关于物理集体智能的研究:所谓“细胞砖块”——在本地运行同一神经网络的立方体硬件模块(神经细胞自动机,Neural Cellular Automata)——能够集体推断它们所组成的整体形状,而无需中央控制器。

At Sakana AI, a recurring theme in our research is collective intelligence: the observation that sophisticated, robust behavior can arise from many simple parts following local rules, with no central controller, as it does in a colony, a tissue, or a brain.

🇨🇳 在 Sakana AI,我们研究中的一个反复出现的主题是集体智能:观察到一种复杂而稳健的行为,能够在没有中央控制器的情况下,从许多遵循局部规则的简单部分中涌现出来,就像群落、组织或大脑中的情况一样。Sakana AI Blog

在近 200 块积木和四种组装形状(飞机、吉他、船、桌子)上测试后,该系统在 60 个周期(约 3 分钟)内达到了 100% 的分类准确率,在多达 5% 模块失效的情况下仍保持稳健,能以 94.8% 的准确率检测结构损坏,并可在仿真中扩展到超过 18,000 个立方体的网格。


Google DeepMind 在 Google Antigravity 中推出 Skill「Predicting the Past」

7 月 13 日 — Google DeepMind 详细介绍了一项名为「Predicting the Past」的 Skill,它可在无需任何编程技能的情况下于 Google Antigravity 中运行,用于分析古代文本和文物。文档中展示了三个使用案例:借助 Aeneas 模型对一块已有 1,800 年历史的罗马诅咒泥板(curse tablet)进行断代和定位;跨欧洲绘制 Aufaniae 祭祀崇拜的分布图(最远延伸到西班牙一座由罗马老兵建立的孤立祭坛);以及根据古代铅质泥板重建多多纳神谕的访客网络。

该 Skill 每次都会生成其预测的解释,类似面向领域专家的铭文学注释。

🔗 公告 — @GoogleDeepMind


简讯

  • Amp 正在准备多用户协作线程 — 一个 Amp 线程现在已经可以从许多客户端同时查看,但目前只能以其创建者的账户身份;团队正在为同一线程开发多账户协作。🔗 @sqs 在 X 上
  • Amp 的原生 macOS 版本正在开发中 — 预计在功能上与当前的 web app 没有差异,也尚未公布发布日期。🔗 @sqs 在 X 上
  • GitHub 分离 SSO 和组织页面 — 原本合并的用户设置页面被拆分为两个独立页面,以提高清晰度。🔗 GitHub 更新日志
  • HeyGen CLI:命令行中的音乐和音效 — 可从终端免费搜索和下载 HeyGen 的音乐/SFX 目录,并演示了一个代理如何将声音与视频节奏同步。🔗 @HeyGen 在 X 上

这意味着什么

分发渠道再次成为面向大众助手的战场。 ChatGPT 重返 EEE 内的 WhatsApp 并扩展到 Kakao 和 Viber,表明 OpenAI 押注于出现在用户已经安装的应用中,而不是吸引用户转向自家界面。这更像是一种分发渠道逻辑,而不是功能逻辑:助手去往用户已经所在的地方,哪怕这意味着在欧洲这类受监管市场经历中断后再度回归。

代理的可靠性正在成为一条独立的工程轴,而不是模型的副产品。 GitHub 对其新子代理委派带来的收益给出了精确量化(工具失败 -23%、搜索 -27%、编辑 -18%),而 Ai2 通过 Shippy 也表达了同样的结论:生产环境中的可靠性来自确定性工具、显式护栏和隔离基础设施,而不仅仅是所选模型。Amp 的 orbs 现在以用户名义进行 commit,也体现了同样的运维关切——要能够干净地融入现有部署流水线。

对模型行为的研究正在超越文本本身。 Anthropic 关于 Claude 按语言表达价值观的研究表明,文化差异(印地语和阿拉伯语中的温暖、俄语中的严谨)比模型版本之间的差异更为显著。Sakana AI 的细胞砖块则提出了一个相关但不同的问题:是否能够在没有中央模型的情况下,仅凭在大规模上重复的相同局部规则,获得智能且稳健的行为——这为能够自我诊断的物理系统提供了一条思路。

无代码 AI 正在向高度专业化的专家场景推进。 Google DeepMind 的 Skill「Predicting the Past」应用于铭文学和考古学,说明复杂工作流如何变得让不具备编程技能的研究人员也能使用,从而让那些原本不可能自行构建这些工具的用户进入这些细分领域。


来源