ai-powered-markdown-translator使用 gpt-5.6-sol 将文章从法语翻译成中文。
这个星期日没有新模型发布,但有两项面向开发者的实质性更新。9 月 10 日发布的 DeepSeek V4.1 Flash 已登陆 Together AI,定价与 DeepSeek 高峰时段相同;Together 称其每项任务成本仅为 GPT-5.6 Sol 的三分之一,但这一说法需要结合具体差异来看。另一方面,Perplexity 允许在其 Agent API 中一次性注册 MCP 服务器。Sakana AI 回顾了 Royal Society 的一期特刊,而 Hugging Face 社区博客的三位投稿者则分别以不同方式探讨了结果验证问题。
Together AI 上线 DeepSeek V4.1 Flash,并称其每项任务成本仅为 GPT-5.6 Sol 的三分之一
9 月 13 日 — DeepSeek V4.1 Flash 已在 Together AI 上线,既可通过 serverless 使用,也可专属部署;每百万输入 token 收费 0.30 美元,输出收费 1.20 美元。这与 DeepSeek API 的高峰时段价格完全相同,而 DeepSeek 在低峰时段会将价格减半。
Together 援引 Artificial Analysis 的测量结果称,该模型在智能体基准测试中胜过 GPT-5.6 Sol,而每项任务成本仅为后者的三分之一:
| 对比指标 | DeepSeek V4.1 Flash | GPT-5.6 Sol (high) |
|---|---|---|
| AutomationBench-AA | 69 % | 55 % |
| Terminal-Bench v4.0 | 27 % | 21 % |
| GDPval-AA v2 | 1632 | 1524 |
| 每项任务的平均成本(Intelligence Index) | 0.27 美元 | 0.81 美元 |
这里有两点需要注意:Together 自己的模型介绍页显示,V4.1 Flash 在推理方面落后于 GPT-5.6 Sol(GPQA Diamond 为 90.9% 对 94.1%,HLE 为 36.8% 对 47%);而在 Terminal-Bench v4.0 上,Artificial Analysis 测得的优势,在 DeepSeek 9 月 10 日发布的表格中却出现了逆转:该表给出的成绩是 V4.1 Flash 为 31.2,GPT-5.6 Sol 为 39.9。
Perplexity 向自定义连接器开放 Agent API,只需一次性注册 MCP 服务器
9 月 13 日 — Perplexity 为其 Agent API 添加了自定义连接器(custom connectors)。管理员只需在项目(Project)的连接器中注册一次远程 MCP 服务器,填写名称、URL,选择 API 密钥认证或无认证,并选择 Streamable HTTP 或 SSE 传输方式。Perplexity 会保存服务器的访问密钥,此后使用项目中任意 API 密钥发出的请求,只需通过 type: "connector" 引用连接器标识符。
相比之下,如果在请求中直接传入 MCP 服务器(type: "mcp"),其 URL 和凭据就必须随每次调用一同发送,而且仅支持 Streamable HTTP。这些连接器扩展了 8 月 27 日为 GitHub、Slack、Google Drive 和 Datadog 推出的托管连接器(managed connectors);如今加上 Linear 和 Notion,共有六种。工具发现默认延迟执行,模型会先搜索,再加载所需的 schema,因此需要将 max_steps 设得足够高。目前没有公布专门的定价。
🔗 Perplexity 连接器文档 🔗 Perplexity API 更新日志
简讯
- Sakana AI 回顾世界模型(world models)特刊 — 这篇 9 月 12 日发布的日语博文介绍了 2026 年 5 月 14 日出版的 Philosophical Transactions of the Royal Society A 特刊;Sakana AI 首席执行官 David Ha 与另外十三位合著者共同署名其导言。此次新闻点在于这篇博文,而非特刊本身的出版。🔗 来源
- REINFORCE 摆脱了精确梯度上升仍会受困的陷阱 — 这是 Hugging Face 社区博客上的个人投稿,并非实验室论文:在同一位读者进行了四十二轮验证后,RDTvlokip 展示了这样的结果——运行 20,000 步时,精确梯度上升在 12 次试验中没有一次得到无歧义编码(即双射),而 REINFORCE 在 12 次中成功了 11 次。不过,所有这些数字都依赖于 Adam 优化器。🔗 来源
- Phionyx 为 AI 审计提出证据契约 — 这是另一篇个人投稿:Ali Toygar Abak 希望防止仪表板或报告在无形中扩大证据实际能够证明的范围,例如将一次被拒绝的工具调用最终表述为被防护机制阻止的安全事件。他提出为每项论断附加八组元数据,但目前仍只是工程与测试方案,没有实验结果。🔗 来源
- darkc0de 提议按获得经验证结果所需的时间评判智能体模型 — 这是第三篇个人投稿:Sonny DeSorbo 认为,能力较弱但速度更快的模型,可能在慢速模型完成第一次尝试之前进行多轮修正;他还勾勒了一个名为 Persistent Challenge Completion 的基准,用于衡量每秒完成的经验证工作量。这是一项没有实验支撑的思考,作者也提醒读者不必过于认真看待。🔗 来源
这意味着什么
第一条主线涉及智能体工具体系。有了自定义连接器,MCP 服务器就从每次请求中重复传递的参数,变成了项目级资源:管理员注册一次,Perplexity 保存其访问密钥,调用 Agent API 的代码便不再需要携带该密钥。Perplexity 因而将 8 月底推出的托管连接器机制扩展到用户自己的 MCP 服务器,无论服务器使用 API 密钥保护还是无需认证;同时,除 Streamable HTTP 外,也支持 SSE 传输。相应的代价是工具发现会延迟执行,因此必须为模型保留足够的步骤,让它在行动前先进行搜索。接入工具由此更像是一项面向整个项目、只需执行一次的管理操作,而不是每次调用都要重复配置的设置。
第二条主线关乎价格与衡量方式。Together AI 以 DeepSeek 高峰时段完全相同的价格提供一款采用 MIT 许可证发布的开放模型:对于能够将调用集中在低峰时段的用户,DeepSeek API 仍然便宜一半。其重点宣传的每项任务成本,也需要结合差异理解。Together 的说法针对的是智能体基准测试,而不是 V4.1 Flash 仍落后于 GPT-5.6 Sol 的推理能力;即使是在 Terminal-Bench v4.0 这样的智能体测试中,排名也会因来源不同而变化:在 Artificial Analysis 的结果中,V4.1 Flash 领先 GPT-5.6 Sol(27% 对 21%),但在 DeepSeek 的表格中却落后于后者(31.2 对 39.9)。当天的三篇社区博文都回到了同一种验证要求:RDTvlokip 让同一位读者对结果进行了四十二轮审阅;Phionyx 希望防止报告暗中扩大证据实际能够证明的范围;darkc0de 则提议衡量每秒完成的经验证工作量,而不是只看第一次尝试是否成功。无论面对的是分数、成本还是审计结论,核心问题始终是:这个数字是在什么条件下得到的。