← 返回洞察
模型4 分钟阅读

智能体能力,多了一个运行时旋钮

Claude Sonnet 5 真正值得关注的,不是又多了几项榜单领先,而是开发者可以在同一个模型内调节 token 消耗与工具活动。运行时策略由此成为智能体能力的一部分,但它仍不是有硬性保证的算力预算。

Anthropic 于 6 月 30 日发布 Claude Sonnet 5,覆盖 Claude 各档计划、Claude Code 与 API。API 在 8 月 31 日前采用每百万输入 token 2 美元、输出 token 10 美元的推广价,之后调整为 3/15 美元;官方模型文档列出的上下文窗口为 100 万 token,同步最大输出为 12.8 万 token。13

真正有意思的并不是标价。Sonnet 5 提供 low、medium、high、xhigh、max 五档 effort。Anthropic 明确说明,这个设置会影响整次响应的全部 token,包括思考与工具调用;较低 effort 往往减少工具调用,较高 effort 则允许更多探索。它是一种行为信号,而不是严格的 token 预算。4

证据Sonnet 5Sonnet 4.6解读时要记住
BrowseComp,单智能体84.7%76.2%Sonnet 5 使用 max effort、1000 万 token 上限和上下文压缩
OSWorld-Verified81.2%78.5%361 项任务、最多 100 步,五次运行的 pass@1 平均值
SWE-bench Pro63.2%58.1%厂商自行运行;标准配置采用自适应思考与 max effort
8 月 31 日后 API 标价每百万 token 3/15 美元每百万 token 3/15 美元相同输入在 Sonnet 5 上的 token 数约为此前的 1.0–1.35 倍

这张表能够支持的结论,比“便宜模型打败昂贵模型”更克制。Anthropic 的系统卡写明,多数能力评测使用 30 万至 100 万 token,而 BrowseComp 的上限达到 1000 万 token,并启用上下文压缩。2 BrowseComp 本身由 1266 个刻意设计得难以检索的问题组成;论文作者也称它只是“不完整但有用”的指标,并承认该评测回避了真实用户问题中的歧义和长答案等难点。5 OSWorld 更接近实际操作,但 Anthropic 在重新评测旧模型前,也修复了缩放工具问题,并提高了单轮 token 上限。26

因此,更稳妥的洞察是运行时策略。选定模型检查点,并不能完全决定智能体如何行动:同一个模型会随 effort 不同而改变工具调用次数与响应 token 消耗。生产系统可以让常规任务从 low 或 medium effort 开始,再根据自身检查结果,只对确有收益的任务升级。

工程问题因此变得可以测量:不同任务在各档 effort 下,效果提升是否足以抵消额外的 token、工具调用与延迟?Anthropic 的文档还提醒,在依赖提示缓存的对话中途修改 effort,会使此前的缓存前缀失效。团队应在自己的评测集上测试各档 effort,并在依赖缓存经济性的对话中保持设置稳定。4

Digital AGI

帮助我们提升信号质量。

告诉我们哪些内容有用、不清楚或有所遗漏。

仅在你提交时发送反馈、选填邮箱、类别、页面上下文、语言、粗略设备类型与版本。分析事件绝不包含反馈正文或邮箱。