智能体能力,多了一个运行时旋钮
Claude Sonnet 5 真正值得关注的,不是又多了几项榜单领先,而是开发者可以在同一个模型内调节 token 消耗与工具活动。运行时策略由此成为智能体能力的一部分,但它仍不是有硬性保证的算力预算。
Anthropic 于 6 月 30 日发布 Claude Sonnet 5,覆盖 Claude 各档计划、Claude Code 与 API。API 在 8 月 31 日前采用每百万输入 token 2 美元、输出 token 10 美元的推广价,之后调整为 3/15 美元;官方模型文档列出的上下文窗口为 100 万 token,同步最大输出为 12.8 万 token。13
真正有意思的并不是标价。Sonnet 5 提供 low、medium、high、xhigh、max 五档 effort。Anthropic 明确说明,这个设置会影响整次响应的全部 token,包括思考与工具调用;较低 effort 往往减少工具调用,较高 effort 则允许更多探索。它是一种行为信号,而不是严格的 token 预算。4
| 证据 | Sonnet 5 | Sonnet 4.6 | 解读时要记住 |
|---|---|---|---|
| BrowseComp,单智能体 | 84.7% | 76.2% | Sonnet 5 使用 max effort、1000 万 token 上限和上下文压缩 |
| OSWorld-Verified | 81.2% | 78.5% | 361 项任务、最多 100 步,五次运行的 pass@1 平均值 |
| SWE-bench Pro | 63.2% | 58.1% | 厂商自行运行;标准配置采用自适应思考与 max effort |
| 8 月 31 日后 API 标价 | 每百万 token 3/15 美元 | 每百万 token 3/15 美元 | 相同输入在 Sonnet 5 上的 token 数约为此前的 1.0–1.35 倍 |
这张表能够支持的结论,比“便宜模型打败昂贵模型”更克制。Anthropic 的系统卡写明,多数能力评测使用 30 万至 100 万 token,而 BrowseComp 的上限达到 1000 万 token,并启用上下文压缩。2 BrowseComp 本身由 1266 个刻意设计得难以检索的问题组成;论文作者也称它只是“不完整但有用”的指标,并承认该评测回避了真实用户问题中的歧义和长答案等难点。5 OSWorld 更接近实际操作,但 Anthropic 在重新评测旧模型前,也修复了缩放工具问题,并提高了单轮 token 上限。26
因此,更稳妥的洞察是运行时策略。选定模型检查点,并不能完全决定智能体如何行动:同一个模型会随 effort 不同而改变工具调用次数与响应 token 消耗。生产系统可以让常规任务从 low 或 medium effort 开始,再根据自身检查结果,只对确有收益的任务升级。
工程问题因此变得可以测量:不同任务在各档 effort 下,效果提升是否足以抵消额外的 token、工具调用与延迟?Anthropic 的文档还提醒,在依赖提示缓存的对话中途修改 effort,会使此前的缓存前缀失效。团队应在自己的评测集上测试各档 effort,并在依赖缓存经济性的对话中保持设置稳定。4