标签:# 算力成本

单任务狂吞 19 万 Token 的代价:从 Artificial Analysis 实测看 Claude Sonnet 5.5 的推理膨胀与 Agentic 成本陷阱

在 Anthropic 刚刚推送的 Claude 5.5 系列模型迭代中,Claude Sonnet 5.5 无疑成为了全行业瞩目的焦点。在官方给出的纸面规格与定价清单中,Sonnet 5.5 的输入与输出价格分别为每百万 Token 2 美元与 10 美元,不仅与 GPT-6 Sol 完全持平,更仅为老大哥 Opus 5.5 的一半;与此同时,官方宣称其推理速度提升了 30%,端到端运行成本降低 30%。更令开发者社群震动的是,在 Terminal-Bench 等权威 Agentic Coding(智能体编程)基准测试中,Sonnet 5.5 的综合得分甚至比 Opus 5.5 还要高出整整 4 分,“中杯越级斩杀超大杯”的讨论瞬间席卷了技术圈。

然而,当独立权威评测机构 Artificial Analysis 披露了其 Intelligence Index 的全维度测试数据后,隐藏在“便宜高分”背后的残酷真相终于浮出水面:Sonnet 5.5 之所以在高难度任务中实现逆袭,在很大程度上依赖了极其激进的 Test-Time Compute(测试期计算扩展)。在最高努力档位(max effort)下,Sonnet 5.5 单个任务平均狂吞高达 19.3 万 Token,其中内部思维链推理(Reasoning)占据了惊人的 14.2 万 Token!如果盲目开启 max 档位,表面上每 Token 便宜一半的 Sonnet 5.5,其实际单任务账单不仅追平了 Opus 5.5,更在相同智能水平的帕累托效率上严重倒挂。