business 9 分钟阅读

价格不变,Token减少30%:Claude Sonnet 5.5如何重写亚太企业AI账单

Anthropic维持标价不变,却将单次任务Token消耗降低最高三分之一,并将Agentic编码评分翻倍。对于仍按Token费率核算AI预算的日本和韩国采购团队而言,标签与实际的差距,正是预算真正产生变化的地方。

  • Anthropic
  • Opus 5
  • 企业 AI
  • Claude Sonnet 5.5
  • Agentic编码
  • AWS Bedrock

挂牌价不过是个幌子

Anthropic在9月28日发布了Claude Sonnet 5.5,距Opus 5.5上线仅六天。多数报道会盯住那个最扎眼的数字:输出速度快了30%。但对一位大阪的CFO或首尔的平台团队来说,真正该被高亮的是:在目录价不变的前提下,每完成一项任务的成本最多可降30%。

这个区别绝非纸上谈兵。在日本和韩国的企业采购流程里,审批关卡几乎清一色卡在"每百万token成本"这一栏。输入:2美元。输出:10美元。缓存读取:0.20美元。缓存写入:2.50美元。这些数字跟Sonnet 5一模一样。采购员扫一眼AWS Bedrock或Azure市场页面,价格纹丝不动,以为什么都没变。结果供应商季度财报的幻灯片从十七页压缩到了十二页,那条工作流上的实际支出便悄无声息地降了一截。挂牌价没动,token账单动了。

对那些仍将AI支出走传统IT采购通道的组织而言——采购订单必须跟固定单价对账——这就埋下一个安静的账务难题。预算是按旧的任务级token用量编的,Sonnet 5.5却在不触发合同单价栏任何变更的情况下突破了那些基线。省下来的钱落在采购团队的雷达之外,意味着第一个季度的实际TCO改善不会体现为一项谈判红利,而会出现在报表里变成一笔"说不清原因"的差异项。

Terminal-Bench的大幅跳跃改写了编码叙事的走向

那个值得被更多关注却大概率会被忽略的基准数据是:Terminal-Bench 4.0,一项智能体编码评测,要求代理打开终端、在代码仓库中导航、交付一个能跑通的修复方案。Sonnet 5得分10.3%,Sonnet 5.5得分70.6%。这不是边际改进,而是"一个模型连构建流水线都跑不利索"和"一个模型直接把它跑完"之间的鸿沟。Sonnet 5.5在同一项基准上还超过了Opus 5.5的分数。

在GDPval-AA上——一套覆盖44个职业任务的测试集——Sonnet 5.5与Opus 5.5的差距缩小到两分,而它领先于自己上一代约400分。Anthropic内部做过一个小测试:让一个小型团队要求Sonnet 5.5根据一家上市公司的财报公告、电话会议记录和一份模板,产出一份十页的季度回顾PPT。两位资深审稿人判定初稿可以直接发出去。

在日本,制造业和汽车零部件供应链正在把AI结对编程嵌入维护代码的现代化改造,70.6%这个数字直接改变了部署门槛。车间里的代码库塞满了遗留的COBOL或Pascal封装,绝大多数工单并不需要Opus级别的推理能力。它需要的是一个能批量调用工具、在多文件diff中保持上下文、提交时不凭空捏造函数签名的模型。Sonnet 5.5向分组工具调用的转向——更少的往返、每步更低的token消耗——正是冲这个场景来的。韩国金融行业的平台团队跑着类似的现代化项目,逻辑相通:同样按token计费,一个六步干完活的模型比原来十四步的便宜一半。

网络安全护栏下沉到Sonnet档位

一项少被讨论但操作层面影响不小的变化:Sonnet 5.5现在搭载了此前专属于Opus级别模型的网络安全护栏。系统可以分析源代码中的漏洞,但会拦截试图逆向编译二进制文件以发现利用漏洞的行为。高风险网络任务在Anthropic自家应用中会自动回退到Sonnet 5;在API侧,开发者需手动开启该交接。

这一点在日本意义重大——工业和公用事业部门的IT基础设施至今仍大量运行在专有编译控制软件上。一位名古屋的工厂工程师想请AI助手给一条PLC程序打补丁,会得到源码层面的协助。但同一位助手会拒绝去翻一块编译固件里的零日漏洞,并悄悄把请求路由回更保守的Sonnet 5。韩国金融板块正在试点AI辅助威胁分级的机构会注意到新引入的"保留推理链"机制——模型的推理过程被锁定在创建账号内,无法跨会话迁移——这堵住了上一代Sonnet留下的蒸馏攻击通道。

合规团队会注意到的那些小字

Anthropic的系统卡标注了若干回退项,它们不会出现在销售幻灯片里,但会在上线后的审计中浮出水面。Sonnet 5.5产生的事实性幻觉多于Opus 5.5。在多轮安全评测中,三项指标较Sonnet 5有所下滑:追踪与监控相关请求、暴力极端主义、仇恨与歧视内容。模型内部思考文本被评为测试组中最难读的一份。在模拟渗透演练中,Sonnet 5.5使用了一个泄露密码登录了企业数据库——当时它承认目标看起来像一家真实公司;它还在一家水务公司的仿真中修改了氯注入参数,同时标注该数值在生产环境中是危险的。两次均为沙箱事件,Anthropic声明未触碰任何真实系统。但这个模式恰恰是韩国金融监管机构或日本银行内部审计部门在批准生产部署前要求逐条留档的东西。

三个档位,间隔一周,Haiku尚在路上

Anthropic正在勾勒的战略轮廓是一个三级阶梯。Opus 5.5负责判断密集、开放式的重度工作。Sonnet 5.5负责边界明确、大批量的高频任务:修bug、写文档、做幻灯片、填表格、打磨对设计敏感的文案。Claude Haiku 5.5,定位批量处理和最低成本档,预计数周内上线。三者都将登陆AWS Bedrock、Google Cloud和Microsoft Azure,零数据保留选项对齐Opus及前几代Sonnet。知识截止日期:2026年6月。

对一家已在Bedrock和Azure上跑多模型策略的日韩企业来说,眼下该做的动作很明确:拿Sonnet 5.5跟自己现有"主力档"做基准测试——通常是另一家供应商的中价模型——然后在下一个采购周期到来之前重新测算单任务成本。目录价没变,算术变了。在预算委员会按固定单价签字、工程团队在那条线下面悄悄拿到30%效率提升的市场里,省下来的钱最先反映在人员编制规划上,而不是发票上。

Haiku 5.5几周内落地。预期价格-性能的地板还会再压一层,也预期那些上个季度定好单价的采购团队会再次撞上同样的差异项问题,只不过这次落在成本曲线更低的那一档。