
Anthropic联创兼CEO达里奥·阿莫迪。图片经由AI处理
9月22日,Anthropic发布Claude 5.5系列的首个模型Opus 5.5。
三周前,它刚推出旗舰模型Fable 5.1;如今,Anthropic称,Opus 5.5在大多数工作任务中已达到Fable 5.1的水平。与上一代Opus 5相比,新模型输出速度提高超过30%,输入、输出Token单价下降20%;在默认设置的典型任务中,完成工作的成本降低约40%。性能比较的对象是Fable 5.1,成本降幅比较的对象则是Opus 5。
Fable刚以顶级模型的定位登场不久,接近它的能力就被放进了更便宜的Opus。又是一个用更便宜更快的新模型,“卷”自家上代旗舰模型的例子?

更值得注意的是发布时机。就在上周,Anthropic CEO达里奥·阿莫迪(Dario Amodei)刚刚发表文章,呼吁AI前沿发展“放缓节奏” ,主张安全实践应当领先于模型能力。Opus 5.5是这一表态后Anthropic发布的首个模型,官方称发布前经过了Frontier Design和METR等外部机构的评估测试。
性能、成本、安全,是Opus 5.5想讲的“新故事”。
01、编程和知识工作双领先,性价比才是核心卖点
Opus 5.5在智能体编程、计算机使用和知识工作三个核心方向上都处于当前模型的第一梯队。

官方基准测试显示,它在Terminal-Bench 4.0、FrontierCode、CursorBench等编程测试中领先,在GDPval-AA v2.1知识工作测试中得分1846 Elo,也超过了Fable 5.1和GPT-6 Astra。独立评估平台Artificial Analysis的智能指数中,Opus 5.5以58分位居榜首,十项评估中领先六项。

不过Anthropic自己也承认,在当前能力水平下,基准测试的差距已经越来越不能可靠地反映真实世界中的差异。这意味着模型竞争正在进入一个新阶段——单纯跑分的边际收益在递减,用户真正关心的是实际工作中的表现、成本和可靠性。
Anthropic公布了一个早期测试案例:一名测试者用Opus 5.5在不到一天的时间里完成了68万行代码的迁移,而同样的工作原本需要一个工程团队花几周时间。
另一个测试中,Opus 5.5在不到三小时内审计并修复了一个20万行的代码库。相比之下,Opus 5完成同样任务用了20多个小时,消耗的token量也是Opus 5.5的2.5倍。
不过,CodeRabbit将 Opus 5.5 接入代码审查流程后,在一组包含80种已知问题的测试中发现51种,现有生产模型组合发现49种。两者发现的问题并不完全重合:Opus 5.5找出了现有组合漏掉的11种,其中包括 Cal.com 中多个任务可能互相覆盖重试计数的并发问题;同时,它也漏掉了现有组合能够发现的9种。

在内部测试中,Anthropic让Opus 5.5和Fable 5.1将广泛使用的负载均衡软件HAProxy从C语言重写为Rust。两个模型都通过了几乎所有HAProxy自身的回归测试,但Opus 5.5只用了9.5小时,Fable 5.1用了12小时,前者成本低51%。
性价比是这次发布的核心卖点。在多个编程基准中,Opus 5.5都以更低的成本达到或超过竞争模型的表现。在FrontierCode上,Opus 5.5默认努力级别就能击败GPT-6 Astra,成本大约只有后者的五分之一。在Terminal-Bench 4.0上,它与GPT-6 Astra性能相当,成本约为后者的40%。
科技媒体THE D
GitHub首席产品官马里奥·罗德里格斯(Mario Rodriguez)在测试后表示,在GitHub Copilot CLI和VS Code的测试中,Claude Opus 5.5使用的token和步骤是测过的模型中最少的,在VS Code里用不到一半的步骤解决了比Opus 5更多的终端任务。
但是,第三方实测有一些不一样的结论,Opus 5.5的性能和成本优势仍取决于任务与推理设置。Sonar在Java测试中发现,它的代码通过率与Opus 5接近,生成的代码更少、严重问题也更少,但每行代码的Bug数提升了约12%。
Artificial Analysis发现,在最高推理档位下,Opus 5.5每项任务生成的输出Token约为Opus 5的1.6倍,单任务成本与Opus 5大致持平。降价能否变成用户账单上的节省,还需要看实际使用场景。
知识工作同样有明显提升。在GDPval-AA v2.1测试中,Opus 5.5拿到1846 Elo分,领先Fable 5.1和Opus 5,也明显高于GPT-6 Astra。这项测试覆盖44种职业的真实工作场景。

Anthropic做过一个内部测试:让模型撰写公司季度业绩报告,信息来源是一份网页副本,财报发布在很难找到的位置,自动评分器逐字逐句核对每个数字和引述的来源。结果是,Opus 5.5的18份报告中有16份通过了质量门槛,Fable 5.1和Opus 5在任何一次尝试中都没能通过。
Opus 5.5还配备了行动前分类筛查、开源沙箱和代码审查漏洞拦截三层防护。在提示注入攻击测试中,它在编程、工具使用、计算机使用和网页浏览等所有场景下都持平或优于Opus 5。AI安全公司Gray Swan的基准测试显示,Opus 5.5与Fable 5.1并列提示注入成功率最低的模型。
不过,在自动化工作流(AutomationBench)和智能体科研(Terminal-Bench-Science 0.1)方面,Opus 5.5的表现都不及GPT-6 Astra。
02、告别“Claude体”
在所有改进中,沟通方式的变化可能是用户感知最直接的一项。
长期以来,Claude的写作风格一直被用户诟病——冗长、啰嗦、公式化,有时甚至显得过分讨好,被网友戏称为“Claude体”(Claudish)。Opus 5.5针对性地解决了这个问题。官方称,新模型会把最重要的信息放在前面,更少使用术语和特有表达方式,更能遵循用户给出的写作规则。
官方提供的对比样例很能说明问题。同样是解释一个计费系统的bug,Opus 5的回答开头是“What I found”,然后大段贴出代码和详细解释,读者需要自己从大量信息中提取关键点。Opus 5.5的回答开头直接给出结论:“额外下降是计费重构中的一个bug”,然后才展开技术细节。先给答案,再讲过程。

Box的AI产品副总裁亚肖达·巴夫纳尼(Yashodha Bhavnani)说:“在我们的评估中,Claude Opus 5.5使用的token是Opus 5的三分之一,答案简洁了40%但没有损失准确性。”

ZDNET评论称,Opus 5有时候简直像个马屁精,尤其是在它做错事的时候。如果新版本哪怕只是少一点谄媚,都值得欢迎。写作风格的改进看起来是个小问题,但对于每天和模型打交道的用户来说,这直接影响使用体验和工作效率。
Anthropic认为,沟通质量的提升不只是体验问题,也是安全问题。当模型的输出更容易理解和检查时,人类审查的效率更高,错误也更容易被发现。从这个角度看,清晰的写作本身就是一种安全增强。
03、首个带Fable级防护的Opus模型
Anthropic称,Opus 5.5是第一个配备与Fable 5.1同级别防护措施的Opus模型。这直接呼应了阿莫迪上周提出的“节奏论”——AI进步应该有节奏地推进,让安全实践始终领先于模型能力。
在自动化行为审计,也就是Anthropic最全面的对齐测试,涵盖近2000个模拟场景中,Opus 5.5在几乎所有错位行为指标上都优于近期的Claude模型,是迄今测试中表现最强的模型。它采取难以逆转行动或越界的可能性远低于近期模型,对提示注入的抵抗力也强于Opus 5。
特别值得注意的是,在一项测试模型突破边界倾向的新评估中,Opus 5.5试图绕过边界的频率比Opus 5或Claude Mythos 5.1低约85%,而且每次尝试都是低严重级别并会自我报告。对于在代码库和系统中无人值守运行Claude的团队来说,这一点和原始能力同等重要。
但Anthropic也坦承,构建能在部署前可靠发现每一种失败的评估方法,仍然是一个未解决的问题。有迹象表明,Opus 5.5经常能察觉到自己正在被评估,这给评估它在真实场景中的行为带来了挑战。随着部署场景的扩大和模型能力的增长,这个挑战会越来越大,除非在可解释性方面取得进展。
具体的防护措施涉及三个高风险领域:
网络安全方面,由于Opus 5.5具备极强的网络能力,Anthropic对其应用了与Fable 5.1类似的网络安全防护。用户可以在日常软件开发中查找和修复bug,但大多数网络安全任务会被重新路由到Opus 4.8。网络验证计划将在未来几周扩展到Opus 5.5,新增三个级别的可信访问权限。
生物学方面,Opus 5.5在生物学领域的能力超过Opus 5,在很多工作上匹配或超过Claude Mythos 5.1。因此它使用了与Fable 5.1相同的生物学防护。经过审核的机构可以申请生命科学验证计划,获得面向生物学研究的防护配置。
蒸馏防护方面,Opus 5.5配备了“保留思考”(Preserved Thinking)机制,防止API用户编辑Claude的历史上下文来提取其推理过程。这项措施针对的是所谓的“蒸馏攻击”——攻击者使用数千个假账号,以工业规模提取模型能力,制造没有安全防护的高能力模型。Anthropic在2026年9月的威胁情报报告中记录了已检测和阻断的非法蒸馏活动。
此外,Opus 5.5还配备了水印措施以符合欧盟AI法案要求,并且不再提供关闭“思考”模式的选项。模型支持零数据保留选项。
04、订阅用户额度涨两成,后续还有Sonnet和Haiku
价格方面,Opus 5.5比Opus 5全面下调。输入token每百万4美元,输出token每百万20美元,分别比Opus 5低20%。缓存读取每百万0.20美元,降幅达60%。缓存写入每百万5美元,比Opus 5的6.25美元低20%。

加上模型本身用token更省,综合下来,典型工作负载的成本比Opus 5低约40%。输出速度也快了30%以上。
Opus 5.5还提供快速模式,速度最高可达2.5倍,价格为每百万输入token 8美元、每百万输出token 40美元。
Anthropic提高了Pro、Max、Team及按席位计费的企业版五小时使用限额,并提供一次可留待需要时使用的限额重置。官方称,Opus 5.5较低的使用成本,也让原有额度比使用Opus 5时约能多支撑25%的工作量。具体能多完成多少任务,仍取决于所选推理档位和Token消耗。
目前,Claude Opus 5.5已在所有平台上线,包括亚马逊云服务AWS、谷歌云和微软Azure。在Claude平台上,开发者可以使用模型ID claude-opus-5-5开始调用。
Anthropic还透露,Claude Sonnet 5.5和Claude Haiku 5.5将在未来几周内推出,带来类似的性能、效率和安全改进。

