arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

价格仅Opus一半,编码反超旗舰!Anthropic发布Claude Sonnet 5.5:提速30%,单任务省钱30%

作者:arXivDaily编辑部 Anthropic 官方公告

导读

当地时间2026年9月28日,Anthropic发布Claude Sonnet 5.5,即日起上线Claude应用、Claude Code、API及主流云平台。新模型主打日常编码与文档表格制作,输出提速30%以上,单任务开销较上代最多降30%。

终端编码反超Opus 5.5,仅靠截图通关宝可梦

Sonnet 5.5在多项基准上较Sonnet 5大幅跃升,最高推理强度(Max)下逼近旗舰Opus 5.5。其中Terminal-Bench 4.0终端编码从上代10.3%暴涨至70.6%,反超Opus 5.5最高分(66.4%);GDPval-AA真实职业任务得1844分,仅比Opus 5.5低2分;并成为首款仅凭屏幕截图通关《宝可梦:红》的Sonnet模型。

Anthropic同时说明,FrontierCode评测中Sonnet 5.5在Xhigh档位(52.1%)高于Max档位(46.2%),因Max档位更频繁调用多子智能体代码审查导致超范围修改或超时;在需持续判断的复杂开放式任务上,Opus 5.5仍明显更强。

Anthropic官方基准对比表,涵盖智能体编码、知识办公、多学科推理、电脑操作与图表识别。

Token单价为Opus一半,低档位1/10成本破纪录

Sonnet 5.5延续了上代单价:输入2美元/百万Token、输出10美元/百万Token、缓存写入2.50美元/百万Token(均为Opus 5.5对应价格的一半),缓存读取同为0.20美元/百万Token。因合并工具调用、减少输出Token,在Terminal-Bench 4.0、CursorBench 4.0及AA-Briefcase v1.1上,其Low或Medium档位仅花约九分之一至十分之一的单任务成本即超越Sonnet 5最佳成绩。目前Claude应用与Claude Code默认Medium档位,Claude Platform默认High档位。

Anthropic官方AA-Briefcase v1.1各模型在不同推理强度(Effort)下的Elo得分与单任务成本曲线。

企业实测与升级要求

Box跨文档评测显示,Sonnet 5.5整体准确率从61%升至65%(金融尽调达81%,查出账簿计息与期权定价错误),交付提速至2.4倍且总Token减少12%。对冲基金Balyasny测得单次金融回答仅耗约12.1万Token(上代为49.7万);测评人Matthew Berman与开发者Goofy分别展示了单条提示词生成的3D物理模拟、乐高搭建器及2342行单文件Game Boy风格游戏。

Box AI在金融、法律、生命科学及公共部门跨文档任务上的准确率对比。

开发者现可通过API标识`claude-sonnet-5-5`或AWS、Google Cloud、Azure调用,支持零数据保留。新模型首次在Sonnet系列配备与Opus同级的网络安全防护(高风险请求自动回退至Sonnet 5)、防蒸馏分类器与账户绑定思考(Preserved Thinking);原关闭思考模式(thinking off)的API用户迁移前需切换为`between_tools`设置。高吞吐轻量模型Claude Haiku 5.5将于数周内推出。

参考资料

https://www.anthropic.com/claude-sonnet-5-5

https://blog.box.com/claude-sonnet-55-real-enterprise-knowledge-work

https://techcrunch.com/2026/09/28/anthropic-releases-sonnet-5-5-which-it-calls-a-significantly-cheaper-faster-work-partner/

https://x.com/claudeai/status/2104633115620823187

https://x.com/claudeai/status/2104633119412523294?s=20

https://x.com/MatthewBerman/status/2104634635234005025

https://x.com/goofyninjaaa/status/2104657861334950098

↑