WayToClawEarn
中等影响independent-research

Claude Sonnet 5 默认上线 Claude Code:85.2% SWE-bench 但有隐藏成本

6月30日,Anthropic 发布 Claude Sonnet 5,立即成为 Claude Code 默认模型。SWE-bench 85.2%,接近 Opus 4.8,$2/$10 入门定价。但新分词器可能导致长 Agent 会话成本不降反升,开发者需实测验证。

WayToClawEarn Editorial发布 2026年7月1日更新 2026年8月8日

编辑基于公开来源复核 · AI 辅助整理。 内容方法 · 原始来源

核心结论

6月30日,Anthropic 发布了 Claude Sonnet 5,立即成为 Claude Code 和 claude.ai 的默认模型。SWE-bench Verified 得分 85.2%,接近 Opus 4.8 水平,入门价格 $2/$10 每百万 token。但新分词器可能导致长时间 Agent 编码会话的实际成本不降反升。

发生了什么

Anthropic 在 6 月 30 日发布了 Sonnet 5,这是有史以来 Agent 编码能力最强的 Sonnet 模型。它立即成为所有 Free 和 Pro 用户的默认模型,覆盖 claude.ai、Claude Code、API、AWS Bedrock 和 Google Cloud Vertex AI。

核心性能数据:

  • SWE-bench Verified:85.2%(大幅领先 Sonnet 4.6)
  • SWE-bench Pro:63.2%(Opus 4.8 为 69.2%)
  • OSWorld(计算机操作):81.2%
  • Terminal-Bench:80.4%
  • BrowseComp:84.7%(非 Opus 模型中最高)
  • 知识工作(GDPval-AA v2):1618 分,微弱领先 Opus 4.8 的 1615 分
  • Cursor 生产基准:Sonnet 5 Max 61.2% vs Opus 4.8 Max 63.8%

一句话总结:Sonnet 5 以 Sonnet 级定价提供了 Opus 4.8 约 90-95% 的 Agent 编码能力。BenchLM 排行榜上甚至以 94 分领先 Opus 4.8 的 92 分。

模型共享 Opus 4.8 的 100 万 token 上下文窗口和 12.8 万输出上限,训练数据截止 2026 年 1 月。

你可能不知道的陷阱:新分词器

厂商宣传的「比 Opus 便宜 60%」并非全貌。Sonnet 5 引入了新分词器,token 计数方式与 Sonnet 4.6 不同。再加上自适应思考机制(模型在难题上消耗更多计算资源),长时间的 Agent 编码会话可能产生与 Opus 4.8 相同甚至更高的实际成本。

$2/$10 的促销定价(截至 8 月 31 日)对代码审查、单文件生成等有限输出的任务最为有利。但对于 Claude Code 中反复调试的开放式 Agent 会话,节省幅度会缩小甚至消失。

建议开发者针对自己的工作流做基准测试,而不是假设成本会降低 60%。

对 AI 编码开发者的影响

1. Sonnet 系列重夺 Agent 编码王座。 Sonnet 3.5 开创了实用 AI 编码 Agent 的先河,但最近的进展集中在 Opus 级模型。Sonnet 5 将这种能力带回中端模型——正是大多数开发者日常使用的层级。

2. Claude Code 已静默升级。 7 月 1 日打开 Claude Code,你已经开始使用 Sonnet 5。无需迁移,默认高努力模式运行。但对于偏好 Sonnet 4.6 行为的特定任务,也无明确回退机制。

3. 免费用户获得接近 Opus 的编码体验。 Sonnet 5 作为 Free 套餐默认模型,意味着任何人都能获得接近 Opus 水平的编码质量。这全面提升了 AI 辅助开发的体验下限。

行动建议

  • Claude Code 用户:本周跑几个有代表性的编码会话,对比 token 消耗。如果工作流偏重输出,监控新分词器是否推高了实际成本。
  • Pro/Max 用户:Sonnet 5 是你的新默认模型。Opus 4.8 在复杂多步推理上仍有优势——用于架构设计和复杂系统调试。
  • 免费用户:这是自 Sonnet 3.5 以来最大的免费套餐升级。100 万 token 上下文窗口本身就能改变大型代码库的工作方式。
  • 正在评估模型的团队:8 月 31 日前的促销窗口是测试的好时机。建议按标准定价做预算规划。

更广的视角

Sonnet 5 发布的同一周,Anthropic 还解除了 Fable 5 的出口管制(7 月 1 日全球可用),并发布了面向生命科学的 Claude Science。公司在消费级模型、前沿研究模型和垂直领域工具三条线同时推进。对开发者而言,结论很简单:Claude Code 中使用的模型变得更好了,目前没有额外成本——但别假设你的账单会保持不变。

claudesonnetanthropicclaude-codecodingagentmodel-release

查看原文 →

免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。