Loading the catalog…
Loading the catalog…
Anthropic 发布 Claude 5.5 系列的第二个模型 Sonnet 5.5,价格与 Sonnet 5 持平、是 Opus 5.5 的一半,速度比 Sonnet 5 快 30% 以上。文中给出 Terminal-Bench 等多项基准与单任务成本。 今天凌晨,Anthropic 发布了 Claude 5.5 系列的第二个模型 Sonnet 5.5, 看 bench... 恐怖如斯 Terminal-Bench 4.0:各思考档位的成绩与单次成本 它的价格和 Sonnet 5 一样,每百万 token 输入 2 美元、输出 10 美元, 价格是 Opus 5.5 的一半 在速度方面,Sonnet 5.5 也是遥遥领先, 比 Sonnet 5 快 30% 以上 。由于完成同样的工作用的 token 更少,官方测试里单个任务的成本最多能再低 30% 按官方的定位,Opus 5.5 负责需要持续判断的复杂开放任务,Sonnet 5.5 更擅长边界清楚的日常任务、修 bug,以及做文档、幻灯片和表格,对设计也很有眼光 面向大批量、低成本场景的 Haiku 5.5 会在未来几周推出 Sonnet 5.5 完整 benchmark Sonnet 5.5 在很多工作中,几近追平 Opus 5.5,也还是第一个只看截图就通关《宝可梦 红》的 Sonnet 模型 编程 Terminal-Bench 4.0:各思考档位的成绩与单次成本 Terminal-Bench 测的是在命令行里完成多步骤专业任务。每个点对应一个思考档位(effort),档位越高,模型想得越久,单次成本越高,分数通常也越高;越靠左上,同样的钱换来的能力越多 Claude 应用里默认的 Medium 档位,Sonnet 5.5 已经远超 Sonnet 5 各档位的最好成绩,单次成本不到后者的十分之一。开到 Max 档位后,它的曲线在最右端越过了 Opus 5.5,得到 70.6%。GPT-6 Sol 在这项测试上没有公开成绩,图中用的是 GPT-5.6 Sol FrontierCode 1.1:代码改动能否直接合入 FrontierCode 看的是代码改动能不能不经人工修改直接合入,超出任务范围的改动即使写得好也会扣分。High 档位下,Sonnet 5.5 比同档位的 Sonnet 5 高 10 个百分点,单次成本约为十五分之一 FrontierCode 上还有个细节:Sonnet 5.5 在 Xhigh 档位得到 52.1%,开到 Max 反而降到 46.2%。原因是 Max 档位下它更常调用 Claude Code 的代码审查 Skill,把审查拆给一批子 Agent 去做。Cognition 检查的两个案例里,这导致了超时,或者改动超出了任务范围 CursorBench 4.0:来自真实 Cursor 编程会话的任务 CursorBench 的任务取自真实的 Cursor 编程会话。Sonnet 5.5 最好成绩 55.5%,和 Opus 5.5 的 57.8% 相差约两个百分点 早期测试者提到,Sonnet 5.5 读懂一个代码库的速度很快。在同题对照里,它比 Sonnet 5 更多地把工具调用合并成一批,步骤更少,成本也更低。客户的反馈里有不少具体数字: Epic Games :在系统设计审计和数据流审查中达到了更高一档模型的质量要求;处理了数万行游戏系统架构代码,能跑数小时的任务,响应依旧很快,提示词也不用写得那么细 Base44 :在 118 个真实应用构建中,产出质量与 Opus 5 持平;平均每个应用迭代 3.6 次,Opus 5 要 7.7 次。它的工具调用失败次数在所有对比模型中最少,也很少中途停下来问用户,构建不容易卡住 Unity :任务要在运行时检查、改动真的生效才算完成,Sonnet 5.5 的大部分工作通过了这项检查;在多步骤 Unity 编辑器与编程测试中完成了 90% 的任务 CodeRabbit :在不同复杂度的代码审查里判断都好于 Sonnet 5,输出 token 明显更少,Sonnet 5 爱频繁联网搜索、token 用量高的毛病都没有了。简单和中等难度的审查会先切换过去 Lovable :思考步骤更少也更稳,编程测试里工具调用少了三分之一,shell 运行次数约减半 SpaceXAI :CursorBench 4.0 拿到 55.5%,仅次于 Opus 5.5 Every :写代码快,迭代时能很快调整方向,需要的时候也能长时间工作;它继承了 Opus 5.5 写作更自然的一部分改进,用起来更有意思 Creator :由 Opus 5.5 定好游戏的架构和整体框架后,可以放心交给 Sonnet 5.5 去实现 知识工作 AA-Briefcase v1.1:知识工作质量与单任务成本 GDPval-AA 用 44 种职业、9 大行业的真实任务测试模型。Sonnet 5.5 与 Opus 5.5 几乎持平,比 Sonnet 5 高约 400 分;AA-Briefcase 也是类似的格局。电脑操作和图表识别接近 Opus 5.5,在长周期的知识工作上明显强于 Sonnet 5 和 GPT-6 Sol 测试者还提到一些不太好量化的变化:聊起来更自然,也更懂设计,会给用户界面多做一层打磨,能按幻灯片模板做出几乎不用改的演示文稿。Anthropic 做过一次内部测试:给它一家上市公司的季度财报材料、电话会记录和一份幻灯片模板,让它做一份 10 页的经营回顾。两位专家评审后认为,初稿可以直接发出去 企业客户的结果: Slack :不改任何提示词,离线 Slackbot 评测几乎全部好于 Sonnet 5,步骤更少,输出 token 少约 14% Zendesk :用数百个真实客服场景测试回复和升级处理,错误决策比目前生产环境里的 Claude 模型更少,工单处理快了 20% Balyasny Asset Management :在 2441 个金融任务上(问答、信息抽取、分析、预测)成绩高于 Sonnet 5,每个回答约用 12.1 万 token,Sonnet 5 要 49.7 万;在参与对比的 7 个模型里,大批量工作流的质量成本比最好 Box :会回到源文档复核数据,找出了 Sonnet 5 漏掉的错误;准确率更高,速度快 2.4 倍,总 token 少 12% Atlassian :Rovo Agent 每月为客户执行数百万次操作,换成 Sonnet 5.5 后运行速度最多比 Sonnet 5 快 30% 价格与速度 三款模型的 API 定价 Sonnet 5.5 每百万 token 输入 2 美元、输出 10 美元,缓存写入 2.5 美元,都是 Opus 5.5 的一半;缓存读取两者相同,都是 0.2 美元。定价和 Sonnet 5 一样,但完成同样的工作用的 token 更少,所以实际花得更少 在多项测试中,Sonnet 5.5 用 Low 或 Medium 档位,就能超过 Sonnet 5 的最好成绩,单任务成本约为十分之一 官方的说法是,Sonnet 5.5 在较低档位时与 Opus 5.5 配合得最好,这时它单任务成本更低;开到较高档位,它能以相近的成本拿到相近的成绩 为了展示速度,官方让 Sonnet 5 和 Sonnet 5.5 用同一句提示词各写一个单文件网页。第一个是“用一个 HTML 文件做 400 只椋鸟的群飞”: 椋鸟的群飞 Sonnet 5.5 输出 4158 个 token 就写完了,鸟群已经飞了一阵,Sonnet 5 还在写代码,最后用了 4649 个 token 第二个是“风吹沙丘”,Sonnet 5.5 用了 2720 个 token,Sonnet 5 用了 3088 个: 风吹沙丘 思考档位可以在成本、速度和质量之间调节。Claude Code 和 Claude 应用默认是 Medium,Claude Platform 默认是 High。档位低,回答更快、token 更少,适合日常工作;档位高,Claude 会想得更久,检查也更仔细 安全方面,这是第一个配备网络安全防护的 Sonnet,日常开发里的找 bug、修 bug 不受影响,高风险的网络安全任务会转回 Sonnet 5 处理 上线 Sonnet 5.5 已经在所有平台上线,包括 AWS、Google Cloud 和 Microsoft Azure,API 模型名是 claude-sonnet-5-5,和 Opus 5.5、Sonnet 5 一样支持零数据留存 如果你之前关闭思考来用 Sonnet,迁移前需要换成新的 between_tools 设置,它会继续关闭前置思考 本文由人人都是产品经理作者【赛博禅心】,微信公众号:【赛博禅心】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载 题图来自Unsplash,基于CC0协议
What RADAR observed and classified to build this opportunity. It is what the source published, not a verification that the offer is still active.
Claude Sonnet 5.5 发布:比肩 Opus 5.5. Anthropic 发布 Claude 5.5 系列的第二个模型 Sonnet 5.5,价格与 Sonnet 5 持平、是 Opus 5.5 的一半,速度比 Sonnet 5 快 30% 以上。文中给出 Terminal-Bench 等多项基准与单任务成本。 今天凌晨,Anthropic 发布了 Claude 5.5 系列的第二个模型 Sonnet 5.5, 看 bench... 恐怖如斯 Terminal-Bench 4.0:各思考档位的成绩与单次成本 它的价格和 Sonnet 5 一样,每百万 token 输入 2 美元、输出 10 美元, 价格是 Opus 5.5 的一半 在速度方面,Sonnet 5.5 也是遥遥领先, 比 Sonnet 5 快 30% 以上 。由于完成同样的工作用的 token…
Open source