中国模型加速AI明星“内卷”,Anthropic上新Opus 5,性能逼近Fable 5价格打对折,刷新ARC-AGI-3纪录
AI模型的竞争,正在同时向两个方向加速:一边是价格不断下探,另一边则是模型能力继续冲击通用人工智能(AGI)的边界。
在中国新模型持续以低价和高性价比冲击市场、企业客户也开始重新审视AI支出的背景下,Anthropic率先将“降本增效”推向了高端模型市场。美东时间24日周五,Anthropic发布新一代Claude Opus模型Opus 5,称其在多个任务上的性能已经逼近公司最先进的Fable 5,但API价格只有后者的一半。
Anthropic预计,Opus 5将成为企业日常办公、软件开发、科学研究和AI智能体工作流中的默认模型,称它是Claude Max的默认模型,也是Claude Pro平台的最强模型。这意味着,Opus 5并不是一个单纯的便宜模型,而是试图将接近旗舰级的能力下沉到更广泛的企业日常任务。
另一亮点是,通过基准测试推动开源通用人工智能(AGI)研究的非营利组织ARC Prize披露,Opus 5在ARC-AGI-3基准测试中取得30.2%的超高成绩,远超GPT-5.6 Sol(Max)创造的该测试成绩前纪录7.8%。

ARC Prize还表示,在分析过程中观察到Opus 5展现出此前未曾出现的新颖行为,使其能够解决此前未曾被攻克的复杂环境,并且表现超过Fable。
以此来看,Opus 5在更接近AGI推理能力的测试中也出现了明显突破。测试成绩进一步凸显了Opus 5在底层推理和复杂环境解决能力上的进步。
媒体评论称,Anthropic的劲敌OpenAI、Meta等大举投入AI的硅谷公司也在加快推出更具成本效率的模型,而中国AI公司则通过低价和开放权重模型进一步加剧了这一竞争。
当中国模型以低价追赶、企业客户开始重新计算AI投入产出比,AI行业的下一场竞争可能不再是“谁能训练出最强模型”,而是:谁能以最低成本提供足够强的模型。
Anthropic此次对Opus 5的定位并非“绝对旗舰”,而是一个面向大规模使用的高性能通用模型。
公司称,Opus 5在软件工程、知识工作和复杂问题解决等多个测试中达到行业领先水平,同时以与上一代Opus 4.8相同的价格提供服务。

在软件工程方面,Anthropic称,Opus 5在Frontier-Bench测试中超过其他模型,表现较Opus 4.8翻倍以上;在CursorBench 3.2测试中,Opus 5最高努力等级下的成绩距离Fable 5峰值仅相差0.5%,但单任务成本只有后者的一半。
在知识工作和自动化任务方面,Opus 5同样表现突出。Anthropic称,在ARC-AGI 3测试中,其得分约为下一名模型的3倍;在Zapier AutomationBench中,以相同任务成本计算,其通过率约为下一名模型的1.5倍;在OSWorld 2.0电脑操作测试中,Opus 5以略高于Fable 5三分之一的成本,超过了Fable 5的最佳成绩。
Anthropic还强调,Opus 5在科学研究任务上的能力明显提升,尤其是在有机化学和蛋白质相关任务上。
从价格来看,Opus 5的API价格为每百万Token输入5美元、输出25美元,与Opus 4.8相同。而Anthropic当前旗舰模型Fable 5的定价为每百万Token输入10美元、输出50美元。
换言之,Anthropic正在尝试提供一种新的产品组合:接近旗舰级的能力,但价格只有旗舰模型的一半。
Opus 5的一个重要变化,是Anthropic开始强调模型的“计算效率”,而不仅仅是最终答案的质量。
公司称,新模型能够更好地检查自己的工作、发现逻辑错误并反复迭代。在部分测试中,Opus 5达到类似表现所需的推理Token数量明显低于上一代。
这意味着,模型能力提升的衡量标准正在发生变化。
过去,模型之间的竞争主要看谁能够在Benchmark上取得更高分;如今,对于企业客户而言,另一个问题同样重要:完成同一个任务,模型到底需要消耗多少Token?
在软件工程场景中,Opus 5重点提升了代码理解、代码修改和复杂任务执行能力。Anthropic称,模型在相关测试中的表现大幅超过上一代,并且在接近Fable 5能力的情况下显著降低了单项任务成本。
在知识工作和自动化领域,Opus 5则瞄准了企业日常流程。
从处理文档、分析信息,到调用工具、操作电脑和执行多步骤任务,模型的目标不再只是生成一段文本,而是完成一个完整的工作流程。
Anthropic称,在ARC-AGI 3、Zapier AutomationBench和OSWorld 2.0等测试中,Opus 5均表现出较强的任务执行能力。
在科学研究方面,Anthropic称,Opus 5在有机化学任务上的得分较Opus 4.8提高10.2个百分点,在预测蛋白质序列变化影响方面提高7.7个百分点。
这意味着,Anthropic正在将Opus 5从一个“更强的聊天模型”推向一个更广泛的专业工作工具。
随着模型能力提升,Opus 5的网络安全能力也成为此次发布的重要看点。
Anthropic称,Opus 5在发现软件漏洞方面的能力已经接近更高阶的Mythos 5,但在将漏洞转化为实际攻击工具方面仍明显落后。
公司同时强调,和上一代Opus 4.8一样,Opus 5并未针对网络安全任务进行专门训练。
Anthropic表示,模型在网络安全任务上的能力提升,主要源于其通用能力增强。
在安全限制方面,Anthropic称,Opus 5的安全分类器相比Fable 5“明显更宽松”,安全机制的干预次数将大幅减少,但仍会阻止二进制漏洞扫描、渗透测试和漏洞利用代码生成等高风险任务。
这一变化反映出AI模型能力提升带来的两面性。
一方面,模型需要具备足够强的能力,才能真正用于企业网络安全、科学研究和复杂工程任务;另一方面,模型越强,如何控制其在高风险领域的使用边界也越困难。
因此,Anthropic此次发布Opus 5,实际上不仅是在降低模型价格,也是在探索如何让更强大的模型以更少的安全限制进入真实工作场景。
Opus 5发布的背后,是企业客户对AI支出回报率越来越强烈的关注。
报道称,一些企业客户已经因为AI支出快速增加而收紧员工使用限制,并重新评估AI工具的投入产出比。
Anthropic负责研究产品管理的Dianne Penn表示,公司正在回应企业客户关于“如何创造更多价值”的反馈。
这说明,AI行业正在进入一个新的阶段。
在早期阶段,企业客户更关注一个模型是不是全球最强,而当AI开始进入企业日常工作流程后,企业开始关注:完成同一个任务,我为什么要多花一倍的钱?
这也使得模型的实际成本变得越来越重要。
一个模型即使在Benchmark上领先,如果完成同样任务需要消耗更多Token,最终的企业使用成本也可能更高。
反过来,一个性能略低但推理效率更高、价格更便宜的模型,可能更适合大规模部署。
于是,AI行业的竞争指标正在从单一的模型能力,变成:模型能力 × 推理效率 × 单位成本。
Opus 5正是Anthropic针对这一变化推出的产品。
如果说企业客户的成本压力推动了AI模型价格重新评估,那么中国AI模型的竞争则进一步加速了这一过程。
7月16日上周四,月之暗面正式发布2.8万亿参数的全球最大开源模型Kimi K3。已公布的测评结果显示,该模型的整体能力仅落后于Fable 5和OpenAI的GPT-5.6。
DeepSeek此前也已经通过低价策略和开放权重模式,推动全球AI模型价格持续下探。
中国模型的竞争意义不一定在于已经在所有前沿能力上超越美国顶级模型,而在于它们正在改变市场对AI模型价格的预期。
过去,企业可能接受“更强的模型就该更贵”这种说法,可是,随着越来越多高性能模型以更低价格提供服务,这种价格逻辑正在发生变化。
如果一个更便宜的模型已经能够完成企业80%甚至90%的日常任务,那么客户是否还愿意为剩余的性能差距支付两倍甚至数倍的价格,就成为现实问题。
这也是Anthropic、OpenAI、Meta等公司都在加快推进更具成本效率模型的原因之一。
从这个角度看,中国模型的竞争与企业自身的降本压力正在形成叠加效应。
一边是中国模型不断以低价追赶,另一边是美国企业客户开始要求AI投入产生更高回报。两股力量共同推动全球AI模型市场重新计算“性能究竟值多少钱”。
