导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

Anthropic发布Claude Fable 5.1和Mythos 5.1,编程与科学基准测试翻倍超越前代

Anthropic于周二发布了Claude Fable 5.1与Claude Mythos 5.1,标志着自Fable 5于6月9日发布以来,Anthropic首次对Mythos级模型产品线进行更新。该公司称,新模型是“面向代码和知识工作的全球最先进AI模型”。此次发布正值一段颇多波折的发布周期:此前经历了一次为期18天的出口管制停摆、一场围绕订阅价格的中期价格战,以及7月发布的Claude Opus 5以更低价格削弱了Fable 5的竞争力。

Anthropic Claude Fable 5.1

据Anthropic介绍,Fable 5.1和Mythos 5.1实为同一基础模型,仅应用了不同的安全过滤机制。其中Fable 5.1面向所有Claude账户用户开放;Mythos 5.1继续面向通过网络安全与生命科学验证计划审查的专业人士提供,这是此前限制Mythos 5访问的Project Glasswing准入通道的后续计划。

基准测试到底测了什么

Anthropic主推的数据来自Terminal-Bench-Science 0.1。该基准测试用于衡量AI代理在命令行环境中完成科学研究任务的能力,以通过率计分。Fable 5.1的得分为52.6%,远超Fable 5的24.7%和Opus 5的29.0%,较前代实现翻倍以上提升。Terminal-Bench 4.0测试AI代理在终端环境下完成智能体编码任务的能力,包括在多步骤命令行会话中编写、运行和调试代码,按正确完成任务的百分比计分。Fable 5.1在该项上得分55.8%,高于Fable 5的42.0%和Opus 5的52.3%。Mythos 5.1在更宽松的网络安全过滤条件下同项测试得分60.9%;Anthropic表示,这一得分差距反映安全机制拦截了部分任务并将其转交给Opus 4.8处理。

Anthropic benchmark chart

在名为Humanity's Last Exam(人类最后考试)的多学科推理测试中,该测试汇集了数十个学术领域的专家级问题,以通过率计分,Fable 5.1在不使用外部工具时得分60.9%,借助工具时可达65.0%,均领先于Opus 5。Anthropic称,这意味着Fable 5.1是其面向学术用途最先进的模型。

对Opus 5的优势与更模糊的性价比

Opus 5于7月发布时,每token价格仅为Fable 5的一半,却在多数主流基准测试上超过Fable 5,令旗舰款对许多付费用户而言变得不再必要。Fable 5.1扭转了这一局面:在Anthropic公布的所有基准测试上均超越Opus 5,包括此前Opus 5领先Fable 5的项目。然而,Fable 5.1的价格仍是Opus 5的两倍——输入10美元、输出50美元,对应Opus 5的5美元和25美元。Token是模型所能处理的基本信息单位,大约相当于平均一个英文单词的三分之二。由于重度工作流会很快耗完订阅计划中的配额,用户往往需要按用量付费。

Anthropic对模型的宣传更看重“推理努力水平”而非原始得分。该公司表示,在低或中等推理努力下运行Fable 5.1,其表现能匹配或超过Fable 5此前的成绩,同时成本更低;而最高推理努力档位专用于那些其他模型无法解决的难题。对日常任务来说,用户把努力水平调得越低,就越是难以找到完全绕过Opus 5的理由。

访问方式与配额安排

访问权限延续了Fable 5经过数月调整后的方案。在Pro计划以及标准Team或Enterprise席位中,Fable 5.1将完全使用按API费率计费的即用即付额度,因为该模型并不被包含在这些计划的每周用量限额中。在Max计划以及高级Team或Enterprise席位中,Fable 5.1可作为订阅的标准组成部分,用于每周用量中最多50%的用量。

Claude Fable 5.1现已可通过Claude API、Amazon Bedrock、Google Cloud和Microsoft Foundry获取,模型ID为“claude-fable-5-1”。