Fable 5.1震撼发布:Anthropic最强模型性能及成本焕新篇章

Fable 5.1震撼发布:Anthropic最强模型性能及成本焕新篇章

AnthropicCEO兼联合创始人达里奥·阿莫迪。图片经AI处理

时至美国东部时间9月1日,Anthropic旗下同步推出了两个新型人工智能模型系列:Claude Fable 5.1与Claude Mythos 5.1。

两款产物虽然共享统一的底层技术框架,但在防护策略的设定上存在分化。Fable 5.1的覆盖范围已然全面铺开,涵盖Pro、Max、Team及Enterprise等各类用户群体,并可通过Claude API以及各大主流云计算平台进行调用。相比之下,Mythos 5.1实行了更为严格的管制政策,唯有通过认证筛查且从事网络安全或生命科学专业工作的部分人士才获得使用许可,当前放开的范围十分有限。

AMP

Fable 5.1在输入与输出的费用标准保持稳定不变,调整的焦点转向了缓冲数据读取的价格体系。具体而言,缓冲数据读取的费用从原先的水平下滑至四分之一,降幅达到75%。依照Anthropic公司的实际计算,在常规业务流程的成本层面,与Fable 5相较总体支出可压缩约四分之一,而涉及复杂编程开发及高度自主化任务场景,节省幅度甚至能达五分之二以上。

Anthropic同步推出了企业级边界防护系统(Enterprise Frontier Safeguards,简称EFS),企业可藉此将其敏感资讯托管于自身掌控的云计算基础设施环境中。对于达成前置条件的企业顾客,在EFS正式投放市场之际,已能够率先行使Fable 5.1所具备的零数据日志保留方式。

在算力表现领域,Fable 5.1在编程开发、科学钻研、知识密集型操作和企业流程自动化等多项测试指标中的表现都较Fable 5更加突出。Anthropic也披露了初期商业用户的实际应用情景,触及长周期机器学习工程、软件问题诊断以及浏览器智能代理等用途。

01 科研型智能体对标赛,性能指数远超竞品

Anthropic在本轮对Fable 5.1的产品定位上做出了显著的方向调整:模型需承载更繁重、更庞杂的任务处理,并在处理的各环节持续验证成果、启用各类工具资源及灵活改变执行战术。

Anthropic官方的测验数据显示,在Terminal-Bench-Science 0.1这项基准中,Fable 5.1拿到52.6分,远超GPT-5.6 Sol的22.4分,后者仅为前者的43%不到,而Fable 5与Opus 5分别停留在24.7分及29.0分。这项评价体系的主要考量是AI代理在科学论证工作中的执行能力,要求模型能在命令行界面中完成持续不间断的研究工程。

AMP

Terminal-Bench 4.0的对比中,Fable 5.1得分55.8,超越Fable 5与Opus 5各自的42.0及52.3。倘若将防护机制的限制条件放宽,调用同一底层的Mythos 5.1版本得分进一步飙升至60.9,成为此轮评测中分数最先进的选项。

同等水准的能力提升也见于知识运用及经营自动化维度。Fable 5.1在GDPval-AA v2上斩获1853分,压过Opus 5的1824分以及Fable 5的1723分;于AutomationBench赛道获31.4%,而Fable 5和Opus 5分别刷出17.1%与26.9%;在CursorBench 3.2.0里更是冲至73.4%。

AMP

这种成绩的跃升,底层反映出的是模型在更长流程链条内维持稳定工作状态的能力升级。Anthropic透露的部分客户实践案例更能充分诠释这种变化。

投资机构Millennium面临过一种极其稀有的程序故障,大约每运行一百万次才会触发一回。这种故障已经纠缠团队四到五年之久,历经多代模型方案的尝试都未能破解。Fable 5.1后来对第三方提供商的代码库做了深层的反向工程剖析,随即对照系统崩溃时生成的堆栈转储数据做逐一比对,最终将问题的罪魁祸首锁定在该库中某个缺陷。

AMP

Ramp的试验内容则聚焦于一次持久化的机器进程工作。Fable 5.1在完全无人看护的状态下连贯运作了38个时辰,随后回过头审视此前得出的数据后,察觉到标注偏差造成的问题,进而主动开启了6项验证实验。一夜之后实验告竣,模型递交了崭新的数据表以及后续操作的建议方案。

还存在一类处理流程更加贴近公司日常的实际情形。Browserbase让Fable 5.1执行浏览器代理的工程,在其最具挑战的某项关卡中完成率达82%,反超Opus 5的74%及Fable 5的57%。Jane Street Capital则公布,根据他们的内部验测,Fable 5.1在编码方面的解决数量超越Fable 5和Opus 5两个版本,而且面对周期长、环节多的复杂处理时,输出的结果依然便于理解。

从这套真实案例观察,Fable 5.1处理的业务已脱离「一个问题对应单一回答」的简易模式。一项完整的工作流可能就此展开:从资讯查证入手,继而进行代码梳理、工具应用、试验实践,再返回之前的阶段重新评估,最终汇总成可交付状态的成果。

科研领地的应用需求是Anthropic本次另一个着力凸显的范畴。

其间最堪关注的领域非蛋白构造莫属。现代医药研制流程里,许多新药的成功需要先挑选出能与人体内的特定位置产生结合反应的蛋白分子。Anthropic安排Mythos 5.1运用开源的蛋白质工程与折叠平台完成作业,继而将模型生成的产品方案交由两家独立机构开展实验确证。

AMP

针对12个靶点,Mythos 5.1所设计的候选物中,约五成最后被确认为有效联合体。Anthropic指出,现有蛋白类分子工程领域的标准成功率大约维持在一成至一成半。

在其中三个靶点处,模型所构造的联合体的联结效能超越以往Adaptyv Bio蛋白分子竞技赛最优作品的十倍。

这项工作的内在价值在于,模型所涉及的职能现已触及实践前置的方案阶段。它能依据任务需求生成筹划,再凭借现存的蛋白工程及结构预言工具做推算验证,终端将候选样品提交给检验专员做校验。

Anthropic还披露了一份计量建模的参考。Fable 5.1借力NASA麦哲伦航天任务三十多年前收录的遥感数据,以及覆盖金星约一成五的既有数据集,对神经元网络做预训练,新近制作出了涵盖金星约三分之一范围内的精细等高图。

AMP

AMP

新生成的制图可以辨识二至三千米尺度的微观构造,原版的精度约为十至二十千米,同期高度度量的准确率最多达到了二五%的增长。Anthropic筹备等候NASA的VERITAS工程与欧航局的EnVision项目启动之后,使用Creative Commons许可方案将该图纸对外开放。

计算微生物学范围内,Mythos 5.1将焦点聚焦在算力效率这一维度。

从业人员时常需要在显卡设备上多轮执行专用的机器学习管道,而运算的快慢会直接决定科研的进展节奏。Mythos 5.1通过编制客制化的显卡内核,并缓存中间态数据,将七个开源深度学习工程库的推理时耗提速了最高二点五倍,与此同时产物的一致性保持完好无损。

AMP

这些模块覆盖ChromBPNet、Flashzoi、Enformer、Profluent-E1、ProGen2与多等级的Evo2。据Anthropic的预估,在基因组尺度的剖析过程中,经过微调的引擎可削减三到六成的显卡耗费。

Anthropic表示,过去这种定制化工作通常由专业性能团队耗时周余才能完成,而Mythos 5.1只消数天即可交付,并且只依靠了通用的代码版本。后续的相关调优方案计划面向社群开源。

02 同源框架 差异安全机制

Fable 5.1和Mythos 5.1虽系出同源,但实际的使用政策分别差异甚大。

Fable 5.1的供给范围遍及所有云平台,包含AWS、Google Cloud与Microsoft Azure等,编程人员也可通过调用claude-fable-5-1接口来访问Claude API。

从防护政策角度看,Anthropic此番着力调节了网络信息安全及生物科学规范的约束体系。

网络防护领域内,Fable 5.1现可协助使用者识别软件缺陷,用于守卫性的保安运维工作。Anthropic指明,与之前Fable 5版本采用的防护方式相对,新型防护方案在Claude Code的环节中的均匀阻挠次数削减约六成。

生物科学专业则维持了更为保守的态度。一般的使用者从事的与研发相关的生物科学工程将被转至Opus版本,而从业人员可报名生物科学资格计划以申请Mythos 5.1的操作权。该计划现已与美国官方展开了合作,初期参与方已然成型。

Mythos 5.1还将根据网络信息安全资格计划向经过评审的安全检验工作人员推广。Claude Security当下由Mythos 5.1来供能,担当对代码库做漏洞筛选并提交人工判核修复意见的职责。

此外,Anthropic也强化了用户个人资料保护及公司级别的防护办法。

新推出的Enterprise Frontier Safeguards,即EFS,赋能公司把所属数据贮存于自身统治的云基础架构中,而非Anthropic的服务器内。日常状态下,需人工审核的事务也由企业方自行承担。EFS将于今年秋冬之交开启分阶段的功能发放,在正式下线之前,满足条件的企业可优先使用Fable 5.1的无数据记录的运营方式。

Anthropic强调,EFS系在与百家以上企业的互动往来后设计制作的,这些企业遍布金融、卫生、生产制造、通讯、律师、商业零售与行政机构等行业领地。

在本次发布的总体特点来看,Fable 5.1的升级侧重于几项具体且有针对性的创新:代码处理能力得到加强,长周期工作的执行稳定度提高,科学钻研工作开始浮现经验验证,读缓存费率显著下沉,而公司可获得更确定的信息主权掌控形式。

对于大众使用人群而言,最立竿见影的改善或许是模型在面对复杂工程时更加能够接续地完成整体工作;对于商业机构而言,费用压缩和资讯掌握机制则通畅了规模化采纳的途径。Anthropic也经由Mythos 5.1把更强的网络信息防护及生物科学工作能力交付给通过考查的业界行家。

Fable 5.1由此演变成Anthropic当今面对生产制造场景的核心竞争力强势版本之一,而学术深耕与危害等级较高的业界使用情景,则被单独规划进了Mythos 5.1的严管准入方式。

03 读缓费率腰斩至二五%

Fable 5.1这回处理的不仅是算力与防护体制,还涵盖了实际的价格水准。

Anthropic沿用了Fable 5既有的标准API计价模式,输入与输出的费用各为每百万Token 10美元及50美元,原始价位没有做下降处理。但缓冲读取的价格由之前的每百万Token 1美元降低至0.25美元,降幅高达四分之三。

AMP

Anthropic依照2026年8月的实际运营数据做了测量,在标准运营状态的成本水平上,整体支出可以获得约一成减让。面向高度自主化、缓冲占比大的某类工作场景,省钱幅度则更加可观。

但是,一家独立评测机构Artificial Analysis的检测体现,缓存价低并不意味着单项工程的实践支出也会有所减降。该机构的结果表明,在最顶端推理模式下,Fable 5.1完成一回Intelligence Index工程的均值支出为3.76美元,与Fable 5相比高出一成半。根本性的因素是Fable 5.1所用的输出数据流比Fable 5大约多出1.7倍。

AMP

缓冲价格的松动依然实现了明显的节省现象。Artificial Analysis算得,缓存读取的费率调低每项工程约省1.40美元的成本,此项优化主要呈现在代理工作的验测中,因为此类任务需多轮查阅过往已解析的背景资讯。

如果将推理档位从最强调至xhigh等级,Fable 5.1的Intelligence Index评分为65,单项工程价位跌至2.72美元,较最顶档缩水1.04美元。可是,这个数字依旧高于Opus 5在最高等级下的2.34美元。

由此看来,Fable 5.1的价钱构造并非单纯的「便宜了」。Anthropic下调的是缓冲这一项的费用,但模型在处理重型任务时消耗的流量数据增大了,最终单项的支出情况还源于具体的调取风格及推理档位的选择。

其实,Fable 5.1还适配批量处理功能。对于非即时性工程,输入和输出费用可以打降到每百万token各5美元和25美元。美国国内专属推理的系数为1.1倍,网页搜索的价格为每千次查询收费十美元,抓取网络页面不独立计价。

AMP

Anthropic也做了不同版本的价钱对标。Opus 5的输入、输出与缓存各自为5、25与0.50美元每百万Token;Sonnet 5则为2、10与0.20美元。

Fable 5.1的基础输入和输出价格依旧高于这两类版本,但缓冲价格业已低于Opus 5,仅比Sonnet 5多0.05美元。


上一篇 2026/09/01 20:27
下一篇 2026/09/01 20:27

相关推荐

  • 从失控到失速:宇树员工揭秘「罚多奖少」与「低薪高压」

    宇树科技上市两周股价跌近五成,市值蒸发超2100亿。员工爆料:创始人王兴兴亲自审批百元报销,奖惩机制「罚多奖少」,薪资水平行业偏低。强势管理带来产品成功,却面临组织发展瓶颈。

    2026/09/01
    00
  • 「小国大担当」——尼泊尔灾难救援的启示

    一场泥石流灾难让世人对尼泊尔刮目相看。这个面积仅14.72万平方公里、人口2960万的小国,在灾后救援中表现出令人敬佩的高效能力。十多架直升飞机迅速出动,失踪获救人员名单每日更新,珠峰登山者加入隧道救援……尼泊尔将高山救援经验快速转化为灾害应对能力。

    2026/09/01
    00
  • 经典电影也改字幕?《肖申克的救赎》内地版本为何引发热议

    《肖申克的救赎》首登内地院线引发字幕风波。网友发现多处改动:度量单位公制化、”体制化”改成”牢笼驯化”、”同性恋”改成”变态”。业界批评违背原意,网友质疑审查尺度,影片公映三十年后成为舆论焦点。

    2026/09/01
    00
  • 「突发」纽约时代广场血案:美国银行32岁副总裁遭刺身亡

    纽约时代广场发生恶性伤人事件,美国银行32岁副总裁艾琳·皮亚琴蒂遭刺身亡。行凶者为49岁女性帕梅拉·希斯内罗丝·洛佩兹,20秒内刺伤两人。警察对峙后开枪,共开五枪制止嫌疑人。经查嫌疑人有精神病史,属无差别随机暴力犯罪。

    2026/09/01
    00
  • 这次动真格了!孙宇晨向多家自媒体发起集中投诉

    孙宇晨近期向多个自媒体账号发起实名投诉,涉及卢克文工作室、36氪、「萝严肃」等。他以侵害名誉权、商誉权等为由要求撤下贬低措辞文章,已聘请律师固定证据。此前向景甜提起诉讼并在社交媒体披露私密内容。

    2026/09/01
    00

发表回复

登录后才能评论