刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6

文章配图-1

新智元报道

今夜,Anthropic没有任何预热,直接甩出了Claude Opus 5.5。

这是Claude 5.5系列首款模型!

Opus 5.5不仅性能追平了Fable 5.1,成本还要比上一代Opus 5低40%,输出速度狂飙30%。

这一次,A\直接掀了「性能强=成本高」的桌子。

如今,每个人可以拿到Fable 5.1级的能力,用更少的钱,干更多的活儿。

文章配图-1

三个字总结:更强、更便宜、更快

用Anthropic的话来说,Opus 5.5在智能体编程、计算机使用、知识工作上,全部刷新了SOTA。

尤其是Terminal-Bench 4.0,跑出了66.4%的成绩,直接把GPT-6 Astra、Fable 5.1按在地上打。

知识工作GDPval-AA v2.1拿下1846 Elo,也跑到了对手前面。

文章配图-1

如今,Claude 5.5的亮相,直接把新一轮模型大战的火药味儿直接拉满。

Anthropic官宣不过2小时,OpenAI直接扔出了GPT-6 Sol和Luna迎战。

AI圈新一轮大战,今夜正式开打了!

文章配图-2

目前,Claude Opus 5.5已在全球正式上线,未来几周,Sonnet 5.5与Haiku 5.5也将同步登场。

首个Claude 5.5登场

暴打GPT-6 Astra

距离Opus 5发布,仅仅过去了不到两个月。

Claude此番「跳级发售」,摆明了就是冲着OpenAI去的。

文章配图-3

Artifical Analysis上,Claude 5.5和Fable 5.1,全部压过了GPT-6 Astra

在Anthropic自家的能力指数ECI上,Opus 5.5的得分干过了「雪藏」的Mythos 5.1。

第三方机构Vals AI的RSI指数,测的是模型自己搞AI研究的本事。实测下来,Opus 5.5全球第一。

文章配图-4 文章配图-5

到了编程这一项,差距被拉得更开。

Terminal-Bench 4.0衡量的是AI在真实终端环境中完成复杂多步编程任务能力。

在这里,Opus 5.5直接拿下了66.4%,领先GPT-6 Astra整整8.5个百分点(57.9%)。Fable 5.1是55.8%;Opus 5只有52.3%。

Opus 5.5只要开默认档,就能锤爆Opus 5的最高档,而成本只有它的五分之一;追平Astra,也只需花Astra 40%的钱。

文章配图-6

此外,在测真实代码合并的FrontierCode v1.1,它跑出54.4%,险胜Astra的53.3%。

最夸张的是CursorBench 4.0,题目全是从真实Cursor会话里扒出来的含糊不清、跨文件的烂摊子任务,它拿下57.8%,而GPT-5.6 Sol只有41.7%。

文章配图-7 文章配图-8

在知识工作领域,Opus 5.5同样势不可挡。

GDPval-AA v2.1基准测试覆盖44个职业的真实工作任务,Opus 5.5拿下1846 Elo,GPT-6 Astra只有1542。

300多分的Elo差距,在竞技评分体系里几乎是代差。

文章配图-1

狂飙写作,「啰嗦」病治好了

最值得一提的是,Opus 5.5这一次在写作和沟通能力上,再次强化了。

之前,Opus 5被吐槽最多的就是沟通太费劲。

现在它学会了「结论前置」,扫一眼就能看懂,不说黑话、不拽怪词,让怎么写就怎么写。

长时间协作下来,体验可以说是质的飞跃。

Anthropic把两个版本拉了个横评,大家感受一下:

遇到Bug时,老版Opus 5要慢条斯理地铺垫一大段,结论藏在后面;Opus 5.5第一句话就一针见血地指出账单异常,紧接着干净利落地附上代码。

文章配图-2

Box的AI产品副总实际体验后表示,「Opus 5.5的token用量只有上一代的三分之一,啰嗦度暴降40%」。

全网首测

比Astra更像AGI

Claude Opus 5.5到底香不香,光听Anthropic吹可不行。

Bun的作者Jarred Sumner说了句大实话,写作像Opus 4.6,写代码像Fable 5.1,它会很快成为大部分人的主力模型。

这不,第一波开发者的真实测评,已经出炉了!

手搓3D动画,每一帧都是狠活

虽然Claude不会生图,但它这次手搓动画效果的体验,那叫一个丝滑。

开发者cheaty看完网友DreW制作的一个30秒短片撂下一句话,「在我看来,这比Astra更像AGI」!

谷歌DeepMind的Ben Poole在纸上随手画了一台投石机和一摞方块的草图。

眼瞧着,Opus 5.5就把草图变成了一个能发射、能砸塌方块的3D物理仿真,投石机的关节和配重都是照着草图搭的。

文章配图-3

Anthropic大牛Addy Osmani也来整活了。

他直接在Three.js里搓了一只骑自行车的鹈鹕的3D动画,在线开香槟庆祝。

沃顿商学院的Ethan Mollick再次用同一套shader提示词测了下——暴雨中的哥特城市。

文章配图-3

文章配图-4

一句话直出游戏

在游戏生成上,Opus 5.5也是拿捏很到位。

有人让它整一个涂鸦画风的FPS,居然直接一把过,清完三波小怪之后甚至还能打Boss。

文章配图-1

文章配图-2

经典游戏「我的世界」,可玩效果非常能打。

文章配图-1

另一位开发者Edwin做了一款游戏,灵感来自人类历史上第一台计算机——安提基特拉机械装置的打捞发现。

画面和音效全都是 Opus 5.5 纯代码实时跑出来的,没有任何外部素材。

Opus降价四成

实则烧得更多

过去,Opus系列让很多人又爱又恨,能力强,但Token蒸发太快。

这一次,Anthropic直接启动了「加量减价」模式。

文章配图-1

输入4刀、输出20刀,各砍20%。最烧钱的缓存读取直接从0.50刀砍到0.20刀,降了60%。

想追求速度,开Fast模式提速2.5倍,价格翻倍,8刀和40刀。

官方的说法很诱人,在典型工作负载下,整体便宜40%,输出快30%。

但Artificial Analysis的测试显示,在最高档max effort下,Opus 5.5每解一道题,平均要狂吐11.9万个token,而思考就消耗了8.4万token。

整体看,Opus 5是7.3万,Fable 5.1是7.8万,GPT-6 Astra只有2.7万。

也就是说,它比上一代多想了60%,比Astra多想了4倍。单价降两成,思考量涨六成,两头一抵,白降。

文章配图-1

文章配图-2

在安全审查这块,Anthropic爆出了一句让人后背发凉的大实话。

Opus 5.5在自动行为审计里拿了历史最高分,试图绕过限制的越狱行为比上一代少了85%,而且每次都会「乖乖主动上报」。

但紧接着,官方坦承,他们发现Opus 5.5经常敏锐地怀疑自己正在被人类评估。这事细思极恐。

一个AI知道自己在考试,它在考场上展现的「乖巧」,未必代表它在真实世界里不受控时的反应。随着能力变强,这个问题正在变成一个无解的黑洞。

OA终极之战,才刚刚开始

这一战,还没有完。

Anthropic也说了,Opus 5.5只是首个版本,Sonnet 5.5和Haiku 5.5也即将推出。

5.5系列的全面铺开,才刚刚开始。

从旗舰到中端到轻量级,Anthropic正在用一套完整的产品线,对OpenAI发起全线进攻。

而OpenAI那边,也拿出了GPT-6 Sol和Luna,效率更高、成本更优的选择。

大模型这波仗,从拼技术一路卷到拼价格,现在可真到肉搏的时候了。

参考资料:

https://www.anthropic.com/claude-opus-5-5

https://x.com/AnthropicAI/status/2102435703535939725?s=20

https://x.com/ClaudeDevs/status/2102438800836489554?s=20

本文来自转载新智元 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

(0)
资讯组小编的头像资讯组小编
DeepSeek新论文公开Agent训练!梁文锋署名
上一篇 3小时前
GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」
下一篇 3小时前



扫码关注我们,了解最新AI资讯~

相关推荐

发表回复

登录后才能评论