在一个少见的周五发布中,Opus 5 成了今天的头条。尽管它在大多数官方基准测试中的表现技术上已经超过 Fable,官方表述仍称它“非常接近”。这主要反映了评测(Evals——如今的 AIE track drop)本身的难度——它并不能体现 Anthropic 显然知道 Fable 仍然保有、但却无法衡量的那种“强模型直觉(big model smell)”。
幸运的是,独立评测也证实了 Opus 的领先表现:
而且,除了定价之外,效率提升的叙事也很重要……尽管它只能勉强与 GPT 5.6 Sol 持平:
AI News for 7/23/2026-7/24/2026. We checked 12 subreddits, 544 Twitters and no further Discords. AINews’ website lets you search all past issues. As a reminder, AINews is now a section of Latent Space. You can opt in/out of email frequencies!
AI Twitter Recap
头条:Claude Opus 5 模型发布
发生了什么
Anthropic 发布 Claude Opus 5 后,引发了对基准测试的密集审视、关于其在编程代理上的大量正面口碑,以及围绕前沿模型评测的再度讨论。
多条推文明确将 Claude Opus 5 讨论为一款新发布的模型,并将其与其他前沿系统在编程和通用能力指标上进行比较,包括
