コンテンツにスキップ
メインサイト ニュース コンソール

でFable級の性能

· Latent Space 翻訳済
播客深度访谈

珍しく金曜日にリリースされたOpus 5が、本日のトップニュースとなりました。大半の公式ベンチマークにおいて、そのパフォーマンスは技術的にはすでに Fable を上回っているものの、公式の表現では依然として「極めて近い」とされています。これは主に、評価(Evals — 今や AIE トラックドロップ)自体の難しさを反映しています。つまり、Anthropic が Fable にまだ残されていると確信していながらも、測定することができない「大型モデル特有の直感(big model smell)」を評価しきれていないのです。

幸いなことに、独立した評価でも Opus の優れたパフォーマンスが実証されています。

また、価格設定だけでなく、効率性の向上に関する議論も重要です……もっとも、GPT 5.6 Sol とかろうじて肩を並べる程度ではありますが。

AI News for 7/23/2026-7/24/2026. We checked 12 subreddits, 544 Twitters and no further Discords. AINews’ website lets you search all past issues. As a reminder, AINews is now a section of Latent Space. You can opt in/out of email frequencies!


AI Twitter Recap

トップニュース:Claude Opus 5 モデルがリリース

何が起きたのか

Anthropic が Claude Opus 5 をリリースしたことで、ベンチマークに対する綿密な検証が行われ、コーディングエージェントとしての性能に対する多くの好意的な口コミが広がり、フロンティアモデルの評価をめぐる議論が再燃しています。

  • 多くのツイートで Claude Opus 5 が新規リリースされたモデルとして明確に議論されており、コーディングや一般的な能力指標において、他のフロンティアシステムとの比較が行われています。これには