跳转到内容
主站 新闻 控制台

GPT‑6 Astra

· Simon Willison
技巧LLM

GPT‑6 Astra

GPT-6 Astra“今日开始向一小部分组织推出,并将在未来几天内向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也将通过 OpenAI API 和 AWS 提供”——我自己还没有试用过,因此目前还没有太多可说的。

其 API 定价将与 Claude Fable 5 和 5.1 相同:输入每百万 token 10 美元,输出每百万 token 50 美元。这显然是 OpenAI 对标 Fable 的产品,而且从 OpenAI 自行公布的大多数基准测试来看,Astra 的得分似乎更高。

最令人印象深刻的是,Astra 在最近发布的(今年 3 月发布)ARC-AGI 3 基准测试中取得了 99.9% 的成绩——不过值得注意的是,Fable 5 目前还没有公布测试结果;此外,ARC-AGI 博客文章指出,这个 99.9% 的成绩是在使用 OpenAI 定制的“Provider Adapter harness”并花费 1.9 万美元的情况下取得的,而使用默认 ARC-AGI harness 时,花费 2.6 万美元取得的成绩为 62.7%。

Provider Adapter harness 会在请求之间保留不透明的推理状态,并使用压缩机制处理更长的对话,从而让模型能够复用先前完成的工作。

鉴于最近发生的 Hugging Face 事件,Astra 在安全任务上的表现出色并不令人意外。它在 ExploitBench 上取得了 100% 的成绩(GPT-5.6 Sol 为 78.5%),在 ExploitGym 上取得了 42.4%(Sol 为 30.3%),并且在 SRE-Bench 二进制逆向工程测试中,四次尝试内的成绩达到 99.2%,相比之下 Sol 为 68.7%。

它在长上下文方面也更强:在 OpenAI 的 eight-needle 基准测试中,处理 256K–512K token 时得分为 100%,处理 512K–1M token 时得分为 96.3%。OpenAI 或许已经解决了长上下文处理领域持续存在的某个挑战。

不过,它并非在所有方面都胜出。Artificial Analysis指出,在他们的 Intelligence Index 上,Astra 仍然不敌 Fable:

与 GPT-5.6 Sol 的智能水平相当:GPT-6 Astra 在该指数中的得分为 61,与 GPT-5.6 Sol 持平。这比 Claude Fable 5.1(启用 fallback 时的最高成绩)低 5 分。该模型的得分也落后于 Meta 新发布的 Muse Spark 1.3(最高成绩)。

不过,它在他们的 Coding Agent Index 上表现更好:

引领 Coding Agent Index 的成本效率前沿:在最高努力程度下,GPT-6 Astra 的成本与 GPT-5.6 Sol(最高努力程度)大致相同,但在该指数上的得分高出 2 分。按每项任务计算,在得分相同的情况下,该模型的成本不到 Claude Fable 5 的一半。

等我获得 Astra 的访问权限后,我会再写更多相关内容。它发布后,API 模型名称将是 gpt-6-astra。