不和老黄商量
Jay 发自 凹非寺
倒反天罡了,家人们。
刚刚,OpenAI 的自研芯片「小辣椒」跑分碾压了英伟达最强的 Blackwell……
700W 的功耗,最高 1.9 倍的每瓦吞吐,推理时延最低降低至对比产品的 1/3.6。
这不是官方 PR,数据来自半导体深度研究机构 SemiAnalysis。该机构受邀前往 OpenAI 实验室进行实测。
一般来说,第一代芯片并不具备竞争力。
但 SemiAnalysis 最终得出的结论是:
OpenAI 这颗第一代芯片,在几乎所有场景下都能击败 Blackwell。
低延迟、高吞吐、低并发……全部达到 SOTA 级别。
据悉,Codex 在这一过程中扮演了非常重要的角色,部分由 AI 编写的内核,性能甚至优于人类编写的内核。
这也是自进化的一种体现吧。

有趣的是,英伟达股价不仅没有跳水,还上涨了 2.19%……

一方面,英伟达有新产品。
在小辣椒发布同一天,英伟达发布了 Jetson Orin Nano 2 机器人电脑。
另一方面,可能也与 OpenAI 的态度有关。
小辣椒跑分公布后,OpenAI 仍明确表示不会弃用英伟达:训练仍将大量使用英伟达芯片,且双方存在融资担保合作。
倒放天罡!OpenAI 芯片碾压 Blackwell
今年 6 月,OpenAI 官宣与博通(Broadcom)合作开发这颗专为推理打造的芯片,名为「小辣椒」。该芯片于 2024 年年中启动设计,从组队到流片只用了约 16 个月。
8 月 25 日,OpenAI 在 Hot Chips 2026 大会上公开了这颗自研芯片。
与此同时,更多隐藏细节也逐渐浮出水面。
SemiAnalysis 受邀携自家的 InferenceX 基准套件前往 OpenAI 实验室进行现场实测。
结论是,这颗第一代芯片在多个主流开源模型上,击败了其测试范围内的所有英伟达、AMD 和谷歌芯片。

能效是其最大亮点。
小辣椒的热设计功耗(TDP)只有 700W,而 Blackwell 旗舰加速卡则为 1200W 至 1400W。SemiAnalysis 实测显示,其每千瓦推理吞吐达到 GB200 NVL72、GB300 NVL72 机架系统的1.5 至 1.9 倍。
时延同样表现出色。
端到端推理时延比英伟达记录的 GB200 NVL72、GB300 NVL72 最佳成绩低 1.7 至 3.6 倍;在超低时延场景下,速度快 2.1 至 4.1 倍。
在 GB300 的最快输出速度设置下,每千瓦吞吐最高高出8.6 至 104.3 倍。

测试模型包括 3 个开源大模型:GPT-OSS 120B、DeepSeek R1 670B,以及月之暗面 Kimi K2.5(1 万亿参数)。
在低并发条件下,GPT-OSS 和 Kimi K2.5 达到约 1400 token/秒/用户;DeepSeek R1 在并发数为 1 时,超过 700 token/秒/用户。
在每秒 100 token 的低并发点位上,Kimi K2.5 的表现是次优芯片的9 倍以上。在相同交互度下,GPT-OSS 的每兆瓦吞吐接近 GB200 最高吞吐点的两倍;在并发数为 1 的点位上,高出 50 倍。
正确性也没有落下,GSM8K 评测结果与英伟达芯片持平。
不过,测试口径也需要说明。
以上成绩全部基于单 token 预测(STP),没有使用推测解码,也没有进行 prefill、decode 分离;而对比的 Blackwell 成绩则启用了多 token 预测(MTP)。SemiAnalysis 表示,如果与启用多 token 预测的 GB300 对比,小辣椒的峰值能效优势将缩小至约 1.5 倍。
跑分数据由 OpenAI 提供,SemiAnalysis 团队在实验室现场验证了 InferenceX 的跑分过程,但没有运行完整套件,也没有测试其更偏好的 AgentX。后者覆盖长上下文、多轮对话,更接近真实生产负载。
与此同时,SemiAnalysis 认为,拿 Blackwell 进行对比并不完全公平,小辣椒真正需要对标的是同样采用 HBM4 的下一代 Vera Rubin。
Rubin 系统已经开始向客户出货,而小辣椒目前仍只有工程样品。
但目前看来,即便直接对标 Rubin,小辣椒依然具备竞争力。
其单 token 预测的每兆瓦输出吞吐,超过了英伟达和 CoreWeave 于 7 月公布的多 token 预测成绩,也远超 GB200 在 2025 年的多 token 预测结果。
两者的每美元产出基本持平,而 Rubin 的成绩使用了推测解码。推测解码能够将每 token 成本进一步降低 3 至 5 倍。小辣椒尚未采用推测解码,补上这一环节后,成本优势可能会进一步扩大。

怎么做到的?
奥特曼,你你你……这速度有点太吓人了啊。
2025 年 11 月完成流片(CoWoS 封装设计)后,实际芯片点亮只用了 3 个月,9 个月就拿出了 A0 步进的成绩。
第二版 B0 步进已经进厂流片,每瓦性能还能再提升约 25%。

规格方面,B0 步进采用台积电 N3P 工艺的单计算 die,搭配 N3E 工艺 I/O chiplet,单 die 可提供13.4 PFLOPS 的 MXFP4 算力,TDP 仅为 700W。
内存方面,该芯片配备 6 组 HBM4 高带宽内存,单封装容量为 216GB,带宽达到15.4TB/s,是目前已经出货或即将出货的加速卡中最高的,供应商大概率为三星。

软件栈同样关键。内核采用 Gluon 语言编写。该语言基于 Triton,保留了 SPMD 编程模型,但提供了更底层的抽象。
据悉,在这场高速开发过程中,AI 扮演了非常重要的角色。
设计阶段使用 Codex、GPT-Astra 辅助,将 SIMD 单元面积缩减了 8%,矩阵引擎面积缩减了 10%。
AI 还负责编写每个内核,部分模块的 AI 内核性能比人类专家编写的内核快 1.5 至 1.8 倍。
迭代速度也相当惊人。
8 天内,并行规模从 TP8 扩展至整机架 TP32;不到两周,部分交互度下的吞吐翻了一倍以上。
这里还有一个彩蛋:OpenAI 使用 Codex 将《毁灭战士》移植到了这颗芯片上,能够以 36 FPS 运行。

讽刺的是,运行在英伟达 GPU 上的 OpenAI 模型 GPT 5.6 Sol,也参与了这颗威胁 CUDA 生态护城河的芯片设计。
英伟达自己的 GPU,正在亲手推动潜在继任者的诞生。
SOTA 级别的内部 AI 加持,可能也是 OpenAI 实现弯道超车的一种方式。
辣椒何时登场
所以,这颗小辣椒什么时候会正式站上擂台?
答案是:工程样品已经就绪。
量产将于 2027 年逐步爬坡,大部分产出将集中在 2027 年底,下一阶段目标是达到 100MW 规模。
承载小辣椒的单机架系统名为 Vindaloo,配备 128 颗小辣椒芯片,并搭配 Katsu CPU 主机架和 Chana 交换机架。两个机架合计功耗约为 160kW,最多可由 16 个机架、2048 颗芯片组成一个 scale-up 域。
部署将与 neocloud 厂商合作,先收集可靠性数据,再逐步放量。
值得注意的是,OpenAI 目前并不打算用小辣椒替代现有的全部芯片系列,仍将与英伟达等算力伙伴合作。
但与此同时,OpenAI 也将继续开发第二代和第三代芯片。
One More Thing
不过,谁能统领好这支辣椒军团,至今仍是个问号。
刚刚曝出的消息显示,OpenAI 数据中心负责人 Chris Malone 已于上周离职。

《华尔街日报》于 8 月 25 日率先报道此事,彭博社随后经 OpenAI 发言人确认。Malone 离职后没有继任者,相关职责被分配给多位负责人。
他于 2025 年 3 月加入 OpenAI,正值公司与甲骨文、软银宣布 Stargate 项目之后不久,负责为快速增长的算力需求建设数据中心。
Stargate 开局并不顺利,OpenAI 一度转向向云厂商租用芯片,最近又开始恢复自建,具体方式是整体租下整座设施,而不是单独租用芯片。但据知情人士透露,负责带队的并不是 Malone。
Malone 是这轮离职潮中的第 4 位高管。
此前,首席营收官 Denise Dresser、首席运营官 Brad Lightcap,以及 CEO Altman 的副手 Fidji Simo 均已离开。TheNextWeb 统计,自 4 月以来,已有7 位高层离任或换岗。
上市前数月出现如此密集的 C 级高管离职,即使按照 IPO 前夜的标准来看,也属罕见。
小辣椒,好像没有能接手的人了……
要不和老黄商量一下,派个人来救火?
(bushi)
参考链接: