黄さんに相談しない
Jay 発、凹非寺より
天の理に反してるじゃないか、みんな。
つい先ほど、OpenAI が独自開発したチップ「ハラペーニョ」のベンチマーク結果が、NVIDIA 最強の Blackwell を圧倒した……
消費電力は 700W。ワット当たりスループットは最大 1.9 倍、推論レイテンシは比較対象の最短で 1/3.6 まで低減された。
これは公式 PR ではない。データの出所は、半導体の専門調査機関 SemiAnalysis だ。同機関は OpenAI の研究所に招待され、実測を行った。
一般的に、初代チップには競争力がない。
しかし、SemiAnalysis が最終的に出した結論はこうだ。
OpenAI のこの初代チップは、ほぼすべてのシナリオで Blackwell を上回る。
低レイテンシ、高スループット、低並列度……すべてが SOTA レベルに達している。
伝えられるところによると、Codex はこの過程で非常に重要な役割を果たした。一部の AI 生成カーネルは、人間が作成したカーネルを上回る性能さえ示したという。
これも一種の自己進化と言えるだろう。

興味深いのは、NVIDIA の株価が急落するどころか、2.19%上昇したことだ……

一つには、NVIDIA に新製品があったことが挙げられる。
ハラペーニョが発表された同日、NVIDIA はロボット向けコンピューター「Jetson Orin Nano 2」を発表した。
もう一つは、OpenAI の姿勢にも関係している可能性がある。
ハラペーニョのベンチマーク結果が公表された後も、OpenAI は NVIDIA を廃止するつもりはないと明確に表明している。トレーニングでは今後も NVIDIA のチップを大量に使用し、両社には融資保証に関する協力関係もある。
天地がひっくり返った!OpenAI のチップが Blackwell を圧倒
今年 6 月、OpenAI は Broadcom と、推論専用に設計されたこのチップを共同開発すると正式発表した。名前は「ハラペーニョ」。2024 年半ばに設計を開始し、チーム結成からテープアウトまでにかかった期間はわずか約 16 カ月だった。
8 月 25 日、OpenAI は Hot Chips 2026 カンファレンスで、この独自開発チップを公開した。
それと同時に、これまで隠されていた詳細も次第に明らかになってきた。
SemiAnalysis は自社の InferenceX ベンチマークスイートを携え、OpenAI の研究所に招待されて現地実測を行った。
結論として、この初代チップは複数の主要オープンソースモデルにおいて、テスト対象となった NVIDIA、AMD、Google の全チップを上回った。

最大の強みは電力効率だ。
ハラペーニョの熱設計電力(TDP)はわずか 700W。一方、Blackwell のフラッグシップアクセラレーターは 1200W~1400W だ。SemiAnalysis の実測によれば、1kW 当たりの推論スループットは、GB200 NVL72 および GB300 NVL72 のラックシステムの1.5~1.9 倍に達した。
レイテンシも優れている。
エンドツーエンドの推論レイテンシは、NVIDIA が記録した GB200 NVL72 および GB300 NVL72 の最良値よりも1.7~3.6 倍短い。超低レイテンシのシナリオでは、速度は 2.1~4.1 倍に達した。
GB300 の最速出力速度設定では、1kW 当たりのスループットが最大で8.6~104.3 倍高かった。

テスト対象のモデルは、3 つのオープンソース大規模モデルだ。GPT-OSS 120B、DeepSeek R1 670B、そして Moonshot AI の Kimi K2.5(1 兆パラメーター)である。
低並列度の条件では、GPT-OSS と Kimi K2.5 がユーザー当たり約 1,400 token/秒を達成した。DeepSeek R1 は、並列数 1 のときにユーザー当たり 700 token/秒を超えた。
毎秒 100 token という低並列度のポイントでは、Kimi K2.5 の性能は次点のチップの9 倍以上だった。同じインタラクションレベルでは、GPT-OSS の 1MW 当たりスループットは GB200 の最大スループットポイントのほぼ 2 倍に達し、並列数 1 のポイントでは、50 倍高かった。
正確性も劣っておらず、GSM8K の評価結果は NVIDIA のチップと同等だった。
ただし、テスト条件についても説明しておく必要がある。
上記の結果はすべて単一 token 予測(STP)に基づくもので、投機的デコーディングは使用しておらず、prefill と decode の分離も行っていない。一方、比較対象となった Blackwell の結果では、複数 token 予測(MTP)が有効化されていた。SemiAnalysis によると、複数 token 予測を有効にした GB300 と比較した場合、ハラペーニョのピーク電力効率の優位性は約 1.5 倍まで縮まるという。
ベンチマークデータは OpenAI が提供したものだ。SemiAnalysis チームは研究所で InferenceX のベンチマーク実行プロセスを検証したが、完全なスイートを実行したわけではなく、同チームがより重視する AgentX もテストしていない。AgentX は長いコンテキストや複数ターンの対話を対象としており、実際の本番負荷により近い。
また SemiAnalysis は、Blackwell との比較は完全に公平とは言えず、ハラペーニョが本当に比較すべき相手は、同じく HBM4 を採用する次世代の Vera Rubin だと考えている。
Rubin システムはすでに顧客への出荷が始まっているが、ハラペーニョは現在もエンジニアリングサンプルに過ぎない。
しかし現時点で見る限り、Rubin と直接比較したとしても、ハラペーニョには依然として競争力がある。
単一 token 予測における 1MW 当たりの出力スループットは、NVIDIA と CoreWeave が 7 月に公表した複数 token 予測の結果を上回り、2025 年における GB200 の複数 token 予測の結果も大幅に上回った。
1 ドル当たりの出力は両者でほぼ同等だったが、Rubin の結果では投機的デコーディングが使用されている。投機的デコーディングを使えば、token 当たりのコストをさらに 3~5 倍引き下げられる。ハラペーニョはまだ投機的デコーディングを採用していないため、これを導入すればコスト面での優位性はさらに拡大する可能性がある。

どうやって実現したのか?
アルトマン、あなた、あなた、あなた……このスピードはさすがに怖すぎる。
2025 年 11 月にテープアウト(CoWoS パッケージ設計)を完了した後、実際にチップを起動するまでにかかった期間はわずか 3 カ月。9 カ月で A0 ステッピングの性能を達成した。
第 2 版となる B0 ステッピングはすでに工場でテープアウトに入っており、ワット当たり性能はさらに約 25%向上する見込みだ。

仕様面では、B0 ステッピングは TSMC の N3P プロセスによる単一コンピュート die を採用し、N3E プロセスの I/O chiplet を組み合わせている。1 つの die で13.4 PFLOPSの MXFP4 演算性能を提供し、TDP はわずか 700W だ。
メモリには HBM4 高帯域幅メモリを 6 組搭載する。1 パッケージ当たりの容量は 216GB、帯域幅は15.4TB/sに達する。これは、すでに出荷済み、または間もなく出荷されるアクセラレーターの中で最高の値であり、サプライヤーはおそらく Samsung だと見られている。

ソフトウェアスタックも同じく重要だ。カーネルは Gluon 言語で記述されている。この言語は Triton をベースにし、SPMD プログラミングモデルを維持しながら、より低レベルの抽象化を提供する。
伝えられるところによると、この高速開発において AI は非常に重要な役割を果たした。
設計段階では Codex と GPT-Astra を活用し、SIMD ユニットの面積を 8%、行列エンジンの面積を 10%削減した。
AI は各カーネルの作成も担当した。一部のモジュールでは、AI が生成したカーネルの性能が、人間の専門家が作成したカーネルよりも1.5~1.8 倍高速だった。
反復のスピードも驚異的だ。
8 日以内に、並列規模を TP8 から 1 ラック全体の TP32 へ拡張。2 週間も経たないうちに、一部のインタラクションレベルではスループットが 2 倍以上に向上した。
さらに、こんなおまけもある。OpenAI は Codex を使って『DOOM』をこのチップに移植し、36 FPS で動作させることに成功した。

皮肉なことに、NVIDIA GPU 上で動作する OpenAI のモデル GPT 5.6 Sol もまた、CUDA エコシステムの堀を脅かすこのチップの設計に関わっていた。
NVIDIA 自身の GPU が、潜在的な後継者の誕生を自ら後押ししているのだ。
SOTA レベルの社内 AI による支援も、OpenAI が別ルートから追い越しを実現した方法の一つなのかもしれない。
ハラペーニョはいつ登場するのか
では、このハラペーニョはいつ正式にリングへ上がるのか?
答えは、エンジニアリングサンプルがすでに完成している、だ。
量産は 2027 年から段階的に拡大される予定で、生産の大部分は 2027 年末に集中する。次の目標は 100MW 規模に達することだ。
ハラペーニョを搭載する単一ラックシステムの名称は Vindaloo。ハラペーニョチップを 128 個搭載し、Katsu CPU ホストラックと Chana スイッチラックを組み合わせる。2 つのラックを合わせた消費電力は約 160kW で、最大 16 ラック、2,048 チップによって 1 つの scale-up ドメインを構成できる。
導入は neocloud 事業者と協力して進め、まず信頼性データを収集したうえで、段階的に出荷規模を拡大する。
注目すべきは、OpenAI が現時点で、既存のすべてのチップ製品をハラペーニョに置き換えるつもりはないということだ。今後も NVIDIA などのコンピューティングパートナーとの協力を続ける。
しかし同時に、OpenAI は第 2 世代、第 3 世代のチップ開発も継続する。
One More Thing
とはいえ、このチリ軍団をうまく率いる人物が誰なのかは、いまだに謎のままだ。
先ほど明らかになった情報によると、OpenAI のデータセンター責任者 Chris Malone が先週退職した。

『ウォール・ストリート・ジャーナル』が 8 月 25 日にこの事実を最初に報じ、その後 Bloomberg が OpenAI の広報担当者を通じて確認した。Malone の退職後、後任は置かれておらず、関連する職務は複数の責任者に分担された。
Malone は 2025 年 3 月に OpenAI に入社した。これは同社が Oracle および SoftBank と Stargate プロジェクトを発表して間もない時期で、急速に拡大するコンピューティング需要に対応するデータセンターの建設を担当していた。
Stargate の立ち上がりは順調ではなかった。OpenAI は一時、クラウド事業者からチップを借りる方向に転じたが、最近になって自社構築を再開している。具体的には、チップを個別に借りるのではなく、施設全体を丸ごと借りる方式だ。ただし、関係者によると、チームを率いていたのは Malone ではないという。
Malone は今回の退職ラッシュにおける4 人目の幹部だ。
これまでに、最高収益責任者の Denise Dresser、最高執行責任者の Brad Lightcap、そして CEO Altman の側近である Fidji Simo も退社している。TheNextWeb の集計によると、4 月以降、すでに7 人の幹部が退任または異動している。
上場を数カ月後に控えた時期に、これほど相次いで C レベル幹部が退職するのは、IPO 前夜という基準で見ても異例だ。
ハラペーニョを引き継げる人が、もういないようだ……
それなら、黄さんに相談して、誰か助っ人を派遣してもらう?
(※冗談です)
参考リンク: