OpenAI独自チップJalapeño、推論性能を初公開 ChatGPTは速くなるか

- OpenAIは独自推論チップJalapeñoの初期結果を公開し、3つの公開モデルで比較対象よりワット当たり1.5~1.9倍の処理量を示した
- エンドツーエンドの遅延は1.7~3.6倍低いとするが、測定はOpenAIが自ら実施しており、ChatGPTやAPIの価格改定は発表されていない
- 企業は応答時間、エージェントの完了時間、成功1件当たりの費用、混雑時の安定性を今から記録すれば、導入後の差を自社の数字で判断できる
6月の発表から2カ月、動くチップの数字が出た
OpenAIは2026年8月25日、同社初の独自推論チップ「Jalapeño」の初期性能を公開しました。Jalapeñoは6月24日にBroadcomと共同発表された半導体で、ChatGPTやCodex、APIなどの回答を生成する推論処理に合わせて設計されています。今回の新しさは、構想や試作品の紹介から進み、公開モデルを使った実測値が出たことです。
OpenAIは、GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1TをSemiAnalysisの公開ベンチマーク「InferenceX」で測定しました。3モデルを通じ、ピーク時のワット当たり処理量は比較対象の1.5~1.9倍、回答全体にかかる遅延は1.7~3.6倍低かったと説明しています。対話性を重視した条件では2.1~4.1倍の性能差を報告しました。
Jalapeñoは3つの公開モデルで、比較対象よりワット当たり1.5~1.9倍多く処理し、エンドツーエンドの遅延を1.7~3.6倍に短縮した。
出典:OpenAI・Jalapeño初期性能報告を要約
最高速度だけでなく、電力と待ち時間を同時に競う
生成AIの推論には、入力を読み込むprefillと、回答を1語ずつ出すdecodeがあります。前者は計算能力、後者はメモリー帯域の影響を受けやすく、複数チップ間でデータを動かす時間も遅延を増やします。Jalapeñoはチップ、メモリー、ネットワーク、ソフトウェアを一体で設計し、回答中に使うKVキャッシュを近くへ置いてデータ移動を減らす構成です。
定格電力は700ワットですが、OpenAIによると今回の処理で持続的に使った電力は550ワット以下でした。GPT-OSS 120BではNVIDIA GB200、DeepSeek R1とKimi K2.5ではGB300を比較対象にし、公開されたチップ電力を使ってワット当たり性能を正規化しています。これはOpenAIの測定結果であり、すべてのモデル、入力長、データセンターで同じ差が出るという保証ではありません。
| 公開モデル | ピーク時の処理量/電力 | 回答全体の遅延 | 比較対象 |
|---|---|---|---|
| GPT-OSS 120B | 約1.9倍 | 約1.7倍低い | NVIDIA GB200 |
| DeepSeek R1 670B | 約1.7倍 | 約3.6倍低い | NVIDIA GB300 |
| Kimi K2.5 1T | 約1.5倍 | 約3.4倍低い | NVIDIA GB300 |
ChatGPTとCodexでは、長い仕事の待ち時間に効く
利用者が半導体を直接選ぶ場面は多くありません。それでも推論基盤の効率が上がれば、ChatGPTの返答、Codexが複数工程を進める時間、APIの混雑時に処理できる件数へ影響します。とくにエージェントは調査、判断、ツール操作、再確認を順番に繰り返すため、1回ごとの小さな遅れが仕事全体では大きく積み上がります。
OpenAIは、Jalapeñoを今後数カ月で拡大し、より高速で効率的な製品を提供するとしています。ただし、どのChatGPTプランやAPIモデルへ先に使うか、料金をいつ下げるか、日本の利用者がいつ違いを体感できるかは発表していません。チップの電力効率が改善しても、浮いた費用がそのまま値下げになるとは限らず、まずは応答速度や利用可能量、混雑時の安定性へ回る可能性があります。
推論の改善は、ChatGPTの応答、Codexが待ち時間を減らして進められる工程数、APIを構築する費用、需要増加時の安定性へ表れる。
出典:OpenAI・Jalapeño発表を要約
独自チップはNVIDIA離れより、選べる推論基盤を増やす動き
Jalapeñoは学習用の万能GPUではなく、現代のLLM推論を主目的にした専用アクセラレーターです。そのため、今回の結果だけでOpenAIがNVIDIAを不要にしたとは読めません。新しい大規模モデルの学習、既存の幅広いソフトウェア資産、短期間で計算資源を増やす場面では、汎用性の高いGPUが引き続き重要です。
一方で、利用量が読める推論を自社設計へ移せれば、OpenAIはモデル、サービングソフト、チップ、ネットワークを同じ目的で調整できます。編集部は、生成AIの競争が「最も賢いモデル」だけでなく、「同じ電力と時間で何件の仕事を終えられるか」へ広がったとみます。Jalapeñoが予定どおり大規模導入されれば、半導体メーカーから買う計算能力へ依存するだけだったAI会社が、サービス原価と体験を自ら設計する余地が増えます。
Broadcomはシリコン実装とネットワーク、Celesticaはボードやラックの統合を担います。OpenAIは設計から製造用データを確定するテープアウトまで9カ月で進め、AIモデルも設計と検証に使ったと説明しました。独自化とは一社ですべてを作ることではなく、製造・通信・ラックの専門企業と組みながら、モデル会社が設計の主導権を持つ形です。
Jalapeñoは2026年末までの初期導入を目指す複数世代の計算基盤で、Broadcomの半導体・通信技術とCelesticaのシステム統合を組み合わせる。
出典:Broadcom・OpenAI共同発表を要約
企業導入の判断軸は、仕事1件の完了コストへ
Jalapeñoの導入後にChatGPTやAPIを評価するなら、単発の返答速度だけでは足りません。代表業務を一つ決め、開始から完了までの時間、途中で止まった回数、人が直した時間、入力と出力を合わせた費用を記録します。エージェントでは速さが上がっても再試行が増えれば、仕事全体の費用は下がらないためです。
| 測る指標 | 確認したい変化 | 判断の注意点 |
|---|---|---|
| 初回応答と完了時間 | 返答だけでなく仕事全体が速いか | 同じ指示とデータで比較 |
| 成功1件当たりのAPI費用 | 再試行を含めて安くなったか | 公表単価だけで決めない |
| 混雑時の失敗・待機 | 利用集中時も安定するか | 平常時と繁忙時を分ける |
| 人の修正時間 | 高速化が品質低下を伴わないか | 正解を判定できる業務で測る |
初期導入は2026年末の予定で、製品別の提供時期と料金効果は未確認です。それでも、会社が今できる準備はあります。現在使っているChatGPTやAPIの応答時間、エージェントの完了時間、成功1件当たりの費用を基準値として残しておけば、Jalapeño導入後の改善を広告文句ではなく自社の数字で判断できます。年末までに大規模運用や製品別の条件が示されなければ、当面は有望な実測結果にとどまり、利用者の選び方は変わりません。
※ 本記事は公開時点の一次情報にもとづいています。最新の状況は出典をご確認ください。
AI検索・LLMO対策
月額5万円で、AIに引用される会社へ
AIの進化が速いほど、自社の情報がAIにどう読まれるかも変わります。ChatGPTやGoogleのAI検索で正しく引用される状態を、AIMAが月額5万円でつくります。相談はチャットで回数の制限なし。記事・FAQの制作から公開・保守まで、本数・回数の上限なし。最低契約期間はありません。
監修者:水間 雄紀
株式会社AIMA 代表取締役
1986年和歌山県生まれ、近畿大学卒。金融機関、経営コンサルティング会社を経て、2018年にコンテンツ制作の専門会社である株式会社circlizeを創業。2024年、ラグザス株式会社に事業譲渡。現在は株式会社AIMAにてAI×マーケティング事業に従事し、株式会社ラグザス・クリエイトでコンテンツの品質管理責任者を務める。
監修者・運営会社について