OpenAI Jalapeno 推理芯片对比 NVIDIA GB300:架构、效率与量产挑战
OpenAI 首款定制推理芯片 Jalapeno 公布基准,对比 NVIDIA GB300,解析 HBM4 架构、数据移动优化与成本影响。
OpenAI 近日公布了其首款定制推理芯片 Jalapeno 的性能基准。在开源推理基准 InferenceX 的测试中,该芯片据称在速度和效率上均优于 NVIDIA 当前公开发布的代表性系统 GB300。本文基于公开采访信息,梳理其技术要点、设计取舍与行业影响。
#一、测试背景与核心结论
OpenAI 硬件副总裁 Richard Ho 表示,团队选择 InferenceX 作为测试基准,是因为它属于中立且开源的方法。与常见的宣传口径不同,这次公布的对比对象并非 NVIDIA 最新量产系统 Vera Rubin,而是已发布且经过充分优化的 GB300 数据。OpenAI 解释,这主要是考虑数据的可得性与可比性:GB300 已有成熟公开成绩,而 Vera Rubin 刚发布不久,尚未形成可比的优化数据。
从结果看,Jalapeno 的主要特性是在同一设备上同时实现高吞吐量与低延迟。OpenAI 称这是行业首次。高吞吐量意味着可以用更低的单位成本服务更多用户和 token;低延迟则直接改善响应速度,使智能体类任务返回更快,并适用于高频编码等场景。
#二、架构设计:HBM4 与数据移动优化
Jalapeno 采用 HBM4 高带宽内存,是首批进入量产的 HBM4 产品之一,时间上紧随 NVIDIA 相关产品。其设计思路被描述为“白纸式”:OpenAI 硬件团队与内部研究团队协作,识别大语言模型推理中的主要瓶颈,尤其关注数据移动。与通用 GPU 或 TPU 等架构不同,Jalapeno 在内存与计算核心之间构建了更紧密的集成关系,通过减少数据搬运和算法优化来实现更低延迟。这种设计也被 OpenAI 称为“新颖架构”,并强调目前尚无其他厂商采用相同方式。
#三、为何专注推理而非训练
Richard Ho 解释,OpenAI 对计算资源的需求巨大,但增长主要集中在推理侧。训练端仍有 NVIDIA 等强大合作伙伴提供芯片,因此自研硅项目优先聚焦于推理芯片,以扩充 OpenAI 可用的推理算力。随着用户规模快速扩大,推理侧需要更多样化的产品组合。Jalapeno 加入后,将与合作伙伴提供的其他芯片一起构成 OpenAI 的推理算力池。
#四、全栈控制与可编程性
定制硅的关键优势在于全栈控制:从模型、软件到硅片层面都可以进行联合优化。OpenAI 认为,作为前沿 AI 实验室,这种端到端的控制能力是其独有优势,开发者可以在不同环节作出权衡,从而获得单靠采购外部芯片难以实现的效率。
新型架构常伴随软件生态适配的担忧。OpenAI 表示,在收到芯片仅数月后,其团队就将三种差异较大的模型跑通到新硬件上,这反映出编程模型对开发者相对友好,也表明其 AI 模型在优化固件与内核方面已具备一定自动化能力。
#五、成本与量产:每瓦性能与供应链瓶颈
在每 token 成本方面,OpenAI 没有提供绝对值,但表示性能每瓦是 token 成本的良好代理指标。Jalapeno 的每瓦性能目前约为其他现有芯片的 1.8 至 4 倍。OpenAI 预计,随着该芯片进入生产部署,客户 token 价格有望下降。
量产挑战同样存在:HBM 内存和晶圆供应均高度受限。OpenAI 依赖 Broadcom 进行物理设计、Celestica 负责系统与机架,同时与多家供应链厂商保持直接合作,以提升产能。Richard Ho 还透露,Jalapeno 是多代路线图的一部分,第二代产品已进入深度开发,第三代已开始概念研究。
#六、行业观察
MSX 作为关注多资产对比与交易体验的平台,同样重视底层算力效率对交易基础设施的潜在提升。更低推理成本和更快响应,可能推动更灵敏的行情处理与更优的撮合体验。OpenAI 这类前沿 AI 公司在推理芯片上的探索,值得行业持续关注。