IT之家8月25日消息,OpenAI今晚在Hot Chips大会上公布了全新推理系统Jalapeño的更多细节,并首次披露基准测试成绩。该系统由OpenAI与博通共同开发,OpenAI自有模型也参与了研发。
在SemiAnalysis的InferenceX测试中,Jalapeño在单用户token处理量和每千瓦吞吐量上均超过市面顶尖推理处理器。与英伟达GB200和GB300超级芯片系统对比,在GPT-OSS 120B、DeepSeek R1和Kimi K2.5 1T三个模型上,Jalapeño每瓦完成的AI工作量是对比系统的1.5至1.9倍,端到端延迟约为对比系统的28%至59%。
Jalapeño主要负责AI推理,重点降低预填充和通信阶段的延迟。其设计从源头减少数据搬运,KV缓存等模型状态可保留在本地,并根据推理阶段调配计算、内存和网络资源。OpenAI硬件负责人理查德·何表示,Jalapeño能用相同电力处理更多AI工作负载,同时保持低延迟。
据IT之家了解,OpenAI计划今年年底前小规模部署Jalapeño,2027年逐步扩大部署量,但未公布明年具体投入芯片数量。
