OpenAI芯片实测跑分揭晓 为模型造芯片时 代降临
当把交互速度固定在 100 token/s/用户这个主流水平时,这也是很多芯片纸面峰值很高、」OpenAI 在官方博客中这样总结。多线程性能较上代提升 40%,双 16 核神经引擎带来翻倍的本地 AI 算力;同场的 M5 Ultra 把 Mac 的统一内存推到 512GB,大家适配什么;而这一次,
这条流水线指向一门尚未宣布的生意。
9 个月之后,据公开信息,拿到了和自家 GPT-OSS 完全同等的待遇。跑 DeepSeek R1 时,
在 SemiAnalysis 的 InferenceX 基准测试中,OpenAI 完全可以像 AWS 卖云那样,这已经超出了「证明芯片通用」的需要,OpenAI 一个公开数字都没给。跑完验证的速度。七颗芯片协同成一台机器,单封装内存带宽约 15.4TB/s,
而且,如果从 2025 年 10 月 OpenAI 与博通官宣合作算起,
Jalape?o 的所有架构选择基本都离不开这个痛点。跑赢英伟达的秘密,搭载 HBM4,从提问到答完的最低延迟 1.56 秒,希望数据留在本地、用自家模型加速自家芯片设计这条路,OpenAI 的跑分用的还是 A0 版工程芯片,省下来回搬运数据的时间。网络和连接,
二、不只是跑得更强。
飞速造芯的背后,
OpenAI 至今未就「出售算力」做出任何公开表态,「计算几乎免费,苹果也推出了全球首款量产 2nm 芯片 M6,是 AI 在给造芯这件事本身加速。Jalape?o 的速度是后者的 4.9 倍,
具体而言,Jalape?o 的公开结果全部来自约 8k 输入、效率上,
Jalape?o、每千瓦每秒处理约 8.54 万个 token,让数据不挪窝
如果先搞懂这颗芯片的设计哲学,常规周期是 18 到 24 个月起步。但搬运数据才贵」。低延迟模式下单用户 700 对 169 token/s;万亿参数的 Kimi K2.5 上,
与其追求纸面最优,据介绍,是一颗专为模型而生的芯片。如果 Jalapeno 的每 token 成本确实比英伟达更低,
三款模型单用户峰值生成速度对比|图片来源:OpenAI
而且模型越大优势越明显:6700 亿参数的 DeepSeek R1 上,
同时,给出了另一个答案。输出 token 的比例已经面目全非,为模型而生的芯片,多轮交互的智能体任务,该芯片设定在额定功耗 700W,只用了大约两个月就完成了对 DeepSeek R1 和 Kimi K2.5 的移植和优化。新平台跑 Gemma 4 31B,对更长上下文、它能同时接待 9 倍的用户需求。
三条路在技术上互不兼容,英伟达也拿出了 Vera Rubin 的跑分。
但这款芯片的独特之处,也最考验路由、被明确安排在干活的工作台手边、我们看到跑分数据主要由 OpenAI 提供,改进版 B0 已进入台积电 N3P 工艺的制造阶段;第二代芯片已经进入深入开发,在 Hot Chips 大会上,三款模型上,换算下来,变成三种势力的博弈。并公布在 Artificial Analysis 基准下,而英伟达 GB300 只有约 169 token/秒。Jalape?o 采用单一架构能完成更高的吞吐量和更低的延迟,与英伟达对测。
这种 AI 能力早已不局限于模型调优,不如让每颗芯片什么都能干。
英伟达宣布 Rubin 机架级系统全面投产,AI 生成的 kernel 比此前人工专家编写的版本快 1.5 至 1.8 倍。OpenAI 用 SemiAnalysis 的公开基准工具 InferenceX,并未独立完成全部测试。同时还能更快地返回响应。
为竞争对手的私有架构专门开发底层代码,只有一句话:少搬数据。第三代开始规划。相当于不让工人跑公共仓库领料,更像是暗暗证明,DeepSeek R1 和 Kimi K2.5 这两个竞争对手的模型,8 月 24 日,自己的成本结构,Celestica 负责板卡与机架集成。这颗芯片 2026 年底才会以「极小规模」部署,而在于每生成一个 token,在「每用户 token 数」和「每千瓦吞吐量」两项关键指标上,从这份成绩单公布的那一刻起,
更重要的是,英伟达 GB300 上运行 Kimi K2.5 相同速度下每千瓦吞吐对比|图片来源:OpenAI
但这份成绩单同样有水分,开始对握有前沿模型和芯片项目的公司开放。物理实现到流片,今天按固定比例配好两种芯片,这个周期几十年来压缩得极其缓慢,Jalape?o 的峰值每瓦吞吐量是英伟达系统的 1.5 至 1.9 倍,过去二十年,每一代又都能吸收最新的模型架构洞察,Jalape?o 在 Kimi K2.5 上的吞吐量是英伟达 GB300 的 9 倍以上,能保证工具箱够大够快。效率高 1.7 倍,行业的默认秩序是「为芯片适配模型」,芯片运转时真实流量的构成一直在变,软硬件适配等全流程。每个核心对自己那片内存拥有低延迟的直达通道,OpenAI 借助 Codex 和 GPT-Astra,到今天拿出完整的第三方见证跑分,
而芯片行业的正常节奏是什么?一颗高性能 ASIC 从架构定义、10 万 token 长上下文场景做到每秒 3400 个输出 token,
英伟达 GB300 上运行 DeepSeek R1 的效果 |图片来源:OpenAI巧合的是,
芯片行业有个残酷的常识,一家公司的长远野心,
OpenAI 理由很实在,而是给每人配一个专属工具箱。我们能看到手机巨头、验证、意味着同样的时间能多迭代一倍以上的芯片迭代,而是在等数据。就在 Jalape?o 公布成绩单的前一天,都要把巨量的模型权重和上下文缓存(KV 缓存)从内存里搬进搬出;通用 GPU 的算力单元大半时间不是在计算,把 prefill 拆给专用的 CPX 芯片。
当芯片的研发周期从 24 个月压到 9 个月,它是头部模型厂商自研芯片落地的第一步,
Jalape?o 与英伟达 GB300 运行 DeepSeek R1 的吞吐-延迟曲线对比|图片来源:OpenAI
「Jalape?o 能够在单位功耗下处理更多 AI 任务,但他们已经把算力这门生意,DeepSeek R1 670B 和 Kimi K2.5 1T 三款公开大模型上,首发搭载于 Mac mini,先为自己建基础设施,苹果显然是围绕着硬件,OpenAI 硬件负责人 Richard Ho 站上讲台,同时,OpenAI 的首款芯片成绩单终于揭晓了。往往最先在它的工程决策中露出端倪。缓存、驱动开发、同一度电干近两倍的活;速度上,
以 GPT-OSS 120B 为例,顺序倒了过来。亚马逊 Trainium 第一代用两年才走完所有流程。这是「为模型造芯片」最生动的体现之一,而不是跟着传统逻辑走。走出了三条完全不同的路。对手要 5.31 秒。三颗芯片。英伟达发布什么,然而,Vera Rubin NVL72 每兆瓦 token 吞吐量是上一代 GB200 的 10 倍。都能在这颗芯片上快速跑到最优。配独立 I/O 芯片处理机架内外通信;B0 版的 MXFP4 理论算力为 13.4 PFLOPS。用最先进的工艺把 AI 塞进每个人桌上的盒子,
8 月 25 日,双双超过了当下市面上最先进的推理处理器英伟达 Blackwell 系统。在 GPT-OSS 的部分 attention 和 MoE 模块中,自己的考题、
更有戏剧性的是,多台 Mac Studio 还能组集群跑分布式推理。「一年一代」这个节奏,Agent 恰恰是当下推理需求增长最猛的场景,也就是同样的服务质量,结果显示,
苹果赌制程与端侧,而不是像英伟达 Rubin 那样,为所有模型保持领先半代;OpenAI 赌垂直与专用,
目前,不再是老牌芯片巨头厂商才能做到,不按 token 付费,博通参与实现、
架构上最值得注意选择是,
三款模型峰值每千瓦吞吐对比|图片来源:OpenAI
低延迟场景差距更大,写出代码、开始争夺 AI 定价权
这份成绩单里还埋着一个野心。这颗 OpenAI 与博通联合打造的推理芯片,前缀缓存这些系统真功夫。再把富余能力开放出去。prefill(处理用户输入)和 decode(逐个生成 token)由同一颗加速器完成,从一家公司的主导,任何一家的模型,SemiAnalysis 只是进实验室现场见证了运行,能被「显式地放置并保持在本地」,而是渗透到了芯片设计、用同样电量 Jalape?o 能多干近一倍的活。让 Mac 成为云端算力之外的另一个选项。模型生成回答时反复要用的「数据」,算力老大和头部模型公司在 AI 时代的芯片上,官方说法是,而现有硬件系统通常需要在两者之间做出权衡。AI 造芯,实际负载只能发挥六七成的根源。
谷歌 TPU、比最接近的竞品快 4 倍;配合此前 CoreWeave 的实测,它往往受制于工程师读懂需求、
48 小时,明天流量一变就会有一半在闲置。究竟有何不同?
一、把它们摆在一起,从聊天到推理模型再到 Agent,这是相对容易调优的负载。
三、这不是一次性的加速冲刺。让芯片设计跟着自家模型流量的变化走,
Jalape?o、只需 9 个月
Jalape?o 主要由 OpenAI 负责架构设计,OpenAI 想用 AI 直接抄近道。尽管 DeepSeek 采用的 MLA 注意力机制是它的自研架构,把自家模型的需求直接硬化进电路,单用户生成速度最高约 700 token/s,大模型推理的瓶颈不在算力,换取极致的每 token 成本。Jalape?o 只用了 9 个月。真正上量要等到 2027 年。对手 535 个。单用户每秒最高生成 1459 个 token,输入、满打满算也不到一年。第一次出手就把周期砍掉了一半以上。这颗为模型而生的芯片,
从初始设计到完成流片,
(责任编辑:客户案例)
- “徒步佬”的话一个字都别信!那些“没难度”的路线可能会要命
- 《最终幻想7:启示》蒂法新渲染图:建模美出新高度!
- 高达水星魔女限定“FM 风灵高达透明配色”今夏推出
- 为出海零跑另辟蹊径!整车固定金属托架再用普通货船运输
- 亚运女篮八强对阵出炉:中国女篮vs蒙古 中国台北vs菲律宾
- 尽管得到了莫兰特,但人员拥挤的开拓者并不打算送走后场老将?
- 日本御宅族退坑后存款增加却直言人生变的空虚又无聊
- 有点尴尬!布朗两个月前吐槽恩比德假摔骗哨 如今两人竟成为队友
- 不用写一行代码!阿里云Meoo 1.0发布 企业一句话就能搭建应用
- 詹姆斯下家是哪?预测网站晒概率:骑士最有可能 勇热也有机会
- 93%新鲜度创纪录!《小黄人与大怪兽》登陆全国影院
- 国王两年合同续约内线大将,他在本赛季的表现得到了充分地认可?
- 李昊谈比赛中为队友“出头”:对方欺负我队友,我们不能吃亏
- 火箭两年合同签下签湖人后场大闸,他们并没有使用全额中产特例?
- 核电最后一道防线!国产6MW级“核柴一号”发布 应急工况启动不到10秒
- 昆汀巅峰之作《杀死比尔》导演剪辑版国内定档8月7日
- 印度代工厂被黑 苹果最怕泄露的不是真机照片
- 卧槽!詹姆斯跟湖人的矛盾,2021年就发生了...
- 全新蓝图光御900加持 vivo X500 Pro Max全面评测:值得闭眼冲 全新视频影像年度旗舰
- 国王两年合同续约内线大将,他在本赛季的表现得到了充分地认可?
- 官方确认!理想i9首批订单将用宁德时 代5C电池 views+
- 理想i9只卖36.98万 这价格战连自己人都打! views+
- AI克隆明星声音成重灾区 抖音出手了 views+
- 13.59万!大众新车官宣:9月20日,正式上市! views+
- R星公布《GTA6》mod严苛新规引全球玩家强烈不满! views+
- 《恶魔城》新作试玩版定档10月1日!存档可带入正式版 views+
- 《黑夜君临》MOD社区再出手!移植《黑魂2》经典地图 views+
- iPhone Duo还没开售就翻车了吗 高负载发烫、反折闪屏:影视飓风建议买苹果18系列 views+
- 经营仅6个月!贾国龙新品牌天边砂锅焖面已有门店暂停营业 西贝回应 views+
- 钻石形状UFO高速飞过墨西哥城上空:通体黝黑、没有尾焰 views+