首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >OpenAI的Jalapeno落地:AI竞赛从"拼卡"进入"拼电费和时延"

OpenAI的Jalapeno落地:AI竞赛从"拼卡"进入"拼电费和时延"

作者头像
Henry Zhang
发布2026-07-21 12:48:38
发布2026-07-21 12:48:38
140
举报

题图摄于北加州太平洋海岸

当你在 Codex 里让智能体连续改十几个文件,进度条卡在第七步不动;或者让 ChatGPT 帮你读一堆材料,迟迟等不到第一个字——你感受到的,往往不只是“模型够不够聪明”,而是它背后的算力系统开始吃力了。

近日,OpenAI 与博通发布了一颗名为 Jalapeño 的芯片。消息出来后,很多人第一反应是:OpenAI 是不是要摆脱英伟达了?

我觉得这个问题问偏了。Jalapeño 并不是用来挑战训练 GPU 的通用加速器,它首先服务于大语言模型的推理:当用户向 ChatGPT、Codex 或 API 发出请求后,怎样更快、更稳定,也更省电地把答案送回来。

OpenAI 这次真正改变的,不是供应商名单,而是自己的角色:它正从“买卡大户”走向“算力系统的总设计师”。

为什么先做推理芯片?因为推理才是不会停的账单

训练和推理,花的是两笔完全不同的钱。训练大模型,像装修一套毛坯房:投入惊人,但大多集中在一个阶段。模型训练完成后,真正漫长的成本才开始显现——几百万、几千万用户每天都在“住”进这套房子,提问、生成、调用工具、运行代码,每一步都在消耗电、显存、网络和机房能力。

智能体把这笔账放大了。它不会只回答一句话,而是要读上下文、制订计划、调用工具、执行代码、检查结果,再决定下一步。一次任务拖得越长,系统就越像在持续运转一台小型工厂。

这里有个常被忽略的东西:KV 缓存。可以把它理解为模型在长对话中的“工作笔记”。上下文越长,这本笔记越厚,显存占用和数据搬运也越重。在一些常见部署配置中,长上下文的 KV 缓存甚至可能吃掉数 GB 显存,直接挤占并发请求的空间。

这也是为什么,长期对话和智能体场景越普及,显存带宽、网络调度和缓存管理越容易成为推理成本的瓶颈。模型会不会思考是一回事;能不能在大量用户同时使用时,持续、稳定、便宜地思考,是另一回事。

GPU 像一套万能工具箱:新模型、新算法、新任务都可以试,适合探索和训练。ASIC 则更像一把为固定工序订做的扳手:牺牲一部分通用性,换取重复、大规模负载下更低的时延与能耗。

GPU 负责探索,ASIC 负责把成熟负载做成可规模化的生意。

OpenAI 说,Jalapeño 围绕模型内核、内存数据搬运、网络和服务模式共同设计;工程样片已经在实验室以目标频率和功耗运行部分机器学习负载,计划在 2026 年底开始初步部署。

这当然是一个重要节点,但也要保持冷静。今天还没有独立第三方验证,无法断言它在真实在线服务中“性能超过”谁。实验室样片运行部分负载,和一个大规模集群同时处理混合用户请求,中间还隔着编译器、调度、网络抖动、故障恢复与运维稳定性。芯片跑得快,不等于产品就一定跑得稳。

芯片只是露出水面的部分,真正的竞争在“芯片下面”

如果只盯着 Jalapeño 的制程、峰值算力或跑分,很容易把一件系统工程看成一场芯片参数战。

OpenAI、博通与系统集成伙伴的分工已经说明了这一点:模型和真实服务负载、芯片与网络、板卡与机柜,并不是彼此独立的零部件,而是一套要共同调校的系统。芯片只是露出水面的部分;水面之下,还有编译器、推理框架、网络、调度、机柜、供电和散热。

模型是前台明星,后台决定它能否变成用户用得起、等得起的服务。

这也是英伟达的优势远不止一块 GPU 的原因。它卖出的并非单纯的计算芯片,还包括 CUDA 软件生态、通信库、网络方案、服务器设计、开发工具,以及无数工程团队已经跑熟的工作流。

GPU 的护城河,不在晶体管上,而在“把芯片变成生产力”的整条 AI 生产流水线。

定制芯片的价值,也早已有现实样本。AWS 公开资料称,第一代 Inferentia 在部分适配场景下,相比可比的云上实例可实现更高吞吐,并把单次推理成本显著压低;Google Cloud 对 TPU v5e 的说法则是,相比前代 TPU v4,推理每美元性能最高可提高 2.5 倍、时延最多可降低到原来的约六成。

这些都是厂商在特定基准和产品配置下给出的数据,不能简单照搬到所有模型和所有企业身上。但它们至少证明了一点:当芯片、模型、编译器和服务框架真正配合起来,专用化并不是“省一点电”的小优化,而可能改变一个服务能否以可接受成本扩张。

软件栈在这里决定成败。AWS 为 Inferentia 配套 Neuron 编译器、运行时和调试工具;Google 则把 XLA 编译器、JAX、PyTorch 与 TPU 服务体系绑在一起。真正困难的从来不是让一颗芯片点亮,而是让开发者几乎不用“重新学一门语言”,就能把模型迁移过去、稳定跑起来。

不少企业尝试切换第三方加速卡后,才发现单卡省下来的差价,很快被模型迁移、团队学习、调试排障和集群运维的成本吃掉。参数表很好看,不等于生产环境好用。

OpenAI、阿里、华为都在做芯片,但各自在解不同的题

海外巨头可以基于海量真实用户负载反向定制硬件;国内厂商则还要同时面对供给链、制程与生态约束。把 Jalapeño 与中国厂商最近的动作放在一起看,会发现它们看似都在“造芯”,起点却并不一样。

OpenAI 是从在线推理负载出发,倒推芯片应该如何设计。ChatGPT、Codex、API 和未来的智能体产品,已经让它积累了关于内存、网络、调度和用户等待时间的大量数据。它最关心的是:怎样把这些具体痛点写进硬件,长期压低推理成本、提升服务体验,同时减轻对单一供给链的依赖。

阿里的路径更接近“云优先”。5 月发布的平头哥真武 M890,以及后续 V900、J900 路线和集成 128 张加速器的磐久 AL128,瞄准的是云上大规模供给。阿里披露,真武系列累计出货已超过 56 万片,外部客户超过 400 家,覆盖汽车、金融等 20 个行业。这里真正要卖的,不只是芯片本身,而是企业能否稳定拿到训练、推理和智能体任务所需的算力服务。

华为更强调“系统优先”。它提出的 τ Scaling Law,通俗说,就是不再只靠把晶体管做得更小来提高性能,而是同时优化芯片内部的数据传输、器件、电路、软件和互联,让每一次数据移动少绕路、少等待。华为称,过去六年已基于这一思路设计并量产 381 款芯片。它的长期效果,最终仍要由可验证的产品性能和大规模集群表现来回答。

OpenAI 从真实负载反推硬件,阿里从云服务反推供给,华为从系统协同挖性能。

三条路线的共同点,是都不再把希望押在“一张更强的卡”上。对国内厂商来说,更迫切的命题是:怎样把“可用芯片”真正做成“好用、稳定、可维护的系统”。

全栈不等于全自研,跟风造芯反而可能把钱烧在错误的地方

正因为三条路线的起点完全不同,“自研芯片”绝不是一条谁都该复制的路径。看到 OpenAI、Google、亚马逊、Meta 都在布局定制芯片,很容易得出一个结论:以后所有 AI 公司都该自己造芯。这个结论恰恰最危险。

自研 ASIC 的门槛非常高。你必须先有足够大、足够稳定、足够可预测的负载,才能把芯片设计、流片、软件适配、服务器验证和长期运维的成本摊薄。对大多数创业公司和普通企业,直接使用 GPU、云上推理实例,或者组合不同算力平台,通常更理性。

Google 的 TPU、AWS 的 Inferentia 已经说明,定制芯片的价值不在于“我也有一颗”,而在于它能否与自家模型、云平台、软件栈和海量需求形成闭环。反过来,市场上也不缺纸面参数亮眼的加速器:芯片做出来了,软件栈却让开发者望而却步;模型迁移要反复改代码,调试工具不够,集群管理也不成熟。最后,算力只能停留在发布会和 PPT 里。

全栈能力,不是把每个零部件都攥在自己手里;而是清楚哪一层必须掌握,哪一层应该借助生态。

Jalapeño 自己也要经历这道考题。量产交付能否按节奏推进,工程样片能否变成稳定的服务器产品,和英伟达 GPU 组成混合集群后如何调度、如何监控、如何分配不同模型的任务,都会影响它最后能否兑现承诺。更别说,编译器、推理引擎和运行时的长期投入,不会随着第一批芯片交付就自动结束。

这并不是给 OpenAI 泼冷水,而是定制芯片必经的现实。造出芯片只是拿到了参赛资格;让它在真实用户负载下稳定、省钱地跑起来,才算真正交卷。

未来的分化会越来越明显。大厂会把模型能力向下延伸,进入芯片、网络、机房和能源效率;中小公司更应该把资源投向垂直场景、产品体验、工作流设计和客户数据。不是每个人都要去造发动机,但每个人都要知道,自己的产品到底烧不烧油。

真正的问题是:谁能把成本变成能力

Jalapeño 不会让 GPU 一夜之间失去价值。前沿训练、模型架构探索、多模态实验和大量复杂任务,仍然需要 GPU 的通用性与成熟生态。英伟达的优势,也不会因为几家巨头做 ASIC 就立刻瓦解。

但“只要买到足够多 GPU,就自然拥有 AI 竞争力”的时代,确实正在过去。

AI 上半场拼算力储备,下半场拼全栈工程效率。

我越来越觉得,AI 的下半场比的是一项更朴素的能力:谁能让同样的模型更快响应、更稳定运行、更少耗电,并把省下来的每一瓦电、每一毫秒等待和每一分钱成本,变成用户真正感受到的价格、体验与可靠性。

这件事最终改变的,也许不只是几家芯片公司的市场份额。它会决定长上下文能不能成为标配,智能体能不能更便宜地执行复杂任务,更多企业能不能用得起高质量模型服务。AI 要从少数公司的昂贵演示,变成真正的生产力基础设施,靠的并不只是更大参数,还要靠更高效的工程。

下次再看到一家厂商宣布“自研芯片”,我不会先问:它打不打得过英伟达?我会先问两个更实际的问题:

  • 它有没有足够大、足够稳定的真实负载,值得为此造一颗芯?
  • 它能不能把省下来的电费和等待时间,真正变成用户愿意持续使用的服务?

对 OpenAI 来说,Jalapeño 给出的答案,是开始把模型、产品与基础设施一起重做。对其他公司来说,答案还在路上。

GPU 不会消失。真正正在消失的,是“只要买到足够多 GPU,就自动拥有 AI 竞争力”的时代。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-19,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 亨利笔记 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 为什么先做推理芯片?因为推理才是不会停的账单
  • 芯片只是露出水面的部分,真正的竞争在“芯片下面”
  • OpenAI、阿里、华为都在做芯片,但各自在解不同的题
  • 全栈不等于全自研,跟风造芯反而可能把钱烧在错误的地方
  • 真正的问题是:谁能把成本变成能力
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档