黄仁勋万字演讲精华:AI计算需求暴增100万倍背后的万亿美元蓝图

导语:黄仁勋在GTC 2026抛出1万亿美元AI需求预测,深度解读AI从生成式到自主智能体的范式转换。

从ChatGPT到Agentic AI:三次关键拐点引爆百万倍计算需求

在演讲中,黄仁勋将过去两年的AI进展归纳为三次关键拐点,每一次都根本性地改变了计算需求的结构。

第一次拐点:ChatGPT与生成式AI。计算从‘检索式’变为‘生成式’,核心需求是大规模预训练,GPU主要服务于训练负载。

第二次拐点:推理能力的涌现。以OpenAI O1、O3为代表的推理模型使AI具备了反思、规划、分解和事实校验能力。黄仁勋明确表示:‘O1让生成式AI变得可信赖、以事实为基础。’这一阶段戏剧性地增加了输入和输出Token的需求量,因为AI不再只是一问一答,而是要‘思考’。

第三次拐点:Agentic AI的到来。黄仁勋将Claude Code称为‘第一个真正的智能体模型’,它能读取文件、编写代码、编译、测试、评估、迭代。他直言:‘Claude Code已经革命性地改变了软件工程。NVIDIA 100%的员工都在使用Claude Code、Codex和Cursor的某种组合……今天没有一个软件工程师不被一个或多个AI智能体辅助。’

这三次拐点的叠加效应是爆炸性的。黄仁勋给出了一个惊人的数据框架:每个任务的计算需求增长了约10,000倍,用户使用量增长了约100倍,两者相乘,过去两年AI的计算需求增长了约100万倍

从投资角度看,这个框架的核心含义是:AI不再是一个‘训练完模型就结束’的一次性支出,而是变成了持续的、按Token计量的运营性支出。每一次AI‘思考’、‘行动’、‘验证’都在消耗推理算力。这从根本上改变了AI基础设施的商业模型,从CapEx驱动转向CapEx+OpEx的双轮驱动。

Vera Rubin:推理时代的超级计算机,解耦架构重塑计算格局

如果说三次拐点定义了‘为什么’,Vera Rubin平台就是NVIDIA给出的‘怎么做’的答案。

七款芯片,五种机架,一台超级计算机

Vera Rubin平台的核心设计哲学是解耦推理(disaggregated inference),即将AI推理的过程拆分为不同阶段,由专门优化的硬件分别处理。这是一次从‘GPU包打天下’到‘异构专用计算’的架构范式转换。

五种机架级系统对应不同的功能模块:NVL72 GPU机架(72个Rubin GPU + 36个Vera CPU)、Vera CPU机架(256个液冷CPU,支撑22,500+并发CPU环境)、STX存储机架、SPX以太网机架、以及LPX推理加速机架。

解耦推理:解决‘吞吐量vs延迟’的结构性矛盾

黄仁勋将高吞吐量和低延迟定义为推理场景中‘互为死敌’的两个需求。Vera Rubin的解决方案是通过Dynamo软件将推理流程拆解:

  • 高吞吐量、延迟不敏感的部分(如Token生成的主体)由Vera Rubin GPU集群处理。
  • 延迟敏感、需要快速交互的部分由GB3 LPU(低精度推理单元)处理。

两者通过以太网连接,NVIDIA为此开发了专用的低延迟模式,将互联延迟降低了约一半。最终效果在最高价值的推理层级上实现了35倍的吞吐量提升

这种架构意味着打破了‘买更多GPU’的线性扩展逻辑,转向了更精细的异构计算资源配置。黄仁勋建议的配比是75% Vera Rubin + 25% GB3 LPU,适用于需要高速编码和工程Token的工作负载。

GB3/Groq的战略定位

NVIDIA对Groq技术的整合是此次发布的一个关键看点。NVIDIA在2025年底以约200亿美元获取了Groq的技术授权和核心团队。GB3 LPU是一种‘静态编译、编译器调度’的确定性处理器,与GPU的动态执行模型形成互补。

GB3 LP30芯片由三星独家代工,已进入量产,预计2026年Q3出货。这一点对供应链格局有深远影响:在Vera Rubin架构中,三星不仅供应HBM和DRAM,还独占了LPU的代工业务,其在NVIDIA供应链中的价值权重显著上升。

Token经济学:AI工厂的商业模型

黄仁勋将Token分为五个不同价值的层级:

  • 第一层:简单聊天机器人Token
  • 第二层:推理Token(如数学、编程)
  • 第三层:Agentic Token(自主行动)
  • 第四层:物理AI Token(机器人、自动驾驶)
  • 第五层:科学发现Token(药物、材料)

他举了一个例子:一个研究人员每天使用5,000万个Token,按150美元/百万计算,成本不过几千美元,‘这甚至不算什么’。关键的商业洞察是:Blackwell产生的收入是Hopper的5倍,而Vera Rubin产生的收入又是Blackwell的5倍。在一个1GW的AI工厂中,两年内Token产量从200万增长到7亿,实现350倍的增长

SemiAnalysis的独立基准测试显示,从Hopper H200到Grace Blackwell NVLink 72,每瓦Token性能提升了35倍(SemiAnalysis创始人Dylan Patel表示‘黄仁勋太保守了,实际上是50倍’)。这远超摩尔定律预测的1.5倍。

黄仁勋还特别强调了软件优化的价值:仅通过软件更新,Fireworks和Linx等推理服务商的Token速度就从约700 tokens/秒提升到了近5,000 tokens/秒。同样的硬件,7倍的性能提升。这意味着NVIDIA GPU的‘有效使用寿命’在持续延长,老一代硬件的云端定价甚至在上涨。

OpenClaw与NemoClaw:Agentic AI的‘Linux时刻’

如果说新一代的Vera Rubin是硬件层的革命,OpenClaw则可以说是软件层的范式转换。

OpenClaw:史上增长最快的开源项目

黄仁勋在演讲中多次提及OpenClaw,将其称为‘人类历史上最受欢迎的开源项目……几周之内就超过了Linux 30年的成就’。OpenClaw本质上是一个智能体计算机的操作系统,负责管理资源、访问工具和文件系统、调用LLM、执行调度和定时任务、将提示分解为步骤、生成子智能体、处理多模态输入输出。

黄仁勋的类比极具战略暗示:‘正如Windows使个人电脑成为可能,OpenClaw使个人智能体成为可能。’他将OpenClaw与Linux、HTTP/HTML、Kubernetes相提并论:‘这和HTML一样重要。这和Linux一样重要。’

他向在场所有企业发出了一个直接的战略挑战:‘每一家公司、每一家软件公司、每一家技术公司,问题就是:你的OpenClaw战略是什么?’

NemoClaw:企业级安全层

OpenClaw的快速普及也带来了一个核心问题:企业安全。黄仁勋明确指出:‘智能体系统在企业网络中可以访问敏感信息、执行代码、进行外部通信。’这是一个全新的安全范式,不同于传统的网络安全或应用安全,智能体的安全需要对AI的自主行为进行策略约束。

NVIDIA的应对方案是NemoClaw,即OpenClaw的企业级参考实现,核心组件包括:

  • 身份与访问管理(IAM)集成
  • 智能体行为审计与监控
  • 权限最小化执行
  • 敏感数据过滤与脱敏

这个方案已获得头部企业SaaS公司集成:Adobe、Atlassian、Box、Cadence、思科、CrowdStrike、达索系统、IQVIA、红帽、Salesforce、SAP、ServiceNow、西门子、Synopsys等。

从SaaS到AGS的转型预言

黄仁勋做出了一个对企业IT行业影响深远的预判:‘每一家SaaS公司都将变成AGS公司’(Agentic as a Service)。企业IT将从‘为人类提供工具’转型为‘管理专业化智能体’。

这意味着Token正在成为一种新的企业资源,如同云计算时代的计算单元,如同SaaS时代的License数量。对于企业SaaS投资者而言,这是一个需要重新评估估值模型的信号。

开源模型联盟与垂直行业布局:从手术室到太空的全面渗透

NVIDIA宣布成立Nemotron Coalition,联合全球AI实验室在NVIDIA DGX Cloud上共同开发开源前沿模型。首批成员包括:Black Forest Labs、Cursor、LangChain、Mistral AI、Perplexity、Reflection AI、Sarvam以及由前OpenAI高管Mira Murati领导的Thinking Machines Lab。

第一个联合开发的模型将由Mistral AI与NVIDIA共同完成,作为Nemotron 4系列的基础。黄仁勋表示:‘开源模型是创新的命脉,是全球参与AI革命的引擎。’

六大开源模型家族覆盖了AI的完整应用谱系:

  • Nemotron Nano:端侧与边缘设备
  • Nemotron Super:单GPU工作站
  • Nemotron Ultra:多GPU服务器
  • Nemotron-4:数据中心级基础模型
  • Cosmos:世界模型与物理AI
  • Isaac:机器人技能模型

这一开源策略具有双重的战略意图:一方面培育开发者生态以驱动NVIDIA硬件需求;另一方面将NVIDIA定位为中立平台提供商,而非与构建在其芯片上的AI实验室/企业进行竞争。

垂直行业布局:

  • 制药与生物科技:罗氏部署超过3,500个Blackwell GPU用于药物发现和制造数字孪生。基因泰克近90%的小分子项目已整合AI,一个肿瘤学分子设计速度提高25%,备选候选药物从两年多缩短到七个月。
  • 自动驾驶:比亚迪、吉利、五十铃和日产正基于NVIDIA Drive Hyperion构建L4级自动驾驶。与优步合作扩展至2028年在28个城市部署自动驾驶车辆。黄仁勋宣称:‘自动驾驶的ChatGPT时刻已经到来。’
  • 医疗机器人:发布了首个医疗机器人专用物理AI平台,核心是Open-H数据集(超过700小时手术视频)。CMR Surgical、强生医疗和美敦力为首批采用者。
  • 太空计算:Vera Rubin太空模块提供比H100多25倍的轨道AI推理算力。Aetherflux、Axiom Space等公司正基于此构建。
  • 桌面超级计算机:DGX Station搭载GB300 Grace Blackwell Ultra Desktop Superchip,748GB一致性内存,20 petaflops AI算力,可在桌面运行万亿参数模型,支持受监管行业隔离配置。

还有一个精心编排的舞台时刻:迪士尼的物理机器人Olaf(《冰雪奇缘》角色)走上舞台,由Jetson驱动、在Omniverse中训练、使用Newton物理求解器(与迪士尼研究院和DeepMind共同开发),与黄仁勋进行即兴对话。黄仁勋说:‘想象一下?这就是迪士尼乐园的未来。所有这些角色在你身边走来走去。’

共封装光学(CPO):AI扩展的物理基石,从边缘走向核心

在Vera Rubin平台的七芯五架构叙事中,有一项技术被反复提及却容易被非专业背景人士忽略:共封装光学(Co-Packaged Optics, CPO)。从NVIDIA的路线图来看,CPO可能是决定未来AI超算能否继续扩展的最关键瓶颈技术。

黄仁勋的三次递进

CPO在演讲中出现了三次,每一次的战略权重都在升级:

  • 第一次作为Vera Rubin平台概述的一部分:‘通过Spectrum-X共封装光学实现横向扩展,提升能效和弹性。’
  • 第二次,黄仁勋手持Spectrum-6 CPO交换机实物,做出技术所有权宣示:‘全球第一款CPO Spectrum-X交换机,已在全量产中。光直接进入这块芯片,与硅片直接对接。电子被转化为光子,直接连接到这块芯片上。我们和台积电共同发明了这个工艺。今天全球只有我们在量产。
  • 第三次在路线图环节,CPO的角色发生质变:‘铜缆会继续重要吗?是的。你们会做光学Scale-up吗?是的。光学Scale-out呢?也是。对于我们生态系统中的每一个人:我们需要大量的铜缆产能,大量的光学产能,大量的CPO产能。’

为什么CPO是AI扩展的物理极限问题

要理解CPO的重要性,需要回到一个基本物理事实:在千兆瓦级AI工厂中,功耗和带宽(而非计算力)才是真正的限制因素。传统的可插拔光模块要求电信号沿PCB上15-30厘米的铜质走线到达前面板,每一厘米的铜线都在耗散能量。CPO将光子引擎直接放置在交换芯片的封装基板上,将电信号路径缩短到几毫米,电子几乎在‘出生’的瞬间就被转化为光子。

根据SemiEngineering 2026年3月的分析,CPO的核心价值在于:

  • 每比特能耗降低30%-50%。
  • 带宽密度提升一个数量级。
  • 消除面板处的接口瓶颈,支持单机架400-800Tbps的聚合带宽。

西门子EDA高级总监Tony Mastroianni的判断极为直接:‘对于超大规模AI芯片,功耗和带宽,而非计算,已经成为限制的因素。’据麦肯锡估计,到2030年全球需要5.2万亿美元的数据中心投资来满足AI需求。在这个尺度下,网络层节省的每一瓦功耗都直接转化为可用于计算的生产性算力。

路线图解读:CPO从边缘走向核心

将NVIDIA历代架构中CPO的角色排列,可以看到一条清晰的迁移路径:

  • Blackwell世代:CPO用于Spine-Leaf间的Scale-Out网络。
  • Vera Rubin世代:CPO扩展至存储网络和集群间互联。
  • Feynman世代(2028年):CPO首次进入机架内GPU到GPU的Scale-up互联,即整个系统中延迟最敏感、带宽需求最高的链路。

关键拐点在Feynman世代:CPO首次进入Scale-up互联,这意味着:

  • CPO成为GPU集群扩展的门控技术。NVLink 72是铜缆的实用上限,NVLink 576需要光学Scale-up。没有CPO,下一代AI超级计算机从物理上就无法建造。
  • NVIDIA正在垂直整合光学能力。‘我们和台积电共同发明了这个工艺’意味着NVIDIA将CPO视为核心差异化技术而非外购商品。
  • ‘铜缆和光学都要’创造了双轨供应链,总可寻址市场扩大。

技术挑战与成熟度

CPO并非没有挑战。SemiEngineering的分析指出几个关键难题:

  • 热管理:光子引擎对温度敏感,需要精确的散热设计。
  • 封装良率:将光器件与大规模硅片集成,对制造精度要求极高。
  • 测试与标准化:缺乏统一的光接口标准。

但SemiAnalysis在2026年1月发布的‘CPO Book’中明确判断:‘CPO将成为本十年后半段及以后Scale-up网络带宽提升的主要驱动力。

投资视角:谁在CPO赛道上

CPO转型的主要受益者包括:

  • 台积电(共封装工艺及硅光子制造)
  • 三星(HBM和部分光子组件)
  • 相干光收发器供应商如Lumentum、Coherent
  • 网络交换芯片厂商如Broadcom

黄仁勋的2026 GTC演讲不仅展示了下一代硬件,更描绘了一个万亿美元规模的AI基础设施蓝图。从百万倍需求增长到解耦推理,从Agentic AI的‘操作系统’到光学互联的物理突破,每一个环节都在重新定义计算的边界。对于投资者和从业者而言,理解这些底层逻辑,就是把握下一个十年的关键。

© 版权声明

相关文章