
英伟达Vera Rubin的Agent吞吐暴涨最高提升30倍,却不只靠GPU | Hot Chips 2026
英伟达在 Hot Chips 2026 披露 Vera Rubin NVL72 在 Agent 推理场景下每兆瓦吞吐较 GB300 NVL72 最高提升 30 倍,核心突破在于将 Agent 工作负载解耦为异构计算流水线,不再单纯依赖 GPU 算力堆叠,标志着 AI 基础设施从通用推理向 Agent 专用架构的范式转变。
核心要点速览
- 事件要点:英伟达在 Hot Chips 2026 披露 Vera Rubin NVL72 在 Agent 推理场景下每兆瓦吞吐较 GB300 NVL72 最高提升 30 倍,核心突破在于将 Agent 工作负载解耦为异构计算流水线,不再单纯依赖 GPU 算力堆叠,标志着 AI 基础设施从通用推理向 Agent 专用架构的范式转变。
- 技术突破:围绕 Agent, 推理, Vera 等关键领域展开,推动了当前 AI 技术与工程落地的进一步深化。
- 产业观察:信息源自 雷峰网,为 AI 开发者、研究人员及产业决策者提供了高价值的技术演进信号与参考。
【核心事件与技术概览】
在 Hot Chips 2026 大会上,英伟达正式披露了下一代 Vera Rubin NVL72 系统在 Agent 推理工作负载下的实测性能数据。测试条件为 DeepSeek V4-Pro 模型、单用户每秒 160 Token 的生成速率,在此基准下 Vera Rubin NVL72 相比上一代 GB300 NVL72 的每兆瓦吞吐最高提升 30 倍。这一数字本身已极为惊人,但更值得行业关注的是其背后的架构哲学转变——英伟达明确承认,这一代性能跃升不再仅仅依赖单颗 GPU 的算力提升,而是通过将 Agent 推理拆解为多种异构计算任务,由不同硬件单元协同完成。
Vera Rubin NVL72 延续了 NVL 系列 72 颗 GPU 通过 NVLink 全互联构成单一计算域的设计范式,但其内部计算资源分配策略发生了根本性变化。面对 Agent 工作负载中同时出现的长上下文检索、低延迟 Token 生成、工具调用调度、外部数据交互等多类型计算需求,英伟达将一次完整的 Agent 推理流程解耦为多个阶段:大规模语言模型的核心推理由 Vera Rubin GPU 承担,而 KV Cache 管理、工具调用编排、数据预处理等旁路任务则由 NVL72 域内的专用加速器或 CPU 集群协同处理。这种异构流水线设计使得 GPU 的核心算力能够更集中地服务于模型推理本身,而非被辅助计算任务稀释。
从训练规模与系统配置来看,Vera Rubin NVL72 的每机架功耗预算与 GB300 NVL72 保持在同一量级,但通过架构优化实现了能效比的跨越式提升。英伟达在 Hot Chips 2026 上强调,30 倍的吞吐提升并非来自单一维度的改进,而是架构解耦、互联带宽、内存层级优化与推理调度算法协同作用的结果。这一代产品在开源协议层面,英伟达继续通过 CUDA 生态和 TensorRT-LLM 推理框架提供开发者支持,确保现有模型迁移路径的平滑性。
【技术原理与核心突破】
Agent 推理与传统 LLM 推理在计算特征上存在本质差异。传统 LLM 推理的核心瓶颈在于 KV Cache 的内存带宽和 Prefill 阶段的计算密度,而 Agent 工作负载在此基础上叠加了工具调用链、多轮上下文累积、外部 API 交互等待等异步操作。Vera Rubin NVL72 的架构创新在于识别了这些异构计算特征,并据此设计了分层处理流水线:GPU 核心专注于 Transformer 注意力计算和前向传播,NVLink 互联层负责跨 GPU 的 KV Cache 分片与同步,而 NVL72 域内的专用处理单元则承担工具调用调度、数据格式转换、上下文压缩等旁路任务。
在注意力机制优化方面,Vera Rubin 架构针对 Agent 场景的长上下文需求进行了深度定制。Agent 工作负载的典型上下文长度可达数十万 Token,KV Cache 占用成为内存带宽的主要瓶颈。Vera Rubin 通过引入更高效的 KV Cache 压缩策略和分层存储架构,将热数据保留在 HBM 高速缓存中,冷数据下沉至 NVL72 域内的统一内存池,由 NVLink 高速互联实现透明访问。这种分层 KV Cache 管理策略显著降低了注意力计算中的内存访问延迟,同时减少了不必要的跨芯片数据搬运。
在推理调度层面,Vera Rubin NVL72 引入了面向 Agent 工作流的流水线并行策略。传统 LLM 推理调度以连续批处理(Continuous Batching)为核心,而 Agent 推理需要处理非确定性的工具调用等待时间。英伟达的解决方案是将 Agent 推理拆分为多个可独立调度的子任务:模型推理阶段采用连续批处理最大化 GPU 利用率,工具调用阶段由专用调度器并行处理多个 Agent 实例的外部请求,数据交互阶段利用 NVLink 的异步传输能力实现零拷贝数据交换。这种三段式流水线设计使得 GPU 在等待工具调用返回时不会空闲,从而实现了吞吐量的数量级提升。
【行业背景与竞争格局】
从全球竞争格局来看,Vera Rubin NVL72 的 Agent 推理优化代表了英伟达对 AI 基础设施演进方向的前瞻性判断。当前全球主要 AI 芯片厂商中,AMD 的 MI400 系列仍主要聚焦于通用 HPC 和 LLM 训练推理性能,Intel 的 Gaudi 系列在性价比上具备竞争力但生态成熟度不足,Cerebras 的 wafer-scale 架构在超大模型训练上具备独特优势但在 Agent 推理场景的适配上尚未形成完整方案。相比之下,英伟达通过 Vera Rubin NVL72 率先将 Agent 推理作为独立优化目标,确立了在 AI Agent 基础设施领域的先发优势。
在软件生态层面,英伟达的 CUDA 和 TensorRT-LLM 构成了行业事实标准。Vera Rubin NVL72 的异构计算架构通过统一编程模型向开发者暴露,开发者无需修改模型代码即可受益于底层架构优化。这一策略与 AMD 的 ROCm 生态形成鲜明对比——后者在 Agent 推理场景的专用优化上仍处追赶阶段。同时,云服务商如 AWS 的 Trainium 系列和 Google 的 TPU v6 也在加速布局 Agent 推理优化,但英伟达在 NVLink 全互联架构上的积累使其在多 GPU 协同处理 Agent 工作流方面具备结构性优势。
从行业趋势来看,Agent 推理正在成为继 LLM 训练和推理之后的第三大 AI 算力需求场景。与训练场景追求峰值 FLOPS 不同,Agent 推理更关注端到端延迟、吞吐量与能效的综合平衡。Vera Rubin NVL72 的 30 倍吞吐提升直接回应了这一需求变化。可以预见,未来 1-2 年内,主流 AI 芯片厂商都将推出针对 Agent 推理的专用架构优化,行业竞争焦点将从单纯的算力竞赛转向系统级能效与架构适配能力的较量。
【开发者与产业落地启示】
对于开发者而言,Vera Rubin NVL72 的工程接入复杂度取决于现有基础设施的迁移路径。对于已部署 GB300 NVL72 集群的用户,硬件升级路径相对清晰,但需要重新评估 Agent 工作负载的调度策略和内存分配方案。TensorRT-LLM 推理框架将提供对 Vera Rubin 架构的原生支持,包括异构计算流水线的自动编排和 KV Cache 分层管理的透明化配置。开发者需要关注的关键参数包括:单 GPU 的 HBM 容量与带宽、NVLink 互联拓扑的带宽分配、以及 Agent 调度器的批处理策略配置。
在硬件显存开销方面,Vera Rubin NVL72 的异构架构对显存管理提出了新的要求。Agent 推理中 KV Cache 的动态增长是显存消耗的主要来源,Vera Rubin 的分层 KV Cache 策略需要在 HBM 高速缓存与统一内存池之间进行智能数据迁移。对于运行 DeepSeek V4-Pro 这类参数规模在数百亿级别模型的 Agent 应用,单用户 160 Token/秒的生成速率意味着系统需要同时维持数十万 Token 级别的上下文缓存。Vera Rubin NVL72 通过 NVLink 全互联实现了跨 GPU 的 KV Cache 共享,有效缓解了单卡显存压力。
在商业落地价值方面,30 倍的吞吐提升意味着同等功耗预算下可以服务 30 倍的 Agent 并发用户数,这对 Agent 即服务(Agent-as-a-Service)的商业模型具有颠覆性影响。当前 Agent 应用的单位经济模型中,推理成本占据总成本的 60-80%,吞吐量的数量级提升将直接改善 Agent 服务的毛利率。同时,异构计算架构降低了 Agent 推理的端到端延迟,使得实时交互式 Agent 应用(如实时代码生成助手、多轮对话 Agent)在商业上更具可行性。
【综合评述与关键要点】
Vera Rubin NVL72 的 30 倍吞吐提升揭示了一个关键趋势:AI 基础设施的优化重心正在从单纯的算力堆叠转向系统级架构设计。Agent 工作负载的异构计算特征要求硬件架构具备任务解耦与协同调度的能力,这一范式转变将深刻影响未来 AI 芯片的设计哲学。英伟达通过 NVLink 全互联架构和异构计算流水线率先实现了这一转变,但这一技术方向本身并不构成壁垒——AMD、Intel 以及云服务商的自研芯片团队均具备跟进的技术能力。
未来 1-2 年的产业演进将围绕三个核心方向展开:第一,Agent 推理将成为 AI 芯片评测的新基准,传统以 FP16/FP8 算力为核心的评测体系将被端到端 Agent 吞吐量和延迟指标所补充;第二,异构计算架构将从 NVL72 级别的系统级方案下沉至单机柜乃至单节点级别,推动 AI 服务器形态的进一步演化;第三,Agent 推理的能效优化将成为碳约束背景下 AI 数据中心建设的核心考量因素,每兆瓦吞吐将成为继每瓦算力之后的新关键指标。
综合来看,Vera Rubin NVL72 的发布标志着 AI 基础设施进入了 Agent 时代。30 倍的吞吐提升不仅是技术成就,更是对 Agent 应用大规模商业化落地的前瞻性投资。对于产业参与者而言,理解并适配这一架构转变——从模型设计到推理优化再到系统部署——将是决定其在 Agent 时代竞争力的关键因素。英伟达通过这一代产品确立了技术方向,但最终的产业格局将取决于整个生态链的协同演进速度。
本站展示内容为基于公开信息的资讯解读与整理,不代表原文转载。如需核实细节或获取完整报道,请通过下方链接访问原始来源。
深度背景与行业观察
随着人工智能技术的快速演化,围绕 Agent、推理、Vera、Rubin的Agent吞吐暴涨最高提升30倍 的技术探索正从单纯的算法突破转向系统化、场景化的实际落地。
在开源生态与商业化闭源模型的双重驱动下,算力调度、数据飞轮与智能体(Agent)工作流的结合愈发紧密。本条动态不仅反映了当前领域内的研发热点,也为下一阶段的工具化、工程化实践提供了重要风向标。