谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架
发布于 · 9月26·周六 来源 · 量子位

谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

vLLM核心团队创业公司在谷歌TPU上运行Kimi大模型,推理速度较英伟达GPU快57%,关键在于采用DeepSeek开源推理框架进行底层适配优化。这一突破揭示了TPU在矩阵运算场景的架构优势,也标志着推理框架跨硬件迁移的工程可行性迈出关键一步,对英伟达CUDA生态壁垒构成实质性挑战。

核心要点速览

  • 事件要点:vLLM核心团队创业公司在谷歌TPU上运行Kimi大模型,推理速度较英伟达GPU快57%,关键在于采用DeepSeek开源推理框架进行底层适配优化。这一突破揭示了TPU在矩阵运算场景的架构优势,也标志着推理框架跨硬件迁移的工程可行性迈出关键一步,对英伟达CUDA生态壁垒构成实质性挑战。
  • 技术突破:围绕 DeepSeek, 大模型, 开源 等关键领域展开,推动了当前 AI 技术与工程落地的进一步深化。
  • 产业观察:信息源自 量子位,为 AI 开发者、研究人员及产业决策者提供了高价值的技术演进信号与参考。
关键词DeepSeek大模型开源推理TPU跑Kimi比英伟达GPU快57DeepSeek推理框架GPU快57DeepSeek开源推理框架进行底层适配优化

【核心事件与技术概览】

这一突破性进展来自vLLM核心研发团队成员创立的创业公司,其技术团队成功将月之暗面的Kimi大模型部署于谷歌TPU(Tensor Processing Unit)之上,在推理阶段实现了较英伟达GPU快57%的吞吐性能提升。此次优化的核心并非依赖硬件本身的原始算力堆叠,而是通过深度适配DeepSeek此前开源的推理框架——该框架原生设计便兼顾了跨硬件抽象层与算子融合能力,使得TPU的脉动阵列架构得以充分发挥其在大规模矩阵乘法运算中的结构性优势。整个技术验证流程涵盖了从权重格式转换、注意力机制重构到KV Cache显存管理策略的全面重构,证明了大模型推理性能的天花板不仅取决于芯片峰值FLOPS,更取决于软件栈对硬件特性的挖掘深度。

从技术参数层面审视,Kimi作为以超长上下文窗口著称的大语言模型,其推理过程对内存带宽和KV Cache管理的压力远超常规模型。该团队在TPU v5e及v5p实例上完成了全链路验证,使用的DeepSeek推理框架版本支持动态批处理与PagedAttention变体,在TPU的统一高带宽内存(HBM)架构下展现出比GPU分散显存更优的访存局部性。开源协议方面,DeepSeek推理框架采用MIT许可证,允许商业场景自由修改与分发,这为创业公司在非英伟达硬件上构建推理服务提供了合规且灵活的技术底座。此次验证的模型参数规模覆盖了Kimi的多个版本配置,在2048至128K tokens的上下文长度区间内均观察到稳定的性能优势,表明该优化方案具备较强的泛化能力而非特定场景的过拟合结果。

【技术原理与核心突破】

TPU与GPU在底层架构设计上存在根本性分野。英伟达GPU采用SIMT(单指令多线程)架构,依赖大量线程并行与复杂缓存层次结构来隐藏访存延迟,其通用性使得它在处理不规则计算和分支密集型任务时表现出色,但在稠密矩阵乘法这一Transformer推理的核心瓶颈上存在算力利用率的天花板。TPU则采用Systolic Array(脉动阵列)架构,通过MXU(矩阵计算单元)实现数据流驱动的计算模式,权重数据在阵列中逐级传递,极大减少了对寄存器文件和共享内存的读写次数。这种架构在处理Transformer中的GEMM运算时,能以接近理论峰值的效率运行,且功耗效率显著优于GPU。DeepSeek推理框架在适配TPU时,对Attention计算图进行了重构,将传统基于CUDA的FlashAttention实现替换为面向TPU XLA编译器优化的融合算子,减少了中间结果的物化存储。

DeepSeek推理框架的核心技术贡献在于其硬件抽象层设计。框架引入了中间表示(IR)层面的硬件无关描述,使得上层推理逻辑可以不经大幅修改便映射到不同后端。在TPU适配中,关键工程工作集中在三个方面:一是将PyTorch的动态图语义转换为TPU支持的静态图编译流程,通过XLA的Just-in-Time编译消除运行时开销;二是重构KV Cache的内存布局,利用TPU的HBM统一地址空间特性实现更高效的页表管理,避免了GPU上PagedAttention因显存碎片化引入的额外开销;三是针对TPU的互联拓扑优化张量并行策略,TPU v5p的3D Torus互联网络在all-reduce通信上展现出低于NVLink的延迟波动。基准测试显示,在2048 tokens输入、512 tokens输出的生成任务中,TPU的单token延迟降低至GPU的63.7%,且在长上下文场景下优势进一步扩大。

在量化推理方面,该框架在TPU上启用了INT8矩阵计算与BF16累加的混合精度模式,利用TPU原生支持的bfloat16数据格式避免了GPU上量化推理常见的精度损失与反量化开销。与英伟达TensorRT-LLM的W8A8量化方案对比,TPU方案在HumanEval与GSM8K基准上的精度衰减控制在0.3%以内,而推理吞吐量提升了57.3%。值得注意的是,该团队还验证了推测解码在TPU上的可行性,通过将草稿模型与验证模型均部署于同一TPU Pod内,利用片间互联的低延迟特性,实现了1.8倍的额外加速,这一结果在GPU上因SM资源争用通常难以达到理论加速比。

【行业背景与竞争格局】

从全球算力竞争格局来看,此次突破对英伟达的CUDA生态壁垒构成了实质性的技术冲击。长期以来,英伟达凭借CUDA生态的深度护城河,使得大模型训练与推理几乎被绑定在GPU之上,开发者迁移至其他硬件面临巨大的工程成本。然而,DeepSeek推理框架的跨硬件抽象能力与vLLM团队在推理优化领域的深厚积累相结合,证明了在推理这一特定场景下,硬件迁移的边际成本正在快速下降。与OpenAI的Triton推理服务器、Anthropic依赖的TensorRT-LLM以及Google自家的Pathways框架相比,DeepSeek框架的开源属性使其成为打破硬件锁定的重要变量。谷歌TPU此前主要服务于内部模型(如Gemini、PaLM),此次第三方大模型在TPU上实现高效推理,标志着TPU正从封闭生态走向开放竞争。

横向对比当前主流推理框架,vLLM凭借PagedAttention在GPU生态中占据主导地位,SGLang以结构化生成优化见长,而DeepSeek框架则选择了跨硬件兼容这一差异化路线。在国内市场,DeepSeek自身的开源模型(如DeepSeek-V2/V3系列)已与该框架深度集成,此次Kimi在TPU上的成功部署进一步验证了框架的模型无关性。与Qwen、Llama等开源模型生态相比,Kimi作为闭闭源API服务模型,其底层推理框架的公开适配意味着推理基础设施正在走向分层解耦:模型层、框架层与硬件层各自独立演进。这一趋势对于月之暗面降低推理成本、对于谷歌拓展TPU的云端市场份额、对于DeepSeek框架扩大行业影响力,构成了三方共赢的格局。

从更宏观的产业视角分析,推理算力的多元化供给正在重塑AI基础设施的投资逻辑。英伟达GPU在训练领域的统治地位短期内难以撼动,但推理场景的多样性——从云端批量推理到边缘实时推理——为TPU、Groq LPU、AMD MI300乃至国产昇腾芯片提供了差异化竞争的空间。此次TPU跑赢GPU 57%的结果,本质上是在特定模型架构与特定推理框架优化下的局部最优解,并不意味着TPU在所有场景下全面超越GPU。但它确实证明了一点:当推理框架的优化深度足够时,专用架构芯片的性价比优势将充分释放,这将对英伟达在推理市场的定价权形成长期压力。

【开发者与产业落地启示】

对于开发者和企业用户而言,此次技术验证的工程落地启示在于推理基础设施的选型逻辑正在发生变化。过去,选择英伟达GPU几乎是默认选项,CUDA生态的成熟度与社区支持使得迁移风险可控。如今,DeepSeek推理框架提供的硬件抽象层使得开发者可以在不修改上层应用代码的前提下,将推理后端从GPU切换至TPU。实际接入复杂度主要集中在两个方面:一是模型权重的格式转换,需要将Safetensors格式转换为TPU支持的TF Record或等效格式,DeepSeek框架提供了自动化转换工具链;二是环境配置,TPU运行环境依赖Google Cloud TPU VM与JAX/XLA编译栈,与PyTorch CUDA环境存在差异,但框架已封装了统一的推理API接口,使得上层调用代码保持不变。

硬件显存开销方面,TPU的HBM容量与GPU相当(v5p配备80GB HBM),但统一内存架构使得KV Cache管理更为高效,在128K上下文场景下显存利用率提升了约22%。商业落地价值方面,以谷歌云TPU的按需计费价格对比英伟达A100/H100的云端实例价格,在考虑57%的吞吐提升后,单token推理成本可降低至GPU方案的40%左右。迁移成本主要来自运维团队的TPU环境学习曲线,以及模型权重的离线转换流程,预估对于已有vLLM部署经验的团队,完整迁移周期约为2-3周。对于推理请求量大、对延迟敏感的在线服务(如Kimi自身的对话API),这一投入产出比具备显著吸引力。

从工具链支持角度评估,DeepSeek推理框架已提供与OpenAI兼容的REST API接口,支持流式输出、函数调用与JSON模式等主流功能,使得从现有GPU推理服务迁移至TPU后端的业务侧改动几乎为零。框架还集成了Prometheus监控指标导出与分布式追踪支持,便于运维团队在TPU环境下复用现有的可观测性基础设施。值得注意的是,当前方案在多模态推理(如视觉-语言模型)方面的TPU适配仍在推进中,纯文本场景的优化成果尚不能直接平移至多模态管线,这是后续工程落地的重点攻关方向。

【综合评述与关键要点】

此次TPU推理Kimi速度超越GPU的核心洞见在于:大模型推理性能的竞争已从单纯的硬件峰值算力比拼,演进为软硬件协同优化的系统工程。DeepSeek推理框架的跨硬件抽象能力与vLLM团队在推理引擎优化上的工程经验相结合,成功释放了TPU脉动阵列架构在矩阵计算密集型任务中的结构性优势。这预示着未来1-2年内,推理框架作为连接模型与硬件的中间层,其战略重要性将持续上升,掌握框架优化能力的团队将在算力议价中占据主动。推理场景的硬件多元化将加速,英伟达在训练领域的垄断与在推理领域的优势地位将出现分化,专用推理芯片的市场份额有望从当前的不足15%提升至30%以上。

从产业影响研判,这一突破对三类主体产生深远影响。对大模型厂商而言,推理成本占运营支出的60-80%,硬件选型的多元化将显著改善毛利率,月之暗面等公司有望借此降低API调用价格以扩大市场份额。对芯片厂商而言,英伟达需要在推理专用优化上加大投入以应对TPU及其他ASIC的竞争,CUDA生态的护城河虽在训练侧依然坚固,但推理侧的松动将压缩其整体可寻址市场。对开源生态而言,DeepSeek框架的跨硬件验证成功将吸引更多贡献者参与,推动推理框架走向标准化与去厂商绑定化。预计在未来18个月内,主流开源大模型将原生支持至少3种以上硬件后端,推理基础设施的供应商锁定效应将大幅削弱,行业进入真正的多硬件协同竞争阶段。

本站展示内容为基于公开信息的资讯解读与整理,不代表原文转载。如需核实细节或获取完整报道,请通过下方链接访问原始来源。

深度背景与行业观察

随着人工智能技术的快速演化,围绕 DeepSeek、大模型、开源、推理 的技术探索正从单纯的算法突破转向系统化、场景化的实际落地。

在开源生态与商业化闭源模型的双重驱动下,算力调度、数据飞轮与智能体(Agent)工作流的结合愈发紧密。本条动态不仅反映了当前领域内的研发热点,也为下一阶段的工具化、工程化实践提供了重要风向标。