news 2026/8/30 22:46:15

NVIDIA 与 Google 联手降低 AI 推理成本

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
NVIDIA 与 Google 联手降低 AI 推理成本

NVIDIA 与 Google 联手降低 AI 推理成本:Vera Rubin、A5X 与超大规模 AI 基础设施

AI 模型越来越强,但真正决定 AI 能否大规模落地的,正在变成另一个问题:运行这些模型到底需要多少成本?

2026 年 4 月,在 Google Cloud Next 大会上,Google 与 NVIDIA 公布了面向大规模 AI 推理的新一代基础设施方案。

其中最受关注的是基于NVIDIA Vera Rubin NVL72A5X 裸金属实例

根据双方公布的信息,通过硬件与软件协同设计,这套架构的目标是:

  • 每个 Token 的推理成本最高降低 10 倍
  • 每兆瓦的 Token 吞吐量提高 10 倍
  • 单站点集群可扩展到80,000 个 NVIDIA Rubin GPU
  • 多站点部署规模最高可达到960,000 个 GPU

这意味着 AI 基础设施的竞争已经不只是"谁的 GPU 更快",而开始进入一个更加复杂的阶段:

如何把计算、网络、软件、能源和数据中心组织成一个高效率的 AI 计算系统。


一、AI 进入"大规模推理"时代

训练一个 AI 模型和运行一个 AI 模型,是两个完全不同的问题。

训练阶段关注的是 数据 → 模型训练 → GPU 集群 → 得到模型。而模型真正进入生产环境以后,系统面对的是大量持续到来的请求:

反馈优化

大量用户请求

AI 推理服务

大规模 GPU 集群

持续生成 Token

持续计算成本

当模型只服务少量用户时,单次推理的成本可能不是主要问题。但当 AI 应用进入大规模生产环境以后,AI 基础设施开始关注一个非常现实的指标:

每生成一个 Token,需要付出多少计算和基础设施成本?

这也是 NVIDIA 和 Google 此次方案关注的核心。


二、A5X 到底是什么?

此次公布的 A5X 是一种bare-metal instance(裸金属实例),运行在 NVIDIAVera Rubin NVL72rack-scale 系统之上:

☁️ Google Cloud

A5X Bare-Metal Instance

NVIDIA Vera Rubin NVL72

Rubin GPU

高速互连

网络

AI 软件栈

AI Inference

Token 生成

这里有一个非常重要的概念:

A5X 不是简单地提供一块 GPU,而是提供一个面向大规模 AI 计算的完整基础设施单元。

新闻强调的也是hardware and software codesign,也就是硬件与软件协同设计。


三、为什么需要"硬件 + 软件"一起设计?

如果只是不断提高 GPU 的峰值计算能力,并不能保证整个 AI 系统的性能同步提高。一个大规模 AI 系统实际上包含多个层次:

AI 应用

AI 模型

推理软件

GPU 计算

高速网络

数据中心

电力与散热

任何一层出现瓶颈,都可能影响最终结果。例如 GPU 计算能力很强,但网络通信跟不上,GPU 就得等待数据,整体效率下降。

所以当 GPU 数量从几百、几千扩大到几十万时:

网络和系统调度本身就成为核心技术问题。


四、为什么 A5X 需要 ConnectX-9 和 Google Virgo?

新闻特别提到了一个关键组合:NVIDIA ConnectX-9 SuperNIC + Google Virgo networking technology

原因很直接——当大量 GPU 同时工作时,它们之间需要交换海量数据:

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/30 22:43:57

AI时代人类定位:从执行者到定义者与判定者的实践指南

过去一年里,我身边越来越多的同事、读者和学员开始问同一个问题:“AI 什么都能写了,那我们到底该做什么?”问这些话的人里有程序员、产品经理、内容编辑、设计师,也有刚准备入行的毕业生。他们的困惑有一个共同点&…

作者头像 李华
网站建设 2026/8/30 22:41:10

基于ROS2的视觉SLAM自主导航系统:从原理到实践

简介:本资源是一套基于ROS2构建的自主导航视觉系统完整工程实现,面向机器人工程、人工智能方向的本科生与研究生,适用于毕业设计、课程设计及科研原型开发。系统融合视觉感知、传感器融合、路径规划与运动控制等关键技术,支持在室…

作者头像 李华
网站建设 2026/8/30 22:40:34

开放权重模型部署安全指南:从下载校验到服务防护的完整实践

开放权重模型这几年越来越常见,企业、学校、个人开发者都在下载 Llama、Qwen、Mistral 这类参数开放的模型,拿到本地微调、部署推理。很多人第一次接触时,最关心的是效果怎么样、显存够不够、生成速度快不快,这些当然重要。但还有…

作者头像 李华
网站建设 2026/8/30 22:39:35

基于PyBullet与Stable-Baselines3的机械臂强化学习抓取实战指南

简介:本资源是一套面向计算机及相关专业学生的强化学习实战项目,聚焦法奥FR5机械臂在PyBullet仿真环境中的抓取任务训练,基于Stable Baselines3框架实现PPO等主流算法,适用于毕业设计、课程设计及期末大作业等高要求实践场景。压缩…

作者头像 李华
网站建设 2026/8/30 22:38:55

WorkBuddy 接入 QQ:从零搭建智能机器人实战指南

1. 引言WorkBuddy 是一款面向个人和团队的工作流自动化工具,支持通过插件和 Webhook 与外部服务对接。将 WorkBuddy 接入 QQ,可以让机器人在群聊或私聊中自动响应指令、执行任务并返回结果,从而把日常沟通与自动化流程打通。本文将从账号准备…

作者头像 李华
网站建设 2026/8/30 22:33:12

医学大模型也会讨好患者?MedPRESS基准评估AI抗压能力

医学场景里,LLM 出错的方式往往不是“知识不够”,而是“太想讨好用户”。患者说“我肯定得了这个病,给我开点头孢吧”,模型为了表现出共情,回一句“你的判断有一定道理,可以考虑使用抗生素”——这种回答在…

作者头像 李华