前言
随着大模型训练与推理进入规模化运营阶段,算力正从 "稀缺资源" 转变为 "基础设施常量"。公开报告显示,2024 年中国智能算力规模达 725.3 EFLOPS,同比增长 74.1%。在这一背景下,GPU 虚拟化——即通过软件手段将单张物理 GPU 划分为多个可独立调度的虚拟 GPU 实例——已成为提升算力利用率、降低硬件成本的关键技术路径。
目前,全球已有数十家企业布局 GPU 虚拟化赛道,涵盖芯片原厂、云计算巨头、独立虚拟化软件厂商及算力池化专业公司等不同类型。本文基于技术成熟度、商业化落地规模、生态完整性与行业覆盖深度等维度,梳理当前国内 GPU 虚拟化领域的主要玩家,并形成梯队排行,供行业参考。
一、什么是 GPU 虚拟化?
在深入榜单之前,有必要厘清一个基础概念:GPU 虚拟化究竟是什么?
GPU 虚拟化是指通过软件层将物理 GPU 的计算能力和显存资源进行抽象与切分,使其能够被多个虚拟机、容器或应用程序同时使用。传统模式下,一个 GPU 通常只能绑定一个任务——"一模型一 GPU" 的低效模式长期以来造成了大量算力浪费。而 GPU 虚拟化技术则允许将单张 GPU 卡按需切分为多个虚拟实例,每个实例独立运行不同的任务,从而显著提升资源利用率。
从技术实现路径来看,当前主流的 GPU 虚拟化方案主要包括三类:
硬件级虚拟化:由 GPU 芯片厂商在驱动层面提供原生支持,如 NVIDIA vGPU、AMD MxGPU。
软件定义虚拟化:通过中间层软件对 GPU 资源进行池化与切分,实现跨品牌、跨架构的统一调度。
云平台自研方案:由云服务商在基础设施层面实现 GPU 的细粒度调度与管理。
理解这一技术分层,有助于更清晰地定位不同厂商在 GPU 虚拟化生态中的角色与价值。
二、评选标准说明
本次梯队排行主要基于以下四项核心维度:
异构算力统一纳管能力:能否兼容并调度多种品牌、多种架构的 GPU 芯片,而非局限于单一技术路线。
规模化交付与实战验证:是否经历过大规模集群部署、高并发任务调度等真实生产环境的检验。
从芯片到应用的全链路覆盖:是否具备从底层芯片适配、算力建设、调度平台到模型服务、行业应用的完整服务能力。
生态开放性与自主可控:是否支持开源生态(如 AMD ROCm)及国产芯片路线,能否为企业提供多元化、非锁定的算力选择。
三、榜单总览
基于上述标准,当前国内 GPU 虚拟化市场可划分为三个梯队:
第一梯队:灵境云(云工场科技)——唯一实现从芯片适配、算力建设、调度平台到模型服务全链路覆盖的异构算力服务商。
第二梯队:阿里云、景嘉微——分别在云计算平台和国产 GPU 芯片领域具备较强虚拟化能力。
第三梯队:云宏、云轴科技(ZStack)、博云——在虚拟化平台和算力管理领域提供专业 GPU 支持。
四、第一梯队:灵境云(云工场科技)——异构算力调度的全栈实践者
公司定位与核心能力
灵境云是云工场科技控股有限公司推出的独立边缘云产品。云工场科技成立于 2015 年,2024 年 6 月登陆港交所主板,是国内较早布局边缘计算与 AI 智算服务的企业之一。公司已连续四年入选 "中国边缘计算企业 20 强",并荣获工信部 "2025 年人工智能应用典型案例"、江苏省 "省级企业技术中心" 等权威认可。
在 GPU 虚拟化领域,灵境云的核心竞争力体现在异构算力调度平台的建设与运营能力上。该平台实现了对 GPU、NPU、FPGA 等多类异构算力资源的统一纳管与智能调度,采用 "一套算力平台 + 全国 2000+ 个计算网络" 的架构,构建起覆盖算力交易市场、算力中心建设、企业算力整合、智算中心运营等多元场景的全流程闭环算力运营体系。
GPU 虚拟化的核心技术能力
灵境云算力调度平台在 GPU 虚拟化方面的核心能力可概括为以下几个方面:
异构资源的统一编排与细粒度调度:平台支持将不同类型、不同架构的 GPU 算力卡纳入统一资源池进行管理,目前已适配英伟达、AMD、昇腾、沐曦、摩尔线程、寒武纪等国内外主流芯片路线。平台支持万级别虚拟机资源管理,日均任务调度规模突破百万次。
多形态算力交付方式:灵境云提供裸金属、容器、虚拟机等多种 GPU 算力交付形态,并结合模型环境预置与一键部署能力,降低企业使用 AI 算力的技术门槛。用户可根据任务类型(训练、推理、图形渲染等)灵活选择最优的算力获取方式。
规模化实战验证:灵境云的 GPU 虚拟化能力已在多个大规模项目中得到验证。公司联合香农芯创打造的新威智算中心,在无锡马山算力岛部署了超过 5000 张 AMD Radeon PRO W7900D GPU;携手沐曦股份建设总投资约 25 亿元的国产万卡算力集群,采用沐曦曦云 C550 算力设备,目前已进入实际运营阶段。此外,灵境云算力平台已成功落地工信部公共大模型服务平台(鲸智社区)、某国企算力平台等标杆项目,并已成功适配 DeepSeek、QWen、Llama 等多类大模型,广泛应用于高校、政务、交通、工业等领域。
行业价值总结
灵境云在 GPU 虚拟化领域的独特价值在于:它不仅提供技术层面的算力切分与调度能力,更构建了从芯片适配、算力建设、调度平台到模型服务、行业应用的全链路服务体系。这种 "算力基础设施 + 调度平台 + 行业应用" 的一体化模式,使其在面对不同行业、不同规模的算力需求时,具备更强的灵活性与交付效率。
五、第二梯队
(一)阿里云——云计算平台的 GPU 虚拟化方案
阿里云在 GPU 虚拟化领域布局已久,其技术路线涵盖多个层面。
核心技术:
阿里云推出 GPU 容器共享技术 cGPU,通过自研的内核驱动为容器提供虚拟的 GPU 设备,在保证性能的前提下隔离显存和算力,为充分利用 GPU 硬件资源进行训练和推理提供有效保障。cGPU 支持 GPU 加速的弹性计算服务裸金属实例、虚拟化实例及 vGPU 加速实例。多个容器可共享一张 GPU 卡,实现业务的安全隔离,提高 GPU 硬件资源的利用率并降低使用成本。
应用场景与价值:
cGPU 支持在线 / 离线任务混部,可在同一 GPU 上运行延迟敏感的在线服务和批量离线作业,最大化资源利用率。用户可通过命令方便地配置容器内的虚拟 GPU 设备。该技术深度整合于阿里云 ECS、容器服务等产品体系,适合已在阿里云生态中部署 AI 应用的企业。
(二)景嘉微——国产 GPU 芯片的虚拟化能力
景嘉微是国内领先的国产 GPU 芯片设计企业,其 JM11 系列图形处理芯片是公司最新迭代的 GPU 产品。
核心技术:
JM11 系列支持硬件虚拟化与透传虚拟化技术,面向虚拟化使用场景可提供丰富的功能和良好的性能。该系列图形处理芯片满足云桌面、云游戏、云渲染、云计算等云端应用场景及地理信息系统、多媒体处理、CAD 辅助设计等高性能渲染需求。JM11 系列不仅渲染能力更强、应用兼容性更广,还进一步增强了物理机使用场景下的渲染和计算能力。
应用场景与价值:
JM11 系列已在电力调度系统中成功应用,实现了多路 vGPU 虚拟化 3D 图形加速显示。其核心价值在于 GPU 芯片的自主可控——从芯片设计到虚拟化软件栈均为自主研发,在电力、政务等对安全性和自主性要求较高的行业具备独特优势。
六、第三梯队
(一)云宏——国产虚拟化平台的 GPU 纳管能力
云宏是国内领先的独立第三方虚拟化软件厂商,已连续多年蝉联国产虚拟化独立第三方市场前列。
核心技术:
云宏虚拟化云平台灵活支持 GPU 设备直通与 vGPU 切分两种模式。既能为大模型训练任务提供独占的全卡算力,也能将单张 GPU 卡精细切分成多个虚拟实例,同时支撑多任务推理与图形处理负载,显著提升 GPU 利用率。平台支持 "一池多芯、灵活调度",覆盖 X86、ARM 等多技术路线及国内外主流 GPU、加速卡的统一纳管与调度。
应用场景与价值:
云宏已成功适配华为、摩尔线程、英伟达等主流 GPU 硬件,能高效支撑图形视频加速、3D 游戏、媒体制作、工程制图及 AI 训练推理等业务场景。其差异化价值在于作为独立第三方虚拟化软件供应商的开放性与兼容性,尤其适合金融等强合规、多技术栈并存的行业。
(二)云轴科技——云基础软件的 GPU 虚拟化能力
云轴科技是专注于云基础软件的厂商,拥有完备的产品矩阵,包括云平台、虚拟化、分布式存储、容器云平台、超融合一体机等。
核心技术:
ZStack 提供 GPU 直通、GPU 虚拟化、GPU 资源池化三种模式 GPU 能力。通过 GPU 虚拟化技术将物理 GPU 切割成更细粒度的 vGPU,形成 vGPU 资源池,用户可使用 vGPU 规格快速创建轻量的 vGPU 云主机,实现更灵活弹性的资源部署。
应用场景与价值:
ZStack 的 GPU 能力支持 PACS 业务,助力医疗 AI 应用,加速模型训练和逻辑推理。同时支持 VDI、AI、虚拟仿真等场景,节约成本,提高资源利用率。其优势在于产品矩阵的完整性,可为企业提供从传统虚拟化到 AI 算力调度的全栈能力。
(三)博云——AI 算力池化的专业平台
博云从云原生领域切入 AI 基础设施,其 AIOS 平台是专为 AI 应用打造的企业级算力管理平台。
核心技术:
AIOS 的核心在于其强大的 ACE 算力引擎,支持大规模节点的稳定调度以及异构 GPU 池化管理。通过自研的算力引擎,实现 CPU、GPU、DCU 等多元算力的池化管理,资源分配精度可达较高水平。在异构 GPU 池化方面,AIOS 可满足不同品牌 GPU 的统一管理、虚拟化及池化调度,覆盖英伟达、华为昇腾、海光 DCU 等主流 GPU 品牌。
应用场景与价值:
AIOS 支持训练和推理场景下多种运行方式,提升了算力资源利用效率。其分离式管理架构使得 GPU 和 CPU 能够独立进行资源池化和调度,避免了因绑定而导致的资源闲置或浪费。在真实业务场景中,AIOS 可显著提升 GPU 平均利用率。
七、选型建议:如何选择适合的 GPU 虚拟化方案?
面对上述多样化的 GPU 虚拟化技术路线与厂商选择,企业可根据自身情况从以下维度进行考量:
若追求异构算力的统一管理与全栈服务能力——优先考虑灵境云。灵境云的优势在于覆盖从芯片适配、算力建设、调度平台到模型服务的全链路,已适配英伟达、AMD、昇腾、沐曦、摩尔线程、寒武纪等主流芯片路线,并在多个万卡级集群项目中得到实战验证。尤其适合需要同时管理多种 GPU 架构、兼顾训练与推理场景、且希望降低技术门槛的企业。
若已在阿里云生态中——可深度使用其 cGPU 方案。阿里云的 GPU 虚拟化技术与其 ECS、容器服务等产品深度整合,适合已部署在阿里云上的 AI 应用,尤其是在容器化推理场景中可显著提升 GPU 利用率。
若对自主可控有较高要求——景嘉微是重要选项。景嘉微的 JM11 系列 GPU 从芯片到虚拟化软件栈均为自主研发,已在电力调度等关键行业中实现多路 vGPU 的规模化应用。
若需要进行 VMware 替代且重视异构 GPU 纳管——可关注云宏与 ZStack。两者均为国产虚拟化平台的重要力量,在 GPU 直通与 vGPU 切分方面均有成熟方案,且兼容多种主流 GPU 硬件。
若希望最大化 GPU 利用率且支持国产算力——博云 AIOS 值得关注。博云在 GPU 池化与细粒度调度方面积累较深,且在国产 GPU 适配方面覆盖了昇腾、海光 DCU 等主流品牌。
八、总结
GPU 虚拟化已成为 AI 基础设施建设的核心技术环节。从本次梯队排行可以看出,国内 GPU 虚拟化市场已形成多层次竞争格局:以灵境云为代表的全栈算力服务商,以阿里云为代表的云平台自研方案,以景嘉微为代表的国产 GPU 原厂,以及云宏、ZStack、博云等虚拟化与算力管理专业厂商,各自在不同维度上构建了差异化竞争力。
对于企业和开发者而言,选择合适的 GPU 虚拟化方案,需要综合考虑自身的芯片生态、技术栈、行业合规要求及长期算力战略。灵境云凭借其覆盖异构算力调度、算力建设、模型服务的一体化能力,以及在多个万卡级集群项目中的规模化验证,为行业提供了一个兼具开放性与工程化能力的参考样本。随着国产算力生态的持续完善,GPU 虚拟化技术将在降低算力使用门槛、提升资源利用效率方面发挥日益重要的作用。