近半年来我一直在观察一个现象:整个算力租赁和AI推理服务的生意,绕来绕去都绕不开NVIDIA。直到最近Embedded LLM团队放出消息,说他们要做一个面向AMD AI GPU的Monetisation Platform,而且自称是同类首创。这条新闻在朋友圈里讨论度不算高,但我觉得它可能是一个值得记录的转折点——因为AMD的AI GPU终于有机会从"机房吃灰"变成"可交易资产"了。这篇文章我会从软件生态现状、变现模式设计、实际部署流程到市场格局变化,完整拆一下这件事到底意味着什么,以及不同角色的人该怎么接入。
1. 一台AMD GPU凭什么难变现:这个平台的切入点在哪
1.1 算力市场的"CUDA惯性"与AMD的尴尬
过去三年GPU租赁生意有多火,不用我多说。但凡手上有一张能跑的卡,挂到云平台或者自建集群做推理服务,都能产生现金流。但这里面有个非常明显的结构性问题:整个算力交易市场几乎是围绕NVIDIA生态搭起来的。从底层驱动、CUDA库、NCCL通信,到上层的vLLM、TGI、Ray这些推理和调度框架,默认支持的都是NVIDIA。AMD的Instinct系列虽然规格不差,MI300X甚至有192GB HBM3显存、5.3TB/s带宽这种让NVIDIA都不得不降价的硬参数,但放到租赁市场里就是不好卖。
为什么不好卖?这里有个"CUDA惯性"在作祟。租GPU的大部分客户手里已经有一套跑通的镜像和脚本,人家不在乎你的卡是不是理论性能更強,只关心"我原来的代码能不能直接跑"。CUDA生态这些年积累的库和工具链太厚了,从cuBLAS、cuDNN到NCCL、TensorRT,每一层都是AMD需要追赶的。所以AMD卡的实际处境是:做内部训练、内部推理够用,但想对外变现,找不到像样的通道。没有分发渠道、没有成熟的计费体系、没有需求方信任背书,这就是所谓的"三无算力"。
1.2 Embedded LLM这套平台具体做了什么
按照官方发布的信息,这个平台的核心逻辑是:让AMD AI GPU的持有者(无论是一张卡的企业用户,还是小型算力机房)可以把自己的算力接入一个统一的LLM推理服务市场,按实际使用量获取收益,而不是像过去那样只能整机租赁或闲置。听起来简单,但"变现"这两个字在AMD生态里要干的事远不止挂个网页。
一是硬件抽象层。平台需要把不同厂商、不同代际的AMD GPU统一抽象成可调度的计算节点。AMD GPU的ROCm版本差异很大,MI50这种老卡跟MI300X的驱动栈完全不是一回事,你需要解决"不同类型的卡能在同一个池子里跑不同的模型"这种问题。
二是推理服务封装。平台提供面向LLM的推理运行时,内置模型部署、并发控制、自动扩缩容,让算力提供方不需要自己研究vLLM参数就能把模型跑起来。这一步其实很关键,因为大部分持卡用户根本没有能力自己部署一套生产级的推理服务。
三是计费与结算系统。按Token数量计费、按小时计费、预留实例等多种模式,牵扯到精确的Token计数、吞吐量监控、账单对账。四是信任与安全体系。算力提供方和需求方之间是陌生人关系,需要做节点认证、网络隔离、数据面加密、用量证明,防止双方互相耍赖。
有趣的是,这个平台选在AMD生态而不是NVIDIA生态做首发,其实是刻意为之的差异化策略。NVIDIA那边的算力市场已经是红海,各种GPU云、算力聚合平台已经把价格打到很低,新玩家进去没有优势。AMD这边恰恰是空白市场,竞争者少,定价话语权高,还能绑定AMD官方的扶持资源。
1.3 "First-of-its-Kind"到底新在哪
说实话,现在科技圈凡是带"首个""首创"的标题都要打个问号。但这件事我仔细看了之后觉得,"首次"这个说法有它的道理。市面上的GPU变现平台不少,但要么只支持CUDA,要么就是纯粹的裸金属租赁,不关心你租回去跑什么。
Embedded LLM这个平台的三层差异化在于:第一,它只针对AMD AI GPU做深度适配,不是"顺便支持一下ROCm",而是从底层驱动到上层推理做了一整套AMD原生的优化;第二,它直接内嵌了LLM场景的变现能力,不是把算力卖给你就完事,而是帮你把模型跑起来、把服务卖出去、把钱结算回来;第三,它把"Embedded"这个概念落地了,平台SDK可以嵌入到需求方自己的产品里,让原本只能本地使用的LLM能力对外输出成收费服务。
说白了,以前你想用AMD卡赚钱,只有"整机租出去"这一条路;现在有了一条新路,把你的算力变成推理服务的产能,直接面对最终用户。这也是我把这个平台定义为"算力批发变服务零售"的原因——整机出租是按资源计费,平台化变现是按效果计费,后者的天花板高得多。
2. AMD GPU的AI软件栈到底行不行:这几年发生了什么
2.1 ROCm从"劝退级"到"可用级"的进化
聊变现之前必须先把一个核心问题说清楚:AMD AI GPU在软件层面到底能不能打。因为如果软件栈一塌糊涂,那再好的变现平台也是空中楼阁。
我大概三年前第一次尝试在AMD卡上跑PyTorch训练,那体验真的劝退。ROCm安装依赖一大堆,编译PyTorch需要手动指定HIP路径,跑起来动不动就是hipErrorNoBinaryForGpu,然后你去GitHub issue里搜,发现有人跟你一样的问题但没解决方案。那个时期,AMD的AI生态基本靠社区用爱发电。
但过去一年半,情况发生了实打实的变化。ROCm的版本迭代明显加快,6.x系列把安装过程简化了不少,官方也提供了Docker镜像,省掉了本地编译的麻烦。PyTorch官方库直接支持ROCm构建,虽然不能做到pip install torch就能拿到CUDA版一样的体验,但至少能用官方预编译轮子了。更关键的是推理框架这边,vLLM在0.6版本之后对ROCm的支持从实验性转成了稳定支持,llama.cpp的HIP后端也一直在跟进新的AMD显卡架构。
我用一个直观的类比来解释这轮变化:以前的AMD AI软件栈像一套"需要自己组装、还要自己修家具的毛坯房",CUDA那边是拎包入住的精装房;现在ROCm至少做到了"家电齐全但有些需要手动校准"的程度。对于愿意花半小时调配置的专业用户来说,这个差距已经从"天堑"缩小到了"门槛"。
2.2 在AMD卡上跑LLM的真实体验
我自己在MI100和MI300X上都跑过一些开源模型,用vLLM部署Llama 3.1 8B和Qwen2.5 72B,说几个真实感受。
首先是显存容量的红利非常明显。MI300X的192GB显存可以单卡跑很多70B级别的模型,而NVIDIA要跑到这个规模得上H100 80G做张量并行,成本差了不是一点半点。对推理场景来说,显存就是王道,因为LLM推理的瓶颈主要是显存带宽和容量,不是算力峰值。MI300X的HBM3带宽5.3TB/s,配合大显存,实际跑起来首Token延迟和生成长Token吞吐都挺能打。我之前做过一个简单的对比,同一个Qwen2.5-72B模型,MI300X单卡做推理,吞吐大概能到同参数规模下H100 80G双卡张量并行的七八成,但算上硬件成本,性价比是高出一截的。
其次是软件层的坑仍然存在,但只要肯花时间调,基本都能绕过去。比如vLLM在ROCm上的某些算子是用Triton写的,你要确保Triton版本跟ROCm版本匹配,否则会出现kernel编译失败。还有一个经常踩的是FlashAttention的ROCm实现,有些模型默认用FA2的CUDA kernel,在AMD卡上根本不会触发,需要显式指定用Triton的kernel或者回退到math实现,性能会有一定下降但不至于不可用。
2.3 迁移一个现有推理服务到AMD卡要付出多少成本
很多人关心的是:把我现在跑在NVIDIA上的推理服务搬到AMD上,工作量有多大。我的答案取决于你用的框架抽象程度。
如果你用的是vLLM或者TGI这种高层框架,而且模型本身是社区常见的架构(Llama、Qwen、Mistral),那迁移成本很低,可能只是改改环境变量、换一下tokenizer,再重新下载模型权重就行。你的推理代码如果是OpenAI兼容接口那种,客户端完全不用改。如果有用到自定义CUDA kernel,那就麻烦了,要么重写成ROCm/HIP,要么找Triton替代实现,这部分工作量很难估。另外,数据并行和模型并行的通信库,AMD这边用的是RCCL(ROCm的NCCL移植版),多卡场景下性能调优比NCCL要费劲一些,尤其是跨节点的通信。
所以我的判断是:面向LLM推理,AMD的软件栈已经到了"可商用"的最低门槛;面向训练,还是NVIDIA的地盘,因为训练对框架依赖太深,AMP(自动混合精度)库、分布式训练的成熟度差距比较大。Embedded LLM这个平台瞄准的场景也确实是推理,而不是训练,这个定位跟AMD当前的技术现状是匹配的。
3. 算力变现的商业模式拆解:平台到底在赚什么钱
3.1 算力供给方和需求方的双向撮合逻辑
什么是好的算力变现平台?站在供需两端看就清楚了。需求方(比如一个做AI应用的小团队)需要的是"便宜、稳定、有模型结果返回"的推理服务,它不想管GPU、不想管驱动、甚至不想管模型部署。供给方(比如持卡的企业、数据中心)需要的是"把闲置算力利用起来、在合规前提下产生现金流"。
过去的算力市场,供需两端的匹配效率非常低。需求方要去各个云平台比价、测试、担心供应商跑路;供给方要去自己找客户、搞计费、搞客服。Embedded LLM这类平台做的事情,本质上是把"算力批发"变成"服务零售":不再按整卡月租出售,而是按实际推理消耗量(Token数)零售。平台在中间的差价就是它的毛利。这个模式能不能跑通,核心看两个指标:一是算力利用率能否拉起来。闲置的AMD卡接入平台后,如果一天能接到足够多的推理请求,供给方赚到的钱会高于整机租赁收入;二是平台是否真的能把NVIDIA的存量需求迁移到AMD上来。如果需求端只是因为AMD便宜而过来,而不是因为AMD本身的技术优势,那这个商业模式就有被价格战打穿的风险。
3.2 计费模式设计:按Token、按时长、还是按节点
变现平台绕不开的环节是定价。我梳理了一下,目前主流的算力计费模式有四种,各自适用的场景完全不同:
| 计费模式 | 原理 | 适用场景 | AMD平台的优势 |
|---|---|---|---|
| 按Token计费 | 按模型生成的Token数量收费 | LLM API服务、应用集成 | 显存大、可跑大模型,单Token成本低 |
| 按小时/按天计费 | 按GPU占用时长收费 | 开发者调试、微调、批量任务 | 单价低于同档NVIDIA卡 |
| 预留实例 | 预付费锁定一段时间的专属算力 | 对延迟敏感的生产业务 | 价格弹性大,适合长期包 |
| 收益分成 | 平台和算力方按比例分成推理收入 | 双方共同运营模型服务 | 平台承担获客和运维,分成空间大 |
按Token计费是最考验技术功底的。你需要精确计算每个请求的输入输出Token数、能准确统计服务端实际处理的Token总数,最关键的是要防止"占着算力不生产"的情况——有的客户挂着长连接不发送请求,你得有对应的超时回收机制。按小时计费相对简单,但竞争更激烈,因为客户会拿你和NVIDIA卡的价格做直接对比。
在这个平台上,我反而最看好预留实例和收益分成两种模式。AMD卡的价格优势不是微弱的5%、10%,而是同显存容量下可能便宜40%以上。对于批量推理、离线生成这类对延迟不是极致敏感的业务来说,用长期预留的AMD卡能把单位成本压得非常低。而收益分成模式适合那些有模型但没算力、有客户但没分发渠道的团队,平台负责GPU侧,你负责模型侧,最后按收入分账,两边风险共担。
3.3 多租户隔离与安全:陌生人之间怎么互相信任
算力变现平台最容易被忽视但最致命的问题是安全。当供给方和需求方是陌生人时,你必须回答三个问题。
第一个问题是租户隔离。多个客户共享一张GPU跑推理时,一个客户的显存刷爆了会不会影响隔壁?一个客户提交的恶意prompt会不会导致进程崩溃,进而影响其他人的服务?解决方案不外乎三种:进程级隔离(每个租户独立进程)、容器级隔离(gVisor/Kata这类安全容器)、以及GPU分区技术。目前大多数轻量化平台用的是进程加容器方案,配合cgroup限制CPU和内存,显存层面靠的是CUDA/HIP的进程隔离机制,但说实话,硬隔离程度有限。如果平台要做高价值客户的生产级业务,这个坑迟早要补。
第二个问题是数据安全。客户把业务数据发到别人的GPU上做推理,数据在内存里、在显存里、在日志里都是明文。平台至少要提供端到端加密传输、显存释放时的数据擦除、日志脱敏。如果客户有更高级别的合规要求,可能还需要TEE(可信执行环境)方案,但AMD的SEV-SNP在AI推理场景还很不成熟,所以目前大多数平台在数据安全上打的是"合同约束+传输加密"的底子。
第三个问题是用量证明。客户说"你这个卡太慢了,只生成了100个token",供给方说"我明明处理了1000个",没有可信的计费凭证,纠纷迟早会发生。所以平台一定要做可审计的日志链路:每个请求的进入时间、排队时长、处理时长、输入输出Token数、GPU利用率都要记录在案,而且要对需求方开放查询接口。这部分的工程投入会远超你的想象,但也正是这类"脏活累活"构成了平台的护城河。
4. 把AMD GPU接进变现平台:从选卡到上线的完整实操
4.1 硬件选型:什么样的AMD卡适合接入
不是所有AMD GPU都适合做LLM推理变现。我先给一个选卡建议表,再解释为什么:
| 显卡型号 | 显存 | 适合场景 | 是否推荐接入 |
|---|---|---|---|
| Instinct MI300X | 192GB HBM3 | 大模型推理、70B+级别单卡部署 | 强烈推荐 |
| Instinct MI325X | 256GB HBM3E | 超大模型推理、长上下文 | 强烈推荐 |
| Instinct MI210/MI250 | 64GB/128GB HBM2E | 中小模型推理、微调 | 可以接入 |
| Radeon RX 7900系列 | 24GB GDDR6 | 小模型实验、个人开发 | 不建议商用 |
| Instinct MI100 | 32GB HBM2 | 老架构、ROCm支持有限 | 不推荐 |
选卡的核心原则是:显存容量决定了你能跑多大的模型,显存带宽决定了你能跑多快,而能不能进入ROCm的官方支持列表决定了你会不会踩坑。MI100这种老卡虽然便宜,但ROCm版本支持的天花板很低,很多新框架版本直接放弃,你贪便宜拿到手反而成了吞时间的黑洞。RX 7900这类消费级卡虽然便宜,但24GB显存跑现在的开源大模型很吃力,而且驱动栈、稳定性跟Instinct系列完全不是一个级别,商用场景别碰。如果预算只够买消费卡,我的建议是先去平台试试水,别急着大规模投入。
4.2 软件环境搭建:从裸机到能跑推理服务
拿到卡之后,第一步是装系统。推荐Ubuntu 22.04 LTS,内核直接选官方支持列表里的版本。ROCm安装现在有两条路,一条是直接用官方的Docker镜像,一条是宿主机装ROCm再加Python环境。我建议你要是只做推理服务,直接用Docker镜像,干净、可复现、版本可控;要是还需要在宿主机上跑训练、调试算子,那就老老实实装宿主机版本,因为容器里的调试体验确实一般。
宿主机安装大概是这么几步:
# 1. 添加AMD ROCm官方软件源 wget https://repo.radeon.com/amdgpu-install/latest/ubuntu/jammy/amdgpu-install_6.3.60302-1_all.deb sudo apt install ./amdgpu-install_6.3.60302-1_all.deb sudo amdgpu-install --usecase=rocm # 2. 验证ROCm环境 rocminfo | grep -i "Marketing Name" hipconfig --full # 3. 安装PyTorch的ROCm版本(关键:镜像源要对) pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/rocm6.0 # 4. 安装vLLM的ROCm版本 pip install vllm==0.6.3.post1+rocm这三步看着简单,实际的坑主要在版本匹配上。PyTorch、ROCm、vLLM三者的版本必须咬合在一起,不是各装最新的就完事。我的经验是:先确定ROCm版本,再去找对应的PyTorch官方ROCm wheel,最后选一个跟这个PyTorch版本匹配的vLLM。顺序反了,就会遇到各种ABI不兼容的报错,包括但不限于undefined symbol、hipErrorNoBinaryForGpu。还有一个容易被忽略的点:某些主板的IOMMU设置会影响AMD GPU的DMA操作,如果你发现推理服务偶尔卡死,先去看看BIOS里的IOMMU和ACS设置,这问题跟ROCm版本无关,纯属硬件平台层面的玄学。
4.3 用vLLM部署并接入变现平台的完整流程
环境装好之后,部署一个推理服务并接入平台,核心流程分四步。
第一步是把模型下载好,整理成标准格式。比如我们部署Qwen2.5-72B-Instruct,用Hugging Face的API拉权重,要指定rocm兼容的tokenizer配置。第二步是启动vLLM服务:
python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen2.5-72B-Instruct \ --tensor-parallel-size 1 \ --max-model-len 32768 \ --gpu-memory-utilization 0.92 \ --host 0.0.0.0 \ --port 8000第三步是验证服务连通性。用OpenAI SDK直接调这个端口:
from openai import OpenAI client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY") resp = client.chat.completions.create( model="Qwen/Qwen2.5-72B-Instruct", messages=[{"role": "user", "content": "用一句话解释什么是算子"}], temperature=0.7 ) print(resp.choices[0].message.content)第四步是把服务注册到平台。平台一般会给一个节点注册脚本,会跑一个健康检查和基准测试,测一下你这张卡的实际吞吐量、首Token延迟,然后根据测试结果给你一个算力评级,决定你的服务能接多大的流量、按什么价格计费。这一步特别提醒:别在平台跑基准测试的时候偷偷调低--max-model-len来刷高吞吐数据,平台后续会按实际生产流量跟你对账,作弊只会导致评级和实际承载能力不符,最后吃亏的还是你自己。
4.4 性能调优:让AMD卡赚更多的钱
同样是MI300X,不同配置下的收入差距可以到一倍以上。因为变现平台按Token计费时,单位时间的Token产出量直接决定了你每小时的收入。我实测了几个重要的调优参数,分享给大家:
第一是--gpu-memory-utilization。默认值0.9,但如果你要跑长上下文,建议留一点余量,我会调到0.92~0.95。这个参数决定KV Cache能占多大空间,直接影响并发能力。但别贪,设太高会导致显存碎片化,反而触发OOM。第二是并发度(--max-num-seqs)。这个参数控制一个批次同时处理多少个请求。对AMD卡来说,因为显存带宽大,并发度可以适当调高,我通常从默认的256调到512左右,配合PagedAttention能明显提升吞吐。
第三是--enable-prefix-caching。如果你的服务面向聊天机器人这类有固定system prompt的场景,开启前缀缓存可以省掉大量重复的prefill计算,实测在长system prompt场景下吞吐能提升30%以上。第四是编译优化。ROCm支持通过hipcc --offload-arch指定目标架构,如果你能确认你的部署架构,可以给vLLM配一个针对性编译的算子库,减少JIT编译带来的启动延迟和kernel dispatch开销。
这些调优看起来琐碎,但真实影响是:同一个模型,调优前后的吞吐可以从每秒800 token提升到1500 token。在按Token计费的模式里,这就意味着收入翻倍。我建议每个接入平台的持卡用户都建一个自己的benchmark脚本,每次改配置都跑一遍,留存数据,方便跟平台的对账单比对。别嫌麻烦,这钱省不了。
5. 这张桌子怎么排:生态影响、平台风险与普通人怎么上车
5.1 对NVIDIA算力价格体系的潜在冲击
稍微把视角拉远一点。如果AMD GPU变现平台真的跑起来了,首当其冲被影响的是NVIDIA算力的价格体系。目前H100的价格那么坚挺,供需紧张是一方面,更关键的是没有足够强的替代品。MI300X的显存和带宽在推理场景完全不虚H100,之前差距在软件和生态。如果Embedded LLM把AMD算力的分发做得足够顺滑,让需求方能像租NVIDIA卡一样租AMD卡,那对价格敏感的推理业务来说,转向AMD的诱惑太大了。
具体点说,推理成本在大模型应用的总成本里占比很高,尤其是长上下文和批量生成场景。同样是1000万Token的日处理量,用H100和用MI300X的成本差距可能达到一半以上。这个成本优势一旦通过变现平台传导到需求端,会有大量非延迟敏感业务从NVIDIA迁移过来。对广大开发者来说,这是好事——价格战意味着更低的算力成本,意味着AI应用的毛利空间变大。
5.2 平台方的三座大山:稳定性、信任与生态绑定
但作为从业者,我也要冷静说一句:这类平台没那么容易做起来。三个风险点,每一个都可能让项目翻车。
第一是算力供给的稳定性。算力提供方不是专业云厂商,没有SLA意识,今天说好了7x24小时在线,明天机房断电了、网络断了、GPU驱动崩了,客户那边体验就会很差。平台需要在每个节点上部署实时健康检查、故障自动摘除、补偿机制,这背后是大量的监控和运维工程。第二是信任建立。让客户把生产流量放到一个刚上线的平台上,难度极大。客户会问:你们跑路了怎么办?我的数据安全吗?你说故障了有补偿,拿什么担保?创业团队通常的回答是"我们有第三方托管、有保险、有审计",但最终能给出可信答案的平台少之又少。这个信任壁垒,不是靠融资新闻能砸开的。
第三是AMD生态的绑定风险。平台把整个商业逻辑押在AMD的ROCm生态上,如果AMD某天改了策略、调整了驱动接口、或者官方下场自己做算力市场,平台就会非常被动。所以聪明的平台一定会同时做技术中立化,把对特定厂商的依赖降到最低,让接入NVIDIA GPU也只是改个后端配置的事。如果你问我对这个平台的长期判断,我会说:看它六个月后是继续死磕AMD,还是开始让平台支持异构GPU。前者说明它想做深,后者说明它想做大。
5.3 开发者、持卡用户、模型创业团队各自的机会窗口
最后说说不同角色的人在这波机会里怎么卡位。
如果你是持卡用户,手里有一批AMD Instinct卡,当前最重要的不是急着挂上去赚钱,而是先把卡的调度、监控、安全基线做好。你可以先接入平台试运行,选收益分成模式,让平台帮你找客户,跑一个月看看真实收益和故障率,再决定是否加大投入。如果你自己有运维能力,也可以同时把卡挂到两三个平台做对比,毕竟市场需求方不会只在一个平台下单。
如果你是AI应用开发者,可以去研究一下这类平台的API,提前把推理服务从不依赖特定GPU的框架上抽象好。我的建议是:你的推理层只用OpenAI兼容接口,底层不管是NVIDIA还是AMD都无所谓。这样当AMD算力的价格优势传导到你面前时,你能第一个切换过去。别等到别人已经用上便宜算力把价格打下来了,你还在纠结迁移成本。
如果你是做模型服务、模型微调的创业团队,这波机会的核心是"把模型能力产品化"。你有模型、有客户,缺的是便宜算力。接入这类AMD变现平台,相当于用更低的成本交付同样的服务,直接体现在毛利率和报价竞争力上。你甚至可以把模型打包成私有API,挂到平台上做收益分成,让平台帮你导流。有一点要提醒:别把全部业务押在一个算力平台上,一定要保留一个NVIDIA的备用通道,毕竟任何初创平台都有跑路或倒闭的可能,你的客户交付承诺不能跟着一起倒。
我个人觉得,真正的机会不在于做平台的跟随者,而在于围绕"AMD算力变便宜了"这件事重构自己的成本结构。当算力市场出现结构性价格变化时,最先调整成本结构的人,会在下一轮竞争中拿到最大的红利。这个逻辑在云计算时代验证过一次,在今天的AI算力市场大概率会再验证一次。