之前在做 AI 应用调研时,我注意到一个很有意思的现象:明明英伟达拥有全球最核心的 GPU 产能,几乎垄断了高端 AI 芯片市场,但普通开发者使用大模型时,都是向 OpenAI、Anthropic、智谱、DeepSeek 这些模型厂商付费,按 token 计费。
英伟达为什么不亲自下场卖 token?
如果它既卖算力芯片,又直接面向开发者售卖模型 token,理论上不是可以赚到更多利润吗?
这个问题看似简单,背后却牵扯到商业模式边界、产业链分工、生态位保护等关键逻辑。这篇文章我会从 token 计费模型、英伟达的商业定位、GPU 与模型服务的成本结构几个角度,把这件事讲清楚。同时也会站在开发者视角,聊聊我们日常接触 token 时需要注意的技术细节和常见坑点。
1. token 到底是什么,为什么 AI 厂商爱按 token 收费
1.1 从“汉字拆字”理解 token
在深入讨论英伟达之前,先把 token 这个概念聊透。
大模型本身并不直接理解文字、单词或句子,它处理的是数值。为了让模型能理解文本,我们需要把文本切分成一个个小的单元,再映射成数字向量。这个小的单元,就是 token。
举个例子:
你好,世界!
如果按常见的大模型分词方式,这句话可能被切成若干个 token,比如“你好”“,” “世界”“!”或者更细粒度的字节级片段。
不同模型使用的 tokenizer(分词器)不一样,切分方式也不同。有的模型一个汉字可能对应 1 个 token,有的可能对应 2 个 token。英文单词通常 1 个单词可能是 1 或 2 个 token,也可能被拆成多个子词。
那为什么 AI 厂商喜欢按 token 收费?
根本原因在于:token 数量直接决定了模型的计算量。
- 输入 prompt 越长,模型需要处理的前缀计算越多。
- 输出内容越长,模型需要自回归生成一步、一步地推出更多 token。
- 上下文越长,KV Cache 占用的显存也越多。
所以 token 数量是最贴近真实资源消耗的计费维度。按 token 计费,本质上是一种“资源用量计费模式”,类似云计算的按量付费。
1.2 一套典型的 token 计费结构
大多数大模型 API 的计费包含两部分:输入 token 和输出 token。通常输出的单价会高于输入单价,因为生成阶段是逐步推理的,计算成本更高。
{ "model": "example-chat-model", "prompt_tokens": 120, "completion_tokens": 80, "total_tokens": 200 }这就是一个常见的 API 响应片段。调用大模型接口时,服务商通常会在响应里返回 usage 信息,里面包含 prompt_tokens、completion_tokens、total_tokens,方便开发者统计每次调用的消耗。
1.3 开发者如何预估 token 消耗
实际开发中,我们经常需要估算一段文本大概占多少 token。这里有两种常用方式。
第一种是使用模型厂商官方的 tokenizer 工具,比如 OpenAI 开源了 tiktoken,可以直接在 Python 中计算 token 数量:
import tiktoken encoding = tiktoken.get_encoding("cl100k_base") text = "Hello, world! 你好,世界!" tokens = encoding.encode(text) print("token 数量:", len(tokens)) print("token 列表:", tokens)运行这段代码,会打印出文本切分后的 token 列表和数量。对开发者来说,在构造 prompt 之前先估算 token,能有效控制成本,避免出现请求量过大导致账单飙升的情况。
第二种是使用模型服务商控制台自带的 Tokenizer 工具。大多数平台都提供了可视化调试页面,你可以直接输入文本,系统会展示 token 切分效果。
很多开发者误以为“1 个汉字 = 1 个 token”,这个说法在部分中文大模型中成立,但换成英文模型或不同分词策略时结论就变了。在做成本预估时,最好用官方 tokenizer 跑一遍,不要凭经验猜测。
2. 英伟达的业务图谱:芯片之外,它到底靠什么赚钱
2.1 英伟达的主营业务构成
一说起英伟达,很多人第一反应是“卖显卡的”。这没错,但它的业务早就不是单纯卖 GPU 这么简单。
从业务板块来看,英伟达的收入主要来自以下几块:
| 业务板块 | 核心产品 | 目标客户 |
|---|---|---|
| 数据中心计算 | A100、H100、H200、B200 等 GPU,以及 DGX 服务器 | 云厂商、大型互联网公司、科研机构 |
| 专业视觉与工作站 | RTX 专业显卡、Omniverse 平台 | 设计、影视、仿真行业 |
| 汽车业务 | NVIDIA DRIVE 平台 | 整车厂、自动驾驶公司 |
| 消费级游戏显卡 | GeForce RTX 系列 | 玩家、创作者 |
而 AI 时代最受关注的是数据中心计算业务,它是英伟达市值飙升的核心引擎。
2.2 英伟达已经做算力服务了
很多人可能不知道,英伟达不只是卖物理芯片,它也有了自己的云服务产品。
比如 NVIDIA DGX Cloud,它提供的是“GPU 算力即服务”,企业可以不自己买显卡,而是按周期租用英伟达的 GPU 算力,在上面跑模型训练和推理任务。
再比如 NVIDIA AI Enterprise,这是一套企业级 AI 软件平台,包含 CUDA、cuDNN、Triton Inference Server、NIM 微服务等组件,帮助企业快速部署和管理 AI 工作负载。
你会发现一个规律:英伟达在做的是“卖算力基础设施”,而不是“卖模型推理结果”。
2.3 英伟达自己有哪些大模型?
这里要区分一下。英伟达其实也发布了若干模型,比如 Nemotron 系列,包括用于智能体场景的 Llama-Nemotron 模型,也有用于代码生成的模型。
但英伟达发布这些模型,更多是为了展示 GPU 能力、完善生态工具链,而不是为了成为一家“通用大模型 API 服务商”。
它并不想靠“输出 token”来赚钱,它想让你相信“用英伟达的 GPU 来跑 token 生成,才是最省钱的”。
3. 核心问题:英伟达为什么不亲自售卖 token
3.1 商业模式定位的冲突
要理解这个问题,我们需要先梳理 AI 产业链的上中下游。
上游是算力硬件,包括 GPU、CPU、网络设备、存储设备。英伟达是这一层的绝对霸主。
中游是模型与平台,包括基础大模型、模型微调平台、推理服务、云服务。OpenAI、Google、Anthropic、智谱、DeepSeek 等厂商在这一层竞争。
下游是应用与终端,包括各类 AI 应用、智能体、办公软件、垂直行业解决方案。
如果英伟达亲自下场售卖 token,会发生什么?
它就不再是“中立的上游供应商”,而是直接变成了中游模型服务商的竞争对手。那些大模型厂商今天还在疯狂采购 H100、B200,转头发现英伟达自己也推出了一个大模型 API,并且按 token 收费。你觉得它们还会继续把英伟达当作最亲密的合作伙伴吗?
这不是猜测,而是商业利益层面的必然冲突。
3.2 卖铲子比淘金更稳定
在淘金热里,最赚钱的不一定是挖到黄金的人,而是卖铲子的人。这个比喻虽然老了点,但在 AI 时代依然成立。
英伟达现在的核心策略就是“卖铲子”。GPU 是训练和运行大模型的必需品,只要全球 AI 训练和推理需求在增长,英伟达就可以源源不断地卖出高毛利芯片。
相比之下,卖 token 是一门需要长期运营、不断优化模型、持续投入研究和迭代的生意。模型效果不好,用户会立刻流失;竞争对手推出更便宜的模型,定价权也会被削弱。
更重要的一点是:token 服务的利润率不一定比卖 GPU 更高。
从公开财报可以窥见,英伟达数据中心的毛利率极高。而大模型 API 服务商的利润空间反而受制于推理成本和激烈的价格战。过去一年,国内外大模型 API 的价格一路走低,很多厂商都在通过降价换市场。
这种背景下,英伟达不可能放弃高毛利的硬件核心业务,转头扎进低价竞争的 token 市场。
3.3 英伟达不卖 token,那云厂商为什么不自己做芯片?
这个问题经常被拿来对比。
实际上,云厂商确实在尝试自研芯片。Google 有 TPU,亚马逊有 Trainium 和 Inferentia,微软也在推进自研 AI 芯片。但它们的逻辑和英伟达不一样:云厂商本来就提供 token 服务,自研芯片是为了降低采购成本和供应链风险,同时提升云产品的利润空间。
也就是说,云厂商是“模型服务商 + 芯片自研者”的双重身份。而英伟达不具备模型服务商的身份,也不需要冒险去摧毁自己的核心护城河。
3.4 直接卖 token 会带来哪些技术挑战
除了商业层面的冲突,直接售卖 token 对英伟达来说也意味着进入一个完全不同的技术领域。
卖 GPU 的核心是硬件工程、驱动开发、互连通信、散热设计。而卖 token 的核心是大模型训练、RLHF、推理优化、并发调度、内容安全、用户增长、API 网关、计费系统。这两套技术栈虽然有关联,但能力要求差异巨大。
一个典型的 token 服务需要具备以下能力:
- 高并发推理引擎,能在毫秒级响应大量用户请求。
- 弹性伸缩策略,应对潮汐式的调用流量。
- 多用户隔离和配额管理,确保单个用户不会耗尽整体资源。
- 内容安全和合规审核,避免模型生成违规内容。
- 完善的开发者平台,包括文档、SDK 和调试工具。
这些能力不是英伟达的强项,如果硬要做,需要投入巨大的人力物力,而且成功的概率并不高。
4. 如果英伟达真的卖 token,会怎样
我们可以做一个思想实验:假设英伟达发布了一个“NVIDIA Token”服务,会带来哪些连锁反应?
4.1 现有客户关系的瓦解
英伟达的最大客户是谁?是 OpenAI、微软、Google、亚马逊、Meta,以及无数 AI 创业公司。
这些客户对英伟达又爱又怕。爱的是它的 GPU 性能确实无可替代;怕的是供应紧张、价格上涨。如果英伟达自己也做模型 API,这些客户会立刻调整采购策略,扶持 AMD、自研芯片或者其他算力渠道,降低对英伟达的依赖。
这条路风险极大,得不偿失。
4.2 生态内外的双重竞争
在生态内部,英伟达和云厂商之间有紧密合作。很多云厂商的实例就是搭载 NVIDIA GPU 的。
在生态外部,英伟达又在跟云厂商的“自研芯片方案”竞争。
如果英伟达进入 token 市场,合作关系会被进一步挤压。云厂商会担心,自己用了英伟达的 GPU 来跑模型服务,结果英伟达转头用自己的 GPU 资源做 token 服务,既当供应商又当竞争对手。
这样的局面会让“GPU 销售 + 云合作”这条路越来越难走。
4.3 利润率可能反而下降
卖硬件是相对直接的商业模型:研发、生产、销售、交付,然后产生利润。
卖 token 则是高成本运营模型:模型训练要烧钱,工程师团队要烧钱,客服支持要烧钱,内容安全要烧钱。国内外的模型 API 又在疯狂打价格战,token 单价一直在往下走。
如果英伟达把资源从 GPU 研发转向 token 运营,反而可能导致整体利润率下滑。
5. 那英伟达在 AI 时代到底在卖什么
5.1 卖 CUDA 生态
英伟达最强的护城河之一,是 CUDA 软件生态。
全球有数百万开发者习惯用 CUDA 进行 GPU 编程。无论是 PyTorch、TensorFlow 还是 JAX,底层调用的都可能是 CUDA 库。这种软件生态的粘性极强。
如果你用了 CUDA 生态,即使某天竞争对手的芯片性能追上来,迁移成本依然很高。所以英伟达很舍得在软件生态上投入,比如开源大量库、提供开发者培训、举办 GTC 大会。
5.2 卖一站式 AI 基础设施
英伟达现在更愿意做的是“AI 工厂”的解决方案商。
从芯片到服务器,从网络到存储,从集群管理到推理框架,英伟达希望提供一个完整的 AI 基础设施方案。企业只需要购买这个方案,就可以快速搭建自己的 AI 平台,而不需要自己处理底层软硬件的复杂适配。
这种模式的核心诉求是:让英伟达成为 AI 时代最底层的“基础设施供应商”。它不需要依赖某一个具体的模型产品赚钱,因为无论哪家模型公司赢,英伟达都能通过底层硬件获利。
5.3 英伟达的“免费 token”是什么
这里要提一个容易混淆的概念。
有些开发者会搜索“英伟达免费 token”,其实这不是英伟达在售卖 API token,而是英伟达在 NVIDIA NIM、NVIDIA Developer Program 等平台上提供的免费试用额度或演示资源。
比如英伟达的 NIM 微服务,提供了推理服务的容器化部署方案,开发者在一些免费资源配额内可以快速体验模型推理能力。这种“免费试用”和直接售卖 token 是两码事。
它更像是一种生态培育手段:让开发者先体验英伟达的推理软件平台,熟悉之后,再到云环境或企业环境购买完整解决方案。
6. 开发者视角:理解 token 计费,避免踩坑
虽然不是所有人都会去搭建一套大模型 API 服务,但作为开发者,理解 token 计费对日常开发非常有帮助。我结合常见的报错场景,整理了下面这些高频问题。
6.1 token 用量如何计算
计算 token 用得最多的地方,是成本预估。
以大模型 API 调用为例,影响 token 用量的变量主要有几个:
- 系统提示词(system prompt)的长度
- 上下文的长度
- 用户输入的长度
- 模型输出内容的长度
如果你的应用需要频繁调用大模型,最好在服务端记录每次调用的 usage 信息,按用户或按任务维度统计 token 消耗。
下面是统计 token 用量的一个简单思路:
def log_token_usage(user_id, task_id, usage): total_tokens = usage.get("total_tokens", 0) prompt_tokens = usage.get("prompt_tokens", 0) completion_tokens = usage.get("completion_tokens", 0) print( f"用户 {user_id} 任务 {task_id} " f"消耗 token {total_tokens} " f"(输入 {prompt_tokens} / 输出 {completion_tokens})" )在实际项目中,可以将这些数据写入日志或数据库,用于后续的成本分析和配额控制。
6.2 token 失效是什么意思
开发中经常听到“token 失效”的说法。这里要区分两种情况。
一种是 API Key 过期。很多模型平台颁发的 API Key 有有效期,到期后请求会返回 401 Unauthorized,提示 invalid token 或 authentication failed。
另一种是会话 token 失效,比如在单点登录系统里,JWT 过期导致登录态失效,需要重新登录。
这两种场景其实都和“大模型 token 计费”无关。前者属于密钥管理,后者属于用户认证体系。
6.3 cookie、session 与 token 的区别
有一些初学者会混淆 cookie、session 和 token。简要说一下:
- cookie 是存储在浏览器端的少量数据,每次请求自动携带。
- session 是存储在服务端的会话数据,通过 session id 关联用户状态。
- token 是一种凭证,通常由服务端签发,客户端保存后随请求发送,服务端校验其有效性。
在 AI 应用里,token 往往用于两层含义:一是大模型的文本切分单元,二是认证凭证。遇到“token 过期”这类问题,要先确认说的是哪一层含义,再对症排查。
6.4 常见 token 报错及处理
结合平时开发经验,我整理了一张 token 相关报错的排查表:
| 问题现象 | 常见原因 | 解决思路 |
|---|---|---|
| 401 Unauthorized: invalid token | API Key 错误或已过期 | 检查密钥是否有权限,重新生成并配置 |
| token 数量超过模型上下文限制 | prompt 长度超出模型窗口 | 做 prompt 截断、摘要压缩或分段处理 |
| token 消耗过快、账单异常 | 循环调用或未做重试限制 | 增加调用频率限制,设置单用户配额 |
| token exchange failed | 认证服务端异常或网络不通 | 检查认证服务地址、网络策略和服务可用性 |
| token endpoint returned 403 forbidden | 服务端策略拒绝该请求来源 | 检查账号区域、访问策略、请求来源 IP 是否被服务商允许 |
| credits 兑换 token 比例不清晰 | 平台按积分/额度方式计费 | 查阅平台官方计费文档,按实际模型定价测算 |
注意,遇到 403 forbidden 这类报错时,首先要检查服务商是否允许你所在区域的账号访问,以及请求来源 IP 是否符合服务商策略。任何绕过服务商区域限制的做法都不可取,不仅违反平台条款,也可能带来安全风险。正确的做法是使用服务商认可的访问方式,或联系平台获取官方支持。
6.5 如何在代码中避免 token 超限
调用大模型时,一个非常常见的问题就是“prompt too long”。
解决思路通常有这几种:
- 提前估算 prompt 的 token 数量,超过阈值前进行截断。
- 对长文本做摘要,保留关键信息。
- 使用支持更长上下文的模型。
- 把长文本拆分成多个片段,分批处理。
下面是一个简单的长度预检示例:
MAX_INPUT_TOKENS = 3000 def validate_prompt(prompt, tokenizer): token_count = len(tokenizer.encode(prompt)) if token_count > MAX_INPUT_TOKENS: raise ValueError(f"prompt 过长,当前 {token_count} token,超过限制 {MAX_INPUT_TOKENS}") return token_count在实际工程中,还可以在异常捕获里增加降级逻辑,比如提示用户缩短输入,或自动触发摘要任务。
7. 英伟达与 token 的产业分工:谁在赚哪一份钱
到现在,我们已经把英伟达不卖 token 的原因拆得很清楚了。总结一下,核心逻辑可以归纳为三点。
7.1 产业链定位决定商业模式
英伟达希望做 AI 时代的算力基础设施供应商,它赚的是“芯片 + 软件栈 + 云计算”的钱。而 token 售卖属于模型服务层的生意,需要直接面向开发者、面对用户运营,和英伟达目前的商业模式存在结构性冲突。
7.2 生态保护决定合作边界
英伟达的大客户里有大量模型服务商。如果英伟达亲自卖 token,就相当于和客户竞争。这不是能力问题,而是信任问题。一旦客户产生“英伟达会抢我生意”的顾虑,英伟达的芯片优势也会被削弱。
7.3 利润结构决定选择理性
GPU 是高毛利产品,而 token 服务正面临激烈的价格战。从商业收益角度看,英伟达没有理由主动进入一个毛利率下降、竞争惨烈、且可能破坏现有主业的赛道。
8. 关注 token,也关注产业链
通过这篇文章,我们清楚了几个关键点:
- token 是大模型的文本切分单元,也是 AI API 计费的核心维度。
- 按 token 计费的本质是按资源消耗计费。
- 英伟达不是没能力卖 token,而是它更适合做 GPU 和算力基础设施供应商。
- 英伟达的战略是通过 CUDA 生态、AI Enterprise 软件栈、DGX Cloud 等方式,锁定 AI 产业链最底层的位置。
对开发者来说,理解 token 不只是为了读懂账单。在设计 AI 应用时,token 估算、上下文管理、成本控制和异常处理,都是真实落地时绕不开的工程问题。只有理解了 token 的经济学,才能做出既好用又可控成本的 AI 产品。
至于未来英伟达会不会推出一款“英伟达自家大模型 API”,我认为不会轻易发生。更大的可能是,英伟达继续用硬件、软件和生态,推动整个 AI 产业向前走,让更多玩家在模型和应用的赛道上去竞争。而我们会继续一边用着 GPU 加速的算力,一边为大模型的 token 买单。