核心原理:先“打草稿”,再“批改”
你把大模型想象成一个超级学霸。
它写答案特别厉害,但速度很慢,一个字一个字地写。
DSpark的做法是:先找个学渣(小模型)快速猜出一大段话(打草稿),然后让学霸一次性“批改”。
学霸批改的时候,猜对的直接通过,猜错的地方才重写。
因为是一次性批改10个字,而不是一个字一个字写,所以速度暴增。
两个关键创新
第一招:半自归生成
以前的学渣要么“一个字一个字猜”(慢但准),要么“一次猜一长串”(快但后面全是错的)。
DSpark把它们结合起来——先并行猜主干,再用一个小模块补充词与词之间的关联。这样既快又准。
第二招:置信度调度验证
你上学时,是不是有些学霸会先扫一眼作业,把明显错的先挑出来?
DSpark也学会了这个——它给每个候选token打一个“存活概率”,系统忙的时候,直接跳过那些“大概率被拒绝”的token,把算力留给真正需要校验的地方。
配套开源项目:DeepSpec
DeepSeek这次不只是开源了DSpark,还开源了一个全栈平台DeepSpec。
它帮你把“训练草稿模型→跑评估→部署加速”的流程全包了。
GitHub地址: https://github.com/deepseek-ai/DeepSpec
image.png
image.png
论文地址: https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf
实操:怎么用?
方案A:直接调用API(最简单)
直接调DeepSeek-V4-Flash-DSpark或V4-Pro-DSpark的API,零部署。
DeepSeek官方没有单独开一个“DSpark版API”,而是直接把加速集成到现有模型里了。你打开DeepSeek官网的API开放平台:https://platform.deepseek.com
选择V4-Flash或V4-Pro的API进行调用,就已经在享受DSpark加速了。
方案B:本地部署(自己动手)
Hugging Face上已经发布了两个DSpark版模型权重:
deepseek-ai/DeepSeek-V4-Pro-DSpark(889B参数)
deepseek-ai/DeepSeek-V4-Flash-DSpark(165B参数)
用vLLM部署:
安装vLLM
pip install vllm
启动DSpark加速的V4-Flash模型
vllm serve “deepseek-ai/DeepSeek-V4-Flash-DSpark”
用SGLang部署:
pip install sglang
python3 -m sglang.launch_server
–model-path “deepseek-ai/DeepSeek-V4-Flash-DSpark”
–host 0.0.0.0
–port 30000
然后你的API地址就是:
http://你的服务器IP:8000/v1/chat/completions
然后你就可以在本地体验“秒回”了。
直接当OpenAI兼容接口用就行。注意Flash版165B参数,至少需要8卡A100的企业级服务器才能跑,Pro版还未公开配置,但从参数量上看肯定要多很多。
要想自己部署测试或进行复现,可以访问九章智算云,轻松获得大卡资源。有需要的朋友请联系峰哥。
注意:数据准备阶段存储需求极大
如果你要自己训练草稿模型,注意了——默认配置下的KV Cache大概需要38TB存储空间。
所以,除非你是大企业,否则老老实实直接调用API或下载官方已经训练好的模型即可。
六、读者可能的问题,我替你问了
Q1:DSpark会让AI的回答变差吗?
A:不会。它用了“拒绝采样”机制,数学上严格保证输出分布和原模型一致。快是快了,质量一丝一毫都没动。
Q2:我的显卡能跑吗?
A:165B参数的Flash-DSpark版,8张A100就能跑。企业级部署门槛不高。
Q3:DSpark只支持DeepSeek自己的模型吗?
A:不是。论文和实测显示,DSpark对Qwen、Gemma、LLaMA等主流开源模型同样适用。它是个通用“加速插件”。
Q4:对普通用户有什么实际好处?
A:更快的AI客服、更流畅的AI编程助手、更便宜的API服务。以后你点个“帮我写方案”,AI几乎秒回。
Q5:它们开源协议是什么?
A:MIT协议,商用、二次开发无版权限制。