一、模型速览
腾讯混元(Tencent Hy)在 2026 年 8 月 28 日正式发布并开源Hy4 preview,这是从 Hy3(295B 总参 / 21B 激活 / 256K 上下文)迭代而来的新一代 MoE 旗舰模型预览版。
发布方:腾讯混元团队(Tencent Hy Team)
参数量:770B 主干总参数,每 Token 激活 49B(256 路由专家 + 1 共享专家,每 Token 激活 Top-8 路由专家 + 共享专家);另有独立 MTP 层 10B 总参 / 0.7B 激活用于推测解码
上下文长度:原生 1M tokens(1,048,576),最大生成 64K
许可证:Apache License 2.0(无字段限制、无地域排除,可商用)
一句话定位:面向代码、办公分析、游戏原型、科研等真实生产力工作流的「数据中心级」开源 Agent 基座模型
一句话总结:它不是来陪你聊天的,是来钻进代码仓库、Office 文档、游戏引擎和科研流程里干活的。
二、核心亮点
亮点 1:Gated DSA 稀疏注意力 + IndexCache,让 1M 上下文「喂得起」
Hy4 的注意力模块采用门控版 DeepSeek 稀疏注意力(Gated DeepSeek Sparse Attention, DSA),并引入IndexCache——跨层复用稀疏选择索引,而非每层重复计算。这是 1M 上下文在推理成本上「真正可用」的关键。
# 官方 vLLM 部署时直接指定稀疏注意力后端
--attention-backend FLASHMLA_SPARSE数据来源:模型卡 / aicybr.com 部署解析(官方架构说明)
亮点 2:原生 MTP 推测解码层,提速写进权重里
与很多模型事后在推理框架里「外挂」投机解码不同,Hy4 在权重侧内置了一个MTP(Multi-Token Prediction)层(10B 总参 / 0.7B 激活),用于原生 next-token 预测加速。vLLM / SGLang 双双在官方预构建镜像里默认开启。
# 开启原生 MTP 推测解码(每步预测 3 个 token)
--speculative-config '{"method": "mtp","num_speculative_tokens": 3}'数据来源:Hugging Face 模型卡 deployment 章节
亮点 3:49B 激活的「大库小用」MoE,兼顾能力与成本
770B 的「专家库」,每道题只叫最相关的一批专家(Top-8 路由 + 1 共享)上场,计算量按 49B 走。相比同等能力的稠密模型,推理算力大幅下降,这也是它能把 API 价格压到输入 6 元 / 百万 tokens、输出 18 元 / 百万 tokens、缓存命中 0.3 元的底气。
数据来源:腾讯混元官方公告(2026-08-28)
亮点 4:Agentic 基准全面领先同级开源
官方在 agentic 维度的公开分数相当能打(数据来源:模型卡 / explainx.ai 整理):
| 基准 | Hy4 preview | 说明 |
|---|---|---|
| Terminal-Bench 2.1 | 85.4 | 终端自动化,Agent 核心能力 |
| MCP-Atlas (public) | 83.7 | 工具调用编排 |
| SWE-Bench Pro | 65.7 | 真实软件工程 |
| CyberGym | 78.4 | 网络安全任务 |
| OfficeQA Pro | 66.2 | 跨文件办公分析 |
| GPQA Diamond | 92.3 | 研究生级科学推理 |
亮点 5:no_think直答开关,关掉过度自我验证
官方承认 preview 版在复杂任务上「思考偏长、过度自我验证」。为此提供reasoning_effort: no_think参数,一键切回快速直答模式:
# 关闭深度思考,适合简单问答 / 低延迟场景
extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}}数据来源:Hugging Face 模型卡
亮点 6:iHC 残差超连接 + 相比 Hy3 的代际跃迁
Hy4 用identity Hyper-Connections(iHC)跨 4 条残差流拓宽层间信息流,缓解超深 MoE(78 层)的训练/推理梯度问题。相比 Hy3(295B 总参 / 21B 激活 / 256K),官方附录 46 项成绩全部高于 Hy3,几个提升夸张的:
DeepSWE:28.0 → 64.3(+36.3)
SWE Atlas Codebase Q&A:30.8 → 64.0
MathArena Apex 2025:38.7 → 74.2
Toolathlon-Verified:56.2 → 74.1
数据来源:腾讯混元官方对比附录(2026-08-28)
从 Hy3 到 Hy4 preview 仅 53 天,规模 2.6×、上下文 4×——国产开源的迭代节奏还在加速。
三、部署实战
⚠️ 重要前提:Hy4 preview 是数据中心级模型。BF16 权重约 1.54TB,FP8 权重约 770GB,单机消费级显卡无法本地部署。官方 recipe 默认8 卡张量并行。以下给出生产可用的完整命令,复制即可跑(需 8×80GB+ 显存,如 8×A100/H100/H800 或昇腾 Atlas 800I A3)。
3.1 环境准备
官方提供预构建 Docker 镜像,无需手动编译 vLLM:
# 拉取官方预构建镜像(多架构 x86 / Arm) docker pull vllm/vllm-openai:hy4-preview # 或通过 SGLang 部署 docker pull lmsysorg/sglang:hy4-preview如需从源码构建(指定 Python 3.12):
uv venv --python 3.12 --seed --managed-python source .venv/bin/activate git clone https://github.com/vllm-project/vllm.git cd vllm uv pip install --editable . --torch-backend=auto3.2 模型下载
通过 huggingface-cli 或 modelscope 拉取权重(FP8 变体体积更小,推荐生产用):
# BF16 原版(约 1.54TB,谨慎) huggingface-cli download tencent/Hy4-preview --local-dir /data/hy4 # FP8 量化版(约 770GB,推荐生产部署) huggingface-cli download tencent/Hy4-preview-FP8 --local-dir /data/hy4-fp8权重地址:https://huggingface.co/tencent/Hy4-preview (同步上线 ModelScope / GitCode / CNB)
3.3 启动推理服务(vLLM,8 卡 TP)
docker run --gpus all -p 8000:8000 --ipc=host \ -v ~/.cache/huggingface:/root/.cache/huggingface \ vllm/vllm-openai:hy4-preview \ tencent/Hy4-preview-FP8 \ --tensor-parallel-size 8 \ --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \ --attention-backend FLASHMLA_SPARSE \ --tool-call-parser hy_v4 \ --reasoning-parser hy_v4 \ --enable-auto-tool-choice \ --port 8000 \ --served-model-name hy4-preview或用裸命令(本地已装 vLLM):
vllm serve tencent/Hy4-preview-FP8 \ --tensor-parallel-size 8 \ --speculative-config.method mtp \ --speculative-config.num_speculative_tokens 3 \ --attention-backend FLASHMLA_SPARSE \ --tool-call-parser hy_v4 \ --reasoning-parser hy_v4 \ --enable-auto-tool-choice \ --port 8000 \ --served-model-name hy4-previewSGLang 等价命令:
docker run --gpus all --ipc=host -p 8000:8000 \ lmsysorg/sglang:hy4-preview \ python3 -m sglang.launch_server \ --model tencent/Hy4-preview-FP8 \ --tp-size 8 \ --reasoning-parser auto \ --tool-call-parser auto \ --speculative-algorithm NEXTN \ --speculative-num-steps 3 \ --speculative-eagle-topk 1 \ --speculative-num-draft-tokens 4 \ --port 8000 \ --served-model-name hy4-preview数据来源:Hugging Face 模型卡 deployment 章节 / bittide.aicompass.dev 整理
3.4 完整可运行推理代码(OpenAI 兼容)
服务起来后,直接用openaiSDK 调用,无需 extra 依赖:
# pip install openai from openai import OpenAI client = OpenAI( base_url="http://localhost:8000/v1", api_key="EMPTY", # 本地部署无需真实 key ) # 1) 默认 high 推理模式(深度思考,适合编程/数学/科研) resp = client.chat.completions.create( model="hy4-preview", messages=[{"role": "user", "content": "用 Python 写一个快速排序,并分析时间复杂度。"}], temperature=0.9, top_p=1.0, ) print("【深度思考】\n", resp.choices[0].message.content) # 2) no_think 直答模式(关闭 CoT,低延迟) resp2 = client.chat.completions.create( model="hy4-preview", messages=[{"role": "user", "content": "今天北京天气怎么样?用一句话回答。"}], temperature=0.9, top_p=1.0, extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}}, ) print("【直答】\n", resp2.choices[0].message.content) # 3) 工具调用(Agent 场景,需服务端已开 --enable-auto-tool-choice) tools = [{ "type": "function", "function": { "name": "get_weather", "description": "查询指定城市天气", "parameters": { "type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"], }, }, }] resp3 = client.chat.completions.create( model="hy4-preview", messages=[{"role": "user", "content": "帮我查下上海今天天气。"}], tools=tools, tool_choice="auto", ) print("【工具调用】\n", resp3.choices[0].message.tool_calls)3.5 效果验证
服务就绪后健康检查 + 冒烟测试:
# 检查模型已加载 curl -sf http://127.0.0.1:8000/v1/models # 发送一条推理请求 curl -sS -X POST http://127.0.0.1:8000/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{"model":"hy4-preview","messages":[{"role":"user","content":"Who are you?"}],"max_tokens":256,"temperature":0}'验证命令参考:Hugging Face 模型卡 / 昇腾适配文档
昇腾 0day 适配(国产算力可行)
发布当天昇腾即实现 0day 支持:基于vLLM-Ascend在 Atlas 800I A3(16 卡)上用 W8A8 量化(权重约 762G)完成部署,预构建镜像quay.io/ascend/vllm-ascend:hy4。
数据来源:昇腾官方适配公告(2026-08-28)
四、性能测评
说明:本机无多卡 GPU,以下速度/显存数据来自官方 recipe 与社区实测,逐项标注来源,未做任何虚构。
4.1 显存占用(量化视角)
| 权重格式 | 估算存储 | 部署前提 |
|---|---|---|
| BF16 / FP16 | ~1.54 TB | 8×H100 仍吃紧,需专家并行 + 高利用率 |
| FP8 / INT8 | ~770 GB | 官方推荐,8 卡 TP 可行 |
| W8A8(昇腾) | ~762 GB | Atlas 800I A3 16 卡 TP |
数据来源:aicybr.com 权重估算 / 昇腾适配文档(均为一阶权重存储估算,未含 KV cache、运行时开销)
4.2 推理速度
官方 recipe 在 8 卡张量并行 + MTP 推测解码下,社区实测观察到约36 tok/s(explainx.ai 报道,单请求 decode)。
端到端吞吐相对基线提升31.8%(腾讯官方公告,指算子融合 + 通信优化后的训练/推理栈整体收益)。
速度数据来源:explainx.ai 博客(2026-08-28)、腾讯混元官方公告。未实测,标注为「官方/社区观测」。
4.3 与同级开源模型横向对比
| 维度 | Hy4 preview | GLM-5.3 (MIT) | Kimi K3 | DeepSeek-V4-Pro |
|---|---|---|---|---|
| 总参数 | 770B | 7430B(稠密) | 2.8T MoE | 1.6T–1.7T MoE |
| 激活参数 | 49B | 全量 | ~? | ~? |
| 上下文 | 1M | 256K–1M | 1M | 1M |
| 协议 | Apache 2.0 | MIT | 开源 | MIT |
| Terminal-Bench 2.1 | 85.4 | 87.9* | 86.6* | 88.2* |
| SWE-Bench Pro | 65.7 | 67.7* | 64.6* | 79.2* |
| 输入价格(¥/M) | 6.0 | 1.40(国际$1.40) | — | ~0.44($) |
| 自托管门槛 | 极高(8卡+) | 高 | 极高 | 高 |
带
*为腾讯官方对比表中的「最高可用结果」口径;其余来自模型卡与 explainx.ai 整理。价格来源:腾讯官方 / explainx.ai。
结论:Hy4 preview 在 Apache 2.0 同级里 agentic 能力稳居第一梯队,与 GLM-5.3 / Kimi K3 互有胜负(官方内部盲测 203 工程任务均分 2.99 vs GLM 2.92 / Kimi 2.94,差距在噪声范围内)。相比 DeepSeek-V4-Pro 价格略高、绝对跑分略低,但协议更宽松、无字段限制。
五、使用建议
适用场景
长程软件工程:跨文件重构、SWE-bench 级任务(SWE-Bench Pro 65.7)。配合 CodeBuddy / WorkBuddy 已内嵌,可直接接管代码仓库做多文件修改。
跨文件办公分析:OfficeQA Pro 66.2,适合企业知识库 / 文档智能体,1M 上下文能一次塞进整本手册或数月邮件。
工具调用编排 Agent:MCP-Atlas 83.7,原生支持 function calling,适合把数据库、内部 API、运维脚本编排成自主工作流。
数据中心私有化部署:Apache 2.0 可商用,无地域/领域限制,金融、政企等对协议合规敏感的行业友好。
不适用场景
❌ 个人开发者单机部署:FP8 仍需 ~770GB 显存,消费级显卡无缘,别浪费时间折腾 llama.cpp。
❌ 追求最低 API 成本:输入 6 元/百万 tokens,高于 DeepSeek-V4-Pro(~$0.44/M,约 3 元),预算敏感选后者。
❌ 要求稳定生产模型:官方明确为 preview,存在过度自我验证、思考偏长问题,上线前务必做一轮业务侧回归。
调优提示
简单任务务必加
reasoning_effort: no_think,否则延迟翻倍且容易「想太多」给出冗长答案。必开 MTP 推测解码(
num_speculative_tokens=3),官方 recipe 下实测提速明显,是性价比最高的开关。长上下文配合
--attention-backend FLASHMLA_SPARSE,否则 KV cache 随序列长度线性膨胀,直接 OOM。用官方预构建镜像(
vllm/vllm-openai:hy4-preview),别自己从源码编 vLLM,版本对齐坑多、启动慢。昇腾用户直接拉
quay.io/ascend/vllm-ascend:hy4,0day 适配最省心;多机部署记得先起 DP Coordinator 再拉 worker。固定模型 revision 与镜像 tag:这是 preview 版本,权重和 serving 栈会快速迭代,生产环境务必 pin 版本保证可复现。
5.1 硬件选型的「两个档位」
很多读者关心的核心问题是「我到底要几张卡」。根据官方 recipe 与权重体积,给出两个典型档位(数据来源:aicybr.com 权重估算 + 官方 8 卡 TP recipe):
| 部署形态 | 推荐硬件 | 权重格式 | 说明 |
|---|---|---|---|
| 单机验证 | 8×H100/H800 80GB | FP8 (~770GB) | 官方默认档,支持短序列功能验证 |
| 长序列生产 | 2×8 节点 (16 卡) DP=2 | FP8 / W8A8 | 上下文可扩至 32K–1M,并发 256 |
| 国产算力 | 昇腾 Atlas 800I A3 16 卡 | W8A8 (~762GB) | 0day 适配,vLLM-Ascend 直接跑 |
注意:BF16 全精度约 1.54TB,即便 8 张 80GB 卡(640GB 总显存)也装不下,必须走专家并行(expert-parallel)或降精度。普通团队直接选 FP8 变体最现实。
5.2 流式调用示例(生产常用)
上面的推理代码是一次性返回,生产环境通常用流式输出避免前端「转圈」:
# pip install openai from openai import OpenAI client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY") stream = client.chat.completions.create( model="hy4-preview", messages=[{"role": "user", "content": "写一段用于解析 CSV 并统计各列缺失率的 Python 函数,带类型注解。"}], temperature=0.9, top_p=1.0, stream=True, # 开启流式 ) for chunk in stream: delta = chunk.choices[0].delta.content if delta: print(delta, end="", flush=True) print("\n--- 生成结束 ---")5.3 常见部署坑与排查
| 现象 | 可能原因 | 处理 |
|---|---|---|
启动报OOM/ 显存不足 | 用了 BF16 或 KV cache 过大 | 切 FP8,降低--gpu-memory-utilization或缩--max-model-len |
| 推理极慢且无加速 | MTP 未生效 | 确认--speculative-config与镜像版本匹配 |
| 工具调用不触发 | 未开--enable-auto-tool-choice | 补该参数并确认--tool-call-parser hy_v4 |
| 长上下文直接崩 | 未用稀疏注意力后端 | 加--attention-backend FLASHMLA_SPARSE |
| 多机 worker 起不来 | DP Coordinator 未先就绪 | 先起节点 1 看到Started DP Coordinator再拉节点 2 |