news 2026/9/30 2:43:31

开源大模型追踪:腾讯混元Hy4preview,FP8 770GB 落地企业私有化,Apache 2.0 无字段限制

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
开源大模型追踪:腾讯混元Hy4preview,FP8 770GB 落地企业私有化,Apache 2.0 无字段限制

一、模型速览

腾讯混元(Tencent Hy)在 2026 年 8 月 28 日正式发布并开源Hy4 preview,这是从 Hy3(295B 总参 / 21B 激活 / 256K 上下文)迭代而来的新一代 MoE 旗舰模型预览版。

  • 发布方:腾讯混元团队(Tencent Hy Team)

  • 参数量:770B 主干总参数,每 Token 激活 49B(256 路由专家 + 1 共享专家,每 Token 激活 Top-8 路由专家 + 共享专家);另有独立 MTP 层 10B 总参 / 0.7B 激活用于推测解码

  • 上下文长度:原生 1M tokens(1,048,576),最大生成 64K

  • 许可证:Apache License 2.0(无字段限制、无地域排除,可商用)

  • 一句话定位:面向代码、办公分析、游戏原型、科研等真实生产力工作流的「数据中心级」开源 Agent 基座模型

一句话总结:它不是来陪你聊天的,是来钻进代码仓库、Office 文档、游戏引擎和科研流程里干活的。

二、核心亮点

亮点 1:Gated DSA 稀疏注意力 + IndexCache,让 1M 上下文「喂得起」

Hy4 的注意力模块采用门控版 DeepSeek 稀疏注意力(Gated DeepSeek Sparse Attention, DSA),并引入IndexCache——跨层复用稀疏选择索引,而非每层重复计算。这是 1M 上下文在推理成本上「真正可用」的关键。

# 官方 vLLM 部署时直接指定稀疏注意力后端
--attention-backend FLASHMLA_SPARSE

数据来源:模型卡 / aicybr.com 部署解析(官方架构说明)

亮点 2:原生 MTP 推测解码层,提速写进权重里

与很多模型事后在推理框架里「外挂」投机解码不同,Hy4 在权重侧内置了一个MTP(Multi-Token Prediction)层(10B 总参 / 0.7B 激活),用于原生 next-token 预测加速。vLLM / SGLang 双双在官方预构建镜像里默认开启。

# 开启原生 MTP 推测解码(每步预测 3 个 token)
--speculative-config '{"method": "mtp","num_speculative_tokens": 3}'

数据来源:Hugging Face 模型卡 deployment 章节

亮点 3:49B 激活的「大库小用」MoE,兼顾能力与成本

770B 的「专家库」,每道题只叫最相关的一批专家(Top-8 路由 + 1 共享)上场,计算量按 49B 走。相比同等能力的稠密模型,推理算力大幅下降,这也是它能把 API 价格压到输入 6 元 / 百万 tokens、输出 18 元 / 百万 tokens、缓存命中 0.3 元的底气。

数据来源:腾讯混元官方公告(2026-08-28)

亮点 4:Agentic 基准全面领先同级开源

官方在 agentic 维度的公开分数相当能打(数据来源:模型卡 / explainx.ai 整理):

基准Hy4 preview说明
Terminal-Bench 2.185.4终端自动化,Agent 核心能力
MCP-Atlas (public)83.7工具调用编排
SWE-Bench Pro65.7真实软件工程
CyberGym78.4网络安全任务
OfficeQA Pro66.2跨文件办公分析
GPQA Diamond92.3研究生级科学推理

亮点 5:no_think直答开关,关掉过度自我验证

官方承认 preview 版在复杂任务上「思考偏长、过度自我验证」。为此提供reasoning_effort: no_think参数,一键切回快速直答模式:

# 关闭深度思考,适合简单问答 / 低延迟场景
extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}}

数据来源:Hugging Face 模型卡

亮点 6:iHC 残差超连接 + 相比 Hy3 的代际跃迁

Hy4 用identity Hyper-Connections(iHC)跨 4 条残差流拓宽层间信息流,缓解超深 MoE(78 层)的训练/推理梯度问题。相比 Hy3(295B 总参 / 21B 激活 / 256K),官方附录 46 项成绩全部高于 Hy3,几个提升夸张的:

  • DeepSWE:28.0 → 64.3(+36.3)

  • SWE Atlas Codebase Q&A:30.8 → 64.0

  • MathArena Apex 2025:38.7 → 74.2

  • Toolathlon-Verified:56.2 → 74.1

数据来源:腾讯混元官方对比附录(2026-08-28)

从 Hy3 到 Hy4 preview 仅 53 天,规模 2.6×、上下文 4×——国产开源的迭代节奏还在加速。

三、部署实战

⚠️ 重要前提:Hy4 preview 是数据中心级模型。BF16 权重约 1.54TB,FP8 权重约 770GB,单机消费级显卡无法本地部署。官方 recipe 默认8 卡张量并行。以下给出生产可用的完整命令,复制即可跑(需 8×80GB+ 显存,如 8×A100/H100/H800 或昇腾 Atlas 800I A3)。

3.1 环境准备

官方提供预构建 Docker 镜像,无需手动编译 vLLM:

# 拉取官方预构建镜像(多架构 x86 / Arm) docker pull vllm/vllm-openai:hy4-preview ​ # 或通过 SGLang 部署 docker pull lmsysorg/sglang:hy4-preview

如需从源码构建(指定 Python 3.12):

uv venv --python 3.12 --seed --managed-python source .venv/bin/activate git clone https://github.com/vllm-project/vllm.git cd vllm uv pip install --editable . --torch-backend=auto

3.2 模型下载

通过 huggingface-cli 或 modelscope 拉取权重(FP8 变体体积更小,推荐生产用):

# BF16 原版(约 1.54TB,谨慎) huggingface-cli download tencent/Hy4-preview --local-dir /data/hy4 ​ # FP8 量化版(约 770GB,推荐生产部署) huggingface-cli download tencent/Hy4-preview-FP8 --local-dir /data/hy4-fp8

权重地址:https://huggingface.co/tencent/Hy4-preview (同步上线 ModelScope / GitCode / CNB)

3.3 启动推理服务(vLLM,8 卡 TP)

docker run --gpus all -p 8000:8000 --ipc=host \ -v ~/.cache/huggingface:/root/.cache/huggingface \ vllm/vllm-openai:hy4-preview \ tencent/Hy4-preview-FP8 \ --tensor-parallel-size 8 \ --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \ --attention-backend FLASHMLA_SPARSE \ --tool-call-parser hy_v4 \ --reasoning-parser hy_v4 \ --enable-auto-tool-choice \ --port 8000 \ --served-model-name hy4-preview

或用裸命令(本地已装 vLLM):

vllm serve tencent/Hy4-preview-FP8 \ --tensor-parallel-size 8 \ --speculative-config.method mtp \ --speculative-config.num_speculative_tokens 3 \ --attention-backend FLASHMLA_SPARSE \ --tool-call-parser hy_v4 \ --reasoning-parser hy_v4 \ --enable-auto-tool-choice \ --port 8000 \ --served-model-name hy4-preview

SGLang 等价命令:

docker run --gpus all --ipc=host -p 8000:8000 \ lmsysorg/sglang:hy4-preview \ python3 -m sglang.launch_server \ --model tencent/Hy4-preview-FP8 \ --tp-size 8 \ --reasoning-parser auto \ --tool-call-parser auto \ --speculative-algorithm NEXTN \ --speculative-num-steps 3 \ --speculative-eagle-topk 1 \ --speculative-num-draft-tokens 4 \ --port 8000 \ --served-model-name hy4-preview

数据来源:Hugging Face 模型卡 deployment 章节 / bittide.aicompass.dev 整理

3.4 完整可运行推理代码(OpenAI 兼容)

服务起来后,直接用openaiSDK 调用,无需 extra 依赖:

# pip install openai from openai import OpenAI ​ client = OpenAI( base_url="http://localhost:8000/v1", api_key="EMPTY", # 本地部署无需真实 key ) ​ # 1) 默认 high 推理模式(深度思考,适合编程/数学/科研) resp = client.chat.completions.create( model="hy4-preview", messages=[{"role": "user", "content": "用 Python 写一个快速排序,并分析时间复杂度。"}], temperature=0.9, top_p=1.0, ) print("【深度思考】\n", resp.choices[0].message.content) ​ # 2) no_think 直答模式(关闭 CoT,低延迟) resp2 = client.chat.completions.create( model="hy4-preview", messages=[{"role": "user", "content": "今天北京天气怎么样?用一句话回答。"}], temperature=0.9, top_p=1.0, extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}}, ) print("【直答】\n", resp2.choices[0].message.content) ​ # 3) 工具调用(Agent 场景,需服务端已开 --enable-auto-tool-choice) tools = [{ "type": "function", "function": { "name": "get_weather", "description": "查询指定城市天气", "parameters": { "type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"], }, }, }] resp3 = client.chat.completions.create( model="hy4-preview", messages=[{"role": "user", "content": "帮我查下上海今天天气。"}], tools=tools, tool_choice="auto", ) print("【工具调用】\n", resp3.choices[0].message.tool_calls)

3.5 效果验证

服务就绪后健康检查 + 冒烟测试:

# 检查模型已加载 curl -sf http://127.0.0.1:8000/v1/models ​ # 发送一条推理请求 curl -sS -X POST http://127.0.0.1:8000/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{"model":"hy4-preview","messages":[{"role":"user","content":"Who are you?"}],"max_tokens":256,"temperature":0}'

验证命令参考:Hugging Face 模型卡 / 昇腾适配文档

昇腾 0day 适配(国产算力可行)

发布当天昇腾即实现 0day 支持:基于vLLM-Ascend在 Atlas 800I A3(16 卡)上用 W8A8 量化(权重约 762G)完成部署,预构建镜像quay.io/ascend/vllm-ascend:hy4。

数据来源:昇腾官方适配公告(2026-08-28)

四、性能测评

说明:本机无多卡 GPU,以下速度/显存数据来自官方 recipe 与社区实测,逐项标注来源,未做任何虚构。

4.1 显存占用(量化视角)

权重格式估算存储部署前提
BF16 / FP16~1.54 TB8×H100 仍吃紧,需专家并行 + 高利用率
FP8 / INT8~770 GB官方推荐,8 卡 TP 可行
W8A8(昇腾)~762 GBAtlas 800I A3 16 卡 TP

数据来源:aicybr.com 权重估算 / 昇腾适配文档(均为一阶权重存储估算,未含 KV cache、运行时开销)

4.2 推理速度

  • 官方 recipe 在 8 卡张量并行 + MTP 推测解码下,社区实测观察到约36 tok/s(explainx.ai 报道,单请求 decode)。

  • 端到端吞吐相对基线提升31.8%(腾讯官方公告,指算子融合 + 通信优化后的训练/推理栈整体收益)。

速度数据来源:explainx.ai 博客(2026-08-28)、腾讯混元官方公告。未实测,标注为「官方/社区观测」。

4.3 与同级开源模型横向对比

维度Hy4 previewGLM-5.3 (MIT)Kimi K3DeepSeek-V4-Pro
总参数770B7430B(稠密)2.8T MoE1.6T–1.7T MoE
激活参数49B全量~?~?
上下文1M256K–1M1M1M
协议Apache 2.0MIT开源MIT
Terminal-Bench 2.185.487.9*86.6*88.2*
SWE-Bench Pro65.767.7*64.6*79.2*
输入价格(¥/M)6.01.40(国际$1.40)—~0.44($)
自托管门槛极高(8卡+)高极高高

带*为腾讯官方对比表中的「最高可用结果」口径;其余来自模型卡与 explainx.ai 整理。价格来源:腾讯官方 / explainx.ai。

结论:Hy4 preview 在 Apache 2.0 同级里 agentic 能力稳居第一梯队,与 GLM-5.3 / Kimi K3 互有胜负(官方内部盲测 203 工程任务均分 2.99 vs GLM 2.92 / Kimi 2.94,差距在噪声范围内)。相比 DeepSeek-V4-Pro 价格略高、绝对跑分略低,但协议更宽松、无字段限制。

五、使用建议

适用场景

  • 长程软件工程:跨文件重构、SWE-bench 级任务(SWE-Bench Pro 65.7)。配合 CodeBuddy / WorkBuddy 已内嵌,可直接接管代码仓库做多文件修改。

  • 跨文件办公分析:OfficeQA Pro 66.2,适合企业知识库 / 文档智能体,1M 上下文能一次塞进整本手册或数月邮件。

  • 工具调用编排 Agent:MCP-Atlas 83.7,原生支持 function calling,适合把数据库、内部 API、运维脚本编排成自主工作流。

  • 数据中心私有化部署:Apache 2.0 可商用,无地域/领域限制,金融、政企等对协议合规敏感的行业友好。

不适用场景

  • ❌ 个人开发者单机部署:FP8 仍需 ~770GB 显存,消费级显卡无缘,别浪费时间折腾 llama.cpp。

  • ❌ 追求最低 API 成本:输入 6 元/百万 tokens,高于 DeepSeek-V4-Pro(~$0.44/M,约 3 元),预算敏感选后者。

  • ❌ 要求稳定生产模型:官方明确为 preview,存在过度自我验证、思考偏长问题,上线前务必做一轮业务侧回归。

调优提示

  1. 简单任务务必加reasoning_effort: no_think,否则延迟翻倍且容易「想太多」给出冗长答案。

  2. 必开 MTP 推测解码(num_speculative_tokens=3),官方 recipe 下实测提速明显,是性价比最高的开关。

  3. 长上下文配合--attention-backend FLASHMLA_SPARSE,否则 KV cache 随序列长度线性膨胀,直接 OOM。

  4. 用官方预构建镜像(vllm/vllm-openai:hy4-preview),别自己从源码编 vLLM,版本对齐坑多、启动慢。

  5. 昇腾用户直接拉quay.io/ascend/vllm-ascend:hy4,0day 适配最省心;多机部署记得先起 DP Coordinator 再拉 worker。

  6. 固定模型 revision 与镜像 tag:这是 preview 版本,权重和 serving 栈会快速迭代,生产环境务必 pin 版本保证可复现。

5.1 硬件选型的「两个档位」

很多读者关心的核心问题是「我到底要几张卡」。根据官方 recipe 与权重体积,给出两个典型档位(数据来源:aicybr.com 权重估算 + 官方 8 卡 TP recipe):

部署形态推荐硬件权重格式说明
单机验证8×H100/H800 80GBFP8 (~770GB)官方默认档,支持短序列功能验证
长序列生产2×8 节点 (16 卡) DP=2FP8 / W8A8上下文可扩至 32K–1M,并发 256
国产算力昇腾 Atlas 800I A3 16 卡W8A8 (~762GB)0day 适配,vLLM-Ascend 直接跑

注意:BF16 全精度约 1.54TB,即便 8 张 80GB 卡(640GB 总显存)也装不下,必须走专家并行(expert-parallel)或降精度。普通团队直接选 FP8 变体最现实。

5.2 流式调用示例(生产常用)

上面的推理代码是一次性返回,生产环境通常用流式输出避免前端「转圈」:

# pip install openai from openai import OpenAI ​ client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY") ​ stream = client.chat.completions.create( model="hy4-preview", messages=[{"role": "user", "content": "写一段用于解析 CSV 并统计各列缺失率的 Python 函数,带类型注解。"}], temperature=0.9, top_p=1.0, stream=True, # 开启流式 ) for chunk in stream: delta = chunk.choices[0].delta.content if delta: print(delta, end="", flush=True) print("\n--- 生成结束 ---")

5.3 常见部署坑与排查

现象可能原因处理
启动报OOM/ 显存不足用了 BF16 或 KV cache 过大切 FP8,降低--gpu-memory-utilization或缩--max-model-len
推理极慢且无加速MTP 未生效确认--speculative-config与镜像版本匹配
工具调用不触发未开--enable-auto-tool-choice补该参数并确认--tool-call-parser hy_v4
长上下文直接崩未用稀疏注意力后端加--attention-backend FLASHMLA_SPARSE
多机 worker 起不来DP Coordinator 未先就绪先起节点 1 看到Started DP Coordinator再拉节点 2
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/30 2:43:21

NTP/SNTP时钟协议原理详解:从时间戳到工程避坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/30 2:42:26

拒绝“猜谜式”编程:从 Google PTCF 到 AI 编程五要素框架

前言:在 AI 辅助编程(AI Programming)日益普及的今天,很多开发者发现:AI 写代码很快,但写出能用的代码很难。 往往是因为我们陷入了“模糊指令”的陷阱。本文将剥离理论概念,直接通过对比案例和…

作者头像 李华
网站建设 2026/9/30 2:42:19

第022篇 try-catch-finally 与 try-with-resources——资源释放正确姿势

摘要:本篇是《Android软件开发面试从入门到精通》第 22 篇,主题为「try-catch-finally 与 try-with-resources」。本篇聚焦「try-catch-finally 与 try-with-resources——资源释放正确姿势」:先回答它解决什么问题,再回答它怎么实现、代价是什么,收尾给出一套可复用的答题…

作者头像 李华
网站建设 2026/9/30 2:42:19

第023篇 自定义异常与异常链——生产代码怎么设计错误

摘要:本篇是《Android软件开发面试从入门到精通》第 23 篇,主题为「自定义异常与异常链——生产代码怎么设计错误」。在Java 核心基础的进度条上,「自定义异常与异常链——生产代码怎么设计错误」承上启下。本篇从零讲起,但按面试官追问的深度推进,读到最后一节就有答案。…

作者头像 李华
网站建设 2026/9/30 2:41:28

Java中toString()方法的正确使用技巧

咱们来详细说说在Java这玩意儿里面括号括起来的那个方法到底是怎么回事儿, 还有为啥这么重要的道理。在 Java 开发中,() 是我们最常用的方法之一。无论是调试程序、输出日志,还是快速查看对象内容,() 方法都起到了至关重要的作用。本篇博客将…

作者头像 李华