news 2026/9/27 3:16:57

1.6 万亿只激活 480 亿:美团 LongCat-2.5 的看点,是「适配 Claude Code」写进了官方日志

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
1.6 万亿只激活 480 亿:美团 LongCat-2.5 的看点,是「适配 Claude Code」写进了官方日志

一、发生了什么

9 月 25 日,美团旗下 LongCat API 开放平台上线新一代模型 LongCat-2.5-Preview,API 与网页端体验入口同步开放(来源:IT之家,经凤凰网科技转述;网易科技)。官方更新日志列出的核心特性:

  • MoE 路线:总参数量约 1.6 万亿,每次推理激活约 480 亿;
  • 原生 100 万 token 上下文,官方点名的场景是超长文档、代码库、日志与多轮复杂任务;
  • 新增图片理解:跨模态问答、内容摘要、复杂视觉推理;
  • Coding 能力单列一项,并明确写出「深度适配 Claude Code 等主流开发环境」,点名 Claude Code、Hermes、OpenClaw、OpenCode、Kilo Code 五个工具。

截至发稿,暂无第三方基准跑分,官方也未公布价格表。这两个空缺,后面会再提。

二、技术拆解:参数是老故事,工具层是新信号

1. 两本账还是那两本账

MoE 模型的总参数和激活参数要分开看:激活参数大致决定单次推理的算力开销,总参数决定能力上限和部署显存门槛。这套算法我上周写阶跃 Step 5 Preview 时拆过一次(600B 只激活 27B、成本 1/8:阶跃这步棋),这次直接套公式:

模型总参数激活参数激活比上下文官方主打
美团 LongCat-2.5-Preview~1.6 万亿~480 亿~3%100 万 token长程任务 + 多模态
阶跃 Step 5 Preview600B27B4.5%100 万 token原生图文输入

(两家数字均为官方口径,来源分别为 IT之家转述的官方更新日志与上证报等对 Step 5 发布的报道;激活比为本表计算值。LongCat-2.5-Preview 缺第三方复现,表中「缺点」栏先欠着:无独立评测、无价格表、未公布权重开放计划——这三件事任何一件落地,对比才有意义。)

激活比从 4.5% 压到 3%,方向没变:同样的能力分数,把单 token 成本再往下压。这条效率线国内厂商已经卷了小一年,单看参数意义在递减。

2. 真正的新信号:harness 进了官方更新日志

过去两年,模型厂商的兼容锚点是 OpenAI 的 chat completions 接口——兼容它的 URL 和报文格式,就等于接入了所有现成客户端,这是当年的事实标准。

现在锚点在挪。这次官方把「深度适配 Claude Code 等主流开发环境」写成核心特性,与多模态、Coding 并列,点名五个工具。翻译一下:Agent 工具层(编辑器、CLI harness)正在成为新的接口标准。模型厂商公开宣布适配某个 harness,本质上是承认两件事:

  1. 开发者的日常工作入口在 harness 手里,不在模型 API 手里;
  2. 谁控制 harness,谁就决定默认模型、提示词模板和工具调用协议——模型只是这个插槽里可替换的组件。

这和当年浏览器大战、后来 Kubernetes 的「一致性认证」是同一个剧本:平台层定型之后,下层组件的标准适配就成了入场券。区别只在于这次卷的是模型。

3. 100 万上下文与成本的真账

原生 100 万上下文对「长程任务」是硬件基础,但它不是免费的:上下文越长,缓存命中与否对账单的影响越大。价格表没公布之前,先把缓存这一行怎么读弄明白比猜价格有用(GPT-6 Sol/Luna 与 Opus 5.5 同日降价:价格表里最该看的,是缓存那一行)。

三、我的判断

**第一,模型竞争的裁判权正在往工具层移,而且没人喊停。**半年前「适配 OpenAI 接口格式」是厂商文档里的一行小字;现在「适配 Claude Code」能进官方更新日志的核心特性列表。这个位置变化说明 harness 的网络效应已经强到模型厂商必须主动贴上去。对开发者是好事:换模型会越来越像换电池。对模型厂商则是坏消息:差异化被压缩到「插槽之外」的部分——价格、长任务稳定性、垂直能力。

**第二,选型重心该换了。**模型可替换性变强之后,「哪个模型跑分高」的决策价值在下降,「工具调用成功率、长任务不崩、缓存单价」这些工程指标的决策价值在上升。跑分是静态快照,Agent 任务是几百步的长链路,两者经常对不上——三元压缩那次的能力边界分析(98.2% 是真的,但先看它把 1.8% 藏在哪)已经演示过:套件内平均分很好看,长程 agent 一项掉 25 分。

**第三,Preview 两个字要当真。**没有第三方跑分、没有价格表,「内部任务表现不错」就无法独立验证(头条「千机阁」的分析也指出外部基准暂时少见)。另外 1.6 万亿总参对想自部署的团队意味着实打实的显存门槛,API 用户倒是无感。等第三方复现和价格落地,再决定要不要切流量不迟。

四、对开发者的启示

  • 把模型当可替换组件:接入任何 Agent 工具时,顺手收敛一套固定的回归用例,换模型先跑一遍再切。
  • 监控加一行:除了回答质量,把「工具调用成功率」单独立项——长链路任务里它比对话质量先崩。
  • 长上下文先算账再喂满:100 万 token 的窗口是能力,不是默认用法,缓存策略决定它是福利还是账单。

一个最小可用的换模型回归集,20 行够用:

# golden_set.py — 换模型前的最小回归:固定输入,比对工具调用行为CASES=[# (任务描述, 期望调用的工具, 期望产物特征)("读仓库根目录的 pyproject.toml 并总结依赖","read_file","包含依赖名列表"),("把 utils.py 里的时间戳打印改成 ISO 格式","edit_file","diff 只动 1 处"),("跑单测并报告失败用例","run_command","退出码 + 失败清单"),]defrun(model_endpoint:str,cases=CASES)->dict:results={}fortask,tool,_incases:# 伪代码:向 model_endpoint 发任务,记录实际工具调用序列called=call_agent(model_endpoint,task)# 返回实际工具调用列表results[task]="PASS"iftoolincalledelse"FAIL"returnresults# 通过率低于基线模型 → 不切流量,先查是提示词适配问题还是能力问题

结尾多说三句。

如果想看「大总参 + 低激活」这步棋的另一面,上一篇阶跃 Step 5 的两本账是同一主题的另一半;模型选型该看哪些工程指标,98.2% 藏起来的那 1.8% 里有一份现成的踩坑清单;而 Anthropic 用仪表盘量自家 Agent 参与研发的那篇(26%、3 万 Agent、四万七分之一),恰好是「工具层接管研发流程」的另一个视角。

这个专栏每天一篇 AI 解读,关注不迷路。

你们的团队现在换一次模型的成本是多少——改一行配置,还是重写一遍提示词?评论区一句话说说。

专注 AI 工程化实践与出海外贸技术

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/27 3:14:55

基于LangChain与Milvus的RAG长尾搜题系统实操指南

长尾搜题是指在教育、技术支持或专业问答场景中,用户提出出现频率低、表述复杂或跨领域的冷门问题。传统的基于关键词匹配的搜索引擎在处理这类问题时,往往因为缺乏精确匹配的语料而返回无关结果。例如,当学生搜索一道涉及多个冷门物理定理的…

作者头像 李华
网站建设 2026/9/27 3:13:36

1PPS时间同步原理与实战:从GPS授时到设备高精度对齐

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/27 3:07:05

语义、信源与上下文:GEO传播中的安全边界清单

语义、信源与上下文:GEO传播中的安全边界清单 GEO 把信息生产从"找资料"扩展到"给答案"。这份清单面向做内容、品牌与搜索的人,把语义对齐、信源偏好、上下文构造和黑帽风险拆成可分别观测的变量,回答一个判断&#xff1…

作者头像 李华
网站建设 2026/9/27 3:07:00

MOSFET缓启动电路设计:抑制上电冲击电流的核心方法

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华