摘要
2026奇点智能技术大会"大模型技术:从Agentic Scaling到自进化"专题将系统拆解大模型从预训练范式迈向后训练+推理计算协同新阶段的关键路径。本文结合张俊林、方斌、卢志武3位已确认演讲嘉宾的过往研究主线,梳理Agentic Scaling、自进化机制、MoE架构工程权衡三大议题,附最小可运行代码示例和2026议题前瞻。
SEO关键词:Agentic Scaling / 自进化大模型 / 大模型后训练 / 推理计算协同 / MoE架构 / 大模型演进 / 2026奇点智能大会 /
一、我们正在见证的范式跃迁
2023-2025这三年,大模型的主旋律是"预训练扩展定律"(Pre-training Scaling Laws):把参数规模、数据量、算力同步拉高,模型在通用能力上自然涌现。但到2025年下半年,业界开始形成一个共识——
纯粹的预训练扩展已经逼近边际收益递减。各家头部实验室的下一阶段赌注,落在了三个相互关联的方向上:
- Agentic Scaling:把"扩展"从训练侧延展到推理侧和环境交互侧,让模型在多轮工具调用与反思中持续提升。
- 自进化(Self-Evolution):模型在闭环任务执行中产生反馈,并据此修改自身参数或行为策略,减少对人工标注的依赖。
- 后训练+推理协同:把"训练—推理"切割成两个独立环节的传统思路,转向"在推理中持续学习"的协同架构。
2026奇点智能技术大会把这一判断直接写进了议题名称:"大模型技术:从Agentic Scaling到自进化"。这意味着大会官方认为,未来12-24个月大模型技术的核心增量,会来自这两个方向,而不是更大的预训练。
📌 大会背景:本专题归属于"奇点智能技术大会"第一天下午分会场A,与"AI原生软件研发(分会场B)"、"AI计算平台(分会场C)"同期举行,完整议程以大会现场发布为准。
二、什么是Agentic Scaling?
要理解Agentic Scaling,先回顾Scaling Law的原始定义。Kaplan等人(2020)给出的预训练扩展定律可以简化为:
L(N, D) = (N_c / N)^α_N + (D_c / D)^α_D N, D → ∞
其中L是Loss,N是参数量,D是数据tokens。在预训练范式下,这个公式告诉我们"参数越多、数据越多,Loss越低"。
但Agentic Scaling关心的是另一个问题:在推理阶段,如果允许模型与环境做K轮交互(调用工具、观察结果、反思修正),那总效用是否也服从某种"扩展曲线"?OpenAI o1/o3系列、DeepSeek-R1的实验已经给出了强力的初步证据——K越大、推理链越长、反思越深,复杂任务的准确率呈对数线性提升。
大会上,OpenAI科学家、Transformer共同创始人Lukasz Kaiser的Keynote《推理模型的历史、现在与未来》将系统复盘从AlphaGo到o系列的推理范式跃迁,这是理解Agentic Scaling最佳的第一手资料。
2.1 一个最小可运行示例:ReAct循环
Agentic Scaling的最小可执行单元是ReAct(Reason+Act)循环。下面用一段50行的Python代码演示其核心思想:
importjsonfromtypingimportList,Dictdefreact_loop(query:str,llm_call,tools:Dict,max_steps:int=5):""" 最小可运行的ReAct循环,体现Agentic Scaling的核心: - 多轮思考(Thought) - 工具调用(Action) - 环境观察(Observation) - 直到能给出最终答案 """scratchpad=[]forstepinrange(max_steps):# 1. 让LLM根据历史决定下一步动作prompt=build_prompt(query,scratchpad,tools)response=llm_call(prompt)thought,action=parse_llm_output(response)scratchpad.append({"thought":thought,"action":action})# 2. 如果模型给出最终答案,退出循环ifaction["type"]=="Finish":returnaction["answer"]# 3. 否则执行工具,获得观察结果tool_fn=tools[action["tool"]]observation=tool_fn(**action["args"])scratchpad.append({"observation":observation})return"未能在限定步数内完成推理"# 工具注册示例tools={"search":lambdaquery:mock_search(query),"calculator":lambdaexpr:eval(expr),"Finish":lambda**kw:kw}answer=react_loop("2026年奇点智能大会的Keynote嘉宾是谁?",llm_call=my_llm,tools=tools,max_steps=8)这段代码虽然简陋,但体现了Agentic Scaling的"推理侧扩展"思想:模型有max_steps次机会与环境交互,每次都基于历史决策下一步。max_steps=8 vs max_steps=1,在复杂任务上的准确率差异可以达到20-30个百分点。
三、自进化大模型:从SFT到自改进
传统SFT(Supervised Fine-Tuning)和RLHF(Reinforcement Learning from Human Feedback)都依赖人类标注。问题是:对于复杂多步推理,人类标注既昂贵,又常常"标错"(因为人类自己也不一定知道正确答案)。
自进化(Self-Evolution)大模型的核心思想是——让模型自己生成任务、自己执行、自己评估、自己修改。一个典型的自进化闭环包含4个阶段:
Self-Play → Self-Critique → Self-Distill → Self-Update
- Self-Play:模型生成新的任务或解决方案,作为训练数据。
- Self-Critique:模型对自己的输出做评估,识别错误或低质量样本。
- Self-Distill:把高质量样本蒸馏回模型,过滤低质量样本。
- Self-Update:用蒸馏后的样本做参数更新。
这一方向上,北京邮电大学方斌教授在"拔尖人才"计划下的研究、以及中国人民大学卢志武教授团队在多模态自进化方向的工作,都会在2026奇点大会的大模型分会场A上呈现。
“自进化的关键不是’模型能改自己’,而是’模型能稳定地、可控地改自己’。一个没有可控性的自进化系统,在生产环境里会快速演化成不可预测的黑盒。”
—— 大会专题摘要,2026奇点智能技术大会
3.1 自进化的工程边界:可观测性必须先行
大会上,演讲嘉宾会重点讨论一个反直觉的点——自进化系统上线前,先要把可观测性做到极致。如果连模型"为什么改了、改成什么样"都观测不到,贸然开启自进化就等于把生产系统丢进黑盒。
这正是2026奇点大会单独设置"AI Infra基础设施与AgenticOps"专题的原因——大模型的自进化和Agent的可观测性是同一个硬币的两面。
四、MoE架构的工程权衡
2024年以来,MoE(Mixture of Experts)已经成为大模型架构的事实标准。Mixtral、DeepSeek-V3、Qwen3-MoE都采用了MoE路线。但"所有专家全激活"与"Top-K路由"之间的工程权衡,在2026年依然没有标准答案。
| 维度 | 全激活Dense | Top-K MoE | 细粒度MoE(DeepSeek风格) |
|---|---|---|---|
| 激活参数 | 100% | ~30% | ~10% |
| 训练成本 | 极高 | 中等 | 较低 |
| 推理显存 | 高 | 中(需缓存所有专家) | 低(可卸载冷专家) |
| 负载均衡 | 无问题 | 需辅助损失 | 需共享专家+路由 |
| 代表模型 | LLaMA-3 405B | Mixtral 8x7B | DeepSeek-V3 |
大会上,小米AI平台部语言模型推理负责人张晨会从"亿级DAU推理部署"视角,分享MoE在生产环境的工程权衡——这是学术界很少触及、但工业界最关心的一手数据。
五、后训练+推理协同:训练-推理边界的消融
传统MLOps把"训练"和"推理"切成两个完全独立的环节。但2026年的趋势是,这个边界正在被消融:
- 推理时训练(Test-Time Training):在推理过程中,根据具体任务临时微调模型的部分参数。
- 持续预训练(Continual Pre-Training):用推理阶段产生的新数据,定期触发训练流程。
- 在线强化学习(Online RL):把RLHF从"训练前一次性"变成"推理中持续"。
张晨在小米场景下的实践数据显示:把推理时训练引入推荐系统,长尾query的NDCG提升约8-15%。这种"推理-训练协同"的工程模式,会在大会上被详细拆解。
六、关键术语速查
| 术语 | 简明释义 |
|---|---|
| Agentic Scaling | 在推理+环境交互阶段扩展算力,提升复杂任务准确率。 |
| Self-Evolution | 模型在闭环中自我生成、自我评估、自我更新参数。 |
| MoE | Mixture of Experts,稀疏激活的多专家架构。 |
| Test-Time Training | 推理时根据任务临时微调模型参数。 |
| ReAct | Reason+Act,Agentic Scaling的最小执行模式。 |
对奇点智能大会(2026)的完整技术议题感兴趣,可前往 奇点大会官方渠道免费 获取PPT详细资料
📚 想看更多大模型工程细节?
2026奇点智能技术大会"大模型技术:从Agentic Scaling到自进化"专题,涵盖后训练、推理协同、自进化、MoE工程权衡。点击海报免费领取大会PPT资料。
🎯 点击海报 · 免费领取 PPT 高清资料
七、写在最后:工程师该关心什么?
对一线工程师来说,Agentic Scaling和自进化并不只是论文里的概念——它们已经直接决定了我们日常工作的形态:
- 可观测性优先级提升:Agentic系统多步推理,每一步都可能出错,链路追踪成为基建必备。
- 评估体系重构:从"模型准确率"到"任务成功率"再到"Agentic系统端到端SLA",评估指标需要重写。
- 成本结构变化:推理时算力消耗成为主要成本,TCO模型要从"训练+推理"二维变成"训练+在线+离线"三维。
- 角色边界重塑:工程师从"写代码"转向"定义需求+架构决策+质量门禁",Coding Agent接管实现。
这些变化不是未来式,而是现在进行时。2026奇点大会就是观察这一变革的最佳窗口。