news 2026/8/21 15:31:56

Agentic Scaling到自进化:大模型下一阶段演进路线图

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Agentic Scaling到自进化:大模型下一阶段演进路线图

摘要

2026奇点智能技术大会"大模型技术:从Agentic Scaling到自进化"专题将系统拆解大模型从预训练范式迈向后训练+推理计算协同新阶段的关键路径。本文结合张俊林、方斌、卢志武3位已确认演讲嘉宾的过往研究主线,梳理Agentic Scaling、自进化机制、MoE架构工程权衡三大议题,附最小可运行代码示例和2026议题前瞻。

SEO关键词:Agentic Scaling / 自进化大模型 / 大模型后训练 / 推理计算协同 / MoE架构 / 大模型演进 / 2026奇点智能大会 /

一、我们正在见证的范式跃迁

2023-2025这三年,大模型的主旋律是"预训练扩展定律"(Pre-training Scaling Laws):把参数规模、数据量、算力同步拉高,模型在通用能力上自然涌现。但到2025年下半年,业界开始形成一个共识——

纯粹的预训练扩展已经逼近边际收益递减。各家头部实验室的下一阶段赌注,落在了三个相互关联的方向上:

  1. Agentic Scaling:把"扩展"从训练侧延展到推理侧和环境交互侧,让模型在多轮工具调用与反思中持续提升。
  2. 自进化(Self-Evolution):模型在闭环任务执行中产生反馈,并据此修改自身参数或行为策略,减少对人工标注的依赖。
  3. 后训练+推理协同:把"训练—推理"切割成两个独立环节的传统思路,转向"在推理中持续学习"的协同架构。

2026奇点智能技术大会把这一判断直接写进了议题名称:"大模型技术:从Agentic Scaling到自进化"。这意味着大会官方认为,未来12-24个月大模型技术的核心增量,会来自这两个方向,而不是更大的预训练。

📌 大会背景:本专题归属于"奇点智能技术大会"第一天下午分会场A,与"AI原生软件研发(分会场B)"、"AI计算平台(分会场C)"同期举行,完整议程以大会现场发布为准。

二、什么是Agentic Scaling?

要理解Agentic Scaling,先回顾Scaling Law的原始定义。Kaplan等人(2020)给出的预训练扩展定律可以简化为:

L(N, D) = (N_c / N)^α_N + (D_c / D)^α_D N, D → ∞

其中L是Loss,N是参数量,D是数据tokens。在预训练范式下,这个公式告诉我们"参数越多、数据越多,Loss越低"。

但Agentic Scaling关心的是另一个问题:在推理阶段,如果允许模型与环境做K轮交互(调用工具、观察结果、反思修正),那总效用是否也服从某种"扩展曲线"?OpenAI o1/o3系列、DeepSeek-R1的实验已经给出了强力的初步证据——K越大、推理链越长、反思越深,复杂任务的准确率呈对数线性提升

大会上,OpenAI科学家、Transformer共同创始人Lukasz Kaiser的Keynote《推理模型的历史、现在与未来》将系统复盘从AlphaGo到o系列的推理范式跃迁,这是理解Agentic Scaling最佳的第一手资料。

2.1 一个最小可运行示例:ReAct循环

Agentic Scaling的最小可执行单元是ReAct(Reason+Act)循环。下面用一段50行的Python代码演示其核心思想:

importjsonfromtypingimportList,Dictdefreact_loop(query:str,llm_call,tools:Dict,max_steps:int=5):""" 最小可运行的ReAct循环,体现Agentic Scaling的核心: - 多轮思考(Thought) - 工具调用(Action) - 环境观察(Observation) - 直到能给出最终答案 """scratchpad=[]forstepinrange(max_steps):# 1. 让LLM根据历史决定下一步动作prompt=build_prompt(query,scratchpad,tools)response=llm_call(prompt)thought,action=parse_llm_output(response)scratchpad.append({"thought":thought,"action":action})# 2. 如果模型给出最终答案,退出循环ifaction["type"]=="Finish":returnaction["answer"]# 3. 否则执行工具,获得观察结果tool_fn=tools[action["tool"]]observation=tool_fn(**action["args"])scratchpad.append({"observation":observation})return"未能在限定步数内完成推理"# 工具注册示例tools={"search":lambdaquery:mock_search(query),"calculator":lambdaexpr:eval(expr),"Finish":lambda**kw:kw}answer=react_loop("2026年奇点智能大会的Keynote嘉宾是谁?",llm_call=my_llm,tools=tools,max_steps=8)

这段代码虽然简陋,但体现了Agentic Scaling的"推理侧扩展"思想:模型有max_steps次机会与环境交互,每次都基于历史决策下一步。max_steps=8 vs max_steps=1,在复杂任务上的准确率差异可以达到20-30个百分点。

三、自进化大模型:从SFT到自改进

传统SFT(Supervised Fine-Tuning)和RLHF(Reinforcement Learning from Human Feedback)都依赖人类标注。问题是:对于复杂多步推理,人类标注既昂贵,又常常"标错"(因为人类自己也不一定知道正确答案)。

自进化(Self-Evolution)大模型的核心思想是——让模型自己生成任务、自己执行、自己评估、自己修改。一个典型的自进化闭环包含4个阶段:

Self-Play → Self-Critique → Self-Distill → Self-Update

  1. Self-Play:模型生成新的任务或解决方案,作为训练数据。
  2. Self-Critique:模型对自己的输出做评估,识别错误或低质量样本。
  3. Self-Distill:把高质量样本蒸馏回模型,过滤低质量样本。
  4. Self-Update:用蒸馏后的样本做参数更新。

这一方向上,北京邮电大学方斌教授在"拔尖人才"计划下的研究、以及中国人民大学卢志武教授团队在多模态自进化方向的工作,都会在2026奇点大会的大模型分会场A上呈现。

“自进化的关键不是’模型能改自己’,而是’模型能稳定地、可控地改自己’。一个没有可控性的自进化系统,在生产环境里会快速演化成不可预测的黑盒。”

—— 大会专题摘要,2026奇点智能技术大会

3.1 自进化的工程边界:可观测性必须先行

大会上,演讲嘉宾会重点讨论一个反直觉的点——自进化系统上线前,先要把可观测性做到极致。如果连模型"为什么改了、改成什么样"都观测不到,贸然开启自进化就等于把生产系统丢进黑盒。

这正是2026奇点大会单独设置"AI Infra基础设施与AgenticOps"专题的原因——大模型的自进化和Agent的可观测性是同一个硬币的两面。

四、MoE架构的工程权衡

2024年以来,MoE(Mixture of Experts)已经成为大模型架构的事实标准。Mixtral、DeepSeek-V3、Qwen3-MoE都采用了MoE路线。但"所有专家全激活"与"Top-K路由"之间的工程权衡,在2026年依然没有标准答案。

维度全激活DenseTop-K MoE细粒度MoE(DeepSeek风格)
激活参数100%~30%~10%
训练成本极高中等较低
推理显存中(需缓存所有专家)低(可卸载冷专家)
负载均衡无问题需辅助损失需共享专家+路由
代表模型LLaMA-3 405BMixtral 8x7BDeepSeek-V3

大会上,小米AI平台部语言模型推理负责人张晨会从"亿级DAU推理部署"视角,分享MoE在生产环境的工程权衡——这是学术界很少触及、但工业界最关心的一手数据。

五、后训练+推理协同:训练-推理边界的消融

传统MLOps把"训练"和"推理"切成两个完全独立的环节。但2026年的趋势是,这个边界正在被消融:

  • 推理时训练(Test-Time Training):在推理过程中,根据具体任务临时微调模型的部分参数。
  • 持续预训练(Continual Pre-Training):用推理阶段产生的新数据,定期触发训练流程。
  • 在线强化学习(Online RL):把RLHF从"训练前一次性"变成"推理中持续"。

张晨在小米场景下的实践数据显示:把推理时训练引入推荐系统,长尾query的NDCG提升约8-15%。这种"推理-训练协同"的工程模式,会在大会上被详细拆解。

六、关键术语速查

术语简明释义
Agentic Scaling在推理+环境交互阶段扩展算力,提升复杂任务准确率。
Self-Evolution模型在闭环中自我生成、自我评估、自我更新参数。
MoEMixture of Experts,稀疏激活的多专家架构。
Test-Time Training推理时根据任务临时微调模型参数。
ReActReason+Act,Agentic Scaling的最小执行模式。

对奇点智能大会(2026)的完整技术议题感兴趣,可前往 奇点大会官方渠道免费 获取PPT详细资料

📚 想看更多大模型工程细节?

2026奇点智能技术大会"大模型技术:从Agentic Scaling到自进化"专题,涵盖后训练、推理协同、自进化、MoE工程权衡。点击海报免费领取大会PPT资料。

🎯 点击海报 · 免费领取 PPT 高清资料

七、写在最后:工程师该关心什么?

对一线工程师来说,Agentic Scaling和自进化并不只是论文里的概念——它们已经直接决定了我们日常工作的形态:

  1. 可观测性优先级提升:Agentic系统多步推理,每一步都可能出错,链路追踪成为基建必备。
  2. 评估体系重构:从"模型准确率"到"任务成功率"再到"Agentic系统端到端SLA",评估指标需要重写。
  3. 成本结构变化:推理时算力消耗成为主要成本,TCO模型要从"训练+推理"二维变成"训练+在线+离线"三维。
  4. 角色边界重塑:工程师从"写代码"转向"定义需求+架构决策+质量门禁",Coding Agent接管实现。

这些变化不是未来式,而是现在进行时。2026奇点大会就是观察这一变革的最佳窗口。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/21 15:31:50

AI计算平台架构演进:从单点性能到生态较量

摘要 2026奇点智能技术大会"AI计算平台:从系统到生态演进"专题直击一个行业共识:AI计算平台竞争已从单点性能(FLOPS)演变为系统架构设计、异构算力兼容、开源生态健康度的综合较量。本文基于小米张晨、阿里云杨文婷、京东段楠等已确认嘉宾的工程实践,拆解万亿参数训…

作者头像 李华
网站建设 2026/8/21 15:28:33

GifHub 常见问题排查:搜索不到 GIF?7 个高频问题一次解决

GifHub 常见问题排查:搜索不到 GIF?7 个高频问题一次解决 【免费下载链接】GifHub Quickly insert GIFs in GitHub comments 项目地址: https://gitcode.com/gh_mirrors/gi/GifHub 作为一款能在 GitHub 评论中快速搜索并插入 GIF 的浏览器扩展&am…

作者头像 李华
网站建设 2026/8/21 15:26:30

Codebrag是什么?一文读懂这款轻量级日常代码审查工具

Codebrag是什么?一文读懂这款轻量级日常代码审查工具 【免费下载链接】codebrag Your daily code review tool 项目地址: https://gitcode.com/gh_mirrors/co/codebrag 在日常开发中,代码审查(Code Review)往往是提升代码质…

作者头像 李华
网站建设 2026/8/21 15:25:29

构建终身学习智能体:SOLAR架构如何实现AI的自我优化与持续适应

1. 项目概述:当AI学会“自我进化”最近在跟几个做AI应用落地的朋友聊天,大家普遍有个痛点:模型训练好了,部署上线,跑得挺好。但业务场景一变,数据分布一漂移,模型性能就开始“跳水”。传统的做法…

作者头像 李华
网站建设 2026/8/21 15:24:55

知网AIGC检测前怎么自查,三款每天免费检测工具推荐

知网AIGC检测前怎么自查,三款每天免费检测工具推荐 知网AIGC检测前应该如何做好自查?随着国内各大高校全面启用知网二代 AIGC 检测系统,毕业生们在提交定稿前普遍面临着前所未有的压力。知网二代检测不仅能够识别显性的复制粘贴,…

作者头像 李华