2026 年的 AI 应用岗,已经从“会用大模型”变成“会造 Agent”。这条路线按六个阶段拆开,每阶段只留知识点 + 动手任务 + 验收标准 + 面试考点,照着做就行。
先搞清楚:Agent 工程师在考什么
| 层级 | 能力 | 一句话 |
|---|---|---|
| L1 基础 | Python / FastAPI / Transformer / Prompt | 写得出手工循环,才知道框架帮你做了什么 |
| L2 核心 | RAG · Embedding · 检索重排 · Tool Calling · MCP | 让模型看得见数据、摸得着系统 |
| L3 编排 | LangChain / LangGraph / 多 Agent | 状态机、条件路由、人机协同断点 |
| L4 工程化 | 评测 / 可观测 / 重试降级 / 安全护栏 / 成本 | Demo 到生产的分水岭 |
| L5 表达 | 项目复盘 + 八股 + 面试表达 | 决定能不能拿到 Offer |
大多数人卡在 L4、L5——项目做了一堆,讲不出指标和取舍。所以这条路线的要求是:每个阶段都必须留下能讲的东西。
📚 阶段一:夯实开发基础(3–5 周)
Python 工程底子
asyncio 并发(Agent 工具并发全靠它)、httpx/requests、FastAPI 路由 + 依赖注入 + 中间件、Pydantic 校验、统一错误码、Git + Docker。
大模型够用知识
Token / 上下文窗口 / KV Cache 与 Prompt Cache(命中后延迟与成本大幅下降,是生产环境的核心指标)、Temperature/Top-p 的工程含义、Self-Attention/QKV/RoPE/MoE、SFT/RLHF/DPO/LoRA 的适用边界。
Prompt 与结构化输出
角色设定、CoT、少样本、ReAct;JSON Schema / JSON Mode / 约束解码;system 前缀缓存友好写法(别在前缀里塞时间戳或随机 ID);要求「仅基于参考内容回答,无依据则拒答」。
✅ 任务
手写一个 50–100 行的 ReAct 循环,挂计算器 + 联网搜索两个工具。先手写再学框架,你才会知道死循环、参数传错、上下文爆炸是怎么发生的。
🤖 阶段二:Agent 核心技术(4–6 周)
RAG 全链路
文档接入 → 清洗 → 切分 → 向量化 → 索引 → 检索 → 重排序 → 上下文组装 → 生成 → 引用溯源。
关键点:
- 按语义边界切分并保留重叠;
- 稠密向量 + BM25 多路召回再融合;
- Rerank 是性价比最高的一跳;
- Query 改写 / HyDE / 实体抽取;
- 增量索引与缓存失效;
- 权限过滤要在召回阶段做;
- 指标看 Hit Rate / MRR / Recall@K / 端到端正确率。
Embedding 与向量库
bge/e5/text-embedding-v3 等选型;Milvus / Qdrant / pgvector / Chroma / FAISS 的单机 vs 分布式与过滤能力差异。
Tool Calling
模型并没有真的调用函数,它只是按 Schema 输出 JSON,你的代码负责解析 → 执行 → 回填。
所以:
- 选错工具 = Schema 描述含糊;
- 传错参数 = 类型没说清;
- 无法自救 = 错误没结构化。
补充:并行工具调用、意图预路由(每轮只给 5–8 个工具)。
MCP(必学)
解决 M 个模型 × N 个工具的集成爆炸。
架构 = Client(协议转换/工具发现)+ Server(工具逻辑与安全审计)+ Transport(stdio / HTTP-SSE / streamable HTTP)。
交互四阶段:初始化 → 发现 → 执行 → 状态写回。
常见坑
- stdio 子进程 PATH 问题(Docker 里 command not found,写绝对路径或用 env 注入);
- HTTP transport 高频
get_tools()打挂 server(启动时拉一次缓存); - 不可信 server 的 description 可能诱导 prompt 注入(只接内网 + args 校验);
- checkpoint 与异步资源串扰(显式
aclose())。
框架
LangGraph 三件套必须熟——StateGraph + Conditional Edge + Checkpointer,再加 Subagent/Handoff。
顺带了解:
- LlamaIndex(检索强)
- AutoGen/CrewAI(多智能体)
- Smolagents(Code as Action)
- Pydantic AI(类型安全)
✅ 验收物
一个「联网搜索 + MCP 工具 + 向量检索」的单 Agent,带递归限制、超时熔断、结构化错误返回。
💻 阶段三:企业级项目实战(6–8 周)
每个项目都要走完:需求分析 → 任务拆解 → 工具接入 → 记忆设计 → 参数校验 → 异常处理 → 效果评测 → 容器上线。
企业 RAG 知识库
多格式解析、表格图片单独处理、语义切分 + 混合检索 + Rerank + 引用溯源、部门级权限隔离、增量同步、失败告警;加分项 GraphRAG、跨语言检索。
企业级智能客服
意图识别 → 订单/物流/退款 Agent 分工 → MCP 调业务系统 → 高危操作人工审批 → 生成回复。
重点:
- 多 Agent 分工而非单 Agent 堆工具;
- Human-in-the-Loop 审批断点;
- 幂等与补偿;
- 兜底降级转人工。
一定要准备一段事故复盘(如物流延迟误判为丢件导致误退),面试官最爱追问。
工程级代码助手
Text2SQL / 仓库理解 / PR Review / 单测生成;沙箱执行、只读默认、写操作二次确认、repo 级检索代替全量塞入。
数据分析助手
NL → SQL/Python → 执行 → 自检 → 图表;Schema 感知、SQL 校验、只读账号、行数上限与超时、换一种方式重算比对。
Agent Workflow 编排平台
可视化编排节点、状态持久化与断点续跑、全链路 Trace + Token 成本归因 + 回放、模型分级路由(规划用强模型、执行用性价比模型、校验用轻模型)。
每个项目沉淀四样
- 架构图;
- 指标表(准确率/P95/成本,前后对比);
- Bad Case 集(≥30 条并分类归因);
- 踩坑复盘(≥3 个带根因与修复)。
🔥 阶段四:进阶 Skills / Harness / Hermes / OpenClaw / PI Agent
目标不是追新,而是建立组件级认知:
| 概念 | 通俗理解 |
|---|---|
| MCP | 统一话术,模型和技能之间的标准接口 |
| Skill | 干活的手,一个可复用任务包(SKILL.md + scripts + assets) |
| Harness | 安全工位,负责环境隔离、权限校验、模型适配、容错与记账 |
- OpenClaw(TS,多渠道个人助理):强在多渠道整合、skills 生态分发、auth profile 调度与 memory 检索,适合当「可控性与隐私」参考实现读源码。
- Hermes(Python,自我进化型):强在 Skill 即程序性记忆——任务成功或踩坑后自动 create/patch/edit 自己的 skill,配合 GEPA 离线批量进化,适合理解「Agent 如何越用越聪明」。
- Harness Engineering:统一跑、统一收、统一记账、统一容错,是 2026 生产环境的热门方向。
- PI Agent 等垂直方案:看它怎么把 SOP 数字化、怎么划领域工具与合规边界。
✅ 任务
- 手写一个 skill 包挂到 Hermes/OpenClaw 跑通;
- 把自有服务包装成 MCP Server 接进 LangGraph;
- 写一页笔记:什么时候用 Skill、什么时候用 MCP、什么时候写死 Workflow。
🧑💻 阶段五:AI Coding 工程训练(专项 2–3 周)
开发联调
Spec-Driven,先定接口契约 / State Schema / 工具 Schema 再生成代码;分层 prompt(架构约束 > 接口 > 实现);生成的代码必须过人工架构审查(边界、幂等、权限、成本)。
Trace 定位四类问题
- 工具选错:intent 第一步就偏 → tool description 含糊/工具太多没路由;
- 参数错误:args 错位缺类型枚举;
- 死循环或早停:轮次异常 → 缺 recursion_limit、Observation 无信息增量;
- 幻觉:引用缺失数值对不上 → 未强制基于参考内容、缺自校验重算。
补充:推理模型过度思考就设thinking.budget_tokens上限,简单任务reasoning_effort: minimal。
Bad Case 驱动迭代
建badcase.csv(query/期望/实际/归因类别/修复/是否回归),归因分类要稳定才能统计改进效果,每次改动跑回归集。
重试/降级/熔断
- 工具层:指数退避 + 幂等键 + 结构化错误返回;
- 推理层:最大迭代 + 循环检测 + 全局超时;
- 系统层:token 预算上限、QPS 限流、模型 Fallback 链;
- 业务层:失败无缝降级到规则/模板/人工。
安全边界
Guardrails 输入门神、越权在 Supervisor 前拦截、不可信内容不进 system 前缀、工具权限最小化且只读默认、高危二次确认 + 审计日志、出参脱敏。
Code Review Checklist
Schema 完整性、幂等性、超时与重试、recursion_limit、checkpoint 序列化、异步资源释放、prompt cache 命中率、token 预算、权限与注入面、日志 trace 覆盖。(放 README 里很加分)
🚀 阶段六:求职冲刺(3–4 周)
八股优先级
- RAG 全链路(最高频,要能画图能讲评估)
- 向量库/混合检索/Rerank
- Transformer 基础与 KV Cache/采样参数
- 幻觉治理的系统性方案(只答“调 prompt”会被否)
- ReAct / Plan-and-Execute / Reflection 对比
- Function Calling 原理 vs MCP 协议区别
- Agent vs Chatbot vs Workflow 区别
- 记忆分层与上下文溢出
- 多智能体模式与选型依据
- 微调 vs RAG vs Prompt 的选型边界
高频真题
- 降低幻觉的完整落地方案;
- 同一问题多次运行为何工具顺序不同、怎么处理;
- 模型凭什么选 A 不选 B;
- 工具调用失败的兜底;
- 检索结果冲突怎么融合;
- 企业级权限隔离怎么做;
- Multi-Agent 的禁用场景(答得出才算真懂);
- LangGraph 为何适合有状态 Agent、如何实现人工确认节点;
- 生产环境延迟瓶颈与优化;
- 如何设计自动化评测与迭代体系;
- 分享一个落地坑与解法(必问,提前备 3 个)。
简历三条硬规则
- 每个项目必须有三维数据(Accuracy / Latency P95 / Cost);
- 不要堆框架名词,专精 1–2 个并讲清选型理由;
- 突出个人决策与难点,别写“我们用了什么”。
项目描述模板
面向 XX 业务的智能客服 Agent|独立负责 背景:日均 XX 单,重复咨询占 XX%,响应 P95 约 XX 秒 方案:LangGraph 编排客服/订单/退款三 Agent + MCP 接入 4 个业务系统 + 混合检索与 Rerank 知识库 + 高危操作人工审批断点 难点:物流延迟误判导致误退 → 引入状态校验与审批节点;工具选错率高 → 重写 tool description 加意图预路由 结果:自助解决率 XX%→XX%,P95 XXs→XXs,单次成本降 XX%,线上事故 0 起模拟面试
白板画架构图、现场排查一段 trace、手撕 Easy/Medium(LRU、合并区间、合并有序链表);综合面提前准备故事别临场编;每场复盘补成知识卡片。
Offer 评估权重
- 业务是否有真实场景和数据(没场景的 AI 岗半年就废)
- 团队技术氛围与带教
- 算力与模型资源
- 岗位内容是造轮子还是接外包
- 薪资职级
入职前 30 天:先看代码库、评测集、线上 badcase,第一周跑通一条端到端链路并产出一份改进清单。
🗓 时间表与避坑
| 人群 | 节奏 | 周期 |
|---|---|---|
| 零基础转行 | 5+6+8 周 + 穿插四五 + 冲刺 4 周 | 约 6 个月 |
| 后端转岗 | 2 周补 Python 异步与 LLM + 4 + 6 + 3 | 约 3–4 个月 |
| 校招/研三 | 项目与八股并行,秋招前 2 个完整项目 + 1 个开源贡献 | 按节点倒排 |
| 在职提升 | 聚焦阶段二+四+五,把当前工作改造成 Agent 项目 | 2–3 个月 |
四个避坑
- 别一上来学框架,先手写 minimal Agent;
- 别过度设计,能用 Workflow 或一次 LLM 解决的别硬上 Agent,能说清“什么不该用 Agent”是资深信号;
- 别忽视评测,没有 golden set + LLM-as-Judge + 回归的项目上线就是盲人摸象;
- 别神话推理模型,简单任务开深度思考只会烧钱拖速度,必须按任务分级路由。
资源(够用不贪多)
- Lilian Weng《LLM Powered Autonomous Agents》
- Anthropic《Building Effective Agents》
- ReAct 论文
- LangChain / LangGraph / LlamaIndex / MCP / FastMCP / Claude Agent SDK / OpenAI Agents SDK 官方文档
- HuggingFace Agents Course、Berkeley LLM Agents
- LangSmith / LangFuse(可观测)
- Ragas / Phoenix(评测)
- Milvus / Qdrant
- Docker
Agent 的技术栈半年一变,但底层能力不变:把模糊需求拆成可执行步骤、设计可观测可回滚的系统、用数据闭环持续迭代。走通这条路的人,靠的不是记住多少框架 API,而是手里有几个真正跑在生产上的项目。
你现在卡在哪个阶段?手上项目的指标是多少?评论区说说,我帮你看路线要不要调整。觉得有用可以收藏关注,后续我把阶段三的五个项目逐个拆成带代码的实战篇。