不知道你有没有过这种困扰,身边的人都在学习Agent同时也在劝你学习Agent,但是没有人告诉过你Agent到底是什么,它能解决什么问题,怎样才能学习它?这篇文章帮你解决这个问题。
一. Agent是什么?
1.1 LLM和Agent
1.1.1 LLM是什么?
想要知道Agent是什么,就需要先了解LLM(Large Language Model 大预言模型)
LLM就相当于一个超级大脑,通过海量的文本数据学习掌握了各种知识。我们日常用的ChatGPT,Deepseek的底层都是LLM。
1.1.2 LLM的弊端?
LLM的优点是非常聪明,但是弊端就是不能进行具体的操作,就像一个只有大脑的人类,只能进行思考而不能通过思考进行具体的动作。
弊端一:只会说不会做
比如你让一个LLM帮你购买一张火车票,它会把买火车票的所有步骤都详细的告诉你,但是不能自动的打开12306真的去帮你购买。换句话说LLM的能力被限制在对话框里面了,而不能跟外界进行互动。
弊端二:没有记忆
这个很好理解,就是LLM一次只能记住一次对话的内容,当我们新开了一个对话,LLM就不知道你是干什么的了。比如你跟豆包说【我叫XXX】在本次对话它知道你叫XXX,但是当你开了一个新对话它就不知道你叫XXX了。
弊端三:不会使用工具
我们之前说过LLM就相当与一个只有大脑的人类,它只能思考不能使用工具。
比如你问【今天上海的天气怎么样】它不会像你一样去调用天气APP从而知道,而是从它自己训练数据里面的旧数据进行猜测。但是这些数据是有截止日期的,如果你问的问题它里面没有,那么就会导致 幻觉 出现,LLM就会瞎说。
弊端四:不会进行规划
让LLM完成一个复杂的任务【帮我写一份同类型商品报告】它不会像人一样先去收集同类型的商品信息,进行比较。而是直接生成一大段话,就是说LLM不会一步步的去执行,而是你问一句它答一句。
1.1.3 Agent是怎么改进LLM的弊端的?
上面讲解完了LLM的弊端,你可能已经在想可不可以让LLM又能【说】又能【做】,这就是Agent要解决的问题。
Agent(智能体)简单的说:Agent是在LLM循环中自主使用工具的系统
如果说LLM是一个只有大脑的人类,那么Agent就是一个功能健全的人类
比如你说【给我订一张长春飞往北京的飞机票】LLM会把所有的步骤告诉你,而Agent会真正的在携程App去购买。
- 解决弊端一: Agent引入了工具调用的能力,可以调用搜索引擎、数据库、API、代码执行器等各种外部工具来真正执行操作。
- 解决弊端二:Agent配备了记忆系统,包括记住当前任务上下文的短期记忆,和存储在外部数据库中、可以跨对话保留的长期记忆。
- 解决弊端三:推出了 MCP 等标准化协议来统一工具接入方式。
- 解决弊端四:Agent 具备了任务拆解和规划能力,能把一个大目标分解成多个小步骤,然后逐步执行。
1.1.4Agent的组成
Agent包含四个模块:
第一个模块:大脑也就是LLM,负责理解意图,推理判断,决定下一步行动
第二个模块:规划模块,负责把复杂任务进行拆解,进行规划
第三个模块:记忆模块,负责储存和检索信息,让Agent在任务中连贯
第四个模块:工具模块,与外界交互
1.1.5Agent和Workflow的区别
可能会有人会把Agent和Workflow混淆,因为确实比较像,都是一步一步的执行。但是它们的设计理念是完全不同的
举例:假设用户要进行退款操作Workflow是这样的
- 第一步接收申请 - 第二步调用 LLM 提取关键信息 - 第三步查数据库获取订单详情 - 第四步调用 LLM 判断是否符合退款政策 - 第五步执行退款或生成拒绝邮件,第六步发送通知。它是完全写死的步骤。
但是Agent不同,它是在收到这个任务之后自己决定下一步应该去干什么。
比如:
它收到「处理这个退款申请」的任务后,自己来决定怎么做,先看看申请写了什么,然后觉得需要查一下订单信息,发现情况有点特殊就去搜索退款政策文档,推理判断后决定执行退款,最后给客户发邮件通知。
Workflow 是指 LLM 和工具通过预定义的代码路径进行编排的系统,而 Agent 是指 LLM 动态主导自身流程与工具调用的系统,由 LLM 自主决定如何完成任务。