在上一篇文章中,我们聊到了 AI Agent 如何验证渲染 Bug、如何分辨进程退出原因,以及为什么“不确定时问人”比“假装什么都知道”更重要。那些讨论聚焦在 Agent 的能力边界上——它能看见什么、不能看见什么、什么时候该停下来。
今天我们把视角拉远一点,回答两个更底层的问题:
- MCP 是什么?它如何给 Agent 装上“眼睛”和“手脚”?
- 如果要开发一个 AI 大模型,需要经历哪些步骤、学什么语言、花多少钱?
这两个问题看似独立,实则一体两面:MCP 让 Agent 能调用外部世界,而大模型是 Agent 的“大脑”。理解它们,才能理解 AI Agent 从“能说会道”走向“能看能做”的完整图景。
一、MCP:AI Agent 的“USB-C 接口”
1.1 什么是 MCP?
MCP 全称Model Context Protocol(模型上下文协议),由 Anthropic 在 2024 年底推出并开源。它的核心思想很简单:为 AI 模型与外部工具、数据源之间建立一个统一的接口标准。
在 MCP 出现之前,每让 AI 连接一个新工具(比如数据库、浏览器、GitHub),开发者都需要为不同的 AI 应用编写特定的集成代码。这就像在 USB-C 出现之前,每个设备都有自己的充电口——繁琐、重复、难以复用。
MCP 的作用就是提供一套标准协议,让 AI Agent 能够“即插即用”地调用外部能力。它不关心底层是 Python 还是 Go,不关心工具是本地还是云端,只关心接口是否统一。
1.2 MCP 的使用是免费的吗?
需要分开看:
- 协议本身是免费的:MCP 是一个开放、开源的标准,任何人都可以免费使用和实现。
- MCP 服务器(工具)大多免费:绝大多数社区和官方提供的 MCP 服务器都是开源免费的。例如,微软官方的 Playwright MCP 就是 Apache-2.0 许可,完全免费。
- 潜在付费场景:
- 模型调用费:这是最主要的成本。当 Agent 使用 MCP 工具时,工具返回的结果(如网页截图、数据库数据)会作为上下文发送给大模型,这会消耗 Token。例如,用 Playwright MCP 完成一个典型任务,在 Claude Sonnet 模型上大约消耗 11.4 万 Token,成本约 0.34 美元。
- 第三方 API 费用:部分 MCP 服务器可能封装了付费的第三方服务(如高级搜索 API),使用这些服务时会产生额外费用。
- 云托管服务:如果你选择使用云平台提供的 MCP 托管服务,可能会产生部署或调用时长费用。例如,阿里云百炼的某些 MCP 服务提供 2000 次免费调用,超出后按 29 元/千次计费。
1.3 有哪些常见的 MCP?
MCP 生态发展迅速,覆盖了从编码、设计到办公的各类场景。以下是一些代表性服务器:
| 类别 | MCP 服务器 | 主要功能 |
|---|---|---|
| 代码与开发 | GitHub MCP | 管理 Issues、PRs,操作代码仓库 |
| Playwright MCP | 浏览器自动化,控制网页、进行测试和抓取 | |
| Chrome DevTools MCP | 集成 Chrome 开发者工具,用于调试和性能分析 | |
| Context7 MCP | 实时获取最新的库文档和代码示例 | |
| Serena MCP | 提供语义级的代码检索与编辑能力 | |
| 设计与协作 | Figma MCP | 让 Agent 直接读取 Figma 设计稿的布局和样式信息 |
| Notion MCP | 创建、编辑、搜索 Notion 页面 | |
| 飞书 Lark MCP | 操作飞书消息、日历、文档等 | |
| 网页与数据 | Firecrawl MCP | 网页抓取,并将内容提取为 Markdown |
| Jina AI MCP | 提供语义搜索、图像搜索等跨模态搜索能力 | |
| 工作流 | n8n MCP | 连接 n8n 自动化平台,实现复杂工作流 |
你可以通过awesome-mcp-servers等社区列表发现更多 MCP 服务器。
1.4 给 Agent 加视觉功能的 MCP 是什么?
给 Agent 加视觉功能的 MCP,核心作用是让 Agent 能够“看见”渲染后的画面,从而验证 UI 是否正确。它们通常提供以下一种或多种关键能力:
- 截图(Screenshot):捕获浏览器页面或桌面窗口的 PNG 图像。
- 视觉差异对比(Screenshot Diff):比较两张截图的差异,并高亮显示变化的像素。
- 页面交互与状态获取:除了“看”,还能点击、输入、执行 JavaScript,并获取页面状态。
这类 MCP 的代表包括:
- Playwright MCP(Vision Mode):微软官方出品。它的“视觉模式”增加了基于坐标的工具,可以通过截图与 Canvas、WebGL 等传统方式难以访问的元素进行交互。
- OpenCode 视觉 MCP:专为编码代理设计,支持截图、录制 GIF、页面交互、状态对比和 JavaScript 执行,形成一个完整的“观察-行动-验证”闭环。
- Aperture MCP:定位是为 AI 编码代理提供“眼睛”。它可以截取本地开发服务器的画面,控制 Token 成本,检测变化并计算视觉差异。
- Agent Vision MCP:通过 Chrome DevTools Protocol 直接访问实时浏览器标签页,按需捕获真实的 PNG 截图。
这些工具让 Agent 能够自主地“打开程序、截图、分析、修改、再验证”,从而闭环地解决渲染 Bug 的验证问题。但需要记住:它们只能让 Agent 判断“元素有没有渲染出来”,不能替人判断“渲染得好不好看”。
二、开发 AI 大模型:从数据到部署的完整路径
如果说 MCP 是 Agent 的“感官”,那么大模型就是它的“大脑”。开发一个 AI 大模型是一个系统性的工程,核心路径可以概括为数据准备、模型训练、模型微调、模型部署四大阶段。
2.1 四个核心阶段
- 数据准备:数据是模型性能的生命线。这个阶段涉及从海量来源(如网页、书籍、代码)采集数据,并进行复杂的清洗、去重和格式化处理。当数据规模达到 PB 级别时,需要借助分布式计算框架来完成。
- 模型训练:这是最耗费资源的阶段,通常称为预训练(Pre-training)。模型会在数万亿计的、无标注的通用文本上进行学习,通过自监督任务,从文本结构中学到语法、事实、常识和逻辑推理能力,最终得到一个“通才”模型。这个过程可能需要成千上万张 GPU 组成的集群,耗时数周甚至数月。
- 模型微调:预训练后的“通才”模型可能行为不稳定。微调是让它成为特定领域“专才”的关键步骤。主流方法包括全量微调(效果最好但成本极高)和参数高效微调(PEFT)。其中,LoRA和QLoRA因其资源消耗小、效果接近全量微调而成为主流选择,使得在消费级显卡上微调大模型成为可能。
- 模型部署:训练好的模型需要通过**推理(Inference)**来真正解决具体问题。这涉及将模型集成到应用程序中,并可能需要进一步的推理优化(如量化、蒸馏)来提升响应速度和降低成本。
2.2 需要学习哪些编程语言?
- Python:绝对的核心。它是 AI 和深度学习领域的主导语言,拥有最丰富的生态,如 PyTorch、TensorFlow 等框架和 Hugging Face 等模型库,几乎所有的开发和训练工作都围绕 Python 展开。
- CUDA / C++:性能优化的关键。如果你希望深入底层,优化模型在 GPU 上的训练和推理速度,那么学习 CUDA(NVIDIA 的并行计算平台)和 C++ 是必经之路。这能让你进行高性能计算和自定义算子开发。
- 其他语言:虽然 Python 是主流,但在某些特定场景下,Rust、Go 等语言也可能用于构建高性能的推理服务或数据处理管道。
2.3 如何训练云端大模型?
对于个人或团队而言,云端训练是更现实、更高效的选择,无需自建昂贵的硬件集群。主流云平台都提供了一站式的大模型训练服务。
- 主流云平台:阿里云(百炼平台、PAI)、腾讯云(TI-ONE)、金山云(星流平台)、魔搭社区(Twinkle)等。
- 典型流程:通常包括资源组创建(选择 GPU 机型)、存储配置(挂载数据集和模型文件)、创建训练任务(指定镜像、启动命令、环境变量)等步骤。你可以使用平台预置的镜像(如包含 PyTorch、CUDA 的镜像)快速开始。
- 框架支持:这些平台通常集成或支持主流的开源训练框架,如LLaMA-Factory(用于微调)、Megatron-LM(用于大规模预训练)、veRL(用于强化学习)等,大大降低了开发门槛。
2.4 开发大模型需要多贵的电脑?
这是最关键的问题之一。硬件成本取决于你的目标:是进行前沿研究、训练千亿级模型,还是微调一个 7B/13B 模型用于特定任务。
个人/团队微调(7B-70B 模型):这是大多数开发者的起点。得益于QLoRA等量化技术,你可以在单张消费级显卡上微调大模型。
- 入门选择:RTX 4090 (24GB)或RTX 3090 (24GB)。配合 QLoRA,可以微调 7B 甚至 13B 的模型。一张 RTX 4090 的价格约为1.5 万-2 万元人民币。
- 云端租用:在 io.net 等平台,租用一张A100 40GB(约$1.20/小时)可以完成 7B 模型的完整微调或 70B 模型的 QLoRA 微调。一次 LoRA 微调的成本可以控制在10 美元以下。
百亿参数模型训练(100 亿-1000 亿参数):这时需要多卡集群。
- 硬件配置:需要H100或A100 80GB级别的 GPU,通过高速互联(如 NVLink)组成集群。
- 成本估算:一套这样的集群成本在100 万到 500 万元人民币之间。
千亿参数以上大模型训练(如 GPT-4 级别):这是真正的“军备竞赛”。
- 硬件配置:需要H300、MI350X等旗舰卡组成的超级集群,配备 InfiniBand 网络。
- 成本估算:硬件成本高达500 万到 2000 万元人民币。
三、结语:感官与大脑,缺一不可
MCP 让 AI Agent 有了“眼睛”和“手脚”,能打开程序、截图、查数据库、调 API;大模型则是它的“大脑”,决定了它理解世界、推理决策、生成代码的能力。
两者结合,才是完整的 AI Agent:
- 没有 MCP,大脑再聪明也无法感知外部世界,只能空谈。
- 没有大模型,工具再多也无法理解任务、规划步骤、修正错误。
对个人开发者而言,最务实的路径是:从 Python 和 PyTorch 入手,利用云端平台和 LoRA/QLoRA 等高效微调技术,从微调一个 7B 或 13B 的开源模型开始,而非直接尝试从零预训练一个千亿级模型。同时,善用 MCP 生态,让 Agent 能调用浏览器、数据库、设计稿等外部能力,快速构建出能看、能做、能验证的智能应用。
云端训练让你能以极低的成本起步,消费级显卡也能满足特定任务的微调需求,而MCP则让 Agent 的能力边界从“聊天”扩展到“操作世界”。
这就是从 MCP 到云端大模型的完整图景:感官与大脑,缺一不可。