多模态RAG真香！一文带你掌握AI开发的最新技术趋势，小白也能秒懂的编程干货！-平芜编程栈

“多模态RAG目前主流的思路有两种，一种是模态对齐，另一种是使用文本作为中间模态进行转换。”

RAG技术目前已经被广泛应用于智能问答，知识库等场景；但随着需求的不断深化，简单的文本问答已经很难满足需求，因此多模态RAG就被提上了日程。

但是，多模态模型虽然经过一两年时间的发展，但在多模态RAG领域依然存在很多问题，这也是目前多模态RAG应用比较少的原因之一；虽然说网上存在部分多模态RAG的教学，但大部分都是理论介绍和一些基础入门，而在实际开发中基本上没任何作用。

多模态RAG

但不管怎么说，多模态RAG作为未来的发展方向，我们还是要对其有一定的了解。

首先，第一点多模态指的是不同模态的数据，这里的模态指的是数据的不同形式，主要包括以下几种，文本，图片，音频，视频；其中表格数据算不上多模态类型，因为表格是一种数据组织结构，而不是一种数据格式。

其次，目前市面上所谓的多模态模型，大部分也仅仅支持两种模态，如文字转图片，语音，视频等；即使所谓的全模态模型，也只是只是更多的模态类型，但也只能同时使用一种；如你上传图片，就不能上传音频和视频内容。

如下图所示，虽然支持了多种模态的数据，但并不是同时支持多种模态数据。

而且，从工程开发的实操角度来看，你会发现这些多模态模型的请求接口，不同模态的数据使用的是不同的参数，并不能把多种模态的数据放到一块处理。

所以，从这一点来说，所谓的多模态其实应该叫两模态，主要就是文本与其它模态的转换。

我想很多人应该对多模态RAG比较好奇，因为很多人听说过多模态RAG，但好像在真实的工作中并没有遇到过多模态，或者说用到的很少。并且没有针对多模态RAG做个真正的工程化开发，大都是跑个小DEMO yy一下。

事实上，多模态RAG要远比我们想象中的复杂，它并不是说调几个多模态模型就可以了，它需要解决很多复杂的问题；如多模态的文档切分，提取，转换，生成，选择哪些模型，参数怎么传。

举个例子，如果针对一个房屋设计的文档做多模态RAG怎么搞？因为大楼设计的核心在于设计图，文字描述只是用来辅助理解，怎么精确的查找到需要的图纸？如果让模型仿照图纸做优化设计怎么搞？

当然，这其中很多问题作者到现在也没搞明白，但学一点就记录一点，哪怕都是问题至少也是自己学习和思考的过程。

首先，通过使用openai之前发布的老的经典多模态模型clip，作者发现一个问题；在之前，作者对多模态最直观的理解是文搜图和图搜图；这一点相对应用场景比较广，如电商平台的搜索功能，并且易于理解。

但之前作者认为的多模态RAG，就是让多模态模型去理解图片，音频或视频中的内容，并做文字总结；之后，再对总结的文字做向量化，之后通过文字向量计算的方式来查找。

但研究了Clip之后才发现，Clip是直接把文字，还有图片转换成向量，然后通过模态对齐的方式，让文字向量和图片向量产生关联，然后可以进行相似度计算。即通过文字搜图片(text-to-image)，通过图片搜文字(image-to-text)，通过文字搜文字(text-to-text)，通过图片搜图片(image-to-image)。

所以，现在多模态RAG的实现方式主要有两种或者说三种，一种是直接同模态数据进行搜索，如文本搜索，图搜图等；这种相对就比较简单，同一种模态的数据进行相似度计算也很合理。第二种就是跨模态，如文搜图，文生图等，让不同模态的数据产生交集；而针对这种跨模态数据，有两种实现方式，一种就是模态对齐的方式，直接把不同模态的数据转换成向量格式进行处理；第二种就是通过文本作为中间格式，比如对图片进行总结，然后生成总结文本，通过总结文本进行检索。并不直接对图片本身进行检索。

受限于模型技术的发展，多模态技术目前还处于初级阶段，还存在各种各样的问题；因此，多模态RAG针对不同的场景也有不同的实现思路，并不能一概而论。

学AI大模型的正确顺序，千万不要搞错了

🤔2026年AI风口已来！各行各业的AI渗透肉眼可见，超多公司要么转型做AI相关产品，要么高薪挖AI技术人才，机遇直接摆在眼前！

有往AI方向发展，或者本身有后端编程基础的朋友，直接冲AI大模型应用开发转岗超合适！

就算暂时不打算转岗，了解大模型、RAG、Prompt、Agent这些热门概念，能上手做简单项目，也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料，手把手帮你快速入门！👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型（GPT、文心一言等）特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架（LangChain等）实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块，看似清晰好上手，实则每个部分都有扎实的核心内容需要吃透！

我把大模型的学习全流程已经整理📚好了！抓住AI时代风口，轻松解锁职业新可能，希望大家都能把握机遇，实现薪资/职业跃迁～