GPT-4o与Gemini如何统一多模态?Maths, CS & AI Compendium 统一架构完整指南
【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium
📚Maths, CS & AI Compendium是一本开源的数学、计算机与 AI 综合教材,其中第 10 章「Multimodal Learning」完整拆解了GPT-4o 与 Gemini 的多模态统一架构:它们如何把文本、图像、音频、视频压缩成一条 token 序列,再用一个模型、一套共享权重实现跨模态的理解与生成。本文用最少的公式、最多的直觉,带你走通「统一多模态架构」的完整脉络。
为什么需要"统一"多模态架构?
早期的多模态系统像五间房子里的五位翻译,各管一种模态,靠墙上的传话口协作;而统一多模态架构是一位全能多语者——一个模型,一次前向传播,同时读懂文字、看懂图像、听清声音、处理视频。
统一还有两个硬理由:
- 工程上:
k种模态两两打通,最多需要k(k-1)条独立流水线(文生图、图生文、语音转写……),统一模型把它们收敛为一套系统; - 理论上:人类认知里视觉与语言从来不是孤立模块,跨模态绑定发生得早且深。共享权重还能让模型跨模态迁移——文本里"主语在谓语前"的时序模式,可以复用到视频里"物体先出现再移动"的时序推理。
从"拼积木"到"原生多模态":三种集成深度
GPT-4o 与 Gemini 并不在同一个集成深度上,教材用一个"遥控器"类比讲清了这条光谱:
| 集成深度 | 代表模型 | 核心思路 |
|---|---|---|
| 浅层 | NExT-GPT | 冻结 LLM 大脑 + 冻结的图像/音频专家,仅训练轻量投影层,用"模态信号 token"路由到对应解码器 |
| 中层 | CoDi | 各模态保留自己的扩散生成器,通过共享条件机制对齐隐空间,一次生成图像+匹配音频 |
| 深层 | Gemini、GPT-4o | 单模型端到端训练,跨模态注意力在预训练中自然生长 |
Gemini:从第一天起就"多模态"
Gemini 的 Transformer从预训练开始就吃交错序列——文本、图像、音频、视频 token 混排在一起。文本走 SentencePiece 分词器,视觉侧则学习一套类似 VQ 方案的视觉分词器。因为跨模态注意力是在预训练中有机生长出来的,而不是事后"加装"的,所以它的跨模态推理能力最深厚——代价也是训练成本最高。
GPT-4o:"o" 即 omni 的端到端架构
GPT-4o 把所有模态压进同一个 Transformer、同一个"预测下一个 token"目标:
- 音频 → 频谱 token(spectral tokens)
- 图像 → patch token
- 文本 → 子词 token
输出侧再由模态专属的解码头还原。它最关键的创新是延迟:早期系统(如 GPT-4V)要靠 ASR → LLM → TTS 三级模型级联,GPT-4o 把这串级联整体去掉,语音交互因此更接近"实时对话"。
编码器—共享主干—解码器:统一架构的骨架
把统一模型想象成一座工厂:单一装配线(共享主干)+ 不同卸货口(编码器)+ 不同发货部(解码器)。原料进厂前各自专业分拣,进厂后走同一条传送带:
- 模态编码器$E_m$:把原始输入变成一串
d维嵌入向量。文本是查表嵌入,图像常用 ViT 切 patch 后线性投影,音频先算梅尔频谱图再过卷积/Transformer 前端; - 共享 Transformer 主干:对所有模态的 token 拼接或交错后用自注意力处理——同一个注意力公式,只是 Q/K/V 里混进了不同模态的 token。图像 patch token 可以直接"看见"文本 token,跨模态推理不依赖任何额外的交叉注意力模块;
- 模态解码器$D_m$:把主干输出还原成原生格式(文本 token、像素、波形)。
细节上,每个 token 还会加上一个模态嵌入$e_m$(类似位置编码,但编码的是"我是哪种模态"),让主干知道 token 的出身。
多模态 Token 化:把图像和声音"翻译成"token
统一架构最大的工程难题是:文本是 1D 离散序列,图像是 2D 连续像素网格,音频是 1D 连续波形,视频还多了时间轴。解决方式就是分词(tokenisation),把一切变成 Transformer 能左到右消化的扁平序列:
- 图像有两条路:离散派用 VQ-VAE / VQ-GAN 把图像量化成码本索引序列,直接当"词汇表"用;连续派用 ViT/CNN 编码器产出连续嵌入再线性投影——Gemini 和 GPT-4o 走的是连续派,而 Parti、LlamaGen 这类自回归图像生成器偏爱离散派;
- 音频通常转梅尔频谱图,再经神经音频编解码器(EnCodec、SoundStream 等)离散化成层级 token,或经可学习编码器连续投影;
- 视频在图像分词之上压缩时间维,常用3D VQ-VAE量化"时空 patch"——时间压缩因子至关重要,24fps 的原始视频不做降采样会产生多到无法处理的 token。
分好词之后,各模态 token 用特殊分隔符标记边界,交错成一条序列。Transformer 按标准注意力处理整条混合序列,分隔符既是边界提示,也充当各模态片段的"池化点"。
一个绕不开的设计权衡是token 预算:一张图若占 256 个 token,而配文只有 50 个,图像就吃掉 5 倍上下文。于是有了 token 合并、自适应分词(简单区域少用 token、复杂区域多用)等技巧来平衡分辨率与上下文长度。
四阶段训练配方:为什么不能"一步到位"?
"你不会在教孩子算术之前先教他微积分。" 统一多模态模型从随机初始化直接联合训练所有模态,实践中几乎无法收敛,主流方案是分阶段训练(staged training):
- 单模态预训练:文本主干在万亿级 token 上做下一词预测,视觉编码器在分类/自监督(MAE、DINO)目标上预热,音频编码器在语音识别数据上预热;
- 跨模态对齐:把编码器接到共享主干,在成对数据(图文对、音频-转写对)上做对比或生成式对齐,此时编码器可冻结,只更新投影层与主干;
- 联合多模态预训练:解冻几乎全部参数,在单模态+多模态混合数据上用一个下一词预测目标训练——模型必须预测"下一个 token",无论它是文本、图像还是音频 token,被迫形成真正的跨模态理解;
- 指令微调与对齐:在多模态指令数据上微调,并用 RLHF / DPO 对齐人类偏好。
阶段内还要做模态预热防止"模态坍缩":文本数据量占绝对优势,若不控制,模型会"忘记"弱模态。手段包括梯度平衡、数据比例调度与按模态加权的损失。
统一架构怎么考?主流评测基准一览
没有单一指标能衡量"能看、能听、能读、能动"的模型,主流做法是打一套组合拳:
- MMLU:57 个学科的知识基线——统一模型学会视觉后不应出现文本能力回退(掉了就是灾难性遗忘的信号);
- MMBench:20 个细粒度视觉-语言能力维度,检验模型是真看懂图,还是在走文本捷径;
- SEED-Bench:1.9 万道图文/视频选择题,专测时序理解与组合推理;
- MM-Vet:单题同时要求识别、OCR、空间感知、生成、知识检索多种技能;
- MathVista:几何图、统计图表、函数曲线上的数学推理,直指多模态思维链能力;
- WebArena / OSWorld等智能体基准:以任务成功率衡量长程规划与容错。
一个持续的隐患是数据污染:模型在 internet 级数据上训练过,基准图题可能"背过答案",严格去重与留出集是必要但不完美的防线。
延伸阅读与动手路径
想继续深挖统一多模态架构、世界模型(JEPA、Sora 类视频预测)与多模态智能体,可对照仓库中的原始章节:
- 统一架构主章节(本文素材):chapter 10 - multimodal learning/05. unified multimodal architectures.md
- 多模态表征与 CLIP 式对齐:chapter 10 - multimodal learning/01. multimodal representations.md
- 视觉语言模型(VQA、Captioning、LLaVA):chapter 10 - multimodal learning/02. vision language models.md
- 图像/视频分词(VQ-VAE、VQ-GAN、3D 量化):chapter 10 - multimodal learning/03. image and video tokenisation.md
- 教材总览与章节大纲:README.md
💡 所有架构图(SVG)都放在 images/ 目录下,可配合章节原文对照阅读;仓库内含 MCP Server,还能让 AI 助手把整本教材当知识库来用。
总结
GPT-4o 与 Gemini 代表了多模态统一的**"原生端到端"方向:一切模态 → 一条 token 序列 → 一个共享 Transformer → 同一个预测目标。与 NExT-GPT 这类"拼积木"方案相比,集成越深,跨模态推理越强,训练越贵。而分阶段训练配方**正是把"理论上的优雅"变成"工程上可行"的关键——这也是 Maths, CS & AI Compendium 用直觉先行的方式讲透的核心。
【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考