news 2026/9/17 11:29:03

GPT-4o与Gemini如何统一多模态?Maths, CS AI Compendium 统一架构完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
GPT-4o与Gemini如何统一多模态?Maths, CS AI Compendium 统一架构完整指南

GPT-4o与Gemini如何统一多模态?Maths, CS & AI Compendium 统一架构完整指南

【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium

📚Maths, CS & AI Compendium是一本开源的数学、计算机与 AI 综合教材,其中第 10 章「Multimodal Learning」完整拆解了GPT-4o 与 Gemini 的多模态统一架构:它们如何把文本、图像、音频、视频压缩成一条 token 序列,再用一个模型、一套共享权重实现跨模态的理解与生成。本文用最少的公式、最多的直觉,带你走通「统一多模态架构」的完整脉络。

为什么需要"统一"多模态架构?

早期的多模态系统像五间房子里的五位翻译,各管一种模态,靠墙上的传话口协作;而统一多模态架构是一位全能多语者——一个模型,一次前向传播,同时读懂文字、看懂图像、听清声音、处理视频。

统一还有两个硬理由:

  • 工程上k种模态两两打通,最多需要k(k-1)条独立流水线(文生图、图生文、语音转写……),统一模型把它们收敛为一套系统
  • 理论上:人类认知里视觉与语言从来不是孤立模块,跨模态绑定发生得早且深。共享权重还能让模型跨模态迁移——文本里"主语在谓语前"的时序模式,可以复用到视频里"物体先出现再移动"的时序推理。

从"拼积木"到"原生多模态":三种集成深度

GPT-4o 与 Gemini 并不在同一个集成深度上,教材用一个"遥控器"类比讲清了这条光谱:

集成深度代表模型核心思路
浅层NExT-GPT冻结 LLM 大脑 + 冻结的图像/音频专家,仅训练轻量投影层,用"模态信号 token"路由到对应解码器
中层CoDi各模态保留自己的扩散生成器,通过共享条件机制对齐隐空间,一次生成图像+匹配音频
深层GeminiGPT-4o单模型端到端训练,跨模态注意力在预训练中自然生长

Gemini:从第一天起就"多模态"

Gemini 的 Transformer从预训练开始就吃交错序列——文本、图像、音频、视频 token 混排在一起。文本走 SentencePiece 分词器,视觉侧则学习一套类似 VQ 方案的视觉分词器。因为跨模态注意力是在预训练中有机生长出来的,而不是事后"加装"的,所以它的跨模态推理能力最深厚——代价也是训练成本最高。

GPT-4o:"o" 即 omni 的端到端架构

GPT-4o 把所有模态压进同一个 Transformer、同一个"预测下一个 token"目标

  • 音频 → 频谱 token(spectral tokens)
  • 图像 → patch token
  • 文本 → 子词 token

输出侧再由模态专属的解码头还原。它最关键的创新是延迟:早期系统(如 GPT-4V)要靠 ASR → LLM → TTS 三级模型级联,GPT-4o 把这串级联整体去掉,语音交互因此更接近"实时对话"。

编码器—共享主干—解码器:统一架构的骨架

把统一模型想象成一座工厂:单一装配线(共享主干)+ 不同卸货口(编码器)+ 不同发货部(解码器)。原料进厂前各自专业分拣,进厂后走同一条传送带:

  1. 模态编码器$E_m$:把原始输入变成一串d维嵌入向量。文本是查表嵌入,图像常用 ViT 切 patch 后线性投影,音频先算梅尔频谱图再过卷积/Transformer 前端;
  2. 共享 Transformer 主干:对所有模态的 token 拼接或交错后用自注意力处理——同一个注意力公式,只是 Q/K/V 里混进了不同模态的 token。图像 patch token 可以直接"看见"文本 token,跨模态推理不依赖任何额外的交叉注意力模块;
  3. 模态解码器$D_m$:把主干输出还原成原生格式(文本 token、像素、波形)。

细节上,每个 token 还会加上一个模态嵌入$e_m$(类似位置编码,但编码的是"我是哪种模态"),让主干知道 token 的出身。

多模态 Token 化:把图像和声音"翻译成"token

统一架构最大的工程难题是:文本是 1D 离散序列,图像是 2D 连续像素网格,音频是 1D 连续波形,视频还多了时间轴。解决方式就是分词(tokenisation),把一切变成 Transformer 能左到右消化的扁平序列:

  • 图像有两条路:离散派用 VQ-VAE / VQ-GAN 把图像量化成码本索引序列,直接当"词汇表"用;连续派用 ViT/CNN 编码器产出连续嵌入再线性投影——Gemini 和 GPT-4o 走的是连续派,而 Parti、LlamaGen 这类自回归图像生成器偏爱离散派;
  • 音频通常转梅尔频谱图,再经神经音频编解码器(EnCodec、SoundStream 等)离散化成层级 token,或经可学习编码器连续投影;
  • 视频在图像分词之上压缩时间维,常用3D VQ-VAE量化"时空 patch"——时间压缩因子至关重要,24fps 的原始视频不做降采样会产生多到无法处理的 token。

分好词之后,各模态 token 用特殊分隔符标记边界,交错成一条序列。Transformer 按标准注意力处理整条混合序列,分隔符既是边界提示,也充当各模态片段的"池化点"。

一个绕不开的设计权衡是token 预算:一张图若占 256 个 token,而配文只有 50 个,图像就吃掉 5 倍上下文。于是有了 token 合并、自适应分词(简单区域少用 token、复杂区域多用)等技巧来平衡分辨率与上下文长度。

四阶段训练配方:为什么不能"一步到位"?

"你不会在教孩子算术之前先教他微积分。" 统一多模态模型从随机初始化直接联合训练所有模态,实践中几乎无法收敛,主流方案是分阶段训练(staged training)

  1. 单模态预训练:文本主干在万亿级 token 上做下一词预测,视觉编码器在分类/自监督(MAE、DINO)目标上预热,音频编码器在语音识别数据上预热;
  2. 跨模态对齐:把编码器接到共享主干,在成对数据(图文对、音频-转写对)上做对比或生成式对齐,此时编码器可冻结,只更新投影层与主干;
  3. 联合多模态预训练:解冻几乎全部参数,在单模态+多模态混合数据上用一个下一词预测目标训练——模型必须预测"下一个 token",无论它是文本、图像还是音频 token,被迫形成真正的跨模态理解;
  4. 指令微调与对齐:在多模态指令数据上微调,并用 RLHF / DPO 对齐人类偏好。

阶段内还要做模态预热防止"模态坍缩":文本数据量占绝对优势,若不控制,模型会"忘记"弱模态。手段包括梯度平衡、数据比例调度与按模态加权的损失。

统一架构怎么考?主流评测基准一览

没有单一指标能衡量"能看、能听、能读、能动"的模型,主流做法是打一套组合拳:

  • MMLU:57 个学科的知识基线——统一模型学会视觉后不应出现文本能力回退(掉了就是灾难性遗忘的信号);
  • MMBench:20 个细粒度视觉-语言能力维度,检验模型是真看懂图,还是在走文本捷径;
  • SEED-Bench:1.9 万道图文/视频选择题,专测时序理解与组合推理;
  • MM-Vet:单题同时要求识别、OCR、空间感知、生成、知识检索多种技能;
  • MathVista:几何图、统计图表、函数曲线上的数学推理,直指多模态思维链能力;
  • WebArena / OSWorld等智能体基准:以任务成功率衡量长程规划与容错。

一个持续的隐患是数据污染:模型在 internet 级数据上训练过,基准图题可能"背过答案",严格去重与留出集是必要但不完美的防线。

延伸阅读与动手路径

想继续深挖统一多模态架构、世界模型(JEPA、Sora 类视频预测)与多模态智能体,可对照仓库中的原始章节:

  • 统一架构主章节(本文素材):chapter 10 - multimodal learning/05. unified multimodal architectures.md
  • 多模态表征与 CLIP 式对齐:chapter 10 - multimodal learning/01. multimodal representations.md
  • 视觉语言模型(VQA、Captioning、LLaVA):chapter 10 - multimodal learning/02. vision language models.md
  • 图像/视频分词(VQ-VAE、VQ-GAN、3D 量化):chapter 10 - multimodal learning/03. image and video tokenisation.md
  • 教材总览与章节大纲:README.md

💡 所有架构图(SVG)都放在 images/ 目录下,可配合章节原文对照阅读;仓库内含 MCP Server,还能让 AI 助手把整本教材当知识库来用。

总结

GPT-4o 与 Gemini 代表了多模态统一的**"原生端到端"方向:一切模态 → 一条 token 序列 → 一个共享 Transformer → 同一个预测目标。与 NExT-GPT 这类"拼积木"方案相比,集成越深,跨模态推理越强,训练越贵。而分阶段训练配方**正是把"理论上的优雅"变成"工程上可行"的关键——这也是 Maths, CS & AI Compendium 用直觉先行的方式讲透的核心。

【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/17 11:28:28

Intel Vortex NPU调用与DCIM配置实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/17 11:27:25

用Dify搭建多语言PDF原格式翻译流水线:拆译合查全攻略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/17 11:22:07

PMSM无感启动全速域控制:破解0-50rpm观测盲区

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/17 11:18:46

斑马优化算法结合Otsu实现高效多阈值图像分割

## 1. 项目背景与核心价值在医学影像分析、遥感图像处理等领域,多阈值图像分割一直是关键预处理步骤。传统Otsu方法在处理复杂图像时,常因阈值数量增加导致计算量指数级增长。这个项目将斑马优化算法(ZOA)与Ostu方法结合,实现了高效的多阈值分…

作者头像 李华