📖标题:Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
🌐来源:arXiv, 2607.16107v1
🛎️文章简介
🔸研究问题:如何解决现有音频视觉大语言模型在处理长时段、复杂真实世界视频时存在的跨模态对齐弱、时序推理能力不足及数据稀缺问题?
🔸主要贡献:论文提出了完全开源的AV-Flamingo模型,通过构建大规模音视频技能数据集、三阶段课程学习及时间戳锚定的思维链框架,实现了在长视频理解与推理任务上的SOTA性能。
📝重点思路
🔸构建Audio-Visual-Skills数据集:收集约700万条包含字幕和问答的训练实例,涵盖短时长与长达15分钟的长视频,专门针对时序、组合及跨模态推理进行标注,弥补高质量配对数据空白。
🔸设计三阶段课程训练策略:第一阶段利用单模态及短上下文数据建立基础感知;第二阶段引入长上下文数据进行中期训练,扩展至15分钟视频理解;第三阶段通过后训练强化时序 grounded 的思维链推理。
🔸提出TAVIT推理框架:开发Temporal Audio-Visual Interleaved Chain-of-Thought,将中间推理步骤显式地锚定到音视频流的具体时间戳上,增强模型在长序列中的时序对齐能力和可解释性。
🔸优化架构与对齐机制:采用SigLIP视觉编码器和AF-Whisper音频编码器,通过时间交错模块融合多模态令牌,并引入约束旋转时间嵌入以保留绝对时序位置信息,支持长上下文并行训练。
🔎分析总结
🔸在15个以上的音视频、全模态及语音基准测试中,AV-Flamingo显著优于同等规模的开源模型,并在多项指标上超越或媲美更大参数的闭源模型。
🔸消融实验证实,引入AV-Skills短数据能提升跨模态推理基础,而加入长数据进一步增强了长程时序理解和音视频 grounding 能力。
🔸模型在长视频基准如MMOU和Video-MME上表现优异,特别是在需要复杂时序推理和跨模态引用的任务中,展现出强大的鲁棒性和泛化能力。
🔸TAVIT框架有效提升了推理质量,使模型能够处理分布在长时间跨度内的稀疏证据,解决了传统模型随视频时长增加性能下降的问题。
💡个人观点
论文打破了以往模型仅关注短视频或单模态堆砌的局限,提出了高质量的大规模长视频数据和显式的时序思维链引导。