一、文章主要内容总结
本文聚焦低资源语言(以巴斯克语为例)的多模态大语言模型(MLLM)开发,核心解决现有MLLM以英语资源为主、低资源语言性能不足且开源社区缺乏有效方案的问题。主要内容如下:
- 数据构建:创建了巴斯克语首个多模态训练和评估数据集——训练集含300多万图像-文本样本(基于CC3M和Pixmo-AMA翻译生成),评估集含约8000个人工验证样本,涵盖封闭型任务(VQAv2 Eus、A-OKVQA Eus、Pixmo-CapQA Eus)和开放型任务(WildVision Eus)。
- 模型架构与训练:采用晚期融合(late-fusion)架构,以CLIP为视觉编码器、单层线性层为视觉-语言连接器,基于Llama-3.1-Instruct(英语中心模型)和Latxa(巴斯克语适配模型)两种骨干LLM,通过两阶段训练(视觉-语言对齐、多模态指令微调)探索不同数据混合策略。
- 核心发现:
- 仅需20%的巴斯克语多模态数据,模型即可在巴斯克语基准测试中取得优异成绩;
- 英语多模态数据结合巴斯克语纯文本数据,可实现 decent 性能,缓解低资源语言多模态数据稀缺问题;
- 无需巴斯克语适配的骨干LLM,英语中心骨干LLM在巴斯克语多模态任务(含开放式生成)中表现相当;
- 加入纯文本数据可减少骨干LLM的文本任务性能下降,且能跨模态迁移能力(如英语多模态数据+巴斯克语纯文本数据提升巴斯克语多模态性能)。