Paper reading-Eagle Exploring The Design Space for Multi- modal LLMs with Mixture of Encoders
· 8 min read
nvidia的论文, 主要还是实践训练MLLM上的一堆经验
任务
探究通过使用不同的视觉编码器和分辨率来提高MLLM系统性能的不同设计带来的效果
motivation
- 解读高分辨率的精细视觉信息是MLLM重要的课题,常用的CLIP-ViT 预训练时候的分辨率只有如224*224或者336*336,对OCR等细粒度信息不够好
- 近期研究发现
enhanced visual perception显著减少幻觉和提高性能,许多近期MLLM用了混合视觉编码器- 有扩大视觉编码器的预训练量和参数的
- 有将高分辨率编码器和CLIP融合的
- 也有更复杂的融合和路由,根据任务选用不同编码器,"视觉MoE"的
- 但缺乏对此类方法设计的通用考量, 以及综合性的大benchmark
方法
- 对不同的视觉编码器进行基准测试,寻找更高分辨率自适应的方案
- 对不同的视觉编码器混合策略做同类比较(论文将近期的混合策略归为了CC,SA,LH等几类)
- 寻找多个视觉编码器的最优组合
- 改进pre-alignment和数据混合