Open-Qwen2VL 论文核心概念、数据、配置与性能快速参考
| 组件 | 预训练阶段 | SFT 阶段 |
|---|---|---|
| Vision Encoder | SigLIP-so400m-384px(冻结) | SigLIP-so400m-384px(冻结/可训练) |
| Projector | Adaptive Avg-Pooling + 2-layer MLP | MLP(pool 目标为 27×27) |
| LLM Backbone | Qwen2.5-1.5B-Instruct | Qwen2.5-1.5B-Instruct |
| Visual Tokens / 图 | 144 | 729 |
| Context Length | 4096 | 4096 |
| 数据集 | 过滤方法 | 规模 | 作用 |
|---|---|---|---|
| CCS-CLIP | CLIPScore | 8.5M | 高质量基础标题数据 |
| DataComp-DFN | DFN top-15% | 15M | 大规模 CLIP 过滤数据 |
| LAION-CLIP | CLIPScore 0.3 阈值 | 15M | 对照组,与 DataComp-DFN 分布相似 |
| DataComp-MLM-Filter & DFN | DFN + SU≥85 | 19.9M | 引入 MLLM 视角的高质量数据,提升多样性 |
最终采用组合:1 + 4 = CCS-CLIP + DataComp-MLM-Filter & DFN,共 28.4M 图文对。
| 配置项 | 预训练 | SFT |
|---|---|---|
| Precision | BF16 | BF16 |
| Global Batch Size | 256 | 128 |
| Training Epochs | 1 | 1 |
| Peak LR | 5e-5 | 2e-5 |
| Warmup Steps | 3% | 3% |
| LR Scheduler | linear-warmup + cosine-decay | linear-warmup + cosine-decay |
| Weight Decay | 0.01 | 0.1 |
| Sequence Packing | Yes(FFD 算法) | No |
| 模型 | 预训练 Token | MMBench | SEEDBench | MMStar | MathVista |
|---|---|---|---|---|---|
| Qwen2-VL-2B-Instruct | 1.4T | 68.8 | 72.0 | 46.3 | 48.0 |
| InternVL2.5-2B-MPO | 277B | 72.5 | 73.2 | 54.3 | 55.3 |
| DeepSeekVL-2-Tiny | 8.1T | 68.3 | 72.5 | 49.9 | 54.5 |
| Open-Qwen2VL | 5B | 80.9 | 72.5 | 49.7 | 53.1 |
视觉 token 压缩比:729 → 144,压缩比为 5.06×
相对训练量:5B / 1.4T ≈ 0.36%
序列打包目标:把多个样本拼接至接近 context length 4096
# Projector 伪代码
nn.Sequential(
nn.AdaptiveAvgPool2d((12, 12)),
nn.Flatten(start_dim=2),
nn.Linear(vision_dim, llm_dim),
nn.GELU(),
nn.Linear(llm_dim, llm_dim)
)