跳转至

多模态赛道

赛道概览

58 个 Lesson · 预计 4-6 周 · 从 CLIP 双塔对齐到 LLaVA 指令跟随、开放词汇检测、时序定位与人脸/手部 VLM 推理

Multimodal 赛道按视觉语言方法的演进脉络组织教学主题。从对比学习(CLIP)出发,经过跨模态融合(BLIP)、视觉指令跟随(LLaVA)、开放词汇检测(OWL-ViT)、文档理解(OCR VLM)、视频时序定位(2D-TAN),再延伸到具身问答、多模态推理、视频检索、音频文本理解、音视融合、HOI、视线估计,以及人物属性识别、人脸身份识别与验证推理、手部姿态与手势推理。配套 **70 个 VLM 注册组**用于定位教学入口;是否包含对应论文机制以 fidelity 审计为准。


学习路径

下图展示前 16 课(VLM 架构核心)的学习路径;Lesson 17 之后按主题分组,详见下方课程列表。

flowchart TD
    L01["01 CLIP\nRetrieval"] --> L02["02 BLIP\nCaptioning + ITM"]
    L02 --> L03["03 LLaVA\nInstruction VLM"]
    L01 --> L04["04 Grounding\nReferring"]
    L04 --> L05["05 Mask Grounding\nMask 预测"]
    L03 --> L06["06 Flamingo\nInterleaved VLM"]
    L02 --> L07["07 Q-Former\nBridge VLM"]
    L06 --> L08["08 Perceiver\nResampler VLM"]
    L07 --> L09["09 PaliGemma\nMultitask VLM"]
    L01 --> L10["10 OWL-ViT\nOpen-Vocab Detection"]
    L05 --> L11["11 Grounded-SAM\nOpen-Vocab Segmentation"]
    L09 --> L12["12 KV-OCR\nDocument VLM"]
    L03 --> L13["13 Video VLM\nTemporal QA"]
    L13 --> L14["14 BMN\nTemporal Grounding"]
    L14 --> L15["15 2D-TAN\nTemporal Grounding"]
    L15 --> L16["16 Multi-Scale\n2D-TAN"]

    style L01 fill:#2563eb,color:#fff
    style L02 fill:#2563eb,color:#fff
    style L03 fill:#7c3aed,color:#fff
    style L04 fill:#dc2626,color:#fff
    style L05 fill:#dc2626,color:#fff
    style L06 fill:#7c3aed,color:#fff
    style L07 fill:#7c3aed,color:#fff
    style L08 fill:#7c3aed,color:#fff
    style L09 fill:#059669,color:#fff
    style L10 fill:#dc2626,color:#fff
    style L11 fill:#dc2626,color:#fff
    style L12 fill:#059669,color:#fff
    style L13 fill:#d97706,color:#fff
    style L14 fill:#d97706,color:#fff
    style L15 fill:#d97706,color:#fff
    style L16 fill:#d97706,color:#fff

颜色说明

🟦 对齐与融合 · 🟪 VLM 架构 · 🟥 检测与分割 · 🟩 多任务 / 文档 · 🟧 视频时序


先修知识

领域 要求
DL-Hub 完成 Vision 视觉赛道 + NLP 赛道
注意力机制 Self-Attention, Cross-Attention, Multi-Head Attention
对比学习 InfoNCE Loss 基本直觉

课程列表

全部 58 个 Lesson 按主题分组如下,从 CLIP 双塔对齐到人脸 / 手部 VLM 推理,走完现代视觉语言建模核心脉络。

VLM 架构核心(01-16)

序号 项目 代码文档 核心概念
01 CLIP-Style Retrieval clip_compact_retrieval 对比学习, 双塔编码器
02 BLIP-Lite Captioning + ITM blip_compact_captioning 视觉 token 融合, ITM
03 LLaVA-Lite Instruction VLM llava_compact_instruction_vlm 视觉前缀, 指令跟随
04 Grounding Referring grounding_compact_refexp 指代表达, Box 回归
05 Mask Grounding mask_grounding_compact_refexp 文本条件 Mask 预测
06 Flamingo Interleaved VLM flamingo_compact_interleaved_vlm 交错图文, Few-shot
07 Q-Former Bridge VLM qformer_compact_bridge_vlm Cross-attention 瓶颈
08 Perceiver Resampler VLM perceiver_resampler_compact_vlm 多视图 token 池化
09 PaliGemma Multitask VLM paligemma_compact_siglip_decoder_vlm 提示式多任务
10 OWL-ViT Open-Vocab Detection owlvit_compact_open_vocab_detection 开放词汇检测
11 Grounded-SAM Segmentation grounded_sam_compact_open_vocab_segmentation 开放词汇分割
12 Key-Value OCR Document VLM key_value_ocr_compact_doc_vlm 文档字段提取
13 Video VLM Temporal QA video_vlm_compact_temporal_qa 短视频 QA
14 BMN Temporal Grounding bmn_compact_temporal_grounding 时序定位, 边界预测
15 2D-TAN Temporal Grounding 2dtan_compact_temporal_grounding 密集时序段图
16 Multi-Scale 2D-TAN multiscale_2dtan_compact_temporal_grounding 多尺度时序金字塔

视频 / 音频跨模态(17-22)

序号 项目 代码文档 核心概念
17 Video-Text Retrieval video_text_retrieval 视频-文本对比学习, 时序池化
18 Prompt Learning VLM prompt_learning_vlm Soft Prompt, Frozen Encoder 适配
19 Audio-Text Understanding audio_text_understanding 音频文本对齐, 事件描述分类
20 Audio-Visual Learning audio_visual_learning 音视融合, 短片段跨模态检索
21 Audio-Grounded Retrieval audio_grounded_retrieval 音频查询, 片段检索, 交叉模态对齐
22 Audio-Visual Event Localization audio_visual_event_localization 文本条件事件定位, 时序显著性

具身、推理与人物理解(23-34)

序号 项目 代码文档 核心概念
23 Embodied Question Answering embodied_question_answering 具身场景状态, 导航上下文, 问答推理
24 Multimodal Reasoning multimodal_reasoning 图像证据 + 事实序列, 多模态判别推理
25 Vision-Language Navigation vision_language_navigation 视觉观测 + 指令编码, 动作决策, 导航状态融合
26 Image-Text Reranking image_text_reranking 跨编码器融合, 候选重排, 细粒度图文匹配
27 Scene-Text VLM Recognition scene_text_vlm_recognition 场景文字读取, 图像文字对齐, 短词识别
28 Document VLM Reasoning document_vlm_reasoning 文档布局理解, OCR 证据聚合, 文档问答
29 Human-Object Interaction Reasoning human_object_interaction_reasoning 人-物区域关系建模, 文本关系查询, 交互判别
30 Vision-Language Gaze Estimation vision_language_gaze_estimation 头部位置条件, 语言上下文, 视线点/热图回归
31 Person Search Attribute Retrieval person_search_attribute_retrieval 人物图像检索, 属性文本查询, 身份感知对齐
32 Video-Text Action Localization video_text_action_localization 视频动作区间定位, 文本条件时序建模, 起止边界回归
33 Pedestrian Attribute Recognition pedestrian_attribute_recognition 行人属性识别, 图像-属性对齐, 多标签判别
34 Video-Text Action Recognition video_text_action_recognition 视频动作识别, 文本标签对齐, clip 级判别

人脸与手部 VLM 推理(35-58)

序号 项目 代码文档 核心概念
35 Face Expression VLM Recognition face_expression_vlm_recognition 人脸表情分类, 情绪标签提示, 轻量图文融合
36 Face Anti-Spoof VLM Reasoning face_anti_spoof_vlm_reasoning 真假脸判别, 伪迹提示融合, 多模态真实性推理
37 Face Identity VLM Recognition face_identity_vlm_recognition 人脸身份匹配, identity prompt 对齐, 轻量视觉语言识别
38 Face Verification VLM Reasoning face_verification_vlm_reasoning 双脸一致性验证, 成对证据融合, 多模态身份推理
39 Face Attribute VLM Reasoning face_attribute_vlm_reasoning 人脸属性问答, 属性提示融合, 二元视觉语言推理
40 Face Caption VLM Grounding face_caption_vlm_grounding 人脸描述匹配, caption-grounded 对齐, 图文一致性判别
41 Face Occlusion VLM Reasoning face_occlusion_vlm_reasoning 遮挡轻重判断, 人脸证据与文字提示融合, 比例感知推理
42 Face Region Grounding VLM face_region_grounding_vlm 面部区域定位, 文字区域查询, 归一化框回归
43 Face Landmark VLM Reasoning face_landmark_vlm_reasoning 面部关键点问答, 图像证据与 landmark 查询融合, 点位回归
44 Face Parsing VLM Reasoning face_parsing_vlm_reasoning 面部区域解析推理, 分区提示融合, mask-aware 多模态判别
45 Face Alignment VLM Reasoning face_alignment_vlm_reasoning 五点关键点布局回归, query-conditioned 对齐, 视觉语言融合
46 Face Detection VLM Reasoning face_detection_vlm_reasoning 归一化人脸框回归, query-conditioned 检测, 视觉语言融合
47 Face Retrieval VLM Reasoning face_retrieval_vlm_reasoning 人脸图库检索, identity-aware 图文对齐, top-1 retrieval
48 Face Pose VLM Reasoning face_pose_vlm_reasoning yaw/pitch/roll 回归, pose query 融合, 多模态姿态推理
49 Face Gaze VLM Reasoning face_gaze_vlm_reasoning 人脸 gaze 回归, query-conditioned face reasoning, 多模态视线推理
50 Person Pose VLM Reasoning person_pose_vlm_reasoning 人体 pose 因子回归, pose query 融合, 多模态姿态推理
51 Hand Pose VLM Reasoning hand_pose_vlm_reasoning 十点手部关键点回归, hand pose query 融合, 多模态手部姿态推理
52 Gesture VLM Reasoning gesture_vlm_reasoning 手势类别判别, gesture query 融合, 多模态手势推理
53 Finger Count VLM Reasoning finger_count_vlm_reasoning 0-5 手指数分类, finger-count query 融合, 多模态手部推理
54 Handedness VLM Reasoning handedness_vlm_reasoning left/right 分类, handedness query 融合, 多模态手部推理
55 Palm Orientation VLM Reasoning palm_orientation_vlm_reasoning 掌心朝向分类, palm-orientation query 融合, 多模态手部推理
56 Sign Digit VLM Reasoning sign_digit_vlm_reasoning 0-9 手势数字分类, sign-digit query 融合, 多模态手部推理
57 Finger Spread VLM Reasoning finger_spread_vlm_reasoning 手指张开度标量回归, spread query 融合, 多模态手部推理
58 Thumb Position VLM Reasoning thumb_position_vlm_reasoning 拇指高低位置三分类, thumb-position query 融合, 多模态手部推理

运行示例

python -m tracks.multimodal.lesson_01_clip_compact_retrieval.train \
  --device cpu --epochs 1 \
  --max-train-batches 2 --max-eval-batches 1
python -m tracks.multimodal.lesson_03_llava_compact_instruction_vlm.train \
  --device cpu --epochs 1 \
  --max-train-batches 2 --max-eval-batches 1
python -m tracks.multimodal.lesson_10_owlvit_compact_open_vocab_detection.train \
  --device cpu --epochs 1 \
  --max-train-batches 2 --max-eval-batches 1
python -m tracks.multimodal.lesson_16_multiscale_2dtan_compact_temporal_grounding.train \
  --device cpu --epochs 1 \
  --max-train-batches 2 --max-eval-batches 1

VLM 技术演进脉络

flowchart LR
    subgraph 2021["2021 — 对比对齐"]
        CLIP["CLIP"]
        ALIGN["ALIGN"]
        ViLT["ViLT"]
    end
    subgraph 2022["2022 — 融合与生成"]
        BLIP["BLIP"]
        CoCa["CoCa"]
        Flamingo["Flamingo"]
    end
    subgraph 2023["2023 — 指令跟随"]
        BLIP2["BLIP-2"]
        LLaVA["LLaVA"]
        CogVLM["CogVLM"]
        QwenVL["Qwen-VL"]
    end

    CLIP --> BLIP --> BLIP2
    CLIP --> Flamingo --> BLIP2
    BLIP2 --> LLaVA
    BLIP2 --> CogVLM
    LLaVA --> QwenVL

    style CLIP fill:#2563eb,color:#fff
    style BLIP fill:#059669,color:#fff
    style BLIP2 fill:#7c3aed,color:#fff
    style LLaVA fill:#7c3aed,color:#fff

VLM Zoo

70 个视觉语言方法注册组

VLM Zoo 按 2021 年 CLIP 到 2025 年方法时间线提供 70 个 VLM 注册组。公共核心已支持 真实图像/Token 与四条多模态计算路径;其中 12 个代表入口为 compact,其余 58 个仍是 baseline-alias,不能按 70 个独立论文架构计数;逐项状态以 Model Zoo 保真度审计为准。

# 列出所有 VLM 架构
python scripts/vlm_zoo.py --list

# 搜索特定架构
python scripts/vlm_zoo.py --search llava

# 查看时间线
python scripts/vlm_zoo.py --timeline

# 冒烟测试
python scripts/vlm_zoo.py --smoke dlvlm:clip_tiny
VLM Zoo — 70 个视觉语言方法注册标签(点击展开)
Family 年份 核心创新
CLIP 2021 对比图文预训练
ALIGN 2021 大规模噪声对比学习
ViLT 2021 Patch 级视觉语言 Transformer
SimVLM 2021 简单视觉语言预训练
ALBEF 2021 先对齐再融合
LiT 2022 锁定图像的文本微调
BLIP 2022 引导式图文预训练
CoCa 2022 对比式描述器
OFA 2022 统一架构、任务、模态
Flamingo 2022 交错图文视觉语言模型
PaLI 2022 Pathways 图文模型
BLIP-2 2023 Q-Former 桥接视觉与 LLM
InstructBLIP 2023 指令微调 BLIP-2
LLaVA 2023 视觉指令微调
MiniGPT-4 2023 投影前缀视觉 LLM
Kosmos-2 2023 接地多模态 LLM
mPLUG-Owl2 2023 模态自适应模块
CogVLM 2023 LLM 层内视觉专家
PaLI-X 2023 缩放版 Pathways 图文模型
Qwen-VL 2023 通义千问视觉语言模型
Ferret 2023 指点式区域感知视觉语言建模
Emu2 2023 多模态生成与理解统一
Fuyu 2023 原生 patch 序列视觉输入
IDEFICS2 2024 开放式多图对话助手
InternVL 2024 多尺度高分辨率视觉编码
Phi-3-Vision 2024 轻量视觉语言推理
Janus 2024 理解与生成统一视觉前端
Ovis 2024 文档/OCR 场景优化的视觉语言助手
Cambrian 2024 多视觉塔融合与蒸馏
Molmo 2024 开放数据配方驱动的多模态助手
Video-LLaVA 2024 视频时序视觉指令跟随
DeepSeek-VL 2024 对话式多模态推理
Qwen2-VL 2024 更强文档与视频理解
VILA 2024 轻量视觉语言助手
Omni-VLM 2024 统一多模态理解接口
SEED-VL 2024 强化检索与生成统一
MiniCPM-V 2024 轻量端侧视觉语言模型
Eagle-VLM 2024 Agent 风格多模态响应
Phi-4-MM 2025 轻量多模态推理升级
XComposer2 2025 细粒度图文编辑与理解
LLaVA-Next 2025 更强多图与视频理解
IDEFICS3 2025 多图对话新一代接口
Kimi-VL 2025 长上下文多模态助手
Stem-VL 2025 结构化多模态推理原型
Moondream2 2025 小型端侧视觉问答助手
Granite-Vision 2025 企业文档与图表理解
OLMOCR 2025 文档 OCR 专项视觉语言模型
InternLM-XComposer 2025 多模态写作与编辑助手
MobileVLM 2025 轻量移动端多模态模型
MiniCPM-O 2025 端侧开放式多模态模型
Kosmos-2.5 2025 文档理解与 OCR 增强
ChartVLM 2025 图表理解与数据问答
DocOwl2 2025 文档问答与版面理解
Grounded-VLM 2025 定位增强的视觉语言推理
MetaVLM 2025 元学习式视觉语言适配
Evo-VL 2025 进化式多模态推理
Agent-VL 2025 面向工具调用的多模态代理
Video-Qwen-VL 2025 视频增强版通义视觉语言模型
SigLIP-VLM 2025 SigLIP 风格对齐与生成统一
OCRVLM 2025 文档 OCR 专项多模态助手
Science-VLM 2025 科学图表与实验图像理解
WebVLM 2025 网页截图与界面理解
MixVLM 2025 多路视觉编码混合融合
EdgeVLM 2025 端侧轻量多模态推理
InternVL2 2024 多尺度多模态升级版
XGen-MM 2024 指令跟随多模态模型
Aria 2024 端到端视觉对话助手
LLaMA-Vision 2024 LLaMA 系视觉扩展
Bunny 2024 小型视觉指令模型
Rabbit-VLM 2025 Agent 风格多模态交互

完整列表与变体见 python scripts/vlm_zoo.py --list


多模态任务分类

任务类型 对应 Lesson 输入 输出
图文检索 01 CLIP 图像 + 文本 相似度排名
图像描述 02 BLIP 图像 文本描述
视觉问答 03 LLaVA, 09 PaliGemma 图像 + 问题 文本回答
目标定位 04-05 Grounding 图像 + 文本 Box / Mask
开放词汇检测 10 OWL-ViT 图像 + 类别文本 检测框
开放词汇分割 11 Grounded-SAM 图像 + 文本 分割掩码
文档理解 12 KV-OCR 文档图像 键值对
视频 QA 13 Video VLM 视频帧 + 问题 文本回答
时序定位 14-16 BMN/2D-TAN, 32 Action Localization 视频 + 文本 时间段
视频检索与识别 17 Video-Text Retrieval, 34 Action Recognition 视频 + 文本 相似度排名 / 类别
音频跨模态 19-22 Audio-Text / Audio-Visual 音频 + 文本/视频 对齐 / 事件定位
具身与导航 23 EQA, 25 VLN 场景观测 + 指令/问题 回答 / 动作决策
多模态推理 24 Reasoning, 28-29 Document/HOI 图像 + 事实/文档/查询 判别 / 问答
人物与属性理解 31, 33 Person Search / Attribute 人物图像 + 属性文本 检索 / 多标签
人脸 / 手部 VLM 推理 35-58 Face & Hand Reasoning 人脸/手部图像 + 查询 分类 / 回归 / 定位

下一步

恭喜!

完成 Multimodal 赛道意味着你已经走完了 DL-Hub 全部 8 条学习赛道的核心内容。以下是一些进阶方向:

方向 说明
Model Zoo 探索 浏览 VLM Zoo 的 70 个注册标签,并结合 fidelity 状态区分时间线名称与已实现机制
论文阅读 阅读 resources/pdfs/llms/ 下的 50+ 篇论文
贡献新 Lesson 参考 贡献指南 提交 PR
回顾复习 回到 赛道总览 制定复习计划