780 字
4 分钟
生成式视觉预训练
定义
生成式视觉预训练(Generative Vision Pretraining) 指在大规模图像生成任务上预训练模型,使其学到通用视觉表示,然后通过 instruction-tuning 将这些表示对齐到下游视觉理解任务。与传统的判别式预训练(对比学习、自编码等)不同,生成式预训练以「创造」视觉内容为目标,训练中学到的表示也可用于视觉理解。
为什么重要
从图像生成到视觉理解
常见的视觉表示学习方法包括:
- 监督判别学习(ImageNet 分类)
- 对比学习(CLIP、MoCo、SimCLR)
- 自举法(DINO、BYOL)
- 自编码(MAE、BEiT)
生成式预训练长期以来效果落后于判别式方法。但 Vision Banana 的结果表明这一格局正在改变。
与 LLM 范式的类比
| 阶段 | LLM 范式 | 视觉生成范式 |
|---|---|---|
| 预训练 | 文本生成(GPT) | 图像生成(Nano Banana Pro 等) |
| 涌现能力 | 语言理解、推理 | 视觉理解、几何推理 |
| 对齐 | Instruction-tuning | 视觉 instruction-tuning |
| 统一接口 | 文本生成 | RGB 图像生成 |
核心优势
- 统一接口:所有视觉任务输出编码为 RGB 图像,自然语言提示指定任务,不需要任务专用架构
- 处理多解歧义:生成模型学习数据分布,不需要判别模型的定制损失来避免模糊均值
- 世界知识:大规模生成预训练带来的物体尺度、空间关系的先验知识,超越窄域专家
- 能力保持:instruction-tuning 不牺牲基座模型的生成能力
实现方式
RGB 作为通用输出空间
| 任务 | RGB 编码方式 |
|---|---|
| 语义分割 | 类别→纯色映射(开放词汇) |
| 实例分割 | 每实例自动分配不同颜色 + 多阶段聚类解析 |
| 度量深度 | Power transform 非线性变换 + RGB 立方体边缘双射 |
| 表面法线 | 方向向量直接映射 RGB 通道 |
Instruction-Tuning 要点
- 在原始训练数据中混入少量视觉任务数据
- 严格零样本迁移:不使用任何 benchmark 训练集
- 不需要任务专用损失或架构修改
与相关概念对比
| 预训练范式 | 代表方法 | 学习什么 | 局限 |
|---|---|---|---|
| 监督判别 | ViT, ResNet | 类别判别 | 需要标注,泛化受限 |
| 对比学习 | CLIP, SigLIP | 图文对齐 | 依赖文本监督 |
| 自编码 | MAE, BEiT | 重建掩码 | 重建损失≠理解 |
| 生成式预训练 | NBP→Vision Banana | 生成完整图像 | 计算开销大 |
潜在应用
- 通用视觉基座模型:一个模型同时做分割、深度、法线、生成、编辑
- 机器人与自动驾驶:深度估计不需要相机内参,纯视觉推断绝对尺度
- AGI-V:生成式视觉预训练可能是通向视觉 AGI 的路径
开放问题
- 视频生成器是否包含更丰富的时空理解表示?
- 如何降低推理计算开销?
- 更多任务的 instruction-tuning 是否会涌现跨任务泛化(类似 LLM 的涌现能力)?
- 与 LLM 的深度融合如何实现跨模态推理?