1148 字
6 分钟
Image Generators are Generalist Vision Learners
Vision Banana 对图像生成器做轻量指令微调,将视觉任务结果统一编码为 RGB 图像。在论文的多项 2D/3D 评测中,单个模型达到或超过专用模型的表现。
论文信息
- 标题: Image Generators are Generalist Vision Learners
- 作者: Shangbang Long, Songyou Peng, Paul Voigtlaender 等 (Google DeepMind,含 Kaiming He, Saining Xie, Jonathan T. Barron 等)
- arXiv: 2604.20329v3(2026-04 提交,2026-06 修订)
- 项目页: vision-banana.github.io
核心问题
图像生成预训练学到的表示能否用于通用视觉理解?论文通过轻量指令微调,检验这些表示在分割、深度和法线估计中的迁移能力。
方法
核心思路
借鉴 LLM 范式:生成预训练 → 基座模型 → instruction-tuning → 任务对齐。类比:
| LLM 范式 | Vision Banana 范式 |
|---|---|
| 文本生成预训练 (GPT) | 图像生成预训练 (NBP) |
| 文本 instruction-tuning | 视觉 instruction-tuning |
| 文本输出作为统一接口 | RGB 图像输出作为统一接口 |
基座模型
Nano Banana Pro (NBP):Google 的图像生成模型,具备强大的文生图和图像编辑能力。
Instruction-Tuning 策略
- 将视觉任务输出参数化为 RGB 图像(感知 = 图像生成)
- 视觉任务数据以极低比例混入 NBP 原始训练数据中
- 不使用任何评估 benchmark 的训练数据(严格零样本迁移)
- 不牺牲基座模型的生成能力
视觉任务的 RGB 编码
语义分割: 每个类别指定一个纯色(支持自然语言、JSON、hex、RGB tuple 多种提示风格),生成彩色分割可视化图,后处理按最近 RGB 分配像素类别。
实例分割: 提示指定类别 + 背景色,模型自动为每个实例分配不同颜色。用多阶段聚类算法解析实例 mask。
深度估计: 将度量深度映射到 RGB 空间的双射:
- 用 Barron power transform (λ=-3, c=10/3) 对深度值做非线性变换,近处精度优先
- 沿 RGB 立方体边缘分段线性插值(类似 3D Hilbert 曲线首段)
- 严格可逆——RGB 可精确解码回度量深度
表面法线: 方向向量直接映射 RGB 通道:R=trunc((1-x)/2)×255, G=trunc((1+y)/2)×255, B=trunc((1+z)/2)×255
关键实验结论
2D 理解(零样本迁移)
| 任务 | Benchmark | Vision Banana | 最佳对手 |
|---|---|---|---|
| 指代表达分割 | RefCOCOg UMD (cIoU↑) | 73.8 | 73.4 (SAM3 Agent) |
| 推理分割 | ReasonSeg val (gIoU↑) | 79.3 | 77.0 (SAM3 Agent) |
| 语义分割 | Cityscapes val (mIoU↑) | 69.9 | 65.2 (SAM3) |
| 实例分割 | SA-Co/Gold (cgF₁↑) | 47.5 | 24.6 (OWLv2) |
- 语义分割:超越 SAM3 +4.7 mIoU,是开放词汇零样本最佳
- 实例分割:得分接近 OWLv2 的两倍,搭配 Gemini Flash-Lite 做存在性判断
- 指代表达分割:胜过 SAM3 + Gemini 2.5 Pro 组合
3D 理解(零样本迁移)
深度估计(无相机内参,纯合成数据训练):
| Model | 平均 δ₁↑ | ETH3D δ₁↑ | NYU δ₁↑ | KITTI δ₁↑ |
|---|---|---|---|---|
| Vision Banana | 0.882 | 0.935 | 0.948 | 0.915 |
| Depth Anything V3 | 0.918 | 0.917 | 0.963 | 0.843 |
| UniK3D | 0.823 | 0.687 | 0.961 | 0.629 |
| Depth Pro | 0.802 | 0.415 | 0.961 | 0.812 |
- 在 Depth Anything V3 评估的 4 个数据集上平均 δ₁: 0.929 vs 0.918
- 不依赖相机内参(训练和推理都不用),纯从视觉线索推断绝对尺度
- 训练数据完全来自合成渲染引擎,零真实深度数据
表面法线估计:
| Model | 室内平均 mean↓ | 室内平均 median↓ |
|---|---|---|
| Vision Banana | 15.549 | 9.300 |
| Lotus-2 | 16.558 | N/A |
| DSINE | 17.017 | 10.190 |
生成能力保留
| 任务 | Vision Banana 胜率 |
|---|---|
| 文生图 (GenAI-Bench) | 53.5% vs NBP |
| 图像编辑 (ImgEdit) | 47.8% vs NBP |
轻量 instruction-tuning 几乎不损害原始生成能力。
局限与讨论
- 计算开销大:运行 NBP 级别的图像生成器比轻量专家模型贵得多,部署需要加速策略
- 任务覆盖有限:当前只覆盖 2D 分割 + 3D 深度/法线,尚未扩展到多视角、视频、检测等
- 实例分割仍有差距:在 SA-Co/Gold 上与 SAM3(非零样本)仍有距离
- 户外法线略弱:Virtual KITTI 上定量略逊 Lotus-2(但 Lotus-2 在该集上训练过)
核心洞察
生成模型可以表达同一输入对应多个合理结果的情况,减少预测向模糊均值收敛的问题。Vision Banana 用 RGB 图像统一编码多种任务输出,从而复用同一模型架构。
与相关工作的关系
| 方法 | 主要设计 | 与本文区别 |
|---|---|---|
| SAM 3 | 专用分割架构+大量标注 | Vision Banana 通用生成模型,无需专用架构 |
| Depth Anything V3 | 专用深度架构+相机内参 | Vision Banana 不用内参,纯合成数据训练 |
| Lotus-2 | 扩散模型微调做深度/法线 | 全量微调牺牲生成能力;Vision Banana 轻量 instruction-tuning 保留生成 |
| GenRGB / DepthLM 等 | 加专用模块+全量微调 | 牺牲模型通用性;Vision Banana 权重共享、统一接口 |
| LLM 范式 (GPT→InstructGPT) | 生成预训练→instruction-tuning | Vision Banana 是该范式在视觉领域的直接类比 |
Image Generators are Generalist Vision Learners
https://blog.lpkt.cn/posts/papers/image-generators-are-generalist-vision-learners/