1148 字
6 分钟
Image Generators are Generalist Vision Learners

Vision Banana 对图像生成器做轻量指令微调,将视觉任务结果统一编码为 RGB 图像。在论文的多项 2D/3D 评测中,单个模型达到或超过专用模型的表现。

论文信息#

  • 标题: Image Generators are Generalist Vision Learners
  • 作者: Shangbang Long, Songyou Peng, Paul Voigtlaender 等 (Google DeepMind,含 Kaiming He, Saining Xie, Jonathan T. Barron 等)
  • arXiv: 2604.20329v3(2026-04 提交,2026-06 修订)
  • 项目页: vision-banana.github.io

核心问题#

图像生成预训练学到的表示能否用于通用视觉理解?论文通过轻量指令微调,检验这些表示在分割、深度和法线估计中的迁移能力。

方法#

核心思路#

借鉴 LLM 范式:生成预训练 → 基座模型 → instruction-tuning → 任务对齐。类比:

LLM 范式Vision Banana 范式
文本生成预训练 (GPT)图像生成预训练 (NBP)
文本 instruction-tuning视觉 instruction-tuning
文本输出作为统一接口RGB 图像输出作为统一接口

基座模型#

Nano Banana Pro (NBP):Google 的图像生成模型,具备强大的文生图和图像编辑能力。

Instruction-Tuning 策略#

  • 将视觉任务输出参数化为 RGB 图像(感知 = 图像生成)
  • 视觉任务数据以极低比例混入 NBP 原始训练数据中
  • 不使用任何评估 benchmark 的训练数据(严格零样本迁移)
  • 不牺牲基座模型的生成能力

视觉任务的 RGB 编码#

语义分割: 每个类别指定一个纯色(支持自然语言、JSON、hex、RGB tuple 多种提示风格),生成彩色分割可视化图,后处理按最近 RGB 分配像素类别。

实例分割: 提示指定类别 + 背景色,模型自动为每个实例分配不同颜色。用多阶段聚类算法解析实例 mask。

深度估计: 将度量深度映射到 RGB 空间的双射:

  1. 用 Barron power transform (λ=-3, c=10/3) 对深度值做非线性变换,近处精度优先
  2. 沿 RGB 立方体边缘分段线性插值(类似 3D Hilbert 曲线首段)
  3. 严格可逆——RGB 可精确解码回度量深度

表面法线: 方向向量直接映射 RGB 通道:R=trunc((1-x)/2)×255, G=trunc((1+y)/2)×255, B=trunc((1+z)/2)×255

关键实验结论#

2D 理解(零样本迁移)#

任务BenchmarkVision Banana最佳对手
指代表达分割RefCOCOg UMD (cIoU↑)73.873.4 (SAM3 Agent)
推理分割ReasonSeg val (gIoU↑)79.377.0 (SAM3 Agent)
语义分割Cityscapes val (mIoU↑)69.965.2 (SAM3)
实例分割SA-Co/Gold (cgF₁↑)47.524.6 (OWLv2)
  • 语义分割:超越 SAM3 +4.7 mIoU,是开放词汇零样本最佳
  • 实例分割:得分接近 OWLv2 的两倍,搭配 Gemini Flash-Lite 做存在性判断
  • 指代表达分割:胜过 SAM3 + Gemini 2.5 Pro 组合

3D 理解(零样本迁移)#

深度估计(无相机内参,纯合成数据训练):

Model平均 δ₁↑ETH3D δ₁↑NYU δ₁↑KITTI δ₁↑
Vision Banana0.8820.9350.9480.915
Depth Anything V30.9180.9170.9630.843
UniK3D0.8230.6870.9610.629
Depth Pro0.8020.4150.9610.812
  • 在 Depth Anything V3 评估的 4 个数据集上平均 δ₁: 0.929 vs 0.918
  • 不依赖相机内参(训练和推理都不用),纯从视觉线索推断绝对尺度
  • 训练数据完全来自合成渲染引擎,零真实深度数据

表面法线估计:

Model室内平均 mean↓室内平均 median↓
Vision Banana15.5499.300
Lotus-216.558N/A
DSINE17.01710.190

生成能力保留#

任务Vision Banana 胜率
文生图 (GenAI-Bench)53.5% vs NBP
图像编辑 (ImgEdit)47.8% vs NBP

轻量 instruction-tuning 几乎不损害原始生成能力。

局限与讨论#

  1. 计算开销大:运行 NBP 级别的图像生成器比轻量专家模型贵得多,部署需要加速策略
  2. 任务覆盖有限:当前只覆盖 2D 分割 + 3D 深度/法线,尚未扩展到多视角、视频、检测等
  3. 实例分割仍有差距:在 SA-Co/Gold 上与 SAM3(非零样本)仍有距离
  4. 户外法线略弱:Virtual KITTI 上定量略逊 Lotus-2(但 Lotus-2 在该集上训练过)

核心洞察#

生成模型可以表达同一输入对应多个合理结果的情况,减少预测向模糊均值收敛的问题。Vision Banana 用 RGB 图像统一编码多种任务输出,从而复用同一模型架构。

与相关工作的关系#

方法主要设计与本文区别
SAM 3专用分割架构+大量标注Vision Banana 通用生成模型,无需专用架构
Depth Anything V3专用深度架构+相机内参Vision Banana 不用内参,纯合成数据训练
Lotus-2扩散模型微调做深度/法线全量微调牺牲生成能力;Vision Banana 轻量 instruction-tuning 保留生成
GenRGB / DepthLM 等加专用模块+全量微调牺牲模型通用性;Vision Banana 权重共享、统一接口
LLM 范式 (GPT→InstructGPT)生成预训练→instruction-tuningVision Banana 是该范式在视觉领域的直接类比
Image Generators are Generalist Vision Learners
https://blog.lpkt.cn/posts/papers/image-generators-are-generalist-vision-learners/
作者
lollipopkit
发布于
2026-06-10
许可协议
CC BY-NC-SA 4.0