944 字
5 分钟
Who Said Neural Networks Aren't Linear?

Linearizer 将网络写成 f(x) = g_y⁻¹(A·g_x(x)),使其在可逆变换诱导的向量空间中精确线性。论文据此探索 SVD、伪逆和投影在一步生成、幂等约束及风格迁移中的应用。

论文信息#

  • 标题: Who Said Neural Networks Aren’t Linear?
  • 作者: Nimrod Berman (Ben-Gurion Univ.), Assaf Hallak (NVIDIA), Assaf Shocher (Technion)
  • arXiv: 2510.08570v2(2025-10 提交,2026-02 修订)
  • 代码: github.com/assafshocher/Linearizer
  • 领域: Machine Learning (cs.LG)

核心问题#

线性性取决于向量空间的运算定义。论文尝试学习可逆变换,在新的加法与数乘定义下构造线性映射,从而使用线性代数工具分析和操作网络。

方法#

核心架构见 Linearizer Framework。

诱导向量空间运算#

通过可逆映射 g 定义新的加法 ⊕_g 和数乘 ⊙_g,使 (V, ⊕_g, ⊙_g) 构成合法向量空间,f 在诱导空间间成为线性映射。

训练方式#

  • g_x, g_y, A 端到端联合训练
  • 可从零训练,也可从已有模型蒸馏
  • A 通过低秩分解(两个矩形矩阵相乘)避免巨大矩阵乘法
  • 时间条件场景(如 Flow Matching)中 A_t 由 MLP 以 t 为输入生成

关键数学结果#

  1. 复合性: 两个 Linearizer 复合仍是 Linearizer,核心矩阵为 A₂A₁
  2. 迭代幂: L∘^N(x) = g⁻¹(A^N · g(x))
  3. SVD 迁移: f 的 SVD 直接由 A 的 SVD + g 变换给出
  4. 伪逆: f†(y) = g_x⁻¹(A† g_y(y)),满足四个 Penrose 条件
  5. 表达力: 对任意有限数据集,存在 g_x, g_y, A 使得 Linearizer 可拟合(自由度在数据支撑外)

关键实验结论#

一步 Flow Matching#

指标MNIST 32×32CelebA 64×64
一步 vs 100步 MSE3.0×10⁻⁴3.0×10⁻⁴
反演重建 PSNR31.6 / 33.4—
反演重建 LPIPS0.008 / 0.006—
100步 vs 1步 PSNR32.4 / 32.9—
100步 vs 1步 LPIPS0.006 / 0.007—
  • 1000步→1步 比 100步→1步 FID 进一步改善约 8 分
  • 利用伪逆实现精确编码/反演,无需额外训练编码器

风格迁移#

  • 固定 g_x/g_y,每种风格对应一个 A_style
  • 风格插值直接对矩阵线性插值,效果平滑连贯
  • 从预训练 Johnson 风格迁移网络蒸馏

幂等生成网络 (IGN)#

  • 架构级幂等:f(f(x))=f(x) ⇔ A²=A,无需额外损失项约束
  • 全局投影:整个空间都是有效源分布,无需潜噪声注入
  • 用 STE(Straight-Through Estimator)处理 A 的二值化

额外实验#

任务Linearizer对比
CelebA 分类87.6%ResNet-50: 86.1%
dSprites 解缠蒸馏与原编码器持平略优VAE/FactorVAE/β-VAE
天气预测与 PatchTST 竞争长步长优于 Autoformer

局限与讨论#

  1. 可逆网络训练困难:比标准架构更难优化
  2. 未达到 SOTA:当前只是可行性验证,尚未在更大规模基准上验证竞争力
  3. 表达力仍是开放问题:虽然证明了有限数据拟合能力,精确表达力刻画待研究
  4. 拓扑约束:Linearizer 的核(null space)由 A 的核决定,线性子空间要么平凡要么无穷维——无法将恰好三个点映射为零而第四个不为零

核心洞察#

Linearizer 与 Normalizing Flows 都使用可逆网络。前者迁移向量空间的代数结构,后者变换概率分布,目标不同。

与相关工作的关系#

方法主要机制与本文区别
Koopman 理论可观测函数上的线性算子 KLinearizer 针对任意映射 f→Y;允许矩形 A
NTK参数空间线性演化NTK 输出仍非线性;Linearizer 是 I/O 线性
KDM从预训练扩散模型蒸馏编码器-线性-解码器Linearizer 从零训练;强制 g_x=g_y
Consistency Models蒸馏扩散教师为一步生成不需要线性结构
Normalizing Flows可逆变换迁移概率分布Linearizer 迁移代数结构
深度线性网络欧氏基下纯线性缺乏表达力;Linearizer 通过 g 保持非线性
Who Said Neural Networks Aren't Linear?
https://blog.lpkt.cn/posts/papers/who-said-neural-networks-arent-linear/
作者
lollipopkit
发布于
2026-06-10
许可协议
CC BY-NC-SA 4.0