944 字
5 分钟
Who Said Neural Networks Aren't Linear?
Linearizer 将网络写成 f(x) = g_y⁻¹(A·g_x(x)),使其在可逆变换诱导的向量空间中精确线性。论文据此探索 SVD、伪逆和投影在一步生成、幂等约束及风格迁移中的应用。
论文信息
- 标题: Who Said Neural Networks Aren’t Linear?
- 作者: Nimrod Berman (Ben-Gurion Univ.), Assaf Hallak (NVIDIA), Assaf Shocher (Technion)
- arXiv: 2510.08570v2(2025-10 提交,2026-02 修订)
- 代码: github.com/assafshocher/Linearizer
- 领域: Machine Learning (cs.LG)
核心问题
线性性取决于向量空间的运算定义。论文尝试学习可逆变换,在新的加法与数乘定义下构造线性映射,从而使用线性代数工具分析和操作网络。
方法
核心架构见 Linearizer Framework。
诱导向量空间运算
通过可逆映射 g 定义新的加法 ⊕_g 和数乘 ⊙_g,使 (V, ⊕_g, ⊙_g) 构成合法向量空间,f 在诱导空间间成为线性映射。
训练方式
- g_x, g_y, A 端到端联合训练
- 可从零训练,也可从已有模型蒸馏
- A 通过低秩分解(两个矩形矩阵相乘)避免巨大矩阵乘法
- 时间条件场景(如 Flow Matching)中 A_t 由 MLP 以 t 为输入生成
关键数学结果
- 复合性: 两个 Linearizer 复合仍是 Linearizer,核心矩阵为 A₂A₁
- 迭代幂: L∘^N(x) = g⁻¹(A^N · g(x))
- SVD 迁移: f 的 SVD 直接由 A 的 SVD + g 变换给出
- 伪逆: f†(y) = g_x⁻¹(A† g_y(y)),满足四个 Penrose 条件
- 表达力: 对任意有限数据集,存在 g_x, g_y, A 使得 Linearizer 可拟合(自由度在数据支撑外)
关键实验结论
一步 Flow Matching
| 指标 | MNIST 32×32 | CelebA 64×64 |
|---|---|---|
| 一步 vs 100步 MSE | 3.0×10⁻⁴ | 3.0×10⁻⁴ |
| 反演重建 PSNR | 31.6 / 33.4 | — |
| 反演重建 LPIPS | 0.008 / 0.006 | — |
| 100步 vs 1步 PSNR | 32.4 / 32.9 | — |
| 100步 vs 1步 LPIPS | 0.006 / 0.007 | — |
- 1000步→1步 比 100步→1步 FID 进一步改善约 8 分
- 利用伪逆实现精确编码/反演,无需额外训练编码器
风格迁移
- 固定 g_x/g_y,每种风格对应一个 A_style
- 风格插值直接对矩阵线性插值,效果平滑连贯
- 从预训练 Johnson 风格迁移网络蒸馏
幂等生成网络 (IGN)
- 架构级幂等:f(f(x))=f(x) ⇔ A²=A,无需额外损失项约束
- 全局投影:整个空间都是有效源分布,无需潜噪声注入
- 用 STE(Straight-Through Estimator)处理 A 的二值化
额外实验
| 任务 | Linearizer | 对比 |
|---|---|---|
| CelebA 分类 | 87.6% | ResNet-50: 86.1% |
| dSprites 解缠蒸馏 | 与原编码器持平略优 | VAE/FactorVAE/β-VAE |
| 天气预测 | 与 PatchTST 竞争 | 长步长优于 Autoformer |
局限与讨论
- 可逆网络训练困难:比标准架构更难优化
- 未达到 SOTA:当前只是可行性验证,尚未在更大规模基准上验证竞争力
- 表达力仍是开放问题:虽然证明了有限数据拟合能力,精确表达力刻画待研究
- 拓扑约束:Linearizer 的核(null space)由 A 的核决定,线性子空间要么平凡要么无穷维——无法将恰好三个点映射为零而第四个不为零
核心洞察
Linearizer 与 Normalizing Flows 都使用可逆网络。前者迁移向量空间的代数结构,后者变换概率分布,目标不同。
与相关工作的关系
| 方法 | 主要机制 | 与本文区别 |
|---|---|---|
| Koopman 理论 | 可观测函数上的线性算子 K | Linearizer 针对任意映射 f |
| NTK | 参数空间线性演化 | NTK 输出仍非线性;Linearizer 是 I/O 线性 |
| KDM | 从预训练扩散模型蒸馏编码器-线性-解码器 | Linearizer 从零训练;强制 g_x=g_y |
| Consistency Models | 蒸馏扩散教师为一步生成 | 不需要线性结构 |
| Normalizing Flows | 可逆变换迁移概率分布 | Linearizer 迁移代数结构 |
| 深度线性网络 | 欧氏基下纯线性 | 缺乏表达力;Linearizer 通过 g 保持非线性 |
Who Said Neural Networks Aren't Linear?
https://blog.lpkt.cn/posts/papers/who-said-neural-networks-arent-linear/