385 字
2 分钟
Sparser, Faster, Lighter Transformer Language Models
论文在 LLM 前馈层中引入非结构化稀疏,并设计配套的数据格式和 CUDA kernel。实验中,超过 99% 的稀疏度带来了吞吐量、能耗和内存收益,且模型越大收益越明显。
作者: Edoardo Cetin, Stefano Peluchetti, Emilio Castillo, Akira Naruse, Mana Murakami, Llion Jones 论文: arXiv<2603>2603>.23198 代码: 即将开源
核心思路
大语言模型的前馈层(feedforward layers)占据大量参数和 FLOPs。论文对这些层进行非结构化稀疏化,让大部分权重变成零,从而减少计算和内存开销。
主要贡献
1. 稀疏打包格式 + CUDA Kernel
核心工程贡献:设计了一种新的稀疏打包格式,搭配专用 CUDA kernel,提高了现代 GPU 上稀疏计算的执行效率。
2. 稀疏度与性能的量化研究
- 简单的 L1 正则化就能诱导出超过 99% 的稀疏度
- 下游性能几乎不受影响(negligible impact)
- 稀疏度 → 实际收益:吞吐量 ↑、能耗 ↓、内存占用 ↓
- 关键发现:模型越大收益越明显(increase with model scale)
3. 同时适用于推理和训练
kernel 设计覆盖了 LLM 推理和训练的稀疏计算场景,不只是推理加速。
关键洞察
稀疏度高不等于运行更快。论文通过配套的数据格式和 kernel,让非结构化稀疏转化为实际运行收益。
代码和 kernel 将以开源许可发布,便于在基础模型的训练和推理中使用。
Sparser, Faster, Lighter Transformer Language Models
https://blog.lpkt.cn/posts/papers/sparser-faster-lighter-transformer-language-models/