385 字
2 分钟
Sparser, Faster, Lighter Transformer Language Models

论文在 LLM 前馈层中引入非结构化稀疏,并设计配套的数据格式和 CUDA kernel。实验中,超过 99% 的稀疏度带来了吞吐量、能耗和内存收益,且模型越大收益越明显。

作者: Edoardo Cetin, Stefano Peluchetti, Emilio Castillo, Akira Naruse, Mana Murakami, Llion Jones 论文: arXiv<2603>.23198 代码: 即将开源


核心思路#

大语言模型的前馈层(feedforward layers)占据大量参数和 FLOPs。论文对这些层进行非结构化稀疏化,让大部分权重变成零,从而减少计算和内存开销。

主要贡献#

1. 稀疏打包格式 + CUDA Kernel#

核心工程贡献:设计了一种新的稀疏打包格式,搭配专用 CUDA kernel,提高了现代 GPU 上稀疏计算的执行效率。

2. 稀疏度与性能的量化研究#

  • 简单的 L1 正则化就能诱导出超过 99% 的稀疏度
  • 下游性能几乎不受影响(negligible impact)
  • 稀疏度 → 实际收益:吞吐量 ↑、能耗 ↓、内存占用 ↓
  • 关键发现:模型越大收益越明显(increase with model scale)

3. 同时适用于推理和训练#

kernel 设计覆盖了 LLM 推理和训练的稀疏计算场景,不只是推理加速。


关键洞察#

稀疏度高不等于运行更快。论文通过配套的数据格式和 kernel,让非结构化稀疏转化为实际运行收益。

代码和 kernel 将以开源许可发布,便于在基础模型的训练和推理中使用。

Sparser, Faster, Lighter Transformer Language Models
https://blog.lpkt.cn/posts/papers/sparser-faster-lighter-transformer-language-models/
作者
lollipopkit
发布于
2026-05-10
许可协议
CC BY-NC-SA 4.0