跳转至

07 | Quantization

189 个字 预计阅读时间 1 分钟

目标

  • 降低显存占用
  • 提升推理吞吐
  • 尽量保持精度

量化对象

  • 权重(weights)
  • 激活(activations)
  • KV cache(推理阶段关键内存)

常见路径

  • PTQ:后训练量化,部署快
  • QAT:量化感知训练,精度更稳但成本更高

精度与效率权衡

  • bit 越低,速度 / 显存越好,但精度风险越高
  • 对关键层采用更高精度通常更稳
  • 不同任务对量化敏感度不同,必须任务内验证

多模态模型注意点

  • 视觉编码器与语言模型对量化敏感层不同
  • 图像理解任务通常比纯文本更容易掉点
  • 量化后需按维度复评:语义、视觉一致性、真实性