07 | Quantization¶
约 189 个字 预计阅读时间 1 分钟
目标 ¶
- 降低显存占用
- 提升推理吞吐
- 尽量保持精度
量化对象 ¶
- 权重(weights)
- 激活(activations)
- KV cache(推理阶段关键内存)
常见路径 ¶
- PTQ:后训练量化,部署快
- QAT:量化感知训练,精度更稳但成本更高
精度与效率权衡 ¶
- bit 越低,速度 / 显存越好,但精度风险越高
- 对关键层采用更高精度通常更稳
- 不同任务对量化敏感度不同,必须任务内验证
多模态模型注意点 ¶
- 视觉编码器与语言模型对量化敏感层不同
- 图像理解任务通常比纯文本更容易掉点
- 量化后需按维度复评:语义、视觉一致性、真实性