Что такое Квантование
Снижение точности вычислений для ускорения
Квантование — это техника оптимизации нейросетей, при которой веса и активации модели преобразуются из высокоточных форматов (FP32) в низкоточные (INT8, INT4), уменьшая размер модели и ускоряя инференс.
Типы квантования
- Post-Training Quantization (PTQ) — после обучения модели
- Quantization-Aware Training (QAT) — во время обучения
- Dynamic Quantization — во время инференса
- Static Quantization — с калибровкой на данных
Форматы точности
- FP32 — 32-битная плавающая точка (исходная)
- FP16 — 16-битная (половинная точность)
- INT8 — 8-битное целое (4x сжатие)
- INT4 — 4-битное целое (8x сжатие)
Преимущества
- Уменьшение размера модели в 2-8 раз
- Ускорение инференса в 2-4 раза
- Снижение энергопотребления
- Возможность запуска на edge-устройствах
Инструменты
- TensorRT (NVIDIA)
- ONNX Runtime
- PyTorch quantization
- TensorFlow Lite