Mis on Kvantiseerimine
Arvutustapsuse vahendamine kiiruse nimel
Kvantiseerimine on narvivorkude optimeerimistehnika, kus mudeli kaalud ja aktiveerimised teisendatakse korge tapsusega formaatidest (FP32) madala tapsusega formaatidesse (INT8, INT4), vahendades mudeli suurust ja kiirendades jareldamist.
Kvantiseerimise tuubid
- Post-Training Quantization (PTQ) — parast mudeli treeningut
- Quantization-Aware Training (QAT) — treeningu ajal
- Dunaamiline kvantiseerimine — jareldamise ajal
- Staatiline kvantiseerimine — andmete kalibreerimisega
Tapsusformaadid
- FP32 — 32-bitine ujukoma (algne)
- FP16 — 16-bitine (pooltapsus)
- INT8 — 8-bitine tarisarv (4x tihendamine)
- INT4 — 4-bitine tarisarv (8x tihendamine)
Eelised
- Mudeli suuruse vahendamine 2-8 korda
- Jareldamise kiirendamine 2-4 korda
- Vahenenud voolutarve
- Voimalus tootada servas seadmetel
Tooriistad
- TensorRT (NVIDIA)
- ONNX Runtime
- PyTorch kvantiseerimine
- TensorFlow Lite