Nima Kvantlash
Tezlik uchun hisoblash aniqligini kamaytirish
Kvantlash — bu model og'irliklari va aktivatsiyalari yuqori aniqlikdagi formatlardan (FP32) past aniqlikka (INT8, INT4) o'tkaziladigan, model hajmini kamaytiruvchi va inferensni tezlashtiruvchi neyron tarmoq optimallashtirish texnikasi.
Kvantlash turlari
- Post-Training Quantization (PTQ) — modelni o'qitgandan keyin
- Quantization-Aware Training (QAT) — o'qitish davomida
- Dinamik kvantlash — inferens davomida
- Statik kvantlash — ma'lumotlar kalibratsiyasi bilan
Aniqlik formatlari
- FP32 — 32-bitli suzuvchi nuqta (asl)
- FP16 — 16-bit (yarim aniqlik)
- INT8 — 8-bitli butun son (4x siqish)
- INT4 — 4-bitli butun son (8x siqish)
Afzalliklari
- Model hajmini 2-8 marta kamaytirish
- Inferensni 2-4 marta tezlashtirish
- Kam quvvat iste'moli
- Edge qurilmalarida ishlash imkoniyati
Vositalar
- TensorRT (NVIDIA)
- ONNX Runtime
- PyTorch kvantlash
- TensorFlow Lite