Квантизация простыми словами: почему Q4 — это нормально

Если вы качали модели для Ollama или LM Studio, то видели загадочные суффиксы: Q4_K_M, Q8_0, Q6_K. Это уровни квантизации — и именно они решают, поместится ли модель в вашу видеокарту. Разберёмся без математики.
Что вообще происходит
Нейросеть — это миллиарды чисел-весов. В оригинале каждый вес хранится в 16 битах. Квантизация — это сжатие: веса записываются грубее, например 4 битами вместо 16. Модель занимает в 3–4 раза меньше памяти и работает быстрее, потому что узкое место локального инференса — скорость чтения памяти, а не вычисления.
Формат GGUF — стандарт упаковки квантованных моделей для llama.cpp и всего, что на нём построено (Ollama, LM Studio, Jan). Буква Q и цифра — среднее число бит на вес, суффиксы K_S/K_M/K_L — варианты «умной» квантизации, где важные слои сжимаются бережнее.
Таблица: Qwen3-32B в разных квантах
| Квант | Размер файла | Минимум VRAM | Качество |
|---|---|---|---|
| BF16 (оригинал) | ~65,5 ГБ | 72+ ГБ | Эталон |
| Q8_0 | ~34,8 ГБ | 40 ГБ | Неотличимо от эталона |
| Q6_K | ~26,9 ГБ | 32 ГБ | Практически без потерь |
| Q5_K_M | ~23,2 ГБ | 28 ГБ | Потери на грани измеримого |
| Q4_K_M | ~19,8 ГБ | 24 ГБ | −1–3% на бенчмарках |
| Q3_K_M | ~16 ГБ | 20 ГБ | Заметная деградация |
| Q2_K | ~12,3 ГБ | 16 ГБ | Только от безысходности |
Почему Q4 — золотая середина
Замеры показывают одно: между FP16 и Q4_K_M разница в единицы процентов, которую в обычной работе вы не заметите. Обрыв начинается ниже: Q3 ощутимо «глупеет» на математике и коде. Отсюда главное следствие: большая модель в Q4 почти всегда лучше маленькой в Q8. Qwen3-32B в Q4_K_M (20 ГБ) обойдёт Qwen3-14B в Q8 (16 ГБ) практически везде.
Короткая памятка
- Есть запас памяти — берите Q6_K или Q8_0, хуже не будет.
- Стандартный выбор без раздумий — Q4_K_M.
- Не влезает даже Q4 — лучше модель поменьше, чем Q2.
- Для рассуждающих моделей (DeepSeek-R1) держитесь Q5 и выше.
Проверить, какой квант влезет в вашу карту, можно в ИИ-калькуляторе.