Подобрать ПК
ПК для ИИ

Квантизация простыми словами: почему Q4 — это нормально

Если вы качали модели для Ollama или LM Studio, то видели загадочные суффиксы: Q4_K_M, Q8_0, Q6_K. Это уровни квантизации — и именно они решают, поместится ли модель в вашу видеокарту. Разберёмся без математики.

Что вообще происходит

Нейросеть — это миллиарды чисел-весов. В оригинале каждый вес хранится в 16 битах. Квантизация — это сжатие: веса записываются грубее, например 4 битами вместо 16. Модель занимает в 3–4 раза меньше памяти и работает быстрее, потому что узкое место локального инференса — скорость чтения памяти, а не вычисления.

Формат GGUF — стандарт упаковки квантованных моделей для llama.cpp и всего, что на нём построено (Ollama, LM Studio, Jan). Буква Q и цифра — среднее число бит на вес, суффиксы K_S/K_M/K_L — варианты «умной» квантизации, где важные слои сжимаются бережнее.

Таблица: Qwen3-32B в разных квантах

Квант Размер файла Минимум VRAM Качество
BF16 (оригинал) ~65,5 ГБ 72+ ГБ Эталон
Q8_0 ~34,8 ГБ 40 ГБ Неотличимо от эталона
Q6_K ~26,9 ГБ 32 ГБ Практически без потерь
Q5_K_M ~23,2 ГБ 28 ГБ Потери на грани измеримого
Q4_K_M ~19,8 ГБ 24 ГБ −1–3% на бенчмарках
Q3_K_M ~16 ГБ 20 ГБ Заметная деградация
Q2_K ~12,3 ГБ 16 ГБ Только от безысходности

Почему Q4 — золотая середина

Замеры показывают одно: между FP16 и Q4_K_M разница в единицы процентов, которую в обычной работе вы не заметите. Обрыв начинается ниже: Q3 ощутимо «глупеет» на математике и коде. Отсюда главное следствие: большая модель в Q4 почти всегда лучше маленькой в Q8. Qwen3-32B в Q4_K_M (20 ГБ) обойдёт Qwen3-14B в Q8 (16 ГБ) практически везде.

Короткая памятка

Проверить, какой квант влезет в вашу карту, можно в ИИ-калькуляторе.