Сколько видеопамяти нужно для локальных LLM в 2026 году: подбираем GPU под задачи

Видеопамять — главная валюта локального ИИ. Модель, которая не поместилась в VRAM, либо не запустится, либо будет работать в разы медленнее на выгрузке в ОЗУ. Разбираем по ступеням, что реально запускается на популярных картах в 2026 году.
8–12 ГБ: входной билет
RTX 4060, 3060 12 ГБ, 5060. Уверенно работают модели класса 7–8 млрд параметров в 4-битном квантовании: Llama 3.1 8B, Qwen 8B, Mistral 7B. Этого хватает для чат-ассистента, суммаризации и простого кода. 12-миллиардные модели влезают впритык, длинный контекст уже не помещается.
16 ГБ: рабочая лошадка
RTX 4080/5070 Ti и аналоги. Открываются модели 14–24 млрд параметров в Q4 — уровень, на котором локальный ассистент начинает уверенно писать код и работать с документами. Плюс комфортный запас под контекст 16–32K токенов.
24–32 ГБ: серьёзный локальный ИИ
RTX 4090 (24 ГБ) и 5090 (32 ГБ). Здесь живут 30–70-миллиардные модели: 32B в Q6, 70B в агрессивном Q3–Q4. Качество ответов приближается к облачным сервисам. 5090 с 32 ГБ — сейчас самый мощный потребительский вариант, но и цена соответствующая, а из-за дефицита памяти карты дорожают.
Особый путь: Mac и общая память
Mac на M3/M4 с 64–128 ГБ объединённой памяти запускают даже 70B-модели без дискретной видеокарты — медленнее NVIDIA по токенам в секунду, но с уникальным соотношением «объём памяти / цена». Вариант для тех, кому важен большой контекст, а не скорость.
Практические советы
- Квантование Q4_K_M — золотая середина качества и объёма: считайте примерно 0,6–0,7 ГБ на миллиард параметров плюс запас под контекст;
- Быстрый старт — Ollama или LM Studio, тонкая настройка — llama.cpp;
- Не гонитесь за максимальной моделью: 14B, которая летает, полезнее 70B, которая еле ползёт.
Подобрать конфигурацию под вашу модель можно в ИИ-калькуляторе MinerBoss.