Подобрать ПК
ПК для ИИ

Сколько видеопамяти нужно для локальных LLM в 2026 году: подбираем GPU под задачи

Видеопамять — главная валюта локального ИИ. Модель, которая не поместилась в VRAM, либо не запустится, либо будет работать в разы медленнее на выгрузке в ОЗУ. Разбираем по ступеням, что реально запускается на популярных картах в 2026 году.

8–12 ГБ: входной билет

RTX 4060, 3060 12 ГБ, 5060. Уверенно работают модели класса 7–8 млрд параметров в 4-битном квантовании: Llama 3.1 8B, Qwen 8B, Mistral 7B. Этого хватает для чат-ассистента, суммаризации и простого кода. 12-миллиардные модели влезают впритык, длинный контекст уже не помещается.

16 ГБ: рабочая лошадка

RTX 4080/5070 Ti и аналоги. Открываются модели 14–24 млрд параметров в Q4 — уровень, на котором локальный ассистент начинает уверенно писать код и работать с документами. Плюс комфортный запас под контекст 16–32K токенов.

24–32 ГБ: серьёзный локальный ИИ

RTX 4090 (24 ГБ) и 5090 (32 ГБ). Здесь живут 30–70-миллиардные модели: 32B в Q6, 70B в агрессивном Q3–Q4. Качество ответов приближается к облачным сервисам. 5090 с 32 ГБ — сейчас самый мощный потребительский вариант, но и цена соответствующая, а из-за дефицита памяти карты дорожают.

Особый путь: Mac и общая память

Mac на M3/M4 с 64–128 ГБ объединённой памяти запускают даже 70B-модели без дискретной видеокарты — медленнее NVIDIA по токенам в секунду, но с уникальным соотношением «объём памяти / цена». Вариант для тех, кому важен большой контекст, а не скорость.

Практические советы

Подобрать конфигурацию под вашу модель можно в ИИ-калькуляторе MinerBoss.