Локальный запуск нейросетей упирается в объём видеопамяти. Разбираем, как рассчитать требуемый VRAM под конкретную модель и квантование, и что делать, если памяти не хватает.

Понадобится: видеокарта NVIDIA (или AMD/Intel с поддержкой), драйверы, Ollama или LM Studio, PowerShell (Windows) или терминал (Linux/macOS). Минимум — 8 ГБ VRAM для моделей 7B в 4-битном квантовании. Для 13B нужно 10–12 ГБ, для 30B — 20–24 ГБ, для 70B — от 40 ГБ. Точный объём зависит от квантования, длины контекста и оверхеда фреймворка.
Пошаговая инструкция
- 1Узнайте объём VRAM: в Windows откройте PowerShell и выполните nvidia-smi —query-gpu=memory.total —format=csv. В Linux/macOS используйте ту же команду или lspci | grep VGA.
- 2Определите число параметров модели (7B, 13B, 30B, 70B) — оно указано в названии на Hugging Face.
- 3Выберите уровень квантования: Q4_K_M (4 бита) — базовый, Q5_K_M (5 бит) — лучше качество, Q8_0 (8 бит) — почти без потерь, FP16 — полная точность.
- 4Рассчитайте базовый объём: для 7B в Q4 нужно ~4–5 ГБ, в Q8 — ~8 ГБ, в FP16 — ~14 ГБ. Для 13B в Q4 — ~8 ГБ, в Q8 — ~14 ГБ. Для 30B в Q4 — ~18 ГБ. Для 70B в Q4 — ~40 ГБ.
- 5Добавьте запас на контекст: каждые 1000 токенов контекста съедают 0,1–0,5 ГБ в зависимости от модели и квантования. Для 4096 токенов добавьте 1–2 ГБ.
- 6Учтите оверхед фреймворка: Ollama и LM Studio требуют дополнительно 0,5–1,5 ГБ VRAM на служебные нужды.
- 7Сложите базовый объём, запас на контекст и оверхед — получите минимальный требуемый VRAM.
- 8Сравните с вашей видеокартой. Если VRAM меньше, переходите к более сильному квантованию (Q4 вместо Q8) или уменьшайте контекст.
- 9Установите Ollama: скачайте с ollama.com и запустите установщик. В Linux выполните curl -fsSL https://ollama.com/install.sh | sh.
- 10Запустите модель в Ollama: ollama run llama3:8b (или другую, например mistral:7b). Ollama сама подберёт квантование под вашу VRAM.
- 11Проверьте загрузку VRAM: в новом окне PowerShell выполните nvidia-smi и посмотрите столбец Memory-Usage.
- 12Если модель не влезает, Ollama автоматически переключится на CPU — это замедлит генерацию. Чтобы избежать, задайте параметр num_gpu: в Modelfile укажите PARAMETER num_gpu 20 (число слоёв на GPU).
- 13В LM Studio: откройте вкладку Search, скачайте модель с суффиксом Q4_K_M. Перейдите в My Models, выберите модель и нажмите Load.
- 14В настройках LM Studio (шестерёнка) установите GPU Offload на максимум (например, 32 слоя), Context Length — 4096, Batch Size — 512.
- 15Следите за индикатором VRAM в LM Studio: если он красный, уменьшите GPU Offload или Context Length.
- 16Для экономии VRAM используйте квантизацию Q4_K_S вместо Q4_K_M — она чуть компактнее.
- 17Если видеопамяти критически не хватает, рассмотрите запуск на CPU с 32 ГБ RAM — скорость будет ниже, но модель заработает.
- 18Для точного расчёта под конкретную модель используйте онлайн-калькуляторы VRAM (например, от Hugging Face) — они учитывают архитектуру и контекст.
Частые ошибки
- Игнорирование запаса на контекст: многие считают только вес модели, забывая, что длинный контекст (8K, 16K) требует дополнительных гигабайт. 2. Использование FP16 на бытовой видеокарте: для 7B нужно ~14 ГБ, что превышает возможности большинства GPU. 3. Попытка запустить 70B на 24 ГБ VRAM без агрессивного квантования — модель не загрузится или будет работать на CPU. 4. Неучёт оверхеда фреймворка: Ollama и LM Studio резервируют память под свои нужды, поэтому реальное потребление выше расчётного. 5. Установка слишком большого Batch Size в LM Studio — это увеличивает пиковое потребление VRAM и может привести к ошибке out of memory. 6. Запуск нескольких моделей одновременно: каждая занимает VRAM, суммарно может не хватить. 7. Отсутствие мониторинга: без nvidia-smi или индикатора LM Studio легко пропустить момент, когда модель начала использовать CPU.
Итог
Частые вопросы
Сколько видеопамяти нужно для модели 7B?
Для 7B в квантовании Q4_K_M достаточно 6–7 ГБ VRAM с учётом контекста 4096 токенов и оверхеда. В Q8_0 потребуется около 10 ГБ, в FP16 — 16 ГБ. Если видеокарта имеет 8 ГБ, можно запустить 7B в Q4, но лучше ограничить контекст до 2048 токенов.
Можно ли запустить нейросеть, если видеопамяти меньше рекомендуемой?
Да, но с потерей скорости. Ollama и LM Studio автоматически переносят часть слоёв на CPU. Вы также можете вручную уменьшить число слоёв на GPU (параметр num_gpu в Ollama или GPU Offload в LM Studio) и снизить длину контекста. Это замедлит генерацию, но модель заработает.
Как точно измерить, сколько VRAM занимает модель?
В Windows и Linux выполните nvidia-smi в терминале — в столбце Memory-Usage отображается текущее потребление. В LM Studio есть встроенный индикатор загрузки VRAM. Запустите модель, дайте ей поработать несколько секунд и посмотрите пиковое значение. Для AMD используйте rocm-smi.



