Flyweight предлагает запускать крупные MoE-модели на одной видеокарте и системной памяти

Проект Flyweight получил первый публичный релиз C++/CUDA-движка для запуска MoE-моделей, которые не помещаются целиком в видеопамять. Runtime распределяет экспертов между GPU и оперативной памятью […]

Flyweight предлагает запускать крупные MoE-модели на одной видеокарте и системной памяти

Проект Flyweight получил первый публичный релиз C++/CUDA-движка для запуска MoE-моделей, которые не помещаются целиком в видеопамять. Runtime распределяет экспертов между GPU и оперативной памятью и предоставляет совместимый API.

Что произошло

Движок автоматически оценивает доступную память при старте и выбирает схему выгрузки. В описании заявлены GGUF-модели, OpenAI- и Anthropic-совместимые API, чат-интерфейс, вызовы инструментов и режим CPU без CUDA.

В опубликованных измерениях на ноутбуке с RTX 5070 Ti и 60 ГБ RAM автор указывает около 35 токенов в секунду для Qwen3.8-Flash-Next в лёгком кванте и 6–7 токенов в секунду для DeepSeek V4 Flash. Это результаты одного стенда, а не универсальный бенчмарк.

Почему это важно

Для локального запуска больших MoE узким местом часто становится не вычислительная мощность, а объём VRAM. Автоматическое размещение экспертов и квантование KV-кэша могут сделать эксперименты доступными на обычных рабочих станциях.

Цена такой гибкости — зависимость от пропускной способности оперативной памяти и необходимость проверять задержки. Для интерактивного агента средняя скорость генерации важна меньше, чем стабильное время первого токена и корректные tool calls.

Вывод

Flyweight интересен как инженерный эксперимент вокруг «домашнего» inference: он не отменяет ограничения железа, но даёт более удобный способ использовать его полностью.