Проект Flyweight получил первый публичный релиз C++/CUDA-движка для запуска MoE-моделей, которые не помещаются целиком в видеопамять. Runtime распределяет экспертов между GPU и оперативной памятью и предоставляет совместимый API.
Что произошло
Движок автоматически оценивает доступную память при старте и выбирает схему выгрузки. В описании заявлены GGUF-модели, OpenAI- и Anthropic-совместимые API, чат-интерфейс, вызовы инструментов и режим CPU без CUDA.
В опубликованных измерениях на ноутбуке с RTX 5070 Ti и 60 ГБ RAM автор указывает около 35 токенов в секунду для Qwen3.8-Flash-Next в лёгком кванте и 6–7 токенов в секунду для DeepSeek V4 Flash. Это результаты одного стенда, а не универсальный бенчмарк.
Почему это важно
Для локального запуска больших MoE узким местом часто становится не вычислительная мощность, а объём VRAM. Автоматическое размещение экспертов и квантование KV-кэша могут сделать эксперименты доступными на обычных рабочих станциях.
Цена такой гибкости — зависимость от пропускной способности оперативной памяти и необходимость проверять задержки. Для интерактивного агента средняя скорость генерации важна меньше, чем стабильное время первого токена и корректные tool calls.
Вывод
Flyweight интересен как инженерный эксперимент вокруг «домашнего» inference: он не отменяет ограничения железа, но даёт более удобный способ использовать его полностью.
