Проект llama.cpp выпустил версию 0.6.0 — крупное обновление для локального запуска языковых и мультимодальных моделей. Релиз добавляет расширенный batch API, поддержку новых архитектур и несколько изменений для ускорения инференса.
Что изменилось
В проекте появилась llama_batch_ext для смешанной обработки токенов и эмбеддингов, а также поддержка GLM-5.3-Flash, decision-моделей и speculative decoding для Qwen4Exp. Обновлён и серверный API для сценариев, где модель должна принимать решение по структурированному запросу.
Почему это важно
llama.cpp давно служит базовым слоем для локальных приложений, настольных оболочек и домашних серверов. Чем шире список поддерживаемых моделей и эффективнее работа с памятью, тем быстрее новые релизы добираются до обычных видеокарт и Apple Silicon.
Что учесть перед обновлением
Изменения затрагивают формат состояния сессий и внутренние интерфейсы, поэтому старые сохранённые состояния могут потребовать пересоздания. Перед обновлением рабочего сервера стоит зафиксировать версии моделей и проверить совместимость клиентского кода.
