llama.cpp 0.6.0 расширила локальный стек: новые API, GLM-5.3-Flash и ускоренное декодирование

Проект llama.cpp выпустил версию 0.6.0 — крупное обновление для локального запуска языковых и мультимодальных моделей. Релиз добавляет расширенный batch API, поддержку новых архитектур и […]

llama.cpp 0.6.0 расширила локальный стек: новые API, GLM-5.3-Flash и ускоренное декодирование

Проект llama.cpp выпустил версию 0.6.0 — крупное обновление для локального запуска языковых и мультимодальных моделей. Релиз добавляет расширенный batch API, поддержку новых архитектур и несколько изменений для ускорения инференса.

Что изменилось

В проекте появилась llama_batch_ext для смешанной обработки токенов и эмбеддингов, а также поддержка GLM-5.3-Flash, decision-моделей и speculative decoding для Qwen4Exp. Обновлён и серверный API для сценариев, где модель должна принимать решение по структурированному запросу.

Почему это важно

llama.cpp давно служит базовым слоем для локальных приложений, настольных оболочек и домашних серверов. Чем шире список поддерживаемых моделей и эффективнее работа с памятью, тем быстрее новые релизы добираются до обычных видеокарт и Apple Silicon.

Что учесть перед обновлением

Изменения затрагивают формат состояния сессий и внутренние интерфейсы, поэтому старые сохранённые состояния могут потребовать пересоздания. Перед обновлением рабочего сервера стоит зафиксировать версии моделей и проверить совместимость клиентского кода.