В подборке свежих работ по локальным моделям выделились исследования DeepSeek V4.1 Flash: одно разбирает сжатие KV-кэша, другое — автоматическое улучшение оболочки coding-агента. Оба направления нацелены не только на качество модели, но и на стоимость длинных рабочих сессий.
Что произошло
Обсуждаемая работа по V4.1 Flash описывает повторное использование KV-данных между слоями и более компактное представление кэша. В публичном пересказе приводится оценка около 890 байт на токен для глобального кэша — показатель, который особенно важен на длинном контексте.
Параллельное исследование SoL-Pi рассматривает циклы авторефлексии, улучшающие не сами веса модели, а harness: планирование, инструменты и управление контекстом. В сообщении сообщества заявлено снижение токенового трафика примерно на 44,7–49% при сопоставимом результате.
Почему это важно
Для агентских задач стоимость часто определяется повторной передачей большого системного промпта и истории инструментов. Оптимизация кэша и оболочки может дать больший практический эффект, чем небольшая прибавка к баллам общего бенчмарка.
Обе цифры требуют аккуратного чтения: они относятся к конкретным экспериментальным конфигурациям и не являются гарантией для любого движка или сценария. Воспроизводимые скрипты и одинаковые стенды здесь важнее красивого процента.
Вывод
Следующий этап развития локального AI — это совместная оптимизация модели, памяти и агентского контура. DeepSeek V4.1 Flash стал удобным полигоном именно потому, что длинный контекст быстро выявляет стоимость неэффективной инфраструктуры.
