Новые исследования DeepSeek V4.1 Flash сосредоточились на сжатии KV-кэша и агентских контурах

В подборке свежих работ по локальным моделям выделились исследования DeepSeek V4.1 Flash: одно разбирает сжатие KV-кэша, другое — автоматическое улучшение оболочки coding-агента. Оба направления […]

Новые исследования DeepSeek V4.1 Flash сосредоточились на сжатии KV-кэша и агентских контурах

В подборке свежих работ по локальным моделям выделились исследования DeepSeek V4.1 Flash: одно разбирает сжатие KV-кэша, другое — автоматическое улучшение оболочки coding-агента. Оба направления нацелены не только на качество модели, но и на стоимость длинных рабочих сессий.

Что произошло

Обсуждаемая работа по V4.1 Flash описывает повторное использование KV-данных между слоями и более компактное представление кэша. В публичном пересказе приводится оценка около 890 байт на токен для глобального кэша — показатель, который особенно важен на длинном контексте.

Параллельное исследование SoL-Pi рассматривает циклы авторефлексии, улучшающие не сами веса модели, а harness: планирование, инструменты и управление контекстом. В сообщении сообщества заявлено снижение токенового трафика примерно на 44,7–49% при сопоставимом результате.

Почему это важно

Для агентских задач стоимость часто определяется повторной передачей большого системного промпта и истории инструментов. Оптимизация кэша и оболочки может дать больший практический эффект, чем небольшая прибавка к баллам общего бенчмарка.

Обе цифры требуют аккуратного чтения: они относятся к конкретным экспериментальным конфигурациям и не являются гарантией для любого движка или сценария. Воспроизводимые скрипты и одинаковые стенды здесь важнее красивого процента.

Вывод

Следующий этап развития локального AI — это совместная оптимизация модели, памяти и агентского контура. DeepSeek V4.1 Flash стал удобным полигоном именно потому, что длинный контекст быстро выявляет стоимость неэффективной инфраструктуры.