Meituan выпустила предварительную версию LongCat-2.5 через свою API-платформу. Обновление расширяет семейство LongCat в сторону длинных агентных сценариев и добавляет понимание изображений.
Что произошло
Новая версия предназначена для задач, где модель должна долго удерживать контекст и выполнять последовательность действий. В описании API отдельно выделены визуальные вопросы, суммаризация изображений и рассуждения по содержимому кадра.
Почему это важно
Для автономных помощников текстового контекста уже мало: агенту приходится читать интерфейс, анализировать скриншоты и сопоставлять визуальные данные с планом работы. Мультимодальный режим делает такую связку доступной без отдельного контура распознавания каждого изображения.
Контекст
LongCat-2.5 остаётся крупной серверной моделью, поэтому новость прежде всего важна пользователям API, а не владельцам обычных домашних видеокарт. Публичных сопоставимых тестов на качество визуальной отладки и длительных задач пока недостаточно, поэтому заявленные возможности лучше воспринимать как стартовую точку для собственных проверок.
Вывод
Релиз показывает, что конкуренция среди агентных моделей смещается от размера контекста к способности надёжно связывать текст, изображение и последовательность действий. В прикладных проектах решающими будут не рекламные параметры, а цена, задержка и доля задач, завершённых без вмешательства человека.



