Meituan обновила LongCat-2.5 и добавила мультимодальный режим для агентов

Meituan выпустила предварительную версию LongCat-2.5 через свою API-платформу. Обновление расширяет семейство LongCat в сторону длинных агентных сценариев и добавляет понимание изображений. Что произошло Новая […]

Meituan обновила LongCat-2.5 и добавила мультимодальный режим для агентов

Meituan выпустила предварительную версию LongCat-2.5 через свою API-платформу. Обновление расширяет семейство LongCat в сторону длинных агентных сценариев и добавляет понимание изображений.

Что произошло

Новая версия предназначена для задач, где модель должна долго удерживать контекст и выполнять последовательность действий. В описании API отдельно выделены визуальные вопросы, суммаризация изображений и рассуждения по содержимому кадра.

Почему это важно

Для автономных помощников текстового контекста уже мало: агенту приходится читать интерфейс, анализировать скриншоты и сопоставлять визуальные данные с планом работы. Мультимодальный режим делает такую связку доступной без отдельного контура распознавания каждого изображения.

Контекст

LongCat-2.5 остаётся крупной серверной моделью, поэтому новость прежде всего важна пользователям API, а не владельцам обычных домашних видеокарт. Публичных сопоставимых тестов на качество визуальной отладки и длительных задач пока недостаточно, поэтому заявленные возможности лучше воспринимать как стартовую точку для собственных проверок.

Вывод

Релиз показывает, что конкуренция среди агентных моделей смещается от размера контекста к способности надёжно связывать текст, изображение и последовательность действий. В прикладных проектах решающими будут не рекламные параметры, а цена, задержка и доля задач, завершённых без вмешательства человека.