Новое исследование объясняет, почему языковые модели буксуют на сложных задачах при RL-обучении

Свежая исследовательская работа, разошедшаяся по Hacker News, предлагает объяснение неприятной закономерности: обучение с подкреплением (RL) непропорционально улучшает то, что модель и так частично умела, […]

Новое исследование объясняет, почему языковые модели буксуют на сложных задачах при RL-обучении

Свежая исследовательская работа, разошедшаяся по Hacker News, предлагает объяснение неприятной закономерности: обучение с подкреплением (RL) непропорционально улучшает то, что модель и так частично умела, а задачи с нулевым начальным успехом так и остаются нерешёнными.

Авторы называют это эффектом Матфея в RL-обучении языковых моделей: усредненные графики роста на бенчмарках выглядят обнадёживающе, но за этим ростом часто скрывается стагнация именно на сложных задачах — модель просто становится ещё лучше в том, что уже умела, а не расширяет реальные границы своих возможностей.

Предложенное решение

Метод, получивший название «Never Give Up» («Никогда не сдавайся»), предлагает изменить процесс обучения так, чтобы модель не переставала пытаться решать задачи с нулевым начальным процентом успеха, а не концентрировалась только на постепенном улучшении уже освоенных навыков.

Тема попала в резонанс с более широкой дискуссией последних месяцев о том, действительно ли frontier-модели продолжают качественно расти или улучшения на бенчмарках всё больше маскируют выход на плато в сложных областях — математике, доказательствах, действительно новых типах задач.

Практический вывод для тех, кто выбирает модель по бенчмаркам: высокий агрегированный результат не гарантирует, что модель реально справится с конкретной сложной задачей вне тренировочного распределения — стоит смотреть не только на средние цифры, но и на то, как модель ведёт себя именно на нетипичных, непростых кейсах.