Свежая исследовательская работа, разошедшаяся по Hacker News, предлагает объяснение неприятной закономерности: обучение с подкреплением (RL) непропорционально улучшает то, что модель и так частично умела, а задачи с нулевым начальным успехом так и остаются нерешёнными.
Авторы называют это эффектом Матфея в RL-обучении языковых моделей: усредненные графики роста на бенчмарках выглядят обнадёживающе, но за этим ростом часто скрывается стагнация именно на сложных задачах — модель просто становится ещё лучше в том, что уже умела, а не расширяет реальные границы своих возможностей.
Предложенное решение
Метод, получивший название «Never Give Up» («Никогда не сдавайся»), предлагает изменить процесс обучения так, чтобы модель не переставала пытаться решать задачи с нулевым начальным процентом успеха, а не концентрировалась только на постепенном улучшении уже освоенных навыков.
Тема попала в резонанс с более широкой дискуссией последних месяцев о том, действительно ли frontier-модели продолжают качественно расти или улучшения на бенчмарках всё больше маскируют выход на плато в сложных областях — математике, доказательствах, действительно новых типах задач.
Практический вывод для тех, кто выбирает модель по бенчмаркам: высокий агрегированный результат не гарантирует, что модель реально справится с конкретной сложной задачей вне тренировочного распределения — стоит смотреть не только на средние цифры, но и на то, как модель ведёт себя именно на нетипичных, непростых кейсах.



