Опубликован датасет из 1451 математической задачи с рассуждениями DeepSeek V4.1 Flash. Авторы проверяли ответы вычислительным грейдером и дополнительной локальной моделью, а затем исключали пересечения с MATH-500 и AIME.
Что произошло
В набор вошли задачи по алгебре, геометрии, теории чисел, дискретной математике и смежным направлениям. Исходный пул прошёл дедупликацию и фильтрацию, после чего для генерации решений использовался режим максимального рассуждения.
Первый слой проверки сравнивает итоговые ответы через SymPy. Случаи, где автоматический грейдер не смог уверенно сопоставить ответ, дополнительно разбирала Qwen3.5 4B; неоднозначные примеры в финальную выборку не включали.
Почему это важно
Такие наборы дают разработчикам малых reasoning-моделей готовую основу для SFT и дистилляции. Особенно ценна проверяемость финального ответа: ошибочные трассы не должны бездумно попадать в обучение.
Ограничение тоже очевидно: все решения получены одним учителем, а корректность финального ответа не равна построчной проверке каждого шага рассуждения. Датасет полезен как исследовательская база, но не как абсолютная разметка истины.
Вывод
Открытые проверенные наборы постепенно становятся отдельным слоем инфраструктуры вокруг моделей. Их качество будет определяться не длиной цепочки мыслей, а прозрачностью отбора и независимой проверкой.
