Команда SupraLabs выпустила Supra2-100M — базовую языковую модель примерно на 100,7 млн параметров. Её цель не конкурировать с большими чат-ботами, а дать исследователям дешёвую площадку для обучения и тонкой настройки.
Что внутри
Модель построена на архитектуре Qwen3, обучена с нуля примерно на 30 млрд токенов английского текста и использует собственный токенизатор на 32 768 элементов. Базовая длина контекста при обучении составила 1024 токена, а конфигурация допускает до 2048.
Почему релиз заметен
Для экспериментов со смесью данных, абляциями и быстрым fine-tuning не всегда нужен многомиллиардный чекпойнт. Небольшую модель проще запускать на одной потребительской видеокарте, быстрее переобучать и использовать как учебный стенд для локальных команд.
Чего от неё не стоит ждать
Supra2-100M не предназначена для надёжных ответов, длинных рассуждений или многоязычного продакшена. Она не прошла чат-настройку и защитное дообучение, поэтому склонна к галлюцинациям и продолжению нежелательного текста.
Вывод
Сверхмалые модели полезны не как замена крупным системам, а как способ сделать исследования доступными без дорогого оборудования. Такой формат особенно удобен для прототипов игровых диалогов, локальных инструментов и учебных проектов, где важны скорость итераций и контроль над данными.



