Supra2-100M показывает, зачем нужны сверхмалые открытые языковые модели

Команда SupraLabs выпустила Supra2-100M — базовую языковую модель примерно на 100,7 млн параметров. Её цель не конкурировать с большими чат-ботами, а дать исследователям дешёвую […]

Supra2-100M показывает, зачем нужны сверхмалые открытые языковые модели

Команда SupraLabs выпустила Supra2-100M — базовую языковую модель примерно на 100,7 млн параметров. Её цель не конкурировать с большими чат-ботами, а дать исследователям дешёвую площадку для обучения и тонкой настройки.

Что внутри

Модель построена на архитектуре Qwen3, обучена с нуля примерно на 30 млрд токенов английского текста и использует собственный токенизатор на 32 768 элементов. Базовая длина контекста при обучении составила 1024 токена, а конфигурация допускает до 2048.

Почему релиз заметен

Для экспериментов со смесью данных, абляциями и быстрым fine-tuning не всегда нужен многомиллиардный чекпойнт. Небольшую модель проще запускать на одной потребительской видеокарте, быстрее переобучать и использовать как учебный стенд для локальных команд.

Чего от неё не стоит ждать

Supra2-100M не предназначена для надёжных ответов, длинных рассуждений или многоязычного продакшена. Она не прошла чат-настройку и защитное дообучение, поэтому склонна к галлюцинациям и продолжению нежелательного текста.

Вывод

Сверхмалые модели полезны не как замена крупным системам, а как способ сделать исследования доступными без дорогого оборудования. Такой формат особенно удобен для прототипов игровых диалогов, локальных инструментов и учебных проектов, где важны скорость итераций и контроль над данными.