Tether опубликовала синтетический набор из 191 млрд токенов для обучения ИИ
Новость опубликована 23.09.2026 ⦁ источник
Tether AI Research 23 сентября опубликовала Genesis III — синтетический набор из 159,6 млн англоязычных учебных документов, или примерно 191,43 млрд токенов. Он охватывает 19 направлений естественных наук, техники, математики и информатики — от школьного уровня до профессиональной медицины. Данные доступны на Hugging Face по лицензии CC BY-NC 4.0, то есть без разрешения на коммерческое использование.
Авторы пытались решить не нехватку параметров, а нехватку пригодных открытых данных для небольших моделей. Сначала модель Qwen3-1.7B отвечала на сгенерированные вопросы с четырьмя вариантами. Её ошибки более крупная модель превращала в разбор заблуждения и правильного решения, а успешные ответы — в объяснение, почему верен один вариант и неверны остальные. Так получились два дополняющих друг друга массива: разбор ошибок и рассуждение по вариантам ответа.
В описанных авторами контролируемых опытах модели с 1,7 млрд параметров обучали с нуля. При сопоставимом объёме обучения объединённый Genesis III набрал 51,85% против 23,28% у Cosmopedia-v2 в ARC-Easy, 42,71% против 21,36% в ARC-Challenge и 30,19% против 15,16% в MMLU STEM. На более сложном GPQA Diamond разница оказалась значительно меньше: 22,72% против 20,20%.
Это пока результат команды Tether, а не независимое воспроизведение. В статье нет доверительных интервалов, тесты близки к предметам самого набора, а его карточка прямо предупреждает о возможных галлюцинациях, ошибочных объяснениях и неверных ключах ответов. Genesis III нельзя считать справочником или готовыми данными для медицины и других ответственных применений. Но в отличие от обещания локального ИИ-репетитора здесь уже доступны сами данные, код и контрольные модели — проверить заявленное преимущество теперь могут другие исследователи.
Tether AI Research, QVAC, Genesis III, Qwen3-1.7B, Cosmopedia-v2, синтетические обучающие данные