NaiveAI 27 сентября открыла веса и код Naive‑N0.5‑Flash под лицензией MIT. Это модель со смесью экспертов: всего 309 млрд параметров, но при обработке токена задействуются 15,5 млрд. Разработчик заявляет нативный контекст до миллиона токенов — без единого слоя полного внимания.

При длинном контексте обычному вниманию приходится сопоставлять новый токен со всей предыдущей последовательностью, и вычислительные расходы быстро растут. В Naive‑N0.5‑Flash 39 слоёв смотрят только на окно из 128 токенов, а девять разреженных слоёв выбирают из истории по 2048 наиболее подходящих токенов. Индексатор всё равно просматривает всю историю, а полный кэш ключей и значений сохраняется: схема сокращает вычисления и обращения к памяти, но не превращает миллион токенов в бесплатную память.

Модель построена на открытой MiMo‑V2.5 и после изменения архитектуры прошла продолженное обучение на 3,25 трлн токенов. В таблицах самой NaiveAI она набрала 73,6% на SWE‑bench Pro и 86,7% на Terminal‑Bench 2.1; большинство испытаний запускали через Claude Code с базовыми файловыми и командными инструментами. Это результаты разработчика, собранные не всегда в одном независимом прогоне с конкурентами, поэтому они показывают заявленный уровень релиза, а не устанавливают нового универсального лидера.

Отдельный проверяемый результат — рантайм NaiveRT. На восьми GPU он достиг пиковых 2122 токенов в секунду в лучшем секундном отрезке среди 41 запроса на генерацию HTML и SVG, без режима рассуждений и без учёта первичной обработки запроса. Полный цикл спекулятивной генерации занял 3,4 мс против 12,3 мс у SGLang на той же системе. По журналу команды, ядро оптимизации сделали за шесть дней: модели предлагали и реализовывали изменения, а люди задавали направление и критерии приёмки. Из 151 испытания приняли 63, 71 вариант не прошёл проверку или был отменён, ещё 17 остались альтернативами и прототипами.

Открытость здесь ещё не означает бытовую доступность: веса занимают около 315 ГБ и требуют ускорителей с поддержкой FP8; готового провайдера на Hugging Face пока нет, а API только обещан. Миллионный контекст тоже не доказывает, что модель одинаково хорошо использует каждую его часть. Новый факт уже есть: разработчики получили открытую реализацию длинного контекста без полного внимания и измеримо ускорили конкретный режим генерации — проверить качество и переносимость этих результатов независимо ещё предстоит.