DeepSeek 10 сентября выпустила V4.1-Flash — модель, которая принимает текст и изображения и поддерживает контекст до миллиона токенов. Главное изменение касается памяти длинных диалогов: по данным разработчика, глобальный KV-кэш занимает примерно четверть объёма предыдущей V4-Flash в памяти ускорителя и одну восьмую при постоянном хранении на SSD.

KV-кэш — сохранённые промежуточные данные об уже обработанном тексте: благодаря им модель не пересчитывает всю историю при каждом новом токене. В V4.1-Flash обработку входа и генерацию ответа разделили между энкодером и декодером. Декодер получает общий кэш из представлений энкодера; слои также совместно используют часть данных внимания. При обработке входа активируются 8 млрд параметров, при генерации — 16 млрд. Это не полный размер модели: её основная сеть содержит 552 млрд параметров.

Для агента, который много раз читает растущую историю работы, такое сокращение кэша потенциально уменьшает одну из крупных статей расходов. Но четыре раза относятся именно к кэшу, а не ко всей памяти, цене запроса или времени выполнения задачи. Веса и код опубликованы под MIT; модель уже обслуживается через API под именем deepseek-flash. Открытость позволяет изучать реализацию, но сотни миллиардов параметров не превращают её в модель для обычного ноутбука.

В собственных тестах DeepSeek новая версия решила 90,6% задач Terminal-Bench 2.1 против 82,7% у V4-Flash. Проверка шла с максимальным усилием рассуждения, контекстом до миллиона токенов и агентным каркасом DeepSeek; для этой проверки указаны три прогона на задачу, предел 500 шагов и отсутствие сети. Универсального превосходства нет: на GPQA Diamond новая Flash уступает V4-Pro. Независимого воспроизведения этих измерений мы не установили. Содержательный результат релиза — опубликованный способ сократить хранение контекста и доступная реализация, а не обещание одинакового выигрыша в любой задаче.