Одна и та же языковая модель может выдать разные тексты на один запрос даже при жадном декодировании — когда на каждом шаге выбирается самый вероятный токен. В работе, опубликованной в Transactions on Machine Learning Research, исследователи запускали одинаковые модели, запросы и алгоритм на одном оборудовании, меняя только числовой формат между BF16 и FP16. Полные последовательности разошлись в 49–100% проверок на математических и программных задачах.

Внутри каждого формата повторные запуски оставались одинаковыми. Расхождение возникало между форматами: округление слегка меняло оценки токенов, и при малом разрыве между двумя лидерами модель иногда выбирала другой. Один такой выбор затем менял всю дальнейшую последовательность. В опытах участвовали шесть моделей четырёх семейств размером от 1,1 до 7 млрд параметров; для модели на 12,2 млрд эффект проверили отдельно без полного сравнения способов исправления.

Разный текст не всегда означает разный результат. На HumanEval у Qwen2.5-3B точные последовательности совпали лишь в 26,2% задач, но итог выполнения программ — в 97,6%. На GSM8K, напротив, смена формата изменила правильность конечного ответа у 19% запросов. Поэтому числовой формат способен мешать точному воспроизведению аудита и отдельным сравнениям моделей, хотя среднее качество и практический результат могут остаться прежними.

Авторы предложили частичное исправление: пересчитывать выходной слой в FP32 только тогда, когда оценки двух лучших токенов слишком близки. На Nvidia A10G это повысило долю полностью совпадающих текстов на 22–36 процентных пунктов при задержке менее 4%; на L4 и A100 прибавка составила 12–21 пункт. Пересчёт требовался примерно на 0,7–1,4% шагов.

Метод не гарантирует одинаковые ответы. В тестах его преимущество исчезало при пакетах от восьми запросов, а при сквозном FP8 прибавка составила лишь один пункт. Выборку токенов вместо жадного декодирования авторы не проверяли, полное сравнение не охватывало модели на десятки миллиардов параметров, а величина эффекта зависела от ускорителя. И главное: воспроизводимость не равна правильности — одинаково повторяемый ответ всё ещё может быть ошибочным.