Тестирование в сообществе: GPT-5.5 показывает точность 99,46% при умножении 20-значных чисел без использования инструментов

Пользователь X по имени @cozyblaze265065 опубликовал 22 мая неофициальные результаты тестирования способности модели к умножению многозначных чисел: без использования каких-либо внешних инструментов GPT-5.5 при настройке «среднего уровня рассуждений» и 7 попытках на каждый пример решил 400 задач умножения (20×20), где каждый множитель содержал до 20 цифр. Точность составила 99,46%; ошибки возникали лишь в очень немногих случаях с особенно длинными числами. Гистограмма показала, что в режиме «среднего уровня рассуждений» точность значительно выше, чем при более низких настройках, что подтверждает влияние большего количества шагов цепочки рассуждений на точность выполнения операций с многозначными числами. Исследователь в области ИИ Рафаэль Мильерь в своем репосте отметил: «Я всё ещё время от времени слышу, будто LLM вообще не умеют считать — это очередное напоминание, что мы уже не 2022 год». Данное тестирование проводилось сообществом добровольцев, не являясь официальным бенчмарком от OpenAI; однако чёткая методология и впечатляющие результаты привлекли большое внимание.

X (@cozyblaze265065)