Пользователь X по имени @cozyblaze265065 опубликовал 22 мая неофициальные результаты тестирования способности модели к умножению многозначных чисел: без использования каких-либо внешних инструментов GPT-5.5 при настройке «среднего уровня рассуждений» и 7 попытках на каждый пример решил 400 задач умножения (20×20), где каждый множитель содержал до 20 цифр. Точность составила 99,46%; ошибки возникали лишь в очень немногих случаях с особенно длинными числами. Гистограмма показала, что в режиме «среднего уровня рассуждений» точность значительно выше, чем при более низких настройках, что подтверждает влияние большего количества шагов цепочки рассуждений на точность выполнения операций с многозначными числами. Исследователь в области ИИ Рафаэль Мильерь в своем репосте отметил: «Я всё ещё время от времени слышу, будто LLM вообще не умеют считать — это очередное напоминание, что мы уже не 2022 год». Данное тестирование проводилось сообществом добровольцев, не являясь официальным бенчмарком от OpenAI; однако чёткая методология и впечатляющие результаты привлекли большое внимание.
Связанные темы
| Тема | Ответов | Просм. | Активность | |
|---|---|---|---|---|
| OpenAI 内部通用模型推翻 80 年艾狄胥猜想,数学界里程碑 | 0 | 16 | 21.05.2026 | |
| 北大团队发布全球首个 AI 学术诚信基准,整体问题率达 34% | 0 | 11 | 20.05.2026 | |
| Google DeepMind AI agent resolves 9 open Erdős problems and proves 44 OEIS conjectures at hundreds of dollars per proof | 0 | 12 | 25.05.2026 | |
| OpenAI launches Daybreak cyber tools and Patch the Planet: GPT-5.5-Cyber scores 85.6% on CyberGym, Codex Security hits 500K+ fixed findings | 0 | 3 | 23.06.2026 | |
| GRAM:将递归推理概率化,10M 参数 ARC-AGI-1 达 52% | 0 | 16 | 20.05.2026 |