L’utilisateur X @cozyblaze265065 a publié le 22 mai les résultats d’un test de benchmark informel sur la multiplication de nombres à plusieurs chiffres : sans recourir à aucun outil externe, et en utilisant le mode « raisonnement moyen » (medium reasoning) de GPT-5.5 avec 7 échantillons par case, il a résolu 400 opérations de multiplication 20×20 (chaque multiplicateur comptant jusqu’à 20 chiffres). Le taux de réussite s’est élevé à 99,46 %, seules quelques combinaisons comportant beaucoup de chiffres ayant donné lieu à des erreurs. La carte thermique montre que le taux de précision obtenu en mode « raisonnement moyen » est nettement supérieur à celui des modes de raisonnement moins poussés, ce qui démontre que l’augmentation du nombre d’étapes de raisonnement en chaîne améliore considérablement la précision dans les calculs impliquant de grands nombres. Raphaël Millière, chercheur en IA, a reposté ce test en commentant : « Je continue d’entendre parfois dire que les LLM ne savent absolument pas faire d’arithmétique – cela rappelle une fois de plus qu’on n’est plus en 2022. » Ce test, mené de façon bénévole par la communauté et non en tant que benchmark officiel d’OpenAI, se distingue par sa méthodologie claire et ses résultats ont suscité un grand intérêt.
Sujets connexes
| Sujet | Réponses | Vues | Activité | |
|---|---|---|---|---|
| OpenAI 内部通用模型推翻 80 年艾狄胥猜想,数学界里程碑 | 0 | 16 | Mai 21, 2026 | |
| 北大团队发布全球首个 AI 学术诚信基准,整体问题率达 34% | 0 | 11 | Mai 20, 2026 | |
| Google DeepMind AI agent resolves 9 open Erdős problems and proves 44 OEIS conjectures at hundreds of dollars per proof | 0 | 12 | Mai 25, 2026 | |
| OpenAI launches Daybreak cyber tools and Patch the Planet: GPT-5.5-Cyber scores 85.6% on CyberGym, Codex Security hits 500K+ fixed findings | 0 | 3 | Juin 23, 2026 | |
| GRAM:将递归推理概率化,10M 参数 ARC-AGI-1 达 52% | 0 | 16 | Mai 20, 2026 |