Test communautaire : GPT-5.5 atteint un taux de réussite de 99,46 % dans la multiplication de nombres à 20 chiffres, sans aucun outil.

L’utilisateur X @cozyblaze265065 a publié le 22 mai les résultats d’un test de benchmark informel sur la multiplication de nombres à plusieurs chiffres : sans recourir à aucun outil externe, et en utilisant le mode « raisonnement moyen » (medium reasoning) de GPT-5.5 avec 7 échantillons par case, il a résolu 400 opérations de multiplication 20×20 (chaque multiplicateur comptant jusqu’à 20 chiffres). Le taux de réussite s’est élevé à 99,46 %, seules quelques combinaisons comportant beaucoup de chiffres ayant donné lieu à des erreurs. La carte thermique montre que le taux de précision obtenu en mode « raisonnement moyen » est nettement supérieur à celui des modes de raisonnement moins poussés, ce qui démontre que l’augmentation du nombre d’étapes de raisonnement en chaîne améliore considérablement la précision dans les calculs impliquant de grands nombres. Raphaël Millière, chercheur en IA, a reposté ce test en commentant : « Je continue d’entendre parfois dire que les LLM ne savent absolument pas faire d’arithmétique – cela rappelle une fois de plus qu’on n’est plus en 2022. » Ce test, mené de façon bénévole par la communauté et non en tant que benchmark officiel d’OpenAI, se distingue par sa méthodologie claire et ses résultats ont suscité un grand intérêt.

X (@cozyblaze265065)