Shenzhen, en collaboration avec le cluster Huawei Ascend 910C, termine le post-entraînement complet des 1,6 billion de paramètres de DeepSeek-V4-Pro, une percée pour les capacités de calcul nationales dans l'entraînement

L’équipe du Hetao College de Shenzhen, en collaboration avec l’Institut de technologie de Harbin (Shenzhen), l’Institut de recherche sur les mégadonnées de Shenzhen et l’équipe de Huawei, a récemment annoncé avoir achevé le post-entraînement complet du grand modèle DeepSeek-V4-Pro comportant 1,6 billion de paramètres, en s’appuyant sur un cluster de mille cartes équipé des puces Huawei Ascend 910C (plateforme de calcul IA de Shenzhen Smart City). L’ensemble de l’entraînement a duré plus de 1500 étapes, sans aucune interruption ni erreur. Selon les équipes participantes, il s’agit de la première fois qu’une institution tierce dans le monde réalise une exploration d’entraînement d’un modèle de cette envergure paramétrique sur une plateforme de calcul nationale, ce qui confirme que les puces IA chinoises peuvent soutenir l’entraînement de modèles super-dimensionnés de classe mondiale. En termes d’indicateurs clés, le taux d’utilisation de la puissance de calcul (MFU) a dépassé les 30 %, et l’efficacité des opérateurs d’entraînement de base a augmenté de 14 %, atteignant des normes de fonctionnement industrielles.

Pendant longtemps, la puissance de calcul nationale s’est principalement chargée des tâches d’inférence et de micro-ajustement dans le domaine des grands modèles. Or, l’ampleur de la puissance de calcul nécessaire au post-entraînement complet et le volume des communications entre puces dépassent de loin ceux du scénario d’inférence – en particulier pour DeepSeek-V4-Pro, qui utilise une architecture de mélange d’experts (MoE). Volume des communications entre experts lors du post-entraînement est environ des dizaines de fois supérieur à celui d’un modèle ordinaire. Pour ce faire, l’équipe a résolu trois problèmes fondamentaux : 1) concevoir un plan de répartition distribué précis pour allouer les 1,6 billion de paramètres comme des “pièces de puzzle” au cluster de mille cartes ; 2) optimiser la stratégie de planification MoE pour éliminer le déséquilibre de charge entre experts et les goulots d’étranglement de communication entre cartes ; 3) construire un système de surveillance entièrement visualisable et contrôlable pour garantir le fonctionnement stable de l’entraînement sur un grand nombre d’étapes. Comparé à l’utilisation de modèles prêts à l’emploi pour l’inférence, le post-entraînement complet exige que le modèle “s’auto-réfléchisse et ajuste dynamiquement les paramètres”, ce qui multiplie soudainement la charge de calcul et de communication. Cette percée s’accompagne également d’une mission de formation des talents : 42 étudiants ont participé en profondeur à l’ensemble du projet pratique.

SCMP | Publication de Shenzhen