HRM-Text es de código abierto; el preentrenamiento de un modelo recursivo con 1 mil millón de parámetros cuesta solo unos $1,500.

Sapient Intelligence (Singapur) y sus colaboradores del Instituto Tecnológico de Massachusetts publicaron el 20 de mayo el artículo sobre HRM-Text, liberando simultáneamente en GitHub y HuggingFace los pesos del modelo y el marco de entrenamiento completo. HRM-Text se basa en la arquitectura de “Modelo de Razonamiento Jerárquico” (HRM), reemplazando la propagación hacia adelante única típica de los Transformers por un diseño recursivo de dos escalas temporales: los módulos de nivel superior se encargan de la planificación abstracta lenta, mientras que los módulos de nivel inferior gestionan cálculos rápidos y detallados; ambos realizan una recursión anidada en un espacio latente continuo antes de generar la salida, logrando así una profundidad computacional casi ilimitada con un número fijo de parámetros. La versión XL, con 1 mil millón de parámetros, fue entrenada durante unas 46 horas con aproximadamente 40 mil millones de tokens efectivos (usando dos nodos con 16 GPUs H100 cada uno, a un coste de unos 1.472 dólares), alcanzando resultados de 60,7 % en MMLU, 84,5 % en GSM8K, 81,9 % en ARC-Challenge y 56,2 % en MATH. Por su parte, la variante L (TRM), con 0,6 mil millones de parámetros, se entrenó por unos 800 dólares y supera en varios benchmarks a modelos de 3 mil millones de parámetros entrenados con Transformers estándar.

En cuanto a los datos de entrenamiento, HRM-Text utiliza apenas unos 40 mil millones de tokens estructurados, cantidad entre 1/100 y 1/1000 respecto a los volúmenes habituales de preentrenamiento (que oscilan entre 4 y 36 billones de tokens). Esto supone un ahorro de entre 130 y 600 veces en cómputo, y de entre 150 y 900 veces en volumen de datos. El código abierto incluye herramientas para extracción de datos, empaquetado de secuencias mediante PrefixLM, entrenamiento distribuido con PyTorch FSDP2, el kernel FlashAttention 3 y utilidades para convertir checkpoints; actualmente solo es compatible con GPUs de arquitectura Hopper (H100/H800). Cabe señalar que los pesos disponibles corresponden únicamente a la fase de preentrenamiento, sin ajustes posteriores mediante fine‑tuning por instrucciones o RLHF, limitándose a la generación de texto a partir de un prefijo; una vez cuantizada a int4, el tamaño del modelo se reduce a unos 0,6 GiB, permitiendo su ejecución local. Los desarrolladores presentan esta iniciativa como una demostración práctica de la “democratización del preentrenamiento de modelos base”: hasta ahora, el preentrenamiento desde cero quedaba fuera del alcance de la mayoría debido a los altos costes computacionales, algo reservado exclusivamente a los laboratorios más importantes.

GitHub | HuggingFace | PRNewswire