Pablo Moreno-Muñoz y Gergely Neu (ICREA), investigadores de la Universidad Pompeu Fabra (UPF), junto con Adrian Müller del Instituto Federal de Tecnología de Zúrich (ETH Zürich), publicaron el 21 de mayo en arXiv (arXiv:2605.22507) un nuevo marco de modelado generativo denominado «Transporte Impulsado por Valor» (Value-Driven Transport, VDT). Este marco formula los problemas de transporte como problemas de control estocástico en tiempo discreto y los reformula como un problema de programación lineal (PL): las variables duales de dicha PL coinciden exactamente con la función de valor óptima del problema de control, la cual codifica directamente la estrategia de control óptima. De este modo, se unifican el control óptimo, el aprendizaje por refuerzo (AR), el transporte óptimo y la optimización estocástica primal-dual bajo un mismo marco teórico. Basándose en esta estructura de PL, los investigadores desarrollaron un algoritmo primal-dual sin necesidad de simulaciones, que permite aproximar la función de valor óptima y extraer a partir de ella las estrategias de control VDT.
En comparación con los modelos de flujo, los modelos de difusión y el puente de Schrödinger, que son populares actualmente, las trayectorias de transporte generadas mediante estrategias VDT son más lineales, se pueden simular de forma rápida y robusta, y no requieren parametrizar directamente los términos de deriva del control. Además, admiten extensiones idénticas a las de los modelos de difusión y de flujo, como la generación condicionada y la guía sin clasificador. Al presentar este trabajo en X, Gergely Neu comentó: «Quizá algún día ya no necesitemos diseñar recompensas de forma ingenieril», lo que sugiere las amplias implicaciones de este marco para el diseño de recompensas en el ámbito del aprendizaje por refuerzo. El artículo incluye ilustraciones con los resultados experimentales; por el momento, el código fuente no se ha hecho público.