Pablo Moreno-Muñoz et Gergely Neu (ICREA), chercheurs à l’Université Pompeu Fabra (UPF), en collaboration avec Adrian Müller de l’École polytechnique fédérale de Zurich (ETH Zürich), ont publié le 21 mai sur arXiv (arXiv:2605.22507) un nouvel cadre de modélisation générative appelé « Transport piloté par la valeur » (Value-Driven Transport, VDT). Ce cadre modélise les problèmes de transport comme des problèmes de contrôle stochastique en temps discret, puis les reformule sous forme de programmation linéaire (PL). Les variables duales de cette PL correspondent précisément à la fonction de valeur optimale du problème de contrôle ; cette dernière encode directement la stratégie de contrôle optimale. Ainsi, ce cadre unifie le contrôle optimal, l’apprentissage par renforcement (AR), le transport optimal et l’optimisation stochastique primal-duale au sein d’un même cadre théorique. Grâce à cette structure de PL, les chercheurs ont développé un algorithme primal-duale ne nécessitant aucune simulation, permettant d’approximer la fonction de valeur optimale puis d’en extraire la stratégie de contrôle VDT.
Comparé aux modèles dominants actuels tels que le flow matching, les modèles de diffusion et le pont de Schrödinger, les trajectoires de transport générées par les stratégies VDT sont plus proches de lignes droites, se simulent rapidement et de manière robuste, sans avoir besoin de paramétrer directement les termes de dérive du contrôle. Ce cadre autorise également des extensions identiques à celles des modèles de diffusion et de flow matching, comme la génération conditionnelle ou le guidage sans classifieur. Dans une publication sur X, Gergely Neu a commenté : « Peut-être qu’un jour nous n’aurons plus besoin de concevoir manuellement les fonctions de récompense », soulignant ainsi les implications plus larges de ce cadre pour la conception des fonctions de récompense en apprentissage par renforcement. Le papier décrit les résultats expérimentaux illustrés par des schémas ; le code n’est pas encore disponible publiquement.