Pesquisadores como Ryan Bahlous-Boldi, doutorando no MIT CSAIL, publicaram em 21 de maio um artigo no arXiv (arXiv:2605.22817) no qual apresentam o algoritmo de Otimização de Políticas Vetoriais (Vector Policy Optimization, VPO). As abordagens atuais de treinamento reforçado para LLMs — como o GRPO — comprimem previamente todos os sinais de recompensa em um único escalar, o que faz com que o valor de entropia da distribuição de saídas do modelo seja baixo e a diversidade de soluções geradas seja insuficiente; por isso, seu desempenho fica limitado quando é preciso buscar a melhor resposta entre múltiplas opções candidatas durante a inferência (métricas pass@k ou best-of-k). A ideia central do VPO é que, na prática, as recompensas já possuem uma estrutura vetorial: por exemplo, no caso da geração de código, cada teste tem seu próprio resultado de aprovação ou reprovação, assim como existem diversos modelos de preferências dos usuários. Ao realizar o treinamento conjunto sob diferentes distribuições de pesos de recompensa por meio da conversão aleatória em escalares, o modelo consegue gerar respostas especializadas em distintas regiões do espaço de recompensas, mantendo a qualidade das produções e aumentando sua diversidade. O VPO pode substituir diretamente o estimador de vantagem do GRPO, sem elevar significativamente os custos operacionais. No LiveCodeBench, o VPO superou o GRPO em relação à métrica pass@k e também manteve maior diversidade no espaço de recompensas em diversos domínios de tarefas. Soheil Feizi, professor na Universidade de Maryland, comentou ao compartilhar o artigo que a perspectiva de recompensas escalares é “intrinsecamente perdedora” e que o VPO, juntamente com métodos como o GEPA, aponta para a necessidade de redefinir o conceito de “recompensa” como um objeto de feedback estruturado.
Related topics
| Tópico | Respostas | Vistas | Atividade | |
|---|---|---|---|---|
| 三机构团队提出生成建模新框架 VDT,将最优控制与最优传输统一为线性规划,路径更直、推理更快 | 0 | 9 | 22 Maio , 2026 | |
| GRAM:将递归推理概率化,10M 参数 ARC-AGI-1 达 52% | 0 | 15 | 20 Maio , 2026 | |
| 前 DeepMind 副总裁 Nando de Freitas:纯模仿学习可涌现奖励最大化行为,无需设计奖励函数 | 0 | 7 | 22 Maio , 2026 | |
| 斯坦福研究发现:AI Agent 过劳后开始援引马克思主义话语 | 0 | 12 | 19 Maio , 2026 | |
| DeepSeek-V4-Pro 限时折扣 5 月 31 日到期,官方宣布原价四分之一将成永久定价 | 0 | 7 | 22 Maio , 2026 |