WeLinux
后训练
话题
回复
浏览量
活动
MIT 提出 VPO:向量化奖励替代标量,让 LLM 测试时搜索保持多样性
常规
强化学习
,
ai研究
,
llm
,
后训练
,
推理
0
14
2026 年5 月 23 日