奖励学习
| Tema | Respuestas | Vistas | Actividad | |
|---|---|---|---|---|
| Nando de Freitas, ex vicepresidente de DeepMind: el aprendizaje por imitación puro puede generar comportamientos que maximicen las recompensas, sin necesidad de diseñar funciones de recompensa |
|
0 | 7 | 22 Mayo 2026 |