奖励学习
| Tópico | Respostas | Vistas | Atividade | |
|---|---|---|---|---|
| Nando de Freitas, ex-vicepresidente da DeepMind: o aprendizado por imitação puro pode gerar comportamentos que maximizam recompensas, sem necessidade de definir funções de recompensa |
|
0 | 7 | 22 Maio , 2026 |