奖励学习
| Thema | Antworten | Aufrufe | Aktivität | |
|---|---|---|---|---|
| Nando de Freitas, ehemaliger Vizepräsident bei DeepMind: Reines Imitationslernen kann zu verhaltensweisen führen, die die Belohnung maximieren – ohne dass eine Belohnungsfunktion erforderlich ist |
|
0 | 7 | 22. Mai 2026 |