强化学习
| トピック | 返信 | 表示 | アクティビティ | |
|---|---|---|---|---|
| MITがVPOを提案:ベクトル化報酬でスカラー値に代わり、LLMのテスト時検索における多様性を維持 |
|
0 | 18 | 2026 年 5 月 23 日 |
| 3つの機関からなる研究チームが、最適制御と最適輸送を線形計画問題として統合する新しい生成モデリングフレームワーク「VDT」を提案。これにより計算経路が簡素化され、推論速度も向上する |
|
0 | 11 | 2026 年 5 月 22 日 |
| 元DeepMind副社長のナンド・デ・フレイタス氏:純粋な模倣学習だけで報酬関数を設計せずに報酬最大化行動が生じる |
|
0 | 8 | 2026 年 5 月 22 日 |
| アリババ、クローズドソースモデル『Qwen3.7-Max』を公開 強化学習向け計算リソースへの投資を拡大 |
|
0 | 29 | 2026 年 5 月 21 日 |
| 2人のエンジニアがOpenAIのゴブリン問題を再現、訓練コストはわずか49セント |
|
0 | 10 | 2026 年 5 月 21 日 |