Geraud Nangue Tasse
University of the Witwatersrand
収録論文 3本 ・ フィジカルAI/ロボット学習
安全オフラインRLLLM評価/道徳推論強化学習ベンチマーク
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 再分配に基づくコスト推定によるスパース安全オフライン強化学習の改善安全オフラインRL2026/8/12
軌道レベルの停止フィードバックのみから密なステップごとのコストを推定し、制約付きオフライン強化学習を改善するフレームワークを提案した。
- CORDA:大規模言語モデルにおける階層的・危害中心の道徳推論のベンチマークLLM評価/道徳推論2026/8/8
道徳原則が衝突する状況での優先順位付け能力を評価するベンチマークCORDAを提案し、10の指示チューニング済みLLMが直接的な危害回避を優先する傾向などを明らかにした。
- RobocupGym: RoboCupにおける挑戦的な連続制御ベンチマーク強化学習ベンチマーク2024/7/1
RoboCup 3Dサッカーシミュレーションを基にした強化学習環境を構築し、Naoロボットの連続制御タスクをStable Baselines 3と統合して提供する。