Ping-Chun Hsieh
収録論文 7本 ・ フィジカルAI/ロボット学習
模倣学習強化学習/セキュリティ強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 劣ったデモからの言語批評模倣学習模倣学習2026/7/1
不完全なデモから学習する際に、スカラー信号ではなく自然言語による批評を監督信号として用いる新しい模倣学習フレームワークを提案し、行動クローニングと拡散ポリシーに適用して性能を向上させた。
- Plan2Cleanse: モンテカルロ計画による深層強化学習のテスト時バックドア防御強化学習/セキュリティ2026/5/10
強化学習モデルに埋め込まれたバックドア攻撃を、再学習なしでテスト時に検出・無害化するフレームワークを提案。モンテカルロ木探索を計画問題として適用し、ブラックボックスでトリガー探索と防御的再計画を行う。
- ベルマン整合性とハイブリッド批評家によるクロスドメイン方策最適化強化学習2026/3/12
強化学習において、ソースドメインのデータを活用してターゲットドメインの学習を効率化するクロスドメイン転移を扱い、ドメイン間の状態・行動空間の違いと転移の負の影響を同時に解決する手法QAvatarを提案した。
- 半教師ありクロスドメイン模倣学習模倣学習2026/2/1
少数の目標ドメインの専門家デモとラベルなしの不完全軌道のみを用いて、ドメイン間の状態行動マッピングを学習する半教師ありクロスドメイン模倣学習手法を提案し、MuJoCoとRobosuiteで安定かつデータ効率的な性能向上を示した。
- 行動量子化と軌道最適化による人間らしい強化学習エージェントの学習強化学習2025/11/1
人間のデモをベクトル量子化VAEでマクロ行動に蒸留し、軌道最適化として人間らしさを定式化することで、報酬最大化と人間類似行動を両立する強化学習フレームワークMAQを提案した。
- 行動制約付き模倣学習模倣学習2025/8/1
行動制約のある模倣者が、より広い行動空間を持つ専門家から学ぶ新設定ACILを提案し、DTW距離に基づく軌道アライメントで専門家の軌道に沿った代理データを生成するDTWILを開発した。
- 拡散報酬による敵対的模倣学習模倣学習2024/5/1
拡散モデルをGAILに統合し、より安定で滑らかな報酬を生成する模倣学習手法DRAILを提案。ナビゲーション・マニピュレーション・歩行で有効性を検証した。