Minho Park
収録論文 5本 ・ フィジカルAI/ロボット学習
VLAVLA/操作強化学習歩行
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ロボットのように見る:ロボット中心のポイントマップによる視覚言語行動モデルVLA2026/7/1
視覚言語行動モデル(VLA)がカメラ視点とロボット座標系のずれで性能を落とす問題を、ロボット座標系の3D座標を画素に格納したポイントマップを入力に用いることで解決し、既存VLAに最小限の変更で統合できることを示した。
- 3D HAMSTER: 3D軌道ガイダンスによる階層型視覚言語行動モデルの計画と制御の橋渡しVLA/操作2026/6/1
階層型VLAモデルにおいて、プランナーが直接3D軌道を予測できるようにし、2Dガイダンスの幾何学的歪み問題を解決した。実世界操作で優れた性能を示した。
- FlashSAC: 高次元ロボット制御のための高速かつ安定なオフポリシー強化学習強化学習2026/4/1
オフポリシー強化学習の不安定性を解決するため、勾配更新を削減しつつモデル規模とデータ処理量を増やし、ノルム制約で安定化したFlashSACを提案。60以上のタスクでPPO等を上回る性能と効率を示した。
- ACG: フローベース視覚言語行動モデルのための行動一貫性ガイダンスVLA2025/10/1
模倣学習で訓練されたVLAモデルの行動の一貫性を、訓練不要のテスト時ガイダンスで改善し、細かい操作タスクの成功率を高める手法を提案。
- PHUMA: 物理的に信頼できるヒューマノイド歩行データセット歩行2025/10/1
物理的な不自然さを除去する2段階パイプラインでモーションキャプチャとネット動画を統合し、73時間のヒューマノイド歩行データセットを構築、実機Unitree G1へのゼロショット転移を実現した。