Moo Jin Kim
収録論文 11本 ・ フィジカルAI/ロボット学習
VLAマニピュレーションロボット評価/ベンチマーク
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Cosmos Policy: 視覚運動制御と計画のための動画モデル微調整VLA2026/1/1
大規模事前学習済み動画モデルを、アーキテクチャ変更なしの一段階の追加学習だけでロボット方策に変換し、行動・将来画像・価値を潜在フレームとして生成して計画も可能にした手法。
- Openpi Comet:2025 BEHAVIORチャレンジ競技解法マニピュレーション2025/12/1
2025 BEHAVIORチャレンジに向けた解法を提案し、事前学習と事後学習のスケーリング効果を明らかにして、検証Qスコア0.345を達成した。
- RoboArena:汎用ロボットポリシーの分散型実世界評価ロボット評価/ベンチマーク2025/6/1
評価者ネットワークが自由にタスクと環境を選び、ペア比較の二重盲検評価を集約することで、汎用ロボットポリシーをスケーラブルかつ公平にランキングする手法を提案し、7機関・600以上の実機評価で有効性を示した。
- CoT-VLA:視覚的思考連鎖推論を用いた視覚-言語-行動モデルVLA2025/3/1
将来の画像フレームを視覚的目標として自己回帰的に予測してから行動系列を生成することで、視覚的思考連鎖推論をVLAに組み込み、実世界タスクで17%の性能向上を達成した。
- 視覚言語行動モデルの微調整:速度と成功率の最適化VLA2025/2/1
VLAモデルの微調整戦略を検討し、並列デコードやアクションチャンキングを組み合わせた最適化レシピを提案。LIBEROベンチマークで成功率を76.5%から97.1%に向上させ、推論速度も26倍高速化した。
- OpenVLA: オープンソースの視覚-言語-行動モデルVLA2024/6/1
97万件の実機ロボット実演で学習した7BパラメータのオープンソースVLAモデルを提案し、閉源モデルRT-2-Xを上回る汎用マニピュレーション性能と効率的なファインチューニングを実現した。
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- BridgeData V2: A Dataset for Robot Learning at Scale2023/8/1
- Giving Robots a Hand: Learning Generalizable Manipulation with Eye-in-Hand Human Video Demonstrations2023/7/1
- NeRF in the Palm of Your Hand: Corrective Augmentation for Robotics via Novel-View Synthesis2023/1/1
- Vision-Based Manipulators Need to Also See from Their Hands2022/3/1