Jingkuan Song
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WSA$_1$: 3D中心の世界・空間・行動モデルによる汎用ロボット制御ロボット基盤モデル2026/7/1
ロボット基盤モデルに3D世界の物理ダイナミクスと行動の因果関係を学習させる新しいパラダイムを提案し、少ない実データで高い汎化性能を実現した。
- 言語基盤の分離型行動表現によるロボット操作マニピュレーション2026/3/1
自然言語を意味的ブリッジとして用い、翻訳・回転・グリッパー制御という3つの解釈可能な行動プリミティブを導入し、対照学習と模倣学習を組み合わせて汎化性能を高めるロボット操作フレームワークを提案した。
- 多数派を超えて:ロボットマニピュレーションのためのロングテール模倣学習マニピュレーション2026/2/1
訓練データが一部のタスクに偏るロングテール問題に対し、データ豊富なタスクからデータ希少なタスクへ知識を転移するApproaching-Phase Augmentationを提案し、ロボット操作の性能を改善した。
- シミュレーションと人間の協調学習によるデータ効率的で汎化可能なロボットマニピュレーションマニピュレーション2026/1/1
シミュレーションのロボット動作と実世界の人間観察を同時に活用する協調学習フレームワークSimHumを提案し、少ない実データで汎化性能の高いマニピュレーションを実現した。
- MiVLA: 人間とロボットの相互模倣事前学習による汎化可能な視覚-言語-行動モデルVLA2025/12/1
人間の手とロボットアームの動作類似性を利用し、人間とロボットの行動空間を双方向に整列させる相互模倣事前学習でVLAを訓練し、汎化性能を向上させた研究。
- 効率的な視覚-言語-行動モデルのサーベイVLA2025/10/1
視覚-言語-行動モデル(VLA)の効率化に関する初の包括的サーベイであり、モデル設計・学習・データ収集の3つの柱で既存研究を整理し、課題と今後の方向性を示す。
- 汎用ロボット方策におけるショートカット学習:データセットの多様性と断片化の役割VLA2025/8/1
大規模ロボットデータセットで訓練された汎用方策が訓練分布外で汎化しにくい原因を分析し、タスク無関係な特徴に依存する「ショートカット学習」が主因であること、サブデータセットの多様性不足と分布の断片化がそれを助長することを示した。さらにデータ拡張でショートカット学習を軽減し汎化性能を改善できることを実証した。
- InSpire: 内在的空間推論を備えた視覚-言語-行動モデルVLA2025/5/1
VLAモデルに「物体はロボットから見てどの方向か」という空間推論を組み込むことで、タスク無関係な視覚特徴への誤相関を抑え、汎化性能を高める手法を提案。
- ロボット基盤モデルのためのポリシー対比デコーディングVLA2025/5/1
ロボット基盤モデルが学習する偽の相関を、物体マスク画像との行動確率分布の対比により訓練なしで補正し、汎化性能を向上させる手法を提案。