Shifeng Bao
Renmin University of China
収録論文 6本 ・ フィジカルAI/ロボット学習
マニピュレーションVLA/世界モデルVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ChunkTrust: 行動専門家の証拠に基づくロボット政策の実行ホライズン適応マニピュレーション2026/9/30
ロボット基盤政策が予測する行動チャンクの実行長を、固定値ではなく行動専門家の証拠から推論する潜在変数として扱い、訓練不要のセレクタと軽量アダプタで適応的に決定する手法を提案。
- RoboHarn-Evo: 階層的物理知識を進化させ自己改善するロボットマニピュレーションマニピュレーション2026/9/29
物理的な試行錯誤からタスク知識と行動知識を階層的に蓄積・修正し、基盤モデルを更新せずにロボット操作の成功率を高めるフレームワークを提案。
- 相互作用中心モデリングによる2本指グリッパ操作の統一的クロスドメイン表現の実現マニピュレーション2026/9/25
2本指グリッパの共通構造をパラメータ化した抽象化で捉え、VLMとSAMで相互作用 triplet を推定し、Flow-Matching Transformerで7自由度動作を生成することで、異なるロボット間や視点間でのゼロショットsim-to-real転移を可能にした模倣学習手法。
- JEPA-WAM: 共同埋め込み世界モデリングによる視覚-言語-行動ポリシーの学習VLA/世界モデル2026/8/1
事前学習済みV-JEPA空間に基づく潜在世界モデルを構築し、遷移予測と行動生成を共有予測器で結合することで、効率的かつ高精度なロボット制御を実現した。
- 密な身体化チェーン・オブ・ソート監視による視覚言語行動モデルの訓練VLA2026/6/1
ロボット間の転移を改善するため、視覚言語モデルに密な身体化チェーン・オブ・ソート(ECoT)監視を導入し、推論時にはECoT生成をスキップできるデュアルストリームアーキテクチャのVLAモデルZR-0を提案した。
- アクション草案と検証:視覚言語行動モデルのための自己検証フレームワークVLA2026/3/1
拡散アクション専門家が複数のアクション候補を生成し、VLMが一回のフォワードパスでスコアリングして最適なものを選択する自己検証フレームワークを提案。シミュレーションと実世界で成功率を向上させた。