Yongjie Bai
収録論文 7本 ・ フィジカルAI/ロボット学習
VLA身体化エージェント/OSマニピュレーションEmbodied AI
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Bridge-WA: ロボット行動のための世界の変化箇所と変化方法の予測VLA2026/7/1
ロボット操作のための軽量な世界行動モデルを提案し、将来の変化を教師モデルから蒸留した3つの事前知識で行動生成を条件付け、外乱に強い汎化を実現した。
- PhyAgentOS: 認知計画と物理実行を分離した自己進化型身体化エージェントOS身体化エージェント/OS2026/7/1
身体化エージェント向けに、セッション単位のスケジューリング、検証、記憶、安全をOSサービスとして提供する実行基盤を提案。状態をファイルとして扱うことで認知と物理実行を分離し、検証済み結果を知識として蓄積する自己進化ループを実現した。
- RoVLA: ロバストな視覚言語行動モデルのための多重整合性制約VLA2026/5/1
視覚言語行動モデルのロバスト性を高めるため、指示意味・軌道進化・観測摂動の3つの変換に対する整合性制約を導入したRoVLAを提案。
- SkiP: ロボット操作の効率化のためのスキップと精密化のタイミングマニピュレーション2026/5/1
模倣学習のポリシーが毎ステップ予測するのをやめ、動作が単調な区間はスキップし、接触や把持などの重要区間だけを高解像度で予測する新しい手法を提案。動作の複雑さを自動検出して区間を分割し、実行ステップを15〜40%削減しつつ成功率を維持・向上させる。
- RoVer: 視覚-言語-行動モデルのためのテスト時検証器としてのロボット報酬モデルVLA2025/10/1
VLAモデルの推論時にロボット過程報酬モデルを検証器として使い、候補行動を生成・評価・選択することで、追加学習なしに性能を向上させるフレームワークを提案。
- 見て行動することを学ぶ:ロボットマニピュレーションのためのタスク認識型仮想視点探索VLA2025/8/1
再構成したシーンからタスクに適した仮想カメラ視点を選んで観測を再描画し、タスク特化型のMixture-of-Experts視覚エンコーダと組み合わせることで、遮蔽や視覚的分布シフトに頑健な多タスクロボット操作を実現した。
- サイバー空間と物理世界の融合:Embodied AIに関する包括的サーベイEmbodied AI2024/7/1
Embodied AIの最新動向を、ロボット・シミュレータ、知覚・相互作用・エージェント・sim-to-realの4研究領域、マルチモーダル大規模モデルの活用まで網羅的に整理したサーベイ論文。