Yutong Bai
収録論文 5本 ・ フィジカルAI/ロボット学習
触覚/操作スキル獲得世界モデル/計画/制御動画予測VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- T-Rex: 触覚反応型巧みな操作触覚/操作2026/6/1
触覚信号に動的に反応する操作を実現するため、大規模な触覚データセットと可変レートのMixture-of-Transformersアーキテクチャを導入し、12の操作タスクで成功率を大幅に向上させた。
- 遊び心のあるエージェント型ロボット学習スキル獲得2026/6/1
ロボットエージェントが指示なしで自己主導の「遊び」を通じてスキルを獲得し、後続タスクに活用する手法を提案。コード生成エージェントチーム(RATs)が探索タスクを生成・実行・検証・修正し、成功体験をコードスキルライブラリに蓄積する。
- 身体化世界モデルの高次化による計画と制御の実現世界モデル/計画/制御2026/4/28
高次元の関節動作空間を直接探索する代わりに、高レベル行動を低レベル関節動作列に変換する軽量ポリシーを訓練し、凍結した世界モデルと組み合わせて高レベル行動から未来観測を予測する「持ち上げられた世界モデル」を提案。人間型エージェントで2Dウェイポイントを高レベル行動とし、低レベル探索より3.8倍精度が向上。
- 全身姿勢に条件付けられた一人称視点動画予測動画予測2025/6/1
過去の動画と3D身体姿勢の動作から、一人称視点の未来動画を自己回帰拡散トランスフォーマーで予測するモデルPEVAを提案し、大規模データセットNymeriaで学習・評価した。
- LLARVA: 視覚-行動インストラクションチューニングによるロボット学習の強化VLA2024/6/1
構造化プロンプトで多様なロボットタスクを統合するインストラクションチューニング手法と、中間2D表現「ビジュアルトレース」の予測により視覚と行動を整合させ、RLBenchと実機Frankaで高い汎化性能を示した研究。