Yunfan Lou
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Token-World: 視覚言語モデルのトークン空間におけるロボット操作のための世界モデリングVLA2026/9/30
VLAモデルの視覚トークンを圧縮した状態空間で未来のダイナミクスを予測する世界モデルを提案し、操作ベンチマークで予測精度と方策整合性を向上させた。
- RoboFL: 世界行動モデルのための連合エキスパートアセンブリVLA/連合学習2026/9/28
各クライアントが訓練したLoRAアダプタをサーバー側MoEのエキスパートとして組み込み、ルーティングとエキスパートを協調学習する連合学習フレームワークを提案。実機Frankaで集中学習を12.23%上回り、通信量を最大86.81%削減した。
- DynamicWAM: 動的操作におけるワールドアクションモデルのためのデュアルパス動作条件付け操作2026/8/1
動的な物体操作のためのコンパクトなワールドアクションモデルを提案し、履歴フロー条件付けと運動学的記述子の注入により動作認識と応答性を向上させた。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- Efficient-WAM: 低コストな未来想像を備えた10億パラメータの世界行動モデルVLA2026/6/1
未来の視覚予測を圧縮し、推論コストを大幅に削減した世界行動モデルを提案。実機で約100msの低遅延を実現しつつ、制御性能を維持する。
- Dream-Tac: 接触を伴うロボット操作のための統合触覚世界行動モデル触覚/操作2026/6/1
視覚と触覚を統合した世界行動モデルを提案し、接触を伴う操作タスクでの行動予測精度を向上させた。
- FORCE: 価値校正ウォームアップと自己蒸留による効率的なVLA強化学習ファインチューニングVLA/強化学習2026/6/1
VLAモデルの強化学習ファインチューニングを安定化・高速化する3段階フレームワークFORCEを提案。価値校正ウォームアップと自己蒸留でサンプル効率を改善し、シミュレーションと実機で成功率を大幅に向上させた。
- HCSG: 視覚言語ナビゲーションのための人間中心の意味・幾何推論ナビゲーション2026/5/1
動的な人間環境での視覚言語ナビゲーションにおいて、人間の行動意図を理解するための人間中心フレームワークを提案し、幾何予測と意味解釈を統合して社会的に適切なナビゲーションを実現する。
- マスク世界モデル:ロバストなロボット政策学習のための重要要素予測VLA2026/4/1
動画生成事前学習に基づく世界モデルがロボット政策学習に有望だが、RGB予測は背景や照明などの無関係な要素に過適合しがち。本論文では、ピクセルではなくセマンティックマスクの進化を予測するマスク世界モデル(MWM)を提案し、幾何学的情報ボトルネックにより物理ダイナミクスと接触関係を捉えつつ視覚ノイズを除去。拡散ベースの政策ヘッドと統合し、LIBEROやRLBenchでSOTAを達成し、実世界実験でもロバスト性を示した。
- ContactExplorer: 接触カバレッジ誘導による汎用巧みなマニピュレーションの探索マニピュレーション2026/3/1
物体表面と手指の接触パターンをカウントベースで探索し、未探索の接触領域へ誘導する強化学習手法を提案し、巧みなマニピュレーションのサンプル効率と成功率を向上させた。