Nianfeng Liu
FiveAges
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- XEWorld:行動条件付きワールドモデルは未知のロボット形態に汎化できるか?ワールドモデル2026/8/1
ロボット操作のための行動条件付きワールドモデルが、未見のロボット形態に対して物理ダイナミクスを捉えているかを検証するため、クロスエンボディメントテストベッドXEWorldを導入し、既存モデルの限界を分析した。
- FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いるVLA2026/7/1
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
- E-TTS:ロボット操作のための新しい具現化テスト時スケーリングフレームワークマニピュレーション2026/6/1
ロボット操作タスクにおいて、推論と行動の両方を履歴情報を活用して反復的に洗練する、モジュール式でプラグアンドプレイなテスト時スケーリングフレームワークを提案した。
- WAM-Nav: 非対称潜在世界行動モデリングによる統合視覚ナビゲーションナビゲーション2026/6/1
視覚ナビゲーションのための潜在世界行動モデルを提案し、行動生成と視覚予測を共同で学習することで、推論効率を保ちつつ先見的な障害物回避を実現した。
- SKIP: 効率的な具現化ワールドモデルのためのスパースキーフレーム補間パラダイムワールドモデル2026/6/1
ロボット操作動画の生成を、タスク関連のキーフレームのみを生成し、残りを補間することで高速化する手法を提案。
- SpatialVAM: 空間認識型マルチビュービデオ拡散によるデータ効率的なロボットポリシーVLA/操作2026/4/1
3D空間構造と時間変化を同時に捉えるため、空間認識型のマルチビューヒートマップビデオとRGBビデオを生成する初の3Dビデオ行動モデルを提案し、少数のデモで汎用的な操作を実現した。
- FloorPlan-VLN: フロアプラン誘導型視覚言語ナビゲーションの新パラダイムVLA2026/3/1
視覚言語ナビゲーション(VLN)において、フロアプランを大域的な空間事前情報として活用する新しいタスクとデータセットを提案し、簡潔な指示だけでナビゲーションを可能にする手法FP-Navを導入した。
- BridgeV2W: 身体マスクで動画生成モデルを身体性世界モデルへ橋渡し世界モデル2026/2/1
座標空間の行動をURDFとカメラパラメータから描画した身体マスクに変換し、ControlNet風に動画生成モデルへ注入することで、視点や身体構造に依存しない統一的な身体性世界モデルを実現した。
- 不確実性を考慮した観測再注入による視覚-言語-行動モデルの強化VLA2026/2/1
VLAモデルの言語層の不確実性が高いときに、観測情報を次層のFFNに再注入する訓練不要のプラグインモジュールを提案し、追加データやモジュールなしで行動生成の精度と信頼性を向上させた。
- EgoDemoGen: ロボットマニピュレーションにおける視点汎化のための自己中心視点デモ生成マニピュレーション2025/9/1
自己中心視点が変化しても動作する模倣学習ポリシーのため、新視点での観測と行動のペアを生成するフレームワークを提案。軌道変換と条件付き動画生成を組み合わせ、シミュレーションと実機で成功率を大幅に改善した。