Jing Liu
FiveAges
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Vorch-Omni: 視覚と聴覚のマルチタスク統合オーケストレーション音声映像生成2026/8/6
音声と映像の生成・編集・参照合成を単一モデルで統一的に扱うマルチタスクフレームワークを提案し、条件付けマスクとタスク識別子により多様な入出力構成を柔軟に処理する。
- XEWorld:行動条件付きワールドモデルは未知のロボット形態に汎化できるか?ワールドモデル2026/8/1
ロボット操作のための行動条件付きワールドモデルが、未見のロボット形態に対して物理ダイナミクスを捉えているかを検証するため、クロスエンボディメントテストベッドXEWorldを導入し、既存モデルの限界を分析した。
- AtlasVLA: 視覚言語行動モデルのための持続的な世界・自我状態モデリングVLA2026/8/1
単眼カメラのみで長期的なタスクを遂行できるよう、視覚言語行動モデルに持続的な世界状態メモリと自我作業メモリを導入し、空間推論とタスク進行の追跡を可能にした。
- FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いるVLA2026/7/1
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
- ReCoVLA: VLMガイドによる報酬生成で視覚言語行動ポリシーの障害回復を実現VLA/障害回復2026/6/8
事前学習済みのVLAポリシーを凍結し、外部VLMで障害モードと回復段階を推定して報酬を構成することで、シミュレーションでの残差ポリシー訓練と実機へのゼロショット転送を行う障害回復フレームワークを提案した。
- LongSpace: ビデオにおける知覚から想起までの長期的空間記憶の探求空間記憶/ビデオ理解2026/6/4
長期的な空間記憶を評価するベンチマークLongSpace-Benchを導入し、3D構造的手がかりと層認識メモリを用いた空間推論フレームワークLongSpaceを提案した。
- VeriSpace: 視覚言語行動モデルのための空間基盤型行動検証VLA/操作2026/6/1
VLAモデルのテスト時行動選択を改善するため、3D認識の行動検証器を提案し、候補行動の空間的関係と幾何学的妥当性を評価して信頼性を高めた。
- WAM-Nav: 非対称潜在世界行動モデリングによる統合視覚ナビゲーションナビゲーション2026/6/1
視覚ナビゲーションのための潜在世界行動モデルを提案し、行動生成と視覚予測を共同で学習することで、推論効率を保ちつつ先見的な障害物回避を実現した。
- SKIP: 効率的な具現化ワールドモデルのためのスパースキーフレーム補間パラダイムワールドモデル2026/6/1
ロボット操作動画の生成を、タスク関連のキーフレームのみを生成し、残りを補間することで高速化する手法を提案。
- NavWM: 先読み計画のための統合ナビゲーションワールドモデルナビゲーション2026/6/1
ナビゲーションのための統合ワールドモデルを提案し、潜在世界トークンによる幾何・意味理解と、多様な行動予測による閉ループ計画を実現した。
- E-TTS:ロボット操作のための新しい具現化テスト時スケーリングフレームワークマニピュレーション2026/6/1
ロボット操作タスクにおいて、推論と行動の両方を履歴情報を活用して反復的に洗練する、モジュール式でプラグアンドプレイなテスト時スケーリングフレームワークを提案した。
- SurveilNav: ロボットと監視システムの協調による物体目標ナビゲーションナビゲーション2026/6/1
監視カメラとロボットを協調させ、大規模環境での物体探索ナビゲーションを効率化するフレームワークを提案した論文。
- 部分モジュラーマルチエージェントポリシー学習によるオープンマルチエージェントシステムにおけるオンライン分散タスク割り当てマルチエージェント強化学習2026/5/13
本論文は、部分モジュラーなチーム効用を持つマルチエージェント強化学習を用いて、オンライン分散タスク割り当て問題を解決する。カテゴリカルポリシーと整合する新しい連続緩和法(PME)を導入し、SubMAPGという集中学習・分散実行のポリシー勾配法を提案する。
- SpatialVAM: 空間認識型マルチビュービデオ拡散によるデータ効率的なロボットポリシーVLA/操作2026/4/1
3D空間構造と時間変化を同時に捉えるため、空間認識型のマルチビューヒートマップビデオとRGBビデオを生成する初の3Dビデオ行動モデルを提案し、少数のデモで汎用的な操作を実現した。
- FloorPlan-VLN: フロアプラン誘導型視覚言語ナビゲーションの新パラダイムVLA2026/3/1
視覚言語ナビゲーション(VLN)において、フロアプランを大域的な空間事前情報として活用する新しいタスクとデータセットを提案し、簡潔な指示だけでナビゲーションを可能にする手法FP-Navを導入した。
- 形態情報をTransformerに埋め込むクロスロボット方策学習VLA2026/3/1
ロボットの関節構造やトポロジーをTransformerに組み込み、複数の機体にまたがって動作する方策を学習する手法を提案した論文。
- 不確実性を考慮した観測再注入による視覚-言語-行動モデルの強化VLA2026/2/1
VLAモデルの言語層の不確実性が高いときに、観測情報を次層のFFNに再注入する訓練不要のプラグインモジュールを提案し、追加データやモジュールなしで行動生成の精度と信頼性を向上させた。
- BridgeV2W: 身体マスクで動画生成モデルを身体性世界モデルへ橋渡し世界モデル2026/2/1
座標空間の行動をURDFとカメラパラメータから描画した身体マスクに変換し、ControlNet風に動画生成モデルへ注入することで、視点や身体構造に依存しない統一的な身体性世界モデルを実現した。
- UrbanNav: ウェブ規模の人間軌跡から学ぶ言語誘導型都市ナビゲーションナビゲーション2025/12/1
ウェブ上の街歩き動画1500時間以上と300万組の指示・軌跡・ランドマークデータを用い、自由な言語指示に従って実都市を移動する具現化エージェントを訓練するフレームワークを提案した。
- 無線駆動する薄型誘電エラストマーアクチュエータ搭載ソフトロボットソフトロボティクス2025/12/1
薄型誘電エラストマーアクチュエータとオンボード電子回路を統合し、220Vの低電圧で無線駆動する小型ソフトロボットを開発した。
- PIGEON: VLM駆動の関心点選択による物体ナビゲーション物体ナビゲーション2025/11/1
VLMを関心点(PoI)の選択に用いることで、未見屋内環境での物体ナビゲーションを効率的かつ検証可能にし、ゼロショットで最先端性能を達成した研究。
- C-NAV: オープンワールドにおける自己進化型継続的物体ナビゲーションナビゲーション2025/10/1
動的に変化する環境で新たな物体カテゴリのナビゲーションを継続的に学習しつつ、過去の知識を忘れないための二重経路の忘却防止機構と適応的サンプリング戦略を提案した。
- EgoDemoGen: ロボットマニピュレーションにおける視点汎化のための自己中心視点デモ生成マニピュレーション2025/9/1
自己中心視点が変化しても動作する模倣学習ポリシーのため、新視点での観測と行動のペアを生成するフレームワークを提案。軌道変換と条件付き動画生成を組み合わせ、シミュレーションと実機で成功率を大幅に改善した。
- FlexVLN: 多様な視覚言語ナビゲーションタスクへの柔軟な適応VLA2025/3/1
視覚言語ナビゲーションにおいて、教師あり学習ベースの指示追従器とLLMプランナーを階層的に統合し、検証機構とマルチモデル統合機構で幻覚を抑え、未知データセットへの汎化性能を大幅に向上させた。
- COSMO: 選択的記憶の組み合わせによる低コスト視覚言語ナビゲーションVLA2025/3/1
視覚言語ナビゲーション(VLN)において、状態空間モジュールとトランスフォーマーを統合し、選択的状態空間モジュール(RSSとCS3)を導入することで、高性能と低計算コストを両立する新アーキテクチャCOSMOを提案した。
- Planning-Assisted Context-Sensitive Autonomous Shepherding of Dispersed Robotic Swarms in Obstacle-Cluttered Environments2023/1/1