Junwei Liang
収録論文 33本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TemporalFlow-VLA: 物理的に基づいた実行履歴を学習する長期的ロボット操作VLA/操作2026/8/27
視覚言語行動モデルに物理的な時間的監督を導入し、多段階操作の実行履歴をコンパクトに学習する手法を提案。LIBEROやRoboTwinで高い成功率を達成し、長期的な操作で優位性を示した。
- Zero-WAM: 人間のビデオからの文脈内世界行動モデリングによるオープンエンドなタスク汎化VLA2026/8/26
人間のビデオを文脈内の指示として用いることで、訓練時に見たことのない操作タスクをゼロショットで実行できるビデオ行動モデルを提案した。
- 多視点統一カメラ場:RGBのみの多カメラVLAポリシーのための幾何学的形状の行動指向表現VLA2026/8/1
多カメラ観測を利用するVLAモデルにおいて、視点間で一貫した行動指向の潜在場を形成する訓練時のみのフレームワークを提案し、深度復元と視点間対応を改善して操作成功率を大幅に向上させた。
- 遅い推論器から速いプランナーへのトークン単位潜在ストリーミングによる動的視覚言語ナビゲーションナビゲーション2026/7/1
動的な人間中心環境での視覚言語ナビゲーションにおいて、遅いVLMの推論中に中間隠れ状態をストリーミングして高速なプランナーを逐次更新するSPARK-VLNを提案し、ナビゲーション成功率と社会的コンプライアンスを向上させた。
- AffordanceVLA:アフォーダンス認識による行動生成を強化する視覚言語行動モデルVLA/操作2026/6/4
視覚言語モデルとロボット制御の構造的ミスマッチを解消するため、アフォーダンス予測を中間表現として導入し、物体の接地・2D位置特定・3D幾何推論を段階的に行う統一フレームワークを提案した。
- FutureNav: 視覚言語ナビゲーションのための統合世界行動モデリングVLA/ナビゲーション2026/6/1
視覚と言語によるナビゲーション(VLN)タスクにおいて、世界状態の遷移と将来予測を明示的にモデル化する統合フレームワークを提案し、4B規模のバックボーンで複数のベンチマークで最先端性能を達成した。
- 知覚行動基盤モデル:人間の動作プリエントをロボット中心の地形に適応させるヒューマノイド制御2026/6/1
人間の動作データを基盤としたヒューマノイド制御モデルを、ロボットの周囲地形に適応させるフレームワークを提案。地形に合わせた参照動作を合成し、教師-学生学習で実ロボットに展開する。
- MotionWAM: 実時間ヒューマノイド移動操作のための基盤ワールドアクションモデルヒューマノイド/移動操作2026/6/1
本論文は、ビデオワールドモデルの中間特徴を利用して、単一の行動空間で全身動作を予測する実時間ヒューマノイド移動操作モデルMotionWAMを提案し、実機で高い成功率を達成した。
- NavThinker: 社会的ナビゲーションにおける結合予測と計画のための行動条件付きワールドモデルナビゲーション2026/3/1
ロボットの行動に応じて将来のシーンと歩行者動態を予測する行動条件付きワールドモデルを強化学習と組み合わせ、社会的ナビゲーションの性能を向上させた。
- DiT4DiT: ビデオダイナミクスと行動の統合モデリングによる汎用ロボット制御VLA2026/3/1
ビデオ生成と行動予測を統合したエンドツーエンドのVideo-Actionモデルを提案し、シミュレーションと実機で高い成功率とサンプル効率を達成した。
- FLUX: 整流フローと静的から動的への学習によるクロス身体性生成ナビゲーションポリシーの高速化ナビゲーション2026/3/1
動的ナビゲーションベンチマークDynBenchを導入し、フローベースの統一ナビゲーションポリシーFLUXを提案。直線軌道で推論を高速化し、静的から動的へのカリキュラムで社会的ナビゲーションと静的タスクの堅牢性を向上、ゼロショットで多種ロボットに転移可能。
- MeshMimic: 3Dシーン再構成による幾何学認識型ヒューマノイド動作学習ヒューマノイド/動作生成/sim2real2026/2/1
動画から3Dシーンと人間の動きを再構成し、地形との接触を保ったままヒューマノイドロボットの動作を学習させるフレームワークを提案。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- 自動運転のための視覚-言語-行動モデル:過去・現在・未来VLA2025/12/1
自動運転における視覚-言語-行動(VLA)フレームワークの進化を整理し、End-to-End型とDual-System型の2つのパラダイムに分類して、その特徴と課題を概観したサーベイ論文。
- 3EED: あらゆる場所のあらゆるものを3Dでグラウンディング3Dグラウンディング2025/11/1
車・ドローン・四足歩行ロボットのRGBとLiDARデータを統合した大規模3D視覚グラウンディングベンチマークを構築し、クロスプラットフォーム評価手法を提案した。
- EgoTraj-Bench: 一人称視点のノイズ観測下での頑健な軌道予測ベンチマーク軌道予測2025/10/1
一人称視点のノイズを含む観測履歴とクリーンな俯瞰視点の未来軌道を対応付けた初の実世界ベンチマークを構築し、観測のノイズ除去と未来予測を同時に行う二流フローマッチングモデルBiFlowを提案した。
- 見て想像する:人間の実演と未来予測による長期的マニピュレーションの誘導マニピュレーション2025/9/1
人間の実演動画から手順意図を推論し、生成モデルで未来の動画ロールアウトを合成して低レベル制御を導く階層的フレームワークSuper-Mimicを提案し、長期的マニピュレーションタスクでゼロショット手法を20%以上上回った。
- 生LiDAR点群から直接制御する人型ロボットの安全で快適な歩行ポリシー歩行2025/8/1
生のLiDAR点群を直接モータ指令に変換するエンドツーエンド歩行ポリシーを提案し、制約付きMDPと制御バリア関数を組み合わせて安全性を保証、快適性報酬で人間に配慮した動きを実現、実機へ転移した。
- SD-OVON: 動的シーンにおけるオープンボキャブラリ物体ナビゲーションのための意味論対応データセットとベンチマーク生成パイプライン物体ナビゲーション2025/5/1
マルチモーダル基盤モデルを活用し、実世界の意味論と常識に沿ったフォトリアルな動的シーンと操作可能物体を含むオープンボキャブラリ物体ナビゲーション用データセット・ベンチマークを自動生成するパイプラインを提案。
- 全方位知覚:動的環境における脚式移動のための全方向衝突回避歩行2025/5/1
生のLiDAR点群を直接処理して3D空間認識と全方向衝突回避を実現する脚式ロボットのエンドツーエンド移動ポリシーを提案し、高忠実度LiDARシミュレータで訓練して実環境でも検証した。
- 成功への階段:LLM駆動の粗から細への探索によるオンライン階層対応ゼロショット物体目標ナビゲーションフレームワークナビゲーション2025/5/1
事前地図や再学習なしで多階層建物内の物体を目指すゼロショットナビゲーションを実現するASCENTを提案。階層表現構築とLLMによる粗密探索でHM3D/MP3Dで最高性能を達成し、四足ロボットで実機検証した。
- 未見タスクへの汎化に挑む視覚-言語-行動マニピュレーションの限界探索VLA2025/5/1
VLAモデルのクロスタスク汎化を評価する新ベンチマークAGNOSTOSを提案し、文脈内デモンストレーションで未見タスクの行動を予測するX-ICM手法を導入した。
- 視覚言語モデルによるゼロショット3D視覚グラウンディング3D視覚グラウンディング2025/5/1
2Dの視覚言語モデルを活用し、3D専用の学習データなしで3Dシーン内の物体を自然言語で特定するゼロショット手法SeeGroundを提案。
- GLOVER++:人間の行動からアフォーダンス学習を解き放ちロボットマニピュレーションへマニピュレーション2025/5/1
50万枚のアフォーダンス注釈付き大規模データセットHOVA-500Kを構築し、人間のデモからロボット操作へアフォーダンス知識を転移するグローバル・トゥ・ローカル学習フレームワークGLOVER++を提案した。
- SeeGround: ゼロショットオープンボキャブラリ3D視覚グラウンディングのための見て接地する手法3D視覚グラウンディング2024/12/1
2D視覚言語モデルを活用し、3Dシーンをクエリに合わせたレンダリング画像と空間記述のハイブリッドで表現することで、ゼロショットでオープンボキャブラリな3D視覚グラウンディングを実現した。
- GaussianProperty: LMMを用いた3Dガウシアンへの物理特性の統合3D表現/物理特性推定2024/12/1
SAMとGPT-4Vを組み合わせて2D画像から物体の材質・物理特性を推定し、投票戦略で3Dガウシアンに付与することで、物理シミュレーションやロボット把持に応用可能にした学習不要のフレームワーク。
- GLOVER: タスク指向把持のための汎用オープン語彙アフォーダンス推論マニピュレーション2024/11/1
大規模言語モデルを微調整してRGB画像から把持可能な部位のアフォーダンスを推論し、実世界で高速・高精度にタスク指向把持を実現するフレームワークを提案。
- LHPF: 自動運転における履歴を振り返り未来を計画する手法自動運転計画2024/11/1
過去の計画意図を集約して現在の観測と組み合わせる模倣学習型プランナを提案し、実データと合成データで既存手法を上回り、純粋な学習ベース手法として初めて専門家を超える性能を達成した。
- 認知から予知へ:社会的ナビゲーションのための未来認識フレームワーク社会的ナビゲーション2024/9/1
人間の将来の軌道を予測し、その経路を妨げる行動にペナルティを与える強化学習手法Falconを提案し、新しいベンチマークSocialNavで評価した。
- ロボット操作のための視覚事前学習における人間-ロボットドメインギャップの緩和マニピュレーション2024/6/1
人間とロボットのペア動画を用いたコントラスティブ学習で、人間の活動データで事前学習した視覚モデルをロボット領域に適応させ、操作タスクの成功率を向上させた研究。
- 言語指示に基づくマルチタスクロボット操作のための対照的模倣学習模倣学習2024/6/1
言語指示と視覚観察から多様な操作タスクを実行するエンドツーエンド模倣学習エージェントSigma-Agentを提案し、対照的学習とマルチビューTransformerで性能を向上させた。
- 未知の動的環境における3Dセマンティックマップを用いたオープンボキャブラリ移動マニピュレーション移動マニピュレーション2024/6/1
VLMとLLMを活用して3Dセマンティックマップを構築し、未知の動的環境で自然言語指示に基づく移動マニピュレーションを実現するフレームワークを提案。実機実験で高い成功率を示した。
- DragTraffic: 自動運転のための対話的で制御可能な交通シーン生成シーン生成2024/4/1
画像生成のDragGANに着想を得て、条件付き拡散モデルにより非専門家でも多様でリアルな交通シナリオを対話的に生成・制御できるフレームワークを提案した。