Liang Pan
収録論文 31本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MoSAT: 空間オーディオとテキスト記述からの人間動作生成動作生成2026/9/20
空間オーディオと自然言語を条件として全身動作を生成する新タスクを提案し、データセットSTAMと階層的クロスアテンションを用いた潜在フローマッチング手法MoSATを開発した。
- LightNav-0: 汎用身体性ナビゲーションのためのVLM空間知能の引き出しナビゲーション2026/8/31
事前学習済み視覚言語モデルの空間知能をナビゲーション制御に直接活用する、タスク非依存の汎用ナビゲーションモデルLightNav-0を提案。統一トークンインターフェースと残差VQアクショントークナイザにより、指示追従・物体探索・視覚追跡を単一モデルで実現する。
- VBVR-Pro: ネイティブ視覚推論のためのスケーラブルで検証可能なスイート視覚推論2026/8/26
視覚生成を推論の媒体として扱うネイティブ視覚推論の研究を進めるため、300の手続き生成タスクからなる閉ループテストベッドVBVR-Proを導入し、検証可能な報酬スコアラと制御されたモダリティ比較を提供する。
- 軽量ロコパルクール:マルチスキル蒸留による多用途な知覚全身移動全身移動/パルクール/強化学習2026/8/1
深度カメラと速度指令のみで、歩行・バランス・登攀・降下・跳躍などの全身スキルを自律的に切り替える単一のポリシーを提案し、障害物のある地形での移動を実現した。
- ACE-Data-0: 人間中心の環境キャプチャによる具現化データエンジンデータセット2026/7/30
家庭環境を校正済みの録音スタジオに変えるデータ収集エンジンACEを提案し、多感覚データセットACE-Data-0を構築した。
- PhysX-Omni: 剛体・変形体・関節物体のための統合シミュレーション対応物理3D生成3D生成2026/5/1
剛体、変形体、関節物体など多様なアセットタイプに対応した、シミュレーション対応の物理3D生成の統合フレームワークを提案した論文。
- あなたの運転ワールドモデルは万能選手か?自動運転/評価ベンチマーク2026/5/1
運転ワールドモデルの性能を画質から閉ループ運転まで多面的に評価する統一ベンチマークWorldLensを提案し、既存モデルが全軸で優れないことを示した。
- HSImul3R: 物理を組み込んだシミュレーション可能な人-シーン相互作用の再構築シミュレーション/再構築2026/3/1
カジュアルな映像から、物理的に安定したシミュレーション可能な人-シーン相互作用の3D再構築を行うフレームワークを提案。物理シミュレータを能動的な監督者として双方向に最適化し、実ロボットへの適用も実証した。
- マルチモーダル基盤モデルによる空間知能のスケーリングVLA2025/11/1
800万件の多様な空間データでマルチモーダル基盤モデルを訓練し、空間知能ベンチマークで大幅な性能向上を達成するとともに、データスケーリングや創発的汎化の兆候を分析した。
- 3EED: あらゆる場所のあらゆるものを3Dでグラウンディング3Dグラウンディング2025/11/1
車・ドローン・四足歩行ロボットのRGBとLiDARデータを統合した大規模3D視覚グラウンディングベンチマークを構築し、クロスプラットフォーム評価手法を提案した。
- 俊敏性と安定性の融合:異種データによる汎用人型ロボット制御人型ロボット制御2025/11/1
人間のモーションキャプチャと物理的に生成したバランス動作という異種データを組み合わせ、単一のポリシーで俊敏な動きと極限のバランス維持を両立させる人型ロボット制御フレームワークAMSを提案。
- PhysX-Anything: 単一画像からシミュレーション可能な物理的3Dアセットを生成sim2real2025/11/1
単一の画像から、関節構造や物理属性を備えたシミュレーション可能な3Dアセットを生成するVLMベースのフレームワークを提案し、新データセットPhysX-Mobilityも構築した。
- 人間型ロボットによる大型物体の抱え込み:強化学習を用いた全身マニピュレーション全身マニピュレーション2025/9/1
人間の動作事前分布とニューラル符号付距離場を強化学習に統合し、人間型ロボットが大型物体を全身で抱え込む多接触・長時間タスクを実現した。
- 3D・4D世界モデリングのサーベイ世界モデル2025/9/1
RGB-D画像や占有グリッド、LiDAR点群といったネイティブな3D/4D表現を用いた世界モデリング研究を初めて体系的に整理し、定義・分類・データセット・評価指標をまとめたサーベイ。
- MOSPA: 空間オーディオに駆動される人間モーション生成モーション生成2025/7/1
空間オーディオに反応する人間の動きを生成するため、初の空間オーディオ駆動モーション(SAM)データセットを構築し、拡散モデルベースの生成フレームワークMOSPAを提案した。
- 画像からLiDARへのデータ事前学習における時空間一貫性の強化LiDAR事前学習2025/3/1
連続するLiDAR-カメラペアを用いて時空間的手がかりを統合するSuperFlow++を提案し、11の異なるLiDARデータセットで最先端性能を達成した。
- VLMは自動運転に本当に使えるのか?信頼性・データ・評価指標の観点からの実証研究VLA2025/1/1
自動運転向けVLMの信頼性を17設定・約2万フレームで評価するベンチマークDriveBenchを構築し、VLMが視覚ではなく一般知識やテキスト手がかりに依存しがちであることを明らかにした。
- LargeAD: 自動運転のための大規模クロスセンサデータ事前学習自動運転/3D知覚2025/1/1
2D画像から視覚基盤モデルでスーパーピクセルを抽出しLiDAR点群と対応付けることで、自動運転向けのクロスモーダル3D表現を大規模事前学習するフレームワークを提案。
- LiMoE: 自動車シーン向けLiDAR表現の混合エキスパート学習3D認識2025/1/1
LiDARの複数表現(距離画像・疎ボクセル・生点群)をMixture of Expertsで統合し、事前学習からセグメンテーションまで一貫して活用するフレームワークを提案。
- DynamicCity: 動的シーンからの大規模4D占有生成4D生成2024/10/1
動的運転環境の大規模4D占有シーンを生成するフレームワークを提案し、HexPlane表現のVAEとDiTベース拡散モデルで高品質な生成を実現した。
- 4DコントラスティブSuperFlow:密な3D表現学習器3D知覚2024/7/1
LiDARとカメラの連続ペアを用いた時空間事前学習フレームワークSuperFlowを提案し、点群密度変化への不感性と流れベースのコントラスティブ学習で3D知覚モデルを効率的に学習する。
- 自動運転におけるBird's Eye View知覚のロバスト性のベンチマークと改善BEV知覚2024/5/1
BEV知覚モデルのロバスト性を評価するベンチマークRoboBEVを提案し、33モデルを検証してCLIPベースの改善手法を設計した。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- 自動運転向けマルチモーダルなデータ効率の良い3Dシーン理解3Dシーン理解2024/5/1
LiDARセマンティックセグメンテーションの半教師あり学習において、LiDARとカメラの対応や言語知識を活用するLaserMix++を提案し、少ないアノテーションで高精度を実現した。
- ユニバーサルLiDARセグメンテーションに向けたマルチスペースアラインメントLiDARセグメンテーション2024/5/1
異なるセンサやシーンで収集された大規模運転データセットを統合し、データ・特徴・ラベル空間でのアラインメントを行うことで、単一パラメータでマルチタスク・マルチデータセット・マルチモダリティのLiDARセグメンテーションを実現するM3Netを提案。
- Calib3D:信頼できる3Dシーン理解のためのモデル選好の校正3Dシーン理解2024/3/1
3Dシーン理解モデルの不確実性推定の信頼性を評価するベンチマークCalib3Dを提案し、28モデル・10データセットで検証。校正を改善する深度対応スケーリング手法DeptSも導入。
- InsActor: Instruction-driven Physics-based Characters2023/12/1
- Segment Any Point Cloud Sequences by Distilling Vision Foundation Models2023/6/1
- RoboBEV: Towards Robust Bird's Eye View Perception under Corruptions2023/4/1
- Robo3D: Towards Robust and Reliable 3D Perception against Corruptions2023/3/1
- LaserMix for Semi-Supervised LiDAR Semantic Segmentation2022/7/1