Li Zhang
Fudan University
収録論文 46本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PRICE:身体性強化学習のための物理的関係に基づく行動チャンクのクレジット割り当て強化学習2026/9/30
終端の成否信号のみから、軌道間の物理的関係を利用して行動チャンクごとのクレジットを推定する手法PRICEを提案し、LIBEROや実機で有効性を示した。
- X-WBC:ヒューマノイド全身制御のためのクロスエンボディメント基盤モデル全身制御/クロスエンボディメント2026/9/14
人間の動作データを共通の意味表現として学習し、ロボット固有の軽量モジュールで各機体に適応させることで、複数のヒューマノイドをまたいで全身制御方策を訓練する基盤フレームワークを提案。
- PASTEL: 単眼4Dシーン再構成のためのパノラマ位置合わせ4D再構成2026/9/5
単眼ビデオから可視領域の再構成と不可視領域の生成を組み合わせた4Dシーン合成手法を提案。視点計画を2次元方向探索に変換するパノラマ位置合わせにより、観測範囲外のシーンを効率的に生成し、再構成性能も向上させる。
- TacPAC: 接触リッチ操作のためのワールドアクションモデルにおける触覚予測とリアルタイム行動修正触覚/操作2026/9/4
視覚中心のワールドアクションモデルに触覚予測を組み込む際、予測と実行のタイミング差が問題となる。TacPACは、計画された行動チャンクに基づく触覚予測をキャッシュし、実行中に得られる実触覚画像と照合して未実行の行動をリアルタイムに修正する手法を提案し、5つの実ロボットタスクで成功率を大幅に向上させた。
- マイクロロボットナビゲーションのための分単位トレーニングナビゲーション2026/8/1
マイクロロボットのナビゲーションを強化学習で訓練する際、従来は数時間から数日かかっていたが、高速シミュレータとタスク整形正則化報酬により10分未満での訓練を実現した。
- DR-GS: 物理ベースの変形・再照明可能な2Dガウシアン3D再構成2026/6/28
変形物体のガウシアンスプラッティングにおいて、照明と材質を分離し、再照明や変形後の編集を可能にする統一フレームワークを提案した。
- HAT-4D: 人間とエージェントの協調による単眼ビデオからの4D複数物体インタラクション復元4D再構成2026/6/26
単眼ビデオから複数物体の3D形状・時間変化・物理的相互作用を復元するエージェントフレームワークを提案し、人間のフィードバックを統合して深度曖昧性や遮蔽問題を解決する。
- ROVE: 強化学習によるヒューマノイド操作のための人間介入の活用ヒューマノイド操作/VLA/強化学習2026/6/15
不完全な人間介入データを用いてヒューマノイドVLAモデルを強化学習で訓練するフレームワークROVEを提案。楽観的価値推定とクロスエンボディ映像を活用し、高価値な行動を優先学習することで実世界の接触を伴う操作タスクで性能を向上させた。
- Metis: 自動運転と都市ナビゲーションのための汎用かつ効率的なワールドアクションモデル自動運転2026/6/14
ビデオ生成と行動予測を分離したエンドツーエンドのワールドアクションモデルを提案し、推論時のビデオ生成を省略することで効率化しつつ、汎用性と性能を向上させた。
- 自己教師あり単眼ビデオ深度推定のための3D一貫性最適化深度推定2026/6/14
ビデオフレームを独立に扱う従来法の問題を解決するため、深度推定を多視点3D再構成問題として捉え、3D一貫性最適化フレームワークを導入した。画像レベルのフォトメトリックレンダリング、ワールド座標の幾何学的整合、多スケール時間勾配一貫性の3つの制約でフレームを統一的に最適化し、自己教師あり学習とゼロショット臨床環境で最先端の精度を達成した。
- Flow6D: 離散から連続へのフローマッチングによる効率的かつ高精度なカテゴリレベル6D姿勢推定姿勢推定2026/6/1
6D姿勢推定を高精度かつ高速に行うため、離散的な潜在空間での位置特定と連続的な姿勢回帰を組み合わせた階層的フローマッチングフレームワークを提案した。
- 行動から世界モデリングへの転移可能なダイナミクス事前学習世界モデル/事前学習2026/6/1
ロボット操作データを用いて行動条件付きの世界モデルを事前学習し、そのダイナミクス事前知識をシミュレータとポリシー学習の両方に転移させる手法を提案した。
- NavOL: オンライン模倣学習によるナビゲーションポリシーナビゲーション2026/5/1
シミュレータとオンラインで対話し、専門家のデモを収集して自己更新するオンライン模倣学習パラダイムを提案し、分布シフトや報酬設計の問題を軽減したナビゲーションポリシーを学習する。
- ロボット群における完全被覆採餌のための訪問グリッド群制御2026/5/1
ロボット群による完全な資源収集を目指し、グリッドベースの確率的採餌戦略を提案。訪問回数が少ない領域への探索バイアスにより、後期段階の収集効率を向上させる。
- MCNav: 記憶を考慮した動的認知地図によるゼロショット目標指向ナビゲーションナビゲーション2026/5/1
探索済み領域の情報を活用する記憶対応ナビゲーションフレームワークを提案し、目標の再検証と再探索戦略によりナビゲーション失敗を低減する。
- 想像された未来から実行可能な行動へ:ロボット操作のための潜在行動の混合マニピュレーション2026/5/1
ビデオ生成モデルによる未来予測をロボット操作に活用する際、予測フレームを直接ポリシーに渡すのではなく、複数の逆動力学モデルを用いて潜在行動の混合表現に変換する制御指向インターフェースMoLAを提案し、シミュレーションと実機で性能向上を確認した。
- 前方・逆動力学の事前学習分離によるロボット学習の非絡み合い化VLA2026/4/1
視覚と言語・行動の予測を分離し、前方動力学モデルと逆動力学モデルを別々に事前学習してから統合するフレームワークDeFIを提案し、CALVINやSimplerEnvなどのベンチマークで最先端性能を達成した。
- CT-VIR: スパースアンカーを用いた屋内位置推定のための連続時間ビジュアル慣性レンジング融合位置推定2026/4/1
VIOのドリフトをUWBレンジングで補正する際、スプラインによる連続時間軌跡表現とスライディングウィンドウ最適化で、非同期センサ融合の精度と効率を両立する手法を提案した。
- 解剖学的先行知識に基づく自律ロボット心臓超音波標準断面取得フレームワーク医用画像/ロボット制御2026/3/1
心臓超音波の標準断面を自動取得するため、解剖学的先行知識を組み込んだセグメンテーションと強化学習によるプローブ調整を統合したフレームワークを提案した。
- MotionAnymesh: 物理に基づく関節構造生成によるシミュレーション対応デジタルツインシミュレーション/デジタルツイン2026/3/1
静的な3Dメッシュを、物理シミュレーションで動作可能な関節付きアセットへ自動変換するフレームワークを提案。VLMの推論に物理的知識を組み込み、関節推定と衝突回避を最適化する。
- RoboRouter:ロボットマニピュレーションのための訓練不要なポリシールーティングマニピュレーション2026/3/1
複数の既存ロボット操作ポリシーをプールし、タスクごとに最適なポリシーを経験から学習して選択する訓練不要のルーティング手法を提案。シミュレーションと実世界で成功率を向上させた。
- Uni-World VLA: 自動運転のための世界モデリングと計画の交互実行自動運転/VLA2026/3/1
自動運転向けに、将来フレーム予測と軌道計画を交互に行う統合VLAモデルを提案し、閉ループな意思決定を実現した。
- DAGS-SLAM: 時空間運動確率と不確実性対応スケジューリングによる動的対応3DGS SLAMSLAM2026/2/1
各ガウシアンに時空間運動確率を持たせ、不確実性に応じてセマンティクスを必要な時だけ呼び出すことで、動的環境でもリアルタイムに高精度な3DGS-SLAMを実現した。
- UniMotion: シミュレーション・予測・計画を統合するモーションフレームワーク自動運転2026/2/1
自動運転における運動シミュレーション・予測・計画を単一のTransformerモデルで統合し、Waymoデータセットで高い性能と汎化を示した研究。
- 予言による行動方策の強化学習VLA2025/11/1
ロボット世界モデル「Prophet」を大規模データで事前学習し、新環境へ少数適応させてシミュレータとし、FlowScaleでVLA方策を強化学習する手法を提案。
- DSBench:車外・車内リスクを評価する包括的ベンチマーク自動運転VLMベンチマーク2025/11/1
自動運転向けVLMの安全性評価のため、車外環境リスクと車内運転行動安全を10カテゴリ28サブカテゴリで統合評価する初のベンチマークDSBenchを構築し、98Kデータでの微調整が安全性を向上させることを示した。
- SynHLMA:離散的な人-物体インタラクション表現による関節物体の手言語操作の合成マニピュレーション2025/10/1
関節物体に対する言語指示付きの手の把持・操作系列を生成するフレームワークSynHLMAを提案し、生成・予測・補間タスクで高性能を示した。
- 相対位置が重要:極座標表現による軌道予測と計画自動運転2025/8/1
自動運転の軌道予測・計画において、従来の直交座標ではなく極座標系で位置を表現する手法Polarisを提案し、距離と方向の影響をより自然にモデル化して最先端性能を達成した。
- RealEngine: 現実的な文脈での自動運転シミュレーション自動運転シミュレーション2025/5/1
3Dシーン再構成と新規視点合成を組み合わせ、マルチモーダルでフォトリアルな閉ループ自動運転シミュレーションを実現するフレームワークを提案。
- 左脳から右脳へ:視覚と言語によるナビゲーションのための適応的テキストドリーマーVLA2025/5/1
視覚と言語によるナビゲーション(VLN)において、LLMをベースに左脳(論理統合)と右脳(想像的予測)の二重分岐構造で将来の環境意味を言語形式で適応的に想像し、ナビゲーション専門モジュールと統合する手法を提案。R2Rベンチマークで少ないパラメータで最先端性能を達成。
- 過去と未来を橋渡しする:履歴予測と計画を用いたEnd-to-End自動運転自動運転2025/3/1
自動運転のEnd-to-Endモデルにおいて、過去の予測・計画クエリを未来の各タイムステップに対応付けて再利用するBridgeADを提案し、nuScenesで最先端性能を達成した。
- 自動運転における歩行者行動とシーン理解への視覚言語モデルの応用VLA2025/1/1
大規模視覚言語モデルの知識を効率的な視覚ネットワークに蒸留し、歩行者の行動予測とシーン理解に適用することで、多様で包括的な意味属性の生成と予測精度の向上を実現した。
- DG-SLAM: 動的環境に対応したロバストなガウシアンスプラッティングSLAMとハイブリッド姿勢最適化SLAM2024/11/1
動的環境でも高精度なカメラ姿勢推定と高忠実度な再構成を実現する、3Dガウシアンを用いた初の動的Visual SLAMシステムを提案。
- DeMo: 動き予測を方向意図と動的状態に分離するフレームワーク予測2024/10/1
交通エージェントの軌道予測を「方向意図」と「時間変化する状態」に分けてモデル化し、AttentionとMambaを組み合わせてArgoverse 2とnuScenesで最高精度を達成した研究。
- ポイントピラミッドを用いたマルチスケール特徴融合による3D物体検出3D物体検出2024/9/1
LiDAR点群の3D物体検出において、空間スケールと意味的深さを横断する特徴ピラミッド型の融合モジュールを提案し、点密度のばらつきにも対応した検出フレームワークを構築した論文。
- RoDyn-SLAM: ニューラル放射輝度場を用いた動的環境に頑健な高密度RGB-D SLAMSLAM2024/7/1
動的環境で不安定になる従来のNeRFベースSLAMに対し、動きマスク生成と分割統治型の姿勢最適化を導入し、精度とロバスト性を向上させたフレームワークを提案。
- バターを取って:YOLOv7とBERTを活用したデスクトップ型マルチタスクロボットアームの研究マニピュレーション2024/5/1
小型デスクトップロボットに音声認識・自然言語理解・視覚認識を組み合わせ、マルチモーダルな自律動作を実現した研究。
- OpenOcc: 占有表現によるオープンボキャブラリ3Dシーン再構成3D再構成/オープンボキャブラリ2024/3/1
ニューラル放射輝度場と占有表現を組み合わせ、事前学習済みオープンボキャブラリモデルを蒸留することで、ゼロショットで3Dシーンの再構成と理解を同時に行うフレームワークを提案。
- SUIT: Learning Significance-guided Information for 3D Temporal Detection2023/7/1
- Spatial-temporal Transformers for EEG Emotion Recognition2021/10/1
- Joint order assignment and picking station scheduling in KIVA warehouses with multiple stations2021/8/1
- Hierarchical Road Topology Learning for Urban Map-less Driving2021/4/1
- Holistic Grid Fusion Based Stop Line Estimation2020/9/1
- 3D Printed Brain-Controlled Robot-Arm Prosthetic via Embedded Deep Learning from sEMG Sensors2020/5/1
- A Magnetically-Triggered Soft Capsule for On-Demand Mucus Collection2018/9/1
- Magnetic Navigation of a Rotating Colloidal Swarm Using Ultrasound Images2018/9/1