Zhe Li
NTU
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PlanGuard: 身体性エージェントにおける多段階計画の安全性ガードレール安全性/計画2026/9/26
実行前の多段階計画全体を環境と照らし合わせて物理的安全性を評価する検出器を提案し、専用データセットと蒸留手法で小型モデルでも高精度を実現した。
- RoboDreamer: 予測状態空間モデルによる先読み型ヒューマノイド歩行歩行2026/9/7
観測マスキングと蒸留を用いた2段階教師-学生フレームワークで、不完全なセンシング下でも安定したヒューマノイド歩行を実現する。
- EMERGE-Policy: ロボットの心は単一ポリシーを超えて出現するVLA2026/8/30
複数の専門エージェントが協調して知覚・推論・検証・記憶を行うグラフ構造のエージェントフレームワークを提案し、追加のファインチューニングなしでベンチマークと実ロボット実験で高い性能を達成した。
- 物理的インタラクションの学習:触覚・力覚を考慮したロボット学習のサーベイ触覚・力覚学習2026/8/1
触覚・力覚センシングを統合したロボット学習手法を、マルチモーダルかつ多段階のシステム設計の観点から統一的な分類学TF-ARTを用いて整理し、今後の研究課題を考察したサーベイ論文。
- ω-0: 人間型ロボットの同時移動操作のための潜在予測世界行動モデルヒューマノイド2026/8/1
言語指示と視覚・状態入力から、移動と操作を同時に行う全身行動を直接予測する世界行動モデルを提案し、実機で11種類の家庭タスクを達成した。
- Open-AoE: 身体化学習のためのオープンな自己中心視操作データセットとツールチェーンデータセット2026/7/1
スマートフォンで撮影した自己中心視の操作動画約2000時間と、それをロボット学習用に加工するツールチェーンを公開した論文。
- 3DThinkVLA: 潜在3D事前知識を3D思考誘導共学習で視覚言語行動モデルに付与するVLA2026/6/3
視覚言語行動(VLA)モデルに、3D幾何知覚と3D空間推論を分離して潜在空間に注入する共学習フレームワークを提案し、推論時の追加テキスト生成なしに暗黙的な3D空間推論を可能にする。
- RoboForge: 物理最適化されたテキスト誘導型ヒューマノイド全身歩行歩行2026/3/1
テキストから生成した人間らしい動作をヒューマノイドロボットで物理的に実行可能にするため、物理的妥当性を最適化する双方向結合フレームワークを提案した。
- PRM-as-a-Judge:ロボットの細粒度監査のための高密度評価パラダイムロボット評価2026/3/1
ロボットの実行品質をバイナリ成功率ではなく、プロセス報酬モデル(PRM)を用いて軌道ビデオから密に評価する新しいパラダイムを提案し、OPD指標体系と診断ベンチマークRoboPulseで検証した。
- MOSAIC: 高速残差適応による汎用人型モーション追従と遠隔操作のsim-to-realギャップの橋渡しsim2real2026/2/1
多様な入力インターフェースに対応する人型ロボットの全身遠隔操作システムを構築し、インターフェース固有の残差モジュールを高速適応・蒸留することで、実機での長期的な遠隔操作を安定化させた。
- AoE: 身体性AIのための常時オンの一人称視点人間動画収集システムデータ収集2026/2/1
スマホと首掛けホルダーを使い、誰でもどこでも一人称視点の実世界インタラクション動画を低コストで収集し、身体性基盤モデルの学習データ不足を解消するシステムを提案。
- 潜在推論VLA:視覚-言語-行動モデルのための潜在思考と予測VLA2026/2/1
Chain-of-Thought推論を連続潜在表現に内部化し、推論時の明示的生成を不要にすることで、最大90%の遅延削減を実現したVLAフレームワーク。
- RoboBrain 2.5:奥行きを見据え、時間を心に刻むVLA2026/1/1
深度認識に基づく3D空間推論と、時間的な進捗予測を統合した次世代の身体性AI基盤モデルを提案し、複雑なマニピュレーションの精度と実行認識を向上させた。
- RoboMirror: 模倣の前に理解する、動画からヒューマノイド歩行への変換VLA2025/12/1
VLMを用いて動画から視覚的な運動意図を抽出し、拡散ポリシーを条件付けることで、ポーズ再構成やリターゲティングなしにヒューマノイドの歩行を生成するフレームワークを提案。
- フリースタイルはできる?音声制御による表現豊かなヒューマノイド歩行歩行2025/12/1
音声から直接ヒューマノイドのダンスや身振りを生成する統一フレームワークRoboPerformを提案し、低遅延で高忠実な音声同期動作を実現した。
- 基盤モデル時代の身体性ロボットマニピュレーション:計画と学習の視点マニピュレーション2025/12/1
ロボットマニピュレーションの学習ベース手法を、高レベル計画と低レベル制御の統一的な枠組みで整理したサーベイ。言語・コード・動作・アフォーダンス・3D表現の推論や、入力モデリング・潜在表現学習・方策学習の分類を提示し、課題と展望を論じる。
- URDF-Anything: 3Dマルチモーダル言語モデルによる関節物体の構築sim2real2025/11/1
点群とテキストを入力とする3Dマルチモーダル大規模言語モデルで、関節物体の幾何分割と運動学パラメータをエンドツーエンドに予測し、ロボットシミュレーション用デジタルツインを自動生成する手法を提案。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- ロボットマニピュレーションの統合的理解に向けて:包括的サーベイマニピュレーション2025/10/1
ロボットマニピュレーション研究を、タスク別ベンチマーク・データセット・手法の統一的分類・ボトルネック・実応用まで幅広く整理した包括的サーベイ。
- BLM₁:デジタルと物理を横断する汎用大規模モデルVLA2025/10/1
デジタル空間と物理空間、異なるタスクやロボット身体をまたいで動作する統合型マルチモーダル基盤モデルBLM₁を提案し、2段階学習で身体性知識と制御を両立させた。
- 言語から運動へ:動作潜在ガイダンスによるリターゲティング不要なヒューマノイド制御VLA2025/10/1
言語指示から直接ヒューマノイドの動作を生成するフレームワークRoboGhostを提案し、従来の動作デコード・リターゲティングを省略して低遅延かつ高精度な制御を実現した。
- ActivePose: ロボットマニピュレーションのための能動的6D物体姿勢推定と追跡マニピュレーション2025/9/1
VLMと「ロボットの想像力」を組み合わせ、曖昧さを検出してカメラを次の最良視点へ動かすことで、6D物体姿勢推定・追跡を能動的に高精度化する手法を提案。
- A0: 汎用ロボットマニピュレーションのためのアフォーダンス認識階層モデルマニピュレーション2025/4/1
物体との接触点と接触後軌道を予測するアフォーダンス表現を用い、高レベルな空間理解と低レベル行動実行を階層的に分けた拡散モデルを提案。複数ロボットで汎用性と実世界性能を示した。
- BodyGen: 効率的な身体と制御の共設計に向けて身体共設計2025/3/1
トポロジー認識型自己注意と時間的クレジット割り当てで形態表現と報酬バランスを改善し、ロボットの身体と制御方策を効率的に共設計する手法を提案。
- すべてのロボットを一つに:多用途な汎用身体性エージェントのための新標準と統合データセットデータセット2024/8/1
実世界とシミュレーションのデータを統合した新標準ARIOを提案し、約300万エピソード・32万タスクからなる大規模データセットを構築した。
- A Graph Reconstruction by Dynamic Signal Coefficient for Fault Classification2023/6/1