Manling Li
Northwestern University
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 物理推論のためのモデリングと実行の分離物理推論2026/8/22
物理問題を解く際に、計算前に物理モデルを明示的に構築するフレームワークを提案し、二段階の学習戦略でモデルの推論性能を向上させた。
- MANIGUARD: 仕様に基づく安全性評価とロボット操作改善のためのベンチマークとデータセット安全性評価/操作2026/8/18
ロボット操作の基盤モデルの安全性を評価・改善するための、仕様に基づくフレームワークとベンチマーク、データセットを提案した論文。
- マルチモーダルメモリ圧縮による長期的身体化意思決定意思決定/ベンチマーク2026/8/2
長期的な身体化意思決定のためのベンチマークDunphyBenchを提案し、VLMエージェントの性能が人間に及ばないこと、メモリ管理がボトルネックであることを示した。さらに、ユーザー嗜好に基づいて情報を圧縮するMeMentoを設計し、精度向上とメモリ削減を実現した。
- HumanCLAW: 視覚言語モデルは身体を通して行動できるか?VLA評価2026/7/1
視覚言語モデル(VLM)の身体を使った行動能力を評価するフレームワークを提案し、41の屋内シーンで1,218エピソードのベンチマークを構築。最先端のVLMでも成功率は最大16.8%にとどまり、物体認識ではなく身体の自己認識が欠如していることが課題と判明。
- 行動アンクローニング:推論時ステアリングなしでモードリダイレクションをポリシー重みに蒸留する手法模倣学習/ポリシー編集2026/6/1
デモデータに含まれる望ましくない行動モードを抑制するため、一時的なモード分類器からのリダイレクション信号をポリシー重みに蒸留し、推論時オーバーヘッドなしで安全な行動を実現する手法MoREを提案した。
- 視点計画:VLMによる3D空間の能動的推論と計画VLA2026/5/1
VLMがカメラ移動による視点変化を予測し、複数ステップの計画で目標視点を特定できるかを検証し、その能力を高める反復的自己探索と視点グラフ蒸留の枠組みを提案した。
- DreamAvoid: 臨界期テストタイムドリーミングによるVLAポリシーの失敗回避VLA/操作2026/5/1
VLAモデルが微細な操作中に失敗する問題に対し、実行が臨界期に入ったかを検出し、複数の候補行動を評価して最適な行動を選択する「テストタイムドリーミング」フレームワークを提案した。
- ESI-Bench:知覚と行動のループを閉じる身体化空間知能のベンチマーク身体化空間知能2026/5/1
受動的な観察ではなく、能動的な探索を通じて空間理解を行う身体化空間知能のベンチマークを提案し、能動的探索が受動的観察より優れていることを示した。
- EgoTL: 長時間タスクのための自己中心視点シンクアラウド連鎖VLA2026/4/10
自己中心視点のデータに、発話と行動のタイムスタンプ付き思考連鎖とメートルスケールの空間情報を付与するパイプラインを構築し、VLMやワールドモデルの評価・微調整を行う。
- 大規模言語モデルを用いた具現化プランニングには系統的な安全リスクが存在する安全性評価2026/4/1
大規模言語モデルをロボットのプランナーとして使う際の安全性を評価するベンチマークDESPITEを導入し、計画能力が高くても危険な計画を生成するリスクが高いことを示した。
- Phys4D:動画拡散モデルから物理的に整合した4Dモデリング4D生成/物理整合性2026/3/1
動画拡散モデルを3段階の学習で物理的に整合した4D世界表現へと引き上げる手法を提案し、幾何・運動・長期物理整合性の評価指標も導入した。
- 試行錯誤からの学習:身体性LLMのための内省的テスト時計画VLA2026/2/1
実行前の内省で行動候補を生成・評価し、実行後の内省でモデルと方針を更新する内省的テスト時計画を提案し、長期的な家庭内タスクやロボット実験で性能向上を実証した。
- ENACT: 自己中心的なインタラクションの世界モデリングによる身体性認知の評価身体性認知/ベンチマーク2025/11/1
ロボティクスシミュレーションから生成した自己中心視点の行動と観測の系列並べ替えタスクにより、視覚言語モデルが身体性認知の能力(アフォーダンス認識、行動効果推論など)をどの程度持つかを評価するベンチマークを提案。
- 自己対戦ファインチューニングによるエージェントRLのための世界モデル内在化VLA2025/10/16
LLMエージェントに状態表現と遷移モデルからなる内部世界モデルを自己対戦SFTで学習させ、方策最適化前に未来状態をシミュレートすることでOOD環境でのRL性能を大幅に向上させる手法SPAを提案。
- IKEAマニュアルの実践:インターネット動画における組立指示の4Dグラウンディング4Dグラウンディング2024/11/1
家具の3Dモデル・組立説明書・インターネット動画を密に対応付けたデータセットを構築し、組立計画生成や動画内の部品位置推定など5つのタスクの評価基盤を提供した。
- 身体性エージェントインターフェース:身体的意思決定のためのLLMベンチマークVLA2024/10/1
LLMを用いた身体的意思決定を統一的に評価するための汎用インターフェースを提案し、多様なタスク・モジュール・細粒度エラー指標でLLMの能力を体系的に分析するベンチマークを構築した。