Xiaoqi Li
Peking University
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BiRoAD: 双腕マニピュレーションのための共有・役割適応表現学習マニピュレーション2026/9/20
双腕ロボットの動作を「腕交換で不変な協調構造」と「役割に応じて変化する成分」に分解し、役割の偏りに頑健な模倣学習を可能にする特徴変換フレームワークを提案。
- データ合成と統合プランニングによるマニュアル基盤の家電操作のスケーリング操作プランニング2026/8/16
家電のマニュアルから部品接地・長期プランニング・閉ループ回復データを自動生成するパイプラインMAGEと、それを用いた大規模データセットUseAppliance、およびエンドツーエンドモデルAppliancePlanを提案し、実ロボットで有効性を実証した。
- ロボットのためのインテリジェントクラウドエッジマルチモーダル対話システムヒューマンロボットインタラクション2026/7/1
限られた計算資源のロボット向けに、改良したジェスチャ検出器とLLM/VLMエージェントを組み合わせたクラウドエッジ型マルチモーダル対話フレームワークを提案し、複雑環境での対話成功率を実証した。
- LaST-HD: スケーラブルな人間データからロボット操作の物理的推論を学習する操作学習2026/6/1
人間の手のデモンストレーションとロボットのデモンストレーションを共有の潜在推論空間で整列させ、物理ダイナミクスを内部化することで、ロボット操作の学習を改善する新しい手法を提案した論文。
- AT-VLA: 適応的触覚注入による視覚言語行動モデルのフィードバック反応向上VLA/触覚/操作2026/5/1
接触を伴う操作タスクで視覚言語行動モデルの性能を高めるため、適応的に触覚情報を注入する仕組みと、高速な触覚反応を可能にする二重ストリーム構造を提案した。
- BiPreManip: 予期的協調によるアフォーダンスに基づく両腕準備的操作の学習両腕操作2026/3/1
直接掴みにくい物体や機能的操作が難しい物体に対して、一方の腕が準備的操作を行い他方の腕の目標動作を可能にする両腕協調タスクを扱い、視覚アフォーダンスに基づくフレームワークを提案した。
- AnchorVLA4D: ロボット操作のためのアンカーベース時空間視覚言語行動モデルVLA/操作2026/3/1
視覚アンカーを用いて、操作中の空間認識と時間的文脈を強化する新しいVLAモデルを提案。初期シーンのアンカー画像と軽量な空間エンコーダを追加し、追加センサなしで性能を向上させた。
- Real2Edit2Real: 3D制御インターフェースによるロボット実演の生成sim2real2025/12/1
多視点RGBから3D再構成した点群を編集し、深度を主制御信号とする動画生成モデルで新しい操作実演を合成することで、1〜5件の実演から50件相当のデータを生成しデータ効率を10〜50倍向上させるフレームワーク。
- ManualVLA:思考連鎖による手順書生成とロボット操作を統合したVLAモデルVLA2025/12/1
目標状態から実行手順を推論する「Manual Chain-of-Thought」を導入し、手順書生成と操作実行をMixture-of-Transformersで統合したVLAモデルを提案。3D Gaussian Splattingによるデジタルツインで訓練データを自動生成する。
- Imagine2Act: 想像上の目標を用いた物体-動作の運動整合性によるロボットマニピュレーションマニピュレーション2025/9/1
言語指示から想像した目標画像と3D点群を生成し、物体の変形とエンドエフェクタ動作を整合させることで、高精度な物体再配置タスクを実現する模倣学習フレームワークを提案した。
- RwoR: ロボットなしで方策学習するための人間の手の収集からのロボットデモンストレーション生成模倣学習2025/7/1
手首に装着したGoProで人間の手のデモを収集し、生成モデルでロボットグリッパのデモに変換することで、実機ロボットなしに操作方策を学習できる手法を提案。
- BiAssemble: 両手協調アフォーダンス学習による幾何学的組み立てマニピュレーション2025/6/1
破片の点群から両手協調に必要なアフォーダンスを学習し、割れた器などの幾何学的組み立てを実現する手法を提案。実世界ベンチマークで従来法を上回る性能を示した。
- Fast-in-Slow:高速操作と低速推論を統合するデュアルシステム基盤モデルVLA2025/6/1
VLMベースの推論システムに実行モジュールを部分的にパラメータ共有して組み込み、高速かつ精密なロボット操作を実現する統合型VLAモデルを提案。
- SR3D: 単視点3D再構成で透明・鏡面物体の把持を実現マニピュレーション2025/5/1
単視点のRGB-D画像から外部の視覚モデルで物体メッシュを再構成し、視点・キーポイントマッチングで元のシーンに位置合わせすることで、透明・鏡面物体の把持を可能にする学習不要のフレームワークを提案。
- CrayonRobo: 物体中心のプロンプト駆動型視覚-言語-行動モデルによるロボットマニピュレーションVLA2025/5/1
RGB画像に手書き風の2D視覚プロンプトを重ね、低レベル動作と高レベル計画を同時に指示する視覚-言語-行動モデルを提案。キーフレームごとに接触姿勢と移動方向をSE(3)空間で予測し、長期タスクを実行する。
- HybridVLA:拡散と自己回帰を統合した視覚-言語-行動モデルVLA2025/3/1
拡散モデルによる連続的な行動生成と自己回帰による文脈推論を単一の大規模言語モデル内で統合し、両者を協調的に学習・アンサンブルするロボット操作フレームワークを提案。
- ManipGPT:大規模視覚モデルのアフォーダンスセグメンテーションは関節物体操作に十分か?アフォーダンス/マニピュレーション2024/12/1
大規模視覚Transformerを微調整し、関節物体の操作に必要な部位レベルのアフォーダンスマスクを予測する枠組みを提案。シミュレーションと実世界の画像データセットで学習し、インピーダンス適応方策と組み合わせることで複雑な知覚システムなしに操作を実現した。
- 人間中心の屋内 embodied 配送ベンチマークembodied AI/配送2024/6/1
極地研究基地を模した多層建物内で、人間キャラクターと把持・移動可能なロボットによる配送タスクを再現する仮想環境と、13kの言語指示を含むデータセットを構築し、大規模マルチモーダルモデルを基盤としたベースライン手法を提案した。
- AIC MLLM:ロボットマニピュレーションのための自律対話型修正マルチモーダル大規模言語モデルマニピュレーション2024/6/1
関節物体操作における低レベル接触姿勢の失敗を、視覚マスクとテキスト指示を用いてMLLMが自律的に認識・修正する手法を提案。
- NaturalVLM: 細粒度自然言語を用いたアフォーダンス誘導型視覚マニピュレーションマニピュレーション2024/3/1
家庭用ロボット向けに、細かい自然言語指示を段階的に解釈して物体操作を行う学習フレームワークと、15タスク・4500エピソード超のベンチマークNrVLMを提案した論文。
- ManipVQA: マルチモーダル大規模言語モデルへのロボットアフォーダンスと物理的知識の注入VLA2024/3/1
ロボット操作に必要な道具検出・アフォーダンス認識・物理概念理解をVQA形式で学習させ、MLLMに操作中心の知識を注入するフレームワークを提案した。
- ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic Manipulation2023/12/1
- ImageManip: Image-based Robotic Manipulation with Affordance-guided Next View Selection2023/10/1
- RGBManip: Monocular Image-based Robotic Manipulation through Active Object Pose Estimation2023/10/1
- Find What You Want: Learning Demand-conditioned Object Attribute Space for Demand-driven Navigation2023/9/1
- Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions2023/9/1
- AuthROS: Secure Data Sharing Among Robot Operating Systems Based on Ethereum2022/8/1