Haoran Li
Institute of Automation, Chinese Academy of Sciences
収録論文 51本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Token-World: 視覚言語モデルのトークン空間におけるロボット操作のための世界モデリングVLA2026/9/30
VLAモデルの視覚トークンを圧縮した状態空間で未来のダイナミクスを予測する世界モデルを提案し、操作ベンチマークで予測精度と方策整合性を向上させた。
- GIFT: 行動指向の構造的監督による誘導中間特徴学習を用いたロボット操作マニピュレーション2026/9/3
視覚と言語の事前学習で得られる特徴と制御に必要な情報の乖離(行動十分性ギャップ)を埋めるため、中間特徴に幾何・アフォーダンス・目標領域の3つの制御関連構造を学習させるフレームワークGIFTを提案し、複数のポリシーで性能向上を確認した。
- WALA: 行動ラベル付きデモと行動フリー動画から実行可能な潜在行動を学習するロボット学習2026/7/1
行動ラベル付きデモと行動フリー動画の両方から実行可能な潜在行動を学習するフレームワークWALAを提案し、ロボットポリシーの性能と汎化性を向上させた。
- 跳ぶ前に見よ:凍結VLAモデルのためのツリー探索を行動評価へ蒸留するVLA2026/7/1
凍結したVision-Language-Actionモデルの出力分布から有望な行動を選ぶため、シミュレーションでのモンテカルロ木探索で得た知識を軽量なQ値モデルに蒸留し、不確実性を考慮した評価で行動を選択するフレームワークSVAを提案した。
- VT-WAM: 接触を伴う操作のための視覚-触覚ワールドアクションモデルマニピュレーション2026/7/1
接触を伴う操作タスク向けに、視覚予測・触覚変形予測・行動予測を統合したフレームワークを提案し、実世界6タスクで高い成功率を達成した。
- エコー・メモリ:行動世界モデルにおける記憶の制御研究世界モデル2026/6/8
行動条件付き世界モデルにおける記憶機構を制御された条件下で比較し、記憶の容量・圧縮・読み出し・再帰の各軸が性能に与える影響を明らかにした研究。
- FORCE: 価値校正ウォームアップと自己蒸留による効率的なVLA強化学習ファインチューニングVLA/強化学習2026/6/1
VLAモデルの強化学習ファインチューニングを安定化・高速化する3段階フレームワークFORCEを提案。価値校正ウォームアップと自己蒸留でサンプル効率を改善し、シミュレーションと実機で成功率を大幅に向上させた。
- 具身知能のためのスケーラブルで再現可能なクローズドループシミュレーション基盤の構築シミュレーション基盤2026/6/1
クラウドネイティブ技術を用いて、大規模トレーニング・標準評価・データ収集を統合した具身知能向けシミュレーション基盤を提案する論文。
- NoiseGate: ワールドアクションモデルにおける情報ゲーティングとしての潜在変数毎タイムステップスケジュール学習VLA2026/5/1
ロボットの行動生成と未来観測の予測を統合するワールドアクションモデルにおいて、各潜在フレームのノイズレベル(タイムステップ)を学習可能な情報ゲートとして扱い、行動生成に寄与する信頼性を動的に調整する手法NoiseGateを提案した。
- X-DiffVLA: クロスエンボディ拡散行動ヘッドを備えた視覚言語行動モデルVLA2026/5/1
異なるエンドエフェクタを持つロボット間で知識を転移できる拡散ベースのVLAモデルを提案し、エンボディフォーシングと形態学的ツリー拡散により性能を向上させた。
- クリップ付き目的関数による後方最適化:生成的方策学習における効率と安定性の橋渡しロボット操作/強化学習2026/4/1
ロボット操作のための生成的方策をRLで微調整する際の不安定性とサンプル非効率を解決するため、後方推論として方策改善を定式化するPOCOフレームワークを提案。期待値最大化手順で報酬重み付き暗黙後方を方策に蒸留し、オフラインからオンラインへのパラダイムで事前分布に探索を固定する。
- PokeVLA: 包括的な世界知識の指導によるポケットサイズの視覚言語行動モデルの強化VLA2026/4/1
この論文は、ロボット操作のための軽量な視覚言語行動モデルPokeVLAを提案し、2段階のトレーニングと新しいアクションエキスパートにより、LIBERO-Plusベンチマークと実世界で高い性能を達成した。
- SoftHand Model-W: 3Dプリントによる手首と手根管を統合した人間型・劣駆動ロボットハンドハンド/劣駆動/手首統合2026/4/1
Pisa/IIT SoftHandを基に、拮抗腱機構と2自由度の腱駆動手首を統合した3Dプリント製の人間型劣駆動ハンドを開発し、手首の駆動がアームの補償動作を減らし作業時間を短縮することを実証した。
- OmniVTA: 接触を伴うロボット操作のための視覚-触覚世界モデル操作2026/3/1
接触を伴う操作タスクのために、大規模な視覚-触覚-行動データセットと、触覚信号を予測・閉ループ制御に活用する世界モデルベースのフレームワークを提案した論文。
- InCoM: 意図駆動型知覚と構造的協調による移動マニピュレーション移動マニピュレーション2026/2/1
移動マニピュレーションにおいて、潜在的な動作意図を推定して知覚注意を段階的に配分し、ベースとアームの動作を分離して協調生成するフレームワークを提案。シミュレーションと実機で成功率を大幅に向上させた。
- 長寿命ロボットに向けて:強化学習ファインチューニングによるVLAモデルの継続学習VLA2026/2/1
VLAモデルの下流タスク適応における破滅的忘却とデータ依存を解決するため、オンライン環境フィードバック不要の強化学習ファインチューニング手法LifeLong-RFTを提案し、継続学習でSFT比22%の成功率向上を達成した。
- WoVR: 幻覚を制御してVLAポリシーを強化学習で事後学習する信頼可能なワールドモデルシミュレータVLA2026/2/1
不完全な学習済みワールドモデルをシミュレータとして使い、キーフレーム初期化ロールアウトとモデル・ポリシー共進化で幻覚の影響を抑え、VLAポリシーを強化学習で安定に事後学習する手法を提案。
- 生成的エピソードガイダンスによる二重粒度コントラスト報酬で効率的な身体性RL強化学習/報酬設計2026/2/1
大規模動画生成モデルを活用し、少数の専門家動画から各RLエピソード用のタスクガイダンスを生成して、粗い探索と細かいマッチングを両立する二重粒度コントラスト報酬を与えることで、人手アノテーションなしにサンプル効率の高い身体性強化学習を実現した研究。
- LDA-1B:汎用身体データ取り込みによる潜在ダイナミクス行動モデルのスケーリングVLA2026/2/1
異種の身体データからダイナミクス・方策・視覚予測を統合学習する10億パラメータのロボット基盤モデルを提案し、接触・器用・長距離タスクで性能を向上させた。
- Drive-P2D: 自動運転向けVLMのための段階的知覚から意思決定へのベンチマークVLA2026/1/1
自動運転における視覚言語モデル(VLM)を、物体・シーン・意思決定の3段階で評価する6,650問のベンチマークを提案し、推論と回答を分離して採点・誤り分析を行う。
- DiffuDepGrasp: 拡散モデルによる深度ノイズモデリングで実現するSim2Realロボット把持sim2real2025/11/1
拡散モデルで実機深度センサのノイズを学習・合成し、シミュレーションのみで訓練した把持方策をゼロショットで実機に転移するフレームワークを提案。
- QDepth-VLA:量子化深度予測を補助監督とする視覚-言語-行動モデルVLA2025/10/1
VLAモデルにVQ-VAEで量子化した深度マップの潜在トークンを予測する補助タスクを追加し、空間推論能力とマニピュレーション性能を向上させた。
- RoboGPT-R1:強化学習によるロボットタスクプランニングの強化VLA2025/10/1
視覚言語モデルを教師あり微調整と強化学習の2段階で訓練し、長期的な操作タスクの計画能力を高める手法を提案。小型モデルながら大規模モデルを上回る性能を達成。
- LEGO MINDSTORMSで作るソフトシナジー搭載の教育用ロボットハンドロボットハンド2025/10/1
LEGO MINDSTORMSのみを用いて、腱駆動・高受動性の人間型ロボットハンドを開発し、教育現場で最新ロボティクスを学べることを示した。
- 視覚ベース触覚センサの分類:レビュー触覚2025/9/1
視覚ベース触覚センサ(VBTS)を、接触を触覚画像に変換する原理に基づきマーカー型と強度型の2つに大別し、さらに4つのサブタイプに分類して比較したレビュー論文。
- World4RL: 拡散世界モデルによるロボットマニピュレーションの強化学習ポリシー改善マニピュレーション2025/9/1
拡散モデルベースの世界モデルを高忠実度シミュレータとして用い、実機やシミュレータを使わずに想像環境内でマニピュレーション方策を強化学習で直接改善するフレームワークを提案。
- 身体性マニピュレーションのための視覚-言語-行動モデルに関するサーベイVLA2025/8/1
身体性知能におけるロボット操作のための視覚-言語-行動(VLA)モデルについて、アーキテクチャの変遷やデータセット、学習手法、評価方法を5つの観点から整理し、課題と今後の方向性をまとめたサーベイ論文。
- CLAR: マスク再構成と多段階コントラスト整合を融合したロボットマニピュレーション向け3D表現学習マニピュレーション2025/7/1
マスク付きオートエンコーダとクロスモーダルなコントラスト学習を組み合わせ、局所的な変形可能注意で3D形状と2D視覚特徴を精密に対応付ける3D事前学習フレームワークを提案し、視覚運動ポリシー学習で最高性能を達成した。
- StereoTacTip:生体模倣スキンマーカー配置による視覚ベース触覚センシング触覚2025/6/1
ステレオカメラを用いたマーカーベース視覚触覚センサにおいて、生体模倣的な複雑なマーカー配置が形状復元に与える影響を調査し、新しいアルゴリズムと補正モデルを導入して高精度な形状復元を実現した。
- MagicGripper: 接触の多いロボットマニピュレーションのためのマルチモーダルセンサ統合グリッパ触覚2025/5/1
柔らかいエラストマーに3次元多層グリッドを埋め込んだ小型触覚センサmini-MagicTacを開発し、近接覚・視覚センシングも統合したグリッパMagicGripperを提案。遠隔操作組立、接触ベース位置合わせ、自律把持の3タスクで有効性を実証した。
- TeViR: 拡散モデルによるテキストから動画への報酬生成で効率的な強化学習強化学習/ロボットマニピュレーション2025/5/1
テキストから動画を生成する拡散モデルを使い、予測映像と現在の観測を比較して密な報酬を生成する強化学習手法を提案。11の複雑なロボット操作タスクでサンプル効率と性能を向上させた。
- せん断力に基づく多指劣駆動触覚ロボットハンドの把持制御触覚2025/3/1
柔らかい触覚センサを指先に備えた劣駆動ロボットハンドで、接触力フィードバックを用いて壊れやすい物体を把持・操作する制御手法を提案した。
- ConRFT: 一貫性ポリシーによるVLAモデルの強化学習ファインチューニングVLA2025/2/1
VLAモデルをオフラインとオンラインの強化学習でファインチューニングし、実世界の接触を伴う操作タスクで成功率を大幅に向上させた手法。
- FetchBot: ゼロショットSim2Realによる散らかったシーンでの汎化可能な物体把持sim2real2025/2/1
100万シーンの合成データと50万のデモを用い、RGBから深度を予測して遮蔽物を考慮した行動生成を行うSim2Realフレームワーク。実環境の散らかった場面で平均89.95%の成功率を達成した。
- ViTacTip:透明スキンと生体模倣チップを備えたロボットマニピュレーション用マルチモーダルセンサの設計とベンチマーク触覚2025/1/1
透明スキンと生体模倣チップで視覚・近接・触覚・力覚を同時に取得する小型センサViTacTipを設計し、GANによるモダリティ間変換と多タスク学習でその性能を実証した論文。
- GAPartManip:材質に依存しない関節物体操作のための大規模パーツ中心データセットマニピュレーション2024/11/1
透明な蓋や反射する取っ手など深度知覚が難しい家庭内の関節物体を操作するため、材質ランダム化とパーツ単位の操作姿勢注釈を備えた大規模データセットを構築し、頑健な操作を可能にするモジュール型フレームワークを提案した。
- 物体レベル計測に基づく分散不変カルマンフィルタによるマルチロボット姿勢SLAMマルチロボットSLAM2024/9/1
リー群上の状態表現と共分散交差を組み合わせた分散不変カルマンフィルタを提案し、物体レベルの計測モデルで通信負荷を抑えつつマルチロボットの姿勢推定と協調測位を高精度化した。
- CrystalTac:迅速なモノリシック製造技術による3Dプリント視覚ベース触覚センサファミリー触覚2024/8/1
マルチマテリアル3Dプリンティングによるモノリシック製造で、独自の感知機構を持つ視覚ベース触覚センサ(VBTS)ファミリー「CrystalTac」を開発し、触覚知覚タスクでの有効性とコスト効率・設計柔軟性を示した。
- TacShade:光・影・グレースケールに基づく形状再構成のための3Dプリント軟質光学触覚センサ触覚2024/6/1
スケッチの明暗表現に着想を得た3Dプリント軟質光学触覚センサを開発し、接触物体の形状を粗く高速に再構成する手法を提案した。
- 触覚ソフトハンドA:拮抗腱機構を備えた3Dプリント可能な高受動自由度ヒューマノイドロボットハンドマニピュレーション2024/6/1
拮抗腱機構と3Dプリント触覚センサを統合した5指ロボットハンドを開発し、把持適応性と操作性の向上を実証した。
- AnyRotate: 重力不変な手内物体回転を実現するSim-to-Real触覚触覚2024/5/1
高密度な触覚情報をシミュレーションで学習し実機へゼロショット転移することで、手の向きや重力に依存せず任意軸周りに未知物体を回転させるシステムを実現した。
- LLMによる物体親和性転移で物体ゴールナビゲーションを進化させるナビゲーション2024/3/1
LLMから得た意味知識と学習ベースの物体親和性を動的に融合し、未知環境での物体ゴールナビゲーションの汎化性能を高めるフレームワークLOATを提案した。
- ViTacTip: Design and Verification of a Novel Biomimetic Physical Vision-Tactile Fusion Sensor2024/2/1
- MagicTac: A Novel High-Resolution 3D Multi-layer Grid-Based Tactile Sensor2024/2/1
- Bi-Touch: Bimanual Tactile Manipulation with Sim-to-Real Deep Reinforcement Learning2023/7/1
- NeuronsMAE: A Novel Multi-Agent Reinforcement Learning Environment for Cooperative and Competitive Multi-Robot Tasks2023/3/1
- Tactile-Driven Gentle Grasping for Human-Robot Collaborative Tasks2023/3/1
- Cross-domain Random Pre-training with Prototypes for Reinforcement Learning2023/2/11
- NeuronsGym: A Hybrid Framework and Benchmark for Robot Tasks with Sim2Real Policy Learning2023/2/1
- BRL/Pisa/IIT SoftHand: A Low-cost, 3D-Printed, Underactuated, Tendon-Driven Hand with Soft and Adaptive Synergies2022/6/1
- Deep Reinforcement Learning based Automatic Exploration for Navigation in Unknown Environment2020/7/1