Cewu Lu
Shanghai Jiao Tong University
収録論文 121本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FP2: ロボット基盤モデルに力制御を付与する軽量インターフェース力制御2026/9/29
タスク適応済みのロボット基盤モデルに、高頻度の力制御ポリシーを組み合わせて接触の多い操作を安定化させる軽量な下流インターフェースFP2を提案し、実機4タスクで性能と力調整の品質を改善した。
- HIRE: 視覚的に曖昧な精密マニピュレーションのための履歴条件付きインタラクション推論と高速実行マニピュレーション2026/9/25
力覚の履歴から接触状態を推論する低レート推論器と、接触動作を高レートで精密実行する実行器を組み合わせ、見た目が同じでも状態が異なる精密操作を実現したフレームワーク。
- PredActor: 予測的行動拡散による操縦可能なオンボードヒューマノイド制御ヒューマノイド制御2026/9/21
固有感覚のみを用いて行動と将来状態軌道を同時生成し、テスト時にも目標へ操縦できるヒューマノイド制御ポリシーを提案。
- 視覚運動ポリシーにおける視覚的身体依存性の再考VLA2026/9/15
視覚運動ポリシーがロボットの見た目に依存しすぎる問題(VED)に対し、3D点群で身体を正規化する手法を提案し、人間からロボットへの転移性能を向上させた。
- Track4Action: 世界中心の3Dトラッカーを視覚言語行動ポリシーに蒸留するVLA2026/8/1
行動ラベルにはロボットの動作指示しか含まれないが、デモ動画のフレーム遷移には3D世界の変化が含まれる。この遷移を凍結した3Dトラッカーから蒸留し、推論時にトラッカー不要のVLAポリシーを学習するフレームワークを提案。シミュレーションと実機で精度が向上した。
- 疲労を考慮したキャラクター制御キャラクターアニメーション2026/8/1
物理シミュレーションで人間らしい動きを再現するため、疲労を有限なエネルギー源の代理として導入し、疲労状態に応じた一般的な動作模倣ポリシーを獲得した。
- 解析的概念による明示的運動学的ガイダンスを用いた視覚言語行動モデルVLA2026/7/1
VLAモデルに3D構造情報を組み込むため、物体を明示的なプログラム的設計図として表現する解析的概念を構築し、密な報酬と空間的ガイダンスで微調整を支援する手法を提案した。
- 力の注入に遅すぎることはない:反応的力注入によるVLAポストトレーニングの加速VLA/力覚/接触操作2026/7/1
事前学習済みの視覚言語行動(VLA)ポリシーに、接触反応性を追加するフレームワークLIFTを提案。力覚メモリとゼロ初期化クロスアテンションで反応的アクション専門家を移植し、オンラインDAggerループで分布シフトに対処。タオル折り、本挿入、ハノイの輪配置で性能向上を実証。
- 遅延対応ガイダンス融合による非同期マルチモーダル拡散ポリシー合成模倣学習/拡散ポリシー/マルチモーダル2026/7/1
異なるセンシングレートや推論遅延を持つ複数のモダリティを、各ポリシーが本来の速度で動作しつつ遅延を補正して融合するフレームワークLAG-Fusionを提案し、接触を伴う操作タスクで有効性を示した。
- FA-RDP: 接触を伴う操作のための周波数適応型リアクティブ拡散ポリシーマニピュレーション2026/7/1
接触前後の異なるフェーズで必要とされる動作の多様性と反応性のトレードオフを解決するため、周波数適応型の拡散ポリシーを提案。接触前は低周波・多段サンプリングで多様性を保持し、接触後は高周波・一段サンプリングで素早い反応を実現する。
- AnyDexRT: 較正不要で数回の人間ガイダンスによる器用な手のリターゲティング遠隔操作/リターゲティング2026/7/1
AnyDexRTは、人間の手の動きをロボットハンドにマッピングする際に、較正や手動調整を不要にし、数回の人間の指示で直感的な遠隔操作を実現する手法を提案した。
- 多様な経験によるスケーリング:視覚言語行動モデルのための手法VLA2026/6/8
視覚言語行動モデルの実世界展開における課題を解決するため、意図分離アルゴリズムと類似サンプル誘導型強化学習を導入し、ロボットタスクとマルチモーダルベンチマークで優れた性能を達成した。
- ロボット操作における関節部品知覚の再考知覚/操作2026/6/6
関節部品の幾何学的構造を抽象化した「GPS」表現を提案し、VRデバイスで1分間の注釈で高品質なデータを収集、単一RGB-D画像から汎用的なGPSモデルを学習して操作に応用した。
- GeoAlign: セマンティクスを超えた状態誘導による空間的位置合わせをVLAモデルに導入VLA2026/6/1
VLAモデルにロボットの状態情報を利用した幾何学的特徴の位置合わせ機構を導入し、操作タスクの成功率を向上させた。
- ChronoFlow-Policy: 視覚運動ポリシー学習における過去・現在・未来の相互作用フローの統合VLA2026/6/1
物体とグリッパーの3Dキーポイントを用いて過去・現在・未来の相互作用ダイナミクスを統一的に表現するChronoFlowを導入し、これを拡散ベースの視覚運動ポリシーと共学習させることで、長期的・非マルコフ的操作タスクでの性能を向上させた。
- 分析的概念中心メモリによるエージェント型身体操作マニピュレーション2026/6/1
長期的な身体操作タスクのために、物体の状態やスキルを構造化された概念で記憶・検索するメモリフレームワークを提案し、タスク成功率や汎化性能を向上させた。
- PO-PDDL: 視覚デモから記号的POMDPを学習し不確実性下でのロボット計画を実現計画/不確実性2026/6/1
実ロボットの視覚デモから、部分観測と確率的行動を扱える記号的POMDPモデルを自動学習し、不確実性下でのタスク計画を可能にする手法を提案した。
- FTP-1: 触覚センサを横断する接触リッチ操作のための汎用基盤触覚ポリシー触覚/基盤モデル2026/6/1
多様な触覚センサとロボット構成に対応する初の汎用基盤触覚ポリシーFTP-1を提案し、約3000時間のデータで事前学習して未見センサへの転移を実証した。
- OpenEAI-Platform: オープンソースの具現化人工知能ハードウェア・ソフトウェア統合プラットフォームVLA/ロボットアーム/オープンソース2026/6/1
低コストの6+1自由度ロボットアームと再現可能なVLAモデルを統合した完全オープンソースのプラットフォームを提案し、実世界の操作タスクで商用アームや大規模事前学習モデルと同等以上の性能を示した。
- X-Imitator: 双方向アクション・ポーズ相互作用による空間認識模倣学習模倣学習2026/5/1
空間認識と行動生成を双方向ループで結びつけ、相互に洗練させる新しい模倣学習フレームワークを提案。24のシミュレーションと3つの実世界タスクで性能を実証した。
- LIDEA: 暗黙的特徴蒸留と明示的幾何学的整合による人間からロボットへの模倣学習模倣学習2026/4/1
人間のデモ動画を利用してロボットの模倣学習を効率化するため、2D特徴蒸留と3D幾何学的整合を組み合わせたフレームワークLIDEAを提案した。
- ActiveGlasses: 自己中心的な人間のデモから能動視覚で操作を学習する操作学習2026/4/1
スマートグラスに取り付けたステレオカメラで人間のデモを収集し、同じカメラをロボットの知覚アームに搭載して能動視覚を再現することで、ロボット操作をゼロショット転移で学習するシステムを提案した。
- ForceVLA2: 力認識によるハイブリッド力-位置制御で接触を伴う操作を実現VLA/操作2026/3/1
接触を伴う操作のための視覚言語行動モデルに、力認識とハイブリッド力-位置制御を導入し、成功率を大幅に向上させた。
- RL強化テレオペレーションと巧みな専門家混合VLAによる人間らしい操作の実現VLA/巧緻操作/触覚2026/3/1
高自由度の両手巧緻操作を可能にするため、RLで訓練した原子スキルによるデータ収集支援と、触覚・力覚を統合したVLAアーキテクチャを提案し、接触を伴う複雑タスクで成功率を2倍に向上させた。
- RoboPocket: スマホでロボットポリシーを即座に改善模倣学習2026/3/1
スマートフォンとARを用いて、物理ロボットを使わずに模倣学習のデータ収集を効率化し、ポリシーを即時改善するシステムを提案した論文。
- I-Perceive: 言語指示に基づく能動的知覚のための基盤モデル能動的知覚2026/3/1
ロボットが言語指示に従って視点を能動的に調整する能動的知覚の基盤モデルを提案し、大規模環境でのオープンエンドな指示に応じたカメラ視点予測を実現した。
- カメラ選択の再考:ロボット操作における魚眼カメラ特性の実証研究模倣学習/カメラ特性2026/3/1
ロボット操作における手首搭載魚眼カメラの特性を、シミュレーションと実世界の実験で体系的に分析し、空間定位、シーン汎化、ハードウェア汎化への影響を明らかにした。
- VTAM:視覚と言語を超え、触覚を統合したビデオ・触覚・行動モデルVLA2026/3/1
映像から行動を予測するVAMに触覚を追加し、接触の多い繊細な操作を安定化させるマルチモーダル世界モデルを提案。ポテトチップスの把持などで大幅な性能向上を実現。
- LaMP: 3Dシーンフローを潜在運動事前分布として用いる視覚-言語-行動ポリシーの学習VLA2026/3/1
3Dシーンフローを潜在的な運動事前分布として組み込んだ二重エキスパート型VLAフレームワークを提案し、LIBEROや実機実験で従来手法を上回る成功率とOOD頑健性を達成した。
- UniPlan: 統合PDDL定式化による移動マニピュレーションの視覚言語タスクプランニングVLA2026/2/1
大規模屋内環境での長期的な移動マニピュレーションのため、シーン構造・視覚情報・ロボット能力をPDDLに統合し、VLMで物体を接地して既存のPDDLソルバで計画を生成するシステムを提案した。
- HiWET: 長期的なヒューマノイド移動操作のための階層型ワールドフレームエンドエフェクタ追従移動操作2026/2/1
ヒューマノイドの移動操作をワールド座標系でのエンドエフェクタ追従問題として再定式化し、高レベル方策がサブゴールを生成、低レベル方策が安定性制約下で実行する階層型強化学習フレームワークを提案。運動学的マニフォールド事前分布により探索を効率化し、実機へのゼロショット転移も実証した。
- 軌道ではなく意図を模倣せよ模倣学習2026/2/1
模倣学習において、行動の意図と実行の詳細を周波数空間でのマルチスケールトークン化により分離し、意図トークンを用いた転移と適応を可能にする手法MINTを提案。
- 力方策:接触リッチ操作のための相互作用フレーム下でのハイブリッド力・位置制御方策の学習マニピュレーション2026/2/1
視覚で自由空間動作を導き、接触時には力フィードバックを用いた高頻度ローカル方策が相互作用フレームを推定してハイブリッド力・位置制御を行う、グローバル・ローカル視覚力方策を提案。
- どんな家でもどんなタスクでも:抽象的ヒューマンタスクのためのスケーラブルな長期計画タスク計画2026/2/1
大規模家庭環境での曖昧な指示に対応するため、LLMで指示とシーングラフをPDDLサブゴールに変換し、記号推論で長期計画を生成する手法AHATを提案。中間推論の外部修正をGRPOに統合したTGPOで性能を向上。
- ImplicitRDP: 構造的スローファスト学習による視覚-力覚拡散ポリシーVLA2025/12/1
視覚と力覚を単一ネットワークで統合し、非同期トークンを因果注意で処理する拡散ポリシーを提案。接触の多い操作タスクで高い反応性と成功率を実現した。
- 効率的な視覚運動学習のためのL1サンプルフロー模倣学習2025/11/1
フローマッチングの多峰性を保ちつつ、L1回帰の効率性を活かすため、2ステップでサンプリングするL1 Flowを提案し、模倣学習ベンチマークで有効性を示した。
- RealD²iff: 深度拡散によるロボットマニピュレーションの実世界ギャップの橋渡しsim2real2025/11/1
拡散モデルでシミュレーションのクリーンな深度から実機のようなノイズ深度を合成し、実機データ収集なしでゼロショットsim2realマニピュレーションを実現した研究。
- VLMの洞察と精密マニピュレーションを繋ぐ実行可能な解析概念マニピュレーション2025/10/1
VLMの高レベル推論を、数学的に定義された「実行可能な解析概念」を介して把持姿勢や力方向・軌道計画に変換し、未学習の物体でも精密操作を可能にするフレームワークGRACEを提案。
- ARMADA: 自律的オンライン失敗検出と人間共有制御によるスケーラブルな実世界展開と適応sim2real2025/10/1
模倣学習ポリシーの実世界展開において、オンライン失敗検出(FLOAT)と人間共有制御を組み合わせ、必要な時だけ人間が介入するマルチロボット適応システムを提案。成功率4倍以上、人間介入率2分の1以下を実現。
- 裏返しロボット:ゼロショットSim-to-Realによる衣類の裏返し操作マニピュレーション2025/9/1
衣類を裏返す動的で遮蔽の多いタスクを、タスク分解とGPU並列MPMシミュレータによる自動データ生成で解決し、実機で最大81.3%の成功率を達成したゼロショットsim-to-realフレームワーク。
- FSGlove:形状認識キャリブレーションを備えた慣性式ハンドトラッキングシステム触覚2025/9/1
各指関節と手背にIMUを装着し、最大48自由度の手の動きを追跡しながら、微分可能最適化によるキャリブレーションで個人の手形状も同時に再構成する慣性式モーションキャプチャシステムを提案した。
- SOE: 多様体上探索によるサンプル効率の良いロボット方策の自己改善マニピュレーション2025/9/1
タスクに関連する要因を潜在空間で表現し、有効な行動の多様体上に探索を制約することで、安全かつ効率的にロボット方策を自己改善するフレームワークを提案した。
- TrajBooster: 軌道中心学習によるヒューマノイド全身マニピュレーションの強化VLA2025/9/1
車輪型ヒューマノイドの豊富なデータを活用し、エンドエフェクタ軌道を形態非依存のインターフェースとして二足歩行ヒューマノイドのVLAを効率的に学習させるフレームワークを提案。
- 点追跡による履歴認識型視覚運動ポリシー学習マニピュレーション2025/9/1
点追跡を用いて過去の観測を物体中心の履歴表現に圧縮し、視覚運動ポリシーに組み込むことで、記憶を要する操作タスクの性能を向上させた研究。
- 量子化された手の状態で巧みなマニピュレーションを学習するマニピュレーション2025/9/1
手の状態を量子化してコンパクトに表現し、腕の動作と統合的に拡散させることで、腕と手の協調を効率的に学習する視覚運動方策DQ-RISEを提案した。
- FBI: 動的な視触覚ショートカット方策による巧みな把持内操作の学習マニピュレーション2025/8/1
触覚信号と物体運動の因果関係を動的潜在モデルで捉え、視覚と触覚を動的に融合する模倣学習フレームワークFBIを提案し、把持内操作タスクで性能を向上させた。
- AgentWorld: 家庭内移動マニピュレーションのための対話型シミュレーションプラットフォームsim2real2025/8/1
家庭内での移動マニピュレーションを学習するため、自動シーン構築と遠隔操作によるデータ収集を統合したシミュレーションプラットフォームを提案し、模倣学習手法のベンチマークを通じてsim-to-real転移への有効性を示した。
- ArtGS: 3Dガウシアンスプラッティングによる関節物体の視覚・物理モデリングと操作マニピュレーション2025/7/1
3Dガウシアンスプラッティングに視覚言語モデルと微分可能レンダリングを組み合わせ、関節物体の構造を推定して操作方策を最適化するフレームワークを提案。
- UniDomain: 実世界デモンストレーションからの統一PDDLドメイン事前学習による汎化可能なロボットタスクプランニングタスクプランニング2025/7/1
12,393本の操作動画から原子PDDLドメインを抽出し、統一ドメインを事前学習して、未知タスクをゼロショットで計画できるフレームワークを提案した。
- Tru-POMDP: 仮説の木とオープンエンドPOMDPによる不確実性下のタスク計画タスク計画2025/6/1
LLMで仮説の木を構築し、オープンエンドなPOMDP計画と組み合わせることで、曖昧な指示や未知の物体配置に対応する家庭用ロボットのタスクプランナを提案した。
- 知識駆動型模倣学習:多様な条件への汎化を実現する模倣学習2025/6/1
外部の構造的意味知識を活用して物体表現を抽象化し、少ない実演データでロボットマニピュレーションの汎化性能を高める知識駆動型模倣学習を提案した。
- SIME: モーダルレベル探索による方策の自己改善模倣学習/自己改善2025/5/1
ロボットが人間のデータから初期学習した後、環境との相互作用を通じて自己改善するために、モーダルレベルの探索とデータ選択を組み合わせた手法を提案し、シミュレーションと実機で有効性を示した。
- ForceVLA:力覚対応MoEで接触の多いマニピュレーションを強化するVLAモデルマニピュレーション2025/5/1
外部力覚をVLAの第一級モダリティとして扱い、力覚対応のMixture-of-Experts融合モジュールで視覚言語埋め込みと6軸力フィードバックを統合する操作フレームワークを提案し、接触の多いタスクの成功率を23.2%向上させた。
- ガウススプラッティングによる新規デモ生成で実現するロバストなワンショットマニピュレーションマニピュレーション2025/4/1
3Dガウススプラッティングで再構成したシーンを直接編集し、多様で視覚的にリアルなデモを生成することで、ワンショット設定での視覚運動政策の汎化性能を大幅に向上させる手法RoboSplatを提案。
- デジタル遺伝子:解析的概念を通じて物理世界を学ぶ物理世界理解2025/4/1
物理世界の概念を数理的手続きのプログラムとして表現する「解析的概念」を提唱し、機械知能が物理世界を認識・推論・相互作用するための枠組みと基盤を提案する。
- DexTOG: 言語指示に基づくタスク指向の巧みな把持学習マニピュレーション2025/4/1
言語ガイド付き拡散モデルで多指ハンドのタスク指向把持を生成する枠組みDexTOGを提案し、80物体・5カテゴリの新データセットDexTOG-80Kを構築した。
- 反応的拡散ポリシー:接触の多い操作のための低速・高速視触覚ポリシー学習視触覚模倣学習2025/3/1
拡散ポリシーで低速に行動チャンクを生成し、高速な触覚トークナイザで閉ループ制御する視触覚模倣学習手法を提案し、接触の多い操作タスクでの性能を向上させた。
- Dense Policy:双方向自己回帰による行動学習マニピュレーション2025/3/1
軽量なエンコーダのみのアーキテクチャで行動系列を粗から細へと対数的な推論時間で展開する、双方向自己回帰型のロボットマニピュレーション方策を提案。
- AirExo-2:低コスト外骨格による汎化可能なロボット模倣学習のスケールアップ模倣学習2025/3/1
低コストの外骨格システムAirExo-2で実世界の大規模デモンストレーションデータを収集し、それを擬似ロボットデータに変換して、3D空間と2D意味論を融合する模倣学習ポリシーRISE-2を訓練した。
- 解析的概念による関節物体操作のための物理的に接地された常識知識マニピュレーション2025/3/1
MLLMが推論した意味レベルの常識知識を、数学的に定義された解析的概念を介して物理世界に接地し、関節物体の汎用的な操作を可能にする手法を提案した。
- AnyDexGrasp: 異なるハンドに汎用な高効率学習による器用把持マニピュレーション2025/2/1
接触中心の中間表現を介してハンド非依存の把持モデルを学習し、各ハンド固有の把持決定モデルを実機試行錯誤で少数データから訓練することで、複数のロボットハンドで高成功率の把持を実現した。
- Arti-PG: 多様な関節物体を大規模に手続き生成するツールボックス関節物体生成2024/12/1
関節物体の3Dデータと詳細なアノテーションを手続き的に大量生成するツールボックスArti-PGを提案し、26カテゴリの物体生成を実現した。
- 把持姿勢の事前知識を活用した巧みな操作マニピュレーション2024/12/1
物体の機能部位に対する巧みな把持姿勢を事前知識として生成し、その後の操作を強化学習で探索することで、学習効率と成功率を高める手法を提案した。
- 行動の前に動作を:物体運動をマニピュレーション条件として拡散する手法マニピュレーション2024/11/1
観測から物体の将来の姿勢系列を予測し、それを条件としてロボットの行動系列を拡散生成するプラグアンドプレイ型モジュールMBAを提案し、模擬・実環境で既存方策の性能を大幅に向上させた。
- ConceptFactory: 物体概念化による3D物体知識アノテーションの効率化3D認識/アノテーション2024/11/1
3D物体を一般的な幾何概念で認識する「物体概念化」により、視覚とロボティクスの両面で物体知識を効率的にアノテーションするツールボックスと大規模データセットを提案。
- FoAR: 接触の多いロボットマニピュレーションのための力覚対応リアクティブポリシーマニピュレーション2024/11/1
力/トルクセンシングと視覚入力を組み合わせ、将来の接触予測に基づいて力データの利用を動的に調整するリアクティブポリシーを提案し、接触の多いタスクでの性能を向上させた。
- ForceMimic: 力中心の模倣学習と力・動作キャプチャシステムによる接触の多いマニピュレーションマニピュレーション2024/10/1
人間の力加減を計測する装着型デバイスで野菜の皮むきなどの接触作業のデモを集め、力と位置を同時に扱う模倣学習でロボットに教える手法を提案。視覚のみの手法より成功率を54.5%向上させた。
- DeformPAM:選好ベースの行動整合による変形物体の長期的操作のためのデータ効率学習マニピュレーション2024/10/1
人間の選好データから報酬モデルを学習し、拡散モデルで生成した複数候補行動を報酬で選別することで、変形物体の長期的操作を少ないデータで高精度に実現する枠組みを提案。
- CAGE: 因果アテンションによるデータ効率的で汎化可能なロボットマニピュレーションマニピュレーション2024/10/1
視覚基盤モデルDINOv2と因果アテンションを組み合わせ、50回程度の実演から未知環境でも汎化できるロボット操作ポリシーを提案した。
- ImDy: 模倣観測からの人間逆動力学逆動力学2024/10/1
人間の動作模倣アルゴリズムと物理シミュレータを組み合わせて大規模な逆動力学データセットImDyを構築し、関節トルクと床反力を同時推定するデータ駆動型ソルバを学習した研究。
- 解析的オントロジーテンプレートによる関節物体の概念的知識の発見関節物体理解2024/9/1
関節物体の構造とアフォーダンスに関する概念的知識を、実データなしで発見するためのパラメータ化・微分可能なプログラム記述「解析的オントロジーテンプレート(AOT)」と、それに基づくAOTNetを提案した。
- SAM2ベースのトラッキングとオンライン軸推定による関節物体マニピュレーションマニピュレーション2024/9/1
SAM2で動的部分を追跡しながら3D点群から関節軸をオンライン推定し、関節物体を閉ループで操作する手法を提案した論文。
- SKT: 状態認識キーポイント軌道と視覚言語モデルを統合したロボット衣類操作衣類操作/VLA2024/9/1
視覚言語モデル(VLM)を用いて、多様な衣類の状態を単一モデルで認識しキーポイントを予測することで、ロボットによる衣類操作を汎用的に実現する手法を提案した。大規模合成データで学習し、キーポイント検出精度とタスク成功率を向上させた。
- UniAff:視覚言語モデルによる道具使用と関節物体操作のためのアフォーダンス統合表現マニピュレーション2024/9/1
道具と関節物体の操作を統一的に扱うため、アフォーダンス認識と3D運動制約の推論を視覚言語モデルで行う手法UniAffを提案し、シミュレーションと実世界で汎化性能を向上させた。
- セグメント単位の選択と最適化によるロボットマニピュレーションにおける混合品質デモンストレーションの有効活用マニピュレーション2024/9/1
ロボットマニピュレーションの混合品質デモデータをセグメント単位で選別・最適化し、既存の政策にプラグアンドプレイで組み込めるフレームワークS2Iを提案。
- Kalib: 参照点追跡による簡単なハンドアイキャリブレーションキャリブレーション2024/8/1
視覚基盤モデルを活用し、ロボットの参照点を追跡することで、マーカーや再学習なしにカメラとロボット間のキャリブレーションを自動化する手法を提案。
- 多指把持のための驚くほど効率的な表現マニピュレーション2024/8/1
多指ハンドでの把持を効率的に学習するための新しい表現を提案し、少ない実機試行で高い把持成功率を達成した。
- DiPGrasp: 効率的な微分可能把持計画のための並列局所探索マニピュレーション2024/8/1
力閉包に基づく把持品質指標を勾配最適化し、並列サンプリングと衝突処理を組み合わせることで、様々な自由度のグリッパに対応する高速で微分可能な把持計画手法を提案した。
- TieBot: 実世界-シミュレーション-実世界アプローチによる視覚デモンストレーションからのネクタイ結び学習変形物体マニピュレーション2024/7/1
ネクタイの変形と長期的な操作が難しいネクタイ結びを、実演動画からメッシュ列を推定し、教師方策と生徒方策を学習して実機に転移するReal-to-Sim-to-Realシステムを提案。実機で双腕ロボットが10回中5回成功。
- 人間とエージェントの共同学習による効率的なロボットマニピュレーションスキル獲得マニピュレーション2024/7/1
人間と学習型アシストエージェントがロボットの制御を共有し、データ収集とロボットの訓練を同時に行うことで、効率的にマニピュレーションスキルを獲得するシステムを提案した。
- 散乱環境における把持可能性の発見による高速かつ高精度な把持姿勢検出マニピュレーション2024/6/1
散乱環境で把持しやすい領域を「graspness」として定義し、それを予測するニューラルネットワークGSNetを提案。従来手法より大幅に高精度・高速な6DoF把持姿勢検出を実現した。
- HumanVLA:視覚言語指示による物理ヒューマノイドの物体再配置VLA2024/6/1
視覚と言語の指示に従って物理ヒューマノイドが物体を再配置するためのVLAモデルを、教師方策の蒸留により構築し、新データセットで有効性を示した。
- DiffGen: 微分可能物理シミュレーション・微分可能レンダリング・視覚言語モデルによるロボット実演生成sim2real2024/5/1
微分可能な物理シミュレーションとレンダリング、視覚言語モデルを組み合わせ、自然言語指示からロボットの実演データを自動生成するフレームワークを提案。
- MS-MANO: 生体力学的制約を考慮した手姿勢トラッキング手姿勢推定2024/4/1
筋骨格系とMANOを統合したMS-MANOモデルと姿勢精緻化フレームワークBioPRを提案し、生理学的に自然な手姿勢トラッキングを実現した。
- RISE: 3D知覚で実世界ロボット模倣をシンプルかつ効果的に模倣学習2024/4/1
単一視点の点群から連続的なロボット動作を直接予測するエンドツーエンドの模倣学習手法を提案し、2D・3Dの既存手法を大きく上回る精度と効率を実現した。
- RH20T-P: 組み合わせ可能な汎化エージェントに向けたプリミティブレベルロボットデータセットマニピュレーション2024/3/1
ロボット操作のための約3.8万本の動画クリップからなるプリミティブレベルデータセットRH20T-Pを構築し、計画実行型の組み合わせ汎化エージェントのベースラインを実装した。
- ManiPose: 姿勢を考慮した物体操作のための包括的ベンチマークマニピュレーション2024/3/1
物体の6D姿勢に応じて把持や操作を適応させる「姿勢考慮型物体操作」の研究を進めるため、シミュレーション環境・大規模データセット・LLM活用ベースラインを提供するベンチマークを構築した。
- RPMArt: 関節物体のためのロバストな知覚とマニピュレーションマニピュレーション2024/3/1
ノイズの多い点群から関節パラメータと把持可能点を推定し、シミュレーションのみの学習で実世界の関節物体をゼロショットで操作できるフレームワークを提案。
- Foundation Models in Robotics: Applications, Challenges, and the Future2023/12/1
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI2023/12/1
- Differentiable Cloth Parameter Identification and State Estimation in Manipulation2023/11/1
- UniFolding: Towards Sample-efficient, Scalable, and Generalizable Robotic Garment Folding2023/11/1
- TacIPC: Intersection- and Inversion-free FEM-based Elastomer Simulation For Optical Tactile Sensors2023/11/1
- RFTrans: Leveraging Refractive Flow of Transparent Objects for Surface Normal Estimation and Manipulation2023/11/1
- Precise Robotic Needle-Threading with Tactile Perception and Reinforcement Learning2023/11/1
- Intersection-free Robot Manipulation with Soft-Rigid Coupled Incremental Potential Contact2023/11/1
- Differentiable Fluid Physics Parameter Identification Via Stirring2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- AirExo: Low-Cost Exoskeletons for Learning Whole-Arm Manipulation in the Wild2023/9/1
- GAMMA: Generalizable Articulation Modeling and Manipulation for Articulated Objects2023/9/1
- Flexible Handover with Real-Time Robust Dynamic Grasp Trajectory Generation2023/8/1
- ClothesNet: An Information-Rich 3D Garment Model Repository with Simulated Clothes Environment2023/8/1
- RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot2023/7/1
- GarmentTracking: Category-Level Garment Pose Tracking2023/3/1
- AnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal Domains2022/12/1
- SAM-RL: Sensing-Aware Model-Based Reinforcement Learning via Differentiable Physics-Based Simulation and Rendering2022/10/1
- RCareWorld: A Human-centric Simulation World for Caregiving Robots2022/10/1
- Unseen Object 6D Pose Estimation: A Benchmark and Baselines2022/6/1
- CPPF: Towards Robust Category-Level 9D Pose Estimation in the Wild2022/3/1
- TransCG: A Large-Scale Real-World Dataset for Transparent Object Depth Completion and a Grasping Baseline2022/2/1
- RFUniverse: A Multiphysics Simulation Platform for Embodied AI2022/2/1
- SAGCI-System: Towards Sample-Efficient, Generalizable, Compositional, and Incremental Robot Learning2021/11/1
- Towards Real-World Category-level Articulation Pose Estimation2021/5/1
- H2O: A Benchmark for Visual Human-human Object Handover Analysis2021/4/1
- SuctionNet-1Billion: A Large-Scale Benchmark for Suction Grasping2021/3/1
- RGB Matters: Learning 7-DoF Grasp Poses on Monocular RGBD Images2021/3/1
- Transferable Active Grasping and Real Embodied Dataset2020/4/1
- GraspNet: A Large-Scale Clustered and Densely Annotated Dataset for Object Grasping2019/12/1
- Transferable Force-Torque Dynamics Model for Peg-in-hole Task2019/12/1
- 6-PACK: Category-level 6D Pose Tracker with Anchor-Based Keypoints2019/10/1
- DenseFusion: 6D Object Pose Estimation by Iterative Dense Fusion2019/1/1