Hao Dong
University of Southern California
収録論文 114本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Rolling-WAM: 転がる想像による世界行動モデルVLA2026/9/24
ロボット操作のための世界行動モデルにおいて、映像と行動のノイズ除去を再計画サイクルごとに分割して行うことで、計算遅延を抑えつつ4.5倍の再計画高速化を実現した手法。
- BiRoAD: 双腕マニピュレーションのための共有・役割適応表現学習マニピュレーション2026/9/20
双腕ロボットの動作を「腕交換で不変な協調構造」と「役割に応じて変化する成分」に分解し、役割の偏りに頑健な模倣学習を可能にする特徴変換フレームワークを提案。
- HIL-UMI: ユニバーサルマニピュレーションインターフェースへのVLAモデルのヒューマン・イン・ザ・ループ事後学習の導入VLA2026/9/17
ロボットを使わずにハンドヘルドUMIデモ中に方策を照会し、Energy Scoreで分布外状態を検出してデータ収集を促し、アドバンテージ推定器を更新してVLAモデルを事後学習する枠組みを提案。
- OpenDexGrasp: オープン語彙のタスク指向巧み把持マニピュレーション2026/9/16
自由形式の言語指示から機能意図を推論し、多視点視覚と物体形状に基づいて高自由度の巧みな把持を生成する統合フレームワークを提案。
- OpenWAM: 体系的な世界行動モデル事前学習に向けたオープンでモジュール型の探求VLA2026/9/7
世界行動モデルの設計空間をモジュール化し、制御実験を通じて設計原則を抽出・検証するオープンな研究基盤を構築した。
- 1500時間のデモからオン方針修正までの両腕家庭操作のスケーリング両腕操作/VLA/データセット2026/9/3
家庭内両腕操作タスクの1500時間のデモデータセットを公開し、VLAモデルXR-2を訓練。データ量とDAgger修正データの増加に伴い成功率が向上するスケーリング傾向を実証した。
- データ合成と統合プランニングによるマニュアル基盤の家電操作のスケーリング操作プランニング2026/8/16
家電のマニュアルから部品接地・長期プランニング・閉ループ回復データを自動生成するパイプラインMAGEと、それを用いた大規模データセットUseAppliance、およびエンドツーエンドモデルAppliancePlanを提案し、実ロボットで有効性を実証した。
- VTInstructor: 連続環境におけるナビゲーション指示生成のための視覚的軌跡プロンプティングVLA2026/8/15
連続環境でのRGB映像からナビゲーション指示を生成する初のフレームワークを提案し、軌跡の幾何学を視覚的プロンプトに変換して指示生成の精度を大幅に向上させた。
- FlatLab: 平板物体のロボット操作のための統一手法フレームワークとシミュレーションベースのベンチマークマニピュレーション2026/8/14
平板物体の操作を戦略生成と行動実行に分離する統一フレームワークを提案し、多様な物体に汎化する手法と、その評価のための高忠実シミュレーションベンチマークFlatLabを導入した。
- 疎と密の融合:剛体-変形体相互作用を伴うロボット操作の対応関係に基づく手法マニピュレーション2026/8/1
剛体と変形体が相互作用する操作タスク(衣類掛けや着衣補助など)のために、タスク固有の疎なキーポイントと変形体上の密な対応関係を組み合わせたハイブリッド表現を提案し、正確なキーポイント追跡と汎化を実現する。
- Mimir: インタラクティブ環境における身体化エージェントのための動的グラウンディングを備えたニューロシンボリック記憶システム身体化エージェント/記憶システム2026/8/1
身体化エージェントの長期タスク遂行を改善するため、世界記憶とタスク記憶を分離し、行動前に動的にグラウンディングするニューロシンボリック記憶システムMimirを提案した。
- Jetson-PI: 先読み整合非同期推論による搭載リアルタイムロボット制御の実現VLA/エッジ推論2026/7/1
低消費電力の搭載デバイス上でVLAモデルを高速に動作させるため、非同期推論の課題を解決する先読み整合補正と信頼度ベースのスケジューリングを提案した論文。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- Embodied3DBench: 視覚言語モデルの低水準身体化空間知能のベンチマークVLA/ベンチマーク2026/5/1
視覚言語モデルの身体化3D環境における低水準空間知能を評価するベンチマークを提案し、13モデルの評価と大規模データセットによる改善を示した。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- HeteroGenManip: 異種物体間インタラクションのための汎用操作マニピュレーション2026/5/1
異なる種類の物体が関わる操作タスクを、把持位置の特定とその後の動作計画を分離した2段階フレームワークで解決し、カテゴリ特化モデルと拡散ポリシーを組み合わせて汎化性能を向上させた。
- SUGAR: 人間ビデオ駆動のスケーラブルな汎用ヒューマノイド移動操作学習フレームワーク移動操作2026/5/1
人間のビデオから不完全な動作プリエントを抽出し、物理ベースのリファイナーで修正してから、階層的な自律ポリシーに蒸留することで、タスク固有の報酬設計やテレオペレーションなしにヒューマノイドの移動操作スキルを学習するフレームワークを提案した。
- AT-VLA: 適応的触覚注入による視覚言語行動モデルのフィードバック反応向上VLA/触覚/操作2026/5/1
接触を伴う操作タスクで視覚言語行動モデルの性能を高めるため、適応的に触覚情報を注入する仕組みと、高速な触覚反応を可能にする二重ストリーム構造を提案した。
- HiPolicy: 階層型マルチ周波数アクションチャンキングによるポリシー学習模倣学習2026/4/1
ロボットの模倣学習において、長期的な依存関係のモデリングと細かい閉ループ制御のトレードオフを解決するため、異なる周波数でアクション系列を予測する階層型マルチ周波数アクションチャンキングフレームワークを提案した。
- IPD: オフライン強化学習における想像的計画蒸留による逐次方策の強化オフライン強化学習2026/3/4
オフライン強化学習の逐次方策モデルに対し、世界モデルと準最適価値関数を用いて劣った軌道を特定し、想像上の最適ロールアウトを生成してデータ拡張と蒸留を行う新しい枠組みIPDを提案した。
- AnchorVLA4D: ロボット操作のためのアンカーベース時空間視覚言語行動モデルVLA/操作2026/3/1
視覚アンカーを用いて、操作中の空間認識と時間的文脈を強化する新しいVLAモデルを提案。初期シーンのアンカー画像と軽量な空間エンコーダを追加し、追加センサなしで性能を向上させた。
- GraspALL: 任意の低照度環境下でのロボット衣類把持のための照明変動適応型構造補償マニピュレーション2026/3/1
照明が動的に変化する低照度環境でもロバストに衣類を把持できるよう、RGBと非RGBモダリティの特徴を照明強度に応じて適応的に融合するモデルGraspALLを提案した。
- RMBench:記憶依存型ロボットマニピュレーションのベンチマークと政策設計への洞察マニピュレーション2026/3/1
記憶を必要とするロボット操作タスクを体系的に評価する9タスクのシミュレーションベンチマークRMBenchと、明示的記憶モジュールを持つ操作政策Mem-0を提案し、既存政策の記憶限界と設計指針を明らかにした。
- BiPreManip: 予期的協調によるアフォーダンスに基づく両腕準備的操作の学習両腕操作2026/3/1
直接掴みにくい物体や機能的操作が難しい物体に対して、一方の腕が準備的操作を行い他方の腕の目標動作を可能にする両腕協調タスクを扱い、視覚アフォーダンスに基づくフレームワークを提案した。
- FreeArtGS: 自由移動シナリオにおける関節物体のガウシアンスプラッティング再構成3D再構成2026/3/1
単眼RGB-Dビデオから自由に動く関節物体を再構成する新しい手法を提案。部品分割と関節推定を組み合わせ、エンドツーエンドで最適化する。
- GarmentPile++: 視覚言語推論によるアフォーダンス駆動の乱雑な衣類取り出しマニピュレーション2026/3/1
衣類の山から言語指示に従って安全かつ正確に1枚だけを取り出すパイプラインを提案。視覚言語モデルと視覚アフォーダンスを統合し、SAM2によるセグメンテーションとマスク微調整、さらに大型衣類向けの双腕協調を導入した。
- パーツ認識型高密度3D特徴場による汎用的な関節物体マニピュレーションの学習マニピュレーション2026/2/1
関節物体の機能部位を認識する高密度3D特徴場PA3FFを学習し、それを用いた模倣学習フレームワークPADPで汎化性能とサンプル効率を向上させた。
- ユーザー中心物体ナビゲーション:個人の習慣を統合したパーソナライズド物体探索ベンチマーク物体ナビゲーション2026/2/1
個人の物体配置習慣を組み込んだ物体ナビゲーションの新ベンチマークUcONを提案し、習慣検索モジュールで習慣を活用することで成功率が向上することを示した。
- A3D: 双腕マニピュレーションによる適応的アフォーダンス組立マニピュレーション2026/1/1
家具組立のための双腕ロボットフレームワークA3Dを提案し、点群ベースの適応的アフォーダンス学習により多様な部品形状に対応した支持・安定化位置を特定する。
- CADGrasp: 混雑環境における接触・衝突を考慮した汎用巧みな把持の学習マニピュレーション2026/1/1
単視点点群から、接触と衝突を考慮したスパースIBS表現を拡散モデルで予測し、それを用いて混雑環境でも衝突を避けつつ安定した巧みな把持姿勢を生成する二段階手法を提案。
- RealAppliance: 実マニュアルに整合した高忠実度家電アセットの制御可能化と実用化sim2real2025/12/1
実マニュアルと整合する物理・電子機構・プログラムロジックを備えた100種の高忠実度家電アセットデータセットと、家電操作計画を評価するベンチマークを提案した論文。
- Real2Edit2Real: 3D制御インターフェースによるロボット実演の生成sim2real2025/12/1
多視点RGBから3D再構成した点群を編集し、深度を主制御信号とする動画生成モデルで新しい操作実演を合成することで、1〜5件の実演から50件相当のデータを生成しデータ効率を10〜50倍向上させるフレームワーク。
- TwinAligner: 視覚・動的アライメントによる物理認識Real2Sim2Realでロボットマニピュレーションを実現sim2real2025/12/1
シミュレーションと実世界の視覚・動的ギャップをSDF再構成と3DGSレンダリング、剛体物理同定で埋め、シミュレーションで訓練した方策を実世界へゼロショット転移させるReal2Sim2Realシステムを提案。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- InternData-A1:汎用ポリシー事前学習のための高忠実度合成データVLA2025/11/1
大規模シミュレーションで生成した63万軌道超の合成データセットInternData-A1を構築し、合成データのみでVLAモデルを事前学習しても実データと同等の性能が得られることを示した。
- NavSpace:ナビゲーションエージェントの空間知能指示追従ベンチマークナビゲーション2025/10/1
ナビゲーションエージェントの空間知能を評価する6カテゴリ・1228ペアのベンチマークNavSpaceを提案し、22モデルを評価するとともに、新モデルSNavを提案して実機でも優位性を示した。
- SpikeGrasp: ステレオスパイクストリームからの6自由度把持姿勢検出ベンチマークマニピュレーション2025/10/1
ステレオスパイクカメラの生イベントから点群復元なしで直接6自由度把持姿勢を推定する、神経模倣型リカレントスパイキングニューラルネットワークを提案し、大規模合成ベンチマークで従来手法を上回る性能とデータ効率を示した。
- ロバストなロボット汎化のための忠実度を考慮したデータ構成sim2real2025/9/1
生成データ拡張におけるデータ構成を最適化問題として扱うCIFTを提案し、実データと合成データの混合比を情報忠実度に基づいて調整することで、ロボット政策の分布外汎化性能を大幅に向上させた。
- DexFlyWheel:器用なマニピュレーションのためのスケーラブルで自己改善するデータ生成フレームワークマニピュレーション2025/9/1
模倣学習と残差強化学習を組み合わせた自己改善サイクルにより、多様な器用マニピュレーションのデータを自動生成し、ポリシー性能を向上させるフレームワークを提案。
- Imagine2Act: 想像上の目標を用いた物体-動作の運動整合性によるロボットマニピュレーションマニピュレーション2025/9/1
言語指示から想像した目標画像と3D点群を生成し、物体の変形とエンドエフェクタ動作を整合させることで、高精度な物体再配置タスクを実現する模倣学習フレームワークを提案した。
- CorrectNav: 自己修正フライホイールによる視覚言語行動ナビゲーションモデルの強化VLAナビゲーション2025/8/1
訓練中の誤り軌道を自己修正データに自動変換して再学習を繰り返す「自己修正フライホイール」を提案し、単眼RGBベースのVLAナビゲーションモデルCorrectNavでR2R-CEとRxR-CEの成功率を大幅に更新した。
- RwoR: ロボットなしで方策学習するための人間の手の収集からのロボットデモンストレーション生成模倣学習2025/7/1
手首に装着したGoProで人間の手のデモを収集し、生成モデルでロボットグリッパのデモに変換することで、実機ロボットなしに操作方策を学習できる手法を提案。
- 基盤モデルの推論とパーツグラウンディングによる適応的な関節物体操作マニピュレーション2025/7/1
基盤モデルを活用して関節物体をパーツ単位で認識し、そのアフォーダンスからプリミティブスキルを組み合わせて未知カテゴリの物体も操作できるフレームワークAdaRPGを提案した。
- SimLauncher: シミュレーション事前学習によるサンプル効率の高い実世界ロボット強化学習の起動sim2real2025/7/1
デジタルツインシミュレーションで視覚運動ポリシーを事前学習し、その知識を実世界強化学習の価値ブートストラップと行動提案に活用することで、サンプル効率と成功率を大幅に向上させるフレームワークを提案。
- CheckManual: マニュアルに基づく家電操作の新たな挑戦とベンチマークマニピュレーション2025/6/1
家電のマニュアルを読み取り、その指示に従ってロボットが操作を行うためのベンチマークCheckManualを提案し、マニュアルに基づく操作計画モデルManualPlanを構築した。
- ClutterDexGrasp:散らかった環境での汎用器用把持のためのSim-to-Realシステムマニピュレーション2025/6/1
散らかったシーンで目標物体を把持するため、シミュレーションで教師方策を訓練し、3D拡散方策の生徒モデルに蒸留して実機にゼロショット転移する閉ループシステムを提案した。
- CrayonRobo: 物体中心のプロンプト駆動型視覚-言語-行動モデルによるロボットマニピュレーションVLA2025/5/1
RGB画像に手書き風の2D視覚プロンプトを重ね、低レベル動作と高レベル計画を同時に指示する視覚-言語-行動モデルを提案。キーフレームごとに接触姿勢と移動方向をSE(3)空間で予測し、長期タスクを実行する。
- 身体性エージェントと人間の適応のための通信効率の良い欲求アラインメントVLA2025/5/1
家庭支援シミュレーション環境HA-Desireを構築し、曖昧な指示からユーザの潜在的な欲求を推論して適応するフレームワークFAMERを提案した。欲求ベースの心的推論と反省ベースの通信モジュールにより、タスク実行と通信効率を大幅に向上させた。
- SR3D: 単視点3D再構成で透明・鏡面物体の把持を実現マニピュレーション2025/5/1
単視点のRGB-D画像から外部の視覚モデルで物体メッシュを再構成し、視点・キーポイントマッチングで元のシーンに位置合わせすることで、透明・鏡面物体の把持を可能にする学習不要のフレームワークを提案。
- 予測力注意を伴う適応的視触覚融合による巧みなマニピュレーションマニピュレーション2025/5/1
力誘導注意融合モジュールと自己教師あり未来力予測を導入し、操作段階に応じて視覚と触覚の重みを適応的に調整することで、接触の多い3つの実世界タスクで平均93%の成功率を達成した。
- DexGarmentLab: 巧みな衣類操作のための環境と汎化可能な方策マニピュレーション2025/5/1
両手での巧みな衣類操作に特化した大規模シミュレーション環境DexGarmentLabを構築し、単一の実演から多様な軌道を自動生成する手法と、形状・変形の多様性に汎化する階層的な操作方策HALOを提案した。
- マルチモーダル外れ値検出・セグメンテーションのための超簡便な外れ値合成外れ値検出2025/5/1
マルチモーダル入力に対し、特徴量を混ぜるだけで外れ値サンプルを合成し、分布外検出・セグメンテーションを高精度かつ高速に行う手法を提案。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- 基盤モデル特徴駆動によるオンラインエンドエフェクタ姿勢推定:マーカーフリー・学習フリー手法姿勢推定2025/3/1
事前学習済み視覚特徴とCADモデルから2D-3D対応を求め、PnPと時系列最適化でエンドエフェクタの6D姿勢を学習なし・マーカーなしでオンライン推定する手法を提案。
- GarmentPile: 点レベル視覚アフォーダンスによる散乱衣類の把持・適応操作マニピュレーション2025/3/1
散らかった衣類の絡まりを点レベルのアフォーダンスで表現し、絡みを解きほぐして把持・回収する枠組みを提案。シミュレーションと実機で有効性を示した。
- AdaManip: 適応的な関節物体操作環境と方策学習マニピュレーション2025/2/1
鍵やドアなど内部状態が見えない関節物体を試行錯誤で操作するための新しいシミュレーション環境と、3D視覚拡散を用いた模倣学習による適応方策を提案した。
- CordViP: 実世界での巧みな操作のための対応関係に基づく視覚運動ポリシーマニピュレーション2025/2/1
物体の6D姿勢推定とロボット固有感覚を活用し、物体と手の対応関係を捉えるインタラクション認識点群を構築することで、実世界の巧みな操作を高精度に実現する視覚運動ポリシーを提案した。
- OmniManip: 物体中心のインタラクションプリミティブを空間制約として用いた汎用ロボットマニピュレーションマニピュレーション2025/1/1
物体の機能的アフォーダンスに基づく正準空間でインタラクションプリミティブを表現し、VLMの常識推論を3D空間制約に変換する二重閉ループ型のオープンボキャブラリなロボットマニピュレーションシステムを提案した。
- マルチモーダル適応と汎化の進展:従来手法から基盤モデルまでマルチモーダル適応2025/1/1
マルチモーダルなドメイン適応・汎化に関する初の包括的サーベイであり、従来手法からCLIPなどの基盤モデルを活用した最新手法までを整理し、課題と今後の方向性を示した。
- ManipGPT:大規模視覚モデルのアフォーダンスセグメンテーションは関節物体操作に十分か?アフォーダンス/マニピュレーション2024/12/1
大規模視覚Transformerを微調整し、関節物体の操作に必要な部位レベルのアフォーダンスマスクを予測する枠組みを提案。シミュレーションと実世界の画像データセットで学習し、インピーダンス適応方策と組み合わせることで複雑な知覚システムなしに操作を実現した。
- 予測的逆動力学モデルによるロボットマニピュレーションのスケーラブル学習マニピュレーション2024/12/1
ロボットの予測視覚状態に基づく逆動力学モデルで行動を予測するPIDMを提案し、大規模データで事前学習したSeerがシミュレーションと実世界で大幅な性能向上を達成した。
- GarmentLab:衣服操作のための統合シミュレーションとベンチマーク変形物体操作2024/11/1
衣服や布の操作を学習・評価するための多様なタスクとリアルなシミュレーションを備えたベンチマークを提案し、sim-to-realギャップの縮小を目指す。
- ET-SEED: 効率的な軌道レベルSE(3)同変拡散ポリシーマニピュレーション2024/11/1
空間対称性を利用した軌道レベルのSE(3)同変拡散モデルを提案し、ロボットマニピュレーションにおけるデモンストレーション依存を減らしつつ、データ効率と汎化性能を向上させた。
- MO-DDN: 多物体要求駆動ナビゲーションのための粗から細への属性ベース探索エージェントナビゲーション2024/10/1
複数の物体と個人の好みを考慮した要求駆動ナビゲーションのベンチマークMO-DDNを提案し、属性を活用した粗から細への探索エージェントで高性能を実現した。
- 巧みな視触覚ポリシー学習のための3D触覚の正準表現と力に基づく事前学習触覚2024/9/1
3D触覚データを正準表現に変換し、力に基づく自己教師あり事前学習を行うことで、巧みな手による接触の多い操作タスクの成功率を向上させた研究。
- EqvAfford: 点レベルアフォーダンス学習のためのSE(3)同変性マニピュレーション2024/8/1
物体の姿勢に依存しない操作を実現するため、点レベルアフォーダンス学習にSE(3)同変性を導入したフレームワークEqvAffordを提案し、多様な姿勢の物体に対する操作タスクで高い性能と汎化能力を示した。
- 局所占有予測と複数三平面投影による物体把持マニピュレーション2024/7/1
単視点の点群から把持点周辺の占有を予測して形状を補完し、6自由度把持姿勢を高精度に推定する手法を提案。
- TARGO: 遮蔽環境下でのターゲット駆動型物体把持のベンチマークマニピュレーション2024/7/1
遮蔽のある散らかった環境でのターゲット物体把持に焦点を当てた新ベンチマークTARGOを構築し、既存手法の限界を示すとともに、形状補完モジュールを備えたTransformerベースのTARGO-Netを提案した。
- 相互作用予測によるマニピュレーション学習マニピュレーション2024/6/1
初期・最終状態と言語指示から遷移フレームと操作対象物体を予測する事前学習手法MPIを提案し、実機・シミュレーションで従来手法を10〜64%上回る性能を達成した。
- A3VLM: 動作可能な関節構造を理解する視覚言語モデルVLA2024/6/1
物体の関節構造と操作可能性を理解する視覚言語モデルを提案し、ロボットに依存しない表現から簡単な動作プリミティブでロボット動作に変換できることを示した。
- AIC MLLM:ロボットマニピュレーションのための自律対話型修正マルチモーダル大規模言語モデルマニピュレーション2024/6/1
関節物体操作における低レベル接触姿勢の失敗を、視覚マスクとテキスト指示を用いてMLLMが自律的に認識・修正する手法を提案。
- InstructNav: 未探索環境における汎用指示ナビゲーションのゼロショットシステムナビゲーション2024/6/1
未探索環境で多様な言語指示に従ってロボットをナビゲートさせるため、動的ナビゲーションチェーンとマルチソースバリューマップを用いたゼロショットの汎用指示ナビゲーションシステムを提案した。
- 局所ダイナミクスの再帰的伝播による散乱物体の支持関係推定と対象物取り出しマニピュレーション2024/6/1
散乱した物体群の局所的な力学情報を再帰的に伝播させて支持関係グラフを構築し、対象物を安全に取り出すための操作順序計画を可能にする手法を提案した。
- 人間中心の屋内 embodied 配送ベンチマークembodied AI/配送2024/6/1
極地研究基地を模した多層建物内で、人間キャラクターと把持・移動可能なロボットによる配送タスクを再現する仮想環境と、13kの言語指示を含むデータセットを構築し、大規模マルチモーダルモデルを基盤としたベースライン手法を提案した。
- PreAfford: 多様な物体と環境に対応するユニバーサルなアフォーダンスベースの事前把持マニピュレーション2024/4/1
把持しにくい物体に対して、点レベルのアフォーダンス表現とリレー学習を用いた事前把持計画フレームワークを提案し、把持成功率を69%向上させた。
- 拡散ポリシーによる巧みな機能的把持前操作マニピュレーション2024/3/1
物体を掴む前に位置や向きを器用に調整する把持前操作を、教師-生徒学習と拡散ポリシーで実現し、30種類以上の物体で72.6%の成功率を達成した研究。
- ManipVQA: マルチモーダル大規模言語モデルへのロボットアフォーダンスと物理的知識の注入VLA2024/3/1
ロボット操作に必要な道具検出・アフォーダンス認識・物理概念理解をVQA形式で学習させ、MLLMに操作中心の知識を注入するフレームワークを提案した。
- RoboKeyGen: 拡散モデルによる3Dキーポイント生成を用いたロボット姿勢と関節角度の推定姿勢推定2024/3/1
2Dキーポイント検出と拡散モデルによる3Dキーポイント生成に分けてロボットの姿勢と関節角度を推定し、従来法より高精度・高速に実現するフレームワークを提案。
- NaturalVLM: 細粒度自然言語を用いたアフォーダンス誘導型視覚マニピュレーションマニピュレーション2024/3/1
家庭用ロボット向けに、細かい自然言語指示を段階的に解釈して物体操作を行う学習フレームワークと、15タスク・4500エピソード超のベンチマークNrVLMを提案した論文。
- UniDoorManip:大規模多様ドア操作環境における汎用ドア操作ポリシーの学習マニピュレーション2024/3/1
多様なドアを操作するための大規模データセットとモバイルロボット・部分点群観測を含む新環境を構築し、操作過程を3段階に分解して推論と逆順に学習する汎用ポリシーを提案した。
- SCANet: 自己修正組立ネットワークによるLEGO組立誤りの修正組立/自己修正2024/3/1
LEGO組立の誤りを検出・修正する自己修正ネットワークSCANetを提案し、誤り修正用データセットLEGO-ECAを構築した。MEPNetの組立結果を修正し、正確性を大幅に向上させた。
- 粗から細へのアフォーダンス学習による点群ノイズに頑健な関節物体操作マニピュレーション2024/2/1
実世界の点群ノイズに対処するため、遠距離の粗い点群で操作箇所を推定し、近距離の精細な点群で最終動作を決定する2段階のアフォーダンス学習手法を提案した。
- ManipLLM: 物体中心のロボットマニピュレーションのための身体性マルチモーダル大規模言語モデルマニピュレーション2023/12/1
マルチモーダル大規模言語モデルの推論能力を微調整で活用し、物体カテゴリ理解・アフォーダンス推論・姿勢予測を行ってロボットマニピュレーションの汎化性能を高めた手法を提案。
- LVDiffusor: 大規模モデルから機能的再配置の事前知識を拡散モデルへ蒸留マニピュレーション2023/12/1
LLMとVLMを使って多様な物体配置例を収集し、拡散モデルに蒸留することで、機能的要件を満たす物体再配置の目標位置を生成する手法を提案した論文。
- RGBGrasp: ロボットアーム動作中の多視点撮影とNeRFによる画像ベース物体把持マニピュレーション2023/11/1
ロボットアーム移動中に撮影した少数のRGB視点とNeRFを用いて、透明・鏡面物体を含む3D構造を推定し把持を実現する手法を提案。
- ImageManip: アフォーダンス誘導による次視点選択を用いた画像ベースのロボットマニピュレーションマニピュレーション2023/10/1
RGBカメラで対象物を複数視点から撮影し、深度推定とアフォーダンスマップを融合して、3D点群を使わずに把持・操作を可能にする画像ベースのマニピュレーション手法を提案した。
- RGBManip: 能動的な物体姿勢推定による単眼画像ベースのロボットマニピュレーションマニピュレーション2023/10/1
グリッパに搭載した単眼カメラを動かしながら多視点で物体を観察し、強化学習で把持戦略と能動知覚を同期させて6D姿勢推定精度と作業効率を両立する画像のみのマニピュレーション手法を提案。
- SparseDFF: スパースビュー特徴蒸留によるワンショット巧みな操作マニピュレーション2023/10/1
スパースなRGBD画像から大規模2D視覚モデルを用いて3Dシーンの意味特徴を抽出し、ワンショットで巧みな操作を学習する手法を提案。
- Where2Explore: 未知のカテゴリの関節物体に対する少数ショットアフォーダンス学習マニピュレーション2023/9/1
物体カテゴリ間で共通する局所形状を活用し、未知カテゴリの関節物体を少数のインタラクションで効率的に探索・操作するアフォーダンス学習フレームワークを提案。
- Learning Environment-Aware Affordance for 3D Articulated Object Manipulation under Occlusions2023/9/1
- 欲しいものを探せ:要求条件付き物体属性空間の学習による要求駆動型ナビゲーションナビゲーション2023/9/1
ユーザーの要求を指示として、その要求を満たす物体をシーン内から探し出す要求駆動型ナビゲーション(DDN)を提案し、大規模言語モデルから得たテキスト属性特徴を視覚属性特徴と対比学習で整合させる手法を開発した。
- 動く前に議論せよ:マルチエキスパート議論による視覚言語ナビゲーションVLA2023/9/1
大規模モデルを分野別エキスパートと見立て、各ステップで議論しながら進むゼロショット視覚言語ナビゲーション手法を提案し、R2Rで大幅な性能向上を達成した。
- GraspGF: 人間支援のためのスコアベース把持プリミティブ学習マニピュレーション2023/9/1
人間の代わりにロボットハンドで物体を把持する際、ユーザの意図に適応するため、把持勾配場(GraspGF)と履歴条件付き残差ポリシーを組み合わせた手法を提案。
- ピクセル誘導ナビゲーションスキルによるゼロショット物体ナビゲーションと基盤モデルの橋渡しナビゲーション2023/9/1
RGB画像上のピクセルを目標指定として使うナビゲーション方策PixNavを提案し、基盤モデルと実機ナビゲーションを繋いで長期的な物体探索を可能にした。
- Robot Structure Prior Guided Temporal Attention for Camera-to-Robot Pose Estimation from Image Sequence2023/7/1
- Instruct2Act: Mapping Multi-modality Instructions to Robotic Actions with Large Language Model2023/5/1
- Learning Semantic-Agnostic and Spatial-Aware Representation for Generalizable Visual-Audio Navigation2023/4/1
- Learning a Universal Human Prior for Dexterous Manipulation from Human Preference2023/4/1
- Learning Foresightful Dense Visual Affordance for Deformable Object Manipulation2023/3/1
- PartManip: Learning Cross-Category Generalizable Part Manipulation Policy from Point Cloud Observations2023/3/1
- SuperFusion: Multilevel LiDAR-Camera Fusion for Long-Range HD Map Generation2022/11/1
- End-to-End Affordance Learning for Robotic Manipulation2022/9/1
- Learning-Based Dimensionality Reduction for Computing Compact and Effective Local Feature Descriptors2022/9/1
- Online Pole Segmentation on Range Images for Long-term LiDAR Localization in Urban Environments2022/8/1
- DualAfford: Learning Collaborative Visual Affordance for Dual-gripper Manipulation2022/7/1
- Towards Human-Level Bimanual Dexterous Manipulation with Reinforcement Learning2022/6/1
- GraspARL: Dynamic Grasping via Adversarial Reinforcement Learning2022/3/1
- AdaAfford: Learning to Adapt Manipulation Affordance for 3D Articulated Objects via Few-shot Interactions2021/12/1
- RoboAssembly: Learning Generalizable Furniture Assembly Policy in a Novel Multi-robot Contact-rich Simulation Environment2021/12/1
- Dynamic Balancing of Humanoid Robot Walker3 with Proprioceptive Actuation: Systematic Design of Algorithm, Software and Hardware2021/8/1
- Online Range Image-based Pole Extractor for Long-term LiDAR Localization in Urban Environments2021/8/1
- VAT-Mart: Learning Visual Action Trajectory Proposals for Manipulating 3D ARTiculated Objects2021/6/1
- DMotion: Robotic Visuomotor Control with Unsupervised Forward Model Learned from Videos2021/3/1
- Fast Online Planning for Bipedal Locomotion via Centroidal Model Predictive Gait Synthesis2021/2/1