Ruihai Wu
University of California, Berkeley
収録論文 54本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GroundAnything: 並列デコーディングと高精度視覚グラウンディングをフラッシュ速度で両立視覚グラウンディング2026/9/30
拡散モデルによる並列デコーディングで視覚グラウンディングを高速化し、4Bモデルで同規模の最先端性能を達成した研究。
- GroundingPI:視覚プリミティブで物理知能に挑むグラウンディング基盤モデルVLA2026/9/30
点やボックスを量子化座標として生成する4Bのグラウンディング基盤モデルを提案し、ロボット操作や自動運転の視覚バックボーンとして性能を向上させた。
- X2Real:実世界汎用ポリシー評価のための拡張可能なシミュレーションベンチマークsim2real2026/9/23
実機との相関0.84を達成したIsaac Labベースの進化型シミュレーションベンチマークで、10能力次元・44タスクにより汎用マニピュレーションポリシーを忠実・多様・公平に評価する。
- BiRoAD: 双腕マニピュレーションのための共有・役割適応表現学習マニピュレーション2026/9/20
双腕ロボットの動作を「腕交換で不変な協調構造」と「役割に応じて変化する成分」に分解し、役割の偏りに頑健な模倣学習を可能にする特徴変換フレームワークを提案。
- AffordanceWAM: アフォーダンス認識型の世界行動統合モデリングによるロボットマニピュレーションVLA2026/9/16
人間とロボットの動画から物体中心のアフォーダンスを予測し、将来の映像とロボット行動を統合的に生成するモデルを提案。人間動画を活用してロボット操作の汎化性能を向上させた。
- 検証が学習を止めるとき:継続的身体エージェントのための更新受入監査継続学習2026/9/9
継続学習型身体エージェントのポリシー更新を、誤り制御と学習機会の両面から評価する「更新受入監査」プロトコルを提案し、範囲ベースの信頼ゲートが更新を過剰に拒否する問題を合成実験で示した。
- 生成動画プランをシミュレーションで接地し多様な器用操作コントローラを実現マニピュレーション2026/9/9
生成された手と物体のインタラクション動画をシミュレーションで接地し、多様な把持や操作を実行できる器用なロボットハンドコントローラを学習する手法を提案。
- LD4WAM: 人間のビデオから潜在ダイナミクスを学習するワールドアクションモデルVLA2026/8/23
人間のビデオからロボットの行動に直接使える潜在ダイナミクスを学習し、将来のビデオ生成と行動条件付けを組み合わせたワールドアクションモデルを提案。5,000時間以上のデータで事前学習し、シミュレーションと実機で高い性能を達成。
- FlatLab: 平板物体のロボット操作のための統一手法フレームワークとシミュレーションベースのベンチマークマニピュレーション2026/8/14
平板物体の操作を戦略生成と行動実行に分離する統一フレームワークを提案し、多様な物体に汎化する手法と、その評価のための高忠実シミュレーションベンチマークFlatLabを導入した。
- 疎と密の融合:剛体-変形体相互作用を伴うロボット操作の対応関係に基づく手法マニピュレーション2026/8/1
剛体と変形体が相互作用する操作タスク(衣類掛けや着衣補助など)のために、タスク固有の疎なキーポイントと変形体上の密な対応関係を組み合わせたハイブリッド表現を提案し、正確なキーポイント追跡と汎化を実現する。
- AdaDexGrasp: 3次元視覚触覚表現融合による適応的器用把持マニピュレーション2026/8/1
視覚と触覚を統合した表現を用いて、把持計画と接触後の適応的修正を行う統一フレームワークを提案し、多様な物体での把持成功率と汎化性を向上させた。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- MagicSim: 実行可能な身体化インタラクションのための統合基盤シミュレーション基盤2026/6/16
シミュレーションを制御・スキル・計画を結ぶ実行基盤として捉え、YAML定義から多様な実行可能な世界を構築し、コマンドをロボット動作に変換する統一パイプラインを提供する。
- AffordanceVLA:アフォーダンス認識による行動生成を強化する視覚言語行動モデルVLA/操作2026/6/4
視覚言語モデルとロボット制御の構造的ミスマッチを解消するため、アフォーダンス予測を中間表現として導入し、物体の接地・2D位置特定・3D幾何推論を段階的に行う統一フレームワークを提案した。
- HeteroGenManip: 異種物体間インタラクションのための汎用操作マニピュレーション2026/5/1
異なる種類の物体が関わる操作タスクを、把持位置の特定とその後の動作計画を分離した2段階フレームワークで解決し、カテゴリ特化モデルと拡散ポリシーを組み合わせて汎化性能を向上させた。
- HiPolicy: 階層型マルチ周波数アクションチャンキングによるポリシー学習模倣学習2026/4/1
ロボットの模倣学習において、長期的な依存関係のモデリングと細かい閉ループ制御のトレードオフを解決するため、異なる周波数でアクション系列を予測する階層型マルチ周波数アクションチャンキングフレームワークを提案した。
- ロボット操作におけるワールドモデル評価のためのベンチマーク RoboWM-Benchベンチマーク/ワールドモデル2026/4/1
ロボット操作タスクに特化した、ビデオワールドモデルの物理的実行可能性を評価するベンチマークを提案。生成動画を実行動作に変換し、シミュレーションで検証する。
- LeHome: 家庭環境における変形物体操作のためのシミュレーション環境シミュレーション/変形物体操作2026/4/1
家庭内の変形物体(衣類や食品など)を高忠実度で操作できるシミュレーション環境を提案し、低コストロボットでの評価を可能にした。
- 見ることからシミュレーションへ:デジタルいとこによる高忠実度生成シミュレーションで汎用ロボット学習と評価を実現sim2real2026/4/1
実世界のパノラマ画像から高忠実度のシミュレーションシーンを生成し、さらに多様な「デジタルいとこ」シーンを合成することで、ロボットの汎用学習と評価を効率化する生成フレームワークを提案した。
- GarmentPile++: 視覚言語推論によるアフォーダンス駆動の乱雑な衣類取り出しマニピュレーション2026/3/1
衣類の山から言語指示に従って安全かつ正確に1枚だけを取り出すパイプラインを提案。視覚言語モデルと視覚アフォーダンスを統合し、SAM2によるセグメンテーションとマスク微調整、さらに大型衣類向けの双腕協調を導入した。
- DexKnot: 器用な袋結び操作のための汎化可能な視覚運動ポリシー学習マニピュレーション2026/3/1
袋結びの汎化可能なポリシーを、キーポイントのアフォーダンスと拡散ポリシーを組み合わせて学習するフレームワークを提案した。
- GraspALL: 任意の低照度環境下でのロボット衣類把持のための照明変動適応型構造補償マニピュレーション2026/3/1
照明が動的に変化する低照度環境でもロバストに衣類を把持できるよう、RGBと非RGBモダリティの特徴を照明強度に応じて適応的に融合するモデルGraspALLを提案した。
- RMBench:記憶依存型ロボットマニピュレーションのベンチマークと政策設計への洞察マニピュレーション2026/3/1
記憶を必要とするロボット操作タスクを体系的に評価する9タスクのシミュレーションベンチマークRMBenchと、明示的記憶モジュールを持つ操作政策Mem-0を提案し、既存政策の記憶限界と設計指針を明らかにした。
- BiPreManip: 予期的協調によるアフォーダンスに基づく両腕準備的操作の学習両腕操作2026/3/1
直接掴みにくい物体や機能的操作が難しい物体に対して、一方の腕が準備的操作を行い他方の腕の目標動作を可能にする両腕協調タスクを扱い、視覚アフォーダンスに基づくフレームワークを提案した。
- パーツ認識型高密度3D特徴場による汎用的な関節物体マニピュレーションの学習マニピュレーション2026/2/1
関節物体の機能部位を認識する高密度3D特徴場PA3FFを学習し、それを用いた模倣学習フレームワークPADPで汎化性能とサンプル効率を向上させた。
- Bi-Adapt: 意味的対応による新規カテゴリ3D物体への少数ショット両手操作適応マニピュレーション2026/2/1
視覚基盤モデルを活用してカテゴリをまたぐアフォーダンス対応を学習し、新規カテゴリの物体に対する両手操作を少数データで効率的に汎化させるフレームワークを提案した。
- A3D: 双腕マニピュレーションによる適応的アフォーダンス組立マニピュレーション2026/1/1
家具組立のための双腕ロボットフレームワークA3Dを提案し、点群ベースの適応的アフォーダンス学習により多様な部品形状に対応した支持・安定化位置を特定する。
- RealAppliance: 実マニュアルに整合した高忠実度家電アセットの制御可能化と実用化sim2real2025/12/1
実マニュアルと整合する物理・電子機構・プログラムロジックを備えた100種の高忠実度家電アセットデータセットと、家電操作計画を評価するベンチマークを提案した論文。
- AdaptPNP: 把持・非把持スキルを統合した適応的ロボットマニピュレーションマニピュレーション2025/11/1
VLMを用いて把持と非把持(押す・つつく等)の動作を組み合わせた計画を生成し、デジタルツインで予測しながら実環境でも適応的に再計画するマニピュレーション枠組みを提案した論文。
- Manual2Skill++: コネクタを考慮した指示書からの汎用ロボット組立組立/マニピュレーション2025/10/1
組立指示書から視覚言語モデルで接続情報を抽出し、部品と接続関係を階層グラフで表現してロボット組立を実行するフレームワークを提案。
- 基盤モデルの推論とパーツグラウンディングによる適応的な関節物体操作マニピュレーション2025/7/1
基盤モデルを活用して関節物体をパーツ単位で認識し、そのアフォーダンスからプリミティブスキルを組み合わせて未知カテゴリの物体も操作できるフレームワークAdaRPGを提案した。
- BiAssemble: 両手協調アフォーダンス学習による幾何学的組み立てマニピュレーション2025/6/1
破片の点群から両手協調に必要なアフォーダンスを学習し、割れた器などの幾何学的組み立てを実現する手法を提案。実世界ベンチマークで従来法を上回る性能を示した。
- DexGarmentLab: 巧みな衣類操作のための環境と汎化可能な方策マニピュレーション2025/5/1
両手での巧みな衣類操作に特化した大規模シミュレーション環境DexGarmentLabを構築し、単一の実演から多様な軌道を自動生成する手法と、形状・変形の多様性に汎化する階層的な操作方策HALOを提案した。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- GarmentPile: 点レベル視覚アフォーダンスによる散乱衣類の把持・適応操作マニピュレーション2025/3/1
散らかった衣類の絡まりを点レベルのアフォーダンスで表現し、絡みを解きほぐして把持・回収する枠組みを提案。シミュレーションと実機で有効性を示した。
- MetaFold: 軌道生成と基盤モデルによる言語誘導型多カテゴリ衣類折り畳みフレームワークマニピュレーション2025/3/1
衣類折り畳みタスクにおいて、タスク計画と言語誘導の点群軌道生成、低レベル基盤モデルによる行動予測を分離して学習し、多カテゴリの衣類や多様な指示に適応できるフレームワークを提案した。
- AdaManip: 適応的な関節物体操作環境と方策学習マニピュレーション2025/2/1
鍵やドアなど内部状態が見えない関節物体を試行錯誤で操作するための新しいシミュレーション環境と、3D視覚拡散を用いた模倣学習による適応方策を提案した。
- Manual2Skill: 視覚言語モデルを用いた家具組立のための説明書読解とロボットスキル獲得マニピュレーション2025/2/1
VLMで説明書画像から組立情報を抽出し、階層的な組立グラフと6D姿勢推定・動作計画を組み合わせて、ロボットがIKEA家具を組み立てられるようにしたフレームワーク。
- ManipGPT:大規模視覚モデルのアフォーダンスセグメンテーションは関節物体操作に十分か?アフォーダンス/マニピュレーション2024/12/1
大規模視覚Transformerを微調整し、関節物体の操作に必要な部位レベルのアフォーダンスマスクを予測する枠組みを提案。シミュレーションと実世界の画像データセットで学習し、インピーダンス適応方策と組み合わせることで複雑な知覚システムなしに操作を実現した。
- GarmentLab:衣服操作のための統合シミュレーションとベンチマーク変形物体操作2024/11/1
衣服や布の操作を学習・評価するための多様なタスクとリアルなシミュレーションを備えたベンチマークを提案し、sim-to-realギャップの縮小を目指す。
- ET-SEED: 効率的な軌道レベルSE(3)同変拡散ポリシーマニピュレーション2024/11/1
空間対称性を利用した軌道レベルのSE(3)同変拡散モデルを提案し、ロボットマニピュレーションにおけるデモンストレーション依存を減らしつつ、データ効率と汎化性能を向上させた。
- EqvAfford: 点レベルアフォーダンス学習のためのSE(3)同変性マニピュレーション2024/8/1
物体の姿勢に依存しない操作を実現するため、点レベルアフォーダンス学習にSE(3)同変性を導入したフレームワークEqvAffordを提案し、多様な姿勢の物体に対する操作タスクで高い性能と汎化能力を示した。
- 局所ダイナミクスの再帰的伝播による散乱物体の支持関係推定と対象物取り出しマニピュレーション2024/6/1
散乱した物体群の局所的な力学情報を再帰的に伝播させて支持関係グラフを構築し、対象物を安全に取り出すための操作順序計画を可能にする手法を提案した。
- PreAfford: 多様な物体と環境に対応するユニバーサルなアフォーダンスベースの事前把持マニピュレーション2024/4/1
把持しにくい物体に対して、点レベルのアフォーダンス表現とリレー学習を用いた事前把持計画フレームワークを提案し、把持成功率を69%向上させた。
- NaturalVLM: 細粒度自然言語を用いたアフォーダンス誘導型視覚マニピュレーションマニピュレーション2024/3/1
家庭用ロボット向けに、細かい自然言語指示を段階的に解釈して物体操作を行う学習フレームワークと、15タスク・4500エピソード超のベンチマークNrVLMを提案した論文。
- UniDoorManip:大規模多様ドア操作環境における汎用ドア操作ポリシーの学習マニピュレーション2024/3/1
多様なドアを操作するための大規模データセットとモバイルロボット・部分点群観測を含む新環境を構築し、操作過程を3段階に分解して推論と逆順に学習する汎用ポリシーを提案した。
- RoboEXP: Action-Conditioned Scene Graph via Interactive Exploration for Robotic Manipulation2024/2/1
- Learning Environment-Aware Affordance for 3D Articulated Object Manipulation under Occlusions2023/9/1
- Where2Explore: Few-shot Affordance Learning for Unseen Novel Categories of Articulated Objects2023/9/1
- Learning Foresightful Dense Visual Affordance for Deformable Object Manipulation2023/3/1
- DualAfford: Learning Collaborative Visual Affordance for Dual-gripper Manipulation2022/7/1
- AdaAfford: Learning to Adapt Manipulation Affordance for 3D Articulated Objects via Few-shot Interactions2021/12/1
- VAT-Mart: Learning Visual Action Trajectory Proposals for Manipulating 3D ARTiculated Objects2021/6/1
- DMotion: Robotic Visuomotor Control with Unsupervised Forward Model Learned from Videos2021/3/1