Wenbo Ding
Tsinghua University
収録論文 63本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MM-ABC: 見て、協調し、想像する汎用モバイルマニピュレーションモバイルマニピュレーション2026/9/28
移動とマニピュレーションを別々のストリームとして扱い、マスク付きジョイントアテンションと未来予測の追加監督で協調させる基盤モデルを提案。
- BiView-Touch: クロスハンド補完による両手触覚表現学習触覚2026/9/20
一方の手の触覚潜在表現を、同期したもう一方の手の触覚情報から補完する自己教師あり学習フレームワークを提案し、少ないラベルで両手動作や力の認識精度を向上させた。
- DexTouch-WM: 人間の触覚から器用なロボット操作のための行動条件付き触覚ワールドモデルを学習触覚/ワールドモデル2026/9/17
人間とロボットの手に同じ触覚センサ配置を装着し、人間の触覚データからロボットの視覚・触覚の未来を予測するワールドモデルを学習。人間のデータを増やすほどロボット領域の予測精度が向上し、政策評価や合成データ生成にも使えることを示した。
- TouchSight: 一人称視野映像からの素手触覚予測触覚2026/9/17
手袋型圧力センサの記録を生成AIで素手映像に変換し、一人称視野の動画から手全体の接触力を予測する手法を提案。触覚センサなしで密な触覚情報を推定できる。
- GeoLAM: ラベルなし人間動画から幾何学的潜在行動を学習VLA2026/9/15
人間の動画から幾何学的な手がかりを活用して潜在行動を学習し、ロボット操作タスクに転移するフレームワークを提案。
- GLAM: 大域的時空間記憶に基づく潜在世界モデルによる能動的探索とナビゲーションナビゲーション2026/9/13
地図レベルの潜在トークン上で未来の地図表現とウェイポイントを予測するJEPA型世界モデルGLAMを提案し、ObjectNavタスクでベースラインを上回る成功率と経路長効率を達成した。
- MoPA: サブシステム特化型知覚アラインメントによる協調的移動マニピュレーション移動マニピュレーション2026/9/10
移動とマニピュレーションで異なる知覚表現を二重ストリームで抽出し、行動レベルで協調させるフレームワークを提案。ManiSkill-HABで最高性能、実機でも成功率76.3%を達成。
- VISTA: 視覚から推定する空間接触注意による高密度接触操作マニピュレーション2026/8/26
接触を伴う精密操作のため、視覚のみからグリッパの変形を推定し、触覚センサなしで接触情報を獲得する模倣学習フレームワークを提案した。
- UniReflex: 高速・低速反射による事前学習生成ポリシーのためのプラグアンドプレイ力制御力制御2026/8/18
事前学習済みの生成ポリシーに追加学習なしで力制御を組み込むプラグアンドプレイフレームワークを提案。潜在表現から高速反射ネットワークが可変インピーダンス制御を駆動し、接触安定性を向上させる。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- CheckVLA: アクション条件付きワールドモデルによる実行時検証で長期的モバイル操作を実現モバイル操作/VLA/実行時検証2026/7/1
長期的なモバイル操作において、VLAポリシーが開ループで行動チャンクを実行する際の誤差蓄積問題に対し、別途訓練したアクション条件付きワールドモデルで実行を検証し、逸脱時に介入する手法を提案した。シミュレーションで成功率と再現率が向上した。
- ハーネスVLA:メモリ誘導エージェントによる凍結VLAの信頼性ある操作プリミティブへの変換VLA/操作2026/7/1
凍結したVLAモデルを再試行可能な接触豊富なプリミティブとして活用し、解析的プリミティブと組み合わせることで、微調整なしに分布外の操作タスクでの成功率を大幅に向上させるフレームワークを提案した。
- 信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル信頼性評価2026/7/1
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
- TaCauchy: 視覚ベース触覚シミュレーションのための拡張可能なFEMフレームワーク触覚シミュレーション2026/6/1
GPU加速ロボティクスプラットフォーム上で、有限要素法に基づき物理的に正確な応力場と接触力を計算する触覚センサーシミュレーションフレームワークを提案した。
- FutureNav: 視覚言語ナビゲーションのための統合世界行動モデリングVLA/ナビゲーション2026/6/1
視覚と言語によるナビゲーション(VLN)タスクにおいて、世界状態の遷移と将来予測を明示的にモデル化する統合フレームワークを提案し、4B規模のバックボーンで複数のベンチマークで最先端性能を達成した。
- OneVLA: 身体性タスクのための統一フレームワークVLA2026/6/1
ナビゲーションと操作を単一のフレームワークに統合したVLAモデルを提案し、タスク固有のアーキテクチャを不要にする統一アクションヘッドと多段階トレーニング戦略を導入。シミュレーションと実環境で最先端の性能を達成した。
- dVLA-RL: 離散拡散ビジョン・ランゲージ・アクションモデルに対する軌跡上の強化学習VLA/強化学習2026/6/1
離散拡散型VLAモデルの強化学習を可能にするため、生成過程をマルコフ決定過程とみなし、軌跡の結合確率を目的関数とする手法を提案した。
- テキストと画像で考える:長期的ロボット操作のためのインターリーブ型視覚・言語推論トレース操作2026/5/1
長期的なロボット操作タスクにおいて、テキストによるサブゴールと視覚的なキーフレームを交互に配置した中間表現(トレース)を導入し、これを自己生成して動作デコーダに条件付けする新しいポリシーフレームワークを提案した。
- OA-WAM: 物体アドレス可能な世界行動モデルによるロバストなロボット操作マニピュレーション2026/5/1
物体ごとのスロット表現とアドレス機構を導入した世界行動モデルを提案し、物体の同一性と文脈を分離することで、シーン変化に対して頑健な操作を実現した。
- TouchAnything: 自己中心視点映像からの両手触覚推定のためのデータセットとフレームワーク触覚推定2026/5/1
自己中心視点の映像から触覚情報を推定するための大規模データセットと、視覚から触覚を予測するベースラインフレームワークを提案した論文。
- 動的摂動下でのロバストな視覚制御のためのエージェント中心観測適応視覚制御2026/4/1
時間変化する劣化(天候やノイズなど)に対して、復元ベース表現の失敗を情報ボトルネックの観点から分析し、前景マスクと復元専門家のルーティングを組み合わせたプラグアンドプレイの観測アダプタACO-MoEを提案した。
- 大規模な人間のデモから学習するロボット操作のための人間意図事前分布VLA/操作学習2026/4/1
人間のデモ動画から操作の事前知識を学び、ロボット操作に活用する階層型VLAフレームワークMoT-HRAを提案。大規模データセットHA-2.2Mを構築し、意図推定とロボット制御を統合することで、分布シフト下での堅牢な操作を実現。
- 一緒に歩こう:人間中心の屋外支援のための長期的社会的ナビゲーションナビゲーション2026/4/1
高レベルの自然言語指示から屋外での長期的な社会的ナビゲーションを実現する、地図不要のフレームワークを提案。GPSと公開地図APIのPOIを用いて目的地を推定し、高レベルVLMと低レベルVLAを状況に応じて切り替えることで、安全で社会的に適切な移動を実現する。
- 腱駆動アームにおける時分割多重駆動:軽量設計と耐故障性マニピュレーション2026/4/1
腱駆動ロボットアームのアクチュエータ数を大幅に削減しつつ、高トルクと耐故障性を両立する時分割多重駆動(TDMA)方式を提案し、試作アームMuxArmでその有効性を実証した。
- 適応触覚融合と力混合制御によるマスターマイクロ残差補正を用いた接触リッチ操作マニピュレーション2026/3/1
視覚模倣学習に触覚と力覚を組み合わせ、マスター・マイクロ残差制御アーキテクチャで高周波のリアルタイム補正を行い、接触を伴う精密操作の成功率を向上させた。
- FUTURE-VLA: 実時間実行下での統合軌道予測VLA2026/2/1
長時間の映像履歴を効率的に圧縮し、潜在空間での自己回帰により将来の視覚予測と行動生成を単一のフォワードパスで行うVLAアーキテクチャを提案。予測に基づく人間参加型の実行ゲーティングも実現した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- CEI: 3D空間におけるクロスエンボディメント視覚運動方策学習のための統合インターフェースクロスエンボディメント2026/1/1
異なるロボットアームやエンドエフェクタ間で実演データを転移し、未見の形態でも方策学習を可能にするフレームワークCEIを提案。機能類似性に基づく軌道アライメントで、シミュレーションと実機での双方向転移を実現した。
- SandWorm: 粒状媒体中で動作するスクリュー駆動ロボットのためのイベントベース視触覚知覚と能動振動触覚2026/1/1
粒状媒体中で動くスクリュー駆動ロボットに、振動する弾性体とイベントカメラを組み合わせた視触覚センサを搭載し、地中の物体認識や力推定、パイプライン浚渫などの作業を実現した。
- FlexiCup:デュアルゾーン視触覚センシングを備えたワイヤレス多モーダル吸盤触覚2025/11/1
中央ゾーンで視覚と触覚を切り替え、周辺ゾーンで空間認識を行うワイヤレス多モーダル吸盤を開発し、真空吸着とベルヌーイ非接触把持の両方で知覚駆動型把持と拡散ベースのエンドツーエンド学習を実証した。
- UMIGen:自己中心点群生成とクロスエンボディメント模倣学習の統合フレームワーク模倣学習2025/11/1
ハンドヘルドデバイスで点群の観察-行動ペアを収集し、視認性を考慮した最適化で自己中心3D観測を生成することで、異なるロボット形態への転移を可能にする枠組みを提案した。
- RoboAfford++: ロボット操作とナビゲーションのためのマルチモーダルアフォーダンス学習向け生成AI強化データセットアフォーダンス2025/11/1
物体の機能部位や配置可能領域などのアフォーダンスを細粒度で注釈付けした87万枚超の画像と200万件のQAペアからなるデータセットを構築し、評価ベンチマークも提案した論文。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- SocialNav-Map: 人間軌道予測を用いた動的マッピングによるゼロショット社会ナビゲーション社会ナビゲーション2025/11/1
人間の軌道予測と占有マップを組み合わせ、環境ごとの追加学習なしで安全に移動できるゼロショット社会ナビゲーション手法を提案。
- チームXiaomi EV-AD VLA:キャプション誘導検索システムによるクロスモーダルドローン航法VLA2025/10/1
ドローンの自然言語誘導画像検索において、VLMで候補画像のキャプションを生成し再ランキングする2段階手法を提案し、ベースラインを5%改善した。
- 能動的リスク知覚による社会的ナビゲーションの学習社会的ナビゲーション2025/10/1
RGB-Dとオドメトリのみを用い、周囲の人間との衝突リスクを予測する能動的リスク知覚モジュールをFalconに追加し、混雑環境での社会的に配慮したナビゲーションを実現した。
- SAC Flow: 速度再パラメータ化逐次モデリングによるフローベース方策のサンプル効率の良い強化学習強化学習2025/9/1
フローベース方策のオフポリシー強化学習における不安定性を、速度ネットワークの再パラメータ化とゲート機構で解決し、SACベースの実用的アルゴリズムを提案した。連続制御とロボットマニピュレーションで最先端性能を達成。
- MoiréTac: モアレパターン増幅を利用した多次元知覚のためのデュアルモード視触覚センサ触覚2025/9/1
透明な構造内で微小格子を重ねてモアレ縞を生成し、6軸力覚・接触位置・視覚を同時に取得できる視触覚センサを開発した。
- NavA³: あらゆる指示を理解し、どこへでも移動し、何でも見つけるナビゲーション2025/8/1
高レベルな人間の指示を理解し、実環境で空間認識を伴う物体ナビゲーションを行う階層型フレームワークNavA³を提案。大規模データで訓練したモデルにより、オープンボキャブラリな物体特定と精密な移動を実現した。
- UltraTac:超音波と視触覚を統合したロボット知覚センサ触覚2025/8/1
視触覚センサに超音波センシングを同軸光音響構造で統合し、近接覚・材質分類・テクスチャと材質の同時認識を実現した。
- ManiGaussian++:階層的ガウス世界モデルによる汎用ロボット両腕マニピュレーションマニピュレーション2025/6/1
両腕ロボットのマルチタスク操作のため、役割の異なる腕を区別するガウス表現とリーダー・フォロワー型の階層的世界モデルを導入し、時空間ダイナミクスを予測して性能を向上させた。
- 全方向触覚センシングを備えた柔軟ロボットグリッパーAllTact Fin Ray触覚2025/4/1
透明シリコーン製の柔軟フィンガー内部にカメラを配置し、全体変形と接触面の局所形状を同時に推定する全方向触覚センシング手法を提案した。
- VTire:高解像度センシングを実現する視触覚バイモーダルタイヤ触覚2025/4/1
視覚と触覚を同時に取得できるバイモーダルスマートタイヤを開発し、地形認識やひび割れ検出、荷重センシング、損傷検出を実現した。
- VET:没入型ヒューマンマシンインタラクションのための視覚・電気触覚システム触覚2025/3/1
視覚ベース触覚センサに電気刺激フィルムをスクリーン印刷で統合し、触覚の入力と出力を双方向に行えるシステムを開発した。ゲームやロボットアーム遠隔操作で応用例を示した。
- AVR: 視点と焦点距離の最適化による能動視覚駆動型精密ロボットマニピュレーションマニピュレーション2025/3/1
頭部追跡による視点制御と電動ズームを組み合わせた両腕遠隔操作・学習フレームワークAVRを提案し、シミュレーションと実機で成功率を大幅に向上させた。
- Exo-ViHa: 視覚・触覚フィードバックを備えたクロスプラットフォーム外骨格システムによる効率的な巧みなスキル学習マニピュレーション2025/3/1
3Dプリント製の外骨格とモーションキャプチャグローブ、カメラを組み合わせ、一人称視点とリアルタイム触覚フィードバックで巧みな操作のデモデータを効率的に収集するシステムを提案。
- VolleyBots:運動制御と戦略的プレーを統合したマルチドローン・バレーボール競技のテストベッド群制御2025/2/1
複数ドローンがバレーボールで協調・対戦するテストベッドを構築し、運動制御と戦略を組み合わせたタスクで強化学習やゲーム理論の手法を評価した。階層型方策が3対3で69.5%の勝率を達成し、シミュレーションから実機へのゼロショット転移も示した。
- MoDex:神経内部モデル学習による高次元巧みな制御の計画マニピュレーション2024/9/1
人間の内部モデルに着想を得て、手の動力学を学習するニューラルネットワークと双方向計画を組み合わせ、シミュレーションと実世界で巧みな手の制御を実現するフレームワークを提案。
- MuxHand:時分割多重モータ駆動によるケーブル駆動型巧みなロボットハンドマニピュレーション2024/9/1
4つのモータを時分割多重制御して9本のケーブルを独立に動かすことで、低コストかつ高巧緻性を実現したロボットハンドを開発し、把持・操作性能を実験で示した。
- 手渡し透明物体の深度復元による人からロボットへの受け渡しマニピュレーション2024/8/1
単一のRGB-D画像から手の姿勢を手がかりに透明物体の深度を復元する手法を提案し、実世界での人からロボットへの受け渡しを実現した。
- Chemistry3D: 化学実験向けロボットインタラクションベンチマークsim2real2024/6/1
NVIDIA Omniverse上に構築した化学実験シミュレーションツールキットで、液体や透明物体の操作、温度・色・pH変化の可視化、RLタスクやSim2Real検証を提供する。
- 視覚と触覚の融合:信号処理の観点から見た視触覚センサの最新レビュー触覚2024/6/1
視触覚センサを信号処理の観点から包括的にレビューし、ハードウェアだけでなく処理手法の重要性を示して今後の研究方向を展望した。
- ManiCM: ロボットマニピュレーションのための一貫性モデルによるリアルタイム3D拡散ポリシーマニピュレーション2024/6/1
拡散モデルに一貫性制約を課すことで、点群入力からロボットの行動を1ステップで生成するリアルタイムマニピュレーションモデルを提案し、従来手法を平均10倍高速化した。
- Point-Wise Vibration Pattern Production via a Sparse Actuator Array for Surface Tactile Feedback2024/2/1
- SATac: A Thermoluminescence Enabled Tactile Sensor for Concurrent Perception of Temperature, Pressure, and Shear2024/2/1
- DeformNet: Latent Space Modeling and Dynamics Prediction for Deformable Object Manipulation2024/2/1
- Dual-modal Tactile E-skin: Enabling Bidirectional Human-Robot Interaction via Integrated Tactile Perception and Feedback2024/2/1
- Growing from Exploration: A self-exploring framework for robots based on foundation models2024/1/1
- MASP: Scalable GNN-based Planning for Multi-Agent Navigation2023/12/1
- WSTac: Interactive Surface Perception based on Whisker-Inspired and Self-Illuminated Vision-Based Tactile Sensor2023/8/1
- Visuotactile Sensor Enabled Pneumatic Device Towards Compliant Oropharyngeal Swab Sampling2023/5/1
- Visual-tactile Fusion for Transparent Object Grasping in Complex Backgrounds2022/11/1