Mingyu Ding
収録論文 58本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DexVerse: 多タスク・多形態の器用操作のためのモジュール型ベンチマーク器用操作/ベンチマーク2026/7/1
多様な操作スキル、ロボット形態、視覚変化をカバーする大規模ベンチマークDexVerseを構築し、既存手法の汎化性能を評価した。
- Handroid: 器用な手とヒューマノイドを橋渡しする再構成可能ロボットヒューマノイド/器用操作/再構成ロボット2026/7/1
27自由度の電動ボディを器用な手または卓上ヒューマノイドとして再構成できる小型ロボットを開発し、操作・移動・再構成を含む長期的タスクを実証した。
- 電流を触覚として使う:準拠性のある器用な操作のための固有受容的接触フィードバックマニピュレーション2026/7/1
外部の触覚・力センサーを使わず、モーター電流と関節状態から接触を認識し、準拠性のある把持を実現する枠組みを提案。PDコントローラの目標位置を予測して把持力を調整する。
- DenseReward: 失敗合成によるロボット操作のための高密度報酬学習操作2026/7/1
ロボット操作の強化学習を改善するため、シミュレーションで物理的に現実的な失敗軌道を自動生成し、視覚と言語からフレーム単位の高密度報酬を予測する報酬モデルDenseRewardを提案した。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- クロスエンボディメントロボット操作のための行動事前学習VLA2026/6/1
視覚言語行動モデルにおいて、行動モジュールに事前に運動の事前知識を学習させる2段階トレーニング手法を提案し、クロスエンボディメント設定での性能を向上させた。
- TempoVLA: 速度制御可能な視覚言語行動ポリシーの学習VLA2026/6/1
ロボット操作の速度を明示的な条件で制御できる単一のVLAモデルを提案。デモの軌道を任意の速度に再タイミングするデータ拡張と、速度をポリシーに供給する機構を組み合わせ、低リスク区間での高速化と高リスク区間での低速化を実現した。
- DexCompose: 単一の手による多タスク操作のための巧みなポリシー再利用マニピュレーション2026/6/1
既存の巧みな操作ポリシーを再利用し、指レベルのアクション所有権に基づく役割認識型残差構成フレームワークを提案。2つの事前学習済みポリシーを組み合わせて、単一の手で複数のタスクを実行する。
- CoorDex: 身体と手の事前知識を統合した連続的器用な人型ロコ操作ロコ操作2026/6/1
歩行と操作を別々に行う従来手法に対し、身体と手の高次元制御を潜在残差制御に変換し、移動しながら器用な操作を可能にする学習パイプラインを提案した。
- AnyBody: 任意キーポイント指示による全身ヒューマノイドの自由制御全身制御2026/6/1
任意の身体キーポイントのサブセットを指示として全身ヒューマノイドを制御する統一的なコントローラを提案し、大規模なモーション追跡や下流タスクの学習を実現した。
- WatchAct: 行動に基づくロボット操作のベンチマーク操作/ベンチマーク2026/6/1
人間の行動ビデオと言語指示を組み合わせた、ロボット操作のための新しいベンチマークを提案し、シミュレーションと実機で評価した。
- 幾何学的有用性スコアリングによるTransformerベース単眼SLAMの高速化SLAM2026/4/1
単眼SLAMの計算冗長性を減らすため、フレームのマッピング価値を事前に予測する軽量なゲーティングネットワークLeanGateを提案し、90%以上の冗長フレームをスキップして85%以上の計算削減と5倍のスループット向上を実現した。
- UniDex: 人間の一人称視点ビデオからの汎用器用ハンド制御のためのロボット基盤スイート器用操作2026/3/1
人間の一人称視点ビデオからロボット実行可能な軌道を生成し、統一された行動空間と3D VLAポリシーを用いて、複数の器用ハンドへの汎用制御を実現する基盤スイートを提案した。
- SldprtNet: 言語駆動3D設計におけるCAD生成のための大規模マルチモーダルデータセットCAD生成/データセット2026/3/1
産業部品24万点以上を含む、CADモデル生成用の大規模マルチモーダルデータセットを構築し、画像とテキストを組み合わせた入力がCAD生成に有効であることを示した。
- DIAL: 潜在世界モデリングによる意図と行動の分離を用いたエンドツーエンドVLAVLA2026/3/1
VLAモデルにおいて、高次意思決定と低次運動実行を潜在意図ボトルネックで橋渡しし、VLMの潜在空間で未来予測を行い、軽量ポリシーで行動を生成する枠組みを提案した。
- 万物を操る一手:統合的な巧みな操作のための標準表現マニピュレーション2026/2/1
多様なロボットハンドの構造を統一するパラメータ化標準表現を提案し、異なるハンド間での把持政策のゼロショット転移を実現した。
- 視覚が言語を上書きするとき:VLAにおける反事実的失敗の評価と緩和VLA2026/2/1
VLAモデルが言語指示ではなく視覚的ショートカットに従ってしまう「反事実的失敗」を評価するベンチマークLIBERO-CFを提案し、言語条件付けを正則化する二分岐推論手法CAGで改善する。
- LiLo-VLA: 物体中心ポリシー連携による長期的マニピュレーションの構成VLA2026/2/1
物体中心のVLAポリシーをモジュール化して連結し、未学習の長期的マニピュレーション課題にゼロショットで汎化するフレームワークを提案。
- 動作画像拡散との共同学習によるロボットVLAの性能向上VLA2025/12/1
VLAモデルに将来の動きを予測する動作ヘッドを追加し、動作ヘッドと共同学習することで、推論速度を保ちながら動作推論能力と実環境性能を大幅に向上させた。
- VLMベースロボットマニピュレーションのための中間表現の再考マニピュレーション2025/11/1
VLMが理解しやすく汎用性の高い中間表現SEAMを提案し、語彙と文法に分解することで多様な未見タスクに対応。さらに検索拡張少数ショット学習による開放語彙セグメンテーションを設計し、実世界実験でSOTA性能を示した。
- アクションチャンキングにおける地平線の混合VLA2025/11/1
VLAモデルで問題となる行動チャンク長(地平線)のトレードオフを解消するため、異なる地平線のセグメントを並列処理して統合するMixture of Horizons戦略を提案し、性能と汎化性を向上させた。
- VER: 基盤モデル蒸留と動的ルーティングによるロボット学習のための視覚エキスパートトランスフォーマーVLA2025/10/1
複数の視覚基盤モデルを蒸留してエキスパートライブラリを構築し、軽量なルーティングネットワークでタスクに応じた専門家を動的に選択することで、17種類のロボットタスクで最先端性能を達成した。
- CollaBot: 視覚言語ガイドによる同時協調マニピュレーション協調マニピュレーション2025/8/1
視覚言語モデルを活用し、複数ロボットが大型物体を協調して把持・運搬するための汎用フレームワークを提案。実環境を含む実験で従来手法を上回る72%の成功率を達成した。
- Interleave-VLA:画像とテキストの交互入力でロボット操作を強化VLA2025/5/1
画像とテキストを交互に与える指示でロボットを学習させ、未知の物体への汎化性能を2倍に高め、手描きスケッチなどの柔軟な指示にも対応できるVLAモデルを提案。
- RoboTwin: 生成デジタルツインによる双腕ロボットベンチマーク双腕マニピュレーション2025/4/1
3D生成基盤モデルと大規模言語モデルを活用し、多様な専門家データセットと実世界に即した評価プラットフォームを提供する双腕ロボットタスク向けの生成デジタルツインフレームワークを提案。
- ReBot: 実機からシミュレーションを経て実機へ戻るロボット動画合成によるロボット学習のスケーリングsim2real2025/3/1
実機のロボット軌道をシミュレーションで再生して対象物体を多様化し、実背景と合成することで物理的にリアルで時間的一貫性のあるロボット動画を生成し、VLAモデルを対象領域に適応させる手法を提案。
- REMAC: 長期的ロボット操作のための自己反省・自己進化型マルチエージェント協調マルチエージェント計画2025/3/1
視覚言語モデルを用いたロボット計画において、環境変化に適応し効率的に長期タスクを実行するため、自己反省と自己進化を取り入れたマルチエージェント計画フレームワークREMACを提案した。
- 物理特性を考慮したオンラインマスキング推論によるロボットパレタイズマニピュレーション2025/2/1
強化学習とオンライン学習で動的に更新する行動空間マスキングを用い、箱の密度や剛性といった物理特性を考慮して積み付け計画を立てる手法を提案し、実機のロボットパレタイザで有効性を検証した。
- BOSS: 長期的タスクにおける観測空間シフトのベンチマーク模倣学習2025/2/1
階層的ロボット学習で生じる観測空間シフト(OSS)を検証するベンチマークBOSSを提案し、既存模倣学習手法がOSSにより性能低下することを示した。
- GeoManip: ロボット操作のための汎用インターフェースとしての幾何制約マニピュレーション2025/1/1
物体や部位の関係から得られる幾何制約を言語表現を介して解釈し、訓練なしで多様な操作タスクを実行するフレームワークを提案。
- Moto: 動画からロボット操作を学習するための橋渡し言語としての潜在モーショントークンVLA2024/12/1
動画を潜在モーショントークン列に変換し、自己回帰的に事前学習することで、ロボット操作に転移可能な運動知識を獲得する手法を提案。
- DexHandDiff: 適応的巧みな操作のための相互作用を考慮した拡散計画マニピュレーション2024/11/1
接触を伴う巧みな操作のための拡散計画フレームワーク。接触前後の二段階拡散とLLMによるガイダンス生成で、訓練分布外の目標にも適応できる。
- DexH2R: 人間からロボットへのタスク指向巧みな操作マニピュレーション2024/11/1
人間の手の動きをロボットハンドに再ターゲットし、タスク指向の残差行動ポリシーを学習させることで、テレオペレーションなしに巧みな操作を実現するフレームワーク。
- GRAPE: 選好アライメントによるロボット方策の汎化VLA2024/11/1
成功・失敗の試行から報酬を暗黙的に学習し、大規模視覚言語モデルが提案する時空間制約で選好を自動設計することで、VLAモデルの未見タスクへの汎化性能を高める手法。
- 言語駆動型方策蒸留によるマルチエージェント強化学習の協調運転VLA2024/10/1
LLMを教師エージェントとして用い、その意思決定を小規模な生徒エージェントに蒸留することで、協調運転タスクにおけるMARLの学習効率と性能を向上させる手法を提案した。
- 物体部分シーンフローによる具現化非依存の行動計画行動計画2024/9/1
対象物体の部分運動を3Dシーンフローとして予測し、その変換から多様なロボットの行動軌道を生成する具現化非依存の手法を提案。
- 対話的で学習可能な協調運転自動化に向けて:大規模言語モデル駆動の意思決定フレームワーク協調運転/LLM意思決定2024/9/1
大規模言語モデルを活用し、環境モジュール・CoT推論・記憶モジュールを組み合わせて、あらゆるシナリオと協調運転自動化レベルに対応する対話的で学習可能な協調運転フレームワークを提案した。
- P2 Explore: 階層予測を用いた未知の雑然環境における効率的探索探索2024/9/1
雑然とした屋内環境の間取りを予測するFPUNetを提案し、予測した部屋のトポロジーに基づいて訪問順を最適化することで、ロボット探索の経路長を短縮する手法を実現した。
- DSLO: 不整合な時空間伝播に基づく深層シーケンスLiDARオドメトリLiDARオドメトリ2024/9/1
LiDAR点群の時系列から自己位置推定を行う深層学習手法を提案し、空間特徴の再利用やゲート付き階層的姿勢精緻化、時間的特徴伝播により、KITTIとArgoverseで精度と速度を両立した。
- スパース拡散方策:ロボット学習のためのスパースで再利用可能かつ柔軟な方策VLA2024/7/1
Transformerベースの拡散方策にMixture of Expertsを組み込み、タスクごとに専門家を選択的に活性化することで、マルチタスク学習や継続学習を効率化する手法を提案した。
- WOMD-Reasoning: 運転シーンにおけるインタラクション推論のための大規模データセットVLA2024/7/1
実世界の運転シーンにおける交通ルールに基づくインタラクションを記述・推論する300万件のQ&Aデータセットを構築し、それを用いた運転動作言語モデルMotion-LLaVAを提案した。
- DrPlanner: 大規模言語モデルを用いた自動運転車のモーションプランナーの診断と修復自動運転/モーションプランニング2024/3/1
大規模言語モデルを活用し、自動運転車のモーションプランナーを自動的に診断・修復するフレームワークを提案。
- RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis2024/2/1
- RoboScript: 実機とシミュレーションをまたぐ自由形式マニピュレーションのためのコード生成マニピュレーション2024/2/1
ROS抽象化に基づく統一インターフェースで、コード生成による実機・シミュレーション両対応のロボットマニピュレーションパイプラインと自由記述タスクのベンチマークを提案。
- PhyGrasp: 物理常識推論でロボット把持を汎化するマルチモーダル大規模モデルマニピュレーション2024/2/1
言語と3D点群を統合した大規模モデルで物体の物理的性質を推論し、未知の素材や形状でも人間の指示に沿った把持姿勢を生成する。
- SkillDiffuser: Interpretable Hierarchical Planning via Skill Abstractions in Diffusion-Based Task Execution2023/12/1
- EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning2023/12/1
- Generalizable Long-Horizon Manipulations with Large Language Models2023/10/1
- LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving2023/10/1
- RSRD: A Road Surface Reconstruction Dataset and Benchmark for Safe and Comfortable Autonomous Driving2023/10/1
- Human-oriented Representation Learning for Robotic Manipulation2023/10/1
- Tree-Planner: Efficient Close-loop Task Planning with Large Language Models2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Physion++: Evaluating Physical Scene Understanding that Requires Online Inference of Different Physical Properties2023/6/1
- EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought2023/5/1
- AdaptDiffuser: Diffusion Models as Adaptive Self-evolving Planners2023/2/3
- NeRF-Loc: Transformer-Based Object Localization Within Neural Radiance Fields2022/9/1
- ComPhy: Compositional Physical Reasoning of Objects and Events from Videos2022/5/1