Yan Ding
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- 家庭用移動操作タスクのシームレスな実-シミュレーション-実転送を実現するスケーラブルな具現化知能プラットフォーム移動操作2026/6/1
実環境からシミュレーションへの自動シーン再構築と、ハードウェア非依存のミドルウェアにより、家庭用移動操作タスクの実-シミュレーション-実転送をシームレスに行うプラットフォーム「BestMan」を開発した。
- VISTA: UMIデータの視覚基盤と物理検証によるVLAトレーニング適応VLA2026/6/1
UMIデータをVLAモデルの訓練に使う際の視覚的・物理的な不整合を解消するため、魚眼カメラ用VQAデータセットと物理検証パイプラインを導入し、実ロボット成功率を向上させた。
- EgoAERO: 物体アセットなしで単一の一人称視点ビデオから巧みな操作を学習するマニピュレーション2026/6/1
物体の3Dモデルを使わずに、単一の一人称視点RGB-Dビデオから手と物体の軌跡を再構成し、ロボットの巧みな操作ポリシーを学習するフレームワークを提案した。
- UMI-Bench 1.0: UMIデータを用いた卓上ロボット操作のためのオープンで再現可能な実世界ベンチマークマニピュレーション2026/6/1
UMIスタイルの操作ポリシーを実世界で標準評価する初のベンチマークを提案し、データ収集から評価までの統一プロトコルを提供する。
- 片腕から両腕へ:単腕エージェントの行動を双腕に拡張する新しいフレームワーク双腕操作2026/6/1
単腕のデモンストレーションのみから双腕操作を可能にする階層的アクション拡張フレームワークExS2Dを提案し、シミュレーションと実機で有効性を示した。
- GSAM: 関節物体操作のための汎用かつ安全なロボットフレームワークマニピュレーション2026/5/1
関節物体の操作において、視覚による運動学パラメータ推定とVLMによる常識推論で認識を洗練し、衝突回避の制約を統合した安全な軌道計画を行うフレームワークを提案した。
- 能動的知覚を備えたロボットの計画と状況対応タスク計画/能動的知覚2026/4/1
ロボットの実行中に発生する予期せぬ状況を能動的に知覚し対処するためのフレームワークVAP-TAMPを提案した。視覚言語モデルとシーングラフを活用し、タスクと動作の統合計画を行う。
- LLM-GROP: 大規模言語モデルによる視覚に基づくロボットのタスク・動作計画タスク・動作計画2025/11/1
大規模言語モデルの常識知識と視覚情報を活用し、複数物体の移動を伴うモバイルマニピュレーションのタスク・動作計画を統合するフレームワークを提案。実環境とシミュレーションで成功率と効率を評価した。
- AsyncVLA:視覚言語行動モデルのための非同期フローマッチングVLA2025/11/1
VLAモデルの行動生成に非同期フローマッチングを導入し、行動の信頼度に基づく自己修正を可能にすることで、長期的タスクでの安定性とデータ効率を向上させた。
- FastUMI-100K:大規模UMI形式データセットによるデータ駆動型ロボットマニピュレーションの進展マニピュレーション2025/10/1
モジュール型ハードウェアと軽量トラッキングを備えたFastUMIシステムで収集した10万件超の家庭内タスク実演データセットを構築し、多様な模倣学習アルゴリズムで高い成功率を示した。
- U-Arm:ロボットマニピュレーション向け超低コスト汎用遠隔操作インターフェース遠隔操作2025/9/1
3Dプリント製リーダーアームで様々な商用ロボットアームを遠隔操作できる低コストフレームワークを提案し、データ収集効率を39%向上させた。
- MLM: アーム付き四足ロボットのマルチタスク全身移動操作制御の学習移動操作2025/8/1
実世界とシミュレーションのデータを活用した強化学習フレームワークMLMを提案し、6自由度アーム付き四足ロボットが複数タスクの全身移動操作を自律的または遠隔操作で行えるようにした。
- Skill-Nav: ウェイポイントインターフェースによる多様な四足歩行を統合したナビゲーション歩行2025/6/1
四足ロボットの歩行スキルをウェイポイントを介して階層的ナビゲーションに統合し、障害物を避けながら目標地点へ自律移動できるようにした研究。
- 左脳から右脳へ:視覚と言語によるナビゲーションのための適応的テキストドリーマーVLA2025/5/1
視覚と言語によるナビゲーション(VLN)において、LLMをベースに左脳(論理統合)と右脳(想像的予測)の二重分岐構造で将来の環境意味を言語形式で適応的に想像し、ナビゲーション専門モジュールと統合する手法を提案。R2Rベンチマークで少ないパラメータで最先端性能を達成。
- 小さく考え、大きく行動する:生涯ロボットマニピュレーションのためのプリミティブプロンプト学習マニピュレーション2025/4/1
スキル間で共有されるプリミティブをプロンプトとして学習し、生涯にわたるロボットマニピュレーションを実現する手法を提案。
- MoMa-Kitchen: モバイルマニピュレーションにおけるアフォーダンスに基づく最終接近ナビゲーションのための10万件超ベンチマークモバイルマニピュレーション2025/3/1
キッチン環境でロボットが物体を掴むために最適な最終ナビゲーション位置を学習するための10万件超のデータセットとベンチマークを構築し、軽量なベースラインモデルNavAffを提案した。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- OpenFly: 空中視覚言語ナビゲーションのための包括的プラットフォームVLA2025/2/1
空中視覚言語ナビゲーションのための多様なレンダリングエンジンと自動データ収集ツールチェーンを統合したプラットフォームを提案し、10万軌道の大規模ベンチマークとキーフレーム重視のナビゲーションモデルを構築した。
- SpatialVLA:視覚-言語-行動モデルのための空間表現の探求VLA2025/1/1
ロボット操作における空間理解の重要性に着目し、3D位置エンコーディングと適応的行動グリッドを導入した視覚-言語-行動基盤モデルSpatialVLAを提案。110万件の実世界ロボットデータで事前学習し、ゼロショットでの操作や新環境への適応を実現した。
- BestMan: 統一シミュレーション・ハードウェアAPIを備えた身体性AI向けモジュール式移動マニピュレータプラットフォームsim2real2024/10/1
PyBulletベースの身体性AI研究用シミュレーションプラットフォームBestManを提案し、知覚・計画・制御の統合、モジュール性、sim-to-real転送、多様なハードウェア対応を実現した。
- FastUMI: スケーラブルでハードウェア非依存の汎用マニピュレーションインターフェースとデータセットマニピュレーション2024/9/1
ロボットアームの実世界データ収集を低コスト・ハードウェア非依存で実現するため、UMIを再設計したFastUMIを提案し、22タスク・1万軌跡超のデータセットを公開した。
- AlignBot: ユーザーのリマインダーに沿ったVLM駆動型家庭用ロボットのカスタマイズタスクプランニングVLA2024/9/1
家庭用ロボット向けに、微調整したLLaVA-7BをGPT-4oのアダプタとして用い、ユーザーのリマインダーを構造化指示に変換してカスタマイズされたタスク計画を生成するフレームワークを提案し、実環境実験で成功率86.8%を達成した。
- ドローンによる建物検査のためのクラスタリングベースの新たな視点計画手法視点計画2024/8/1
スペクトラルクラスタリングと局所ポテンシャル場法、ハイパーヒューリスティックアルゴリズムを組み合わせ、ドローンによる建物検査の視点計画を効率的に行う手法を提案した。
- DKPROMPT: ドメイン知識で視覚言語モデルを誘導するオープンワールド計画手法VLA2024/6/1
PDDLのドメイン知識を使って視覚言語モデルへのプロンプトを自動生成し、オープンワールドでのロボットタスク計画・実行を高精度化するフレームワークを提案した論文。
- 最適化ベースのタスク・動作計画のサーベイ:古典的手法から学習ベース手法までタスク・動作計画2024/4/1
タスク計画と動作計画を統合するTAMPについて、最適化ベースの手法を古典的手法から学習ベース手法まで体系的にレビューしたサーベイ論文。
- MoMa-Pos: 物体運動学を考慮した移動マニピュレーションのための効率的なベース配置最適化フレームワーク移動マニピュレーション2024/3/1
移動マニピュレータのベース配置を最適化するフレームワークを提案し、タスクに関連する物体を優先的に再構成して計算効率を高め、実環境とシミュレーションで既存手法を上回る性能を示した。
- ORLA*: Mobile Manipulator-Based Object Rearrangement with Lazy A Star2023/9/1
- Symbolic State Space Optimization for Long Horizon Mobile Manipulation Planning2023/7/1
- ARDIE: AR, Dialogue, and Eye Gaze Policies for Human-Robot Collaboration2023/5/1
- Integrating Action Knowledge and LLMs for Task Planning and Situation Handling in Open Worlds2023/5/1
- Grounding Classical Task Planners via Vision-Language Models2023/4/1
- Task and Motion Planning with Large Language Models for Object Rearrangement2023/3/1
- Robot Task Planning and Situation Handling in Open Worlds2022/10/1
- GLAD: Grounded Layered Autonomous Driving for Complex Service Tasks2022/10/1
- Learning to Ground Objects for Robot Task and Motion Planning2022/2/1
- Visually Grounded Task and Motion Planning for Mobile Manipulation2022/2/1
- Task-Motion Planning for Safe and Efficient Urban Driving2020/3/1
- Visual Semantic SLAM with Landmarks for Large-Scale Outdoor Environment2020/1/1