Yiming Wang
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GLoTouch: 並列グリッパによるグローバル・トゥ・ローカルな触覚知覚で外部視覚なしに物体探索・認識・把持を実現触覚2026/9/23
並列グリッパに長尺プローブと視触覚センサを組み合わせ、暗所でも触覚のみで容器内の物体探索から形状認識・把持までを行う枠組みを提案した。
- メートル単位で行動する:精密ロボット操作のための計量的相互作用の学習マニピュレーション2026/9/16
物体とシーンに対する動作の計量的な関係を明示的にモデル化し、VLAやWAMモデルの操作精度を向上させるフレームワークを提案した。
- VT-MUSE: 操作のためのマルチモーダル統合シーケンシャル視触覚表現学習視触覚表現学習2026/8/21
視覚と触覚の時系列情報を統合する表現学習フレームワークを提案し、シミュレーションと実世界で操作タスクの成功率を大幅に向上させた。
- LA4VLA: 視覚なしで行動を学習する言語-行動事前学習VLA2026/6/1
視覚-言語-行動モデルが視覚情報に過度に依存する問題を解決するため、視覚観察なしで言語条件付き行動の事前学習を行うフレームワークを提案し、シミュレーションと実世界で性能向上を確認した。
- E²DT:経験認識サンプリングによる効率的かつ効果的なロボット操作のためのディシジョン・トランスフォーマー強化学習2026/5/1
ロボット操作の強化学習において、ディシジョン・トランスフォーマーの性能を向上させるため、経験の質と多様性を考慮したサンプリング手法を提案した論文。
- C2T: キャプション構造とLLM整合型常識報酬学習による交通・車両協調群制御2026/4/1
交通信号制御と自動運転車の協調において、人手設計の報酬に代わり、大規模言語モデルから常識知識を抽出して内在報酬を学習し、MARLポリシーを導くフレームワークC2Tを提案した。
- 対話を超えたベンチマーキング:協調的インスタンス物体ナビゲーションの再現可能なベンチマークナビゲーション2026/3/31
本論文は、協調的インスタンス物体ナビゲーション(CoIN)のための再現可能なベンチマークQAsk-Navを提案し、ナビゲーションと質問応答の能力を独立に評価できるようにした。また、軽量な統一モデルLight-CoNavを開発し、既存手法より小型・高速でありながら、未知の物体や環境への汎化性能が高いことを示した。
- 予測時空間観測と深層強化学習による分散型エンドツーエンド多機追跡群制御2026/3/1
LiDAR生データから直接制御指令を生成する分散型MARLフレームワークを提案し、予測時空間観測により障害物回避と動的目標の包囲を実現、実機ドローン群で検証した。
- ExoGS: スケーラブルなマニピュレーションデータ収集のための4D Real-to-Sim-to-Realフレームワークsim2real2026/1/1
人間の直接教示をロボット同型の受動外骨格で計測し、環境と物体を3Dガウシアンスプラッティングで再構成してシミュレーション上で大規模データ拡張と方策学習を行うReal-to-Sim-to-Real手法を提案。
- RGMP: 汎化可能なヒューマノイドロボット操作のための再帰的幾何事前マルチモーダルポリシーマニピュレーション2025/11/1
視覚言語モデルに幾何学的な事前知識を組み込み、ガウス過程でロボットと対象物の関係を再帰的に符号化することで、少ないデータで未知環境にも汎化するヒューマノイド操作を実現した。
- ロボット把持のための障害物推論マニピュレーション2025/11/1
散らかった環境で目標物体を把持するため、障害物を除去する行動順序を推論する視覚言語モデルUNOGraspを提案し、大規模データセットUNOBenchで訓練・評価した。
- AirExo-2:低コスト外骨格による汎化可能なロボット模倣学習のスケールアップ模倣学習2025/3/1
低コストの外骨格システムAirExo-2で実世界の大規模デモンストレーションデータを収集し、それを擬似ロボットデータに変換して、3D空間と2D意味論を融合する模倣学習ポリシーRISE-2を訓練した。
- 自由形式言語によるロボット推論と把持マニピュレーション2025/3/1
GPT-4oなどの視覚言語モデルを活用し、自由な指示に基づいて散らかった箱から物体を把持するFreeGraspを提案。物体をキーポイントで検出し、空間推論を行い把持順序を決定する。
- ForceMimic: 力中心の模倣学習と力・動作キャプチャシステムによる接触の多いマニピュレーションマニピュレーション2024/10/1
人間の力加減を計測する装着型デバイスで野菜の皮むきなどの接触作業のデモを集め、力と位置を同時に扱う模倣学習でロボットに教える手法を提案。視覚のみの手法より成功率を54.5%向上させた。
- 対話型指示エラー検出と位置特定による連続環境での視覚言語ナビゲーションVLA2024/6/1
連続環境での視覚言語ナビゲーションにおいて、ユーザーの指示エラーを検出し位置を特定して対話的に修正を求める手法を提案し、新しい評価指標SINを導入した。
- 指示エラーの検出と位置特定:視覚と言語によるナビゲーションにおける課題VLA2024/3/1
視覚と言語によるナビゲーション(VLN-CE)において、人間が与える指示に含まれる誤りを検出・位置特定するための新しいベンチマークと手法を提案し、既存手法の脆弱性を示した。
- AirExo: Low-Cost Exoskeletons for Learning Whole-Arm Manipulation in the Wild2023/9/1
- Unsupervised Active Visual Search with Monte Carlo planning under Uncertain Detections2023/3/1
- 3DSGrasp: 3D Shape-Completion for Robotic Grasp2023/1/1
- Loop closure detection using local 3D deep descriptors2021/11/1
- POMP++: Pomcp-based Active Visual Search in unknown indoor environments2021/7/1
- Where to Explore Next? ExHistCNN for History-aware Autonomous 3D Exploration2020/11/1
- POMP: Pomcp-based Online Motion Planning for active visual search in indoor environments2020/9/1