Mingtong Dai
収録論文 6本 ・ フィジカルAI/ロボット学習
VLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 緊急動作を優先する:リアルタイムVLA制御のための緊急度認識デノイジングVLA2026/9/29
VLAポリシーのデノイジング計算を動作の実行緊急度に応じて配分し、緊急動作を早く出力しつつ残りを背景で精錬することで、リアルタイム制御の遅延を削減する手法を提案。
- Bridge-WA: ロボット行動のための世界の変化箇所と変化方法の予測VLA2026/7/1
ロボット操作のための軽量な世界行動モデルを提案し、将来の変化を教師モデルから蒸留した3つの事前知識で行動生成を条件付け、外乱に強い汎化を実現した。
- SkiP: ロボット操作の効率化のためのスキップと精密化のタイミングマニピュレーション2026/5/1
模倣学習のポリシーが毎ステップ予測するのをやめ、動作が単調な区間はスキップし、接触や把持などの重要区間だけを高解像度で予測する新しい手法を提案。動作の複雑さを自動検出して区間を分割し、実行ステップを15〜40%削減しつつ成功率を維持・向上させる。
- GraspView: 乱雑環境におけるロボット把持のための能動的知覚スコアリングと最適視点最適化マニピュレーション2025/11/1
RGB画像のみを用いて、乱雑環境での把持を実現するパイプラインを提案。多視点再構成と能動的視点選択により、透明物体や近距離でも高精度な把持を可能にする。
- RoVer: 視覚-言語-行動モデルのためのテスト時検証器としてのロボット報酬モデルVLA2025/10/1
VLAモデルの推論時にロボット過程報酬モデルを検証器として使い、候補行動を生成・評価・選択することで、追加学習なしに性能を向上させるフレームワークを提案。
- 見て行動することを学ぶ:ロボットマニピュレーションのためのタスク認識型仮想視点探索VLA2025/8/1
再構成したシーンからタスクに適した仮想カメラ視点を選んで観測を再描画し、タスク特化型のMixture-of-Experts視覚エンコーダと組み合わせることで、遮蔽や視覚的分布シフトに頑健な多タスクロボット操作を実現した。