Mingxu Zhang
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA/ベンチマークVLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Embodied3DBench: 視覚言語モデルの低水準身体化空間知能のベンチマークVLA/ベンチマーク2026/5/1
視覚言語モデルの身体化3D環境における低水準空間知能を評価するベンチマークを提案し、13モデルの評価と大規模データセットによる改善を示した。
- CrayonRobo: 物体中心のプロンプト駆動型視覚-言語-行動モデルによるロボットマニピュレーションVLA2025/5/1
RGB画像に手書き風の2D視覚プロンプトを重ね、低レベル動作と高レベル計画を同時に指示する視覚-言語-行動モデルを提案。キーフレームごとに接触姿勢と移動方向をSE(3)空間で予測し、長期タスクを実行する。
- SR3D: 単視点3D再構成で透明・鏡面物体の把持を実現マニピュレーション2025/5/1
単視点のRGB-D画像から外部の視覚モデルで物体メッシュを再構成し、視点・キーポイントマッチングで元のシーンに位置合わせすることで、透明・鏡面物体の把持を可能にする学習不要のフレームワークを提案。
- ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic Manipulation2023/12/1