Iaroslav Ponomarenko
収録論文 3本 ・ フィジカルAI/ロボット学習
VLAアフォーダンス/マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CrayonRobo: 物体中心のプロンプト駆動型視覚-言語-行動モデルによるロボットマニピュレーションVLA2025/5/1
RGB画像に手書き風の2D視覚プロンプトを重ね、低レベル動作と高レベル計画を同時に指示する視覚-言語-行動モデルを提案。キーフレームごとに接触姿勢と移動方向をSE(3)空間で予測し、長期タスクを実行する。
- ManipGPT:大規模視覚モデルのアフォーダンスセグメンテーションは関節物体操作に十分か?アフォーダンス/マニピュレーション2024/12/1
大規模視覚Transformerを微調整し、関節物体の操作に必要な部位レベルのアフォーダンスマスクを予測する枠組みを提案。シミュレーションと実世界の画像データセットで学習し、インピーダンス適応方策と組み合わせることで複雑な知覚システムなしに操作を実現した。
- ManipVQA: マルチモーダル大規模言語モデルへのロボットアフォーダンスと物理的知識の注入VLA2024/3/1
ロボット操作に必要な道具検出・アフォーダンス認識・物理概念理解をVQA形式で学習させ、MLLMに操作中心の知識を注入するフレームワークを提案した。