Zijian Song
収録論文 4本 ・ フィジカルAI/ロボット学習
マニピュレーション操作VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ロボット操作は視覚から幾何への写像である:言語・ビデオモデルを超えた視覚幾何バックボーンマニピュレーション2026/4/1
ロボット操作を視覚から3次元幾何への写像と捉え、言語やビデオのバックボーンではなく事前学習済み3次元表現を用いたVGAモデルを提案し、シミュレーションと実機で優れた性能を示した。
- 事前学習済みビデオモデルから物理を学ぶ:ロボット操作のためのマルチモーダル連続・逐次世界相互作用モデル操作2026/3/1
ロボットデータ不足を補うため、事前学習済みビデオ生成モデルを物理シミュレータとして活用し、ビデオと行動を共通の物理トークンで表現することで、操作タスクを解く枠組みPhysGenを提案した。
- RADAR: 実世界ダイナミクス・空間物理知能・自律評価による視覚言語行動モデルの汎化ベンチマークVLA2026/2/1
VLAモデルの実世界汎化を評価するため、物理ダイナミクス・空間推論タスク・3D指標による完全自律評価を統合したベンチマークRADARを提案し、既存モデルを監査した。
- AutoDrive-R²: 自動運転VLAモデルの推論と自己反省能力を強化VLA2025/9/1
自動運転向けVLAモデルに思考連鎖と強化学習を導入し、推論と自己反省を促すことで軌道計画の精度と解釈性を向上させた研究。