Jiaya Jia
The Hong Kong University of Science and Technology
収録論文 7本 ・ フィジカルAI/ロボット学習
sim2realVLAデータセット
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WorldLine: ロボットマニピュレーションのための行動駆動型視覚シミュレーションsim2real2026/9/29
行動なしのロボット動画1万時間以上から操作ダイナミクスを学習し、10種類以上の実機の行動軌跡で接地することで、異なる機体間で共有可能な行動駆動型視覚シミュレータを構築した研究。
- データスケーリングを超えて:視覚言語行動モデルのための表現中心の継続事前学習VLA2026/8/27
ロボットデータの不足を補うため、多様なロボットデータでVLMバックボーンを継続事前学習し、下流タスクの性能を向上させるVLActを提案した。
- PhysEditWorld: 物理編集可能なワールドモデル向け大規模データセットデータセット2026/6/25
ゲームワールドモデルの物理ダイナミクスを制御可能にするため、重力パラメータを明示的に付与した大規模マルチモーダルデータセットを構築した。
- StarVLA-α: 視覚言語行動システムの複雑さを低減するVLA2026/4/1
VLAモデルの設計選択を制御条件下で研究するため、複雑さを最小限に抑えたシンプルなベースラインStarVLA-αを提案し、複数ベンチマークで高い性能を達成した。
- VP-VLA: 視覚プロンプトをインターフェースとする視覚言語行動モデルVLA2026/3/1
VLAモデルのブラックボックス的な制御を改善するため、高次推論と低次実行を分離し、視覚プロンプト(十字線やバウンディングボックス)を介して指示を伝える二重システムフレームワークを提案した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- RoboCoder: 大規模言語モデルによる基本スキルから一般タスクへのロボット学習VLA2024/6/1
大規模言語モデルと実環境フィードバックを組み合わせ、基本スキルから複雑なタスクへとロボットが自律的に学習するフレームワークを提案し、80タスクのベンチマークで36%の相対改善を達成した。