Jingjing Zhang
収録論文 5本 ・ フィジカルAI/ロボット学習
VLAVLM/空間推論/動作計画
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- ロボット動作に対するVLMの空間推論能力の評価:動作嗜好を考慮したロボット計画への一歩VLM/空間推論/動作計画2026/3/1
視覚言語モデル(VLM)がロボットの動作計画に必要な空間推論(物体との距離や経路スタイルなどの嗜好)をどの程度理解できるかを、4つの最新VLMと4つの質問方法で評価した。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- Evo-1: 意味的整合性を保つ軽量Vision-Language-ActionモデルVLA2025/11/1
ロボットデータでの事前学習なしに、VLMの知覚表現を保ちながら軽量・高性能を実現したVLAモデルを提案。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。