Linjie Li
収録論文 3本 ・ フィジカルAI/ロボット学習
VLA評価VLA動画生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HumanCLAW: 視覚言語モデルは身体を通して行動できるか?VLA評価2026/7/1
視覚言語モデル(VLM)の身体を使った行動能力を評価するフレームワークを提案し、41の屋内シーンで1,218エピソードのベンチマークを構築。最先端のVLMでも成功率は最大16.8%にとどまり、物体認識ではなく身体の自己認識が欠如していることが課題と判明。
- 視点計画:VLMによる3D空間の能動的推論と計画VLA2026/5/1
VLMがカメラ移動による視点変化を予測し、複数ステップの計画で目標視点を特定できるかを検証し、その能力を高める反復的自己探索と視点グラフ蒸留の枠組みを提案した。
- SlowFast-VGen:行動駆動型長尺動画生成のための低速・高速学習動画生成2024/10/1
人間の補完的学習システムに着想を得て、低速学習(世界動態の拡散モデル)と高速学習(時間LoRAによるエピソード記憶)を組み合わせ、行動に基づく長尺動画生成の一貫性を向上させる手法を提案。