Jianhua Han
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAVLA/操作/継続学習自動運転VLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EWAM:統合身体モデルにおける創発的な深さ方向の専門化——意味理解から視覚的先読み、行動までVLA2026/9/30
行動中心の統合身体モデルEWAMを提案し、層ごとの監督なしに浅い層で意味、中間層で予測未来、深い層で行動に注意が向く創発的な深さ方向の専門化が生じることを示した。
- WAM-Diff2: 階層的AR-to-Diffusion蒸留による高効率自動運転VLAVLA2026/8/1
事前学習済みの自己回帰型VLAモデルを、並列実行可能な拡散モデルへ変換するための3段階の階層的蒸留戦略を提案し、推論速度を大幅に向上させつつ性能を維持する。
- AtomicVLA: ロボットにおける原子スキル学習の可能性を解き放つVLA/操作/継続学習2026/3/1
長期的・多段階のロボット操作タスクを扱うため、タスク計画・原子スキル抽象化・細粒度アクションを統合的に生成するフレームワークAtomicVLAを提案。スキル誘導型Mixture-of-Expertsによりスケーラブルな原子スキルライブラリを構築し、継続学習も可能にした。
- Percept-WAM: 知覚強化型世界認識行動モデルによる堅牢なエンドツーエンド自動運転自動運転VLA2025/11/1
2D/3D知覚を単一の視覚言語モデルに統合し、World-PV/World-BEVトークンとグリッド条件付き予測で長尾・遠距離・小物体に強い自動運転モデルを提案。
- VidMan: ビデオ拡散モデルの暗黙的ダイナミクスを活用したロボットマニピュレーションマニピュレーション2024/11/1
ビデオ拡散モデルを2段階で訓練し、未来の視覚軌道予測で環境ダイナミクスを学習した後、逆ダイナミクスモデルに変換してロボット操作の行動予測精度を向上させた研究。
- NavCoT:分離推論の学習によるLLMベース視覚言語ナビゲーションの強化VLA2024/3/1
視覚言語ナビゲーション(VLN)において、LLMにナビゲーションの思考連鎖(世界モデルによる次観測の想像、候補選択、行動決定)を学習させ、ドメインギャップを効率的に埋める手法を提案。
- CODA: A Real-World Road Corner Case Dataset for Object Detection in Autonomous Driving2022/3/1