Song Han
収録論文 10本 ・ フィジカルAI/ロボット学習
動画生成協調運転VLAマルチエージェント強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LongLive-Plug: 動画生成のための一度きりの蒸留フレームワーク動画生成2026/9/29
ベースモデルにLoRAとして再利用可能な能力を学習させ、下流モデルに訓練不要でプラグアンドプレイ展開できる蒸留手法を提案。
- MIND-CAVs: 意図駆動型自律に基づくCAVのためのマルチインテリジェンス交渉・意思決定システム協調運転2026/7/1
自動運転車が高次の意図を共有し、エッジサーバが車両間の意図の衝突を調停することで、グローバルに一貫した協調判断を実現するフレームワークを提案した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- ForeAct: 効率的な視覚的先読み計画でVLAを誘導するVLA2026/2/1
将来の観測画像とサブタスク記述を生成してVLAの視覚入力に追加するだけで、アーキテクチャ変更なしに実世界タスクの成功率を大幅に向上させる計画モジュールを提案。
- VLASH: 未来状態を考慮した非同期推論によるリアルタイムVLAVLA2025/12/1
ロボットの状態を前回の行動チャンクで先読みし、予測と実行の時間ずれを解消することで、追加コストなしにVLAの非同期推論を高速化・安定化する手法を提案。
- EgoVLA:自己中心視点の人間動画から視覚-言語-行動モデルを学習VLA2025/7/1
一人称視点の人間動画でVLAモデルを訓練し、逆運動学とリターゲティングで人間の手の動きをロボット動作に変換、少数のロボット実演で微調整してロボットポリシーを獲得する手法を提案。
- 通信を活用した自律走行車のためのロバストで安全なマルチエージェント強化学習:シミュレーションからハードウェアまでマルチエージェント強化学習2025/6/1
V2V通信を活用したマルチエージェント強化学習フレームワークRSR-RSMARLを提案し、シミュレーションから実機へのゼロショット転移と制御バリア関数による安全性保証を実現した。
- CoT-VLA:視覚的思考連鎖推論を用いた視覚-言語-行動モデルVLA2025/3/1
将来の画像フレームを視覚的目標として自己回帰的に予測してから行動系列を生成することで、視覚的思考連鎖推論をVLAに組み込み、実世界タスクで17%の性能向上を達成した。
- VISTA 2.0: An Open, Data-driven Simulator for Multimodal Sensing and Policy Learning for Autonomous Vehicles2021/11/1
- Efficient and Robust LiDAR-Based End-to-End Navigation2021/5/1