Kefan Gu
収録論文 7本 ・ フィジカルAI/ロボット学習
VLA/推論高速化VLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Realtime-VLA FLASH: 拡散型VLAのための投機的推論フレームワークVLA/推論高速化2026/5/1
拡散型視覚言語行動モデル(dVLA)の再計画時の推論遅延を削減するため、軽量ドラフトモデルと主モデルのAction Expertによる並列検証、および必要時に完全推論へ切り替える位相認識フォールバック機構を備えた投機的推論フレームワークを提案した。LIBEROで平均推論遅延を19.1ms(3.04倍高速化)に短縮し、実世界のコンベアベルト仕分けでも有効性を示した。
- RoboChallenge:実機ロボットによる具現化ポリシーの大規模評価VLA2025/10/1
多数のモデルとタスクを実機で評価するオンラインシステムRoboChallengeを構築し、初期ベンチマークTable30で最新VLAモデルを調査した。
- Dexbotic: オープンソース視覚-言語-行動ツールボックスVLA2025/10/1
複数のVLAモデルを単一環境で再現・開発できるPyTorchベースのオープンソースツールボックスを提供し、高性能な事前学習済みモデルも公開した。
- ManiAgent:汎用ロボットマニピュレーションのためのエージェント型フレームワークマニピュレーション2025/10/1
複数のエージェントが協調して環境認識・サブタスク分解・行動生成を行い、複雑なマニピュレーションを効率的にこなすエージェント型アーキテクチャを提案した論文。
- IntentionVLA: 人間とロボットのインタラクションのための汎用かつ効率的な意図推論VLA2025/10/1
意図推論・空間グラウンディング・簡潔な身体性推論を組み合わせたカリキュラム学習と効率的推論機構により、間接的な指示から人間の意図を推論して行動生成するVLAフレームワークを提案。
- LLaDA-VLA:視覚言語拡散アクションモデルVLA2025/9/1
拡散ベースの視覚言語モデルをロボットマニピュレーションに適応させた初のVLAモデルを提案し、特殊トークン分類と階層的アクション復号により従来手法を上回る性能を実現した。
- ROSA: ロボット状態を活用した視覚言語と行動のアライメントVLA2025/6/1
ロボットの状態推定データを自動取得してVLAモデルの訓練に組み込み、視覚言語空間と行動空間のずれを埋めることで、少ないデータでも高性能・高汎化を実現する手法を提案。