Zhi Hou
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PF-RL: 視覚言語行動モデルのための目標条件付き価値幾何による進捗場強化学習VLA2026/9/26
VLAモデルの特徴上に目標条件付きの進捗表現を学習し、その幾何的距離から密な報酬を生成することで、長期的なマニピュレーションタスクの強化学習を効率化する手法を提案。
- StreamPI: 視覚・言語・行動モデルのためのストリーミング型マルチモーダル時間モデリングVLA2026/8/26
単一フレームのVLAモデルに追加パラメータなしで時間的推論能力を付与するフレームワークを提案し、実ロボットタスクで有効性を実証した。
- ExToken: 効率的なVision-Language-Action強化学習のための構造化探索VLA/強化学習2026/7/1
VLAモデルの強化学習における探索停滞問題を分析し、軌跡の多様性がサンプル効率に重要であることを示した上で、オフラインのデモから得た離散的な行動プリミティブに基づいて探索を構造化するExTokenフレームワークを提案した。
- ACE-Brain-0.5:物理的エージェントAIのための統合具現化基盤モデルVLA2026/7/1
ロボット知能を空間知覚、意思決定、身体的行動、自己監視、自己改善の5機能に統合した、単一の8Bバックボーンによる閉ループ基盤モデルを提案する。
- ACE-Brain-0: 空間知能を共通の足場とする普遍的身体性知能基盤モデル2026/3/1
多様な身体(自動運転、ロボット、ドローン)を統合する基盤モデルを提案し、空間知能を共通の足場として、専門化と融合を経て高い性能を達成した。
- カメラ空間で行動を接地する観測中心の視覚-言語-行動ポリシーVLA2025/8/1
ロボットの手先姿勢をロボット基準座標系ではなくカメラ座標系で予測するOC-VLAを提案し、視点変化への汎化とタスク成功率を改善した。
- 視覚的身体脳:マルチモーダル大規模言語モデルに空間での知覚・思考・制御をVLA2025/6/1
マルチモーダルLLMをロボット制御に統合するVeBrainを提案し、テキストベースの制御信号を実機の動作ポリシーに変換するアダプタと大規模指示データセットで脚ロボットやアームの適応的な操作を実現した。
- Dita: 汎用視覚言語行動ポリシーのための拡散TransformerのスケーリングVLA2025/3/1
Transformerで連続行動列を直接ノイズ除去するマルチモーダル拡散フレームワークを提案し、多様なロボットデータを統合して長期的タスクや実環境適応を実現した。
- 拡散トランスフォーマーポリシーVLA2024/10/1
大規模マルチモーダル拡散トランスフォーマーで連続行動系列を直接ノイズ除去し、多様なロボットデータセットで汎化性能を向上させる手法を提案。
- Discovering Human-Object Interaction Concepts via Self-Compositional Learning2022/3/1
- Affordance Transfer Learning for Human-Object Interaction Detection2021/4/1