Hengshuang Zhao
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- データスケーリングを超えて:視覚言語行動モデルのための表現中心の継続事前学習VLA2026/8/27
ロボットデータの不足を補うため、多様なロボットデータでVLMバックボーンを継続事前学習し、下流タスクの性能を向上させるVLActを提案した。
- StreamPI: 視覚・言語・行動モデルのためのストリーミング型マルチモーダル時間モデリングVLA2026/8/26
単一フレームのVLAモデルに追加パラメータなしで時間的推論能力を付与するフレームワークを提案し、実ロボットタスクで有効性を実証した。
- SRL-MPC: 形状を考慮した強化学習モデル予測制御ナビゲーション2026/8/21
異なる形状のロボット群や群衆の中での安全で効率的なナビゲーションを実現するため、強化学習でMPCのパラメータを適応的に調整する手法を提案した。
- ACE-Brain-0.5:物理的エージェントAIのための統合具現化基盤モデルVLA2026/7/1
ロボット知能を空間知覚、意思決定、身体的行動、自己監視、自己改善の5機能に統合した、単一の8Bバックボーンによる閉ループ基盤モデルを提案する。
- IR-SIM: ナビゲーション、学習、ベンチマークのための軽量スキルネイティブシミュレータシミュレーション2026/6/1
YAML設定だけでシナリオを定義できる軽量なナビゲーション用シミュレータIR-SIMを提案し、テキストからのシナリオ生成や学習データ生成、高忠実度シミュレータや実機への橋渡しを実現した。
- 触覚対応ワールドアクションモデル:非対称注意による触覚統合触覚/操作2026/6/1
接触を伴う操作タスクで、視覚と触覚を統合した世界行動モデルを提案。触覚トークンが視覚ダイナミクスを乱す問題を非対称注意機構で解決し、実ロボットで成功率を向上させた。
- DreamAvoid: 臨界期テストタイムドリーミングによるVLAポリシーの失敗回避VLA/操作2026/5/1
VLAモデルが微細な操作中に失敗する問題に対し、実行が臨界期に入ったかを検出し、複数の候補行動を評価して最適な行動を選択する「テストタイムドリーミング」フレームワークを提案した。
- ACE-Brain-0: 空間知能を共通の足場とする普遍的身体性知能基盤モデル2026/3/1
多様な身体(自動運転、ロボット、ドローン)を統合する基盤モデルを提案し、空間知能を共通の足場として、専門化と融合を経て高い性能を達成した。
- FASTER: リアルタイムフローVLAの再考VLA2026/3/1
フロー型VLAの反応遅延を分析し、Horizon-Aware Scheduleで直近動作のデノイズを1ステップに短縮してリアルタイム応答性を大幅に改善した手法を提案。
- Any3D-VLA:多様な点群によるVLAのロバスト性向上VLA2026/2/1
シミュレータ・センサ・モデル推定の点群を統合して学習し、2D表現と融合することで、VLAモデルの性能とドメインギャップ耐性を高める手法を提案。
- 最適化経路整形によるコンベア上の動的物体操作のSim-to-Real転移sim2real2025/8/1
シミュレータで生成したデモを用いた模倣学習において、外観ノイズのアニーリングで形状情報を優先させるGEMを提案し、コンベア上の動的物体操作を実環境へ転移させた。
- VIP: 視覚指示によるロボットマニピュレーションの事前学習マニピュレーション2024/10/1
テキスト指示の代わりに将来画像とスパース点フローを視覚指示として用いる事前学習手法VIPを提案し、多様なタスクでの性能を大幅に向上させた。
- DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model2023/10/1
- InsMapper: Exploring Inner-instance Information for Vectorized HD Mapping2023/8/1