Hongrui Zhu
収録論文 6本 ・ フィジカルAI/ロボット学習
VLAシミュレーション/自己中心視点模倣学習マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- EgoSim: 身体化インタラクション生成のための自己中心的世界シミュレータシミュレーション/自己中心視点2026/4/1
自己中心視点の動画から3Dシーン状態を更新しながら、空間的に一貫したインタラクション動画を生成する閉ループ型シミュレータを提案。大規模単眼動画からのデータパイプラインと低コスト収集システムも導入。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- ウェーブレットポリシー:世界事前記憶を用いたスケール領域での模倣学習模倣学習2025/4/1
背景画像から持続的なシーン構造を記憶トークンとして符号化し、ウェーブレット変換で行動をマルチスケールに分解して予測する軽量な模倣学習フレームワークを提案。実機を含む多数のタスクで高精度を達成。
- ImitDiff: 基盤モデルの事前知識を転移した妨害に頑健な視覚運動模倣ポリシーVLA2025/2/1
視覚言語基盤モデルで指示をピクセル単位の意味マスクに変換し、二重解像度の知覚と拡散トランスフォーマで妨害に強い模倣学習ポリシーを実現した。
- リソース格差を埋める:高度な模倣学習モデルを手頃な組み込みプラットフォームへ展開マニピュレーション2024/11/1
Transformerベースの大規模模倣学習モデルを、モデル圧縮とTemporal Ensemble with Dropped Actions(TEDA)によりエッジデバイスへ効率的に展開するパイプラインを提案し、各種マニピュレーションタスクで有効性を示した。