Haoran Zhang
Peking University
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Exo2EgoHOI: 手と物体のインタラクションを考慮した三人称視点から一人称視点への動画生成動画生成2026/9/29
三人称視点の操作動画を一人称視点に変換する際、手と物体のインタラクションを保つための4D事前情報と物体中心のアテンション機構を導入した動画生成フレームワーク。
- 未来予測フロー計画による安全なUAV目標追従UAV目標追従2026/9/9
目標の未来予測を残差信号として軌道生成に組み込み、リスク評価付き実行可能プレフィックス修復をサンプリングループ内で行うことで、混雑環境でのUAV目標追従の安全性と追従性を両立させる計画手法を提案。
- HELP: ロールアウト分割による人間効率的な大規模ロボットポストトレーニングVLA/ポストトレーニング2026/7/1
VLAモデルのポストトレーニングにおいて、2人の専門オペレータが12台のロボットを同時監視し、ロールアウトを自動分割する手法を提案し、人間の労力あたりのポリシー改善とタスクスループットを最大化する。
- 先見: 行動条件付きワールドモデル潜在表現による長期的ロボット操作の失敗検出失敗検出2026/6/1
長期的なロボット操作タスクにおいて、最終的な成功/失敗ラベルのみを用いて、行動条件付きワールドモデルの潜在表現から失敗を検出するフレームワークを提案した。
- 中断しない支援:非干渉型人間ロボット支援のためのベンチマークとLLMベースフレームワークHRI/LLM2026/5/1
ロボットが人間の進行中の作業を中断せずに支援する「非干渉型支援」を定義し、その評価用ベンチマークとLLMとスコアリングモデルを組み合わせた支援手法を提案した論文。
- フローマッチングVLAにおける保守的SFTによる基盤能力の保持VLA/ロボット学習2026/5/1
フローマッチング型VLAモデルのファインチューニング時に生じる破壊的忘却を防ぐため、モデルの信頼度に応じて学習信号を動的にスケーリングする保守的教師あり学習(ConSFT)を提案し、LIBEROやRoboTwinベンチマークで既存手法を上回る性能を確認した。
- BlockVLA: ブロック拡散ファインチューニングによる自己回帰VLAの高速化VLA2026/5/1
自己回帰型VLAモデルの推論遅延を減らすため、ブロック拡散パラダイムを導入し、ブロック内で並列生成しつつブロック間の因果性を保つことで、推論を高速化する手法を提案した。
- RoboMME:ロボット汎用ポリシーの記憶能力を評価・理解するベンチマークVLA2026/3/1
長期的・履歴依存的な操作タスクにおけるVLAモデルの記憶機構を評価するため、16タスクからなる標準ベンチマークと14種の記憶拡張VLAを構築し、記憶表現の有効性がタスク依存であることを示した。
- RoboVIP: 視覚的アイデンティティプロンプティングによる多視点動画生成でロボットマニピュレーションを強化マニピュレーション2026/1/1
ロボット操作データを拡張するため、見本画像を条件に多視点で時間的に一貫した動画を生成する手法を提案し、模擬環境と実機で方策性能を向上させた。
- VCoT-Grasp: 視覚的思考連鎖推論による言語駆動型把持生成のための把持基盤モデルマニピュレーション2025/10/1
視覚的思考連鎖推論を組み込んだエンドツーエンドの把持基盤モデルを提案し、大規模データセットを構築して、実環境での把持成功率と未知物体への汎化性能を向上させた。
- ロボット実世界強化学習のための視覚-言語-行動-批評家モデルVLA2025/9/1
大規模データで学習したVLAベースのプロセス報酬モデルVLACを提案し、報酬設計を不要にするとともに、実世界のマニピュレーション4タスクで成功率を約30%から約90%へ向上させた。
- SO(2)同変ガウシアン彫刻ネットワークによる単視点3D再構成3D再構成2024/9/1
単一視点画像からSO(2)同変なガウシアンスプラッティング表現を生成し、高速(150FPS以上)で3D物体を再構成する手法を提案。ロボット把持への応用可能性も示す。