Rui Zhao
Honor
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視覚-言語-行動モデルにおけるトークン圧縮のための最小知覚差モデリングVLA2026/8/21
本論文は、視覚-言語-行動(VLA)モデルのトークン圧縮において、下流の行動応答に基づく最小知覚差(JND)を導入し、許容範囲内の行動変化を保証する軽量なJND推定器を提案する。
- EATR-Stereo: 身体性を考慮したステレオ証拠のルーティングによるヒューマノイド視覚言語行動制御VLA/ヒューマノイド2026/8/18
頭部搭載ステレオカメラを持つヒューマノイドのVLA制御において、主視点のトークンを保持しつつ補助視点の情報を身体状態に応じて選択的に統合するフレームワークを提案し、実機で高い成功率を達成した。
- 画像1枚で十分:テキストベース世界モデルによるエージェント型ワンショット画像生成と長尾空間知覚データ生成2026/6/18
単一の参照画像から、LVLMとLLMを用いて構造化シーン表現を構築し、拡散モデルで物理的に妥当な長尾データを生成するフレームワークWMGen-v1を提案した。
- 分解された視覚プロキシによる直接的な3D認識オブジェクト挿入画像生成/拡散モデル2026/6/4
背景画像へのオブジェクト挿入を、3Dポーズ制御可能な拡散モデルベースのフレームワークDIRECTを提案。外観・幾何・文脈の3条件を分離注入し、高品質な合成とポーズ操作を両立する。
- Dream.exe: ビデオ生成モデルは実行可能なロボット操作を夢見ることができるか?操作2026/6/3
ビデオ生成モデルが生成した操作映像を物理シミュレータで実行可能なロボット軌道に変換し、実行成功率で物理世界の理解度を評価するフレームワークDream.exeを提案した。
- VECTOR-Drive: 密結合された視覚言語と軌道エキスパートルーティングによるエンドツーエンド自動運転自動運転2026/5/1
エンドツーエンド自動運転のための、視覚言語モデルと軌道予測を密結合したVLAフレームワークを提案し、共有アテンションとセマンティックルーティングにより高い運転スコアを達成した。
- 実世界クラフトランナーにおける協調・競合チームプレイsim2real2026/2/1
シミュレーションと実機ロボットからなるシステムを構築し、マルチエージェント強化学習で協調・競合方策を効率的に学習させ、OODSIでsim2realギャップを軽減して実世界タスクを実現した。
- CoC-VLA: 因果連鎖型視覚言語行動モデルによる説明可能な自動運転のための敵対的ドメイン転移自動運転/VLA2025/11/1
シミュレーションで得た長尾ケース対応能力を実世界へ転移するため、因果連鎖推論を行う視覚言語モデルを教師・生徒・識別器で構成した敵対的転移フレームワークを提案した論文。
- ロボットマニピュレーションのための人間参加型オンライン棄却サンプリングマニピュレーション2025/10/1
オンライン棄却サンプリングと人間による修正を組み合わせ、VLAモデルを安定かつ高精度に微調整する手法Hi-ORSを提案し、実機で接触の多い操作を短時間で習得させた。
- RwoR: ロボットなしで方策学習するための人間の手の収集からのロボットデモンストレーション生成模倣学習2025/7/1
手首に装着したGoProで人間の手のデモを収集し、生成モデルでロボットグリッパのデモに変換することで、実機ロボットなしに操作方策を学習できる手法を提案。
- 3次元情報経路計画のための注意機構に基づく学習経路計画2025/6/1
3次元空間での適応的情報経路計画問題に対し、注意機構を用いた深層強化学習手法を提案し、環境の不確実性を低減しつつ探索と活用のバランスを取る。
- DiffE2E: 拡散と教師あり方策を統合したハイブリッド行動拡散によるエンドツーエンド自動運転の再考自動運転/拡散モデル2025/5/1
拡散モデルと教師あり方策を組み合わせたハイブリッドデコーダを提案し、マルチセンサー知覚特徴の階層的双方向クロスアテンション統合により、CARLAとNAVSIMで最先端性能を達成したエンドツーエンド自動運転フレームワーク。
- 深層強化学習による大規模ロボット探査探査2024/3/1
深層強化学習とアテンション機構を用いて、未知環境をリアルタイムに探査する経路計画手法を提案し、大規模環境へのスケーリングを実現した。
- Learning Highly Dynamic Behaviors for Quadrupedal Robots2024/2/1
- PDiT: Interleaving Perception and Decision-making Transformers for Deep Reinforcement Learning2023/12/1
- Lifelike Agility and Play in Quadrupedal Robots using Reinforcement Learning and Generative Pre-trained Models2023/8/1
- Transformer in Transformer as Backbone for Deep Reinforcement Learning2022/12/1
- Progressive Correspondence Pruning by Consensus Learning2021/1/1