Huajie Tan
Peking University
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ロボ・ドーパミン2.0:ロボット操作のための履歴条件付き・OOD認識プロセス報酬モデリングマニピュレーション2026/8/16
VLAモデルのロボット操作における報酬設計を改善するため、履歴とOOD(分布外)を考慮したプロセス報酬モデルを提案し、ペアワイズ予測インターフェースとSigned-Hopカリキュラムで学習精度を向上させた。
- WorldSimProbe: 身体的操作のための行動条件付きワールドモデルにおけるシミュレータ忠実度の診断シミュレーション評価2026/8/1
行動条件付きワールドモデル(ACWM)が物理シミュレータとして忠実に機能するかを検証するための評価手法「WorldSimProbe」を提案し、複数のベンチマークで既存モデルの欠陥を明らかにした。
- LLaVA-OneVision-2:次世代知覚知能に向けてVLA2026/5/25
動画を圧縮ビットストリームとして扱い、適応的な時間グループと空間的証拠の選択によりトークン予算を効率的に配分する新しい視覚言語モデルを提案。大規模なオープン監視データで学習し、動画理解や時間的・空間的接地、操作トレース推論などで高性能を達成。
- PRM-as-a-Judge:ロボットの細粒度監査のための高密度評価パラダイムロボット評価2026/3/1
ロボットの実行品質をバイナリ成功率ではなく、プロセス報酬モデル(PRM)を用いて軌道ビデオから密に評価する新しいパラダイムを提案し、OPD指標体系と診断ベンチマークRoboPulseで検証した。
- Action-Sketcher: 視覚スケッチを介した長期的ロボット操作のための推論から行動へVLA2026/1/1
ロボットの視界に点・箱・矢印・関係を描く「視覚スケッチ」を中間表現として導入し、See-Think-Sketch-Actのサイクルで長期的な操作を実現するVLAフレームワークを提案。
- RoboBrain 2.5:奥行きを見据え、時間を心に刻むVLA2026/1/1
深度認識に基づく3D空間推論と、時間的な進捗予測を統合した次世代の身体性AI基盤モデルを提案し、複雑なマニピュレーションの精度と実行認識を向上させた。
- Robo-Dopamine: 高精度ロボットマニピュレーションのための汎用プロセス報酬モデリングマニピュレーション2025/12/1
多視点入力から段階的な進捗を理解する汎用報酬モデルを3400時間超のデータで学習し、理論的に整合した報酬整形で強化学習によるロボット操作を高精度化した。
- ロボティクスのための視覚言語モデルにおける推論を伴う空間トレースに向けてVLA2025/12/1
3D空間の参照と計測を統合したVLM「RoboTracer」を提案し、強化学習による多段階の空間推論を実現。大規模データセットとベンチマークも構築し、ロボットの長期的タスク実行に応用した。
- RoboOS-NeXT:生涯学習・スケーラブル・堅牢なマルチロボット協調のための統合メモリフレームワーク群制御2025/10/1
空間・時間・身体性を統合した共有メモリSTEMを中核に、脳-小脳型の階層構造で異種ロボット群の生涯学習・動的タスク割当・障害復旧を実現するフレームワークを提案。
- RoboBrain 2.0 技術報告VLA2025/7/1
視覚と言語を統合し、実環境での知覚・推論・計画を担う具現化基盤モデルRoboBrain 2.0を提案。7Bと32Bの2種類で、空間理解や時系列意思決定タスクで高い性能を示す。
- RoboOS: クロスエンボディメントとマルチエージェント協調のための階層型具現化フレームワークマルチエージェント協調2025/5/1
脳と小脳の階層アーキテクチャに基づき、異なる身体を持つロボット間の協調と長期タスクの計画・実行を可能にするオープンソースの具現化システムを提案。
- RoboBrain:抽象的から具体的へと至るロボット操作のための統合脳モデルVLA2025/2/1
ロボット操作に必要な計画・アフォーダンス知覚・軌道予測を統合したMLLMベースの脳モデルRoboBrainを提案し、多次元情報を付与した大規模データセットShareRobotで訓練して最先端性能を達成した。