Guanghui Ren
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BEE: 視覚言語行動モデルを用いた介入適応型実世界強化学習VLA2026/9/23
凍結したVLAモデルに対し、人間の修正を行動次元ごとの信頼度に応じた制約として扱うことで、実機でのオンライン強化学習を効率化する手法を提案。
- GE-Act 2.0: ロボット操作のためのワールドアクションモデルの事前学習とスケーリングVLA2026/9/4
操作データのみで生成・行動コンポーネントをゼロから学習するワールドアクションモデルを提案し、大規模データでの事前学習とスケーリングの効果を検証した。
- GE-Sim 2.0: ロボット操作のための包括的クローズドループ映像世界シミュレータへのロードマップシミュレーション2026/5/1
ロボット操作のためのクローズドループ映像世界シミュレータGE-Sim 2.0を提案。実ロボットデータで再学習し、状態デコーダ、世界判定器、高速化モジュールを追加して、映像シミュレーションからポリシー学習へのループを閉じる。
- Libra-VLA: 非同期の粗密デュアルシステムによる学習均衡の実現VLA2026/4/1
VLAモデルを粗い意図予測と細かい動作生成の2段階に分離し、学習負荷の均衡と非同期実行を実現する新しいアーキテクチャを提案した。
- RoboClaw: 長期的ロボットタスクのためのスケーラブルなエージェント型フレームワークVLA/長期的タスク2026/3/1
RoboClawは、データ収集・ポリシー学習・タスク実行を単一のVLM駆動コントローラで統合し、自己リセット機構により人間の介入を最小限に抑えつつ長期的タスクを自律的に実行するロボットフレームワークを提案する。
- ACoT-VLA: 視覚言語行動モデルのための行動連鎖推論VLA2026/1/1
行動空間で直接推論する「行動連鎖推論(ACoT)」を提案し、粗い行動意図を明示的・暗黙的に生成して最終方策を導くVLAアーキテクチャを実現した。
- 自己回帰離散事前学習による身体性VLM推論とロボット行動の統合VLA2025/12/1
身体性推論を評価するベンチマークERIQと、連続制御を離散化するFACTトークナイザを提案し、推論と行動を統合したGenieReasonerで実世界マニピュレーション性能を向上させた。
- Real2Edit2Real: 3D制御インターフェースによるロボット実演の生成sim2real2025/12/1
多視点RGBから3D再構成した点群を編集し、深度を主制御信号とする動画生成モデルで新しい操作実演を合成することで、1〜5件の実演から50件相当のデータを生成しデータ効率を10〜50倍向上させるフレームワーク。
- Act2Goal: ワールドモデルから汎用ゴール条件付き政策へマニピュレーション2025/12/1
視覚的ゴールと現在の観測から、目標条件付きワールドモデルで中間視覚状態を生成し、マルチスケール時間制御で長期的なマニピュレーションを実現する汎用政策を提案。
- ロバストなロボット汎化のための忠実度を考慮したデータ構成sim2real2025/9/1
生成データ拡張におけるデータ構成を最適化問題として扱うCIFTを提案し、実データと合成データの混合比を情報忠実度に基づいて調整することで、ロボット政策の分布外汎化性能を大幅に向上させた。
- Imagine2Act: 想像上の目標を用いた物体-動作の運動整合性によるロボットマニピュレーションマニピュレーション2025/9/1
言語指示から想像した目標画像と3D点群を生成し、物体の変形とエンドエフェクタ動作を整合させることで、高精度な物体再配置タスクを実現する模倣学習フレームワークを提案した。
- EO-1: 汎用ロボット制御のためのオープンな統合身体性基盤モデルVLA2025/8/1
視覚・言語・行動を統合的に扱う基盤モデルEO-1と150万件のデータセットEO-Data1.5Mを提案し、多様なロボットでの長期的な器用マニピュレーションを実現した。
- Genie Envisioner:ロボット操作のための統合ワールド基盤プラットフォームVLA2025/8/1
指示条件付き動画拡散モデルを核に、方策学習・評価・シミュレーションを一つの動画生成フレームワークへ統合した基盤を提案し、軽量デコーダで行動軌跡を生成、専用ベンチマークも整備した。
- スケーラブルなロボットマニピュレーションに多様性は本当に必要か?マニピュレーション2025/7/1
ロボット学習におけるデータ多様性の役割をタスク・身体・専門家の3次元で検証し、タスク多様性が重要である一方、専門家の速度多様性は学習を妨げることを示し、その偏りを補正する手法を提案した。
- Hume:視覚-言語-行動モデルにシステム2思考を導入VLA2025/5/1
価値誘導型の熟考(システム2)と軽量な反応型ポリシー(システム1)を組み合わせた二重システムVLAモデルを提案し、器用なロボット制御を実現した。
- EWMBench:身体性世界モデルのシーン・動作・意味品質を評価するベンチマーク身体性世界モデル評価2025/5/1
言語指示から物理的に妥当なシーンを生成する身体性世界モデル(EWM)を、視覚的一貫性・動作正確性・意味整合性の3軸で評価するベンチマークを提案した論文。
- EnerVerse-AC: 行動条件付きで身体性環境を想像する世界モデル世界モデル2025/5/1
エージェントの予測行動から将来の視覚観測を生成する行動条件付き世界モデルを提案し、実機や複雑なシミュレーションなしでロボット模倣学習のデータ拡張と評価を可能にした。
- Genie Centurion:人間による巻き戻し・修正ガイダンスで実世界ロボット訓練を加速VLA2025/5/1
失敗時に状態を巻き戻して人間が修正デモを行い、1人の操作者が複数ロボットを監督できるデータ収集手法を提案し、従来法より成功率を最大40%向上させた。
- UniVLA:タスク中心の潜在行動でどこでも行動を学習するVLA2025/5/1
動画からタスク中心の潜在行動表現を学習し、異なるロボットや環境に展開可能な汎用視覚言語行動ポリシーを実現した研究。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- 敵対的データ収集:効率的でロバストなロボット模倣学習のための人間協調型摂動模倣学習2025/3/1
人間がリアルタイムで環境や指示を攪乱するHiL型データ収集法を提案し、少ないデモ数で模倣学習の汎化・ロバスト性・回復能力を大幅に向上させた。
- EnerVerse: ロボットマニピュレーションのための身体化未来空間の想像VLA2025/1/1
指示から未来の身体化空間を予測する生成ロボティクス基盤モデルを提案し、4Dガウススプラッティングと組み合わせてシミュレーションと実世界のギャップを縮め、高性能な操作を実現した。