Yan Zheng
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- T3S: タスク固有特徴セレクタとスケジューラによるマルチタスク強化学習の改善マルチタスク強化学習2026/8/31
マルチタスク強化学習におけるタスク間干渉を解決するため、ハイパーネットワークでタスク固有のソフトマスクを生成する特徴セレクタと、タスクの進捗と学習速度に基づいて学習タスクを選択するスケジューラを提案した。ロボット操作タスクで既存手法より優れた性能を示した。
- WarpSAC: 探索と活用の再考によるスケーラブルなオフ方策強化学習の頂点を目指して強化学習2026/8/25
データ量に応じて安定化手法を適応させるオフ方策RLアルゴリズムWarpSACを提案し、CPU/GPU並列環境で既存手法を大幅に上回る性能を達成した。
- SCALE: 正しい幾何学におけるJEPA計画のための状態校正潜在埋め込み世界モデル/計画2026/8/17
エンドツーエンドの世界モデルLeWMの潜在表現に、タスク関連状態空間との距離整合性を持たせることで、計画性能を向上させる手法SCALEを提案した。
- RoboPIN: ピン留めチェーン・オブ・ソートによる接地された身体化推論身体化推論/VLM2026/6/14
身体化推論の各ステップを視覚的証拠に固定する「ピン留めチェーン・オブ・ソート」を提案し、エンティティ追跡の一貫性を保つデータセットとモデルを構築した。
- Embodied-R1.5:身体化基盤モデルによる物理的知能の進化身体化基盤モデル2026/6/1
身体化された認知・計画・修正・指示を統合した基盤モデルを構築し、大規模データとマルチタスク強化学習で身体化VLMのSOTAを達成。さらに少量データでVLAに転移可能なことを示した。
- ForceFlow: 接触駆動フローマッチングによる感覚と行動の学習マニピュレーション2026/5/1
接触を伴う操作タスクのための力覚対応リアクティブフレームワークを提案。非対称マルチモーダル融合と視覚から力へのハンドオーバー機構により、力と運動の深い結合を実現し、実世界6タスクで成功率を37%向上させた。
- 非定常性で失われるランクと勾配:強化学習における可塑性損失を緩和するサンプル重み減衰強化学習2026/4/2
強化学習の可塑性損失をネットワーク最適化の理論的観点から分析し、勾配減衰を補正する軽量な手法「サンプル重み減衰」を提案した。
- MUVLA: 地図理解による物体ナビゲーションの探索学習VLA2025/9/1
セマンティックマップを活用して履歴情報を構造化し、報酬誘導型のリターンモデリングで探索行動を学習する物体ナビゲーション用VLAモデルを提案。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- Embodied-R1: 汎用ロボット操作のための強化学習による身体性推論VLA2025/8/1
「ポインティング」を身体性に依存しない中間表現として用い、3Bの視覚言語モデルを強化学習ファインチューニングで訓練することで、未知の環境や実機タスクへのゼロショット汎化を実現した研究。
- 見ることから行うことへ:ロボットマニピュレーションのための推論と意思決定の橋渡しマニピュレーション2025/5/1
空間関係推論で中間表現を生成する視覚言語モデルFSDを提案し、ロボット操作のゼロショット性能を大幅に向上させた。
- AhaRobot:身体性AIのための低コストオープンソース双腕移動マニピュレータマニピュレーション2025/3/1
低コストで完全オープンソースの双腕移動マニピュレータを開発し、遠隔操作インターフェースと制御スタックを最適化することで、家庭内タスクの模倣学習を可能にした。
- CleanDiffuser: 意思決定のための拡散モデル向け使いやすいモジュール式ライブラリ拡散モデル意思決定2024/6/1
意思決定アルゴリズムに特化した初の拡散モデルライブラリCleanDiffuserを提案し、モジュール式で柔軟な実装と広範な評価を通じてその信頼性と設計上の知見を示した。
- Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models2024/2/1
- Uni-RLHF:多様な人間フィードバックを用いた強化学習のための汎用プラットフォームとベンチマークスイートRLHF2024/2/1
多様な人間フィードバックを扱うRLHFのための注釈プラットフォーム、大規模クラウドソーシングデータセット、モジュール式オフラインRLHFベースラインを提供する統合システムを構築し、30以上のタスクで1500万ステップを超えるデータを収集して評価した。
- ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles2023/6/1
- EUCLID: Towards Efficient Unsupervised Reinforcement Learning with Multi-choice Dynamics Model2022/10/1