Zhenyu Jiang
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SimEX: シミュレーション統合型ロボティクス自動研究フレームワークsim2real2026/9/30
LLMコーディングエージェントがシミュレーション内で試行錯誤してロボットツールボックスを構築し、少数の実機試行でシミュレータを校正しながら実ロボットの操作スキルを効率的に獲得する自動研究フレームワーク。
- 生成ロボットポリシーにおけるシミュレーションと実機の共学習のメカニズム解析ロボット学習2026/4/1
シミュレーションと実機データを組み合わせた共学習が有効に機能するメカニズムを理論と実験で解析し、性能を左右する2つの効果(構造的表現アライメントと重要度再重み付け)を特定した。
- 行動クローニング方策を微調整するための残差オフポリシー強化学習強化学習2025/9/1
行動クローニング方策をブラックボックスのベースとして、サンプル効率の良いオフポリシー強化学習で軽量な残差修正を学習し、高自由度系の操作を改善する手法を提案。
- MimicDroid: 人間の遊び動画からの文脈内学習によるヒューマノイドロボット操作VLA2025/9/1
人間の遊び動画のみを訓練データとして、ヒューマノイドが新しい操作タスクを数例の動画から効率的に学習できる文脈内学習手法を提案し、実世界で成功率を約2倍に向上させた。
- シミュレーションと実世界の共訓練:視覚ベースロボットマニピュレーションのための簡単なレシピマニピュレーション2025/3/1
シミュレーションと実世界のデータを混合して方策を共訓練する簡単な手法を提案し、ロボットアームとヒューマノイドの多様なタスクで実世界性能を平均38%向上させた。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
- OKAMI: 単一動画の模倣によるヒューマノイドロボットの操作スキル学習模倣学習/ヒューマノイド2024/10/1
1本のRGB-D動画から物体を認識して人間の動きをヒューマノイドに再ターゲティングし、操作計画と実行ポリシーを生成する手法を提案。閉ループ視覚運動ポリシーは79.2%の成功率を達成した。
- DexMimicGen:両腕巧みな操作のための模倣学習による自動データ生成マニピュレーション2024/10/1
少数の人間デモからヒューマノイドロボットの両腕巧みな操作の軌道を自動生成するシステムを提案し、60のデモから21Kのデモを生成して実機タスクに展開した。
- Harmon: 言語記述からヒューマノイドの全身運動を生成全身運動生成2024/10/1
人間の運動データを事前知識として活用し、視覚言語モデルの常識推論で編集・洗練することで、言語指示に沿った自然で多様なヒューマノイド全身運動を生成する手法を提案した。
- HOVER: ヒューマノイドのための汎用全身制御ニューラルコントローラヒューマノイド全身制御2024/10/1
全身の運動模倣を共通の抽象表現として活用し、ナビゲーションや卓上操作など複数の制御モードを単一の方策に蒸留統合したヒューマノイド全身コントローラを提案した。
- KinScene: 関節物体を含むシーンのモデルベース移動マニピュレーションマニピュレーション2024/9/1
移動マニピュレータが屋内シーンを自律探索し、関節物体の運動モデルを構築して、長期的な操作タスクを計画・実行するフルスタック手法を提案。
- ARDuP: 汎用ポリシーのためのアクティブ領域動画拡散VLA2024/6/1
動画生成ベースのポリシー学習において、動きの手がかりから自動的に「アクティブ領域」を抽出し、その領域に注目して拡散モデルで計画・行動生成する手法を提案。シミュレータと実世界データで成功率を改善。
- Learning Generalizable Manipulation Policies with Object-Centric 3D Representations2023/10/1
- Doduo: Learning Dense Visual Correspondence from Unsupervised Semantic-Aware Flow2023/9/1
- Ditto in the House: Building Articulation Models of Indoor Scenes through Interactive Perception2023/2/1
- ACID: Action-Conditional Implicit Visual Dynamics for Deformable Object Manipulation2022/3/1
- Ditto: Building Digital Twins of Articulated Objects from Interaction2022/2/1
- Synergies Between Affordance and Geometry: 6-DoF Grasp Detection via Implicit Representations2021/4/1