Jinghuan Shang
収録論文 12本 ・ フィジカルAI/ロボット学習
sim2realシーン生成VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 合成事前分布からの世界行動モデルの効率的なSim-to-Real転移sim2real2026/6/1
シミュレーションで訓練した世界行動モデルを実ロボットにゼロショット転移させる初の試みで、物体持ち上げや引き出し開閉などの操作タスクで35%の成功率を達成した。
- Sceniris: 高速な手続き型シーン生成フレームワークシーン生成2025/12/1
衝突のない大規模な3Dシーンを高速に生成する手続き型フレームワークを提案し、従来手法より234倍以上の高速化を実現した。
- AnyTask: Sim-to-Realポリシー学習を進めるための自動タスク・データ生成フレームワークsim2real2025/12/1
GPUシミュレーションと基盤モデルを組み合わせ、多様なマニピュレーションタスクの設計から専門家デモ生成、実機転移までを自動化するフレームワークを提案。生成データで学習したポリシーが実機で平均44%の成功率を達成。
- VER: 基盤モデル蒸留と動的ルーティングによるロボット学習のための視覚エキスパートトランスフォーマーVLA2025/10/1
複数の視覚基盤モデルを蒸留してエキスパートライブラリを構築し、軽量なルーティングネットワークでタスクに応じた専門家を動的に選択することで、17種類のロボットタスクで最先端性能を達成した。
- Theia: ロボット学習のための多様な視覚基盤モデルの蒸留VLA2024/7/1
複数の視覚基盤モデルを蒸留して、多様な視覚知識を符号化したロボット学習用の視覚基盤モデルTheiaを提案し、少ないデータと小さいモデルで従来手法を上回る性能を実証した。
- LLaRA:視覚言語モデルをロボット制御に転用する対話型ポリシー学習VLA2024/6/1
ロボットの行動を視覚と言語の対話として扱い、既存の模倣学習データから自動で対話形式の学習データを生成して視覚言語モデルを微調整し、ロボット制御に転用する手法を提案した。
- Crossway Diffusion: Improving Diffusion-based Visuomotor Policy via Self-supervised Learning2023/7/1
- Active Vision Reinforcement Learning under Limited Visual Observability2023/6/1
- Neural Neural Textures Make Sim2Real Consistent2022/6/1
- Does Self-supervised Learning Really Improve Reinforcement Learning from Pixels?2022/6/1
- Learning Viewpoint-Agnostic Visual Representations by Recovering Tokens in 3D Space2022/6/1
- Self-Supervised Disentangled Representation Learning for Third-Person Imitation Learning2021/8/1