Xiaohan Zhang
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ZeroBot:生成的Real2Simで数分でゼロから学習sim2real2026/9/27
単一視点画像から画像to3D生成モデルで物体メッシュを作り、シミュレーションで並列強化学習を行い、実機タスクを数分で学習するフレームワーク。
- 生成的なReal-to-Simによるロボットマニピュレーションのためのテスト時空間推論sim2real2026/9/27
単一のRGB-D画像から3D生成モデルと視覚言語モデルでシミュレーション可能なシーンを再構築し、数千の並列物理シミュレーションと進化的探索によって物体配置を最適化する、訓練不要のテスト時空間推論フレームワークを提案。
- GIRAF: 関節物体との汎用的な人間インタラクションの実現全身動作生成2026/7/8
関節を持つ物体との全身インタラクションを生成するテキスト条件付き拡散モデルを提案し、物体中心表現と混合ドメイン学習、接触ベースのデータ拡張により未見の物体構成への汎化を実現した。
- 合成事前分布からの世界行動モデルの効率的なSim-to-Real転移sim2real2026/6/1
シミュレーションで訓練した世界行動モデルを実ロボットにゼロショット転移させる初の試みで、物体持ち上げや引き出し開閉などの操作タスクで35%の成功率を達成した。
- 視覚運動ポリシーの短期記憶を拡張し長期的タスクを実現模倣学習2026/6/1
本論文は、模倣学習による視覚運動ポリシーに短期記憶を効果的に組み込むためのアーキテクチャPRISMを提案し、新しいベンチマークReMemBenchで評価した。
- ProcVLM: 手順に基づく進捗報酬を学習するロボット操作モデルマニピュレーション2026/5/1
長期的なロボット操作タスクにおいて、手順の構造と視覚変化に基づいて進捗を推定し、密な報酬信号を生成する視覚言語モデルProcVLMを提案した。
- 能動的知覚を備えたロボットの計画と状況対応タスク計画/能動的知覚2026/4/1
ロボットの実行中に発生する予期せぬ状況を能動的に知覚し対処するためのフレームワークVAP-TAMPを提案した。視覚言語モデルとシーングラフを活用し、タスクと動作の統合計画を行う。
- ExpertGen: 不完全な行動事前分布からのスケーラブルなSim-to-Realエキスパート方策学習sim2real2026/3/1
不完全なデモから拡散方策を事前分布として学習し、その初期ノイズを強化学習で最適化することで、報酬設計なしに高品質なエキスパート方策をシミュレーションで自動生成し、実機転移を可能にするフレームワーク。
- 黄金のチケット:単一のノイズベクトルで生成ロボットポリシーを改善VLA2026/3/1
事前学習済みの拡散・フローマッチングポリシーに対し、ガウス分布から毎回サンプリングする代わりに固定の初期ノイズ(黄金のチケット)を与えることで、追加学習なしにタスク成功率を向上させる手法を提案。
- AnyTask: Sim-to-Realポリシー学習を進めるための自動タスク・データ生成フレームワークsim2real2025/12/1
GPUシミュレーションと基盤モデルを組み合わせ、多様なマニピュレーションタスクの設計から専門家デモ生成、実機転移までを自動化するフレームワークを提案。生成データで学習したポリシーが実機で平均44%の成功率を達成。
- LLM-GROP: 大規模言語モデルによる視覚に基づくロボットのタスク・動作計画タスク・動作計画2025/11/1
大規模言語モデルの常識知識と視覚情報を活用し、複数物体の移動を伴うモバイルマニピュレーションのタスク・動作計画を統合するフレームワークを提案。実環境とシミュレーションで成功率と効率を評価した。
- ParticleFormer: 多物体・多素材ロボット操作のための3D点群ワールドモデルワールドモデル2025/6/1
剛体・変形・柔軟素材が混在する多物体操作を対象に、実ロボット知覚データから直接学習できるTransformerベースの3D点群ワールドモデルを提案し、MPCによる下流操作タスクで高精度な動力学予測を実現した。
- RobotDiffuse: 冗長マニピュレータのための拡散モデルベース運動計画とROP障害物回避データセットマニピュレーション2024/12/1
拡散モデルと点群エンコーダ、エンコーダのみのTransformerを組み合わせ、冗長マニピュレータの滑らかな運動計画を実現。35M姿勢・0.14M障害物回避シーンを含む新データセットROPを公開。
- DKPROMPT: ドメイン知識で視覚言語モデルを誘導するオープンワールド計画手法VLA2024/6/1
PDDLのドメイン知識を使って視覚言語モデルへのプロンプトを自動生成し、オープンワールドでのロボットタスク計画・実行を高精度化するフレームワークを提案した論文。
- FORCE: 物理特性を考慮した人と物体のインタラクション生成ヒューマン・オブジェクト・インタラクション2024/3/1
物体の質量や摩擦といった物理特性をモデル化し、人間の力と抵抗力の関係を捉えることで、多様でリアルな人と物体のインタラクション動作を生成する手法を提案。
- Symbolic State Space Optimization for Long Horizon Mobile Manipulation Planning2023/7/1
- Integrating Action Knowledge and LLMs for Task Planning and Situation Handling in Open Worlds2023/5/1
- Grounding Classical Task Planners via Vision-Language Models2023/4/1
- Spatial-Language Attention Policies for Efficient Robot Learning2023/4/1
- LLM+P: Empowering Large Language Models with Optimal Planning Proficiency2023/4/1
- Task and Motion Planning with Large Language Models for Object Rearrangement2023/3/1
- Robot Task Planning and Situation Handling in Open Worlds2022/10/1
- Robotic Table Wiping via Reinforcement Learning and Whole-body Trajectory Optimization2022/10/1
- GLAD: Grounded Layered Autonomous Driving for Complex Service Tasks2022/10/1
- Learning to Ground Objects for Robot Task and Motion Planning2022/2/1
- Visually Grounded Task and Motion Planning for Mobile Manipulation2022/2/1
- Learning to Guide Human Attention on Mobile Telepresence Robots with 360 Vision2021/9/1
- Object Tracking and Geo-localization from Street Images2021/7/1
- Planning Multimodal Exploratory Actions for Online Robot Attribute Learning2021/6/1
- Task-Motion Planning for Safe and Efficient Urban Driving2020/3/1