Jiawei He
XYZ Embodied AI
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AdaOcc: 身体性タスクのための適応的3D占有予測3D占有予測2026/9/30
様々なセンサ構成や計算予算に適応できる、点ベースの3D意味占有予測手法AdaOccを提案し、Occ-ScanNetで最先端性能を達成した。
- RoboHarn-Evo: 階層的物理知識を進化させ自己改善するロボットマニピュレーションマニピュレーション2026/9/29
物理的な試行錯誤からタスク知識と行動知識を階層的に蓄積・修正し、基盤モデルを更新せずにロボット操作の成功率を高めるフレームワークを提案。
- UniPart: 実世界インタラクションのためのゼロショット言語接地3Dパーツセグメンテーション3Dセグメンテーション2026/9/11
自由なテキスト指示から点群上の機能パーツを切り出すクロスモーダル3D Transformerを提案し、大規模データセット構築によりゼロショット性能と実機把持への転移を実現した。
- Zeva: 文脈内因果学習による汎用身体操作の実現マニピュレーション2026/8/31
ロボットが実環境での物理的相互作用からその場で学習し、その知識を次の行動に活かすフレームワークZevaを提案。ポリシーモデルを凍結したまま、因果相互作用抽出器と二重タイムスケールの因果メモリを用いて、実行した行動と状態変化を符号化し、後の行動の文脈として注入する。シミュレーションと実機操作で最先端のVLAやWAMを上回る性能を示し、勾配更新なしで自己進化を実現。
- JEPA-WAM: 共同埋め込み世界モデリングによる視覚-言語-行動ポリシーの学習VLA/世界モデル2026/8/1
事前学習済みV-JEPA空間に基づく潜在世界モデルを構築し、遷移予測と行動生成を共有予測器で結合することで、効率的かつ高精度なロボット制御を実現した。
- DA-Nav: 方向認識型の都市規模視覚言語ナビゲーションナビゲーション2026/7/1
市街地規模の屋外ナビゲーションを、商用ナビの方向指示を利用して、自己中心視画像上の離散的な空間接地問題として再構成し、軌道回復を可能にするフレームワークを提案した。
- FloorPlan-VLN: フロアプラン誘導型視覚言語ナビゲーションの新パラダイムVLA2026/3/1
視覚言語ナビゲーション(VLN)において、フロアプランを大域的な空間事前情報として活用する新しいタスクとデータセットを提案し、簡潔な指示だけでナビゲーションを可能にする手法FP-Navを導入した。
- ロボティクスのための視覚言語モデルにおける推論を伴う空間トレースに向けてVLA2025/12/1
3D空間の参照と計測を統合したVLM「RoboTracer」を提案し、強化学習による多段階の空間推論を実現。大規模データセットとベンチマークも構築し、ロボットの長期的タスク実行に応用した。
- MarketGen: 自動生成される実体化スーパーマーケット環境を備えたスケーラブルなシミュレーションプラットフォームsim2real2025/11/1
スーパーマーケット環境を自動生成するシミュレーションプラットフォームMarketGenを提案し、レジ袋詰めと棚からの商品収集という2つのタスクのベンチマークを構築した。
- DreamVLA: 包括的な世界知識を夢見る視覚-言語-行動モデルVLA2025/7/1
動的・空間・意味情報を統合した世界知識予測により逆動力学モデリングを行い、知覚-予測-行動ループを実現する新しいVLAフレームワークを提案。
- DexVLG: 大規模巧みな視覚-言語-把持モデルマニピュレーション2025/7/1
単視点RGBD入力から言語指示に沿った巧みな手の把持姿勢を予測する大規模モデルを提案し、1.7億の把持データで学習してゼロショット汎化性能を実証した。
- SoFar: 言語に基づく物体の向きが空間推論と物体操作を橋渡しするVLA2025/2/1
自然言語で物体の向きを定義する「意味的向き」を導入し、大規模データセットとゼロショット予測モデルを構築して、6自由度の空間推論とロボット動作生成を可能にした。