Shizhe Chen
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PointACT: マルチスケール点群アクション相互作用を備えた視覚言語行動モデルVLA2026/5/1
ロボット操作のための視覚言語行動モデルに、階層的な3D点群表現を統合し、アクション生成時に局所的な幾何学と大域的なシーン構造を考慮できるようにした。LIBEROとRLBenchで性能が向上した。
- HO-Flow: 潜在フローマッチングによる汎用的な手と物体のインタラクション生成手と物体のインタラクション生成2026/4/1
テキストと3D物体から手と物体のインタラクション動作を生成するフレームワークを提案。相互作用を考慮したVAEとマスク付きフローマッチングで時間的一貫性と物理的妥当性を向上させた。
- MAGICIAN: 想像ガウシアンを用いた能動マッピングのための効率的な長期計画能動マッピング2026/3/1
3Dガウシアンスプラッティングに基づく想像ガウシアン表現を活用し、木探索による長期計画で能動マッピングの探索効率と再構成精度を向上させるフレームワークを提案。
- FOM-Nav: フロンティア物体マップによる物体目標ナビゲーション物体目標ナビゲーション2025/12/1
未知環境で目標物体を効率的に探索するため、空間フロンティアと物体情報を統合した地図と視覚言語モデルを組み合わせたナビゲーション手法を提案し、実機でも有効性を示した。
- 視覚言語ロボット操作のための環境横断的な失敗推論データのスケーリングVLA2025/12/1
成功軌道を摂動させて多様な失敗データを自動生成し、VLMで推論トレースを付与した大規模データセットFailCoTを構築。これで訓練した検証モデルGuardianは未知環境での失敗検出性能を向上させ、操作タスクの成功率を高めた。
- Gondola: 汎用ロボット操作のための接地視覚言語プランニングVLA2025/6/1
多視点画像と履歴プランから、対象物と位置のセグメンテーションマスクを伴う次行動プランを生成するLLMベースのモデルを提案し、GemBenchで汎化性能を向上させた。
- 神経オブジェクト事前分布を用いたオンライン3Dシーン再構成3D再構成2025/3/1
RGB-D動画から物体単位でシーンをオンライン再構成するため、特徴グリッド補間と事前構築した物体ライブラリの形状事前分布を活用する手法を提案した。
- NextBestPath:未知環境の効率的な3Dマッピング3Dマッピング2025/2/1
エージェントが未知の屋内環境を効率的に3Dマッピングするため、長期的な目標地点を予測するNextBestPath手法と、Doomゲームを利用した新データセットAiMDoomを提案した。
- 汎化可能な視覚言語ロボットマニピュレーションに向けて:ベンチマークとLLM誘導3Dポリシーマニピュレーション2024/10/1
視覚言語ロボット操作の汎化性能を評価する新ベンチマークGemBenchを提案し、3D情報とLLM・VLMを組み合わせた3D-LOTUS++で新規タスクの最先端性能を達成した。
- ViViDex: 人間の動画から視覚ベースの巧みなマニピュレーションを学習マニピュレーション2024/4/1
人間の動画から強化学習で物理的に妥当な軌道を生成し、それを用いて特権情報なしの統一的な視覚ポリシーを学習するフレームワークViViDexを提案。
- PolarNet: 3D Point Clouds for Language-Guided Robotic Manipulation2023/9/1
- Object Goal Navigation with Recursive Implicit Maps2023/8/1
- Robust Visual Sim-to-Real Transfer for Robotic Manipulation2023/7/1
- Instruction-driven history-aware policies for robotic manipulations2022/9/1