Xiaojun Chang
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 次世代医療に向けて:知覚・意思決定・行動のための医療具現化AIのサーベイ具現化AI/医療2026/6/1
医療分野における具現化AI(身体を持つAI)の研究を、知覚・意思決定・行動の統合システムとして体系的に整理したサーベイ論文。応用事例やデータセット、実臨床での課題と今後の研究方向をまとめている。
- A1: 完全透過型オープンソースの適応的かつ効率的なトランケート型視覚言語行動モデルVLA2026/4/1
低コストで高スループットな推論を実現するため、事前学習済みVLMと適応的早期終了・層間トランケートフローマッチングを導入したVLAモデルA1を提案し、シミュレーションと実機でSOTA性能と推論コスト削減を達成した。
- Web動画からの暗黙的幾何表現を用いた視覚言語ナビゲーション視覚言語ナビゲーション2026/3/1
Web上の部屋ツアー動画から大規模な指示データを構築し、RGBフレームから直接空間情報を抽出する暗黙的幾何表現を導入することで、3D再構成に頼らずにVLNエージェントの学習を可能にした。複数のベンチマークで最先端性能を達成し、ゼロショットナビゲーションも実現した。
- LatentPilot: 潜在視覚推論による先読みでシーンを理解する視覚言語ナビゲーションナビゲーション2026/3/1
未来の観測を訓練時に活用して行動条件付き視覚ダイナミクスを学習し、推論時には未来フレームを使わずに潜在トークンで先読み推論を行う新しいVLNパラダイムを提案し、ベンチマークと実ロボットでSOTAを達成した。
- 構造化プランナーとしてのワールドモデル:ロボット操作のための疎な未来予測マニピュレーション2026/3/1
密な未来予測の冗長性と誤差蓄積を避けるため、キネマティクスに基づく疎な構造化フレームを予測するワールドモデルを提案し、視覚プランニングと運動制御を橋渡しする。
- 見て、計画して、巻き戻す:進捗認識型視覚言語行動モデルによる堅牢なロボット操作マニピュレーション2026/3/1
ロボット操作のタスク進捗を明示的なマイルストーンで測定し、失敗時に回復可能な状態へ巻き戻すことで堅牢性を高める、進捗認識型の視覚言語行動フレームワークSPRを提案した。
- GLaD: 視覚言語行動モデルのための幾何潜在蒸留VLA2025/12/1
3D幾何情報を知識蒸留でVLAモデルに組み込み、深度センサーや3D注釈なしで空間推論と操作性能を向上させた手法。
- RoomTour3D: 幾何情報を活用した動画指示チューニングによる身体性ナビゲーションナビゲーション2024/12/1
Web上のルームツアー動画から3D再構成を行い、歩行軌跡と指示文を付与した大規模データセットRoomTour3Dを構築し、VLNタスクの性能を大幅に改善した。
- NavCoT:分離推論の学習によるLLMベース視覚言語ナビゲーションの強化VLA2024/3/1
視覚言語ナビゲーション(VLN)において、LLMにナビゲーションの思考連鎖(世界モデルによる次観測の想像、候補選択、行動決定)を学習させ、ドメインギャップを効率的に埋める手法を提案。
- Deep Learning for Embodied Vision Navigation: A Survey2021/8/1
- Continual Reinforcement Learning with Diversity Exploration and Adversarial Self-Correction2019/6/1