Zhaoxin Fan
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CoLMIN: LLMに基づく協調自動運転のためのマルチ決定経路交渉協調自動運転2026/9/4
複数車両の協調自動運転において、LLMの推論能力を活用し、複数の運転意図を生成・評価する交渉フレームワークCoLMINを提案。浅い反射と深い反射を組み合わせて、複雑な交通シナリオでの安定した合意形成を実現する。
- LiteMVS: 基盤モデル蒸留と専門家集約による効率的な多視点ステレオ3D知覚2026/8/4
多視点ステレオに単眼のセマンティック・構造事前知識を注入し、軽量かつ高精度な深度推定を実現する手法を提案。
- CUBic: 協調型統一バイマニュアル知覚・制御フレームワークバイマニュアル操作2026/5/1
両腕ロボットの操作を統一的な知覚モデリング問題として捉え、共有トークン表現と拡散ポリシーにより腕の独立性と協調を構造的に実現するフレームワークを提案した。
- VAMPO: ビデオ行動モデルの視覚ダイナミクスを改善するポリシー最適化VLA2026/3/1
ビデオ行動モデルのノイズ除去を逐次決定過程とみなし、専門家の視覚ダイナミクスに基づく報酬でポリシー最適化を行うことで、操作に重要な視覚ダイナミクスを直接改善するフレームワークを提案。
- MapDream:視覚言語ナビゲーションのためのタスク駆動型地図学習VLA2026/2/1
視覚言語ナビゲーションにおいて、ナビゲーション目的に直接最適化されたBEV地図を自己回帰的に生成し、行動予測と統合学習するフレームワークを提案。
- GPO: 脚式ロボットの移動と全身制御のための成長型方策最適化歩行2026/1/1
初期段階で行動空間を制限し徐々に拡大する時変行動変換を導入することで、トルクベース制御の脚式ロボットの強化学習を安定化・高性能化する手法GPOを提案し、四足・六足ロボットで実機ゼロショット展開まで検証した。
- Progress-Think: 視覚言語ナビゲーションのための意味的進捗推論VLA2025/11/1
視覚観測から指示文の進捗を意味的に推論し、ナビゲーション方策を導く三段階フレームワークを提案。R2R-CEとRxR-CEで最高性能を達成。
- Long-VLA:ロボットマニピュレーションのための長期的タスクに挑む視覚言語行動モデルVLA2025/8/1
長期的なロボット操作タスクに特化した初のエンドツーエンドVLAモデルを提案し、フェーズ認識入力マスキングでサブタスクの連携を改善、新ベンチマークL-CALVINで評価した。
- MonoDream:パノラマドリーミングによる単眼視覚言語ナビゲーションVLA2025/8/1
単眼入力のみでパノラマRGB-D相当の空間表現を潜在空間で学習し、視覚言語ナビゲーションの性能を向上させる軽量VLAフレームワークを提案。
- RoboPARA: タスク間の並列割当と再構成による双腕ロボット計画マニピュレーション2025/6/1
LLMを活用し、依存グラフの生成と再探索によって双腕ロボットのタスク並列性を最大化する計画フレームワークを提案し、新データセットX-DAPTで有効性を示した。
- Aux-Think: データ効率の良い視覚言語ナビゲーションのための推論戦略の探求VLA2025/5/1
視覚言語ナビゲーション(VLN)において推論戦略を体系的に評価し、推論時の推論崩壊問題を明らかにした上で、CoT教師あり学習で推論パターンを内部化しつつ直接行動予測を行うAux-Thinkを提案した。
- STAMICS: 統合された一貫性と意味論を備えた高密度RGB-D SLAMのためのスプラット・トラック・マップSLAM2025/3/1
3Dガウシアン表現に意味情報を統合し、動的環境でも時間的な意味的一貫性を保ちながら高精度なSLAMを実現する手法を提案。
- CARP: 粗から細への自己回帰予測による視覚運動ポリシー学習VLA2024/12/1
行動系列を多スケール表現にエンコードし、GPT型トランスフォーマーで粗から細へ自己回帰的に予測することで、拡散ポリシー並みの精度と自己回帰並みの効率を両立した視覚運動ポリシー学習手法。
- スコア・分布マッチング方策:マッチング蒸留による高速視覚運動方策VLA2024/12/1
拡散方策をスコアマッチングと分布マッチングの二段階最適化で1ステップ生成器に変換し、6倍の推論高速化と高品質な行動生成を両立させた。