Xinyu Zhang
Beijing Institute of Technology
収録論文 46本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- OmniNav: 動的環境における堅牢な長期的目標ナビゲーションナビゲーション2026/9/8
動的環境での長期的な目標ナビゲーションを、シーン記憶の更新、信念修正、操作可能なエンドポイント選択を統合した因子化タスク状態推定として定式化し、頑健な探索と操作を実現するシステムを提案した。
- GLaQ: 視覚的証拠への潜在クエリ接地によるマルチモーダル推論VLA2026/8/16
マルチモーダル大規模言語モデルの推論において、連続的な潜在状態の代わりに、元の視覚トークンに接地された固定数のクエリを用いることで、細かい視覚情報を効果的に保持・再利用する手法を提案した。
- SOPD-SocialNav: 視覚言語ソーシャルナビゲーションのための選択的オンポリシー蒸留ナビゲーション2026/7/1
大規模な視覚言語モデルから軽量な学生モデルへ、エントロピーに基づくトークン選択と温度制御付きJSダイバージェンスを用いて社会的ナビゲーション知識を蒸留する手法を提案。実機ロボットでの検証も行った。
- 先見的残差強化学習による視覚言語行動モデルを用いた長期的ロボット操作マニピュレーション2026/7/1
凍結したVLAベースポリシー上で残差RLを行う際、各サブタスクの成功報酬に将来の成功確率を掛け合わせることで、サブタスク間の受け渡し品質を最適化し、長期的なタスク成功率を向上させる手法を提案した。
- TFP: 時間条件付きメモリ融合ポリシーによる視覚運動学習VLA/操作学習2026/7/1
視覚言語行動(VLA)ポリシーは反応的で、段階依存の操作タスクで失敗する問題を解決するため、時間条件付きメモリ融合ポリシー(TFP)を提案。液体時定数ダイナミクスでタスク進行の信念を維持し、フローマッチング行動デコーダに適応変調で注入することで、LIBERO等で成功率を向上させた。
- 残差潜在アクションによる視覚特徴ベース世界モデルの学習世界モデル2026/5/1
視覚特徴ベースの世界モデルにおいて、DINO残差から学習可能な新しい潜在アクション表現(RLA)を導入し、フローマッチングで予測することで、既存手法より高速かつ高精度な未来予測を実現した。さらに、ロボット学習への応用として、アクションなし動画からの行動学習や、オフライン動画のみで学習する視覚RLフレームワークを開発した。
- 強化学習におけるワールドモデルは何を学習するのか?環境シミュレータの潜在表現の探索ワールドモデル/解釈可能性2026/3/23
強化学習用のワールドモデル内部の表現を解釈可能性手法で分析し、ゲーム状態の変数が線形に解読可能な形で表現され、因果介入により機能していることを示した。
- 社会的に適合したナビゲーションのためのグループ競合学習による軽量視覚言語モデルの性能向上ナビゲーション2026/3/1
軽量な視覚言語モデル(VLM)の推論能力を高めるため、グループ競合学習(GCL)という戦略を提案し、社会的に適合したナビゲーションのベンチマークで性能を大幅に向上させた。
- Glove2Hand: マルチモーダルセンシンググローブから自然な手と物体のインタラクションを合成手と物体のインタラクション2026/3/1
マルチモーダルセンシンググローブの映像から、物理的な接触情報を保ちつつ写実的な素手の映像を生成するフレームワークを提案し、触覚・IMU信号付きのデータセットHandSenseを構築した。
- MUSON: 都市環境における社会的規範に沿ったナビゲーションのための推論指向マルチモーダルデータセットナビゲーション2025/12/1
歩行者との社会的規範を考慮したナビゲーションのための、5段階の思考連鎖で注釈付けされた1万件超の一人称視点マルチモーダルデータセットを構築し、複数の視覚言語モデルを評価した。
- MAction-SocialNav: 推論強化プロンプトチューニングによる複数行動対応の社会的配慮ナビゲーションナビゲーション2025/12/1
社会的に配慮したナビゲーションにおいて、1つの状況で複数の妥当な行動が存在する曖昧さに対応するため、視覚言語モデルとメタ認知プロンプトを提案し、複数行動データセットと評価指標を構築した研究。
- コーナーケースを走る:エンドツーエンド自動運転のための実世界敵対的閉ループ評価プラットフォーム自動運転評価2025/12/1
フローマッチングで実世界画像を生成し、敵対的な周辺車両ポリシーと組み合わせて、実世界データで学習したエンドツーエンド自動運転モデルを危険なコーナーケースで閉ループ評価するプラットフォームを提案した。
- SocialNav-MoE: 社会規範に配慮したナビゲーションのための強化学習ファインチューニングを用いたMixture-of-Experts視覚言語モデルナビゲーション2025/12/1
小型VLMとMixture-of-Expertsを組み合わせ、強化学習ファインチューニングと意味的類似度報酬で社会的に配慮したナビゲーションを効率的に実現した。
- 災害捜索救助における人間-群知能協調のためのLLMベースフレームワーク群制御2025/11/1
災害捜索救助でUAV群を運用する際の「意図から行動へのギャップ」を埋めるため、音声や図的注釈からオペレータの意図を捉え、LLMで意図理解・階層的タスク分解・ミッション計画を行うLLM-CRFシステムを提案し、シミュレーションで従来の命令型インターフェースよりタスク協調効率が向上することを示した。
- 安全クリティカルな自動運転のための進化的Bird's Eye View知覚:包括的サーベイ自動運転知覚2025/8/1
自動運転におけるBird's Eye View知覚を安全性の観点から、単一モダリティ車載・マルチモーダル車載・マルチエージェント協調の3段階で体系的にレビューし、データセットや課題、将来方向を整理したサーベイ。
- HAC-LOCO: 連続的な外乱下での四足歩行のための階層型アクティブコンプライアンス制御の学習歩行2025/7/1
外力推定に基づき速度指令を適応させる階層型学習フレームワークを提案し、四足ロボットのロバスト性とコンプライアンスの両立を実現した。
- 失敗予測でSim2Realリズミック挿入方策のロバスト性を向上sim2real2025/7/1
ナット回転や摩擦がある高精度な繰り返し挿入タスクに対し、シミュレーションで訓練した挿入方策と失敗予測モジュールを組み合わせ、失敗時に引き上げて再試行する回復機構を備えたSim2Realフレームワークを提案した。
- S2R-Bench: 自動運転のためのSim-to-Real評価ベンチマークsim2real2025/5/1
実世界の多様な道路・天候・照明条件で収集したセンサ異常データを用い、自動運転の知覚アルゴリズムのロバスト性を評価する初の実環境ベースの腐敗ロバスト性ベンチマークを提案した。
- 動的シーン再構成のためのモーションブレンダーガウシアンスプラッティング動的シーン再構成2025/3/1
動画から動的シーンを再構成する際に、モーショングラフを明示的な動き表現として用い、ガウシアンスプラッティングと組み合わせてロボット応用可能な操作可能な再構成を実現した研究。
- Co-MTP: 自動運転のためのマルチ時間融合協調軌道予測フレームワーク軌道予測2025/2/1
V2Xを活用し、過去と未来の両方の時間領域でエージェント間の相互作用を捉える協調軌道予測フレームワークを提案。実世界データセットで最先端性能を達成。
- 悪天候下のマルチシナリオ画像復元のための勾配誘導パラメータマスク画像復元2024/11/1
訓練時の勾配変動に基づいてパラメータを共通・天候別に分割するマスクを導入し、追加パラメータなしで雨・雨滴・雪などの画像劣化を除去する手法を提案した。
- ロボットマニピュレーションのための自己回帰行動系列学習マニピュレーション2024/10/1
ロボットの行動を系列データとして扱い、自己回帰的に生成するChunking Causal TransformerとAutoregressive Policyを提案し、多様なマニピュレーションタスクで有効性を示した。
- V2I-Calib++: 都市交差点における協調知覚のためのマルチ端末空間キャリブレーション手法キャリブレーション2024/10/1
GPS信号が不安定な都市交差点において、位置情報の事前知識なしで複数のLiDAR間の外部パラメータをリアルタイムにキャリブレーションする手法を提案。
- DAP: 拡散モデルによるマルチモーダル収納のためのアフォーダンス予測マニピュレーション2024/9/1
拡散モデルを使い、容器内の配置可能領域の特定と物体の相対姿勢推定を2段階で行うことで、複数の収納解が存在するマルチモーダルな収納タスクを高効率に解く手法を提案。
- PA-LOCO: 外乱適応型四足歩行の学習歩行2024/7/1
特権情報を複数の特徴エンコーダで分離し、残差ポリシーを組み合わせることで、予期せぬ外力に頑健な四足歩行制御を実現した研究。
- ROS-LLM:タスクフィードバックと構造化推論を備えた身体性AIのためのROSフレームワークVLA2024/6/1
ROSと大規模言語モデルを統合し、非専門家が自然言語でロボットをプログラミングできるフレームワークを提案。行動モードや模倣学習、フィードバックによる反省機能を備え、多様なタスクで有効性を検証した。
- 視覚的キネマティックチェーン予測によるマニピュレーション学習のスケーリングマニピュレーション2024/6/1
多様な環境でのロボット操作学習のため、準静的な動作を表す普遍的表現「視覚的キネマティックチェーン」を提案し、それを予測するTransformerモデルVKTで既存手法を上回る性能を示した。
- 不変性マッチングによるロボットマニピュレーションのワンショット模倣学習マニピュレーション2024/5/1
タスクの不変領域を学習し、デモとテストシーンの不変領域をマッチングすることで、単一の未注釈デモから新しい操作タスクを学習する手法を提案。
- 競争を通じてロボットの潜在能力を引き出す群制御2024/3/1
競争環境での他者との比較を学習の補助信号として活用し、ロボットが競争から知識を得て潜在能力を最大限に発揮する競争学習フレームワークを提案。マルチエージェント競走環境での実験で、単一ロボット環境の最先端手法より優れた性能を示した。
- ZSL-RPPO: 再帰的近接方策最適化による四脚ロボットの難地形ゼロショット移動歩行2024/3/1
再帰ニューラルネットを直接訓練するRPPOを提案し、教師なしゼロショット学習で四脚ロボットの難地形歩行を実現、実機で検証した。
- SYNLOCO: Synthesizing Central Pattern Generator and Reinforcement Learning for Quadruped Locomotion2023/10/1
- 6-DOF All-Terrain Cyclocopter2023/9/1
- Reinforced Potential Field for Multi-Robot Motion Planning in Cluttered Environments2023/7/1
- Path Planning for Air-Ground Robot Considering Modal Switching Point Optimization2023/5/1
- Bionic Collapsible Wings in Aquatic-aerial Robot2023/4/1
- CMG-Net: An End-to-End Contact-Based Multi-Finger Dexterous Grasping Network2023/3/1
- Eloss in the way: A Sensitive Input Quality Metrics for Intelligent Driving2023/2/1
- FastPillars: A Deployment-friendly Pillar-based 3D Detector2023/2/1
- Coupled Modeling and Fusion Control for a Multi-modal Deformable Land-air Robot2022/11/1
- A Multi-modal Deformable Land-air Robot for Complex Environments2022/10/1
- Intelligent Amphibious Ground-Aerial Vehicles: State of the Art Technology for Future Transportation2022/7/1
- Temporal and Spatial Online Integrated Calibration for Camera and LiDAR2022/7/1
- Dynamic Registration: Joint Ego Motion Estimation and 3D Moving Object Detection in Dynamic Environment2022/4/1
- MSTC*:Multi-robot Coverage Path Planning under Physical Constraints2021/8/1
- Towards Embodied Scene Description2020/4/1
- Transferring Grasp Configurations using Active Learning and Local Replanning2018/7/1