Rong Xiong
Zhejiang University
収録論文 130本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- StreamRig: リグ内幾何を活用したストリーミング多カメラオドメトリオドメトリ/多カメラ2026/9/30
凍結した多視点3D基盤モデル上に、キャリブレーション済みカメラリグの幾何を活かした因果的ストリーミングオドメトリを構築するフレームワークを提案。
- PccDiffuser: 連続体ロボットのためのマルチソリューション動作計画動作計画2026/9/9
連続体ロボットの経路計画において、条件付き拡散モデルを用いて複数の候補解を並列生成し、アクチュエータ制約を考慮した軌道に変換する手法を提案。障害物0〜4個の環境で91%の成功率を達成し、従来手法より高成功率かつ高効率であることを示した。
- 連続環境における視覚言語ナビゲーションの閉ループ強化学習のためのマクロ行動に基づくトポロジカルグラフの再考ナビゲーション2026/9/3
VLN-CEタスクを階層的MDPとして再構成し、トポロジカルグラフ上のマクロ行動空間で強化学習を行うことで、サンプル効率と性能を向上させた。
- 具現化ナビゲーター:指差し・思考・記憶・整合による効率的ナビゲーションナビゲーション2026/8/18
大規模視覚言語モデルを具現化ナビゲーションに活用する際の課題を解決するため、2Dピクセル選択と3D投影による行動形式、選択的推論と記憶圧縮、GRPOによる二段階整合を備えた統一フレームワークTAMP-Navを提案した。
- G2G: グループ内幾何を活用したグループ間ポーズ推定ポーズ推定2026/6/1
2つの画像グループ間の相対6自由度ポーズを推定する手法を提案。グループ内の既知の幾何情報を活用しつつ、基盤モデルは凍結したまま軽量なモジュールを追加して高精度を達成した。
- APT: 行動エキスパートの事前学習による視覚-言語-行動ポリシーの指示汎化の改善VLA/汎化2026/6/1
視覚-言語-行動モデルにおいて、言語データの不均衡が原因で未見の指示への汎化が悪い問題を、行動エキスパートを事前学習する二段階手法APTで解決した。
- 人型ロボットのための非同期上半身タスク空間軌道追従ポリシーの学習歩行2026/6/1
人型ロボットの高レベルプランナーが出力する低レートのタスク空間軌道と、高レートで動作する全身制御の間の時間的非同期性と構造的不完全性に対処するため、非同期の上半身タスク空間追従フレームワークを提案。教師-学生蒸留とスライディングウィンドウ報酬を用いてフレームドリフトを低減し、シミュレーションと実機で有効性を実証した。
- 基礎特徴量の幾何誘導モデリングによる一般化可能な物体形状変形学習3D再構成2026/5/28
単眼画像から3D物体形状を復元するため、カテゴリレベルのテンプレートを変形させる枠組みを提案し、基礎特徴量にテンプレートのトポロジーを組み込む幾何誘導機構と視点適応型特徴集約により、未知カテゴリや多視点への頑健な一般化を実現した。
- 腱駆動連続体ロボットのための学習ベース動力学モデリングとロバスト制御連続体ロボット/制御2026/4/1
腱駆動連続体ロボットの複雑な非線形性を捉えるGRUベースの動力学モデルを提案し、これを勾配ブリッジとして用いてエンドツーエンドのニューラル制御ポリシーを最適化する。物理実験で正確な追従と未知負荷に対するロバスト性を実証した。
- Fast-SegSim: ロボットシミュレーションのためのリアルタイムオープンボキャブラリセグメンテーションセグメンテーション2026/4/1
2Dガウススプラッティングに基づく高速なオープンボキャブラリセグメンテーション手法を提案し、40FPS以上のレンダリング速度を実現。ロボットシミュレーションでのセンサ入力や、下流タスクの教師データ生成に利用できる。
- Ψ-Map: パノプティック表面統合マップによるReal2Sim転送の実現3D再構成/パノプティックセグメンテーション2026/4/1
大規模シーン向けに、LiDARデータと2Dガウシアンサーフェルを用いた幾何学的強化と、クエリ誘導型のエンドツーエンドパノプティック学習を統合し、高精度でリアルタイムな3D再構成を実現するフレームワークを提案した。
- 腱駆動連続体ロボットの精密追従制御のための参照拡張学習制御2026/4/1
腱駆動連続体ロボットの精密な6自由度追従制御のため、微分可能なRNNダイナミクスモデルを勾配ブリッジとして用い、参照分布を拡張したオフライン学習フレームワークを提案。実験で平均位置誤差を50.9%削減した。
- IntentReact: トポロジカルな意図による反応的オブジェクト中心ナビゲーションの誘導ナビゲーション2026/3/1
オブジェクト目標ナビゲーションにおいて、局所的な観測のみに依存する反応的制御と大域的なトポロジカル計画のギャップを埋めるため、意図(intent)と呼ばれる低次元の方向信号を導入し、学習されたウェイポイント予測を条件付けてナビゲーションを誘導するフレームワークを提案した。
- 方向が鍵:力の方向を学習することで接触の多い操作のSim-to-Real転移を実現sim2real2026/2/1
シミュレーションで人間設計の位置・力制御器を教師として使い、接触力の方向を予測する方策を学習。実機では力覚アダミタンス制御器を構成し、電子レンジ開けやペグ挿しなど4タスクで高い成功率と頑健性を示した。
- ニューラル測距慣性オドメトリ測距慣性オドメトリ2025/12/1
UWB測距と慣性センサをグラフ注意ネットワークと再帰型ニューラルネットで融合し、アンカー配置やマルチパスに頑健な自己位置推定を実現した研究。
- Mr. Virgil: マルチロボットの視覚・測距による相対位置推定の学習マルチロボット位置推定2025/12/1
UWB測距と視覚検出の対応付けをグラフニューラルネットで学習し、微分可能なポーズグラフ最適化と組み合わせてマルチロボットの相対位置推定を高精度化するフレームワークを提案。
- ETP-R1: 強化学習ファインチューニングによるトポロジカル計画の進化 — 連続環境における視覚言語ナビゲーションVLA2025/12/1
連続環境での視覚言語ナビゲーション(VLN-CE)において、グラフベースのモデルに大規模データと強化学習ファインチューニングを適用し、R2R-CEで最先端性能を達成した研究。
- 見て行動し、プロンプトで指定する:視覚言語行動ポリシーのベイズ分解VLA2025/12/1
VLAモデルのファインチューニングで生じる言語忘却と視覚ショートカットを、ポリシーを視覚行動事前と言語条件付き尤度にベイズ分解することで解決し、未知の指示・物体・環境への汎化性能を向上させた。
- ZJUNlict 拡張チーム記述論文 2025群制御2025/11/1
ロボカップ小型リーグのZJUNlictチームが、IMU統合による姿勢精度向上や戦略・CUDAモジュールの最適化など、ハードウェアとソフトウェアの年間成果を報告した論文。
- 身体構成に同変な視覚-言語-行動ポリシーに向けてVLA2025/9/1
ロボットの身体構成の変化に対して同変性を持つように視覚-言語-行動ポリシーを設計し、新しい機体構成への汎化と効率的なファインチューニングを実現した研究。
- BEV-ODOM2: 地上ロボット向けPV-BEV融合と密フロー教師あり学習による拡張BEV単眼視覚オドメトリ視覚オドメトリ2025/9/1
単眼視覚オドメトリのスケールドリフトをBEV表現で解決する手法を改良し、密なBEVオプティカルフロー教師信号とPV-BEV融合により精度を向上させた。
- 閉ループダイナミクスに基づく油圧ショベルの高精度・高効率軌道追従軌道追従/油圧ショベル/モデルベース学習2025/9/1
油圧ショベルの非線形ダイナミクスに対処するため、モデルベース学習と閉ループダイナミクスを組み合わせた軌道追従手法EfficientTrackを提案し、シミュレーションと実機で高精度・高効率を実証した。
- TOP: ヒューマノイドロボットの安定かつ高精度な立位マニピュレーションのための時間最適化ポリシーマニピュレーション2025/8/1
上半身の動作時間を調整する時間最適化ポリシーを導入し、下半身の強化学習制御と組み合わせることで、ヒューマノイドの立位マニピュレーションの安定性と精度を両立させた。
- 人間データからの全身運動模倣フレームワーク:フルサイズヒューマノイドロボット向け全身運動模倣2025/8/1
人間の全身運動を接触を考慮してリターゲティングし、非線形重心MPCと全身制御でバランスを保ちながら実機ヒューマノイドに模倣させるフレームワークを提案した。
- ExploreVLM:視覚言語モデルによる閉ループロボット探索タスクプランニングVLA2025/8/1
視覚言語モデルを活用し、自己反省型の二段階プランナーと物体中心の空間関係グラフ、実行検証による閉ループ機構で、ロボットの対話的探索とリアルタイム再計画を実現したフレームワーク。
- 実行可能動作事前分布によるヒューマノイドロボットの立位上半身動作模倣模倣学習2025/7/1
ヒューマノイドが立ったまま人間の上半身動作を模倣する強化学習フレームワークを提案し、ロボットの実行可能範囲を考慮するEMPモジュールで安定性を確保した。
- UnIRe: 動的都市シーンの教師なしインスタンス分解シーン再構成2025/4/1
RGB画像とLiDAR点雲のみから、4Dスーパーポイントを用いて動的都市シーンを静的背景と個々の動的インスタンスに教師なしで分解し、3Dガウシアンスプラッティングで再構成する手法を提案。
- 言語指示・視覚観察・インタラクションに基づく3D物体アフォーダンスのグラウンディングアフォーダンス2025/4/1
言語指示・視覚観察・インタラクションから3D物体のアフォーダンス領域を推定する新タスクを提案し、そのためのデータセットAGPILとマルチモーダル言語誘導型ネットワークLMAffordance3Dを構築した。
- 生成的運動事前分布による人型ロボットの自然な歩行・移動歩行2025/3/1
人間の全身運動をロボットに転移し、条件付きVAEで未来の参照運動を生成するモデルを学習、その生成運動を方策学習時の密な監督として用いることで、人型ロボットの自然な移動を実現した研究。
- 把持タスクにおけるグリッパ状態の曖昧性解消:擬似触覚フィードバックによる純粋シミュレーション学習の実現マニピュレーション2025/3/1
把持タスクで問題となるグリッパ状態の曖昧性を、力制御グリッパを触覚センサとして用いる擬似触覚フィードバックで解消し、追加データ収集なしにシミュレーションのみでロバストな模倣学習を可能にした。
- PanopticSplatting: エンドツーエンドのパノプティックガウシアンスプラッティング3Dシーン理解2025/3/1
ガウシアンスプラッティングを用いたオープンボキャブラリなパノプティック再構成を、クエリ誘導型セグメンテーションとラベルブレンディングによりエンドツーエンドで実現した手法。
- CNSv2: 確率的対応符号化ニューラル画像サーボビジュアルサーボ2025/3/1
キーポイント検出が困難な環境でも、確率的特徴マッチングを組み込んだニューラル制御により高精度かつリアルタイムなビジュアルサーボを実現した。
- 雑然環境における言語条件付きピック&プレースのための無条件行動事前分布の効率的アラインメントマニピュレーション2025/3/1
視覚・言語・行動の基盤モデルの事前知識を統合し、1つのアテンション層で無条件行動事前分布を3D視覚言語事前分布にアラインメントすることで、少ないデータで学習しつつゼロショット汎化を保ち、雑然環境での言語条件付きピック&プレースを効率的に実現する手法A²を提案。
- BEV-DWPVO: 地面走行のための低スケールドリフト単眼視オドメトリに向けたBEVベース微分可能重み付きプロクルステス法単眼視オドメトリ2025/2/1
地面平面仮定を利用し、BEV特徴マップ上でキーポイントを抽出・マッチングして、微分可能な重み付きプロクルステス解法で3自由度の姿勢推定を行う単眼視オドメトリシステムを提案。
- CarPlanner: 自動運転の大規模強化学習のための一貫性のある自己回帰軌道計画自動運転計画2025/2/1
自己回帰構造と一貫性制約を組み合わせた強化学習プランナーを提案し、大規模実世界データセットnuPlanで従来のIL・ルールベース手法を上回る性能を達成した。
- せん断増粘流体に着想を得た物理的人間-ロボットインタラクションのための制御器物理的人間-ロボットインタラクション2025/2/1
せん断増粘流体の固液相変化に着想を得て、人間との協調と衝撃への耐性を両立する制御器SFCを提案し、安定性解析と実機実験で有効性を示した。
- クロスアテンションを活用したエンドツーエンドのオープンボキャブラリ・パノプティック再構成3D再構成2025/1/1
3Dインスタンスをクエリ、3D埋め込み場をキーとするクロスアテンションでパノプティック再構成を定式化し、学習可能な3Dガウシアンをインスタンスクエリとして用いることで空間的近接性を保ちつつエンドツーエンド最適化を実現した手法を提案。
- UniMM:マルチエージェントシミュレーションのための統合混合モデルフレームワークマルチエージェントシミュレーション2025/1/1
自動運転シミュレーション向けに、回帰ベース混合モデルと離散NTPモデルを包含する統合混合モデルフレームワークを提案し、閉ループサンプル生成と時間的脱結合・整合機構で分布シフトを緩和、WOSACベンチマークで最先端性能を達成した。
- マルチカメラ・マルチマップ視覚慣性自己位置推定:システム、検証、データセットVLA2024/12/1
因果的なリアルタイム自己位置推定を実現するマルチカメラ・マルチマップ視覚慣性システムを提案し、評価指標と長期キャンパスデータセットを構築して有効性を示した。
- BEV-ODOM: BEV表現で単眼視覚オドメトリのスケールドリフトを低減単眼視覚オドメトリ2024/11/1
深度教師なしで透視画像をBEV表現に変換し、3自由度の運動を推定することで、単眼視覚オドメトリのスケールドリフトを抑えるフレームワークを提案した。
- RING#: 回転並進同変グラム学習による姿勢推定ベースの大域的自己位置推定自己位置推定2024/9/1
BEV空間で2つの同変表現を学習し、場所認識を経由せず姿勢推定から直接位置を求める新しい大域的自己位置推定ネットワークRING#を提案した。
- LI-GS: LiDAR統合ガウシアンスプラッティングによる大規模高精度3次元再構成3D再構成/sim2real2024/9/1
LiDAR点群を平面制約付き混合ガウスモデルに変換し、2Dガウシアンサーフェルと組み合わせることで、屋外の大規模シーンを高精度に再構成する手法を提案した。
- 効率的な協調設計のための事前学習・微調整フレームワーク:四足ロボットパルクールの事例研究sim2real2024/7/1
四足ロボットの脚長などの機構と制御方策を同時最適化する事前学習・微調整フレームワークを提案し、パルクール能力を効率的に向上させる。
- PanopticRecon: オープン語彙インスタンスセグメンテーションを活用したゼロショットパノプティック再構成3Dシーン理解2024/7/1
RGB-D画像から、オープン語彙インスタンスセグメンテーションを利用して未知環境でも3Dパノプティック再構成をゼロショットで行う手法を提案。部分ラベルの伝播と3DインスタンスグラフによるID統合で課題を解決した。
- ν-DBA: ニューラル陰的密バンドル調整による画像のみの走行シーン再構成SLAM/3D再構成2024/4/1
3Dニューラル陰的表面で地図を表現し、密オプティカルフローに導かれた幾何誤差で軌跡と地図を同時最適化する密バンドル調整フレームワークを提案し、走行シーンの軌跡推定と密再構成精度を向上させた。
- 把持・認識・配置:方策構造の事前知識を活用した効率的な未知物体再配置マニピュレーション2024/2/1
知覚ノイズに頑健な未知物体再配置のため、把持と配置の分離構造を事前知識として組み込んだ二重ループシステムGSPを提案し、CLIPを活用して高い完了率と少ないステップを実現した。
- 劣調和人工ポテンシャル場による滑らかな経路計画経路計画2024/2/1
人工ポテンシャル場の局所解と障害物近傍での微分爆発を、指数関数でポテンシャルを劣調和化し円形サンプリングで危険距離を保つことで解決した移動ロボットの経路計画手法。
- NGEL-SLAM: Neural Implicit Representation-based Global Consistent Low-Latency SLAM System2023/11/1
- A Two-stage Based Social Preference Recognition in Multi-Agent Autonomous Driving System2023/10/1
- CNS: Correspondence Encoded Neural Image Servo Policy2023/9/1
- 3D Model-free Visual Localization System from Essential Matrix under Local Planar Motion2023/8/1
- Sparse Waypoint Validity Checking for Self-Entanglement-Free Tethered Path Planning2023/8/1
- An Efficient Multi-solution Solver for the Inverse Kinematics of 3-Section Constant-Curvature Robots2023/5/1
- Leveraging BEV Representation for 360-degree Visual Place Recognition2023/5/1
- A Hyper-network Based End-to-end Visual Servoing with Arbitrary Desired Poses2023/4/1
- NF-Atlas: Multi-Volume Neural Feature Fields for Large Scale LiDAR Mapping2023/4/1
- Learning adaptive manipulation of objects with revolute joint: A case study on varied cabinet doors opening2023/4/1
- Zero-shot Transfer Learning of Driving Policy via Socially Adversarial Traffic Flow2023/4/1
- Object-centric Inference for Language Conditioned Placement: A Foundation Model based Approach2023/4/1
- GOOD: General Optimization-based Fusion for 3D Object Detection via LiDAR-Camera Object Candidates2023/3/1
- Failure-aware Policy Learning for Self-assessable Robotics Tasks2023/2/1
- EMV-LIO: An Efficient Multiple Vision aided LiDAR-Inertial Odometry2023/2/1
- DAMS-LIO: A Degeneration-Aware and Modular Sensor-Fusion LiDAR-inertial Odometry2023/2/1
- A Joint Modeling of Vision-Language-Action for Target-oriented Grasping in Clutter2023/2/1
- A Survey on Global LiDAR Localization: Challenges, Advances and Open Problems2023/2/1
- Open-Set Object Detection Using Classification-free Object Proposal and Instance-level Contrastive Learning2022/11/1
- RING++: Roto-translation Invariant Gram for Global Localization on a Sparse Scan Map2022/10/1
- DeepRING: Learning Roto-translation Invariant Representation for LiDAR based Place Recognition2022/10/1
- C^2:Co-design of Robots via Concurrent Networks Coupling Online and Offline Reinforcement Learning2022/9/1
- Efficient Distance-Optimal Tethered Path Planning in Planar Environments: The Workspace Convexity2022/8/1
- Efficient Search of the k Shortest Non-Homotopic Paths by Eliminating Non-k-Optimal Topologies2022/7/1
- Towards Two-view 6D Object Pose Estimation: A Comparative Study on Fusion Strategy2022/7/1
- FEJ-VIRO: A Consistent First-Estimate Jacobian Visual-Inertial-Ranging Odometry2022/7/1
- DPCN++: Differentiable Phase Correlation Network for Versatile Pose Registration2022/6/1
- Learning A Simulation-based Visual Policy for Real-world Peg In Unseen Holes2022/5/1
- One RING to Rule Them All: Radon Sinogram for Place Recognition, Orientation and Translation Estimation2022/4/1
- Learning to Fill the Seam by Vision: Sub-millimeter Peg-in-hole on Unseen Shapes in Real World2022/4/1
- Map-based Visual-Inertial Localization: Consistency and Complexity2022/4/1
- Toward Consistent and Efficient Map-based Visual-inertial Localization: Theory Framework and Filter Design2022/4/1
- DXQ-Net: Differentiable LiDAR-Camera Extrinsic Calibration Using Quality-aware Flow2022/3/1
- A Visual Navigation Perspective for Category-Level Object Pose Estimation2022/3/1
- Depth-Independent Depth Completion via Least Square Estimation2022/3/1
- Translation Invariant Global Estimation of Heading Angle Using Sinogram of LiDAR Point Cloud2022/3/1
- Electric Vehicle Automatic Charging System Based on Vision-force Fusion2021/10/1
- HiTMap: A Hierarchical Topological Map Representation for Navigation in Unknown Environments2021/9/1
- Efficient Object Manipulation to an Arbitrary Goal Pose: Learning-based Anytime Prioritized Planning2021/9/1
- Anti-degenerated UWB-LiDAR Localization for Automatic Road Roller in Tunnel2021/9/1
- Domain Generalization for Vision-based Driving Trajectory Generation2021/9/1
- Learning Observation-Based Certifiable Safe Policy for Decentralized Multi-Robot Navigation2021/9/1
- Socially-Aware Multi-Agent Following with 2D Laser Scans via Deep Reinforcement Learning and Potential Field2021/9/1
- Learning Interpretable BEV Based VIO without Deep Neural Networks2021/9/1
- Improved Radar Localization on Lidar Maps Using Shared Embedding2021/6/1
- Kinematic Motion Retargeting via Neural Latent Optimization for Learning Sign Language2021/3/1
- Efficient learning of goal-oriented push-grasping synergy in clutter2021/3/1
- Collaborative Recognition of Feasible Region with Aerial and Ground Robots through DPCN2021/3/1
- Toward Consistent Drift-free Visual Inertial Localization on Keyframe Based Map2021/3/1
- Neural Motion Prediction for In-flight Uneven Object Catching2021/3/1
- Learn to Differ: Sim2Real Small Defection Segmentation Network2021/3/1
- Radar-to-Lidar: Heterogeneous Place Recognition via Joint Learning2021/2/1
- Improving Redundancy Availability: Dynamic Subtasks Modulation for Robots with Redundancy Insufficiency2020/11/1
- PREGAN: Pose Randomization and Estimation for Weakly Paired Image Style Translation2020/11/1
- Learning World Transition Model for Socially Aware Robot Navigation2020/11/1
- CORAL: Colored structural representation for bi-modal place recognition2020/11/1
- Dynamic Movement Primitive based Motion Retargeting for Dual-Arm Sign Language Motions2020/11/1
- Robust localization for planar moving robot in changing environment: A perspective on density of correspondence and depth2020/11/1
- DiSCO: Differentiable Scan Context with Orientation2020/10/1
- Improving the generalization of network based relative pose regression: dimension reduction as a regularizer2020/10/1
- Imitation Learning of Hierarchical Driving Model: from Continuous Intention to Continuous Trajectory2020/10/1
- RaLL: End-to-end Radar Localization on Lidar Map Using Differentiable Measurement Model2020/9/1
- Deep Samplable Observation Model for Global Localization and Kidnapping2020/9/1
- Deep Phase Correlation for End-to-End Heterogeneous Sensor Measurements Matching2020/8/1
- Collaborative Localization of Aerial and Ground Mobile Robots through Orthomosaic Map2020/7/1
- Learning hierarchical behavior and motion planning for autonomous driving2020/5/1
- Radar-on-Lidar: metric radar localization on prior lidar maps2020/5/1
- Globally optimal consensus maximization for robust visual inertial localization in point and line map2020/2/1
- Cellular Decomposition for Non-repetitive Coverage Task with Minimum Discontinuities2020/1/1
- Weakly-Supervised Road Affordances Inference and Learning in Scenes without Traffic Signs2019/11/1
- DeepGoal: Learning to Drive with driving intention from Human Control Demonstration2019/11/1
- Champion Team Paper: Dynamic Passing-Shooting Algorithm Based on CUDA of The RoboCup SSL 2019 Champion2019/9/1
- Multi-agent Collaboration for Feasible Collaborative Behavior Construction and Evaluation2019/9/1
- Towards navigation without precise localization: Weakly supervised learning of goal-directed navigation cost map2019/6/1
- Efficient two step optimization for large embedded deformation graph based SLAM2019/6/1
- ZJUNlict Extended Team Description Paper for RoboCup 20192019/5/1
- Mechatronic Design of a Dribbling System for RoboCup Small Size Robot2019/5/1
- 2-Entity RANSAC for robust visual localization in changing environment2019/3/1
- LiDAR-Camera Calibration under Arbitrary Configurations: Observability and Methods2019/3/1
- Communication constrained cloud-based long-term visual localization in real time2019/3/1
- Multi-session Map Construction in Outdoor Dynamic Environment2018/7/1
- Laser map aided visual inertial localization in changing environment2018/3/1
- LocNet: Global localization in 3D point clouds for mobile vehicles2017/12/1