Jie Xu
Anyverse Dynamics
収録論文 45本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MonoEgo: 受動的な手首コンステレーションと疎なワークステーションアンカーによる単眼メートル法エゴセントリック実演キャプチャデータ収集2026/9/28
1台の単眼カメラで受動的な手首マーカーと作業台アンカーを撮影し、オフライン再構成によりメートルスケールのエゴセントリックな実演データを取得するシステムを提案した。
- UpDown-SC: 重力正規化された上下包絡線スキャンコンテキストによる屋内LiDAR位置認識位置認識2026/9/24
屋内LiDAR位置認識において、重力方向の正規化と上下2つの包絡面(低中層構造の上側包絡と天井構造の下側包絡)を表現する学習不要の極座標記述子を提案し、姿勢やセンサ高さの変化に頑健な検索を実現した。
- 世界モデルによる汎化可能なロボット挿入マニピュレーション2026/9/23
手首カメラの視覚と固有感覚を統合した単一の世界モデルを最大90の挿入タスクで訓練し、未知形状の物体へのゼロショット挿入を実現した研究。
- オンライン重力推定は重要か?LiDAR慣性オドメトリにおける静かな設計分岐の再検討LiDAR慣性オドメトリ2026/9/12
LiDAR慣性オドメトリにおいて重力をオンライン推定し続けるか固定するかの設計選択を比較し、通常時は差が小さいがLiDAR停止時や動的開始時に影響が出ることを示した。
- JEPAポリシー:ペア行動と未来表現予測による拡散不要の模倣学習模倣学習2026/9/9
行動チャンクとその未来表現をペアで学習する拡散不要の模倣学習フレームワークを提案し、9つのシミュレーションタスクと実機実験で成功率向上と低遅延を実現した。
- Stream3Dv2: 幾何学的・意味的融合によるストリーミングゼロショット3Dシーン理解の強化3Dシーン理解2026/8/21
本論文は、ストリーミングRGB-D入力とノイズのある2Dセグメンテーションマスクを扱うためのトレーニング不要の3Dシーン理解フレームワークを提案し、幾何学的・意味的融合と多様体距離に基づく点群精緻化により性能を向上させる。
- SILO: マルチステージケーブル配線のためのシミュレーション・イン・ザ・ループによるSim-to-Real転移sim2real2026/7/1
GPU並列シミュレーションで学習したRLポリシーを実世界の多段階ケーブル配線タスクに転移するフレームワークを提案し、成功率向上とサイクルタイム半減を実現した。
- EAGG: 幾何認識グラフ条件付けによる身体性整合グラスプ生成マニピュレーション2026/6/16
異なるエンドエフェクタ形状に適応する統一グラスプ生成モデルを提案し、トポロジー認識グラフと反復的な幾何注入で成功率と接触精度を向上させた。
- VBGS-SLAM: 変分ベイズガウススプラッティングによる同時位置推定と地図構築SLAM2026/4/1
3Dガウススプラッティングを用いたSLAMにおいて、カメラ姿勢とシーン地図の不確実性を変分ベイズ推論で明示的に扱うことで、初期化への敏感さや忘却問題を軽減し、追跡性能とロバスト性を向上させた手法を提案した。
- Refinery: 接触の多いタスク向け能動的ファインチューニングと展開時最適化マニピュレーション2025/10/1
ベイズ最適化によるファインチューニングとGMMベースの初期化選択で、接触の多い組立タスクの成功率を91.51%まで向上させ、多部品の長期組立も可能にした。
- VT-Refine: 視触覚フィードバックによる両手組立のシミュレーション微調整学習マニピュレーション2025/10/1
少数の実演と高忠実度の触覚シミュレーションを組み合わせ、強化学習で両手組立ポリシーを微調整することで、接触の多い精密作業の実世界性能を向上させた研究。
- UWB支援視覚慣性ナビゲーションのためのバイアス補正を伴うロバストオンラインキャリブレーションUWB/VINSキャリブレーション2025/8/1
UWBアンカーのオンラインキャリブレーションにおいて、ロボット自己位置推定の不確かさを明示的に考慮し、Schmidtカルマンフィルタによる密結合オンライン補正で初期推定誤差に頑健な手法を提案した。
- ニューラルロボットダイナミクスsim2real2025/8/1
関節剛体ロボットの接触を考慮したダイナミクスを学習し、解析シミュレータの低レベルソルバを置き換える汎用ニューラルシミュレータNeRDを提案。
- LiDAR慣性SLAMのための動的初期化SLAM2025/4/1
ロボットが移動中でもLiDARオドメトリとIMUを反復的に整合させ、LiDAR慣性SLAMを高速かつ頑健に初期化する手法を提案した論文。
- II-NVM: 法線ベクトルを活用したマップの精度と一貫性を高めるSLAMSLAM2025/4/1
法線ベクトルの一貫性を利用して、近接する壁やドアを誤って同一平面として扱う「両面マッピング問題」を解決し、屋内SLAMのマップ精度と一貫性を向上させる手法を提案。
- Adaptive-LIO: 環境適応によるLiDAR慣性オドメトリのロバスト性と精度の向上SLAM2025/3/1
LiDAR慣性オドメトリにおいて、適応的セグメンテーション、IMU飽和・故障検出による運動モード適応、多解像度ボクセルマップによる地図解像度適応を組み合わせ、様々な環境でのロバスト性と精度を向上させた。
- MM-LINS: 過度に退化した環境のためのマルチマップLiDAR慣性システムSLAM2025/3/1
LiDARの退化が起きる環境で地図のドリフトを防ぐため、退化検出時に地図を退避させて新規地図を動的初期化で構築し、後段で地図間類似度を検出して融合するマルチマップLiDAR慣性SLAMを提案した論文。
- NeRF-VIO: ニューラル放射輝度場を活用した初期化付き地図ベース視覚慣性オドメトリVIO2025/3/1
事前学習したNeRFを地図として用い、SE(3)上の測地距離で初期化を安定化させた視覚慣性オドメトリを提案し、MSCKFに二段階更新を組み込んでARデータセットで精度向上を実証した。
- PLK-Calib: プラッカー直線を用いた単一ショット・ターゲットレスLiDAR-カメラ外部キャリブレーションキャリブレーション2025/3/1
LiDARとカメラの間の外部キャリブレーションを、ターゲットを使わず1回の計測で行う手法を提案。直線特徴のプラッカー座標表現を利用して回転と並進を分離し、高精度な推定を実現した。
- 大規模UWBアンカーキャリブレーションとガウス過程を用いたワンショット測位測位・キャリブレーション2024/12/1
LiDAR慣性オドメトリとUWB測距をガウス過程で融合し、大規模環境で1回のサンプリングによるアンカー位置推定と高精度測位を実現した。
- 選択的カルマンフィルタ:SLAMの退化を克服するためのマルチセンサ情報融合の時期と方法SLAM/センサ融合2024/12/1
LiDAR SLAMの退化を検出し、退化時のみ視覚情報を選択的に融合することで、計算コストを抑えつつロバスト性と精度を向上させる手法を提案。
- SPOT: 物体中心操作のためのSE(3)姿勢軌道拡散模倣学習2024/11/1
物体のSE(3)姿勢軌道をタスク表現として用い、拡散ポリシーを条件付ける物体中心模倣学習フレームワークを提案。iPhoneで撮影した8つの実演のみで実世界タスクを制約遵守しつつ完遂した。
- TacSL: 視触覚センサのシミュレーションと学習のためのライブラリ触覚2024/8/1
GPUベースで視触覚センサを高速シミュレーションし、触覚ベースの強化学習を可能にするライブラリTacSLと、sim-to-real転移のための新アルゴリズムAACDを提案した。
- MeMo: ノイズ注入による意味のあるモジュラー制御器の学習モジュラー制御2024/7/1
ロボットの部品ごとにモジュラー制御器を学習し、同じ部品からなる新しいロボットの制御を効率的に再利用できるフレームワークMeMoを提案。
- I2EKF-LO: 二重反復拡張カルマンフィルタに基づくLiDARオドメトリLiDARオドメトリ/状態推定2024/7/1
観測方程式と状態更新の両方を反復する二重反復拡張カルマンフィルタを提案し、動的な過程雑音調整と機体別運動モデルによりLiDARオドメトリの精度と効率を向上させた。
- AutoMate: 多様な形状に対応する専門家・汎用組み立てポリシーマニピュレーション2024/7/1
100種類の組み立てタスクのデータセットと並列シミュレーション環境を構築し、部品特化型と汎用型の組み立てポリシーを学習。シミュレーションから実機へのゼロショット転移を実現した。
- RVT-2: 少数のデモンストレーションから精密なマニピュレーションを学習マニピュレーション2024/6/1
言語指示に基づく多タスク3Dマニピュレーションにおいて、アーキテクチャとシステムの改善により学習を6倍、推論を2倍高速化し、RLBenchで成功率82%を達成、実世界でも10回のデモで高精度タスクを学習可能にした。
- 接触の多い微分可能シミュレーションにおける適応的ホライズンアクター・クリティック強化学習2024/5/28
剛体接触を含む微分可能シミュレーションで、モデルベースのホライズンを適応的に調整して勾配誤差を減らす強化学習アルゴリズムを提案し、歩行タスクで既存手法より40%高い報酬を達成した。
- バターを取って:YOLOv7とBERTを活用したデスクトップ型マルチタスクロボットアームの研究マニピュレーション2024/5/1
小型デスクトップロボットに音声認識・自然言語理解・視覚認識を組み合わせ、マルチモーダルな自律動作を実現した研究。
- AdaDemo: 汎用ロボットエージェントのためのデータ効率的なデモンストレーション拡張模倣学習2024/4/1
既存方策の弱点を特定し、適応的にデモンストレーションを収集・拡張することで、データ効率的に多タスク模倣学習を改善するフレームワークAdaDemoを提案。
- SInViG: A Self-Evolving Interactive Visual Agent for Human-Robot Interaction2024/2/1
- Towards Unified Interactive Visual Grounding in The Wild2024/1/1
- Signatures Meet Dynamic Programming: Generalizing Bellman Equations for Trajectory Following2023/12/1
- Vision-Language Foundation Models as Effective Robot Imitators2023/11/1
- InViG: Benchmarking Interactive Visual Grounding with 500K Human-Robot Interactions2023/10/1
- Towards a Modular Architecture for Science Factories2023/8/1
- RVT: Robotic View Transformer for 3D Object Manipulation2023/6/1
- Assemble Them All: Physics-Based Planning for Generalizable Assembly by Disassembly2022/11/1
- An Integrated Design Pipeline for Tactile Sensing Robotic Manipulators2022/4/1
- Accelerated Policy Learning with Parallel Differentiable Simulation2022/4/1
- Evolution Gym: A Large-Scale Benchmark for Evolving Soft Robots2022/1/1
- A System for General In-Hand Object Re-Orientation2021/11/1
- An End-to-End Differentiable Framework for Contact-Aware Robot Design2021/7/1
- Probabilistic Human Motion Prediction via A Bayesian Neural Network2021/7/1
- Multi-Objective Graph Heuristic Search for Terrestrial Robot Design2021/7/1