Xingyu Chen
Zhongguancun Academy
収録論文 35本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HIRE: 視覚的に曖昧な精密マニピュレーションのための履歴条件付きインタラクション推論と高速実行マニピュレーション2026/9/25
力覚の履歴から接触状態を推論する低レート推論器と、接触動作を高レートで精密実行する実行器を組み合わせ、見た目が同じでも状態が異なる精密操作を実現したフレームワーク。
- PFM-HR: 人型ロボットのためのポーズフローマッチング歩行2026/8/1
大規模な非順序ポーズデータから学習した再利用可能なフローマッチング事前分布を導入し、ポーズ幾何スコアを用いて追跡報酬を調整することで、人型ロボットの動的動作追跡性能を向上させた。
- パノラマ認識型VLAによる全身遠隔操作を用いた移動操作の学習VLA2026/8/1
全身遠隔操作システムとパノラマ認識型VLAポリシーを開発し、移動操作タスクの成功率を大幅に向上させた。
- 大規模基盤モデル時代の手と物体のインタラクション:再構築、生成、身体化転移サーベイ2026/7/30
手と物体のインタラクション(HOI)モデリングにおける基盤モデルの活用を体系的にレビューし、幾何・意味・視覚の8つの事前知識に分類して、各タスクへの導入方法とロボット学習への応用を分析した論文。
- 手動、ジョイスティック、または触覚制御?ロボット介入神経放射線処置におけるナビゲーション戦略のin vitro比較医療ロボティクス2026/7/1
ロボット介入神経放射線処置のためのコントローラインターフェースを比較し、触覚フィードバック付きデバイス模倣コントローラがジョイスティックより優れていることを示した。
- ScaleHP: メートル空間での手の姿勢推定手の姿勢推定2026/6/24
手の骨の比例関係からメートル単位の手のサイズを推定し、深度モジュールなしで絶対スケールの手の姿勢を高精度に復元する新しいフレームワークを提案した。
- HumanoidArena: 自己中心視点の階層的全身体学習のベンチマークヒューマノイド制御2026/6/1
ヒューマノイドロボットの階層的制御(高レベル方策と低レベル運動追跡器)の性能を評価する新しいシミュレーションベンチマークを提案し、脚部が重要な7つのタスクを設計して、方策と追跡器のインターフェースの実行可能性や頑健性を検証する。
- VAIC: 視覚誘導によるヒューマノイドの俊敏な物体インタラクション制御 - 分離コマンドを用いてヒューマノイド制御2026/6/1
ヒューマノイドロボットが、深度カメラと自己状態のみから、箱運びやスケートボードなどの多様な動的物体操作を単一のポリシーで実行できるようにする、教師-生徒蒸留に基づく制御フレームワークを提案した。
- 血管内介入ロボットの遠隔操作:系統的レビュー遠隔手術2026/5/1
遠隔操作による血管内介入ロボットの技術的実現性、通信インフラ、臨床転帰を系統的にレビューし、最大7000kmの遠隔操作が可能で、ネットワーク遅延が臨床的に許容範囲であることを示した。
- ECHO: 視覚言語行動モデルのための連続階層メモリVLA2026/5/1
長期的な操作タスクにおけるVLAモデルの性能を向上させるため、経験を階層的に整理する連続メモリフレームワークECHOを提案。双曲オートエンコーダでメモリを木構造に組織化し、効率的な検索と合成を実現。
- PriorVLA: 事前知識を保持した視覚言語行動モデルの適応VLA2026/5/1
事前学習済みの視覚言語行動モデルを下流タスクに適応させる際、事前知識を保持しつつ効率的に活用するフレームワークPriorVLAを提案。凍結した事前エキスパートと適応エキスパートを組み合わせ、パラメータ更新を25%に抑えつつ、分布外や少数サンプル設定で高い性能を達成。
- ハイブリッド身体性タスクにおける長期的進化のためのワールド・エゴモデリング世界モデル2026/5/1
本論文は、長期的なハイブリッド身体性タスク(ナビゲーションと操作の組み合わせ)において、世界と自己の進化を分離してモデル化する新しいパラダイム「ワールド・エゴモデリング」を提案し、その実装としてWEMモデルとベンチマークHTEWorldを構築した。
- OASIS: SE(3)軌道予測による観測・行動空間の整合を利用したロボット操作マニピュレーション2026/5/1
視覚・言語・行動モデルの中間表現を行動空間の剛体幾何に合わせるため、SE(3)軌道予測を導入したポリシーを提案し、シミュレーションと実機で成功率と汎化性能を向上させた。
- VoxAfford: オープンボキャブラリ3Dアフォーダンス検出のためのマルチスケールボクセルトークン融合3Dアフォーダンス検出2026/5/1
3D点群上のオープンボキャブラリアフォーダンス検出において、MLLMの出力トークンに事前学習済み3D VQVAEのマルチスケール幾何特徴を融合する手法を提案し、mIoUを約8%向上させた。
- AffordSim: アフォーダンス認識ロボット操作のためのスケーラブルなデータ生成器とベンチマークマニピュレーション2026/4/1
自然言語のタスク記述から3Dアフォーダンス予測を統合し、タスク関連シーンと軌道を自動生成するデータ生成器とベンチマークを提案。手動注釈なしで高成功率を達成し、実ロボットへのゼロショット転送も実証。
- 一貫性駆動型デュアルLSTMモデルによるウェアラブルソフトロボットアームの運動学制御ソフトロボティクス/運動学学習2026/3/1
空気圧駆動のソフトロボットアームの順運動学と逆運動学を学習するため、サイクル一貫性損失を導入したデュアルLSTMフレームワークを提案し、非線形・ヒステリシス特性と一対多マッピング問題を解決した。
- HAIC: ダイナミクス認識ワールドモデルによるヒューマノイドの俊敏な物体インタラクション制御マニピュレーション2026/2/1
固有受容感覚の履歴のみから物体の速度・加速度を予測し、動的占有マップを構築することで、スケートボードや台車の押し引きなど劣駆動物体との俊敏な全身インタラクションを実現したヒューマノイド制御フレームワーク。
- MoEベースの頑健な四脚歩行におけるsim-to-real予測可能性の信頼性向上歩行2026/2/1
複数の専門家をゲートで切り替えるMoE歩行ポリシーと、sim-to-real転移性を予測評価するRoboGaugeを提案し、Unitree Go2で雪・砂・階段などの未見地形を安定歩行できることを示した。
- ヒューマノイドロボットのためのポーズ距離場ヒューマノイド2026/2/1
ロボットのポーズ分布を連続的で微分可能な多様体として表現する軽量な事前分布PDF-HRを提案し、報酬整形や正則化として組み込むことで運動追跡やリターゲティングなどのタスクを改善した。
- 階層型モジュラー・マルチエージェント強化学習による機械的血栓回収術のAI自律ナビゲーション医療ロボティクス/強化学習2026/2/1
大腿動脈から内頸動脈までのカテーテルとガイドワイヤの二デバイス操作を、階層型モジュラー・マルチエージェント強化学習で自律化し、in silicoおよびin vitroで有効性を実証した研究。
- VLingNav: 適応的推論と視覚支援言語記憶による身体性ナビゲーションVLA2026/1/1
人間の二重過程理論に着想を得た適応的Chain-of-Thoughtと視覚支援言語記憶を備えたVLAナビゲーションモデルを提案し、長期的タスクにおける推論と記憶を強化した。
- シミュレーションと現実を繋ぐ:セマンティック2Dガウシアンスプラッティングによるドメイン間転移sim2real2025/12/1
物体中心のドメイン不変な空間特徴を抽出するセマンティック2Dガウシアンスプラッティングを提案し、シミュレーションから実世界への操作タスクの転移性能を向上させた。
- 暗黙的キノダイナミック動作リターゲティングによるスケーラブルな全身動作転移動作リターゲティング2025/9/1
骨格グラフ畳み込みデュアルオートエンコーダと物理情報に基づく洗練により、人間の動作データを高速かつ物理的に実現可能なヒューマノイド動作へ変換する手法を提案した。
- PRISM: 投影ベース報酬統合によるシーン認識型Real-to-Sim-to-Real転移sim2real2025/4/1
少数の実演から画像で物体を認識し3Dモデルを取得してシミュレーション環境を自動構築し、VLM監督の投影ベース報酬でRL方策を訓練して実世界に転移する手法を提案。
- ロボット把持システム向けの柔軟なFBG接触力センサ触覚2025/2/1
3DプリントTPUケースとFBGアレイを用いた小型高感度な接触力センサを開発し、ソフトグリッパに統合して力制御を実現した。
- OmniPose6D: 単眼RGB動的環境における短期物体姿勢追跡物体姿勢追跡2024/10/1
動的環境での単眼RGBによる短期物体姿勢追跡のため、大規模合成データセットOmniPose6Dとベンチマークを構築し、不確実性を考慮したキーポイント改良ネットワークを提案した。
- REGNet V2: 異なるサイズのグリッパ向けエンドツーエンド領域ベース把持検出ネットワークマニピュレーション2024/10/1
点群にグリッパパラメータを埋め込み、スコア・領域・精緻化の3段階ネットワークで多様な物体への把持を予測するシステムを提案し、実環境で高い成功率を達成した。
- Prioritized Planning for Target-Oriented Manipulation via Hierarchical Stacking Relationship Prediction2023/3/1
- LIO-PPF: Fast LiDAR-Inertial Odometry via Incremental Plane Pre-Fitting and Skeleton Tracking2023/2/1
- Closed-form Error Propagation on the SE_n(3) Group for Invariant Extended Kalman Filtering with Applications to VINS2022/6/1
- Probabilistic Human Motion Prediction via A Bayesian Neural Network2021/7/1
- Rethinking Temporal Object Detection from Robotic Perspectives2019/12/1
- Joint Anchor-Feature Refinement for Real-Time Accurate Object Detection in Images and Videos2018/7/1
- Temporally Identity-Aware SSD with Attentional LSTM2018/3/1
- Towards Real-Time Advancement of Underwater Visual Quality with GAN2017/12/1