Xin Ding
Tsinghua University
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Zeva-Ego: 一人称視点動画の中間学習と文脈内因果学習によるロボットマニピュレーションVLA2026/9/21
一人称視点の人間動画から行動中心の監督信号を作りVLAモデルを中間学習させ、さらに展開時に行動と結果のフィードバックからパラメータ更新なしで適応する枠組みを提案。
- Zeva: 文脈内因果学習による汎用身体操作の実現マニピュレーション2026/8/31
ロボットが実環境での物理的相互作用からその場で学習し、その知識を次の行動に活かすフレームワークZevaを提案。ポリシーモデルを凍結したまま、因果相互作用抽出器と二重タイムスケールの因果メモリを用いて、実行した行動と状態変化を符号化し、後の行動の文脈として注入する。シミュレーションと実機操作で最先端のVLAやWAMを上回る性能を示し、勾配更新なしで自己進化を実現。
- Zetta ζ: 自己進化する物理知能のための効率的な閉ループ具現化ハーネス具現化エージェント/自己進化2026/8/17
ロボットの実行中にコードベースの批評家と回復スキルをオンラインで進化させる閉ループハーネスを提案し、LIBERO-ProとRoboCasaで高い成功率と高速化を達成した。
- MemCompiler: コンパイルする、注入しない -- 身体化エージェントのための状態条件付きメモリ身体化エージェント/メモリ管理2026/5/1
エージェントの現在の状態に応じて関連メモリのみを動的に選択・コンパイルするメモリシステムを提案し、静的メモリ注入を上回る性能と低遅延を実現した。
- OxyGen: マルチタスク並列下のVLA推論のための統合KVキャッシュ管理VLA2026/3/1
VLAモデルのマルチタスク並列推論において、KVキャッシュをタスク間・時間軸で共有する統合管理手法を提案し、オンデバイスで最大3.7倍の高速化を実現した。
- PA-LVIO: ポーズのみのバンドル調整によるリアルタイムLiDAR-視覚-慣性オドメトリとマッピングオドメトリ/マッピング2026/3/1
LiDAR・カメラ・IMUを統合したリアルタイムオドメトリ・マッピング手法を提案。ポーズのみのバンドル調整とフレーム間・フレーム対マップの制約を組み合わせ、高精度かつ効率的な自己位置推定と高品質なRGB点群地図構築を実現した。
- AdaNav: 不確実性に基づく適応的推論による視覚言語ナビゲーションVLA2025/9/1
視覚言語ナビゲーションにおいて、不確実性に応じて推論を動的に発動する軽量プラグインを提案し、少ない学習データで大幅な性能向上を実現した。
- i2Nav-Robot:屋内・屋外対応の大規模マルチセンサ融合ナビゲーション用ロボットデータセットナビゲーション2025/8/1
全方位移動車両にLiDAR・4Dミリ波レーダー・ステレオカメラ・IMU・GNSS・車輪オドメトリを搭載し、屋内駐車場から屋外街路まで約17kmの走行データを高精度な正解位置とともに収録した大規模データセットを構築した。
- LLM駆動ドライバーエージェントの運転スタイル整合自動運転/LLMエージェント2024/3/1
人間の運転行動を自然言語データセット化し、実演とフィードバックによるマルチ整合フレームワークでLLMドライバーエージェントを個人の運転スタイルに合わせる手法を提案した。