Xiangyu Li
Tsinghua University
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VehDyn: 車両ダイナミクス評価のための運転世界モデルベンチマーク運転世界モデル2026/9/27
CARLAとCarSimを連携させたデータセットを構築し、生成された運転動画が車両の運動学・動力学にどれだけ従っているかを階層的に評価するベンチマークを提案した。
- 時間的モード切替と地形横断追従による空地両用運動制御の学習sim2real2026/9/22
受動車輪型空地両用車両に対し、ToF計測と将来参照情報を用いた学習ベースのモード選択器と強化学習による軌道追従制御を統合し、限られた知覚下での信頼性の高い空地切替と多地形での高精度な地上追従を実現した。
- Touvigation:未知の屋内環境における視覚障害者のための身体適応型物体取得支援視覚障害者支援/身体性AI2026/9/18
視覚障害者が未知の屋内で物を探して手に取るのを支援するハンズフリーシステムを提案し、視覚言語理解と持続的な局所空間モデルを組み合わせて身体相対の低遅延ガイダンスを実現、12名の参加者実験で成功率100%を達成した。
- TADreamer: ビデオ想像による陸空二モードロボットのゼロショット言語誘導3Dナビゲーションナビゲーション2026/9/17
生成ビデオから3Dウェイポイントを復元し、幾何情報でキャリブレーションすることで、陸空両用ロボットの言語指示ナビゲーションを学習なしで実現した。
- 自動運転車と人間運転車の車両運動特性のスペクトル差異を走行シナリオ別に定量化自動運転2026/9/11
実世界の自動運転車データセットを用い、周波数領域の枠組みで自動運転車と人間運転車の運動特性の違いを様々な走行シナリオ別に定量化した研究。
- 6Gにおけるプライバシー保護型身体知能のためのモダリティ分離連合学習VLA2026/9/9
VLAモデルの連合学習において、視覚・言語・行動の各モダリティ特性に応じて集約・プライバシー配分・通信圧縮を分離設計し、6G網でのロボット協調を効率化するフレームワークを提案。
- Zeva: 文脈内因果学習による汎用身体操作の実現マニピュレーション2026/8/31
ロボットが実環境での物理的相互作用からその場で学習し、その知識を次の行動に活かすフレームワークZevaを提案。ポリシーモデルを凍結したまま、因果相互作用抽出器と二重タイムスケールの因果メモリを用いて、実行した行動と状態変化を符号化し、後の行動の文脈として注入する。シミュレーションと実機操作で最先端のVLAやWAMを上回る性能を示し、勾配更新なしで自己進化を実現。
- RoboPhys-3D: 3D再構成による包括的な具現化世界モデル評価世界モデル評価2026/8/28
ロボット操作タスクのビデオ世界モデルを3D再構成に基づいて評価するベンチマークを提案し、生成ビデオの3Dシーン整合性とタスク実行可能性を測定する。
- Zetta ζ: 自己進化する物理知能のための効率的な閉ループ具現化ハーネス具現化エージェント/自己進化2026/8/17
ロボットの実行中にコードベースの批評家と回復スキルをオンラインで進化させる閉ループハーネスを提案し、LIBERO-ProとRoboCasaで高い成功率と高速化を達成した。
- Embodied.cpp: 異種ロボット向け具現化AIモデルのポータブル推論ランタイムVLA/推論ランタイム2026/7/1
VLAモデルや世界行動モデルなどの具現化AIモデルを、異なるロボットやエッジデバイス上で効率的に実行するためのC++推論ランタイムを提案。モジュール化された5層構造により、多レート実行や低遅延推論を実現し、Pythonベースラインと比較して1.05〜2.70倍の高速化とVRAM削減を達成した。
- 単一周波数GNSS受信機を相対観測で高精度測位へ位置推定2026/6/1
低コストな単一周波数GNSS受信機と相対運動センサを組み合わせ、仮想基準局とスライディングウィンドウ因子グラフを用いて、キャリア位相の連続追跡による高精度測位を実現する手法を提案した。実世界実験で数メートルからデシメートル級の精度向上を確認した。
- スケッチからの探索:事前地図を用いた大規模環境でのUAV探査の高速化UAV探査2026/6/1
大規模で複雑な環境でのUAV自律探査の効率を向上させるため、不正確で不完全な2D事前地図を活用する新しい探査フレームワークを提案。LiDAR観測と事前地図の頑健な位置合わせと、階層的な視点計画戦略により、探索経路を最適化する。
- ActProbe: 生成ロボットポリシーの早期故障検出のためのアクション空間プローブ故障検出2026/6/1
生成ロボットポリシーの出力するアクション列自体に故障予兆が含まれることを利用し、軽量なアクション空間のみの検出器ActProbeを提案。故障を視覚的に認識される前に検出し、F1-即時性のトレードオフを改善する。
- 時間的サンプリング周波数の重要性:エンドツーエンド運転軌道予測の容量認識研究自動運転2026/5/1
エンドツーエンド自動運転の軌道予測において、カメラフレームの時間的サンプリング周波数を訓練データ設計の変数として扱い、モデル容量に応じて最適な周波数が異なることを示した研究。
- AwareVLN: 自己認識による視覚言語ナビゲーションの推論VLA2026/5/1
視覚と言語によるナビゲーションにおいて、エージェントの状態とタスクの進捗を理解する自己認識推論機構を導入し、エンドツーエンドで高性能なナビゲーションを実現した。
- ダンパ特性に基づくベイズ物理情報ニューラルネットワークによる車輪荷重推定車両状態推定2026/5/1
サスペンションの複雑な幾何学と非線形動特性を考慮した物理情報ニューラルネットワークにベイズ推論を統合し、ノイズ下での車輪荷重推定のロバスト性を向上させた。
- LLM-MLFFN: 大規模言語モデルによるマルチレベル自動運転行動特徴融合自動運転2026/3/1
自動運転車の運転行動分類の精度と解釈性を高めるため、大規模言語モデルを用いて数値特徴と意味的特徴を融合する新しいネットワークを提案した。Waymoデータセットで94%以上の分類精度を達成した。
- OxyGen: マルチタスク並列下のVLA推論のための統合KVキャッシュ管理VLA2026/3/1
VLAモデルのマルチタスク並列推論において、KVキャッシュをタスク間・時間軸で共有する統合管理手法を提案し、オンデバイスで最大3.7倍の高速化を実現した。
- TriphiBot: FOC推進と偏心設計を組み合わせた水陸空三棲ロボット水陸空ロボット2026/2/1
クアッドコプター構造に受動輪を加えた最小構成で、空・陸・水の三領域を移動できるロボットを提案。偏心重心設計とFOCベースの統合推進、HNMPC-PID制御により効率的な多領域移動とモード遷移を実現した。
- SVBRD-LLM: 自動運転車識別のための自己検証型行動ルール発見フレームワークVLA2025/11/1
交通動画からLLMのゼロショット推論で自動運転車と人間運転車の行動差を表す解釈可能なルールを自動抽出し、識別タスクで検証・洗練するフレームワークを提案。
- RAD: 大規模3DGSベース強化学習によるエンドツーエンド自動運転ポリシーの学習自動運転/強化学習2025/2/1
3Dガウシアンスプラッティングで構築したフォトリアルな閉ループ環境で強化学習を行い、模倣学習を正則化として併用することで、衝突率を大幅に低減した自動運転ポリシーを学習する手法を提案。
- DiffusionDrive:切り詰め拡散モデルによるエンドツーエンド自動運転自動運転2024/11/1
拡散モデルのノイズ除去ステップを切り詰め、マルチモードアンカーを導入することで、自動運転の行動生成を2ステップで多様かつ高品質にし、リアルタイム速度を実現した。