Yiming Li
Tsinghua University
収録論文 50本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Robot-GST: 幾何学的時空間ロボット方策の表現と評価sim2real2026/9/27
RGB-D観測から3DガウススプラッティングとSAM3Dで高忠実度なロボット環境を構築し、実行前に行動候補をシミュレーション評価することで長期マニピュレーションの信頼性を高める枠組みを提案した。
- 足音のこだま:ゲート付き記憶を用いた知覚型ヒューマノイドパルクール歩行2026/9/24
オンボード深度のみを使い、ゲート付き記憶と顕著性誘導の時間知覚で足場の少ない不連続地形を安定して走破するヒューマノイドパルクール手法を提案。
- TactileStep: 足裏触覚学習によるヒューマノイド歩行の接地制御歩行2026/9/24
足裏の圧力センサを歩行制御に統合し、接地フェーズに応じた報酬で着地衝撃と騒音を抑えつつ支持安定性を高める学習フレームワークを提案。
- DAVIS: ヒューマノイドサッカースキルのための深度のみのエンドツーエンド能動視覚フレームワークVLA2026/9/23
頭部搭載の深度画像と固有感覚履歴のみから、ヒューマノイドロボットがサッカーのシュートやドリブルを直接25自由度の関節PD目標として学習するエンドツーエンドフレームワークを提案。
- メートル単位で行動する:精密ロボット操作のための計量的相互作用の学習マニピュレーション2026/9/16
物体とシーンに対する動作の計量的な関係を明示的にモデル化し、VLAやWAMモデルの操作精度を向上させるフレームワークを提案した。
- TrojanWorld: 想像力の誘導によるワールドモデルエージェントへのバックドア攻撃セキュリティ/強化学習2026/9/7
物理的な物体をトリガーとして、ワールドモデルエージェントの内部想像を操作し、攻撃者が指定した行動を誘発するバックドア攻撃フレームワークを提案した。
- SkillX: ヒューマノイドサッカーのための統合マルチスキルポリシー学習歩行/強化学習2026/9/6
ヒューマノイドサッカーにおいて、単一のコマンド条件付きポリシーでドリブル、トラップ、シュートなどの複数のスキルを学習・切り替え可能にする統一強化学習フレームワークを提案した。
- LayerRoute: 行動条件付きレイヤー混合ルーティングによる視覚言語行動ポリシーVLA2026/9/5
視覚言語行動(VLA)ポリシーにおいて、行動モジュールの状態に応じてVLMのレイヤー表現を動的に混合・再利用するルーティング手法を提案し、シミュレーションと実世界で性能を向上させた。
- WildCity: 実世界の都市規模テストベッド - レンダリング、シミュレーション、空間知能のための空間知能/都市規模再構築2026/7/7
自律走行車両が収集した都市規模のマルチモーダルデータセットを構築し、都市全体の3D再構築とクローズドループシミュレーションのベースラインを確立した。
- スプライン方策:ロボット方策の構造化表現模倣学習2026/6/1
ロボット操作の模倣学習において、固定解像度のアクションチャンクの代わりにスプラインパラメータを予測する構造化表現を提案し、連続軌跡の生成や制御への応用を可能にした。
- トークン予測は計画ではない:物理に基づく因果推論エージェントの構築VLA/計画2026/6/1
身体性を持つ視覚言語計画の評価では、言語的な次トークン予測が重視されがちですが、本研究では物理的な因果推論を促すベンチマークと大規模データセットを構築し、因果推論を学習したモデルが計画性能を向上させることを示しました。
- 物理情報アイコナールケージングによる全身操作計画マニピュレーション2026/6/1
物体を囲むロボット形状の脱出時間をアイコナール方程式でモデル化し、物理情報ニューラルネットワークで近似することで、接触モデルに依存しない頑健な全身操作計画を実現した。
- 計画整合型トークン圧縮による長文脈自動運転自動運転2026/6/1
自動運転のためのモノリシックな視覚行動モデルにおいて、長期の文脈を圧縮する際に計画情報を活用するフレームワークを提案し、成功率を向上させた。
- デモンストレーション周辺での適応的探索のためのエルゴード模倣模倣学習2026/5/1
模倣学習における訓練と実環境のミスマッチに対応するため、デモの幾何学的構造から目標分布を構築し、追従と探索を適応的に切り替えるエルゴード制御に基づく軌道生成手法を提案した。
- GaLa: ハイパーグラフ誘導型視覚言語モデルによる手続き計画VLA/計画2026/4/1
画像中の物体間の暗黙的な空間関係や機能的意味をハイパーグラフで表現し、視覚言語モデルの推論に組み込むことで、複雑なシーンでの手続き計画の精度を向上させるフレームワークを提案した。
- ニューラル配置空間距離場による移動マニピュレータの高速かつ安全な軌道最適化マニピュレーション2026/1/1
移動マニピュレータの全身衝突回避を配置空間で直接モデル化するGCDFを提案し、GPUバッチ処理可能なニューラル距離場と逐次凸最適化により高速・安全な軌道生成を実現した。
- LLaViDA: 明示的推論と軌道計画強化のための大規模言語視覚運転アシスタント自動運転/VLA2025/12/1
視覚言語モデル(VLM)を用いて物体運動予測・意味的接地・連鎖的推論を行い、二段階学習で自動運転の軌道計画を高精度化した研究。NuScenesで平均L2誤差0.31m・衝突率0.10%を達成。
- Wanderland:オープンワールド身体性AIのための幾何学的に接地したシミュレーションsim2real2025/11/1
実世界のマルチセンサーキャプチャから高精度な幾何学とフォトリアルな描画を両立する実→シミュレーション基盤を構築し、屋内・屋外都市シーンのデータセットを整備して、身体性ナビゲーションの再現可能な評価基盤を提供する。
- EmboMatrix: 身体性意思決定のためのスケーラブルな訓練基盤VLA2025/10/1
大規模言語モデルに身体性意思決定能力を獲得させるため、タスク・シーン生成、分散シミュレーション、精密報酬を統合した訓練基盤EmboMatrixを構築し、7Bモデルが671Bモデルを上回る性能を達成した。
- タコ腕のリーチング運動:鞭打ち運動に着想を得た視点ソフトロボティクス2025/10/1
水中での鞭のような受動的ダイナミクスがタコの腕のリーチング運動の特徴を再現できるかを実験的に検証し、媒体の重要性と能動制御の必要性を示した。
- 幾何学を考慮した方策模倣模倣学習2025/10/1
模倣学習を実演の幾何学的曲線として捉え、距離場から進行流と吸引流を導出することで、拡散ベースの方策より高成功率かつ20倍高速でメモリ効率の良いロボット制御を実現した。
- 運動プリミティブから距離場を経て力学系へ:自律ロボットのための軌道表現変換模倣学習2025/4/1
運動プリミティブで表された軌道を距離場として暗黙的に符号化し、摂動に反応する安定な自律力学系へと変換する手法を提案した論文。
- 合成データがEnd-to-End自動運転に与える影響の解明自動運転/シミュレーション2025/3/1
3Dガウシアンスプラッティングを用いた高忠実・対話的・効率的な自動運転シミュレータSceneCrafterを提案し、合成データ生成と閉ループ評価を通じてEnd-to-Endモデルの汎化性能を向上させる。
- 外挿的な都市ビュー合成ベンチマークsim2real2024/12/1
自動運転向けの新規視点合成(NVS)において、訓練視点から大きく外れた視点での性能を評価する初のベンチマークEUVSを構築し、既存手法が訓練視点に過適合しやすいことを示した。
- 微分可能距離場を用いた構成空間における安全な動的動作生成マニピュレーション2024/12/1
関節マニピュレータの微分可能距離場を利用し、速度を考慮した時変制御バリア関数と制御リアプノフ関数をQPで統合することで、動的環境下での衝突回避と全身接触動作を実現した。
- ロボティクスにおける距離場と測地流のリーマン幾何学的アプローチ幾何学/経路計画2024/12/1
リーマンアイコナール方程式を解くニューラルソルバー(NES)を提案し、非ユークリッド構造を持つロボットタスクで測地距離場と最短経路を計算可能にした。
- データ多様性の敵対的活用による視覚的ローカリゼーションの改善視覚的ローカリゼーション2024/12/1
外観多様性を持つ3Dガウススプラッティングで訓練データを合成し、敵対的判別器でsyn-to-realギャップを埋めることで、絶対姿勢回帰のロバスト性を大幅に向上させた。
- 非対称軟体腕を持つタコ泳法模倣ロボットソフトロボティクス2024/10/1
非対称な受動変形腕と傘状の速戻り機構を組み合わせ、2つの定速モーターだけでタコの腕運動とストローク時間比を再現し、効率的な遊泳を実現したバイオミメティックロボット。
- トライプレーン把持: 単一RGB画像による効率的な6自由度把持マニピュレーション2024/10/1
単一のRGB画像からトライプレーン・ガウス表現で物体を再構成し、6自由度の把持姿勢を高速に決定する手法を提案。
- 操作計画のためのコンフィギュレーション空間距離場マニピュレーション2024/6/1
ロボットの関節角度空間(コンフィギュレーション空間)における符号付き距離場(CDF)を提案し、制御・最適化・学習で統一的に扱える効率的な計算・融合アルゴリズムを示した。
- どこにいるか教えて:マルチモーダルLLMによる場所認識VLA2024/6/1
視覚基盤モデルで候補地点を検索し、マルチモーダルLLMが各候補を言語推論で比較して最終決定する、追加学習不要の視覚的場所認識手法を提案。
- RadarOcc: 4Dイメージングレーダによる堅牢な3D占有予測3D占有予測/レーダ2024/5/1
4Dレーダのテンソルを直接処理し、ドップラービン記述子や球面特徴符号化を用いて悪天候下でも高精度な3D占有予測を実現した手法。
- 重要なものだけを記憶する:多重走行からの創発的シーン分解3Dマッピング2024/5/1
同じ領域を複数回走行したRGB動画から、自己教師ありで環境と一時的物体を分離し、3Dガウシアンマップを構築する手法を提案。
- EgoPAT3Dv2: 一人称視点の2D画像から3D行動ターゲットを予測し人間-ロボット協調を実現人間-ロボット協調2024/3/1
一人称視点のRGB画像のみから手の動作の3D目標座標を予測するデータセットとアルゴリズムを拡張し、実機ロボットでその有用性を示した研究。
- Online Learning of Continuous Signed Distance Fields Using Piecewise Polynomials2024/1/1
- Collaborative Visual Place Recognition2023/10/1
- LiDAR-based 4D Occupancy Completion and Forecasting2023/10/1
- Geometric Projectors: Geometric Constraints based Optimization for Robot Behaviors2023/9/1
- Representing Robot Geometry as Distance Fields: Applications to Whole-body Manipulation2023/7/1
- Metric-Free Exploration for Topological Mapping by Task and Motion Imitation in Feature Space2023/3/1
- Among Us: Adversarially Robust Collaborative Perception by Consensus2023/3/1
- VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion2023/2/1
- DVGG: Deep Variational Grasp Generation for Dextrous Manipulation2022/11/1
- Learning Distilled Collaboration Graph for Multi-Agent Perception2021/11/1
- Simultaneous Semantic and Collision Learning for 6-DoF Grasp Pose Estimation2021/8/1
- HiFT: Hierarchical Feature Transformer for Aerial Tracking2021/8/1
- Predictive Visual Tracking: A New Benchmark and Baseline Approach2021/3/1
- DR^2Track: Towards Real-Time Visual Tracking for UAV via Distractor Repressed Dynamic Regression2020/8/1
- Towards Robust Visual Tracking for Unmanned Aerial Vehicle with Tri-Attentional Correlation Filters2020/8/1
- Automatic Failure Recovery and Re-Initialization for Online UAV Tracking with Joint Scale and Aspect Ratio Optimization2020/8/1