Pengfei Li
TARS Robotics
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CAP: 学習型ノイズ除去による連続適応型知覚ブラインドヒューマノイド歩行歩行2026/9/10
劣化した深度入力を学習型デノイザで復元しつつ固有感覚も併用することで、知覚が不確実な環境でも途切れずに歩行できるヒューマノイド制御ポリシーを提案した。
- 読み取りやすい共有自律:動作によるロボットの信念の暗黙的伝達共有自律/意図伝達2026/6/1
共有自律システムにおいて、ロボットの動作を目標達成と意図の明確な表示の両方を満たすように設計し、ユーザーがロボットの信念を理解して制御を調整できるようにする。
- PokeVLA: 包括的な世界知識の指導によるポケットサイズの視覚言語行動モデルの強化VLA2026/4/1
この論文は、ロボット操作のための軽量な視覚言語行動モデルPokeVLAを提案し、2段階のトレーニングと新しいアクションエキスパートにより、LIBERO-Plusベンチマークと実世界で高い性能を達成した。
- VistaBot: 時空間認識ビュー合成による視点ロバストなロボット操作マニピュレーション2026/4/1
カメラ視点の変化にロバストなロボット操作を実現するため、幾何モデルとビデオ拡散モデルを統合したフレームワークVistaBotを提案。テスト時のカメラ校正不要で、シミュレーションと実世界で性能を検証した。
- Rhythm: 双ヒューマノイドのインタラクティブ全身制御学習全身制御2026/3/1
人間の動作データから2体のヒューマノイドが抱擁やダンスなどの全身協調動作を実機で行えるようにする統合フレームワークを提案。
- MeanFuser: MeanFlowによる高速ワンショット多様体軌道生成と適応的再構成を用いたエンドツーエンド自動運転自動運転/軌道生成2026/2/1
ガウス混合ノイズとMeanFlowを組み合わせ、離散アンカーに依存せず高速かつロバストに軌道を生成するエンドツーエンド自動運転手法を提案。
- その手の中の世界:実環境での人間中心マニピュレーション学習のための大規模オープンソースエコシステムマニピュレーション2025/12/1
実環境で収集した1000時間超の人間のマニピュレーションデータとウェアラブル収集キット、ベンチマークをオープンソースで提供し、ロボットのマニピュレーション成功率を8%から60%に向上させた。
- LiloDriver: ロングテール自動運転シーンにおける閉ループ運動計画のための生涯学習フレームワーク自動運転/運動計画2025/5/1
大規模言語モデルと記憶拡張型プランナ生成を組み合わせ、再学習なしで新たなロングテール走行シーンに適応する生涯学習型の閉ループ運動計画フレームワークを提案し、nuPlanベンチマークで有効性を示した。
- Afford-X: タスク指向操作のための汎化可能で軽量なアフォーダンス推論アフォーダンス推論2025/3/1
大規模データセットLVIS-Affを構築し、動詞注意と双方向融合モジュールを備えた軽量モデルAfford-Xを開発。非LLM手法を上回る性能を達成し、GPT-4Vより約50倍高速にアフォーダンス推論を行う。
- Bench4Merge: 実環境に近い高密度交通におけるマイクロインタラクティブ車両との合流のための包括的ベンチマーク自動運転/合流/ベンチマーク2024/10/1
高密度交通への合流を評価する閉ループベンチマークを提案し、他車両を大規模データで学習させて多様性を高め、LLMで合流性能を評価する。
- Dual-AEB: ルールベースとマルチモーダル大規模言語モデルを融合した緊急ブレーキシステム自動運転2024/10/1
マルチモーダル大規模言語モデルによるシーン理解と従来のルールベースAEBを組み合わせ、開放的な状況でも迅速に緊急ブレーキを判断できるシステムを提案した。
- OccLLaMA: 自動運転のための占有・言語・行動生成ワールドモデルVLA2024/9/1
意味的占有を視覚表現として用い、視覚・言語・行動を自己回帰モデルで統合した自動運転向け生成ワールドモデルを提案し、4D占有予測・運動計画・視覚質問応答で競争力のある性能を示した。
- PlanAgent: マルチモーダル大規模言語モデルによる閉ループ車両運動計画自動運転計画2024/6/1
マルチモーダルLLMを認知エージェントとして用い、BEV地図とテキスト記述から階層的推論でプランナコードを生成し、反省モジュールで評価する閉ループ車両運動計画システムを提案。nuPlanで評価。
- 構造光画像を用いた臨床における顔面位置合わせの新手法位置合わせ2024/5/1
構造光カメラとCT画像から顔の特徴点を抽出し、ICP法で粗位置合わせと精密位置合わせを行うことで、低誤差かつ短時間で顔面深度画像を位置合わせする手法を提案した。
- GaussianGrasper: オープンボキャブラリなロボット把持のための3D言語ガウシアンスプラッティングマニピュレーション2024/3/1
3Dガウシアンスプラッティングでシーンを明示的に表現し、言語埋め込みを蒸留することで、言語指示に基づくオープンボキャブラリな物体把持を実現した。
- City-scale Incremental Neural Mapping with Three-layer Sampling and Panoptic Representation2022/9/1
- LATITUDE: Robotic Global Localization with Truncated Dynamic Low-pass Filter in City-scale NeRF2022/9/1