Tao Xu
収録論文 8本 ・ フィジカルAI/ロボット学習
ベンチマークVLA/操作データキュレーション自動運転/VLA模倣学習移動ロボットナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboChrono:ストリーミングタスク理解のための実ロボットベンチマークベンチマーク2026/9/29
実ロボットと人手の記録からなる39シナリオ・34,713件のベンチマークを構築し、18の視覚言語モデルのゼロショット性能を評価して、視覚照合と時間順序理解の能力差を明らかにした。
- UniviewVLA:世界モデリングを備えた統合マルチビュー視覚言語行動モデルVLA/操作2026/6/1
標準的な2つのカメラ観測のみから、世界モデルを用いてマルチビューの未来シーンを生成し、遮蔽された情報を補完して行動予測を改善するVLAモデルを提案。推論高速化のためのトークン圧縮と、動的な視点選択手法も導入。
- ATHENA: ロボットデータキュレーションのための高速マルチタスク異種影響関数データキュレーション2026/6/1
大規模VLAモデルの模倣学習において、各デモの影響を高速に計算する影響関数フレームワークATHENAを提案し、50%のデータで全データ学習と同等以上の性能を達成した。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- 効率的な視覚運動学習のためのL1サンプルフロー模倣学習2025/11/1
フローマッチングの多峰性を保ちつつ、L1回帰の効率性を活かすため、2ステップでサンプリングするL1 Flowを提案し、模倣学習ベンチマークで有効性を示した。
- Astra:階層型マルチモーダル学習による汎用移動ロボットの実現移動ロボットナビゲーション2025/6/1
マルチモーダルLLMとマルチタスクネットワークを組み合わせた二重モデルアーキテクチャにより、多様な屋内環境で移動ロボットのナビゲーションを実現した。
- Autonomous object harvesting using synchronized optoelectronic microrobots2021/3/1
- Asymmetric self-play for automatic goal discovery in robotic manipulation2021/1/1