Zhengzhong Tu
University of Texas at Austin
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AURORA: 自然言語駆動型エージェントフレームワークによる信頼性の高い空陸協調シミュレーションの理解・推論・オーケストレーションsim2real2026/9/17
自然言語から空陸協調シミュレーションシナリオを生成し、実行時検証と局所修復により要求された相互作用を忠実に実現するエージェントフレームワークを提案。
- SUMO: 非線形状態空間モデルによる任意の動きのセグメンテーションと追跡トラッキング/セグメンテーション2026/6/29
視覚的手がかりに依存せず、ロボティクス由来の非線形状態空間モデルと選択的アンセンテッドフィルタを用いて、ゼロショットで動物体のセグメンテーションと追跡を統合するフレームワークを提案した。
- 物理基盤のマルチエージェントダイナミクスベンチマーク:ワールドモデルにおけるワールドモデル2026/6/1
ワールドモデルの生成するマルチエージェント衝突シナリオの物理的妥当性を評価するフレームワークCrashTwinを提案し、既存モデルが視覚品質は高いが物理法則に反する挙動を示すことを明らかにした。
- NavTrust: 実世界環境における信頼性を評価する身体性ナビゲーションのベンチマークナビゲーション2026/3/1
RGB・深度・指示の現実的な劣化を体系的に与え、7つの最先端ナビゲーション手法の性能低下を明らかにし、4つの緩和策を評価した統一ベンチマークを提案。
- 実世界で基盤モデル搭載ロボットに必要なモジュール式セーフティガードレール安全性2026/2/1
基盤モデルを組み込んだロボットの安全性を行動・意思決定・人間中心の3次元で整理し、監視と介入からなるモジュール式ガードレールをアーキテクチャ基盤として提案する。
- VISTAv2: 屋内視覚言語ナビゲーションのための世界想像モデルVLA2025/12/1
過去の観測・行動候補・指示から未来の視点を生成し、オンライン価値マップとして計画に融合する世界モデルを提案。MP3DとRoboTHORで性能向上を実証。
- FORGE-Tree: 拡散強制と木探索による長期的ロボットマニピュレーションマニピュレーション2025/10/1
凍結したVLAエンコーダに拡散強制ヘッドとモンテカルロ木拡散を組み合わせ、軌道を局所的に修正しながら長期的な操作タスクの成功率を向上させる制御層を提案。
- 背景は消え、前景が導く:効率的な前景中心協調知覚のためのカリキュラム誘導背景枝刈り協調知覚2025/10/1
車両間で共有する特徴量を前景領域のみに絞りつつ、背景の文脈情報を前景特徴に内部化するカリキュラム学習戦略を提案し、帯域制約下での協調知覚性能を向上させた。
- SafeCoop: エージェント協調運転におけるフルスタック安全性の解明協調運転/安全性2025/10/1
自然言語ベースの協調運転における攻撃手法を分類し、セマンティックファイアウォールや多源合意を用いた防御パイプラインSafeCoopを提案・評価した。
- エッジ上のマルチモーダルセンサ融合と視覚言語モデルによる自動運転のリアルタイム事故回避VLA2025/8/1
軽量VLMを微調整し、インフラからの危険警告と車載センサデータを統合して安全な軌道を生成するエッジ向けフレームワークREACTを提案。DeepAccidentで衝突率77%削減、推論遅延0.57秒を達成。
- 自動運転車は自然言語で接続されるべきである協調運転2025/7/1
協調運転における既存の通信手段の限界を指摘し、意図や推論を自然言語で直接伝えることで、反応的な知覚データ共有から能動的な調整へと転換することを提唱した論文。
- DRAMA-X: 運転における細粒度意図予測とリスク推論のベンチマークリスク推論/意図予測2025/6/1
自動運転向けに、歩行者や自転車などの意図予測・リスク評価・行動提案を評価する細粒度ベンチマークDRAMA-Xを構築し、VLMベースのベースラインSGG-Intentを提案した。
- AirV2X: 空陸一体の車両間協調システムV2X2025/6/1
ドローンを路側機の代わりに使う車両間協調運転の大規模データセットAirV2X-Perceptionを構築し、車両対ドローンアルゴリズムの標準評価を可能にした。
- VISTA: 視覚と言語によるナビゲーションのための生成的視覚想像VLA2025/5/1
拡散モデルを用いて言語指示に基づく未来の視覚イメージを生成し、現在の観測と整合させながら行動を決定するVLNフレームワークを提案。R2RとRoboTHORで最高性能を達成。
- 自動運転のための生成AI:フロンティアと機会自動運転2025/5/1
生成AI(VAE・GAN・拡散モデル・LLM)を自動運転スタック全体にどう応用するかを体系的に整理したサーベイ。データ生成からEnd-to-End運転、デジタルツイン、評価・安全・規制まで課題と研究方向をまとめる。
- LangCoop: 言語による協調運転協調運転2025/4/1
自然言語を通信媒体として用いることで、通信帯域を大幅に削減しつつ協調自動運転を実現する新手法を提案した。
- UniOcc: 自動運転における占有予測・予測のための統合ベンチマーク占有予測2025/3/1
複数の実世界データセットとシミュレータを統合し、2D/3D占有ラベルとボクセル単位のフローを提供するベンチマークを構築。ラベル不要の評価指標を導入し、大規模多様データとフロー情報が占有予測性能を向上させることを示した。
- CoCMT: 協調知覚のための通信効率に優れたクロスモーダルトランスフォーマ協調知覚2025/3/1
物体クエリを選択的に共有するクロスモーダルトランスフォーマを提案し、協調知覚の通信量を大幅に削減しつつ検出精度を向上させた。
- PANDORA: 拡散ポリシー学習による器用なロボットピアノ演奏マニピュレーション2025/3/1
拡散モデルベースのポリシー学習とLLMによる音楽表現評価を組み合わせ、ロボットが精密かつ表現豊かにピアノを演奏できるフレームワークを提案した。
- STAMP: スケーラブルでタスク・モデル非依存な協調知覚協調知覚2025/1/1
異なるモデルを持つ複数エージェントのBEV特徴を軽量なアダプタで共通表現に変換し、効率的に共有・融合する協調知覚フレームワークを提案。
- AutoTrust: 自動運転向け大規模視覚言語モデルの信頼性ベンチマークVLA2024/12/1
自動運転向け視覚言語モデルの信頼性を、信憑性・安全性・堅牢性・プライバシー・公平性の観点から評価するベンチマークを構築し、6つのモデルを比較評価した。
- OpenEMMA: エンドツーエンド自動運転のためのオープンソースマルチモーダルモデル自動運転2024/12/1
マルチモーダル大規模言語モデルを活用し、Chain-of-Thought推論を組み込んだオープンソースのエンドツーエンド自動運転フレームワークを提案。