Tong Zhang
University of Illinois Urbana-Champaign
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MotorMind: 汎用視覚言語モデルをゼロショットロボットマニピュレーションに活用するフレームワークマニピュレーション2026/9/29
汎用VLMが直接観察から行動を生成しフィードバックで適応するだけでロボット操作を実現するハーネスを提案し、専用学習や外部ツールなしでLIBERO-PROや実機xArm6で高い成功率を達成した。
- 行動は1パッチに値する:PatchWAMによる統合的世界-行動モデリングVLA2026/9/22
連続行動を固定マッピングでパッチとして表現し、専用の行動ヘッドや専門家なしに単一の生成モデルで視覚予測と行動生成を同時に行うPatchWAMを提案。LIBERO-Plusで91.8%、RoboTwin 2.0で96.12%の成功率を達成。
- StrucPhysVideo: 構造化キャプションとロボット行動から物理ダイナミクスを学習する動画世界モデル動画世界モデル2026/9/16
物体の動きや相互作用を記述した構造化キャプションとロボットの行動を条件として、物理的に妥当な動画を生成・予測する動画世界モデルを提案し、Physics-IQで最高性能を達成した。
- ResSafe: 残差強化学習によるヒューマノイドの安全フィルタリングヒューマノイド制御2026/9/14
ヒューマノイド制御において、タスク遂行ポリシーと安全補正ポリシーを分離し、残差強化学習で安全フィルタを学習する手法を提案。
- マルチモーダルメモリ圧縮による長期的身体化意思決定意思決定/ベンチマーク2026/8/2
長期的な身体化意思決定のためのベンチマークDunphyBenchを提案し、VLMエージェントの性能が人間に及ばないこと、メモリ管理がボトルネックであることを示した。さらに、ユーザー嗜好に基づいて情報を圧縮するMeMentoを設計し、精度向上とメモリ削減を実現した。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- Ego2Robot: 自己中心視点の人間データからのスケーラブルなロボットデータ合成VLA2026/8/1
自己中心視点の人間の操作動画を、行動リターゲティングとロボットアームの視覚合成、品質キュレーションを経てロボット訓練データに変換するスケーラブルなパイプラインを提案し、大規模データセットでVLAモデルの汎化性能を向上させた。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- OpenHLM:全身ヒューマノイド移動操作の実証的レシピVLA/全身制御2026/6/1
ヒューマノイドの全身協調動作を実現するため、言語と画像から全自由度を直接制御するVLAモデルの構築方法を体系的に研究し、実用的なレシピを提案した。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- ヒューマノイド操作インターフェース:ロボット不要の実演による全身操作全身操作2026/2/1
ポータブルな装着型デバイスで人間の全身動作を計測し、階層的な学習パイプラインを通じてヒューマノイドの多様な全身操作スキルを実環境で獲得するフレームワークを提案。
- AlignDrive: 横縦統合型エンドツーエンド自動運転プランニング自動運転プランニング2026/1/1
縦方向の計画を横方向の走行経路に条件付けたカスケード型フレームワークを提案し、経路に沿った1D変位予測として再定式化することで、速度決定とエージェント挙動の協調を改善した。
- 近接場通信と融合する身体性エッジ知能:概念・設計・検証VLA2025/8/1
大規模モデルをロボット近傍のエッジで動かす身体性エッジ知能と、超大規模アンテナアレイを用いる近接場通信を統合し、両者を協調最適化する枠組みを提案・検証した論文。
- 身体感覚のずれを克服する模倣学習のドメイン適応模倣学習2025/6/1
模倣学習において訓練時と実環境での固有感覚(proprioception)の分布ずれが性能を低下させる問題を特定し、Wasserstein距離に基づくノイズ付加で分布を整合させる手法を提案した。
- HuB: 極限ヒューマノイドバランスの学習ヒューマノイド制御2025/5/1
ヒューマノイドロボットが片足立ちや高蹴りなどの極限的なバランス課題を強化学習で獲得するための、参照動作修正・バランス認識方策学習・sim-to-realロバスト訓練を統合したフレームワークを提案。
- 局所性を活用したロボットマニピュレーションのサンプル効率向上マニピュレーション2024/6/1
ロボットの動作は対象物とその周辺環境に強く影響されるという「動作局所性」の帰納バイアスを導入し、模倣学習のサンプル効率を高めるフレームワークSGRv2を提案。シミュレーションと実環境で少ないデモンストレーションから高い成功率を達成した。
- DVMNet++: 未知物体に対する相対姿勢推定の再考姿勢推定2024/3/1
未知物体の相対姿勢を、正解バウンディングボックスや回転仮説に頼らず、画像特徴と言語理解による検出とボクセルマッチングで単一パスで推定する手法を提案。
- General Flow as Foundation Affordance for Scalable Robot Learning2024/1/1
- Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning2023/11/1
- Reinforcement Learning with Foundation Priors: Let the Embodied Agent Efficiently Learn on Its Own2023/10/1
- 3D-Aware Hypothesis & Verification for Generalizable Relative Object Pose Estimation2023/10/1
- MEDL-U: Uncertainty-aware 3D Automatic Annotation based on Evidential Deep Learning2023/9/1
- A Universal Semantic-Geometric Representation for Robotic Manipulation2023/6/1
- A Heuristic Autonomous Exploration Method Based on Environmental Information Gain During Quadrotor Flight2023/2/1
- End-to-end Learning for Inter-Vehicle Distance and Relative Velocity Estimation in ADAS with a Monocular Camera2020/6/1
- Modeling Varying Camera-IMU Time Offset in Optimization-Based Visual-Inertial Odometry2018/10/1