Tong He
Shanghai Innovation Institute
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AdvDex: 関節整合アクションと敵対的学習による人間のデモからの巧みな操作学習巧みな操作/VLA/身体間転移2026/8/14
人間とロボットのデモを統合したVLAフレームワークを提案し、関節整合アクション空間と敵対的学習により異なる身体間の汎化を実現した。
- プリミティブ身体性ワールドモデルの学習:スケーラブルなロボット学習に向けてワールドモデル2025/8/1
動画生成ベースの身体性ワールドモデルを固定短時間のプリミティブ動作に限定し、言語と動作の細粒度対応・データ効率・推論速度を改善するPEWMを提案。VLMプランナとヒートマップ誘導で閉ループ制御と長期タスクへの組合せ汎化を実現する。
- VQ-VLA:ベクトル量子化アクショントークナイザのスケーリングによる視覚-言語-行動モデルの改善VLA2025/7/1
大規模な行動軌跡データセットで学習したベクトル量子化アクショントークナイザを提案し、ゼロショットで多様なロボットタスクに適応可能で、長期的タスクの成功率を最大30%向上させた。
- CoMo: インターネット動画から連続潜在運動を学習するスケーラブルなロボット学習VLA2025/5/1
インターネット動画から連続的な潜在運動表現を教師なしで学習し、未知動画へのゼロショット汎化と擬似行動ラベル生成を可能にする手法CoMoを提案。
- Aether: 幾何学認識を統合した統一的世界モデリング世界モデル2025/3/1
4D動的再構成・行動条件付き動画予測・目標条件付き視覚計画を同時に学習する世界モデルを提案し、実世界データなしでもゼロショットで汎化できることを示した。
- Tra-MoE: 複数ドメインからの軌道予測モデル学習による適応的ポリシー条件付けVLA2024/11/1
スパースMoEアーキテクチャで任意点軌道を予測し、適応的ポリシー条件付けでロボット制御を改善する手法を提案。
- EMMA: 自動運転のためのエンドツーエンドマルチモーダルモデル自動運転2024/10/1
マルチモーダル大規模言語モデルを基盤に、カメラ映像から直接運転計画や物体検出、道路グラフを生成する自動運転モデルを提案し、複数タスクの同時学習で性能向上を実証した。
- SPA: 3D空間認識による効果的な身体性表現学習身体性表現学習2024/10/1
多視点画像への微分可能レンダリングでViTに3D空間理解を持たせ、8シミュレータ268タスクで既存手法を上回る身体性表現学習フレームワークを提案。
- DiffPano: 球面エピポーラ対応拡散によるスケーラブルで一貫性のあるテキストからのパノラマ生成生成モデル2024/10/1
大規模なパノラマ動画テキストデータセットを構築し、LoRAで微調整した単視点テキスト→パノラマ拡散モデルと球面エピポーラ対応の多視点拡散モデルを組み合わせ、未見のテキストとカメラポーズから一貫性のある多様な360度パノラマ画像を生成する手法を提案。
- STT: 自動運転のためのTransformerによる状態追跡追跡2024/5/1
Transformerを用いて物体の追跡と速度・加速度などの状態推定を同時に行うモデルSTTを提案し、Waymo Open Datasetでリアルタイム性能を達成した。
- 点群が鍵:ロボット学習における観測空間の影響の再考マニピュレーション2024/2/1
RGB・RGB-D・点群という3つの観測モダリティがロボット学習に与える影響を、2つのシミュレータと125タスクからなるベンチマークOBSBenchで比較し、点群ベースの手法が接触の多い操作タスクで優れた性能と汎化を示すことを明らかにした。
- LEF: Late-to-Early Temporal Fusion for LiDAR 3D Object Detection2023/9/1
- SAM: Squeeze-and-Mimic Networks for Conditional Visual Driving Policy Learning2019/12/1
- Focusing and Diffusion: Bidirectional Attentive Graph Convolutional Networks for Skeleton-based Action Recognition2019/12/1