Heng Tao Shen
Tongji University
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Spotter: 身体性モデルを主導させ、VLMに内省させるVLA2026/9/29
身体性モデルが連続実行を主導し、VLMが並行して監視・エラー検出時のみ介入して内省・修正する枠組みを提案し、RoboCasaやRoboTwin 2.0で成功率を改善した。
- GeoAAC: VLAポリシーのノイズ除去軌道の幾何に基づく適応的アクションチャンキングVLA2026/9/17
フローベースVLAポリシーにおいて、ノイズ除去軌道の幾何情報から予測信頼性を推定し、追加学習なしでアクションホライズンを適応的に決定する手法を提案。シミュレーションと実機で成功率を改善。
- WSA$_1$: 3D中心の世界・空間・行動モデルによる汎用ロボット制御ロボット基盤モデル2026/7/1
ロボット基盤モデルに3D世界の物理ダイナミクスと行動の因果関係を学習させる新しいパラダイムを提案し、少ない実データで高い汎化性能を実現した。
- ドリフト対応ポストトレーニング量子化による効率的な視覚言語行動モデルVLA/量子化2026/4/1
視覚言語行動モデル(VLA)の量子化時に生じる時間的誤差蓄積による動作ドリフトを解決するため、ドリフト対応PTQ(DA-PTQ)を提案。クロススペース表現補償と動作駆動混合精度割り当てにより、低ビットでも高精度な制御を実現。
- キーフレーム連鎖による非マルコフ的長期間ロボット操作マニピュレーション2026/3/1
長期的な依存関係を持つ操作タスク向けに、過去の重要なフレームを自動選択・連鎖させてVLAモデルに組み込むフレームワークを提案し、シミュレーションで有効性を示した。
- 言語基盤の分離型行動表現によるロボット操作マニピュレーション2026/3/1
自然言語を意味的ブリッジとして用い、翻訳・回転・グリッパー制御という3つの解釈可能な行動プリミティブを導入し、対照学習と模倣学習を組み合わせて汎化性能を高めるロボット操作フレームワークを提案した。
- MOTIF: 少数ショットでの異なる身体間転送のための行動モチーフ学習VLA2026/2/1
異なるロボット身体間での少数ショット転送を可能にするため、身体に依存しない時空間パターン(行動モチーフ)をベクトル量子化で抽出し、フローマッチング方策を導く軽量予測器を設計した手法。
- 多数派を超えて:ロボットマニピュレーションのためのロングテール模倣学習マニピュレーション2026/2/1
訓練データが一部のタスクに偏るロングテール問題に対し、データ豊富なタスクからデータ希少なタスクへ知識を転移するApproaching-Phase Augmentationを提案し、ロボット操作の性能を改善した。
- 自己修正VLA:スパースな世界想像によるオンライン行動洗練VLA2026/2/1
VLAモデルに将来予測ヘッドを追加し、予測したスパースな未来状態に基づいて報酬を再形成することで、オンラインで行動を自己修正する手法を提案。シミュレーションと実機で成功率と効率が向上。
- シミュレーションと人間の協調学習によるデータ効率的で汎化可能なロボットマニピュレーションマニピュレーション2026/1/1
シミュレーションのロボット動作と実世界の人間観察を同時に活用する協調学習フレームワークSimHumを提案し、少ない実データで汎化性能の高いマニピュレーションを実現した。
- MiVLA: 人間とロボットの相互模倣事前学習による汎化可能な視覚-言語-行動モデルVLA2025/12/1
人間の手とロボットアームの動作類似性を利用し、人間とロボットの行動空間を双方向に整列させる相互模倣事前学習でVLAを訓練し、汎化性能を向上させた研究。
- ワールドモデルへの第一歩:ロボットマニピュレーションに関するサーベイマニピュレーション2025/11/1
ロボットマニピュレーションにおけるワールドモデルの役割を整理し、知覚・予測・制御の観点から中核能力と課題を分析したサーベイ。
- BLM₁:デジタルと物理を横断する汎用大規模モデルVLA2025/10/1
デジタル空間と物理空間、異なるタスクやロボット身体をまたいで動作する統合型マルチモーダル基盤モデルBLM₁を提案し、2段階学習で身体性知識と制御を両立させた。
- 効率的な視覚-言語-行動モデルのサーベイVLA2025/10/1
視覚-言語-行動モデル(VLA)の効率化に関する初の包括的サーベイであり、モデル設計・学習・データ収集の3つの柱で既存研究を整理し、課題と今後の方向性を示す。
- 悪天候下での汎化レンジビューLiDARセグメンテーションに向けてLiDARセグメンテーション2025/6/1
悪天候時のレンジビューLiDARセグメンテーションの汎化性能を分析し、幾何ノイズ抑制と反射歪み補正を組み込んだ軽量フレームワークを提案。
- ロボット基盤モデルのためのポリシー対比デコーディングVLA2025/5/1
ロボット基盤モデルが学習する偽の相関を、物体マスク画像との行動確率分布の対比により訓練なしで補正し、汎化性能を向上させる手法を提案。
- InSpire: 内在的空間推論を備えた視覚-言語-行動モデルVLA2025/5/1
VLAモデルに「物体はロボットから見てどの方向か」という空間推論を組み込むことで、タスク無関係な視覚特徴への誤相関を抑え、汎化性能を高める手法を提案。