Weiliang Tang
収録論文 7本 ・ フィジカルAI/ロボット学習
ヒューマノイド操作/VLA/強化学習マニピュレーションVLA行動計画
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ROVE: 強化学習によるヒューマノイド操作のための人間介入の活用ヒューマノイド操作/VLA/強化学習2026/6/15
不完全な人間介入データを用いてヒューマノイドVLAモデルを強化学習で訓練するフレームワークROVEを提案。楽観的価値推定とクロスエンボディ映像を活用し、高価値な行動を優先学習することで実世界の接触を伴う操作タスクで性能を向上させた。
- 受動的観察者から能動的批評家へ:強化学習がロボット操作のプロセス推論を引き出すマニピュレーション2026/3/1
ビデオMLLMを受動的な観察者から能動的な批評家へと変えるため、結果ベースの強化学習を用いてプロセス推論を誘発する7BフレームワークPRIMO R1を提案し、長期的ロボット操作の進捗監視性能を大幅に向上させた。
- アクションチャンキングにおける地平線の混合VLA2025/11/1
VLAモデルで問題となる行動チャンク長(地平線)のトレードオフを解消するため、異なる地平線のセグメントを並列処理して統合するMixture of Horizons戦略を提案し、性能と汎化性を向上させた。
- VLMベースロボットマニピュレーションのための中間表現の再考マニピュレーション2025/11/1
VLMが理解しやすく汎用性の高い中間表現SEAMを提案し、語彙と文法に分解することで多様な未見タスクに対応。さらに検索拡張少数ショット学習による開放語彙セグメンテーションを設計し、実世界実験でSOTA性能を示した。
- GeoManip: ロボット操作のための汎用インターフェースとしての幾何制約マニピュレーション2025/1/1
物体や部位の関係から得られる幾何制約を言語表現を介して解釈し、訓練なしで多様な操作タスクを実行するフレームワークを提案。
- Moto: 動画からロボット操作を学習するための橋渡し言語としての潜在モーショントークンVLA2024/12/1
動画を潜在モーショントークン列に変換し、自己回帰的に事前学習することで、ロボット操作に転移可能な運動知識を獲得する手法を提案。
- 物体部分シーンフローによる具現化非依存の行動計画行動計画2024/9/1
対象物体の部分運動を3Dシーンフローとして予測し、その変換から多様なロボットの行動軌道を生成する具現化非依存の手法を提案。