Tianran Zhang
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 6本 ・ フィジカルAI/ロボット学習
マニピュレーションVLAワールドモデルVLA/クロス身体操作VLA/強化学習/蒸留
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SafeLoop: 視覚言語行動マニピュレーションのためのリスク認識ロールバックマニピュレーション2026/9/22
VLAモデルのパラメータを変えずに外部ラッパーとして危険予測とロールバック復帰を追加し、衝突や物体落下を約70%削減しつつタスク成功率を維持する手法を提案。
- SG-WAM: テキスト接地と空間認識を備えた意味的ガイダンスによるワールドアクションモデルVLA2026/8/1
ロボット操作のためのワールドアクションモデルに、VLMを意味プランナーとして用いてテキスト指示に基づく意味的先見を注入し、将来ビデオ生成と行動予測の指示追従精度を向上させる手法を提案した。
- 前方予測だけで十分か?JEPAワールドモデルのための物理状態接地ワールドモデル2026/8/1
JEPAベースのワールドモデルに、ロボットの自己受容状態と関節角変化を接地する2つの目的を追加し、潜在表現の識別性と下流タスク性能を向上させる手法を提案した。
- DyPES-VLA: 共有ダイナミクス事前知識と身体固有制御の学習によるクロス身体操作VLA/クロス身体操作2026/8/1
異なるロボット身体間で共有できるダイナミクス事前知識を学習し、身体固有の行動空間で直接制御を出力するVLAモデルを提案。シミュレーションと実機で最高性能を達成した。
- VLA-OPD: オフラインSFTとオンラインRLを架橋する、オンポリシー蒸留による視覚言語行動モデルVLA/強化学習/蒸留2026/3/1
視覚言語行動モデルの事後学習において、オフラインSFTの分布ずれや破滅的忘却と、オンラインRLのスパース報酬や非効率性を解決するため、専門家教師による密なトークンレベル監督を学生の自己生成軌道に適用し、Reverse-KL目的で安定した学習を実現するフレームワークを提案した。
- FlowVLA: 視覚的思考連鎖による動作推論を用いた視覚-言語-行動モデルVLA2025/8/1
未来フレーム予測の前にオプティカルフローで動作を推論するVisual CoTを導入し、物理的に妥当な予測と高効率なロボット操作を実現した。