Junjie He
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GaussianDream++: ロボット操作のための効率的な3Dガウス世界モデリングVLA/3Dガウス/世界モデル2026/8/26
VLAポリシーに世界状態トークンと世界予測トークンを挿入し、訓練時のみ3Dガウス表現で現在と未来の世界を監督することで、推論時の追加コストなしに操作性能を向上させる手法を提案。
- SoftVTBench: 変形を考慮した視覚触覚データセットと変形物体操作のベンチマーク変形物体操作/データセット/ベンチマーク2026/8/19
変形物体操作の物理的相互作用品質を評価するため、視覚触覚データセットと閉ループベンチマークを構築し、変形許容度を考慮した成功率を提案した。
- MobileWAM: 世界行動モデルをチェーン・オブ・フォーサイトで移動操作に橋渡しする移動操作2026/8/5
移動操作のための世界行動モデルを提案し、事前学習済みのビデオ拡散トランスフォーマーと軽量な行動エキスパートを融合させ、移動と操作の異種ダイナミクスを扱う。また、中間表現が未来の潜在チャンクを逐次予測するCoFを導入し、実機でも高い性能を示した。
- SG-WAM: テキスト接地と空間認識を備えた意味的ガイダンスによるワールドアクションモデルVLA2026/8/1
ロボット操作のためのワールドアクションモデルに、VLMを意味プランナーとして用いてテキスト指示に基づく意味的先見を注入し、将来ビデオ生成と行動予測の指示追従精度を向上させる手法を提案した。
- 前方予測だけで十分か?JEPAワールドモデルのための物理状態接地ワールドモデル2026/8/1
JEPAベースのワールドモデルに、ロボットの自己受容状態と関節角変化を接地する2つの目的を追加し、潜在表現の識別性と下流タスク性能を向上させる手法を提案した。
- 4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入VLA2026/8/1
ロボットの行動生成と動画予測を統合する世界行動モデルに対し、3D軌跡フィールドからの時空間知識を表現整合で注入する訓練戦略を提案し、空間理解と実行精度を向上させた。
- DyPES-VLA: 共有ダイナミクス事前知識と身体固有制御の学習によるクロス身体操作VLA/クロス身体操作2026/8/1
異なるロボット身体間で共有できるダイナミクス事前知識を学習し、身体固有の行動空間で直接制御を出力するVLAモデルを提案。シミュレーションと実機で最高性能を達成した。
- Robust-WAM:生成事前学習と意味的先見を橋渡しするワールドアクションモデルVLA2026/8/1
ビデオ生成モデルの事前学習を活かしつつ、意味的潜在空間での先見アライメントを追加することで、見た目の変化に頑健なロボット制御を実現するポストトレーニング手法を提案した。
- SoftVTBench: 物理的制約下での変形物体操作のための安全性を考慮した視覚触覚ベンチマークベンチマーク/変形物体操作/触覚2026/7/1
変形物体の操作において、タスク完了だけでなく物理的安全性(落下や過度な変形の回避)を評価するベンチマークを提案し、触覚センシングが安全性向上に寄与することを示した。
- VLA-OPD: オフラインSFTとオンラインRLを架橋する、オンポリシー蒸留による視覚言語行動モデルVLA/強化学習/蒸留2026/3/1
視覚言語行動モデルの事後学習において、オフラインSFTの分布ずれや破滅的忘却と、オンラインRLのスパース報酬や非効率性を解決するため、専門家教師による密なトークンレベル監督を学生の自己生成軌道に適用し、Reverse-KL目的で安定した学習を実現するフレームワークを提案した。
- DualCoT-VLA: 視覚と言語の連鎖的推論を並列化した視覚言語行動モデルVLA2026/3/1
複雑なタスクで苦戦するVLAモデルに対し、視覚的CoTと言語的CoTを並列に統合し、推論遅延を減らして高性能を実現した。
- S-VAM: 幾何学的・意味的先読みの自己蒸留によるショートカット動画行動モデルロボット学習/VLA2026/3/1
動画行動モデル(VAM)の推論速度と先読み精度のトレードオフを解決するため、単一パスで幾何・意味表現を予測するショートカットモデルS-VAMを提案。多段階拡散の生成事前知識を一段階推論に凝縮する自己蒸留戦略を導入し、シミュレーションと実世界で高性能を実証した。
- LIV-GaussMap: LiDAR-Inertial-Visual Fusion for Real-time 3D Radiance Field Map Rendering2024/1/1