Yuning Su
Zhiyuan Innovation (Shanghai) Technology Co., Ltd.
収録論文 5本 ・ フィジカルAI/ロボット学習
マニピュレーションVLA/操作VLAシーングラフ
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HEARTH: 温度を考慮したロボットマニピュレーションのための物体中心RGB-熱-3Dデータセットマニピュレーション2026/9/20
90物体のRGB・熱・3D形状を対応付けたデータセットを構築し、VLAモデルに熱情報を加えると温度依存の物体選択タスクの成功率が35%から75%に向上することを示した。
- TemporalFlow-VLA: 物理的に基づいた実行履歴を学習する長期的ロボット操作VLA/操作2026/8/27
視覚言語行動モデルに物理的な時間的監督を導入し、多段階操作の実行履歴をコンパクトに学習する手法を提案。LIBEROやRoboTwinで高い成功率を達成し、長期的な操作で優位性を示した。
- V-Link: アクションDiTにおける失われた視覚表現の回復による視覚-言語-行動モデルの強化VLA2026/8/26
VLAモデルのアクション専門家が視覚特徴を十分に活用できない問題を解決するため、VLM内に空間・意味クエリを学習し、非対称経路でAction DiTに注入するV-Linkを提案。ベンチマークで成功率を大幅に向上させた。
- OVIP-SG: 小さな細粒度オブジェクトのマッピングと検索のためのオープンボキャブラリ・インスタンス保存シーングラフシーングラフ2026/8/18
オープンボキャブラリ知覚を3Dシーングラフに統合する際のインスタンス断片化問題を解決し、小さなオブジェクトの保存と機能的なシーン分割、言語ガイドによる検索を実現する統一フレームワークを提案した。
- 多視点統一カメラ場:RGBのみの多カメラVLAポリシーのための幾何学的形状の行動指向表現VLA2026/8/1
多カメラ観測を利用するVLAモデルにおいて、視点間で一貫した行動指向の潜在場を形成する訓練時のみのフレームワークを提案し、深度復元と視点間対応を改善して操作成功率を大幅に向上させた。