Jiaolong Yang
Microsoft Research Asia
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- スパース直接ToFセンサからの高密度メトリック深度補完深度推定2026/8/5
直接ToFセンサのスパースでノイズの多い深度測定から、RGB画像を活用して高密度で正確なメトリック深度を推定するフレームワークを提案。多様なセンサタイプやスパース度に対応し、シミュレーションパイプラインで訓練データ不足を解決。
- 継続か再計画か?適応的実行期間のためのベルヌーイ継続方策学習VLA2026/8/1
固定長のアクションチャンクを実行するVLAモデルにおいて、再計画のタイミングをタスク進捗に応じて適応的に決める軽量フレームワークを提案し、成功率を向上させた。
- 大規模基盤モデル時代の手と物体のインタラクション:再構築、生成、身体化転移サーベイ2026/7/30
手と物体のインタラクション(HOI)モデリングにおける基盤モデルの活用を体系的にレビューし、幾何・意味・視覚の8つの事前知識に分類して、各タスクへの導入方法とロボット学習への応用を分析した論文。
- FM-VLA: 接触を伴う操作における視覚言語行動モデルのための力覚ベースメモリVLA/操作2026/7/1
視覚言語行動モデルに力覚履歴をメモリとして組み込み、非マルコフ的で接触を伴う操作タスクの時間的文脈推論を可能にした。
- LIBERO-Safety: 視覚言語行動モデルにおける物理的・意味的安全性の包括的ベンチマークVLA/安全性評価2026/6/1
VLAモデルの安全性を評価するため、パラメトリックな安全ベンチマークと大規模データセットを構築し、8つのVLAモデルと2つの基盤モデルの系統的評価を行った。
- DeformGen: 変形操作ポリシー学習のための動力学に基づくトポロジー拡張変形操作2026/6/1
変形物体の操作学習において、物理的に妥当な状態と軌道を生成する動力学ベースのデータ拡張フレームワークを提案した。
- 人間のビデオからロボット操作へ:人間中心データを用いたスケーラブルな視覚言語行動学習に関するサーベイVLA/サーベイ2026/6/1
ロボットのデモデータに頼らず、豊富な人間のビデオをVLAモデルの学習に活用する手法を4つのカテゴリに分類して整理し、未解決の課題と今後の研究方向を提示したサーベイ論文。
- MuseVLA: ロボット操作のための適応型マルチモーダルセンシング視覚言語行動モデルVLA2026/6/1
RGBカメラだけでは捉えられない温度や音、レーダーなどの多様なセンサ情報を、タスクに応じてツールのように選択・統合できる視覚言語行動モデルを提案した。
- TaskGround: 全シーン家庭内推論のための構造化実行可能タスク推論タスク推論2026/5/1
家庭内エージェントが完全なシーンと状況依頼から実行可能なタスク構造を推論するための、訓練不要でモデル非依存のフレームワークを提案し、新評価スイートFullHomeで効果を実証した。
- ProgressVLA: 進捗ガイド付き拡散ポリシーによる視覚言語ロボット操作VLA2026/3/1
ロボット操作のための視覚言語行動モデルに、タスク進捗の推定と微分可能な進捗ガイダンスを導入し、長期的なタスクでの成功率と汎化性能を向上させた。
- MobileManiBench:モバイルマニピュレーションのためのモデル検証を簡素化するベンチマークVLA2026/2/1
NVIDIA Isaac Simと強化学習を用いて、多様なモバイルマニピュレーション軌道を自動生成する大規模ベンチマークを構築し、代表的なVLAモデルの性能を評価した。
- VideoVLA:動画生成モデルを汎用ロボットマニピュレータに転換VLA2025/12/1
大規模動画生成モデルをロボットの視覚-言語-行動モデルに転換し、言語指示と画像から行動列と将来の視覚結果を同時予測することで、新規物体や他機体スキルへの汎化を実現した。
- HiMoE-VLA:汎用視覚言語行動ポリシーのための階層的Mixture-of-ExpertsVLA2025/12/1
異なるロボットの実演データを混ぜて学習する際の負の転移を防ぐため、行動空間ごとに特化する階層的MoE行動モジュールを提案し、CALVINやLIBERO、実機タスクで高い性能を達成した。
- 実生活の人間活動動画を用いたロボットマニピュレーション向け視覚-言語-行動モデルのスケーラブル事前学習VLA2025/10/1
人間の手の日常動画を自動解析してロボットのVLA学習データに変換し、100万エピソード規模のデータセットでモデルを事前学習することで、未知環境でのゼロショット性能と実機微調整時の成功率・汎化性能を向上させた。
- UniGraspTransformer:スケーラブルな器用把持のための簡素化された方策蒸留マニピュレーション2024/12/1
物体ごとに強化学習で把持方策を訓練し、それを単一のTransformerネットワークに蒸留することで、多様な物体・姿勢に対応する汎用器用把持を実現した研究。
- CogACT: 認知と行動を融合するロボット操作のための基盤的視覚-言語-行動モデルVLA2024/11/1
VLMの出力を条件とする専用の拡散行動トランスフォーマーを組み込んだ新しいVLAアーキテクチャを提案し、ロボット操作の成功率と汎化性能を大幅に向上させた。