Hang Yin
KTH Royal Institute of Technology
収録論文 32本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 行動表現の方向・スケール分解:VLAモデルで何をトークン化すべきかの再考VLA2026/9/24
VLAモデルの行動トークン化において、並進・回転の増分を方向とスケールに分解するDSD表現を提案し、シミュレーションと実機で成功率の向上を実証した。
- ARCGym: 自律ロボット大腸内視鏡ナビゲーションにおける深層強化学習のベンチマーク医療ロボティクス2026/9/19
臨床由来の変形可能な大腸解剖モデルで、カプセルロボットや柔軟内視鏡による画像ベース自律ナビゲーションを学習・評価するオープンソース強化学習環境ARCGymを提案し、複数のタスクとロボットで性能を比較した。
- 基盤モデルを物理世界エージェントに組み込むことで長期的ナビゲーションの限界を押し広げるナビゲーション2026/8/31
VLMによる推論エージェントとナビゲーション基盤モデルを組み合わせたフレームワークNavMCPを提案し、長期的な探索タスクで高い性能を達成した。
- MANIGUARD: 仕様に基づく安全性評価とロボット操作改善のためのベンチマークとデータセット安全性評価/操作2026/8/18
ロボット操作の基盤モデルの安全性を評価・改善するための、仕様に基づくフレームワークとベンチマーク、データセットを提案した論文。
- SimFoundry: ポリシー学習と評価のためのモジュール式自動シーン生成sim2real2026/6/1
実世界のビデオからシミュレーション用のシーンを自動生成し、多様なバリエーションを作成してロボットポリシーの訓練と評価を行うシステムを提案。シミュレーションでの評価が実世界性能を強く予測し、訓練時のバリエーション追加が成功率を向上させることを示した。
- AllDayNav: 実世界強化学習による生涯ナビゲーションナビゲーション2026/6/1
動的環境での生涯ナビゲーションのために、明示的な地図やシーングラフを使わず、大規模モデルに強化学習でシーン動態を暗黙的に符号化し、自己進化するマルチモーダルメモリで長期動作を実現するフレームワークを提案した。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- AwareVLN: 自己認識による視覚言語ナビゲーションの推論VLA2026/5/1
視覚と言語によるナビゲーションにおいて、エージェントの状態とタスクの進捗を理解する自己認識推論機構を導入し、エンドツーエンドで高性能なナビゲーションを実現した。
- CMP: 能力多様体投影による移動操作の堅牢な全身追従移動操作2026/4/1
脚式移動マニピュレータの全身制御において、センサノイズや非現実的なユーザーコマンドによる分布外入力への堅牢性を高めるため、能力多様体投影(CMP)を提案した。
- F2F-AP: フローから未来への非同期ポリシーによるリアルタイム動的マニピュレーションマニピュレーション2026/4/1
非同期推論の遅延問題を解決するため、物体のフロー予測を用いて未来の観測を合成し、視覚特徴を整合させることで、動的環境での操作を先読みして実行するフレームワークを提案した。
- ENACT: 自己中心的なインタラクションの世界モデリングによる身体性認知の評価身体性認知/ベンチマーク2025/11/1
ロボティクスシミュレーションから生成した自己中心視点の行動と観測の系列並べ替えタスクにより、視覚言語モデルが身体性認知の能力(アフォーダンス認識、行動効果推論など)をどの程度持つかを評価するベンチマークを提案。
- MoMaGen: ソフト・ハード制約下で多段階両腕移動マニピュレーションのデモを生成sim2real2025/10/1
移動ベースと両腕の多段階タスク向けに、到達可能性などのハード制約と視認性などのソフト制約を満たすデータ生成を制約付き最適化として定式化し、多様なデモを自動生成する手法を提案。
- GC-VLN: グラフ制約としての指示による学習不要の視覚言語ナビゲーションVLA2025/9/1
人間の指示を空間制約の有向非巡回グラフに分解し、制約ソルバで経路を解くことで、学習なしに連続環境でロボットをナビゲートするフレームワークを提案した。
- MoTo: 汎用モバイルマニピュレーションのためのゼロショット・プラグイン型インタラクション認識ナビゲーションモバイルマニピュレーション2025/9/1
固定ベースのマニピュレーション基盤モデルにプラグインするだけで、VLMと軌道最適化によりゼロショットで移動マニピュレーションを実現する手法を提案。
- 拡散ポリシーのためのリアルタイム反復スキームVLA2025/8/1
最適制御のリアルタイム反復法を応用し、前時刻の解を初期値に使うことで拡散ポリシーの推論を高速化する手法を提案。蒸留や再設計なしで大規模モデルにも適用可能。
- IGL-Nav: 画像ゴールナビゲーションのためのインクリメンタル3Dガウシアンローカリゼーションナビゲーション2025/8/1
3Dガウシアンスプラッティングを用いて、探索中に逐次更新されるシーン表現からゴール画像の位置を粗く特定し、近づくと微分可能レンダリングで精密化する画像ゴールナビゲーション手法を提案。
- BEHAVIORロボットスイート:日常家事のための実世界全身マニピュレーションを効率化全身マニピュレーション2025/3/1
両腕・車輪・4自由度胴体を備えたロボットで、全身遠隔操作インターフェースと視覚運動ポリシー学習アルゴリズムを統合し、家庭内の全身マニピュレーションタスクを実現するフレームワークを提案。
- UniGoal: 汎用的なゼロショット目標指向ナビゲーションに向けてナビゲーション2025/3/1
異なる種類の目標を統一的なグラフ表現で扱い、LLMによるグラフ推論でゼロショット目標指向ナビゲーションを実現するフレームワークを提案。
- SG-Nav: 3Dシーングラフを用いたLLMベースのゼロショット物体ナビゲーションナビゲーション2024/10/1
観測した環境を3Dシーングラフで表現し、LLMに階層的な思考プロンプトを与えることで、ゼロショット物体ナビゲーションを高精度かつ説明可能に実現した研究。
- 布マニピュレーション研究の展開:レビュー布マニピュレーション2024/7/1
布や衣類のロボット操作に関する研究を、モデリング・知覚・ベンチマーク・操作の観点から整理し、布の多様性への対応度を分析して今後の課題を示したレビュー論文。
- 未知環境における身体性指示追従VLA2024/6/1
マルチモーダル大規模言語モデルを用いた階層的フレームワークにより、未知環境を探索しながら複雑な人間の指示を実行する身体性エージェントを実現した。
- 変形可能物体操作のための対話的知覚変形物体操作2024/3/1
能動カメラとマニピュレータを協調させ、動的能動視覚空間(DAVS)を用いて変形物体の知覚と操作を同時に行う逐次意思決定フレームワークを提案し、シミュレーションと実機で有効性を検証した。
- BEHAVIOR-1K:1000の日常活動とリアルなシミュレーションによる人間中心の身体性AIベンチマークsim2real2024/3/1
人間がロボットにやってほしいと望む1000の日常活動を、50のシーンと9000以上の物体を含む物理シミュレーション環境OMNIGIBSONで再現し、実世界への転移も検証したベンチマークを提案した。
- Controllable Motion Synthesis and Reconstruction with Autoregressive Diffusion Models2023/4/3
- Back to the Manifold: Recovering from Out-of-Distribution States2022/7/1
- Graph-based Task-specific Prediction Models for Interactions between Deformable and Rigid Objects2021/3/1
- Learning Deep Energy Shaping Policies for Stability-Guaranteed Manipulation2021/3/1
- Enabling Visual Action Planning for Object Manipulation through Latent Space Roadmap2021/3/1
- Learning Stable Normalizing-Flow Control for Robotic Manipulation2020/11/1
- Stability-Guaranteed Reinforcement Learning for Contact-rich Manipulation2020/4/1
- Latent Space Roadmap for Visual Action Planning of Deformable and Rigid Object Manipulation2020/3/1
- Data-efficient Model Learning and Prediction for Contact-rich Manipulation Tasks2019/9/1