Xiaoshen Han
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SplineWAM: Bスプライン表現によるワールドアクションモデルの適応的行動ホライズンVLA2026/9/30
行動軌道を3次Bスプラインで圧縮し、動作の複雑さに応じて行動チャンクの時間解像度と長さを適応的に変えるワールドアクションモデルを提案。推論呼び出しを削減しつつ成功率を向上させた。
- 視覚言語行動ポリシーのためのアドバンテージ誘導事後学習の分解VLA2026/9/23
視覚言語行動ポリシーの事後学習において、アドバンテージ誘導強化学習の設計選択を分解し、段階的評価で有効なモジュール式レシピを特定した。
- ロボット計画のための構造化4D潜在予測モデル計画/ビデオ予測2026/7/1
ロボットの計画に使うため、観測とテキスト指示に基づいてシーンの3D構造の進化を潜在空間で予測するモデルを提案し、将来のシーンを生成して行動に変換する。
- Bスプライン方策:Bスプライン行動表現による操作方策の高速化マニピュレーション2026/7/1
離散時刻の行動チャンクの代わりにBスプライン曲線で行動を表現し、操作方策の実行を高速化する手法を提案した論文。
- 視覚運動ポリシー学習のための順序付きアクショントークンVLA2026/7/1
ロボットの連続的なアクションを離散トークンに変換する際、高圧縮・完全復号可能・順序性を満たす新しいトークナイザーOATを提案し、複数のベンチマークで有効性を示した。
- CoStream: 単純な行動の合成による汎用的な複雑操作の実現マニピュレーション2026/6/1
複雑な操作タスクを、基盤モデルと多様なセンシングを組み合わせた複数の単純な行動(意味的・予測的・反応的)に分解し、それらをSE(3)インターフェース上で合成することで、高精度と汎用性を両立するフレームワークを提案した。
- 順序付き行動トークン化(OAT)VLA2026/2/1
連続的なロボット行動を、自己回帰生成に適した順序付きトークン列に変換する学習型トークナイザを提案し、シミュレーションと実機の20以上のタスクで従来手法を上回る性能と推論時の柔軟性を示した。
- シミュレーションと同じ操作を実現:ロボットにおける正確な幾何認識の実現sim2real2025/9/1
深度カメラのノイズを除去して正確なメートル深度を推定するCamera Depth Models(CDMs)を提案し、シミュレーションで訓練した方策を実世界ロボットにそのまま適用可能にした。
- RoboGround: 接地視覚言語事前知識を用いたロボットマニピュレーションマニピュレーション2025/4/1
視覚言語モデルによるグラウンディングマスクを中間表現として用い、対象物の位置・形状情報を政策ネットワークに与えることで汎化性能を高めるロボット操作システムを提案。大規模シミュレーションデータ生成パイプラインも構築した。
- Re$^3$Sim: 3DフォトリアルなReal-to-Simによる高忠実度シミュレーションデータ生成sim2real2025/2/1
実世界の3D再構成とニューラルレンダリングでフォトリアルなシミュレーション環境を構築し、模倣学習でロボット操作方策を訓練、ゼロショットで実機転移を実現した研究。