Ye Shi
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EmbodiRSI: データ効率の良いロボット適応のための再帰的自己改善sim2real2026/9/30
実環境からシミュレーションを構築し、失敗に基づく適応的データ収集と誤り訂正を繰り返すことで、少ない実機データでロボットマニピュレーション方策を効率的に適応させるシステムを提案。
- SelfWAM: 自己接地型統一ワールドアクションモデルによる高速ロボット制御VLA2026/8/1
ロボットの行動と将来の観測を同時に予測する統一モデルを提案し、行動条件付きの将来予測を自己マスクで接地することで、ポリシー学習の性能を向上させた。
- TactiDex: 人間らしい器用な操作のための実世界触覚誘導ベンチマーク器用操作/触覚2026/7/1
触覚信号を活用して、人間のデモンストレーションを物理的に妥当なロボット操作へ変換するフレームワークを提案し、触覚ベンチマークと報酬設計により操作の成功と物理的リアリズムを向上させた。
- ViTacWorld: 接触の多いロボット操作のための視覚-触覚ワールドモデルのスケーリング操作2026/7/1
実データとシミュレーションを組み合わせて視覚・触覚・動作データを大規模に収集し、動作条件付きで視覚と触覚のフィードバックを予測するワールドモデルを構築。これにより接触の多い操作タスクのポリシー改善と評価を実現する。
- GenPO++: ヤコビアンフリー尤度比を用いた生成的方策最適化強化学習2026/6/5
フローベースの生成的方策を強化学習に適用する際、実行アクションの確率評価が難しい問題を、高次可逆ODEソルバーと履歴状態を利用して正確かつヤコビアンフリーな尤度比計算を実現する枠組みを提案した。大規模シミュレーションや実ロボット操作タスクで優れた性能を示した。
- 生成的強化学習を安定したロボット制御へ導く強化学習/制御2026/6/1
拡散・フローベースの生成的方策を学習し、その確率的な潜在変数サンプリングを決定的な潜在アクターに置き換えることで、探索と制御を分離し、安定かつ高精度なロボット制御を実現するフレームワークを提案した。
- 批判者ガイダンスによるサンプル効率的な拡散ベース強化学習強化学習2026/5/1
拡散ポリシーを用いた強化学習において、探索と活用のバランスを改善するため、訓練不要のガイダンス技術を拡散過程に統合し、批判者ネットワークが高価値と判断する領域へ行動生成を誘導する手法CGPOを提案した。MuJoCoの5つのタスクで最先端の性能を達成した。
- UniHM: 視覚言語モデルによる統合器用手操作器用操作/VLA2026/3/1
自由形式の言語指示に基づいて物理的に実現可能な器用な手の操作を生成する統合フレームワークを提案。異なる手の形態を共通コードブックにマッピングし、人間の物体操作データのみで学習することで、実世界の遠隔操作データなしに汎用性の高い操作シーケンスを生成する。
- 拡張可能なロボット制御のためのオンライン拡散方策強化学習アルゴリズムのレビュー拡散方策/強化学習2026/1/1
拡散方策とオンライン強化学習を組み合わせたアルゴリズムを4系統に分類し、12タスクで性能を比較評価した初の体系的レビュー。
- マルチタスクロボットマニピュレーションのための意味的原子スキル学習マニピュレーション2025/12/1
実演から意味的に整合した原子スキル空間を学習し、キーポーズ想像により長期的なタスク実行を可能にするフレームワークAtomSkillを提案。
- 自由形式の言語でヒューマノイドを操作する:統一動作語彙を持つ大規模言語行動モデルVLA2025/11/1
自然言語コマンドをヒューマノイドの全身動作に直接変換する大規模言語行動モデルHumanoid-LLAを提案し、人間とヒューマノイドの動作語彙を統合して物理的安定性を確保した。
- 探索より理解を:未知環境における球状テンセグリティロボットのための意味的経路計画エージェント経路計画2025/11/1
LLMを活用し、未知環境でのテンセグリティロボットの経路計画を意味的推論タスクとして再構築したSATPlannerを提案。適応的観測窓で探索効率と計画の堅牢性を両立させる。
- 没入型ヒューマン-Xインタラクションに向けて:物理的に妥当な動作合成のためのリアルタイムフレームワークヒューマンロボットインタラクション2025/8/1
人間とアバター・ヒューマノイド・ロボットの相互作用をリアルタイムに物理的に妥当に合成するフレームワークHuman-Xを提案。自己回帰的反応拡散プランナと強化学習による動作追従ポリシーを統合し、VR/ロボット協調に応用。
- FreqPolicy: 連続トークンによる周波数自己回帰型視覚運動ポリシーマニピュレーション2025/6/1
動作を周波数領域で表現し、低周波から高周波へ段階的に自己回帰生成する連続トークン型の視覚運動ポリシーを提案。2D/3D操作ベンチマークで精度と効率を両立。
- GenPO: 拡散生成モデルとオンポリシー強化学習の融合VLA2025/5/24
拡散ポリシーをPPOなどのオンポリシーRLに組み込むため、正確な拡散反転と二重ダミー行動機構で対数尤度計算を可能にした生成ポリシー最適化フレームワークを提案。
- DreamPolicy:スケーラブルなヒューマノイド歩行のための統合ワールドモデルポリシー歩行2025/5/1
拡散ベースの地形認識ワールドモデルとオフラインデータを統合し、単一のポリシーで未知の複合地形へのゼロショット転移を実現したヒューマノイド歩行フレームワーク。
- AffordDP: 転移可能なアフォーダンスによる汎化可能な拡散ポリシーマニピュレーション2024/12/1
物体の操作箇所と動作軌道を表すアフォーダンスを基礎モデルと点群位置合わせで未知物体に転移し、拡散サンプリング時の誘導に用いることで、未見カテゴリへの操作汎化を実現した。