Chuan Wen
収録論文 33本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 人間の実演からの視覚・触覚・行動の統合モデリングによる巧みなマニピュレーションマニピュレーション2026/9/28
人間の触覚データを活用し、視覚・触覚・行動を統合的に学習するモデルを構築して、巧みなロボットマニピュレーションの性能を向上させた。
- Triplet2Track: オブジェクト中心表現を用いた信頼性の高い長期的操作のための階層システム操作学習2026/8/24
長期的なロボット操作の信頼性を高めるため、人間の動画を活用し、高レベルのサブゴールをインスタンスに基づくトリプレットとして表現し、実行とオンライン再計画を行う閉ループ模倣学習システムを提案した。
- AnyDexRT: 較正不要で数回の人間ガイダンスによる器用な手のリターゲティング遠隔操作/リターゲティング2026/7/1
AnyDexRTは、人間の手の動きをロボットハンドにマッピングする際に、較正や手動調整を不要にし、数回の人間の指示で直感的な遠隔操作を実現する手法を提案した。
- FA-RDP: 接触を伴う操作のための周波数適応型リアクティブ拡散ポリシーマニピュレーション2026/7/1
接触前後の異なるフェーズで必要とされる動作の多様性と反応性のトレードオフを解決するため、周波数適応型の拡散ポリシーを提案。接触前は低周波・多段サンプリングで多様性を保持し、接触後は高周波・一段サンプリングで素早い反応を実現する。
- 効率的な視覚言語行動推論のための時間的冗長性の削減VLA/高速化2026/7/1
VLAモデルの推論遅延を減らすため、視覚エンコーディングと拡散サンプリングの時間的冗長性を削減するシステムレベルの高速化手法を提案。動的領域のみのトークン更新と2ステップの拡散サンプリングにより、性能を保ちつつ2倍以上の高速化を達成。
- 力の注入に遅すぎることはない:反応的力注入によるVLAポストトレーニングの加速VLA/力覚/接触操作2026/7/1
事前学習済みの視覚言語行動(VLA)ポリシーに、接触反応性を追加するフレームワークLIFTを提案。力覚メモリとゼロ初期化クロスアテンションで反応的アクション専門家を移植し、オンラインDAggerループで分布シフトに対処。タオル折り、本挿入、ハノイの輪配置で性能向上を実証。
- FTP-1: 触覚センサを横断する接触リッチ操作のための汎用基盤触覚ポリシー触覚/基盤モデル2026/6/1
多様な触覚センサとロボット構成に対応する初の汎用基盤触覚ポリシーFTP-1を提案し、約3000時間のデータで事前学習して未見センサへの転移を実証した。
- SARM2: 自己改善型ロボット操作のためのマルチタスク段階認識報酬モデリングマニピュレーション2026/6/1
長期的なロボット操作タスクにおいて、行動クローニングに依存せず、自己ロールアウトからポリシーを改善するための、段階推定器とMMoE価値ヘッドを組み合わせたマルチタスク報酬モデルRMと、それを用いた自己改善フレームワークSPIRALを提案した。
- ActiveGlasses: 自己中心的な人間のデモから能動視覚で操作を学習する操作学習2026/4/1
スマートグラスに取り付けたステレオカメラで人間のデモを収集し、同じカメラをロボットの知覚アームに搭載して能動視覚を再現することで、ロボット操作をゼロショット転移で学習するシステムを提案した。
- RoboPocket: スマホでロボットポリシーを即座に改善模倣学習2026/3/1
スマートフォンとARを用いて、物理ロボットを使わずに模倣学習のデータ収集を効率化し、ポリシーを即時改善するシステムを提案した論文。
- VTAM:視覚と言語を超え、触覚を統合したビデオ・触覚・行動モデルVLA2026/3/1
映像から行動を予測するVAMに触覚を追加し、接触の多い繊細な操作を安定化させるマルチモーダル世界モデルを提案。ポテトチップスの把持などで大幅な性能向上を実現。
- カメラ選択の再考:ロボット操作における魚眼カメラ特性の実証研究模倣学習/カメラ特性2026/3/1
ロボット操作における手首搭載魚眼カメラの特性を、シミュレーションと実世界の実験で体系的に分析し、空間定位、シーン汎化、ハードウェア汎化への影響を明らかにした。
- ヒューマノイド操作インターフェース:ロボット不要の実演による全身操作全身操作2026/2/1
ポータブルな装着型デバイスで人間の全身動作を計測し、階層的な学習パイプラインを通じてヒューマノイドの多様な全身操作スキルを実環境で獲得するフレームワークを提案。
- デジタルからフィジカルへ:物理知能のための自律型コーチとしてのデジタルエージェントVLA2026/1/1
LLMエージェントが強化学習や模倣学習のタスク設計・デバッグ・最適化を自律的に行うベンチマークEmboCoach-Benchを提案し、人間設計を上回る性能を実証した。
- ImplicitRDP: 構造的スローファスト学習による視覚-力覚拡散ポリシーVLA2025/12/1
視覚と力覚を単一ネットワークで統合し、非同期トークンを因果注意で処理する拡散ポリシーを提案。接触の多い操作タスクで高い反応性と成功率を実現した。
- 後知恵オンライン模倣によるフローから方策への変換模倣学習2025/12/1
高レベルプランナが生成した2D点フローを、オンライン試行錯誤と後知恵目標再ラベリングで目標条件付き模倣方策に接地し、操作タスクの性能を2倍以上に改善する手法を提案。
- Maestro:視覚言語モデルでロボティクスモジュールを統合するゼロショット汎用ロボットVLA2025/11/1
VLMコーディングエージェントが知覚・計画・制御モジュールを動的に組み合わせてプログラム的政策を生成し、ゼロショットで汎用ロボットを実現する手法を提案。
- ARMADA: 自律的オンライン失敗検出と人間共有制御によるスケーラブルな実世界展開と適応sim2real2025/10/1
模倣学習ポリシーの実世界展開において、オンライン失敗検出(FLOAT)と人間共有制御を組み合わせ、必要な時だけ人間が介入するマルチロボット適応システムを提案。成功率4倍以上、人間介入率2分の1以下を実現。
- MotionTrans: 人間のVRデータでロボットマニピュレーション方策の動作レベル学習を実現マニピュレーション2025/9/1
VRで収集した人間の動作データを変換し、ロボットデータと重み付き共訓練することで、13タスクの動作をエンドツーエンド方策へ直接転移。9タスクはゼロショットで成功し、事前学習・微調整性能も40%向上。
- TimeRewarder:受動的動画からフレーム間時間距離で密報酬を学習強化学習/報酬設計2025/9/1
フレーム間の時間距離をモデル化し、ロボット実演や人間動画からタスク進捗を推定して強化学習の密報酬を生成する手法を提案。
- SOE: 多様体上探索によるサンプル効率の良いロボット方策の自己改善マニピュレーション2025/9/1
タスクに関連する要因を潜在空間で表現し、有効な行動の多様体上に探索を制約することで、安全かつ効率的にロボット方策を自己改善するフレームワークを提案した。
- 触覚VLA:視覚-言語-行動モデルの物理知識を触覚汎化へ解き放つVLA2025/7/1
視覚・言語・行動モデルに触覚センシングを融合し、接触を伴うタスクで力制御と触覚フィードバックに基づく適応的な行動を可能にするフレームワークを提案。
- 身体感覚のずれを克服する模倣学習のドメイン適応模倣学習2025/6/1
模倣学習において訓練時と実環境での固有感覚(proprioception)の分布ずれが性能を低下させる問題を特定し、Wasserstein距離に基づくノイズ付加で分布を整合させる手法を提案した。
- KineDex: 触覚情報を取り入れた視覚運動ポリシーを運動感覚教示で学習する巧みな操作マニピュレーション2025/5/1
人間の手の動きを直接ロボットハンドに転送する運動感覚教示で触覚付きの実演データを収集し、触覚を統合した視覚運動ポリシーと力制御により接触の多い巧みな操作を実現した。
- FP3: ロボットマニピュレーションのための3D基盤ポリシーマニピュレーション2025/3/1
点群入力を用いた大規模3D基盤ポリシーモデルFP3を提案し、80回のデモで新規タスクを90%以上の成功率で学習できることを実機で示した。
- ロボットマニピュレーションの模倣学習におけるデータスケーリング則マニピュレーション2024/10/1
模倣学習において環境・物体・デモ数の増加が汎化性能に与える影響を大規模実験で調査し、環境と物体の多様性が重要であることを示した。
- Transformerは物体間の空間関係を捉えられるか空間関係認識2024/3/1
物体間の空間関係を認識するベンチマークを提案し、Transformerの長距離注意を活用したRelatiViTが既存手法を大きく上回ることを示した。
- General Flow as Foundation Affordance for Scalable Robot Learning2024/1/1
- Any-point Trajectory Modeling for Policy Learning2024/1/1
- Imitation Learning from Observation with Automatic Discount Scheduling2023/10/1
- Fighting Fire with Fire: Avoiding DNN Shortcuts through Priming2022/6/1
- Keyframe-Focused Visual Imitation Learning2021/6/1
- Fighting Copycat Agents in Behavioral Cloning from Observation Histories2020/10/1