Yuhui Chen
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CLIPとDINOを活用した不確実性を考慮したカスケード融合ネットワークによる汎用的なディープフェイク画像検出画像検出2026/9/7
CLIPとDINOの特徴を階層的に融合し、エントロピーに基づく不確実性で重み付けすることで、未知のディープフェイクに対する汎化性能を高めた検出ネットワークUCF-Netを提案した。
- クリップ付き目的関数による後方最適化:生成的方策学習における効率と安定性の橋渡しロボット操作/強化学習2026/4/1
ロボット操作のための生成的方策をRLで微調整する際の不安定性とサンプル非効率を解決するため、後方推論として方策改善を定式化するPOCOフレームワークを提案。期待値最大化手順で報酬重み付き暗黙後方を方策に蒸留し、オフラインからオンラインへのパラダイムで事前分布に探索を固定する。
- WoVR: 幻覚を制御してVLAポリシーを強化学習で事後学習する信頼可能なワールドモデルシミュレータVLA2026/2/1
不完全な学習済みワールドモデルをシミュレータとして使い、キーフレーム初期化ロールアウトとモデル・ポリシー共進化で幻覚の影響を抑え、VLAポリシーを強化学習で安定に事後学習する手法を提案。
- 生成的エピソードガイダンスによる二重粒度コントラスト報酬で効率的な身体性RL強化学習/報酬設計2026/2/1
大規模動画生成モデルを活用し、少数の専門家動画から各RLエピソード用のタスクガイダンスを生成して、粗い探索と細かいマッチングを両立する二重粒度コントラスト報酬を与えることで、人手アノテーションなしにサンプル効率の高い身体性強化学習を実現した研究。
- 長寿命ロボットに向けて:強化学習ファインチューニングによるVLAモデルの継続学習VLA2026/2/1
VLAモデルの下流タスク適応における破滅的忘却とデータ依存を解決するため、オンライン環境フィードバック不要の強化学習ファインチューニング手法LifeLong-RFTを提案し、継続学習でSFT比22%の成功率向上を達成した。
- QDepth-VLA:量子化深度予測を補助監督とする視覚-言語-行動モデルVLA2025/10/1
VLAモデルにVQ-VAEで量子化した深度マップの潜在トークンを予測する補助タスクを追加し、空間推論能力とマニピュレーション性能を向上させた。
- 身体性マニピュレーションのための視覚-言語-行動モデルに関するサーベイVLA2025/8/1
身体性知能におけるロボット操作のための視覚-言語-行動(VLA)モデルについて、アーキテクチャの変遷やデータセット、学習手法、評価方法を5つの観点から整理し、課題と今後の方向性をまとめたサーベイ論文。
- CLAR: マスク再構成と多段階コントラスト整合を融合したロボットマニピュレーション向け3D表現学習マニピュレーション2025/7/1
マスク付きオートエンコーダとクロスモーダルなコントラスト学習を組み合わせ、局所的な変形可能注意で3D形状と2D視覚特徴を精密に対応付ける3D事前学習フレームワークを提案し、視覚運動ポリシー学習で最高性能を達成した。
- TeViR: 拡散モデルによるテキストから動画への報酬生成で効率的な強化学習強化学習/ロボットマニピュレーション2025/5/1
テキストから動画を生成する拡散モデルを使い、予測映像と現在の観測を比較して密な報酬を生成する強化学習手法を提案。11の複雑なロボット操作タスクでサンプル効率と性能を向上させた。
- ConRFT: 一貫性ポリシーによるVLAモデルの強化学習ファインチューニングVLA2025/2/1
VLAモデルをオフラインとオンラインの強化学習でファインチューニングし、実世界の接触を伴う操作タスクで成功率を大幅に向上させた手法。