Yi Chen
収録論文 21本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VINE: 強化学習のための生成制御ポリシーの調整強化学習2026/7/1
フローマッチングポリシーを強化学習で安定して学習するための新しいサンプリング手法VINEを提案。各デノイズステップで補間状態を再構築し、価値勾配の伝播を安定化させる。
- ジャストインタイムシーングラフ成長:長時間ロボティクスにおける知覚飽和への対抗知覚/シーングラフ2026/7/1
この論文は、ロボットの長時間タスク実行中に生じる知覚の飽和問題を解決するため、タスクに応じて必要な部分だけを動的に活性化する3Dシーングラフ構築手法JITOMAを提案している。
- 予測を行動に変える:世界行動モデルにおける表現整合の再利用VLA2026/6/10
世界行動モデル(WAM)の行動デコーダがタスク関連領域に注目せず、表現の不一致が行動精度を損なう問題を診断し、基盤ビジュアルエンコーダの意味表現と中間特徴を整合させるAGRAを提案。実機操作タスクで性能と汎化を向上させた。
- VLA-ATTC: 相対アクション批評モデルによるVLAモデルの適応的テスト時計算VLA/意思決定2026/5/1
VLAモデルに不確実性に基づく「認知クラッチ」を導入し、複雑な状況でのみ推論フェーズへ切り替える適応的テスト時計算フレームワークを提案。相対比較で最適アクションを選ぶ批評モデルにより、LIBERO-LONGでSOTAの失敗率を50%以上削減した。
- UniT: 人間からヒューマノイドへのポリシー学習と世界モデリングのための統一物理言語に向けてヒューマノイド/模倣学習/世界モデル2026/4/1
人間の映像データを活用してヒューマノイドロボットの学習を行うため、視覚的アンカリングに基づく統一潜在アクショントークナイザー(UniT)を提案し、異なる身体構造間のギャップを埋める。
- DIAL: 潜在世界モデリングによる意図と行動の分離を用いたエンドツーエンドVLAVLA2026/3/1
VLAモデルにおいて、高次意思決定と低次運動実行を潜在意図ボトルネックで橋渡しし、VLMの潜在空間で未来予測を行い、軽量ポリシーで行動を生成する枠組みを提案した。
- ALOE: 視覚言語行動モデルの事後学習のための行動レベルオフポリシー評価VLA2026/2/1
実世界の人間参加型強化学習でVLAモデルを改善するため、現在のポリシーを直接評価するオフポリシー評価フレームワークALOEを提案し、4つの実世界マニピュレーションタスクで検証した。
- RAG-3DSG: 再撮影ガイド付き検索拡張生成による3Dシーングラフの強化3Dシーングラフ2026/1/1
限られた視点と遮蔽による意味的不整合を、再撮影による不確実性推定と物体レベルのRAGで補正し、信頼性の高い3Dシーングラフを構築する手法を提案した。
- RANGER: 単眼カメラによるゼロショット意味的ナビゲーションのための視覚的文脈適応フレームワークナビゲーション2025/12/1
単眼カメラのみで動作し、短い動画から環境の文脈を学習して任意の物体を探索できるゼロショット・オープンボキャブラリなナビゲーション手法を提案。
- 発見・学習・強化:多様なRL生成軌道による視覚-言語-行動事前学習のスケーリングVLA2025/11/1
強化学習で多様な行動パターンを発見し、VLAモデルの事前学習用データを自動生成するフレームワークDLRを提案。標準RLより多様で高成功率の軌道を生成し、下流タスク性能とデータスケーリングを改善する。
- TOPP-DWR: 区分的に一定な角速度制約を考慮した差動駆動車輪ロボットの時間最適経路パラメータ化移動ロボット/経路計画2025/11/1
差動駆動車輪ロボット向けに、角速度・関節速度・線速度・線加速度の制約を組み込んだ時間最適経路パラメータ化アルゴリズムを提案し、SOCPで効率的に解く手法を実証した。
- VLAはVLMからいかに効果的に継承するのか?VLA2025/11/1
絵文字を使った卓上操作タスクでVLAがVLMの事前知識を継承する条件を診断し、パラメータ効率微調整やVLM凍結などの手法を比較した。
- 人間のデモを超えて:VLA学習用データを生成する拡散ベース強化学習VLA2025/9/1
拡散モデルを用いた強化学習で高品質・低分散な軌道を生成し、人間のデモなしでVLAモデルを学習させる手法を提案。LIBEROベンチマークで人間データやガウスRLより高い成功率を達成。
- SN-LiDAR: 新規時空間ビューLiDAR合成のためのセマンティックニューラルフィールドLiDAR/NeRF2025/4/1
LiDAR点群の新規視点合成において、セマンティックセグメンテーション・幾何再構成・LiDAR合成を同時に行う手法を提案し、動的物体や大規模シーンに対応できることを示した。
- Moto: 動画からロボット操作を学習するための橋渡し言語としての潜在モーショントークンVLA2024/12/1
動画を潜在モーショントークン列に変換し、自己回帰的に事前学習することで、ロボット操作に転移可能な運動知識を獲得する手法を提案。
- EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning2023/12/1
- Need for Speed: Fast Correspondence-Free Lidar-Inertial Odometry Using Doppler Velocity2023/3/1
- Picking Up Speed: Continuous-Time Lidar-Only Odometry using Doppler Velocity Measurements2022/9/1
- DICP: Doppler Iterative Closest Point Algorithm2022/1/1
- Research on Event Accumulator Settings for Event-Based SLAM2021/12/1
- When Shall I Be Empathetic? The Utility of Empathetic Parameter Estimation in Multi-Agent Interactions2020/11/1