Ran Tian
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CtrlWAM: 意図と予見を整合させた制御可能なワールドアクションモデルVLA2026/10/1
摂動させた行動をシミュレータで実行し、その視覚的結果と対応付けて学習することで、行動予測と映像生成の整合性を高めた制御可能なワールドアクションモデルを提案。
- 汎用ロボットの安全性を再考する安全性2026/9/6
汎用ロボットの多用途性に伴う新たなリスクを分類し、ライフサイクル全体を考慮した「具現化AI安全性」の研究課題を提案する論文。
- StressDream: ビデオ世界モデルを操縦して堅牢なポリシー評価と改善を実現世界モデル/ポリシー評価2026/6/1
拡散ベースのビデオ世界モデルにおいて、推論時に指定された高影響かつ妥当な未来(例:タスク失敗)へ想像を誘導する手法を提案し、ポリシーの堅牢な評価と改善を可能にした。
- 主張:優れた具現化報酬モデルには悪い行動データが必要報酬モデル2026/6/1
成功行動のみで訓練された具現化報酬モデルは、人間が評価すると罰するような危険・不完全な行動を過剰に報酬としてしまう。悪いロボットデータの不足が原因であり、悪いデータを少し加えるだけで人間の好みとの整合性が向上することを示し、悪いデータの収集・公開を提言する。
- 潜在連鎖推論によるエンドツーエンド運転の世界モデリング自動運転VLA2025/12/1
運転行動の推論を自然言語ではなく、行動と整合した潜在空間で行うLCDriveを提案し、推論速度・軌道品質・強化学習の効果を向上させた。
- Alpamayo-R1: 長尾シナリオにおける汎化可能な自動運転のための推論と行動予測の橋渡し自動運転/VLA2025/11/1
視覚言語行動モデルに因果連鎖推論を組み込み、拡散ベースの軌道デコーダと強化学習を組み合わせることで、長尾の安全臨界シナリオでの自動運転計画精度と推論品質を向上させた研究。
- AnySafe: 潜在空間における安全制約パラメータ化による実行時適応型潜在安全フィルタ安全制御/マニピュレーション2025/9/1
世界モデルの潜在空間で安全フィルタを構築し、ユーザが指定した制約画像のエンコーディングに条件付けすることで、実行時に任意の安全制約へ適応できる手法を提案。Frankaマニピュレータの視覚ベース制御タスクで有効性を実証した。
- テスト時観測介入による再想像:視覚モデル予測制御のための妨害物に頑健な世界モデル予測モデルベース強化学習2025/6/1
世界モデルが未知の視覚的妨害物に弱い問題に対し、テスト時に妨害物を検出・除去して予測を再想像し、事後的に妨害物を戻すことで、行動検証を頑健にする手法を提案。
- 事前学習デモンストレーションの暗黙的フィードバックを用いたマルチエージェント動作生成モデルの直接的事後選好整合マルチエージェント動作生成2025/3/1
事前学習デモンストレーションに含まれる暗黙的な選好を利用し、マルチエージェント動作生成モデルを人間の選好に整合させる手法を提案。
- 先見から熟慮へ:潜在空間アライメントによるVLM-in-the-Loop方策ステアリングVLA2025/2/1
生成的なロボット方策の失敗を減らすため、潜在世界モデルで行動の結果を予測し、それをVLMが言語で評価して低レベル行動を選別する枠組みを提案。
- 最小限のフィードバックでアラインメントを最大化:視覚運動ロボット政策のアラインメントのための効率的な報酬学習VLA2024/12/1
視覚運動ロボット政策を人間の選好に合わせるため、事前学習済み視覚エンコーダを微調整し特徴マッチングで密な視覚報酬を構築するRAPLを提案。従来のRLHFより5倍少ない人間フィードバックでアラインメントを実現。
- スパース拡散方策:ロボット学習のためのスパースで再利用可能かつ柔軟な方策VLA2024/7/1
Transformerベースの拡散方策にMixture of Expertsを組み込み、タスクごとに専門家を選択的に活性化することで、マルチタスク学習や継続学習を効率化する手法を提案した。
- 世界をオブジェクト知識にトークン化し、自動運転のロングテール事象に対処する自動運転/VLA2024/7/1
自動運転のロングテール事象に対処するため、シーンをオブジェクトレベルの知識にトークン化してLLMの推論能力を活用するマルチモーダルLLM「TOKEN」を提案し、軌道誤差と衝突率を大幅に削減した。
- MEReQ: 人間の介入からサンプル効率よく方針を整合させる最大エントロピー残差Q逆強化学習模倣学習/逆強化学習2024/6/1
人間の介入フィードバックから、事前方針と人間の報酬の差分を残差報酬として推定し、残差Q学習でサンプル効率よくロボットの方針を人間の好みに整合させる手法を提案。
- すべての誤りは等しくない:システムレベルの軌道予測失敗を検出するための後悔指標軌道予測2024/3/1
人間予測モデルの誤りがロボットの閉ループ性能に与える影響を「後悔」で定量化し、高後悔データを抽出して効率的にファインチューニングする手法を提案。
- What Matters to You? Towards Visual Representation Alignment for Robot Learning2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Towards Modeling and Influencing the Dynamics of Human Learning2023/1/1
- Anytime Game-Theoretic Planning with Active Reasoning About Humans' Latent States for Human-Centered Robots2021/9/1
- Safety Assurances for Human-Robot Interaction via Confidence-aware Game-theoretic Human Models2021/9/1
- Negotiation-Aware Reachability-Based Safety Verification for AutonomousDriving in Interactive Scenarios2021/6/1
- Learning Human Rewards by Inferring Their Latent Intelligence Levels in Multi-Agent Games: A Theory-of-Mind Approach with Application to Driving Data2021/3/1
- Game-theoretic Modeling of Traffic in Unsignalized Intersection Network for Autonomous Vehicle Control Verification and Validation2019/10/1
- Adaptive Game-Theoretic Decision Making for Autonomous Vehicle Control at Roundabouts2018/10/1