Joyce Chai
University of Michigan
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SimLife:長期的な人間とエージェントの協調のためのパターン理解長期記憶・パターン理解2026/9/17
家庭生活を長期シミュレーションするSimLifeを構築し、数週間〜数ヶ月の観察から潜在的な行動規則を推論する能力を評価するベンチマークSimLife-BPを提案した。
- MolmoAct2: 実世界展開のための行動推論モデルVLA2026/5/1
実世界展開に適した完全オープンな行動推論モデルMolmoAct2を提案し、空間推論に特化したVLMバックボーン、新しいデータセット、オープンな行動トーカナイザ、適応的推論機構などを導入して性能と効率を向上させた。
- SafetyALFRED:マルチモーダル大規模言語モデルの安全意識計画の評価VLA/安全性評価2026/4/1
SafetyALFREDは、ALFREDベンチマークに6種類のキッチン危険を追加し、マルチモーダル大規模言語モデルの危険認識と能動的なリスク軽減計画を評価する。実験では、QA設定での認識は高いが、身体化計画での緩和成功率が低いというギャップを示し、身体化文脈での是正行動を重視するベンチマークへの転換を提唱する。
- RoboMME:ロボット汎用ポリシーの記憶能力を評価・理解するベンチマークVLA2026/3/1
長期的・履歴依存的な操作タスクにおけるVLAモデルの記憶機構を評価するため、16タスクからなる標準ベンチマークと14種の記憶拡張VLAを構築し、記憶表現の有効性がタスク依存であることを示した。
- AimBot: 視覚運動ポリシーの空間認識を高める簡易補助視覚キューVLA2025/8/1
多視点RGB画像に照準線とスコープを重ねてエンドエフェクタの状態を明示し、視覚運動ポリシーの性能を向上させる軽量な視覚拡張手法を提案。
- Fast3R: 1000枚以上の画像を1回の順伝播で3次元再構成3次元再構成2025/1/1
多数の視点画像をTransformerで並列処理し、反復的な位置合わせなしに高精度な多視点3次元再構成を実現する手法を提案。
- 身体性強化学習エージェントへの教示:言語使用の情報量と多様性VLA2024/10/1
強化学習エージェントへの言語入力について、フィードバックの情報量と表現の多様性が学習・推論に与える影響を4つのベンチマークで検証し、多様で情報豊富な言語教示が汎化と新タスクへの適応を促進することを示した。
- RACER: 模倣学習のための豊かな言語ガイド付き失敗回復ポリシーマニピュレーション2024/9/1
失敗回復軌道と言語注釈を自動生成し、VLM監督者と言語条件付きポリシーを組み合わせることで、ロボットマニピュレーションの失敗回復と指示追従を改善する手法を提案。
- 3D-GRAND: 接地精度が高く幻覚の少ない3D-LLM向け100万規模データセット3D-LLM2024/6/1
家庭内3Dシーン4万件と言語指示620万件を対応付けた大規模データセットを構築し、3D-LLMの指示チューニングで接地能力向上と幻覚低減を実現、幻覚評価ベンチマーク3D-POPEも提案した。
- Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation2023/12/1
- Think, Act, and Ask: Open-World Interactive Personalized Robot Navigation2023/10/1
- LLM-Grounder: Open-Vocabulary 3D Visual Grounding with Large Language Model as an Agent2023/9/1
- DOROTHIE: Spoken Dialogue for Handling Unexpected Situations in Interactive Autonomous Driving Agents2022/10/1
- DANLI: Deliberative Agent for Following Natural Language Instructions2022/10/1