Yen-Ling Kuo
収録論文 15本 ・ フィジカルAI/ロボット学習
VLA失敗検出マニピュレーションアフォーダンス
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TBD-VLA: 時間ブロック拡散を用いた視覚言語行動モデルVLA2026/6/5
離散トークン型の視覚言語行動モデル(VLA)において、行動系列を時間ブロックに分割し、ブロック内ではマスク拡散、ブロック間では自己回帰生成を行うことで、時間的一貫性と推論速度を両立する新しいフレームワークを提案した。シミュレーションと実機操作タスクで既存手法を上回る性能を示した。
- 先見: 行動条件付きワールドモデル潜在表現による長期的ロボット操作の失敗検出失敗検出2026/6/1
長期的なロボット操作タスクにおいて、最終的な成功/失敗ラベルのみを用いて、行動条件付きワールドモデルの潜在表現から失敗を検出するフレームワークを提案した。
- 低コスト触覚力制御グリッパによる力調整マニピュレーションの学習マニピュレーション2026/2/1
低コストの触覚フィードバック付き力制御グリッパと、把持力を高頻度で調整するフレームワークを提案し、力加減が重要な実世界タスクで有効性を示した。
- O$^3$Afford: 汎化可能なロボット操作のためのワンショット3D物体間アフォーダンス接地アフォーダンス2025/9/1
視覚基盤モデルと点群を組み合わせ、限られたデータで物体間のアフォーダンスをワンショット学習し、LLMと統合してロボット操作の汎化性能を向上させた。
- CLASS: 行動系列の監督による対照学習でロボットマニピュレーションを実現マニピュレーション2025/8/1
動的タイムワーピングで類似行動系列を特定し、対照学習で行動表現を学習するCLASSを提案。視覚変化に強いロボットマニピュレーションを実現。
- Diff-DAgger: 拡散ポリシーを用いた不確実性推定によるロボットマニピュレーションマニピュレーション2024/10/1
拡散ポリシーの学習目的を利用して不確実性を推定し、ロボットが専門家に質問する対話型模倣学習を効率化した手法を提案。積み重ね・押し・挿入タスクで失敗予測と成功率を改善し、時間も短縮した。
- 画像編集によるロボットマニピュレーションのサブゴール生成にタスク進捗知識を組み込むマニピュレーション2024/10/1
タスク進捗を表す視覚表現と潜在拡散モデルを組み合わせ、言語指示に基づく次の視覚サブゴールを生成してマニピュレーションを誘導するTaKSIEを提案。CALVINベンチマークで最先端性能を達成。
- Neural Amortized Inference for Nested Multi-agent Reasoning2023/8/1
- NashFormer: Leveraging Local Nash Equilibria for Semantically Diverse Trajectory Prediction2023/5/1
- Trajectory Prediction with Linguistic Representations2021/10/1
- Incorporating Rich Social Interactions Into MDPs2021/10/1
- Compositional Networks Enable Systematic Generalization for Grounded Language Understanding2020/8/1
- Encoding formulas as deep networks: Reinforcement learning for zero-shot execution of LTL formulas2020/6/1
- Deep compositional robotic planners that follow natural language commands2020/2/1
- Deep sequential models for sampling-based planning2018/10/1