Kai Ye
Case Western Reserve University
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WHEREを正し、HOWを保つ:参照誘導によるVision-Language-Actionモデルの組合せ的一般化VLA2026/9/29
VLAモデルが視覚的ショートカットに依存して組合せ的一般化に失敗する問題に対し、学習不要のラッパーReGuideを提案し、対象物の位置情報を用いて意味的・幾何的に再結合することで成功率を大幅に改善した。
- Lucida: 合成可能な実世界からシミュレーションへのシーン構築のための解析・生成・配置シーン構築2026/8/31
実室内シーンを編集可能なオブジェクト資産として復元するパイプラインを提案し、各ステップが実際の観測で確実に得られる情報のみを消費するよう再設計。VLMポリシーによるGUI操作でオブジェクト配置を閉ループで行う。
- 想像による回復:推論時カウンターファクチュアル再調整による視覚言語行動モデルの復旧VLA/ロボットマニピュレーション2026/8/14
視覚言語行動モデルがオンラインの外乱(目標変更や物理的摂動)に直面した際、失敗データや再学習なしに、推論時に「もしも」の継続を想像してロボットと環境を最小限に再調整する訓練不要の回復フレームワークを提案した。
- ELDiff: 証拠学習とテキストから画像への拡散の融合テキストから画像生成2026/6/18
複数オブジェクトのテキストから画像生成において、セグメンテーションマップの不確実性と意味的競合を扱うため、証拠学習に基づく損失関数を導入し、オブジェクトごとの一貫性を強化する拡散モデルELDiffを提案した。
- 動力学ブラインドネスの克服:VLAモデルのための学習不要のペース・経路補正VLA2026/5/1
単一フレーム観測に基づくVLAモデルが動的環境で性能劣化する問題に対し、学習不要で閉形式の推論時補正演算子を提案し、動的環境での成功率を最大28.8%向上させた。
- Evo-Depth: 軽量な深度強化型視覚言語行動モデルVLA2026/5/1
追加センサーや高コストな幾何基盤モデルを使わずに、多視点RGB画像から軽量な暗黙的深度符号化モジュールで深度特徴を抽出し、空間セマンティクスを強化するVLAモデルを提案した。
- 人間を考慮したマルチロボットハンドオーバーのためのLLMに基づく階層的時間論理を用いた動的タスク計画タスク計画2026/2/1
大規模言語モデルで人間の指示を階層的なLTLf仕様に変換し、再cedingホライズン計画で動的に再計画することで、マルチロボットのハンドオーバータスクを実現するニューロシンボリックフレームワークを提案した。
- Gen2Real: 生成動画を活用したデモ不要の巧みなマニピュレーションマニピュレーション2025/9/1
生成動画から手と物体の軌道を抽出し、物理整合性を考慮した最適化と強化学習でロボットハンドの把持スキルを学習する手法を提案。シミュレーションで77.3%の成功率を達成し、実機でも動作を実証した。
- グラフ融合強化学習による大規模UAV経路計画の拡張経路計画2024/12/1
Delaunay三角形分割とグラフ融合を用いて、既存のTSPソルバーを最大1万点の大規模UAV経路計画に拡張するフレームワークを提案。
- 欲しいものを掴む:音声で駆動する身体性を備えた巧みな把持システムマニピュレーション2024/12/1
音声指示と視覚情報を視覚言語モデルで統合し、雑然とした環境でも対象物体を正確に把持する身体性把持システム(EDGS)を提案。人間の手と物体の相互作用に着想を得た把持戦略で高い成功率を実現した。
- Multi-Robot Active Mapping via Neural Bipartite Graph Matching2022/3/1