Yinchuan Li
Knowin AI
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- フロンティアVLMエージェントはロボット汎用istになれるか?Embodied Agent Arenaによる実証研究VLA2026/10/1
VLMのロボット汎用性を評価するベンチマーク「Embodied Agent Arena」を提案し、7つのVLMを幾何推定・空間推論・アフォーダンス・タスク計画・操作の観点で比較した。精密推定は得意だが、協調的な目標指向行動の完遂に課題が残ることを示した。
- ロボットのインコンテキスト学習:手法と応用VLA2026/9/28
ロボットのインコンテキスト学習(ICL)に関する文献レビューであり、文脈条件付き方策、幾何学的実演転移、世界モデルベース制御、スキル・エージェントベース実行の4つのインターフェースに分類し、転移の前提や評価手法を整理する。
- RACaP: 進化可能なロボット学習のためのポリシーとしての推論・行動・コーディングVLA2026/9/24
コード生成を進化フェーズに移し、展開時は凍結された型付きポリシーAPIをReActループで呼び出すエージェント型フレームワークを提案。長期的タスクで成功率と速度を大幅に改善し、小型モデルへの蒸留で実機展開を効率化した。
- Robo-Harness K1: 知覚拡張によるロボット操作エージェントの活用VLA2026/9/24
VLMに深度や空間計測などの知覚ツールを提供し、追加学習なしでロボット操作を実現するエージェントフレームワークを提案。少ない実演データでも高い汎化性能を示す。
- World Action Agent:視覚的アクション空間でのロボット操作を可能にするVLM活用フレームワークVLA2026/9/24
VLMをマルチエージェント構成でロボット操作に活用し、接触ビュー・アクションリハーサル・ビュー内補正を組み合わせた視覚的アクション作業空間を提案。LIBERO-Proで75.6%の成功率を達成。
- AffordanceWAM: アフォーダンス認識型の世界行動統合モデリングによるロボットマニピュレーションVLA2026/9/16
人間とロボットの動画から物体中心のアフォーダンスを予測し、将来の映像とロボット行動を統合的に生成するモデルを提案。人間動画を活用してロボット操作の汎化性能を向上させた。
- WorldLines: 長期的な状態を持つ具現化エージェントのベンチマークとモデリング具現化エージェント/長期記憶/ベンチマーク2026/6/17
長期的な家庭支援のためのベンチマークWorldLinesを構築し、記憶と計画の課題を評価するフレームワークObsMemを提案した。
- AffordanceVLA:アフォーダンス認識による行動生成を強化する視覚言語行動モデルVLA/操作2026/6/4
視覚言語モデルとロボット制御の構造的ミスマッチを解消するため、アフォーダンス予測を中間表現として導入し、物体の接地・2D位置特定・3D幾何推論を段階的に行う統一フレームワークを提案した。
- RoboStressBench: 身体化シーンにおける物理的視覚ストレスに対するVLMロバスト性のベンチマークVLM/ベンチマーク2026/5/30
視覚言語モデル(VLM)の実環境でのロバスト性を評価するため、物理的レンダリング方程式に基づき、視覚ストレスを材料・視点・照明・幾何の4次元に分解したベンチマークRoboStressBenchを提案した。
- アフォーダンスエージェントハーネス:検証ゲートによるスキルオーケストレーションアフォーダンス接地2026/5/1
オープンワールドでのアフォーダンス接地を改善するため、検証ゲート付きのクローズドループランタイムを提案し、適応的なスキル選択とエビデンス蓄積により精度とコストのトレードオフを向上させた。
- パノラマ親和性予測親和性予測2026/3/1
360度画像を用いた親和性予測の新タスクを提案し、大規模データセットPAP-12Kと訓練不要のパイプラインPAPを導入した。
- ActionCodec:優れたアクショントークナイザの設計原則VLA2026/2/1
VLA最適化の観点から情報理論に基づく設計原則を導き、それに従う高性能アクショントークナイザActionCodecを提案。LIBEROでロボティクス事前学習なしにSOTAを達成。
- 遺伝的ノイズ除去によるロボット操作のための2ステップ拡散ポリシーマニピュレーション2025/10/1
拡散ポリシーのノイズ除去過程を身体性AIタスク向けに適応させ、遺伝的ノイズ除去という集団ベースサンプリングで2回の推論で高精度なロボット操作を実現した。
- PhysToolBench:マルチモーダル大規模言語モデルの物理ツール理解を評価するベンチマークVLA2025/10/1
MLLMが物理ツールをどれだけ理解しているかを評価する初のVQAベンチマークを構築し、32モデルを評価した結果、ツール理解に大きな欠陥があることを明らかにした。
- STAR: 回転拡張ベクトル量子化による多様なロボットスキル抽象化の学習VLA2025/6/1
VQ-VAEのコードブック崩壊とスキル間因果関係の欠如を解決するため、回転拡張残差スキル量子化と因果スキルトランスフォーマーを組み合わせ、LIBEROベンチマークと実世界タスクで約12%の性能向上を達成した。
- DeCo: 長期的3Dマニピュレーションにおけるゼロショット汎化のためのタスク分解とスキル合成マニピュレーション2025/5/1
模倣学習のデモを把持物体の相互作用に基づいて原子タスクに分解し、VLMで指示を解析してスキルを動的に組み合わせることで、未見の長期的3D操作タスクへのゼロショット汎化を実現するフレームワーク。
- 条件付けが鍵:拡散ポリシーの学習は思ったより速いVLA2025/5/1
条件拡散ポリシー学習で生じる「損失崩壊」を特定し、条件に依存したソース分布を用いるCocosを提案。少ない学習ステップとパラメータで大規模事前学習VLAに匹敵する性能を実現した。
- EmbodiedMAE: ロボットマニピュレーションのための統合3Dマルチモーダル表現マニピュレーション2025/5/1
RGB・深度・点群を統合的に学習するマルチモーダルMAEを提案し、DROID-3Dデータセットで訓練することで、シミュレーションと実機の操作タスクにおいて既存の視覚基盤モデルを上回る性能を達成した。
- 少数ショット視覚言語行動インクリメンタル方策学習VLA2025/4/1
少数の実演から新しい操作タスクを継続的に学習するため、タスク固有プロンプトとタスク関係グラフによる進化戦略を組み合わせたTOPICを提案した論文。
- 運動学モデリングを統合した時空間グラフ拡散政策による双腕ロボットマニピュレーションマニピュレーション2025/3/1
双腕ロボット操作のための拡散政策に、ロボットの物理構造を反映した動的時空間グラフと微分可能な運動学制約を導入し、自己衝突や関節限界を考慮した運動学的に整合する動作生成を実現した。
- RA-DP: 学習不要の高頻度ロボット再計画のための高速適応拡散ポリシーVLA2025/3/1
拡散ポリシーに学習不要のガイダンス信号と行動キュー機構を組み込み、未知の動的環境で高頻度に再計画できるフレームワークを提案した。
- 3D-AffordanceLLM:大規模言語モデルを活用した3D世界におけるオープンボキャブラリ・アフォーダンス検出3Dアフォーダンス検出2025/2/1
大規模言語モデルを3Dアフォーダンス知覚に導入し、自然言語の指示からアフォーダンス領域を推論・セグメンテーションするフレームワークを提案。