Guanbin Li
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FLARE: 視覚言語ロボット操作における自動修正と回復のための障害認識フレームワークマニピュレーション2026/8/27
視覚言語行動モデル(VLA)が実行中に起こす失敗(掴み損ね、落下、衝突など)を自動で修正・回復できるようにするフレームワークを提案。デモに摂動や橋渡しセグメントを注入して「リトライ」能力を、MLLMによる失敗分析で「リセット」スキルを獲得し、オンライン監視で切り替える。
- SpatialDiff: 暗黙的な空間モデリングによる3D認識オブジェクト移動画像編集2026/8/22
複雑なシーンでのオブジェクト移動を正確に行うため、3D空間構造を暗黙的にモデル化し、グローバルな空間監視で編集操作による位置変化を認識する手法を提案した。
- 文脈内モデル予測生成:言語モデルから物理へのオープンボキャブラリ動作合成動作合成2026/6/1
テキスト記述から人間の動作を合成する際に、言語モデルの意味理解と物理シミュレーションの現実性を統合したフレームワークICMPGを提案し、オープンボキャブラリの指示に対して物理的に妥当な動作を生成する。
- 群作用としての世界モデル世界モデル2026/5/23
ビデオ世界モデルの行動忠実性を群構造に基づいて定式化し、潜在空間正則化により一貫性を向上させる手法を提案した論文。
- DDP-WM: 効率的なワールドモデルのための分離型ダイナミクス予測ワールドモデル2026/2/1
観測シーンの潜在状態変化を、物理相互作用による疎な主要ダイナミクスと背景更新に分離して予測するワールドモデルを提案し、推論を約9倍高速化しつつ操作タスクの成功率を向上させた。
- 見て行動することを学ぶ:ロボットマニピュレーションのためのタスク認識型仮想視点探索VLA2025/8/1
再構成したシーンからタスクに適した仮想カメラ視点を選んで観測を再描画し、タスク特化型のMixture-of-Experts視覚エンコーダと組み合わせることで、遮蔽や視覚的分布シフトに頑健な多タスクロボット操作を実現した。
- AutoLayout: 低速・高速協調推論による閉ループレイアウト合成シーン生成/レイアウト合成2025/7/1
低速な推論と高速な生成を組み合わせた二重システムと自己検証ループにより、物理的に整合し意味的にも妥当な物体配置レイアウトを自動生成する手法を提案。
- サイバー空間と物理世界の融合:Embodied AIに関する包括的サーベイEmbodied AI2024/7/1
Embodied AIの最新動向を、ロボット・シミュレータ、知覚・相互作用・エージェント・sim-to-realの4研究領域、マルチモーダル大規模モデルの活用まで網羅的に整理したサーベイ論文。