Xiang Deng
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- NavHarness: エージェント型視覚言語ナビゲーションのための適応的ゴール設定VLA2026/9/30
視覚言語ナビゲーションにおいて、ゴール設定・検証・記憶圧縮・視覚運動実行の4エージェントで構成されるフレームワークを提案し、長期的タスクでの一貫性と推論効率を改善した。
- 空中物体ゴールナビゲーションのための二層意味空間信念マッピングナビゲーション2026/9/8
UAVが未知の屋外環境で目標物体を探すObjectNavのため、VLMの一時的な観測を永続的な空間ガイダンスに変換する二層の信念マップフレームワークを提案し、ベンチマークで最高性能を達成した。
- エルミート曲線による視覚言語行動モデルの軌道事前分布VLA2026/8/1
VLAモデルのアクションチャンクをエルミート曲線でパラメータ化し、滑らかさと連続性を明示的に強制する3つの変種を提案。正則化として用いるのが最も効果的で、実ロボットタスクで成功率を大幅に向上させた。
- RoboSpatialチャレンジ技術報告:選択的推論活性化と参照フレーム曖昧性解消による身体化空間推論空間推論2026/6/30
CVPR 2026のRoboSpatialチャレンジで1位を獲得した、ロボットの空間推論を強化する推論時プロンプト手法を提案した論文。
- 具現化AIのための効率的視覚ポインティング:エージェント駆動データ合成、クロスブロック注意、反復補正視覚ポインティング2026/6/29
言語指示からピクセル座標を推定する視覚ポインティングの精度向上を目指し、データ合成とモデル改良を組み合わせてPointArena 2026で77.2%の精度を達成した。
- ウェイポイントを超えて:視覚言語ナビゲーションのための軌跡中心のウェイポイントパラダイムナビゲーション2026/6/1
連続環境での視覚言語ナビゲーションにおいて、孤立したウェイポイントではなく実行可能な軌跡に基づく新しいウェイポイント予測手法を提案し、計画と制御の一貫性を向上させた。
- EnergyAction: エネルギーに基づくモデルによる片腕から両腕への動作合成両腕操作/エネルギーに基づくモデル/ポリシー転移2026/3/1
本論文では、片腕操作ポリシーをエネルギーに基づくモデルとして表現し、その合成特性を利用して両腕操作タスクへ転移するフレームワークを提案する。時間的・空間的な協調メカニズムと適応的ノイズ除去戦略を導入し、高品質な両腕動作を効率的に生成する。
- 皮質ポリシー:ロボット操作のための二重ストリームビュートランスフォーマーマニピュレーション2026/3/1
静的視点と動的視点の二つのストリームを統合するビュートランスフォーマーを提案し、3D空間理解と動的適応を向上させてロボット操作の性能を大幅に改善した。
- F1: 理解と生成を行動に橋渡しする視覚-言語-行動モデルVLA2025/9/1
将来の視覚状態を予測する「視覚的先見」を意思決定に組み込み、それを目標として逆動力学で行動を生成するVLAフレームワークF1を提案し、実世界タスクとシミュレーションで成功率と汎化性能を大幅に向上させた。
- UAV-ON: 空中エージェントによるオープンワールド物体目標ナビゲーションのベンチマークナビゲーション2025/8/1
空中エージェントが高レベルな意味的目標に基づいて大規模オープンワールド環境で物体を探索・ナビゲートするためのベンチマークUAV-ONを提案し、複数のベースライン手法を評価した。
- DAgger拡散ナビゲーション:視覚言語ナビゲーションのためのDAgger強化拡散ポリシーVLA2025/8/1
視覚言語ナビゲーション(VLN-CE)において、従来の2段階計画を単一の条件付き拡散ポリシーに統合し、DAggerによるオンライン学習で複合誤差を抑えたエンドツーエンド手法を提案。
- STAR: 回転拡張ベクトル量子化による多様なロボットスキル抽象化の学習VLA2025/6/1
VQ-VAEのコードブック崩壊とスキル間因果関係の欠如を解決するため、回転拡張残差スキル量子化と因果スキルトランスフォーマーを組み合わせ、LIBEROベンチマークと実世界タスクで約12%の性能向上を達成した。
- 少数ショット視覚言語行動インクリメンタル方策学習VLA2025/4/1
少数の実演から新しい操作タスクを継続的に学習するため、タスク固有プロンプトとタスク関係グラフによる進化戦略を組み合わせたTOPICを提案した論文。
- 運動学モデリングを統合した時空間グラフ拡散政策による双腕ロボットマニピュレーションマニピュレーション2025/3/1
双腕ロボット操作のための拡散政策に、ロボットの物理構造を反映した動的時空間グラフと微分可能な運動学制約を導入し、自己衝突や関節限界を考慮した運動学的に整合する動作生成を実現した。
- 3D-AffordanceLLM:大規模言語モデルを活用した3D世界におけるオープンボキャブラリ・アフォーダンス検出3Dアフォーダンス検出2025/2/1
大規模言語モデルを3Dアフォーダンス知覚に導入し、自然言語の指示からアフォーダンス領域を推論・セグメンテーションするフレームワークを提案。
- FPGAハードウェアによるニューラル制御:CartPoleとF1TENTHレースカーへの応用制御/FPGA2024/7/1
NMPCを教師として学習したニューラルネット制御器を安価なFPGA上に実装し、CartPoleとF1TENTHカーをkHz級の高頻度で制御して実機性能を向上させた。
- EPD: 長期記憶抽出・文脈認識計画・反復的意思決定によるエゴセントリックタスク計画タスク計画2024/7/1
ICML 2024のEgoPlanチャレンジに向け、長期記憶抽出・文脈認識計画・反復的意思決定の3段階からなるタスク計画フレームワークEPDを提案し、エゴセントリックな計画精度53.85%を達成した。
- RoboMP²: マルチモーダル大規模言語モデルによるロボットのマルチモーダル知覚・計画フレームワークマニピュレーション2024/4/1
マルチモーダル大規模言語モデルを活用し、目標条件付き知覚器と検索拡張計画器を組み合わせてロボットマニピュレーションの汎化性能を高めるフレームワークを提案。