Lingfeng Zhang
収録論文 37本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- リアルタイムVLAに向けて:段階認識型2ステップフローデノイジングとシステムレベル評価VLA2026/9/30
VLAモデルの推論とロボット実行の速度ギャップを分析し、フローデノイジングを2段階に削減する手法と分散リアルタイム実行フレームワークを提案、衣類折り畳みタスクで評価した。
- Magic-W0:物理知能のための構造化ワールド・アクション基盤モデルVLA2026/9/30
ロボットの行動生成と環境の物理的状態変化を、現在状態・遷移・未来状態からなる構造化表現で同時にモデル化する基盤モデルを提案。大規模データで事前学習し、行動仮説と世界予測を層レベルで相互に作用させる。
- MoPA: サブシステム特化型知覚アラインメントによる協調的移動マニピュレーション移動マニピュレーション2026/9/10
移動とマニピュレーションで異なる知覚表現を二重ストリームで抽出し、行動レベルで協調させるフレームワークを提案。ManiSkill-HABで最高性能、実機でも成功率76.3%を達成。
- SOLO: 安定した全地形・長距離知覚ヒューマノイド歩行歩行2026/8/27
長距離歩行で累積する知覚・制御誤差による不安定化を解決するため、地形再構成の鮮明化と時間的クレジット割り当てを改善した統合フレームワークを提案。シミュレーションと実機で高い成功率を達成した。
- ロボット学習における潜在アクションの重要要素ロボット学習2026/8/20
ロボット操作のための潜在アクションモデル(LAM)の設計選択を体系的に比較し、41の設計選択肢を3次元で評価。VLMバックボーンの微調整が下流のポリシー学習に有効であることを示した。
- CheckVLA: アクション条件付きワールドモデルによる実行時検証で長期的モバイル操作を実現モバイル操作/VLA/実行時検証2026/7/1
長期的なモバイル操作において、VLAポリシーが開ループで行動チャンクを実行する際の誤差蓄積問題に対し、別途訓練したアクション条件付きワールドモデルで実行を検証し、逸脱時に介入する手法を提案した。シミュレーションで成功率と再現率が向上した。
- 信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル信頼性評価2026/7/1
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
- OneVLA: 身体性タスクのための統一フレームワークVLA2026/6/1
ナビゲーションと操作を単一のフレームワークに統合したVLAモデルを提案し、タスク固有のアーキテクチャを不要にする統一アクションヘッドと多段階トレーニング戦略を導入。シミュレーションと実環境で最先端の性能を達成した。
- FutureNav: 視覚言語ナビゲーションのための統合世界行動モデリングVLA/ナビゲーション2026/6/1
視覚と言語によるナビゲーション(VLN)タスクにおいて、世界状態の遷移と将来予測を明示的にモデル化する統合フレームワークを提案し、4B規模のバックボーンで複数のベンチマークで最先端性能を達成した。
- テキストと画像で考える:長期的ロボット操作のためのインターリーブ型視覚・言語推論トレース操作2026/5/1
長期的なロボット操作タスクにおいて、テキストによるサブゴールと視覚的なキーフレームを交互に配置した中間表現(トレース)を導入し、これを自己生成して動作デコーダに条件付けする新しいポリシーフレームワークを提案した。
- OA-WAM: 物体アドレス可能な世界行動モデルによるロバストなロボット操作マニピュレーション2026/5/1
物体ごとのスロット表現とアドレス機構を導入した世界行動モデルを提案し、物体の同一性と文脈を分離することで、シーン変化に対して頑健な操作を実現した。
- 一緒に歩こう:人間中心の屋外支援のための長期的社会的ナビゲーションナビゲーション2026/4/1
高レベルの自然言語指示から屋外での長期的な社会的ナビゲーションを実現する、地図不要のフレームワークを提案。GPSと公開地図APIのPOIを用いて目的地を推定し、高レベルVLMと低レベルVLAを状況に応じて切り替えることで、安全で社会的に適切な移動を実現する。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- 世界行動モデルはVLAより汎化するのか?ロバスト性の比較研究VLA2026/3/1
VLAと世界行動モデル(WAM)をLIBERO-PlusやRoboTwin 2.0-Plusで視覚・言語の摂動下に比較し、WAMの高いロバスト性を示した研究。
- MeshMimic: 3Dシーン再構成による幾何学認識型ヒューマノイド動作学習ヒューマノイド/動作生成/sim2real2026/2/1
動画から3Dシーンと人間の動きを再構成し、地形との接触を保ったままヒューマノイドロボットの動作を学習させるフレームワークを提案。
- H-WM:階層型ワールドモデルによるロボットのタスク・動作計画タスク・動作計画2026/2/1
論理空間と視覚空間の状態遷移を統合的に予測する階層型ワールドモデルを提案し、長期的なロボットタスクの計画と実行を安定化させる。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- SocialNav-Map: 人間軌道予測を用いた動的マッピングによるゼロショット社会ナビゲーション社会ナビゲーション2025/11/1
人間の軌道予測と占有マップを組み合わせ、環境ごとの追加学習なしで安全に移動できるゼロショット社会ナビゲーション手法を提案。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- RoboAfford++: ロボット操作とナビゲーションのためのマルチモーダルアフォーダンス学習向け生成AI強化データセットアフォーダンス2025/11/1
物体の機能部位や配置可能領域などのアフォーダンスを細粒度で注釈付けした87万枚超の画像と200万件のQAペアからなるデータセットを構築し、評価ベンチマークも提案した論文。
- 能動的リスク知覚による社会的ナビゲーションの学習社会的ナビゲーション2025/10/1
RGB-Dとオドメトリのみを用い、周囲の人間との衝突リスクを予測する能動的リスク知覚モジュールをFalconに追加し、混雑環境での社会的に配慮したナビゲーションを実現した。
- チームXiaomi EV-AD VLA:キャプション誘導検索システムによるクロスモーダルドローン航法VLA2025/10/1
ドローンの自然言語誘導画像検索において、VLMで候補画像のキャプションを生成し再ランキングする2段階手法を提案し、ベースラインを5%改善した。
- OmniEVA: タスク適応型3Dグラウンディングと身体性考慮推論による汎用エンボディドプランナーVLA2025/9/1
タスクに応じて3D情報の融合を切り替えるゲート付き機構と、ロボットの身体制約を推論に組み込む枠組みにより、実機で実行可能な計画を立てるエンボディドAIプランナーを提案。
- TopoNav: トポロジカルグラフを活用した高度な物体ナビゲーションナビゲーション2025/9/1
トポロジカルグラフを空間記憶として用いることで、長期的な物体ナビゲーションタスクにおける記憶管理と動的環境への対応を改善するフレームワークを提案。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- NavA³: あらゆる指示を理解し、どこへでも移動し、何でも見つけるナビゲーション2025/8/1
高レベルな人間の指示を理解し、実環境で空間認識を伴う物体ナビゲーションを行う階層型フレームワークNavA³を提案。大規模データで訓練したモデルにより、オープンボキャブラリな物体特定と精密な移動を実現した。
- 工学が知能を追い越すとき:指示誘導ナビゲーションの再考ナビゲーション2025/7/1
物体ナビゲーションにおいて、言語モデルよりもフロンティア幾何学の設計が性能の大部分を占めることを示し、言語は軽量なヒューリスティックとして使う方が信頼できると提案した。
- RoboBrain 2.0 技術報告VLA2025/7/1
視覚と言語を統合し、実環境での知覚・推論・計画を担う具現化基盤モデルRoboBrain 2.0を提案。7Bと32Bの2種類で、空間理解や時系列意思決定タスクで高い性能を示す。
- 成功への階段:LLM駆動の粗から細への探索によるオンライン階層対応ゼロショット物体目標ナビゲーションフレームワークナビゲーション2025/5/1
事前地図や再学習なしで多階層建物内の物体を目指すゼロショットナビゲーションを実現するASCENTを提案。階層表現構築とLLMによる粗密探索でHM3D/MP3Dで最高性能を達成し、四足ロボットで実機検証した。
- LiPS: 直並列構造を持つヒューマノイドロボットの大規模強化学習sim2real2025/3/1
閉ループの直並列機構をシミュレーションで直接モデル化することで、ヒューマノイドロボットの強化学習を大規模並列環境で訓練可能にする手法LiPSを提案する。
- HumanoidPano:ヒューマノイドロボットのための球面パノラマ-LiDARハイブリッドクロスモーダル知覚クロスモーダル知覚2025/3/1
パノラマ視覚とLiDARを球面ビジョントランスフォーマーで融合し、ヒューマノイドの自己遮蔽と狭視野を克服する360度BEV知覚フレームワークを提案。
- Mem2Ego: グローバル記憶と自己中心視点を統合した長期的身体性ナビゲーションナビゲーション2025/2/1
グローバルな記憶モジュールからタスク関連情報を適応的に取得し、エージェントの自己中心的な視覚入力と統合することで、長期的な物体ナビゲーションの性能を向上させるVLMベースのフレームワークを提案した。
- MapNav: 注釈付きセマンティックマップによる視覚言語ナビゲーションの新たな記憶表現VLA2025/2/1
視覚言語ナビゲーションにおいて、過去の観測フレームの代わりに注釈付きセマンティックマップを構築・更新して用いることで、記憶と計算の負荷を抑えつつ最先端性能を達成した研究。
- SpatialCoT:座標アライメントと思考連鎖による身体性タスク計画の空間推論強化VLA2025/1/1
視覚言語モデルの空間推論能力を高めるため、座標の双方向アライメントと思考連鎖に基づく空間グラウンディングを組み合わせたSpatialCoTを提案し、ナビゲーションとマニピュレーションのタスクで従来手法を上回る性能を示した。
- ET-Plan-Bench: 基盤モデルによる時空間認知に向けた身体性タスクレベル計画ベンチマークタスク計画2024/10/1
LLMによる身体性タスク計画を評価するベンチマークET-Plan-Benchを提案し、空間・時間・因果理解を要するタスクで最先端モデルの性能が大きく低下することを示した。
- 多層階ゼロショット物体ナビゲーション方策ナビゲーション2024/9/1
MLLMを活用し、複数階にまたがる未知環境で対象物体を探索するゼロショット物体ナビゲーション方策を提案し、四足歩行ロボットで実環境検証も行った。
- TriHelper: 動的支援によるゼロショット物体ナビゲーションナビゲーション2024/3/1
未知環境で特定物体へ向かうゼロショット物体ナビゲーションにおいて、衝突・探索・検出の課題を動的に支援する3つのヘルパーからなるフレームワークを提案し、HM3DとGibsonで既存手法を上回る性能を示した。