Hongyu Ding
収録論文 6本 ・ フィジカルAI/ロボット学習
ナビゲーション移動操作シミュレーション/データ生成能動的探索
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HAM-VLN: 階層的エージェント記憶を活用したゼロショット視覚言語ナビゲーションナビゲーション2026/7/1
ロボットが未知環境で指示に従って移動する際、画像や地図の代わりにエージェント自身が書き込む永続的な世界グラフを記憶として使い、次の行動選択と同じLLM呼び出しで記憶も更新することで、長期的なナビゲーションの記憶・推論ボトルネックを解消した。追加のLLM呼び出しなしで文脈長を65%以上削減しつつ、複数のナビゲーションベンチマークで最高性能を達成した。
- Uni-LaViRA: 言語・視覚・ロボット行動の翻訳による統合具現化ナビゲーションナビゲーション2026/5/1
ナビゲーションの意思決定構造を言語と視覚の行動出力に分解し、事前学習済みMLLMを活用してゼロショットで4つのタスクと4種類のロボットに適用する統合エージェントアーキテクチャを提案した。
- MoMaStage: スキル状態グラフによる計画と閉ループ実行を統合した長期的屋内移動操作移動操作2026/3/1
屋内移動操作ロボット向けに、明示的なシーン地図を使わず、階層スキルライブラリとトポロジー認識スキル状態グラフでVLMの計画を制約し、閉ループ実行で堅牢性を高めるフレームワークを提案した。
- V-Dreamer: ビデオ生成事前知識によるロボットシミュレーションと軌道合成の自動化シミュレーション/データ生成2026/3/1
自然言語の指示から、シミュレーション可能な3D環境と実行可能なロボット軌道を自動生成するフレームワークを提案。ビデオ生成モデルを動作の事前知識として活用し、シミュレーションから実世界への転移を実現した。
- SEA: 不確実領域の能動的探索のための意味地図予測能動的探索2025/10/1
観測から地図の欠損領域を反復予測し、予測と実地図の差分を強化学習で探索に活かすことで、限られた時間で高精度な意味地図を構築する手法を提案。
- LaViRA: 連続環境におけるゼロショット視覚言語ナビゲーションのための言語・視覚・ロボット行動翻訳ナビゲーション2025/10/1
自然言語指示に基づき未学習の連続環境をナビゲートするゼロショット手法。行動を言語・視覚・ロボットの3階層に分解し、各段階で異なる規模のマルチモーダル大規模言語モデルを活用することで、汎化性能と実機制御の効率を両立した。