Jiahua Dong
収録論文 9本 ・ フィジカルAI/ロボット学習
VLAナビゲーションマニピュレーション表現学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 履歴行動軌跡からのスキル学習:世界行動モデルのための行動経験辞書VLA2026/9/30
過去の行動軌跡を共有埋め込みとして辞書化し、操作タスク間でスキルを再利用できるようにした世界行動モデルを提案。
- LEEVLA: 潜在環境進化における重要情報の認識による視覚言語行動モデルVLA2026/7/9
視覚言語行動モデルが動的環境でタスクに重要な視覚情報を強調し、潜在世界表現の構造的進化を保つための新しいアーキテクチャを提案。ドリフト誘導型動的優先化と構造的特徴フロー生成により、タスク認識の「どこで・どのように」学習を実現し、ベンチマークで優れた性能を示した。
- 生涯学習型身体化ナビゲーション学習ナビゲーション2026/3/1
大規模言語モデルを用いた身体化ナビゲーションエージェントが、複数のタスクを連続的に学習しながらも過去の知識を保持できる生涯学習フレームワークUni-Walkerを提案した。
- 生涯にわたる言語条件付きロボット操作学習マニピュレーション2026/3/1
本論文では、ロボットが複数の操作スキルを継続的に学習しつつ、古いスキルの忘却を防ぐフレームワーク「SkillsCrafter」を提案する。
- 視覚環境構造の捉え方が制御性能と相関する表現学習2026/2/1
事前学習済み視覚エンコーダが環境状態(幾何・物体構造・物理属性)をどれだけデコードできるかを測ることで、下流のロボット制御性能を予測できることを示した研究。
- SeqWalker: 階層的計画による逐次視野言語ナビゲーションVLA2026/1/1
長期的な多タスク指示を階層的計画で分割し、視覚観察に基づくサブ指示選択と探索検証で軌道誤りを修正する視野言語ナビゲーションモデルを提案。
- PixelVLA:視覚言語行動モデルにおけるピクセルレベル理解の推進VLA2025/11/1
ピクセル単位のシーン理解とテキスト・画像のマルチモーダル指示に対応したVLAモデルを提案し、大規模ピクセル注釈データセットで学習することで、低コストながら操作成功率を大幅に向上させた。
- ロボットマニピュレーションのための終わりなき行動クローニングエージェントマニピュレーション2024/3/1
言語条件付きで新たな3Dシーン意味論と操作スキルを継続的に学習する終わりなき行動クローニングエージェントNBAgentを提案し、ベンチマークで有効性を示した。
- Generative Partial Visual-Tactile Fused Object Clustering2020/12/1