Jiahao Li
Ant Group
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CASD: チャンク整合セマンティック蒸留による多段階ロボット操作マニピュレーション2026/9/8
行動チャンク全体に対するセマンティックな目標を生成し、ポリシー学習を改善する手法を提案。オフラインVLMでデモを段階に分割し、その重み付き目標を予測するジェネレータを訓練し、ポリシーを条件付けする。
- Lingjing: オープンエンドな都市におけるマルチエージェント具現化タスクのためのシミュレーションテストベッドシミュレーション2026/8/8
異種エージェント(UAV、地上ロボット、自動運転車)が協調する都市環境を再現するシミュレーションプラットフォームを提案し、12の視覚言語モデルを9つの都市タスクで評価した。
- FreqNav: 物体指向型空中視覚言語ナビゲーションのための段階的周波数ルーティングVLA2026/8/1
空中VLNタスクにおいて、ナビゲーション段階に応じて視覚トークンの周波数成分を動的に再配分する軽量な適応認識フレームワークFreqNavを提案し、ベースラインを上回る性能と約3倍の推論高速化を実現した。
- PhysX-CoT: 単一画像からシミュレーション対応3Dアセットへの構造化物理推論3D生成2026/8/1
単一画像からシミュレーション対応の3Dアセットを生成する際、物理的推論を明示的な構造化プロセスとして扱う手法を提案。部品レベルの状態を段階的に予測し、幾何学と物理属性の精度を向上させる。
- CAC-VLA: 視覚言語行動モデルのための文脈ゲート型行動条件付けVLA2026/7/1
VLAモデル内に軽量な潜在行動インターフェースを導入し、文脈ゲートで行動エキスパートへの影響を調整することで、ロボット操作の成功率を向上させた。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- VLA-Arena: 視覚言語行動モデルを評価するためのオープンソースベンチマークフレームワークVLA2025/12/1
VLAモデルの能力限界と失敗モードを定量化するため、タスク構造・言語・視覚の3軸で難易度を設計した170タスクのベンチマークを提案し、最先端モデルの汎化不足や安全性軽視を明らかにした。
- LLM駆動の自己洗練による実体ドローンタスクプランニングドローン計画2025/8/1
産業用ドローンのタスク計画において、連続状態評価と階層的ビヘイビアツリー修正によりLLMが経験から自己洗練するシステムSRDroneを提案し、成功率を大幅に向上させた。
- 離散微分幾何学を活用した二層ソフトロボティクスの仮想実験場ソフトロボティクス/シミュレーション2025/2/1
離散弾性ロッドモデルに基づく新しいシミュレーション環境を構築し、二層ソフトロボットの把持・這行・跳躍・遊泳などの動的挙動を接触を含めて高精度に再現できることを示した。
- Roman: Making Everyday Objects Robotically Manipulable with 3D-Printable Add-on Mechanisms2022/5/1