Dongxiu Liu
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ODEWorld: 物理時間の流れに基づく連続予測アーキテクチャ世界モデル2026/7/1
物理世界の連続的な時間を捉えるため、常微分方程式(ODE)を用いた連続時間の潜在世界モデルを提案し、離散時間モデルの限界を克服した。
- X-Tokenizer: 視覚・言語・行動事前学習のためのマルチモーダル行動トークナイザーVLA2026/6/1
ロボットの行動を離散コードに変換する際、単なる再構成ではなく意味的なインターフェースとして学習する新しいトークナイザーを提案。マスク行動モデリングと対照学習により、行動コードが視覚言語の意味と整合するようにした。
- HoloQ-VLA: 視覚言語行動モデルの一様W4A4量子化VLA/量子化2026/5/27
視覚言語行動モデルを、拡散アクションヘッドを含む全体を一様に4ビット量子化する訓練不要のフレームワークを提案し、性能を維持しつつメモリを大幅削減した。
- Wall-OSS-0.5 技術報告書VLA2026/5/1
大規模VLA事前学習がロボットの実行可能な行動を直接生み出すかを検証し、ゼロショットで実ロボット動作を達成するオープンソース4Bモデルを提案した。
- ManipArena:推論指向の汎用ロボットマニピュレーションの実世界包括評価マニピュレーション2026/3/1
実機ロボットでのマニピュレーション汎化を公平に評価するため、20タスク・1万超の専門家軌道・約188時間分のデータを備えた標準化ベンチマークを構築し、VLAやワールドアクションモデルなど7構成を比較した。
- ロボットマニピュレーション方策のための行動空間設計の謎を解くマニピュレーション2026/2/1
双腕ロボットでの大規模実験により、模倣学習における行動空間の設計(絶対vs差分、関節空間vsタスク空間)が方策の学習性と制御安定性に与える影響を体系的に分析した。
- X-VLA:ソフトプロンプト付きTransformerによるスケーラブルなクロスエンボディメント視覚言語行動モデルVLA2025/10/1
多様なロボットのデータ源ごとに学習可能なソフトプロンプトを割り当てることで、異なる機体を横断して学習できる汎用VLAモデルX-VLAを提案し、6つのシミュレーションと3体の実機でSOTA性能を示した。
- PhysiAgent: 実世界で動作する身体性エージェントフレームワークVLA2025/9/1
VLMとVLAを監視・記憶・自己反省機構とツールボックスで統合し、VLAの能力を最大限に引き出す身体性エージェントフレームワークを提案。複雑な実世界ロボットタスクでの性能向上を実証した。
- 潜在空間後方計画による効率的なロボット政策学習ロボット計画2025/5/1
最終目標から逆算して潜在空間で中間サブゴールを予測する後方計画手法を提案し、長期的なタスクにおけるリアルタイム制御を効率化した。
- ユニバーサルアクションによる具現化基盤モデルの強化VLA2025/1/1
多様なロボットの動作を共通の「ユニバーサルアクション空間」で表現し、異なる機体間でのデータ活用と汎化性能を高める具現化基盤モデルUniActを提案。0.5Bパラメータで14倍規模の既存モデルを上回る。