Xin Wang
Huzhou Institute of Zhejiang University
収録論文 35本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AerialDojo-200K:オープンワールド航空物体目標探索のための大規模ベンチマークスイート航空探索2026/9/28
航空エージェントが大規模3D環境を自律探索し、意味記述や参照画像で指定された物体に到達するタスクのための、既存比3倍のシーンと18.7倍のタスクを含む大規模ベンチマークを構築した。
- HarnessPAI:物理AIのための進化するハーネスVLA2026/9/24
物理AI向けに、コードを実行可能で進化可能なインターフェースとして扱い、ロールアウト内では固定プログラムで実行し、ロールアウト間では実行フィードバックでプログラムを進化させるモデル・身体非依存のフレームワークを提案。
- ForeTac-VLA: 接触の多いロボットマニピュレーションのための触覚予測に基づく視覚-言語-行動モデルVLA2026/9/17
未来の触覚状態を予測して行動生成を導く触覚・視覚・言語融合モデルを提案し、接触の多い実世界タスクで高い成功率を達成した。
- 音響駆動ミリメートル螺旋ロボット:閉鎖流体環境における超音波協調操作群制御2026/8/1
音響放射力と音響流の相乗効果を利用し、ミリメートルサイズの螺旋ロボットを制御・推進する手法を提案・実証した。
- 見えざる脅威:拡散モデルによる視覚言語行動モデルへの無制限ロボット攻撃VLA/敵対的攻撃2026/8/1
拡散モデルを用いて視覚的に自然な敵対的パッチを生成し、VLAモデルのロボット制御を攻撃する手法を提案。ホワイトボックスとブラックボックスの両設定で有効で、シミュレーションと実世界で既存手法を上回る性能を示した。
- 水中マニピュレータ用オイル充填電動関節システムの環境圧力補償とロバスト位置制御水中ロボット/制御2026/7/27
水中マニピュレータの関節が受ける高圧環境に対応するため、圧力補償モジュールの動特性を解析し、関節構造を最適化して内部油圧を密封。不確かさを考慮した動的モデルを構築し、μ合成法に基づくロバスト位置制御器を設計・実験で検証した。
- Enfold: 世界モデルの想像力を予測表現に折り畳み、超効率的な身体制御を実現VLA2026/7/1
生成モデルが未来を構築する過程で得られる中間計算を、現在の視覚と言語指示のみから予測される表現に転移させる手法を提案。推論時に生成器を実行せずに行動予測が可能となり、遅延を大幅削減。
- 自己進化型ワールドモデルのための反事実的制御可能性を備えた自律ビデオ生成ワールドモデル2026/6/23
ビデオ生成モデルを自己進化型ワールドモデルへ発展させるため、介入条件付き未来生成、身体性制約への結合、分布シフト下での検証、生存ブランチの蒸留からなる4段階閉ループ最適化と対応する評価指標を提案した。
- エージェント型AIによるポリシー駆動物理層システムの二段階長期最適化最適化/通信2026/6/23
ネットワーク運用者のポリシー変化やリアルタイム制約に対応するため、エージェント型AIを用いた二段階最適化フレームワークを提案し、セルフリーMIMOビームフォーミングで長期性能を57.2%向上させた。
- 言語エージェントのための方策と世界モデルの同時学習言語エージェント2026/6/1
強化学習のロールアウトから得られる遷移データを利用し、方策学習と同時に世界モデルを補助的に学習するフレームワークPaWを提案。推論時の追加コストなしでエージェント性能を向上させる。
- 身体性AIにおける安全性:リスク、攻撃、防御のサーベイ安全性2026/5/1
身体性AIの安全性に関する研究を、知覚から計画、行動、相互作用までのパイプライン全体にわたって体系的にレビューし、攻撃と防御の多層的な分類法を提案した論文。
- LSGS-Loc: 大規模UAVシナリオ向けの堅牢な3DGSベースの視覚位置推定視覚位置推定2026/4/1
大規模なUAV環境での視覚位置推定を強化するため、スケール認識の初期化とラプラシアンに基づく信頼性マスキングを導入した3DGSベースのパイプラインを提案した。
- 形状解釈可能な視覚的自己モデリングによる幾何認識連続体ロボット制御連続体ロボット制御2026/3/1
連続体ロボットの形状をベジェ曲線で表現し、ニューラルODEで自己モデル化することで、幾何を考慮したハイブリッド形状・位置制御を実現した。
- QuantVLA: 視覚言語行動モデルのためのスケール校正済み訓練不要ポストトレーニング量子化VLA2026/2/23
VLAモデルを訓練なしで低ビット量子化する初のPTQフレームワークを提案し、拡散トランスフォーマの行動ヘッドも量子化してメモリを約70%削減しつつ成功率を向上させた。
- 3D空間における長期的視覚生成とナビゲーションのための航空世界モデルナビゲーション2025/12/1
UAVのナビゲーション向けに、過去のフレームと行動から将来の視覚観測を予測する世界モデルANWMを提案し、候補軌道を意味的妥当性で評価することで大規模3D環境での自律飛行性能を向上させた。
- PosA-VLA: 姿勢条件付きアンカー注意による行動生成の強化VLA2025/12/1
VLAモデルの視覚注意を姿勢情報で誘導し、タスクに関連する領域に集中させることで、冗長な動きを抑え精密で効率的な行動生成を実現した研究。
- 身体性AI:LLMから世界モデルへ身体性AI2025/9/1
大規模言語モデル(LLM)と世界モデル(WM)が身体性AIをどのように推進するかを、基礎から最新動向まで包括的にサーベイした論文。
- U2UData+:身体的長期タスク向けスケーラブルな群UAV自律飛行データセット群制御2025/9/1
15機のUAVによる群自律飛行で長期依存や動的な目標変化を扱う身体的長期タスク向けの大規模データセットと、オンライン収集・閉ループ検証プラットフォームを構築した。
- EvolvingAgent: 長期タスクのためのカリキュラム自己進化エージェントと継続的世界モデルVLA2025/2/1
人間の介入なしに自己計画・自己制御・自己反省を通じて長期タスクを遂行するエージェントを提案し、LLMとマルチモーダル経験を活用した計画、世界モデルに基づく行動制御、カリキュラム学習による反省機構を統合した。
- 最適化ベースの視覚慣性ナビゲーションシステムのための汎用オンライン時間キャリブレーション視覚慣性ナビゲーション2025/1/1
視覚慣性ナビゲーションにおいて、カメラとIMU間の時間オフセットを最適化の状態変数として組み込み、オンラインで推定する汎用手法を提案。EuRoCとシミュレーションで精度と収束速度の向上を示した。
- U2UData: 群ロボットUAVの自律飛行のための大規模協調知覚データセット群制御2024/8/1
3機のUAVが自律飛行して収集したLiDAR・RGB・深度データと3Dアノテーションを含む、群UAV協調知覚のための初の大規模データセットを構築し、協調3D物体検出・追跡のベンチマークを提供した。
- A Generic Stochastic Hybrid Car-following Model Based on Approximate Bayesian Computation2023/12/1
- 3D Pose Estimation of Tomato Peduncle Nodes using Deep Keypoint Detection and Point Cloud2023/11/1
- On-the-Fly SfM: What you capture is What you get2023/9/1
- Semantics-Aware Next-best-view Planning for Efficient Search and Detection of Task-relevant Plant Parts2023/6/1
- RMBench: Benchmarking Deep Reinforcement Learning for Robotic Manipulator Control2022/10/1
- Instance-Aware Predictive Navigation in Multi-Agent Environments2021/1/1
- Deep Visual Odometry with Adaptive Memory2020/8/1
- Sequential Adversarial Learning for Self-Supervised Deep Visual Odometry2019/8/1
- Local Supports Global: Deep Camera Relocalization with Sequence Enhancement2019/8/1
- Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation2018/11/1
- Guided Feature Selection for Deep Visual Odometry2018/11/1
- PSDF Fusion: Probabilistic Signed Distance Function for On-the-fly 3D Data Fusion and Scene Reconstruction2018/7/1
- An Efficient Volumetric Mesh Representation for Real-time Scene Reconstruction using Spatial Hashing2018/3/1
- Look Before You Leap: Bridging Model-Free and Model-Based Reinforcement Learning for Planned-Ahead Vision-and-Language Navigation2018/3/1