Xinyu Zhou
Nanyang Technological University
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 高速計画と忠実な行動:階層型視覚言語行動モデルにおける計画・実行ギャップの解消VLA2026/9/25
階層型VLAの計画器と実行器の不一致を分析し、ブロック自己回帰デコーディングと正規化ゴール変調で計画遅延を8.7倍削減しつつ計画の活用を改善した。
- 統一条件・行動モデリングによる高精度ワンステップ行動生成マニピュレーション2026/8/17
条件と行動を共有トークン空間で統一的にモデリングするUCA-Flowを提案し、推論速度を大幅に向上させつつ成功率を9.3ポイント改善した。
- 物理的インタラクションの学習:触覚・力覚を考慮したロボット学習のサーベイ触覚・力覚学習2026/8/1
触覚・力覚センシングを統合したロボット学習手法を、マルチモーダルかつ多段階のシステム設計の観点から統一的な分類学TF-ARTを用いて整理し、今後の研究課題を考察したサーベイ論文。
- GigaWorld-1: ロボットポリシー評価のためのワールドモデル構築ロードマップワールドモデル2026/7/1
ロボットポリシーの評価を効率化するため、ワールドモデルの信頼性を体系的に研究し、ベンチマークWMBenchを構築して、7つのビデオワールドモデルと4つの行動表現を比較した。
- GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現VLA2026/7/1
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
- 接触を伴うロボット操作のための表現整合型触覚グラウンディング触覚/VLA/操作2026/7/1
触覚強化型VLAポリシーにおいて、将来の触覚状態を予測する中間表現の位置を特定し、軽量な潜在触覚予測器(LTP)を導入して行動表現と接触結果を整合させる手法を提案した。実機の接触を伴う操作タスクで有効性を実証した。
- 統一空間意味プロンプトによる身体化視覚追跡と潜在ダイナミクス学習視覚追跡2026/6/24
身体化視覚追跡において、言語のみのターゲット指示では曖昧さが生じる問題を解決するため、空間的・意味的プロンプトを統合したフレームワークUSSを提案し、実ロボット実験で有効性を示した。
- EM-Fall: ヒューマノイドロボットによる昼夜を問わない転倒検知のための身体化ミリ波センシング転倒検知2026/6/1
移動型ヒューマノイドロボットにミリ波センシングを統合し、視点を能動的に調整して遮蔽や照明条件に影響されずに転倒を検知するフレームワークを提案した。
- ATHENA: ロボットデータキュレーションのための高速マルチタスク異種影響関数データキュレーション2026/6/1
大規模VLAモデルの模倣学習において、各デモの影響を高速に計算する影響関数フレームワークATHENAを提案し、50%のデータで全データ学習と同等以上の性能を達成した。
- 空間プロンプトを用いたエゴセントリック操作の視覚軌道予測操作/軌道予測2026/5/19
ロボット操作のタスク指示を空間的なプロンプト(バウンディングボックスや点)で行う新しい設定を提案し、エゴセントリック映像から将来のエンドエフェクタ軌道を予測する手法を開発した。
- BiPneu: ソフトロボットのための双極圧空気圧システムの設計と制御ソフトロボティクス/空気圧制御2026/5/1
ソフトロボット用に、正負両圧力を高精度・高速に調整できる多チャンネル空気圧システムBiPneuを提案し、ヒステリシス付きデュアルモードスライディングモード制御によりPIDやMPCより優れた追従性能を実証した。
- Gaze2Act: 視線条件付き視覚言語行動ポリシーによる対話的ロボット操作VLA2026/5/1
人間の視線を意図信号として活用し、ロボット操作の精度を高める新しいVLAフレームワークを提案した論文。
- コンプライアント蠕動ロボットの動的モデリングとロバスト歩容最適化歩行2026/4/1
波形パイプを移動するコンプライアント蠕動ロボットのハイブリッド動的モデルとエネルギー消費モデルを構築し、速度と消費電力のトレードオフを考慮したロバストな歩容最適化フレームワークを提案した。
- グレートマーチ100:身体性AIエージェント評価のための100の詳細指向タスクVLA評価ベンチマーク2026/1/1
ロボット学習の評価に向けて、多様な相互作用とロングテール行動を網羅する100の詳細設計タスク「GM-100」を提案し、複数のVLAモデルの性能差を明確に評価できることを示した。
- 軌道品質を重視した群衆ナビゲーション性能向上のための新手法群衆ナビゲーション2025/12/1
群衆ナビゲーションの評価指標の優先順位を整理し、軌道の曲率を明示的に最適化する報酬設計を提案して、2D/3D実験で従来手法を上回る性能を示した。
- 視覚シンボルによるマニピュレーション失敗の診断・修正・学習VLA2025/12/1
視覚シンボルを用いてロボットマニピュレーションの失敗を診断し、テキストと視覚の両方で修正ガイダンスを提供するフレームワークViFailbackを提案し、大規模データセットとベンチマークを構築した。
- AFT: ソフトロボットのマーカーレス・学習不要形状復元のための外観ベース特徴追跡ソフトロボティクス2025/11/1
ソフトロボットの表面模様を暗黙のマーカーとして利用し、マーカーや学習データなしでリアルタイムに形状を追跡・復元する視覚手法を提案した。
- 効率的な視覚運動学習のためのL1サンプルフロー模倣学習2025/11/1
フローマッチングの多峰性を保ちつつ、L1回帰の効率性を活かすため、2ステップでサンプリングするL1 Flowを提案し、模倣学習ベンチマークで有効性を示した。
- IndustryNav: 動的産業環境における身体性エージェントの空間推論ベンチマークナビゲーション2025/11/1
動的な倉庫を再現したUnity環境で、視覚言語モデルによる能動的なナビゲーションと空間推論を評価する初の産業向けベンチマークを提案し、最先端モデルの安全性や計画能力の課題を明らかにした。
- FieldGen: 遠隔操作の前操作軌道からフィールド誘導データ生成へデータ生成2025/10/1
操作を前操作段階と精密操作段階に分け、人間の実演から引力場を構築して多様な軌道を自動生成することで、少ない人手で高品質な実世界データを収集する枠組みを提案。
- メタ学習による高速オンライン適応型ニューラルMPCモデル予測制御2025/4/1
メタ学習を用いて残差ダイナミクスを少数ショットで適応させ、計算効率の良いMPCパイプラインに組み込むことで、リアルタイムなモデル補正と予測精度向上を実現した。
- ツイスト・コイル人工筋で駆動する2自由度ロボット手首の設計・動的モデリング・制御マニピュレーション2025/3/1
ツイスト・コイル人工筋(TCAs)と3RRRR並列機構で駆動する2自由度ロボット手首を設計し、ラグランジュ動的モデルに基づくNMPCで軌道追従制御を実現、PIDとの比較実験とソフトアームへの統合で有効性を示した。
- 異種関係深層強化学習による分散型マルチロボット群衆ナビゲーション群衆ナビゲーション2024/3/1
ロボットと群衆の異種関係をグラフで表現するGNNを強化学習に組み込み、分散型マルチロボットの群衆ナビゲーションを安全かつ快適に実現した研究。
- NBMOD: Find It and Grasp It in Noisy Background2023/6/1
- Nanorobot queue: Cooperative treatment of cancer based on team member communication and image processing2021/11/1