Zihang Wang
Southeast University
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TLC-DiT: タスク整合型局所視覚条件付けによる堅牢なマルチタスクロボットマニピュレーションマニピュレーション2026/9/28
拡散トランスフォーマーポリシーにタスク誘導の局所視覚特徴マップを明示的に追加し、LIBEROや実機双腕タスクで成功率と視覚変化への堅牢性を向上させた。
- MeshPriorDiT: 行動条件付き布地ダイナミクスのための階層的モデリング布地シミュレーション2026/8/27
布地の動き予測を、メッシュGNNによる構造化された事前分布と、拡散トランスフォーマーによる生成的な残差に分解する階層モデルを提案し、長距離の協調と局所的な変形を両立させて予測精度を大幅に向上させた。
- H-PACハンド:劣駆動ロボットハンドの制御指向モデリングと腱弾性補償ハンド制御2026/8/17
腱駆動の劣駆動ハンドにおける腱伸びによる関節誤差を補償する制御手法を提案し、6アクチュエータ・15自由度のハンドで精度を大幅に改善した。
- Max-Q選択的模倣による人間参加型オンラインロボット学習強化学習2026/8/15
人間の介入を活用したオンライン強化学習において、介入軌道を直接評価するMC Q-chunk批判と、現在のポリシーとバッファサンプルのうち高いQ値を持つ方を模倣するmax-Q選択的模倣を組み合わせ、介入学習と自己改善を自動的に切り替える手法を提案した。実機のUSB挿入タスクで99%の成功率を30分で達成した。
- ParkingTransformer: LLM強化による自動駐車のためのエンドツーエンド軌道計画自動駐車/軌道計画/LLM2026/6/1
本論文は、マルチビュー知覚と大規模言語モデル(LLM)のシーン理解能力を組み合わせ、軌道クエリとLLMの暗黙状態特徴を利用して、高密度BEV表現を必要とせずに計画軌道を直接出力する自動駐車フレームワークを提案する。3D位置エンコーディングと固定ウィンドウストリーミング機構を導入し、空間認識と時間処理効率を向上させ、粗密デコード戦略で軌道精度を高める。CARLAシミュレータと実車実験で有効性を検証した。
- MPTF-Net: LiDAR位置認識のためのマルチビュー・ピラミッドTransformer融合ネットワーク位置認識2026/4/1
LiDARベースの位置認識において、NDTによるBEV表現とレンジ画像を多スケールのTransformerで融合し、高精度かつ高速な位置認識を実現した。
- Agile-VLA: 暗黙的アフォーダンスアンカリングによる少数ショット産業用姿勢補正VLA/エッジ推論/姿勢補正2026/3/1
エッジデバイス上でVLAモデルを動かす際の高遅延と高周波制御の矛盾を解決するため、幾何学的視覚手がかりをパラメトリック動作プリミティブに直接マッピングする階層的フレームワークを提案し、5ショットのデモで複雑なワークの姿勢補正を実現した。
- Wild-Drive: 頑健なマルチモーダルルーティングと効率的な大規模言語モデルによるオフロードシーン記述と経路計画自動運転/経路計画2026/3/1
オフロード環境でのシーン記述と経路計画を統合するフレームワークWild-Driveを提案。センサ劣化時に信頼できる情報を適応的に集約するMoRo-Formerと効率的なLLMを用い、劣化条件下でも安定した性能を実現。
- PHANTOMハンド:腱駆動型劣駆動ハンドにおける精密運動学とコンプライアント把持の統合ハンド/把持2026/3/1
腱駆動型劣駆動ハンドの運動学的予測不能性と非線形力伝達を解決するため、6アクチュエータ・15自由度のモジュラーハンドを開発し、解析的運動学と力学補償モデルを統合して精密な指先制御と安定把持を両立した。
- HiMemVLN:階層的記憶システムによるオープンソースゼロショット視覚言語ナビゲーションの信頼性向上VLA2026/3/1
オープンソースLLMを用いた視覚言語ナビゲーションにおける「ナビゲーション健忘」問題を分析し、階層的記憶システムを導入することで性能を約2倍に改善した研究。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。