Shuo Wang
収録論文 54本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AquaWorld:ロボットシミュレーションのための構造整合型水中世界生成sim2real2026/9/19
地形構造を共有することで、地形・シーン構成・タスク・水流が互いに整合する多様な水中環境を自動生成するフレームワークを提案し、構造を保ったランダム化が方策学習や実機へのsim2real転移を改善することを示した。
- CoLMIN: LLMに基づく協調自動運転のためのマルチ決定経路交渉協調自動運転2026/9/4
複数車両の協調自動運転において、LLMの推論能力を活用し、複数の運転意図を生成・評価する交渉フレームワークCoLMINを提案。浅い反射と深い反射を組み合わせて、複雑な交通シナリオでの安定した合意形成を実現する。
- HiTac-WAM: 接触を伴うロボット操作のための階層的触覚ワールドアクションモデル触覚/操作2026/8/20
触覚状態を接触状態、3D変形場、滑りリスクの階層として予測するワールドアクションモデルを提案し、予測と実測のずれに基づく再計画で操作性能を向上させた。
- FeelWorld: 階層的接触予測と計画のための視触覚ワールドモデル触覚2026/7/1
視覚と触覚を統合した階層的ワールドモデルを提案し、将来の視覚特徴と接触・滑り状態を予測することで、接触を伴う操作タスクの計画を改善する。
- 局所動作が重要:ビデオからの強化学習事前学習のための分解・再構成パラダイム強化学習/事前学習2026/7/1
ビデオから強化学習の事前学習を行う際、エージェント全体の動きではなく局所的な動きのパターンに着目し、分解と再構成のパラダイムを提案して、ロボット制御や操作タスクへの転移効率を向上させた。
- TacPrint: ヒトからロボットへの接触再現のためのウェアラブル指先触覚センサ触覚2026/7/1
指先に装着する触覚センサTacPrintを開発し、容量変化から接触深さマップを推定する実-to-sim-to-realパイプラインを構築。触覚ガイドによる補償で把持・拭き取り成功率を大幅に向上させた。
- 視覚強化学習の汎化のためのタスク関連表現の分離強化学習2026/7/1
視覚強化学習の汎化性能向上のため、観測をタスク関連・非関連表現に分離する自己教師ありアルゴリズムT2RDを提案した。
- VLA評価のためのシミュレーションと実世界の相関を改善する実践的レシピVLA評価/sim2real2026/6/1
シミュレーションと実世界の評価結果の相関を体系的に分析し、VLAポリシーの評価や改善にシミュレーションを効果的に活用するための指針を提供する研究。
- Labimus: 化学実験室における人型器用操作のためのシミュレーションとベンチマークシミュレーション/ベンチマーク2026/6/1
有機化学実験室での人型ロボットによる精密な器用操作を評価する初のベンチマークを提案し、実世界の作業台を再現したシミュレーション環境と精密さを考慮した評価プロトコルを導入した。
- スパースひずみセンサによる表面形状センシングのためのエンコーダ・デコーダを用いたクロスセンサ適応手法センサ適応2026/6/1
センサアレイ間の性能差による形状センシングの不一致を解決するため、メタ学習と少数ショット適応を組み込んだエンコーダ・デコーダアーキテクチャを提案し、新規センサアレイで少ないラベルデータと短時間で高精度な適応を実現した。
- FTP-1: 触覚センサを横断する接触リッチ操作のための汎用基盤触覚ポリシー触覚/基盤モデル2026/6/1
多様な触覚センサとロボット構成に対応する初の汎用基盤触覚ポリシーFTP-1を提案し、約3000時間のデータで事前学習して未見センサへの転移を実証した。
- オープンループ指標はクローズドループ運転を予測できるか?NAVSIMとBench2Driveのクロスベンチマーク相関研究自動運転評価2026/5/1
自動運転プランナーのオープンループ評価指標が実際のクローズドループ性能を予測できるかを、NAVSIMとBench2Driveの公開結果を比較して検証した論文。
- オンライン逐次学習に基づくカスタムリストバンドによる関節角度推定ウェアラブルセンサ2026/5/1
カスタムリストバンドとオンライン逐次学習を用いて手首関節角度を推定するシステムを提案。データ収集中にモデルを学習し、異なる装着条件や被験者間のデータドリフトに適応する。
- GSDrive: 3Dガウススプラッティング環境によるマルチモード将来軌道探索で運転方針を強化自動運転2026/4/1
模倣学習と強化学習を組み合わせ、3Dガウススプラッティング環境で将来軌道を探索して密な報酬を生成し、エンドツーエンド自動運転のポリシーを改善するフレームワークを提案した。
- 推論時適応アクションチャンキングによる視覚言語行動モデルの性能向上VLA2026/4/1
VLAモデルにおいて、アクションのチャンクサイズを予測のエントロピーに基づいて適応的に決定する戦略を提案し、シミュレーションと実世界の操作タスクで性能を向上させた。
- UniUncer: エンドツーエンド運転のための統合動的・静的不確かさ自動運転2026/3/1
エンドツーエンド運転プランナーにおいて、静的マップ要素と動的エージェントの両方の不確かさを統合的に推定・活用する軽量フレームワークを提案。
- ETA-VLA: 時間融合とLLM内スパース化による視覚言語行動モデルの効率的トークン適応VLA/自動運転2026/3/1
自動運転向けVLAモデルの計算負荷を減らすため、過去フレームの冗長な視覚トークンをテキストガイドと時間的一貫性で間引くフレームワークを提案し、精度を保ちつつ推論FLOPsを大幅削減した。
- FG-CLTP: ロボット操作のための細粒度対比言語触覚事前学習触覚2026/3/1
触覚センサデータを言語と対比学習で結びつけ、力の大きさや接触形状などの定量的な接触状態を捉える細粒度表現を獲得し、操作タスクの性能を向上させるフレームワークを提案した。
- SpikingTac:高精度動的触覚インプリント追跡のための小型ニューロモルフィック視触覚センサ触覚2026/2/1
低コストで小型なイベントカメラモジュールを組み込んだニューロモルフィック触覚センサを開発し、粘弾性ヒステリシスを考慮した更新則により1000Hzの知覚と350Hzの追跡を実現した。
- HiST-VLA:階層的時空間視覚言語行動モデルによるエンドツーエンド自動運転VLA2026/2/1
3D空間認識と時系列推論を強化した階層的VLAモデルを提案し、動的トークン統合と階層的プランナーで軌道生成を高精度化、NAVSIM v2で最高性能を達成した。
- MapDream:視覚言語ナビゲーションのためのタスク駆動型地図学習VLA2026/2/1
視覚言語ナビゲーションにおいて、ナビゲーション目的に直接最適化されたBEV地図を自己回帰的に生成し、行動予測と統合学習するフレームワークを提案。
- LDA-1B:汎用身体データ取り込みによる潜在ダイナミクス行動モデルのスケーリングVLA2026/2/1
異種の身体データからダイナミクス・方策・視覚予測を統合学習する10億パラメータのロボット基盤モデルを提案し、接触・器用・長距離タスクで性能を向上させた。
- DexTac: 手ごと教示による接触を考慮した視触覚ポリシーの学習マニピュレーション2026/1/1
人間の教示から接触力分布と接触領域を取得し、視触覚ポリシーに組み込むことで、器用な手が複雑な接触作業を自律的に行えるようにしたフレームワーク。
- SG-CADVLM: 事故報告から安全-criticalシナリオを生成する文脈認識デコーディング搭載視覚言語モデルVLA2026/1/1
事故報告書から自動運転の安全検証用シナリオを生成するため、文脈認識デコーディングとマルチモーダル入力を組み合わせたVLMフレームワークを提案し、高リスクシナリオ生成率を大幅に向上させた。
- PEAfowl: 知覚強化型マルチビュー視覚-言語-行動モデルによる両腕マニピュレーションVLA2026/1/1
両腕ロボット操作のためのVLAモデル。トークンごとの深度分布予測と微分可能な3Dリフティングで視点間の幾何学的整合性を高め、Perceiver型のテキスト認識読み出しで指示の接地を改善。訓練時のみの深度蒸留でノイズの多い深度を補い、RoboTwin 2.0で成功率を23ポイント向上させた。
- UPETrack: 遮蔽された変形可能な線状物体の追跡のための単方向位置推定変形可能物体追跡2025/12/1
変形可能な線状物体(DLO)の追跡において、遮蔽領域を幾何学的連続性と時間的進化パターンに基づく単方向位置推定(UPE)で予測するフレームワークを提案し、物理モデルやマーカーなしで高精度な追跡を実現した。
- ArtiBenchとArtiBrain:汎化可能な視覚言語による関節物体操作のベンチマークマニピュレーション2025/11/1
関節物体操作の汎化性能を評価する5段階ベンチマークArtiBenchと、VLM推論と拡散制御を組み合わせたモジュール型フレームワークArtiBrainを提案し、既存手法を上回る性能を示した。
- Progress-Think: 視覚言語ナビゲーションのための意味的進捗推論VLA2025/11/1
視覚観測から指示文の進捗を意味的に推論し、ナビゲーション方策を導く三段階フレームワークを提案。R2R-CEとRxR-CEで最高性能を達成。
- オフロード自動運転の進展:大規模ORAD-3Dデータセットと包括的ベンチマーク自律走行データセット2025/10/1
オフロード自動運転向けの大規模データセットORAD-3Dを構築し、知覚・計画に関する5つのタスクのベンチマークを整備した論文。
- FlowDrive: エンドツーエンド自動運転のためのエネルギーフローフィールド自動運転/プランニング2025/9/1
リスクポテンシャルと車線引力場という物理的に解釈可能なエネルギーフローフィールドをBEV空間に導入し、拡散プランナで軌道生成する自動運転フレームワーク。NAVSIM v2でEPDMS 86.3のSOTAを達成。
- シミュレーションと実世界の最良を活かす:シミュレーションでの制御学習と実世界での知覚による分離型視覚運動マニピュレーションsim2real2025/9/1
制御方策をシミュレーションで学習し、知覚のみを実環境で適応させる分離フレームワークを提案。10〜20回の実演で高いデータ効率と分布外汎化を実現した。
- MonoDream:パノラマドリーミングによる単眼視覚言語ナビゲーションVLA2025/8/1
単眼入力のみでパノラマRGB-D相当の空間表現を潜在空間で学習し、視覚言語ナビゲーションの性能を向上させる軽量VLAフレームワークを提案。
- 第9回AIシティチャレンジコンピュータビジョン2025/8/1
交通・産業・公共安全分野におけるコンピュータビジョンとAIの実応用を推進する第9回AIシティチャレンジの概要。4つのトラックで245チームが参加し、3Dマルチカメラ追跡や交通安全のビデオQA、倉庫での空間推論、魚眼カメラの物体検出などが競われた。
- IRL-VLA:逆強化学習報酬ワールドモデルによる視覚言語行動ポリシーの訓練VLA2025/8/1
逆強化学習で軽量な報酬ワールドモデルを構築し、PPOによる閉ループ強化学習でVLAポリシーを訓練する手法を提案。NAVSIM v2ベンチマークで最先端性能を達成。
- DiffSemanticFusion: オンラインHDマップ拡散による自動運転向けセマンティックラスタBEV融合自動運転/予測・計画2025/8/1
ラスタ表現とグラフ表現の長所を組み合わせ、オンラインHDマップの拡散モジュールで安定性と表現力を高めるBEV融合フレームワークを提案し、軌道予測と計画タスクで性能を改善した。
- 触覚VLA:視覚-言語-行動モデルの物理知識を触覚汎化へ解き放つVLA2025/7/1
視覚・言語・行動モデルに触覚センシングを融合し、接触を伴うタスクで力制御と触覚フィードバックに基づく適応的な行動を可能にするフレームワークを提案。
- MISCGrasp:マルチスケール統合と対照学習による3次元把持の強化マニピュレーション2025/7/1
複数スケールの特徴抽出と対照学習を組み合わせ、形状や大きさが異なる物体に適応する3次元把持手法を提案した。
- 都市環境における複数ドローン体温スクリーニングの軌道計画のための拡張信頼領域逐次凸最適化群制御2025/6/1
複数ドローンによる都市部の体温スクリーニングのため、信頼領域逐次凸最適化を拡張し、衝突回避や被覆効率を考慮した軌道計画手法を提案した。
- SENIOR: 選好ベース強化学習における効率的なクエリ選択と選好誘導探索選好ベース強化学習2025/6/1
人間の選好から報酬を学習する強化学習において、比較しやすい動作区間を選ぶクエリ選択法と選好に基づく探索手法を組み合わせ、フィードバック効率と方策学習を改善した。
- 災害後の医療救助におけるUAV-UGV協調軌道最適化とタスク割り当て群制御2025/6/1
災害後の医療物資輸送のため、UAVとUGVの協調によるタスク割り当てと軌道最適化フレームワークを提案し、シミュレーションで効率改善を示した。
- 時間論理制約と凸実行可能集合による衝突回避を用いたUAV医療配送の軌道最適化軌道最適化2025/6/1
都市部でUAVが複数病院へ時間窓と優先度付きで血液を配送する軌道計画を、STLと凸実行可能集合で定式化し、凸最適化で解く手法を提案した。
- CLTP: 3D接触形状理解のための言語-触覚対照事前学習触覚2025/5/1
触覚3D点群と自然言語を対応付ける事前学習フレームワークを提案し、接触位置・形状・力などの接触状態を言語で理解できるようにした。
- Aux-Think: データ効率の良い視覚言語ナビゲーションのための推論戦略の探求VLA2025/5/1
視覚言語ナビゲーション(VLN)において推論戦略を体系的に評価し、推論時の推論崩壊問題を明らかにした上で、CoT教師あり学習で推論パターンを内部化しつつ直接行動予測を行うAux-Thinkを提案した。
- VTLA:視覚・触覚・言語・行動モデルと選好学習による挿入操作マニピュレーション2025/5/1
視覚と言語に触覚を統合したVTLAモデルを提案し、選好最適化(DPO)で連続的なロボット操作を学習。ピン挿入タスクで90%以上の成功率と実機転移を実現した。
- TLA: 接触の多いマニピュレーションのための触覚-言語-行動モデル触覚2025/3/1
触覚フィードバックを言語と結びつけて処理するTLAモデルを提案し、ペグ挿入組立タスクで従来の模倣学習を上回る性能と未知条件への汎化を示した。
- NeuGrasp: 背景事前分布を活用した素材非依存の物体把持検出のための汎化可能なニューラル表面再構成把持/表面再構成2025/3/1
透明・鏡面物体でも把持できるよう、背景事前分布とTransformerを組み合わせて多視点から物体表面を再構成する手法を提案し、実機・シミュレーションで従来法を上回る把持性能を示した。
- ROS package search for robot software development: a knowledge graph-based approach2023/12/1
- Segmentation and Tracking of Vegetable Plants by Exploiting Vegetable Shape Feature for Precision Spray of Agricultural Robots2023/6/1
- IDLS: Inverse Depth Line based Visual-Inertial SLAM2023/4/1
- Real-Time Marker Localization Learning for GelStereo Tactile Sensing2022/11/1
- KIT Bus: A Shuttle Model for CARLA Simulator2021/6/1
- CFNet: LiDAR-Camera Registration Using Calibration Flow Network2021/4/1
- ACDER: Augmented Curiosity-Driven Experience Replay2020/11/1
- Grasp State Assessment of Deformable Objects Using Visual-Tactile Fusion Perception2020/6/1