Tiancai Wang
収録論文 34本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FailPatch: 視覚言語行動モデルのための失敗残差パッチングVLA2026/9/28
VLA方策の失敗しやすい状態を検出し、凍結した方策の隠れ表現に残差エキスパートを注入して成功率を改善する手法を提案。
- F4R: 失敗駆動型の認識・再構築・洗練・再展開によるロボットの継続的自己改善マニピュレーション2026/9/28
ロボットの失敗を自動で診断し、シミュレーション環境で再構築して強化学習で改善する閉ループ学習フレームワークを提案。実世界での追加デモ収集なしに、4つのマニピュレーションタスクで高い成功率を達成した。
- 予期せぬ感覚を捉える:残差触覚表現によるResTacVLAの接触豊富な操作触覚/VLA/操作2026/7/1
視覚言語行動モデルに触覚を統合する際、視覚特徴が触覚を覆い隠す問題を解決するため、視覚予測と実際の触覚の差を残差表現として用い、視覚的に予測できない重要な接触イベントを捉えるResTacVLAを提案した。
- MemoryVLA++:視覚言語行動モデルにおける記憶と想像による時間的モデリングVLA2026/6/8
ロボット操作のためのVLAモデルに、作業記憶・エピソード記憶・未来想像の仕組みを組み込み、長期的な時間依存タスクを可能にするフレームワークを提案した。
- QuadVerse: 四足歩行シミュレーションのための視覚と物理の現実を統合するフレームワークsim2real2026/6/1
RGB動画から再構成した3Dシーンを基盤に、視覚・接触・アクチュエータの各ギャップを統合的に補正し、実機データなしで視覚ナビゲーションをゼロショット展開できる四足歩行シミュレーションフレームワークを提案した。
- PriorVLA: 事前知識を保持した視覚言語行動モデルの適応VLA2026/5/1
事前学習済みの視覚言語行動モデルを下流タスクに適応させる際、事前知識を保持しつつ効率的に活用するフレームワークPriorVLAを提案。凍結した事前エキスパートと適応エキスパートを組み合わせ、パラメータ更新を25%に抑えつつ、分布外や少数サンプル設定で高い性能を達成。
- Realtime-VLA FLASH: 拡散型VLAのための投機的推論フレームワークVLA/推論高速化2026/5/1
拡散型視覚言語行動モデル(dVLA)の再計画時の推論遅延を削減するため、軽量ドラフトモデルと主モデルのAction Expertによる並列検証、および必要時に完全推論へ切り替える位相認識フォールバック機構を備えた投機的推論フレームワークを提案した。LIBEROで平均推論遅延を19.1ms(3.04倍高速化)に短縮し、実世界のコンベアベルト仕分けでも有効性を示した。
- UniLab: GPU中心パラダイムを超えたロボット強化学習のためのヘテロジニアスアーキテクチャ強化学習/システムアーキテクチャ2026/5/1
CPUシミュレーションとGPU学習を分離したヘテロジニアスな強化学習システムUniLabを提案し、GPUシミュレーションに依存せずに3〜10倍の学習効率向上を実証した。
- GS-Playground: 視覚に基づくロボット学習のための高スループット写実的シミュレータシミュレーション2026/4/1
3Dガウススプラッティングと並列物理エンジンを統合した高速写実シミュレータを開発し、視覚ベースの強化学習を大規模に加速する。
- ロボットシーンクローニング:視覚プロンプト編集による操作タスクのゼロショットシーン適応の推進マニピュレーション2026/3/1
既存のロボット操作軌道を編集してシーン固有の適応を実現する手法を提案し、視覚プロンプトと条件注入モジュールにより正確でシーン整合性のあるサンプル生成を行い、ポリシーの汎化を向上させる。
- DM0: フィジカルAIに向けた身体性ネイティブな視覚-言語-行動モデルVLA2026/2/1
身体性を後付けでなく最初から統合し、大規模事前学習からフローマッチング行動専門家と空間Chain-of-Thoughtで操作とナビゲーションを統一的に学習するVLAフレームワークDM0を提案。
- SpatialActor: ロバストなロボットマニピュレーションのための分離された空間表現の探求マニピュレーション2025/11/1
意味と幾何を明示的に分離し、ノイズの多い深度と専門家事前知識を融合するフレームワークを提案。RLBenchで87.4%を達成し、ノイズ条件下で13.9%〜19.4%の改善を示す。
- Dexbotic: オープンソース視覚-言語-行動ツールボックスVLA2025/10/1
複数のVLAモデルを単一環境で再現・開発できるPyTorchベースのオープンソースツールボックスを提供し、高性能な事前学習済みモデルも公開した。
- ManiAgent:汎用ロボットマニピュレーションのためのエージェント型フレームワークマニピュレーション2025/10/1
複数のエージェントが協調して環境認識・サブタスク分解・行動生成を行い、複雑なマニピュレーションを効率的にこなすエージェント型アーキテクチャを提案した論文。
- IntentionVLA: 人間とロボットのインタラクションのための汎用かつ効率的な意図推論VLA2025/10/1
意図推論・空間グラウンディング・簡潔な身体性推論を組み合わせたカリキュラム学習と効率的推論機構により、間接的な指示から人間の意図を推論して行動生成するVLAフレームワークを提案。
- RoboChallenge:実機ロボットによる具現化ポリシーの大規模評価VLA2025/10/1
多数のモデルとタスクを実機で評価するオンラインシステムRoboChallengeを構築し、初期ベンチマークTable30で最新VLAモデルを調査した。
- VLAをリアルタイム速度で動かすVLA2025/10/1
単一のコンシューマGPU上でpi0級のマルチビューVLAを30Hzのフレームレート・最大480Hzの軌道周波数で動作させる推論最適化手法を提案し、落下するペンを掴むタスクで100%の成功率を達成した。
- LLaDA-VLA:視覚言語拡散アクションモデルVLA2025/9/1
拡散ベースの視覚言語モデルをロボットマニピュレーションに適応させた初のVLAモデルを提案し、特殊トークン分類と階層的アクション復号により従来手法を上回る性能を実現した。
- MUVLA: 地図理解による物体ナビゲーションの探索学習VLA2025/9/1
セマンティックマップを活用して履歴情報を構造化し、報酬誘導型のリターンモデリングで探索行動を学習する物体ナビゲーション用VLAモデルを提案。
- MemoryVLA: ロボット操作のための視覚-言語-行動モデルにおける知覚・認知記憶VLA2025/8/1
人間の作業記憶と海馬の記憶機構に着想を得て、知覚・認知トークンを記憶バンクに蓄え再利用するVLAモデルを提案し、長期的な依存を含む操作タスクで従来手法を上回る成功率を達成した。
- GeoVLA: 視覚言語行動モデルに3D表現を導入VLA2025/8/1
深度マップから点群を生成し、視覚言語モデルの埋め込みと統合することで、3D空間認識を強化したロボットマニピュレーション用VLAフレームワークを提案。
- RAGNet:汎用把持に向けた大規模推論ベースのアフォーダンスセグメンテーションベンチマーク把持2025/7/1
人間の指示に基づく物体のアフォーダンスを大規模に学習・評価するためのベンチマークRAGNetと、それを用いた把持フレームワークAffordanceNetを提案し、実世界での汎化性能を示した。
- ROSA: ロボット状態を活用した視覚言語と行動のアライメントVLA2025/6/1
ロボットの状態推定データを自動取得してVLAモデルの訓練に組み込み、視覚言語空間と行動空間のずれを埋めることで、少ないデータでも高性能・高汎化を実現する手法を提案。
- Ross3D: 3D認識を備えた再構成的視覚インストラクションチューニング3Dシーン理解2025/4/1
3Dシーン理解のための大規模データ不足に対処するため、クロスビューとグローバルビューの再構成を訓練に組み込んだ3D認識型視覚インストラクションチューニング手法を提案し、複数のベンチマークで最高性能を達成した。
- Glad: 自動運転のためのストリーミングシーン生成器シーン生成2025/3/1
潜在変数伝播とストリーミングサンプラーにより、フレーム単位で時間的一貫性のある運転シーンの動画を生成するフレームワークを提案。
- BFA: マルチビュー細粒度マニピュレーションのための最良特徴量認識融合マニピュレーション2025/2/1
マルチビュー画像を用いた細粒度マニピュレーションにおいて、各視点の重要度を軽量ネットワークで予測し、再重み付けして融合するプラグアンドプレイ手法を提案。タスク成功率を22-46%向上させた。
- RoboMatrix: スキル中心の階層型フレームワークによるオープンワールドでのスケーラブルなロボットタスク計画と実行VLA2024/12/1
多様なタスクから汎用メタスキルを抽出し、LLMによるタスク分解と移動・操作を統合したVLAモデルで未見タスクを遂行するスキル中心の階層型ロボットフレームワークを提案した。
- Multi-GraspLLM:多様なロボットハンドのための意味誘導型把持生成マルチモーダルLLMマニピュレーション2024/12/1
自然言語指示に基づき、複数のロボットハンドに対応した把持姿勢を生成する統合フレームワークを提案し、接触注釈付き大規模データセットMulti-GraspSetを構築した。
- RoboGSim: 実世界からシミュレーションを経て実世界へ戻るロボット用ガウシアンスプラッティングシミュレータsim2real2024/11/1
3Dガウシアンスプラッティングと物理エンジンを組み合わせ、実世界のロボット操作データを高忠実度でシミュレーションし、実機へのゼロショット転移を可能にするReal2Sim2Realシミュレータを提案。
- SegGrasp: セマンティック・幾何学誘導セグメンテーションによるゼロショットタスク指向把持マニピュレーション2024/10/1
視覚言語モデルと凸分解による幾何情報を組み合わせ、学習なしで対象物の機能部位を狙うゼロショット把持を実現したフレームワーク。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- SubjectDrive: 被写体制御による自動運転向け生成データのスケーリング自動運転/生成データ2024/3/1
被写体を制御できる生成モデルを開発し、多様な生成データを大量に作ることで自動運転の認識モデルの性能を継続的に向上させられることを示した。
- PillarNeSt: Embracing Backbone Scaling and Pretraining for Pillar-based 3D Object Detection2023/11/1
- ADriver-I: A General World Model for Autonomous Driving2023/11/1