Wei Wu
収録論文 28本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 因果的作用効果の再重み付けによるワールドモデル学習の改善ワールドモデル2026/8/31
アクション条件付きビデオ生成のワールドモデル学習において、背景トークンに偏った損失を避け、アクションの影響を受けるトークンに重点を置く再重み付け手法を提案した。
- IMPACT: 注意はスケーラブルな相互作用認識ワールドモデル学習のための相互作用マップワールドモデル2026/8/31
ワールドモデルの学習において、静的領域が支配的なMSE損失により動的物体の相互作用が過小評価される問題を指摘し、注意マップを用いて損失を再重み付けするフレームワークIMPACTを提案した。
- 具身知能のためのMixture-of-Expertsビデオ事前学習のスケーリングVLA2026/7/8
ロボット制御に特化したビデオ生成モデルLingBot-Videoを提案。MoEアーキテクチャとロボット向けデータ、物理合理性を評価する報酬系で、デジタル生成と物理動作の橋渡しを目指す。
- Worldscape-MoE: スケーラブルな異種行動制御のための統一Mixture-of-Experts世界モデル世界モデル2026/7/1
異なる行動モダリティ(カメラ軌道、ロボット動作、手の関節信号など)を統一的に扱える拡張可能な世界モデルを提案し、MoEアーキテクチャにより異種の行動制御を共有の世界ダイナミクスに統合する。
- 基盤から応用へ:実践におけるVLAモデルの改善VLA/ロボット基盤モデル2026/7/1
VLA基盤モデルの実用化ギャップを埋めるため、データパイプライン刷新、行動空間拡張、予測ダイナミクスモデリングの3点を改良したLingBot-VLA 2.0を提案し、ベンチマークで効果を実証した。
- WorldScape Policy 2.0:推論強化メモリによる操縦可能なワールドアクションモデリングの実現操作2026/7/1
ロボット操作のためのワールドアクションモデルを拡張し、長期・短期メモリと推論強化により、タスク進行の追跡と細かい言語-映像-行動の対応付けを可能にした。
- TacWAM: 力学を考慮した触覚予測を備えたアンカー誘導型ワールドアクションモデル触覚/操作2026/7/1
接触を伴う操作タスクにおいて、視覚だけでなく触覚の未来予測を活用し、力や変形などの物理情報を捉えつつ、アクション生成に特権的な手がかりとして使わないようにする新しいワールドアクションモデルを提案した。
- 必要なときに夢を見る:適応的マルチモーダル推論による世界行動モデルの進化VLA2026/6/1
世界行動モデル(WAM)の性能を高めるため、タスクの切り替え時にはテキスト推論、細かい操作時には視覚推論を動的に切り替える軽量ルータを導入したAdaWAMを提案した。シミュレーションと実世界のタスクで効率と性能が向上した。
- FUSE: 車両・ロボットSLAMシステムにおける統合状態推定のためのフレームワークSLAM2026/5/1
SLAMの状態推定プロセスを観測取り込み・伝播・更新・状態問い合わせのインターフェースに分離し、設計選択を独立に変更可能にするフレームワークFUSEを提案。LiDAR-IMU実装で評価し、Faster-LIOと比較して誤差を低減した。
- WorldVLN: 空中視覚言語ナビゲーションのための自己回帰的世界行動モデルVLA2026/5/1
空中VLNを予測駆動の世界行動問題として捉え、自己回帰ビデオバックボーンで世界状態遷移を予測し、実行可能なウェイポイント行動に直接デコードする初のモデルWorldVLNを提案。2段階訓練と強化学習により、ベンチマークで12%以上の成功率向上を達成し、実ドローンへのゼロショット転送も実証。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- 自然勾配ベイズフィルタリング:力学系のための幾何認識フィルタ状態推定2026/5/1
ガウス分布の統計多様体上で自然勾配降下を用いて事後分布を更新する幾何認識型ガウスフィルタ(NANOフィルタ)を提案し、線形ガウス系ではカルマンフィルタと一致することを示した。衛星姿勢推定やロボットの状態推定などで有効性を実証している。
- 人間とAIのコーディング協調のスケールには、統治可能なコンセンサス層が必要ソフトウェア工学2026/4/20
AI支援開発の成果物をコードとチャット履歴から、型付きプロパティグラフで表現されるコンセンサス層に置き換えるパラダイムを提案し、監査可能性と介入距離の削減を目指す。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- 実用的なVLA基盤モデルVLA2026/1/1
9種類の双腕ロボットから約2万時間の実世界データを収集し、4つのロボットプラットフォームで評価した汎用性の高いVLA基盤モデルLingBot-VLAを開発した。
- RoboScape-R: 報酬と観測を統合したワールドモデルによる汎化可能なロボティクス強化学習強化学習/ワールドモデル2025/12/1
ワールドモデルを汎用環境プロキシとして用い、状態遷移の理解から報酬を生成する強化学習フレームワークを提案し、多様なシーンへの汎化性能を向上させた。
- 3D空間における長期的視覚生成とナビゲーションのための航空世界モデルナビゲーション2025/12/1
UAVのナビゲーション向けに、過去のフレームと行動から将来の視覚観測を予測する世界モデルANWMを提案し、候補軌道を意味的妥当性で評価することで大規模3D環境での自律飛行性能を向上させた。
- 自動運転における軌道予測のための大規模基盤モデル:包括的サーベイ軌道予測2025/9/1
自動運転の軌道予測に大規模言語モデルやマルチモーダル基盤モデルを活用する研究を体系的にレビューし、手法・評価・課題を整理したサーベイ。
- AirScape: 運動制御可能な空中生成ワールドモデル世界モデル2025/7/1
6自由度ドローンの視覚入力と運動意図から将来の観測を予測する世界モデルを構築し、運動意図に沿った3D空間想像力で既存モデルを大幅に上回った。
- RoboScape: 物理情報を組み込んだ身体性世界モデル世界モデル2025/6/1
RGB動画生成と物理知識を統合して学習する世界モデルを提案し、3D形状や運動ダイナミクスを考慮した物理的に妥当なロボット動画生成を実現した。
- AeroLite-MDNet:UAV着陸のための軽量マルチタスク逸脱検出ネットワークUAV着陸/逸脱検出2025/6/1
UAVの安全な着陸を支援するため、マルチスケール融合とセグメンテーションを組み合わせた軽量な視覚ベース逸脱検出モデルを提案し、新しい評価指標とデータセットを導入した。
- NANO-SLAM:自然勾配ガウス近似による車両SLAMSLAM2025/4/1
車両SLAMにおいて、サンプリング分布をガウスパラメータ上の最適化問題として定式化し、自然勾配降下法で解くことで線形化誤差を回避し精度を向上させる手法を提案した論文。
- EgoFSD: 不確実性デノイジングと反復的洗練による効率的なEnd-to-End自動運転のための自己中心的全スパースパラダイムEnd-to-End自動運転2024/9/1
自己中心的な全スパース表現を用いて知覚・予測・計画を統合し、不確実性モデリングと反復的洗練により効率的なEnd-to-End自動運転を実現する手法を提案。
- LCSim: 大規模で制御可能な交通シミュレータ交通シミュレーション2024/6/1
拡散モデルベースの車両運動プランナを組み込み、多様な運転スタイルを再現できる大規模交通シミュレータLCSimを提案した。
- SMART: 次トークン予測によるスケーラブルなマルチエージェント実時間運動生成運動生成2024/5/1
地図とエージェント軌跡を離散トークン化し、GPT型Transformerで次トークン予測を学習することで、自動運転の実時間運動生成を実現した研究。
- AirCode: A Robust Object Encoding Method2021/5/1
- Selective Sensor Fusion for Neural Visual-Inertial Odometry2019/3/1
- Biologically inspired model simulating visual pathways and cerebellum function in human - Achieving visuomotor coordination and high precision movement with learning ability2016/3/1