Yue Wang
University of Southern California
収録論文 214本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- eRLT: 行動に関連するトークンルーティングによる効率的なVLA強化学習VLA2026/10/1
凍結したVLAモデルからタスク固有の行動関連特徴をトークンと層をまたいで抽出し、強化学習のサンプル効率を向上させる手法を提案。
- StreamRig: リグ内幾何を活用したストリーミング多カメラオドメトリオドメトリ/多カメラ2026/9/30
凍結した多視点3D基盤モデル上に、キャリブレーション済みカメラリグの幾何を活かした因果的ストリーミングオドメトリを構築するフレームワークを提案。
- PhysWAM: 自動運転のための物理的に整合した世界行動モデル自動運転/世界モデル2026/9/29
マルチビュー動画・深度・自車運動を単一のフローマッチングTransformerで同時生成し、生成した深度と運動をLiDAR点群に整合させる幾何制約CPPを導入した自動運転向け世界行動モデル。
- BIND: 3Dロボット動作を2D画像特徴に結びつける新表現VLA2026/9/29
カメラ幾何学を用いて3D動作候補を各視点の2D画像特徴に投影・スコアリングすることで、データ効率と視点・物体位置の変化への頑健性を高めた視覚運動ポリシーを提案。
- Rolling-WAM: 転がる想像による世界行動モデルVLA2026/9/24
ロボット操作のための世界行動モデルにおいて、映像と行動のノイズ除去を再計画サイクルごとに分割して行うことで、計算遅延を抑えつつ4.5倍の再計画高速化を実現した手法。
- HOTICE: 混雑環境における全身ヒューマノイド物体搬送ロコマニピュレーション2026/9/21
混雑環境で物体を運ぶため、ロボットと荷物の衝突回避を統合したポテンシャル場と、上下半身を分離しつつ全身協調を保つ二重エージェント強化学習、専門家から一般化への蒸留を組み合わせた全身ロコマニピュレーション学習フレームワーク。
- Neverwhere ビジュアルパルクールベンチマークスイートsim2real2026/9/14
3Dガウススプラッティングで再構成した60以上の都市シーンからなる、視覚移動制御の閉ループ評価環境を構築し、多様なデータの必要性を示した。
- PccDiffuser: 連続体ロボットのためのマルチソリューション動作計画動作計画2026/9/9
連続体ロボットの経路計画において、条件付き拡散モデルを用いて複数の候補解を並列生成し、アクチュエータ制約を考慮した軌道に変換する手法を提案。障害物0〜4個の環境で91%の成功率を達成し、従来手法より高成功率かつ高効率であることを示した。
- 連続環境における視覚言語ナビゲーションの閉ループ強化学習のためのマクロ行動に基づくトポロジカルグラフの再考ナビゲーション2026/9/3
VLN-CEタスクを階層的MDPとして再構成し、トポロジカルグラフ上のマクロ行動空間で強化学習を行うことで、サンプル効率と性能を向上させた。
- GAFT: 地理的アンカーによる微調整を用いた稀な失敗からの危険特定オフロードナビゲーション/危険特定2026/8/31
オフロード走行中の高重心化や閉じ込めなどの稀な失敗事例から危険構造を特定するため、視覚基盤モデルを幾何学由来の事前情報で微調整する手法GAFTを提案した。
- Logic-VLA: 時間論理条件付き視覚言語行動モデルVLA2026/8/20
自然言語指示に加えて、推論時に与えられる信号時相論理(STL)仕様を満たすように行動を調整するVLAモデルを提案。STLエンコーダと2段階のポリシー適応により、形式要件の充足率を大幅に向上させつつ、通常のタスク成功率をほぼ維持する。
- 異種ロボットのための校正済み予測安全:行動条件付きJEPAフレームワークとモデルベース安全シールドVLA/安全保証2026/8/18
視覚言語行動ポリシーに実行時保証を追加するため、行動条件付きJEPA世界モデルで候補行動のタスク進捗と物理リスクを予測し、モデルベース安全シールドでフィルタリングするパイプラインを提案した。
- LadderMan: 人型ロボットによる知覚的梯子登りの学習歩行2026/6/4
人型ロボットが様々な梯子を頑健に登り、梯子上での操作も行える統一システムを提案。シミュレーションで学習したポリシーを実機にゼロショット転送し、多様な梯子形状での登攀と操作タスクを実現した。
- WMLLM: 予測してから行動する世界モデルによる自己進化型最適化エージェント最適化2026/6/2
大規模言語モデルを用いて、ブラックボックス最適化の探索効率を高める自己進化型エージェントフレームワークを提案した。候補生成前に有望な方向を予測する世界モデルを組み込み、分子最適化などで高い性能を示した。
- RoboDream: スケーラブルなロボットデータ合成のための構成的世界モデルデータ生成/世界モデル2026/6/1
ロボット学習のための大規模データ生成を実現する、エンボディメント中心の世界モデルを提案。実ロボットの動作をレンダリングし、シーンや物体の事前知識を条件付けすることで、物理的に実現可能なフォトリアリスティックなデモを合成し、データスケーリングを可能にする。
- G2G: グループ内幾何を活用したグループ間ポーズ推定ポーズ推定2026/6/1
2つの画像グループ間の相対6自由度ポーズを推定する手法を提案。グループ内の既知の幾何情報を活用しつつ、基盤モデルは凍結したまま軽量なモジュールを追加して高精度を達成した。
- SIMPLE: ヒューマノイドの移動操作のためのシミュレーションベースのポリシー学習と評価ヒューマノイド/シミュレーション2026/6/1
ヒューマノイドの全身移動操作タスクを対象とした、大規模で再現可能な統一シミュレーションテストベッドを提案し、多様なタスクとデータ生成パイプラインを統合して、シミュレーションと実世界の性能相関を示した。
- デュエット:効率的な教示による二台ロボットの協調理解群制御2026/6/1
二台のロボットが協調して作業するための学習フレームワークを提案。VR遠隔操作と人間同士の協調動作データを活用し、少ない実機データで高性能な協調ポリシーを学習する。
- APT: 行動エキスパートの事前学習による視覚-言語-行動ポリシーの指示汎化の改善VLA/汎化2026/6/1
視覚-言語-行動モデルにおいて、言語データの不均衡が原因で未見の指示への汎化が悪い問題を、行動エキスパートを事前学習する二段階手法APTで解決した。
- 人型ロボットのための非同期上半身タスク空間軌道追従ポリシーの学習歩行2026/6/1
人型ロボットの高レベルプランナーが出力する低レートのタスク空間軌道と、高レートで動作する全身制御の間の時間的非同期性と構造的不完全性に対処するため、非同期の上半身タスク空間追従フレームワークを提案。教師-学生蒸留とスライディングウィンドウ報酬を用いてフレームドリフトを低減し、シミュレーションと実機で有効性を実証した。
- VLAConf: 視覚言語行動モデルのための校正されたタスク成功信頼度VLA2026/5/1
VLAモデルのタスク成功確率を、軽量な信頼度ヘッドで単一フォワードパス推定する手法を提案。既存手法より高速で、連続行動空間にも適用可能。
- ReflectDrive-2: 強化学習整合型自己編集による離散拡散運転プランナー自動運転2026/5/1
自動運転向けに、離散トークンで軌道を表現し、自己編集で軌道を修正するマスク拡散プランナーを提案。強化学習で編集能力を訓練し、性能を向上させた。
- PyTorchによるバッチ処理対応の微分可能な剛体力学:GPU加速ロボット学習のための実装sim2real2026/5/1
GPU上でバッチ処理と自動微分が可能な剛体力学ライブラリBARDをPyTorchで実装し、従来のCPUベースのライブラリと比較して最大64倍のスループット向上を達成した。
- Fast-SegSim: ロボットシミュレーションのためのリアルタイムオープンボキャブラリセグメンテーションセグメンテーション2026/4/1
2Dガウススプラッティングに基づく高速なオープンボキャブラリセグメンテーション手法を提案し、40FPS以上のレンダリング速度を実現。ロボットシミュレーションでのセンサ入力や、下流タスクの教師データ生成に利用できる。
- Ψ-Map: パノプティック表面統合マップによるReal2Sim転送の実現3D再構成/パノプティックセグメンテーション2026/4/1
大規模シーン向けに、LiDARデータと2Dガウシアンサーフェルを用いた幾何学的強化と、クエリ誘導型のエンドツーエンドパノプティック学習を統合し、高精度でリアルタイムな3D再構成を実現するフレームワークを提案した。
- 腱駆動連続体ロボットのための学習ベース動力学モデリングとロバスト制御連続体ロボット/制御2026/4/1
腱駆動連続体ロボットの複雑な非線形性を捉えるGRUベースの動力学モデルを提案し、これを勾配ブリッジとして用いてエンドツーエンドのニューラル制御ポリシーを最適化する。物理実験で正確な追従と未知負荷に対するロバスト性を実証した。
- 腱駆動連続体ロボットの精密追従制御のための参照拡張学習制御2026/4/1
腱駆動連続体ロボットの精密な6自由度追従制御のため、微分可能なRNNダイナミクスモデルを勾配ブリッジとして用い、参照分布を拡張したオフライン学習フレームワークを提案。実験で平均位置誤差を50.9%削減した。
- MA-VLCM: マルチエージェントチーム設定における方針価値推定のための視覚言語批評モデルマルチエージェント強化学習2026/3/1
マルチエージェント強化学習において、学習済み視覚言語モデルを微調整して中央批評家として用いることで、方針学習中の批評家学習を不要にし、サンプル効率と汎化性を向上させるフレームワークを提案した。
- 大規模報酬モデル:視覚言語モデルによる汎用的なオンラインロボット報酬生成強化学習2026/3/1
ロボット操作の強化学習において、視覚言語モデルをオンライン報酬生成器として活用し、模倣学習で初期化した方策を少数の反復で改善する枠組みを提案した。
- D-REX: 巧みな把持学習のための微分可能な実世界-シミュレーション-実世界エンジン把持/シミュレーション2026/3/1
ガウススプラット表現を用いた微分可能エンジンを構築し、実世界の視覚観測とロボット制御信号から物体質量を同定しつつ、把持ポリシーを同時学習する手法を提案。
- IntentReact: トポロジカルな意図による反応的オブジェクト中心ナビゲーションの誘導ナビゲーション2026/3/1
オブジェクト目標ナビゲーションにおいて、局所的な観測のみに依存する反応的制御と大域的なトポロジカル計画のギャップを埋めるため、意図(intent)と呼ばれる低次元の方向信号を導入し、学習されたウェイポイント予測を条件付けてナビゲーションを誘導するフレームワークを提案した。
- Ψ₀: 汎用人型ロコマニピュレーションに向けたオープン基盤モデルVLA2026/3/1
高品質な一人称視点の人間動画でVLMを事前学習し、人型ロボットの実機データで追加学習する段階的パラダイムにより、少ないデータで人型ロコマニピュレーションを実現するオープン基盤モデルを提案した。
- HumDex: ヒューマノイド器用操作を簡単にする遠隔操作/模倣学習2026/3/1
ヒューマノイド全身の器用な操作のためのポータブル遠隔操作システムを提案し、IMUベースのモーショントラッキングと学習ベースのリターゲティングで高品質なデモデータ収集を実現。さらに、多様な人間の動作データでの事前学習とロボットデータでの微調整による模倣学習フレームワークを導入し、汎化性能を向上させた。
- DreamPlan: ビデオワールドモデルによる視覚言語プランナーの効率的な強化学習ファインチューニング操作2026/3/1
ロボット操作のための視覚言語モデルプランナーを、実世界での試行錯誤を避け、ビデオ生成モデルによる仮想ロールアウトを用いて強化学習でファインチューニングする手法を提案した。
- 月面科学探査と有人宇宙飛行の安全性を支える宇宙ロボティクスの新潮流宇宙ロボティクス2026/3/1
月を拠点とした科学探査と有人飛行支援におけるAI・宇宙ロボティクスの役割を概観し、自律性やセンサ融合が持続可能な探査と将来の火星有人飛行にどう貢献するかを論じた論文。
- 把持と非把持の同時操作:多段階器用タスクへの実用的アプローチマニピュレーション2026/3/1
物体把持と別物体への操作を同時に行う多段階タスクを、物体中心スキルに分解し、少数の実演から実機で学習・実行する手法DexMultiを提案。
- 視覚的推論を用いた文脈内模倣学習模倣学習2026/3/1
ロボットが少数のデモから新しいタスクを適応学習する際、視覚的な推論トレースをプロンプトに追加し、行動予測と推論過程を同時に学習するフレームワークを提案。シミュレーションと実世界で成功率と汎化性能が向上した。
- 方向が鍵:力の方向を学習することで接触の多い操作のSim-to-Real転移を実現sim2real2026/2/1
シミュレーションで人間設計の位置・力制御器を教師として使い、接触力の方向を予測する方策を学習。実機では力覚アダミタンス制御器を構成し、電子レンジ開けやペグ挿しなど4タスクで高い成功率と頑健性を示した。
- 自動運転における構造化Chain-of-Thoughtの高速化VLA2026/2/1
自動運転のVLAモデル向けに、Chain-of-Thought推論を依存グラフに分解し並列デコードすることで、精度を保ちつつ3〜4倍高速化する手法を提案。
- フィデューシャル・エクソスケルトン:画像中心のロボット状態推定状態推定2026/1/1
各リンクにマーカー付きの軽量3Dプリント製マウントを取り付け、単一RGB画像からロボットの関節角度やカメラとの位置関係を推定する手法を提案。低コストなロボットアームでも高精度な状態推定と制御を可能にする。
- OpenNavMap: マルチセッション外観ベーストポメトリックマッピングによるスケーラブルな視覚ナビゲーション視覚ナビゲーション2026/1/1
画像ノードを共視性・オドメトリ・走行可能性グラフで整理し、3D基盤モデルをオンデマンドで活用する軽量なランドマークフリー地図構築システムを提案。19kmの実環境データで高精度な視覚ナビゲーションを実現した。
- Mr. Virgil: マルチロボットの視覚・測距による相対位置推定の学習マルチロボット位置推定2025/12/1
UWB測距と視覚検出の対応付けをグラフニューラルネットで学習し、微分可能なポーズグラフ最適化と組み合わせてマルチロボットの相対位置推定を高精度化するフレームワークを提案。
- PolaRiS: 汎用ロボットポリシーのためのスケーラブルな実世界→シミュレーション評価sim2real2025/12/1
実世界の短い動画スキャンからニューラル再構成で高忠実度なシミュレーション環境を構築し、汎用ロボットポリシーを実世界と強く相関する形で評価できるようにしたフレームワーク。
- ニューラル測距慣性オドメトリ測距慣性オドメトリ2025/12/1
UWB測距と慣性センサをグラフ注意ネットワークと再帰型ニューラルネットで融合し、アンカー配置やマルチパスに頑健な自己位置推定を実現した研究。
- 見て行動し、プロンプトで指定する:視覚言語行動ポリシーのベイズ分解VLA2025/12/1
VLAモデルのファインチューニングで生じる言語忘却と視覚ショートカットを、ポリシーを視覚行動事前と言語条件付き尤度にベイズ分解することで解決し、未知の指示・物体・環境への汎化性能を向上させた。
- CREPES-X: 階層型方位・距離・慣性による直接協調相対姿勢推定システム群制御2025/12/1
小型ハードウェアと二段階の階層推定器により、方位外れ値に頑健で高精度なマルチロボット間の相対姿勢推定を実現した。
- AnchorDream: 動画拡散モデルを活用した身体性を考慮したロボットデータ合成データ合成/拡散モデル2025/12/1
ロボットの動作レンダリングを条件に事前学習済み動画拡散モデルを再利用し、身体性の一貫性を保ちながら多様なロボット実演データを合成する手法を提案。
- ETP-R1: 強化学習ファインチューニングによるトポロジカル計画の進化 — 連続環境における視覚言語ナビゲーションVLA2025/12/1
連続環境での視覚言語ナビゲーション(VLN-CE)において、グラフベースのモデルに大規模データと強化学習ファインチューニングを適用し、R2R-CEで最先端性能を達成した研究。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- 物理世界モデルからのロボット学習マニピュレーション2025/11/1
動画生成モデルと物理世界再構成を組み合わせ、実機データなしでゼロショットのロボットマニピュレーションを実現するフレームワークPhysWorldを提案。
- 運動成分を識別的に扱うことで深度と自己運動の統合学習を進化させる自己運動推定2025/11/1
動画から深度と自己運動を教師なしで同時に学ぶ際、運動を回転・並進などの成分に分けて幾何学的制約を個別に課すことで、精度と頑健性を高めるフレームワークDiMoDEを提案した。
- SeFA-Policy: 選択的フロー整合による高速で正確な視覚運動ポリシー学習VLA2025/11/1
拡散・フローベースのポリシー学習において、蒸留後の生成行動が観測とずれる問題を、専門家デモを用いた選択的フロー整合で補正し、推論遅延を98%以上削減しつつ高精度・高ロバストな視覚運動ポリシーを実現した。
- ResMimic: 汎用モーショントラッキングから残差学習によるヒューマノイド全身ロコマニピュレーションへロコマニピュレーション2025/10/1
大規模な人間モーションデータで訓練した汎用モーショントラッキング方策を土台に、残差方策を学習させて物体とのインタラクションを伴うヒューマノイドの全身移動操作を実現した研究。
- Flexbee:ソフトベクター推進ノズルを備えた把持・止まり木機能付きUAV飛行ロボティクス2025/10/1
ソフトベクター推進ノズルを4基搭載し、飛行・把持・止まり木を統合した新型UAV「Flexbee」を設計し、動力学モデルと階層制御戦略を構築して実験で有効性を検証した。
- Humanoid Everyday:オープンワールドヒューマノイド操作のための包括的ロボットデータセットヒューマノイド操作2025/10/1
ヒューマノイドロボットの器用な操作・人間とのインタラクション・移動を伴う動作を含む大規模マルチモーダルデータセットを構築し、クラウド評価基盤も提供した研究。
- SPARC: 四足歩行ロボットのための並進・回転コンプライアンスを備えた脊椎歩行2025/10/1
四足ロボット用に、回転と並進の両方向の動きが可能な3自由度の脊椎モジュールを開発し、そのコンプライアンスが高速歩行時の消費電力を21%削減することを示した。
- 自律走行のための離散拡散による反射型視覚言語行動モデルVLA2025/9/1
離散拡散と言語モデルを活用し、安全な軌道生成のための反射機構を備えた自律走行向けVLAフレームワークを提案。
- BEV-ODOM2: 地上ロボット向けPV-BEV融合と密フロー教師あり学習による拡張BEV単眼視覚オドメトリ視覚オドメトリ2025/9/1
単眼視覚オドメトリのスケールドリフトをBEV表現で解決する手法を改良し、密なBEVオプティカルフロー教師信号とPV-BEV融合により精度を向上させた。
- 身体構成に同変な視覚-言語-行動ポリシーに向けてVLA2025/9/1
ロボットの身体構成の変化に対して同変性を持つように視覚-言語-行動ポリシーを設計し、新しい機体構成への汎化と効率的なファインチューニングを実現した研究。
- あらゆる画像からのロボット学習sim2real2025/9/1
1枚の画像から物理シミュレーション可能なロボット環境を生成し、大規模な視覚運動デモンストレーションデータを自動収集するフレームワークRoLAを提案。
- 閉ループダイナミクスに基づく油圧ショベルの高精度・高効率軌道追従軌道追従/油圧ショベル/モデルベース学習2025/9/1
油圧ショベルの非線形ダイナミクスに対処するため、モデルベース学習と閉ループダイナミクスを組み合わせた軌道追従手法EfficientTrackを提案し、シミュレーションと実機で高精度・高効率を実証した。
- 転倒を考慮した不整地自律ナビゲーションのための軌道最適化ナビゲーション2025/8/1
不整地での転倒リスクを解析し、安全な姿勢範囲を制約として組み込んだ軌道計画手法CAPを提案し、シミュレーションと実機実験で有効性を示した。
- RCM-ACT: 動的RCMキャリブレーションを用いた模倣学習による眼内異物の自律除去医療ロボティクス/模倣学習2025/8/1
眼内異物除去のための模倣学習フレームワークRCM-ACTを提案し、RCMの動的キャリブレーションとアクションチャンキングを組み合わせることで、未キャリブレーションの顕微鏡下でリング把持・位置決めタスクを自律的に達成した。
- 人間データからの全身運動模倣フレームワーク:フルサイズヒューマノイドロボット向け全身運動模倣2025/8/1
人間の全身運動を接触を考慮してリターゲティングし、非線形重心MPCと全身制御でバランスを保ちながら実機ヒューマノイドに模倣させるフレームワークを提案した。
- 身体性ナビゲーションにおける知覚・社会・運動知能:包括的サーベイナビゲーション2025/8/1
身体性ナビゲーション(EN)を遷移・観測・融合・報酬方策構築・行動の5段階(TOFRA)で整理し、最新手法や評価指標、課題を包括的にレビューしたサーベイ。
- 分布方策勾配のための一般化アドバンテージ推定強化学習2025/7/1
最適輸送理論に基づくワッサースタイン型方向性指標を用いて、分布強化学習向けの一般化アドバンテージ推定(DGAE)を提案し、複数の方策勾配法に統合して性能を評価した論文。
- SkillBlender:スキルブレンドによる汎用人型ロコマニピュレーションロコマニピュレーション2025/6/1
目標条件付きの汎用プリミティブスキルを事前学習し、それらを動的にブレンドすることで、タスク固有の報酬設計を最小限に抑えつつ多様な人型ロコマニピュレーションを実現する階層型強化学習フレームワークを提案。
- MOTIFハンド:熱・慣性・力センサを備えたマルチモーダル観測ロボットハンドマニピュレーション2025/6/1
LEAPハンドを拡張し、触覚・深度・熱カメラ・IMU・視覚センサを統合した低コストな多指ロボットハンドを開発。熱情報を用いた安全把持や、外観が同じで質量が異なる物体の識別を実現した。
- オフロード自律走行車両のためのリアルタイム路面性状解析sim2real2025/6/1
車軸加速度からベイズ推定で路面粗さをリアルタイムに予測し、Simplex制御と統合して速度制限を動的に調整する手法を提案した。
- ManipBench:視覚言語モデルの低レベルロボット操作能力を評価するベンチマークVLA2025/5/1
視覚言語モデルが物体間の相互作用や変形物体の操作をどれだけ理解できるかを評価する新しいベンチマークManipBenchを提案し、33モデルをテストした。
- HMCF: 大規模言語モデルを用いたヒューマン・イン・ザ・ループ型マルチロボット協調フレームワーク群制御2025/5/1
LLMエージェントと人間の監督を組み合わせ、異種ロボット群のタスク割り当てと実行を最適化する協調フレームワークを提案し、シミュレーションと実機でゼロショット汎化性能を示した。
- ドメイン条件付きシーングラフによる状態接地型タスクプランニングタスクプランニング2025/4/1
ドメイン特化のシーングラフをシーン表現として用いることで、LMMベースの手法より高精度に状態を接地し、タスクプランニングの成功率を向上させた。
- UnIRe: 動的都市シーンの教師なしインスタンス分解シーン再構成2025/4/1
RGB画像とLiDAR点雲のみから、4Dスーパーポイントを用いて動的都市シーンを静的背景と個々の動的インスタンスに教師なしで分解し、3Dガウシアンスプラッティングで再構成する手法を提案。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- 言語指示・視覚観察・インタラクションに基づく3D物体アフォーダンスのグラウンディングアフォーダンス2025/4/1
言語指示・視覚観察・インタラクションから3D物体のアフォーダンス領域を推定する新タスクを提案し、そのためのデータセットAGPILとマルチモーダル言語誘導型ネットワークLMAffordance3Dを構築した。
- Quattro: Transformerで高速化するiLQR軌道最適化フレームワーク軌道最適化2025/4/1
iLQRの中間フィードバック・フィードフォワード行列をTransformerで予測し、FPGA上で並列計算することで、リアルタイム軌道最適化を大幅に高速化した研究。
- 人間のフィードバック強化学習によるパーソナライズ運転スタイルの学習自動運転2025/3/1
生成的な軌道モデルを人間のフィードバックで微調整し、多様な運転スタイルに合わせた軌道生成を可能にするTrajHFを提案。
- M2UD: 地上ロボット向けのマルチモーダル・マルチシナリオ不整地SLAMデータセットSLAMデータセット2025/3/1
都市や野原、長い廊下など多様な不整地環境と悪天候下で収集した地上ロボット用SLAMデータセットを構築し、RTKによる高精度な正解位置と精度・効率を考慮した新しい評価指標を提案した。
- 把持タスクにおけるグリッパ状態の曖昧性解消:擬似触覚フィードバックによる純粋シミュレーション学習の実現マニピュレーション2025/3/1
把持タスクで問題となるグリッパ状態の曖昧性を、力制御グリッパを触覚センサとして用いる擬似触覚フィードバックで解消し、追加データ収集なしにシミュレーションのみでロバストな模倣学習を可能にした。
- 雑然環境における言語条件付きピック&プレースのための無条件行動事前分布の効率的アラインメントマニピュレーション2025/3/1
視覚・言語・行動の基盤モデルの事前知識を統合し、1つのアテンション層で無条件行動事前分布を3D視覚言語事前分布にアラインメントすることで、少ないデータで学習しつつゼロショット汎化を保ち、雑然環境での言語条件付きピック&プレースを効率的に実現する手法A²を提案。
- CNSv2: 確率的対応符号化ニューラル画像サーボビジュアルサーボ2025/3/1
キーポイント検出が困難な環境でも、確率的特徴マッチングを組み込んだニューラル制御により高精度かつリアルタイムなビジュアルサーボを実現した。
- UGNA-VPR:不確かさ誘導型NeRF拡張による視覚的位置認識の新学習パラダイムVPR/NeRF/sim2real2025/3/1
既存のVPRデータセットにNeRFと自己教師あり不確かさ推定を組み合わせ、不確かな視点の合成画像を生成して学習データを拡張し、VPR性能を向上させる手法を提案した。
- PanopticSplatting: エンドツーエンドのパノプティックガウシアンスプラッティング3Dシーン理解2025/3/1
ガウシアンスプラッティングを用いたオープンボキャブラリなパノプティック再構成を、クエリ誘導型セグメンテーションとラベルブレンディングによりエンドツーエンドで実現した手法。
- 生成的運動事前分布による人型ロボットの自然な歩行・移動歩行2025/3/1
人間の全身運動をロボットに転移し、条件付きVAEで未来の参照運動を生成するモデルを学習、その生成運動を方策学習時の密な監督として用いることで、人型ロボットの自然な移動を実現した研究。
- せん断増粘流体に着想を得た物理的人間-ロボットインタラクションのための制御器物理的人間-ロボットインタラクション2025/2/1
せん断増粘流体の固液相変化に着想を得て、人間との協調と衝撃への耐性を両立する制御器SFCを提案し、安定性解析と実機実験で有効性を示した。
- CarPlanner: 自動運転の大規模強化学習のための一貫性のある自己回帰軌道計画自動運転計画2025/2/1
自己回帰構造と一貫性制約を組み合わせた強化学習プランナーを提案し、大規模実世界データセットnuPlanで従来のIL・ルールベース手法を上回る性能を達成した。
- BEV-DWPVO: 地面走行のための低スケールドリフト単眼視オドメトリに向けたBEVベース微分可能重み付きプロクルステス法単眼視オドメトリ2025/2/1
地面平面仮定を利用し、BEV特徴マップ上でキーポイントを抽出・マッチングして、微分可能な重み付きプロクルステス解法で3自由度の姿勢推定を行う単眼視オドメトリシステムを提案。
- SMART: 運転トポロジー推論のためのスケーラブルな地図事前分布の進展自動運転/トポロジー推論2025/2/1
SD地図と衛星画像から地図事前分布モデルを学習し、センサー構成に依存せずスケーラブルな車線トポロジー推論を実現する手法を提案。OpenLane-V2で最大28%の改善。
- 時相論理に基づく自動運転車の安全ナビゲーションナビゲーション2025/1/1
LTLとSTLを組み合わせ、形式的に安全な参照軌道生成とMILPによる制御入力最適化を行う自動運転ナビゲーション手法を提案した論文。
- PhysBench:視覚言語モデルの物理世界理解を評価・強化するベンチマークVLA2025/1/1
視覚言語モデル(VLM)の物理世界理解を評価する10,002件のベンチマークPhysBenchを提案し、75モデルの評価と、視覚モデルを組み合わせて物理理解を強化するPhysAgentを開発した。
- クロスアテンションを活用したエンドツーエンドのオープンボキャブラリ・パノプティック再構成3D再構成2025/1/1
3Dインスタンスをクエリ、3D埋め込み場をキーとするクロスアテンションでパノプティック再構成を定式化し、学習可能な3Dガウシアンをインスタンスクエリとして用いることで空間的近接性を保ちつつエンドツーエンド最適化を実現した手法を提案。
- UniMM:マルチエージェントシミュレーションのための統合混合モデルフレームワークマルチエージェントシミュレーション2025/1/1
自動運転シミュレーション向けに、回帰ベース混合モデルと離散NTPモデルを包含する統合混合モデルフレームワークを提案し、閉ループサンプル生成と時間的脱結合・整合機構で分布シフトを緩和、WOSACベンチマークで最先端性能を達成した。
- 大規模人間動画から学ぶ汎用人型ポーズ制御VLA2024/12/1
2000万件超の人間動画から人型ロボットのポーズとテキスト指示のデータセットHumanoid-Xを構築し、テキスト入力で人型ロボットを制御する大規模モデルUH-1を学習した。
- 外挿的な都市ビュー合成ベンチマークsim2real2024/12/1
自動運転向けの新規視点合成(NVS)において、訓練視点から大きく外れた視点での性能を評価する初のベンチマークEUVSを構築し、既存手法が訓練視点に過適合しやすいことを示した。
- LoRA3D: 3D幾何学基盤モデルの低ランク自己校正3D再構成2024/12/1
スパースなRGB画像から3D幾何学基盤モデルを自己校正し、低ランク適応でシーンに特化させる手法を提案。単一GPUで5分以内に完了し、3D再構成と多視点姿勢推定で最大88%の性能向上を達成。
- HUGSIM:自動運転のためのリアルタイム・フォトリアル・閉ループシミュレータ自動運転シミュレーション2024/12/1
3Dガウシアンスプラッティングで2D画像を3D空間に持ち上げ、自動運転アルゴリズムを評価するためのリアルタイムでフォトリアルな閉ループシミュレータを構築した。
- マルチカメラ・マルチマップ視覚慣性自己位置推定:システム、検証、データセットVLA2024/12/1
因果的なリアルタイム自己位置推定を実現するマルチカメラ・マルチマップ視覚慣性システムを提案し、評価指標と長期キャンパスデータセットを構築して有効性を示した。
- BEV-ODOM: BEV表現で単眼視覚オドメトリのスケールドリフトを低減単眼視覚オドメトリ2024/11/1
深度教師なしで透視画像をBEV表現に変換し、3自由度の運動を推定することで、単眼視覚オドメトリのスケールドリフトを抑えるフレームワークを提案した。
- LoGS: 少ない学習画像でガウススプラッティングによる視覚的自己位置推定視覚的自己位置推定2024/10/1
3Dガウススプラッティングをシーン表現に用い、画像検索と特徴マッチングで初期姿勢を推定した後、合成による解析で高精度なカメラ姿勢を求める視覚的自己位置推定手法を提案。
- LI-GS: LiDAR統合ガウシアンスプラッティングによる大規模高精度3次元再構成3D再構成/sim2real2024/9/1
LiDAR点群を平面制約付き混合ガウスモデルに変換し、2Dガウシアンサーフェルと組み合わせることで、屋外の大規模シーンを高精度に再構成する手法を提案した。
- LiLoc: 適応的サブマップ統合と自己中心因子グラフを用いた生涯ローカリゼーションローカリゼーション2024/9/1
中央セッションと補助セッション間のマルチモーダル因子を活用し、適応的サブマップ統合と自己中心因子グラフで高精度かつタイムリーな生涯ローカリゼーションを実現するフレームワークを提案。
- Signal Temporal Logic制約に基づく自動運転車の安全性検証とナビゲーションナビゲーション2024/9/1
Signal Temporal Logic(STL)の制約をMPCに組み込み、ロバストネス値を計算することで自動運転車の経路計画の安全性を検証・制御する手法を提案した論文。
- RING#: 回転並進同変グラム学習による姿勢推定ベースの大域的自己位置推定自己位置推定2024/9/1
BEV空間で2つの同変表現を学習し、場所認識を経由せず姿勢推定から直接位置を求める新しい大域的自己位置推定ネットワークRING#を提案した。
- PanopticRecon: オープン語彙インスタンスセグメンテーションを活用したゼロショットパノプティック再構成3Dシーン理解2024/7/1
RGB-D画像から、オープン語彙インスタンスセグメンテーションを利用して未知環境でも3Dパノプティック再構成をゼロショットで行う手法を提案。部分ラベルの伝播と3DインスタンスグラフによるID統合で課題を解決した。
- 効率的な協調設計のための事前学習・微調整フレームワーク:四足ロボットパルクールの事例研究sim2real2024/7/1
四足ロボットの脚長などの機構と制御方策を同時最適化する事前学習・微調整フレームワークを提案し、パルクール能力を効率的に向上させる。
- RAM: 検索ベースのアフォーダンス転移による汎用ゼロショットロボットマニピュレーションマニピュレーション2024/7/1
ロボット・人間・カスタムデータからアフォーダンス記憶を構築し、言語指示に応じて類似デモを検索して2Dアフォーダンスを3D実行可能な形に転移することで、未知の物体・環境・身体でもゼロショットで操作を実現するフレームワーク。
- 世界をオブジェクト知識にトークン化し、自動運転のロングテール事象に対処する自動運転/VLA2024/7/1
自動運転のロングテール事象に対処するため、シーンをオブジェクトレベルの知識にトークン化してLLMの推論能力を活用するマルチモーダルLLM「TOKEN」を提案し、軌道誤差と衝突率を大幅に削減した。
- 大規模言語モデルを用いた自動運転のためのスーパーアラインメントフレームワーク自動運転2024/6/1
自動運転におけるLLMのセキュリティとプライバシーを守るため、マルチエージェントLLMによるフレームワークを提案し、11のモデルの安全性・プライバシー・コストを評価した。
- DistillNeRF: 単眼画像からニューラル場と基盤モデル特徴を蒸留して3Dシーンを認識3D認識2024/6/1
単一フレームの多視点カメラ画像から、NeRFの蒸留とCLIP/DINOv2などの2D基盤モデル特徴の蒸留を組み合わせて、自己教師ありで3Dシーン表現を学習する手法を提案。
- 渦流を横切るロボット魚の効率的ナビゲーション強化学習/ナビゲーション2024/5/1
LSTMを用いた深層強化学習により、カルマン渦列のような非定常渦流中をロボット魚が効率的に航行できる制御方策を学習させた。
- 重要なものだけを記憶する:多重走行からの創発的シーン分解3Dマッピング2024/5/1
同じ領域を複数回走行したRGB動画から、自己教師ありで環境と一時的物体を分離し、3Dガウシアンマップを構築する手法を提案。
- ν-DBA: ニューラル陰的密バンドル調整による画像のみの走行シーン再構成SLAM/3D再構成2024/4/1
3Dニューラル陰的表面で地図を表現し、密オプティカルフローに導かれた幾何誤差で軌跡と地図を同時最適化する密バンドル調整フレームワークを提案し、走行シーンの軌跡推定と密再構成精度を向上させた。
- LiDAR拡散モデルによるリアルなシーン生成に向けて生成モデル2024/4/1
LiDARシーンのリアルさを保つため、曲線パターン・3D幾何・物体文脈を考慮した潜在空間で拡散モデルを学習し、高効率かつ制御可能なシーン生成を実現した論文。
- Explicit Interaction for Fusion-Based Place Recognition2024/2/1
- 把持・認識・配置:方策構造の事前知識を活用した効率的な未知物体再配置マニピュレーション2024/2/1
知覚ノイズに頑健な未知物体再配置のため、把持と配置の分離構造を事前知識として組み込んだ二重ループシステムGSPを提案し、CLIPを活用して高い完了率と少ないステップを実現した。
- 大規模言語モデルによる運転ポリシーの適応でどこでも走行自動運転2024/2/1
大規模言語モデルを使って各地域の交通ルールを解釈し、自動運転車の運転行動を新しい環境に適応させる手法LLaDAを提案した。
- NGEL-SLAM: Neural Implicit Representation-based Global Consistent Low-Latency SLAM System2023/11/1
- A Language Agent for Autonomous Driving2023/11/1
- A Two-stage Based Social Preference Recognition in Multi-Agent Autonomous Driving System2023/10/1
- GPT-Driver: Learning to Drive with GPT2023/10/1
- CNS: Correspondence Encoded Neural Image Servo Policy2023/9/1
- Sparse Waypoint Validity Checking for Self-Entanglement-Free Tethered Path Planning2023/8/1
- 3D Model-free Visual Localization System from Essential Matrix under Local Planar Motion2023/8/1
- An Efficient Multi-solution Solver for the Inverse Kinematics of 3-Section Constant-Curvature Robots2023/5/1
- Leveraging BEV Representation for 360-degree Visual Place Recognition2023/5/1
- Object-centric Inference for Language Conditioned Placement: A Foundation Model based Approach2023/4/1
- Zero-shot Transfer Learning of Driving Policy via Socially Adversarial Traffic Flow2023/4/1
- A Hyper-network Based End-to-end Visual Servoing with Arbitrary Desired Poses2023/4/1
- NF-Atlas: Multi-Volume Neural Feature Fields for Large Scale LiDAR Mapping2023/4/1
- Learning adaptive manipulation of objects with revolute joint: A case study on varied cabinet doors opening2023/4/1
- GOOD: General Optimization-based Fusion for 3D Object Detection via LiDAR-Camera Object Candidates2023/3/1
- EMV-LIO: An Efficient Multiple Vision aided LiDAR-Inertial Odometry2023/2/1
- DAMS-LIO: A Degeneration-Aware and Modular Sensor-Fusion LiDAR-inertial Odometry2023/2/1
- A Survey on Global LiDAR Localization: Challenges, Advances and Open Problems2023/2/1
- A Joint Modeling of Vision-Language-Action for Target-oriented Grasping in Clutter2023/2/1
- Failure-aware Policy Learning for Self-assessable Robotics Tasks2023/2/1
- Open-Set Object Detection Using Classification-free Object Proposal and Instance-level Contrastive Learning2022/11/1
- RING++: Roto-translation Invariant Gram for Global Localization on a Sparse Scan Map2022/10/1
- DeepRING: Learning Roto-translation Invariant Representation for LiDAR based Place Recognition2022/10/1
- A Robust and Constrained Multi-Agent Reinforcement Learning Electric Vehicle Rebalancing Method in AMoD Systems2022/9/1
- C^2:Co-design of Robots via Concurrent Networks Coupling Online and Offline Reinforcement Learning2022/9/1
- ViP3D: End-to-end Visual Trajectory Prediction via 3D Agent Queries2022/8/1
- Efficient Distance-Optimal Tethered Path Planning in Planar Environments: The Workspace Convexity2022/8/1
- Towards Two-view 6D Object Pose Estimation: A Comparative Study on Fusion Strategy2022/7/1
- FEJ-VIRO: A Consistent First-Estimate Jacobian Visual-Inertial-Ranging Odometry2022/7/1
- Efficient Search of the k Shortest Non-Homotopic Paths by Eliminating Non-k-Optimal Topologies2022/7/1
- VectorMapNet: End-to-end Vectorized HD Map Learning2022/6/1
- DPCN++: Differentiable Phase Correlation Network for Versatile Pose Registration2022/6/1
- Learning A Simulation-based Visual Policy for Real-world Peg In Unseen Holes2022/5/1
- Map-based Visual-Inertial Localization: Consistency and Complexity2022/4/1
- Learning to Fill the Seam by Vision: Sub-millimeter Peg-in-hole on Unseen Shapes in Real World2022/4/1
- Toward Consistent and Efficient Map-based Visual-inertial Localization: Theory Framework and Filter Design2022/4/1
- One RING to Rule Them All: Radon Sinogram for Place Recognition, Orientation and Translation Estimation2022/4/1
- Depth-Independent Depth Completion via Least Square Estimation2022/3/1
- A Visual Navigation Perspective for Category-Level Object Pose Estimation2022/3/1
- DXQ-Net: Differentiable LiDAR-Camera Extrinsic Calibration Using Quality-aware Flow2022/3/1
- Translation Invariant Global Estimation of Heading Angle Using Sinogram of LiDAR Point Cloud2022/3/1
- Tac3D: A Novel Vision-based Tactile Sensor for Measuring Forces Distribution and Estimating Friction Coefficient Distribution2022/2/1
- Trust-based Symbolic Motion Planning for Multi-robot Bounding Overwatch2022/1/1
- Bayesian Optimization Based Trustworthiness Model for Multi-robot Bounding Overwatch2022/1/1
- Object DGCNN: 3D Object Detection using Dynamic Graphs2021/10/1
- DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries2021/10/1
- Electric Vehicle Automatic Charging System Based on Vision-force Fusion2021/10/1
- Learning Interpretable BEV Based VIO without Deep Neural Networks2021/9/1
- Efficient Object Manipulation to an Arbitrary Goal Pose: Learning-based Anytime Prioritized Planning2021/9/1
- Anti-degenerated UWB-LiDAR Localization for Automatic Road Roller in Tunnel2021/9/1
- Domain Generalization for Vision-based Driving Trajectory Generation2021/9/1
- HiTMap: A Hierarchical Topological Map Representation for Navigation in Unknown Environments2021/9/1
- Learning Observation-Based Certifiable Safe Policy for Decentralized Multi-Robot Navigation2021/9/1
- Socially-Aware Multi-Agent Following with 2D Laser Scans via Deep Reinforcement Learning and Potential Field2021/9/1
- A Right Invariant Extended Kalman Filter for Object based SLAM2021/9/1
- A Multi-Hypothesis Approach to Pose Ambiguity in Object-Based SLAM2021/8/1
- Improved Radar Localization on Lidar Maps Using Shared Embedding2021/6/1
- Learn to Differ: Sim2Real Small Defection Segmentation Network2021/3/1
- Efficient learning of goal-oriented push-grasping synergy in clutter2021/3/1
- Toward Consistent Drift-free Visual Inertial Localization on Keyframe Based Map2021/3/1
- Kinematic Motion Retargeting via Neural Latent Optimization for Learning Sign Language2021/3/1
- Neural Motion Prediction for In-flight Uneven Object Catching2021/3/1
- Collaborative Recognition of Feasible Region with Aerial and Ground Robots through DPCN2021/3/1
- Radar-to-Lidar: Heterogeneous Place Recognition via Joint Learning2021/2/1
- Robust localization for planar moving robot in changing environment: A perspective on density of correspondence and depth2020/11/1
- Learning World Transition Model for Socially Aware Robot Navigation2020/11/1
- CORAL: Colored structural representation for bi-modal place recognition2020/11/1
- PREGAN: Pose Randomization and Estimation for Weakly Paired Image Style Translation2020/11/1
- Dynamic Movement Primitive based Motion Retargeting for Dual-Arm Sign Language Motions2020/11/1
- Improving Redundancy Availability: Dynamic Subtasks Modulation for Robots with Redundancy Insufficiency2020/11/1
- DiSCO: Differentiable Scan Context with Orientation2020/10/1
- Improving the generalization of network based relative pose regression: dimension reduction as a regularizer2020/10/1
- Imitation Learning of Hierarchical Driving Model: from Continuous Intention to Continuous Trajectory2020/10/1
- RaLL: End-to-end Radar Localization on Lidar Map Using Differentiable Measurement Model2020/9/1
- Deep Samplable Observation Model for Global Localization and Kidnapping2020/9/1
- Deep Phase Correlation for End-to-End Heterogeneous Sensor Measurements Matching2020/8/1
- Collaborative Localization of Aerial and Ground Mobile Robots through Orthomosaic Map2020/7/1
- Pillar-based Object Detection for Autonomous Driving2020/7/1
- Learning hierarchical behavior and motion planning for autonomous driving2020/5/1
- Radar-on-Lidar: metric radar localization on prior lidar maps2020/5/1
- Globally optimal consensus maximization for robust visual inertial localization in point and line map2020/2/1
- Cellular Decomposition for Non-repetitive Coverage Task with Minimum Discontinuities2020/1/1
- DeepGoal: Learning to Drive with driving intention from Human Control Demonstration2019/11/1
- Weakly-Supervised Road Affordances Inference and Learning in Scenes without Traffic Signs2019/11/1
- Autonomous Driving using Safe Reinforcement Learning by Incorporating a Regret-based Human Lane-Changing Decision Model2019/10/1
- Towards navigation without precise localization: Weakly supervised learning of goal-directed navigation cost map2019/6/1
- LiDAR-Camera Calibration under Arbitrary Configurations: Observability and Methods2019/3/1
- Communication constrained cloud-based long-term visual localization in real time2019/3/1
- 2-Entity RANSAC for robust visual localization in changing environment2019/3/1
- Human-Robot Trust Integrated Task Allocation and Symbolic Motion planning for Heterogeneous Multi-robot Systems2018/10/1
- Target Transfer Q-Learning and Its Convergence Analysis2018/9/1
- Trust-based Multi-Robot Symbolic Motion Planning with a Human-in-the-Loop2018/8/1
- Multi-session Map Construction in Outdoor Dynamic Environment2018/7/1
- Laser map aided visual inertial localization in changing environment2018/3/1
- Bounded Policy Synthesis for POMDPs with Safe-Reachability Objectives2018/1/1
- LocNet: Global localization in 3D point clouds for mobile vehicles2017/12/1
- Parse Geometry from a Line: Monocular Depth Estimation with Partial Laser Observation2016/11/1
- Place classification with a graph regularized deep neural network model2015/6/1