Yan Huang
CASIA
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ワールドモデルからワールドアクションモデルへ:次状態予測の再考VLA2026/9/28
次状態の表現をRGBや単一特徴に固定せず、視覚・意味・幾何・相互作用の複数投影を動的にサンプリングして統合学習するCF-WAMを提案し、人間とロボットの経験を共有遷移学習に活かして制御性能と汎化を向上させた。
- OPIS: ビデオ世界モデルにおけるマルチオブジェクト記憶のための入力接地ベンチマークビデオ世界モデル2026/9/28
ビデオ世界モデルが初期観測の物体をどれだけ記憶できるかを評価するベンチマークOPISを提案し、8モデルで物体の存在・同一性・構造を測定した。
- VISTA: 視覚から推定する空間接触注意による高密度接触操作マニピュレーション2026/8/26
接触を伴う精密操作のため、視覚のみからグリッパの変形を推定し、触覚センサなしで接触情報を獲得する模倣学習フレームワークを提案した。
- UniReflex: 高速・低速反射による事前学習生成ポリシーのためのプラグアンドプレイ力制御力制御2026/8/18
事前学習済みの生成ポリシーに追加学習なしで力制御を組み込むプラグアンドプレイフレームワークを提案。潜在表現から高速反射ネットワークが可変インピーダンス制御を駆動し、接触安定性を向上させる。
- XEWorld:行動条件付きワールドモデルは未知のロボット形態に汎化できるか?ワールドモデル2026/8/1
ロボット操作のための行動条件付きワールドモデルが、未見のロボット形態に対して物理ダイナミクスを捉えているかを検証するため、クロスエンボディメントテストベッドXEWorldを導入し、既存モデルの限界を分析した。
- BridgeVLA++: 3次元操作のためのデータ効率的で汎化可能なメモリ拡張型視覚言語行動フレームワークVLA2026/8/1
事前学習済み視覚言語モデルを活用した3次元ロボット操作フレームワークBridgeVLAを拡張し、空間的・時間的メモリを統合することで、データ効率と汎化性能を保ちつつ、記憶依存の操作タスクで最先端の性能を達成した。
- UESF-Bench: 統合型身体性探索・追従のためのベンチマークと分析VLA2026/7/15
言語で指示された人物を探索し、その後追従する統合的なタスクのベンチマークを新たに構築し、探索と追従を切り替えるVLAフレームワークを提案・評価した論文。
- FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いるVLA2026/7/1
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
- DA-Nav: 方向認識型の都市規模視覚言語ナビゲーションナビゲーション2026/7/1
市街地規模の屋外ナビゲーションを、商用ナビの方向指示を利用して、自己中心視画像上の離散的な空間接地問題として再構成し、軌道回復を可能にするフレームワークを提案した。
- 信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル信頼性評価2026/7/1
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
- 見ることが信じることではない ― 検索基盤型動画誤情報検出のベンチマーク誤情報検出2026/6/2
動画の誤情報を検出するため、ウェブ検索で関連動画を探し比較するベンチマークEVID-Benchを構築し、最先端モデルの性能が低いことを示した。
- 物体ベースのマルチロボットSLAMのための分散ポーズグラフリーマン最適化SLAM2026/6/1
通信トポロジーに柔軟性を持たせた、物体ベースのマルチロボットSLAM向け完全分散型リーマン最適化フレームワークを提案。コンセンサス機構と近似ニュートン法により、収束性と通信効率を向上させた。
- WAM-Nav: 非対称潜在世界行動モデリングによる統合視覚ナビゲーションナビゲーション2026/6/1
視覚ナビゲーションのための潜在世界行動モデルを提案し、行動生成と視覚予測を共同で学習することで、推論効率を保ちつつ先見的な障害物回避を実現した。
- 構造化された段階とキーフレーム監視による視覚言語行動モデルのファインチューニング改善VLA2026/6/1
ロボット操作のVLAモデルにおいて、グリッパーイベント遷移に失敗が集中する問題を解決するため、デモのグリッパー状態から自動的に段階分類器とキーフレーム予測器を補助ヘッドとして学習し、ベースポリシーを変えずに性能を向上させるStaKeフレームワークを提案した。
- SKIP: 効率的な具現化ワールドモデルのためのスパースキーフレーム補間パラダイムワールドモデル2026/6/1
ロボット操作動画の生成を、タスク関連のキーフレームのみを生成し、残りを補間することで高速化する手法を提案。
- Efficient-WAM: 低コストな未来想像を備えた10億パラメータの世界行動モデルVLA2026/6/1
未来の視覚予測を圧縮し、推論コストを大幅に削減した世界行動モデルを提案。実機で約100msの低遅延を実現しつつ、制御性能を維持する。
- DiM-WAM: 多様な履歴イベントメモリを用いた世界行動モデリングVLA2026/6/1
長期依存タスク向けに、多スケールの履歴コンテキストとタスク進捗を統合したメモリ拡張型世界行動モデルを提案し、ロボット操作の成功率を大幅に向上させた。
- E-TTS:ロボット操作のための新しい具現化テスト時スケーリングフレームワークマニピュレーション2026/6/1
ロボット操作タスクにおいて、推論と行動の両方を履歴情報を活用して反復的に洗練する、モジュール式でプラグアンドプレイなテスト時スケーリングフレームワークを提案した。
- SpatialVAM: 空間認識型マルチビュービデオ拡散によるデータ効率的なロボットポリシーVLA/操作2026/4/1
3D空間構造と時間変化を同時に捉えるため、空間認識型のマルチビューヒートマップビデオとRGBビデオを生成する初の3Dビデオ行動モデルを提案し、少数のデモで汎用的な操作を実現した。
- FloorPlan-VLN: フロアプラン誘導型視覚言語ナビゲーションの新パラダイムVLA2026/3/1
視覚言語ナビゲーション(VLN)において、フロアプランを大域的な空間事前情報として活用する新しいタスクとデータセットを提案し、簡潔な指示だけでナビゲーションを可能にする手法FP-Navを導入した。
- 不確実性を考慮した観測再注入による視覚-言語-行動モデルの強化VLA2026/2/1
VLAモデルの言語層の不確実性が高いときに、観測情報を次層のFFNに再注入する訓練不要のプラグインモジュールを提案し、追加データやモジュールなしで行動生成の精度と信頼性を向上させた。
- BridgeV2W: 身体マスクで動画生成モデルを身体性世界モデルへ橋渡し世界モデル2026/2/1
座標空間の行動をURDFとカメラパラメータから描画した身体マスクに変換し、ControlNet風に動画生成モデルへ注入することで、視点や身体構造に依存しない統一的な身体性世界モデルを実現した。
- UniBYD: 人間の模倣を超えた多様なロボットハンドの操作学習のための統合フレームワークマニピュレーション2025/12/1
ロボットと人間の身体差を超え、多様なロボットハンド形態に適応する操作方策を強化学習で獲得する統合フレームワークUniBYDを提案。動的PPOと影エンジンにより人間模倣を超えた適応的探索を実現。
- VERM:基盤モデルを活用した効率的な3Dロボット操作のための仮想視点マニピュレーション2025/12/1
複数の固定カメラの冗長な情報を基盤モデルで仮想視点に統合し、3D操作の精度と効率を向上させる手法を提案。
- VP-AutoTest: 仮想・実機融合型自動運転テストプラットフォーム自動運転テスト2025/12/1
仮想と実機の要素を組み合わせ、単車・複数車協調の敵対的テストや並列推論、多次元評価とAI診断を可能にする自動運転テストプラットフォームを提案した。
- UMIGen:自己中心点群生成とクロスエンボディメント模倣学習の統合フレームワーク模倣学習2025/11/1
ハンドヘルドデバイスで点群の観察-行動ペアを収集し、視認性を考慮した最適化で自己中心3D観測を生成することで、異なるロボット形態への転移を可能にする枠組みを提案した。
- EgoDemoGen: ロボットマニピュレーションにおける視点汎化のための自己中心視点デモ生成マニピュレーション2025/9/1
自己中心視点が変化しても動作する模倣学習ポリシーのため、新視点での観測と行動のペアを生成するフレームワークを提案。軌道変換と条件付き動画生成を組み合わせ、シミュレーションと実機で成功率を大幅に改善した。
- UltraTac:超音波と視触覚を統合したロボット知覚センサ触覚2025/8/1
視触覚センサに超音波センシングを同軸光音響構造で統合し、近接覚・材質分類・テクスチャと材質の同時認識を実現した。
- CoCoL: マルチロボットシステム向け通信効率の良い分散協調学習法群制御2025/8/1
ミラー降下法と勾配追跡を組み合わせ、異種データを持つマルチロボットシステムの協調学習において通信回数と帯域を削減しつつ高精度を維持する手法を提案。
- EC-Flow: 動作ラベルなし動画からの多様なロボットマニピュレーションを可能にする身体中心フローマニピュレーション2025/7/1
動作ラベルなし動画から身体中心のフローを予測して模倣学習を行い、変形物体や遮蔽、非物体変位タスクにも対応するロボットマニピュレーション手法を提案した。
- BridgeVLA: 視覚言語モデルによる効率的な3Dマニピュレーション学習のための入出力アラインメントVLA2025/6/1
3D入力を複数の2D画像に投影し、2Dヒートマップで行動予測を行うことで、VLMを活用した3Dマニピュレーション学習を効率化する手法を提案。
- 連続環境における制約認識型ゼロショット視覚言語ナビゲーションVLA2024/12/1
ゼロショットVLN-CEを制約認識型のサブ命令完了プロセスとして再構成し、CSMとCVMの2モジュールでナビゲーション計画を逐次生成するCA-Navを提案、ベンチマークで最高性能を達成した。
- HGSFusion: ハイブリッド生成と同期によるレーダー・カメラ融合3D物体検出センサーフュージョン2024/12/1
レーダーの到来方向推定誤差を考慮して確率密度関数で点群を稠密化し、空間・モダリティ同期で画像特徴と融合する3D物体検出ネットワークを提案。
- GR-MG: 部分注釈データを活用するマルチモーダル目標条件付きポリシーマニピュレーション2024/8/1
テキスト指示と目標画像の両方で条件付けできるポリシーを提案し、部分的に注釈されたデータを活用してロボット操作の汎化性能を向上させた。
- Chemistry3D: 化学実験向けロボットインタラクションベンチマークsim2real2024/6/1
NVIDIA Omniverse上に構築した化学実験シミュレーションツールキットで、液体や透明物体の操作、温度・色・pH変化の可視化、RLタスクやSim2Real検証を提供する。
- Dual-modal Tactile E-skin: Enabling Bidirectional Human-Robot Interaction via Integrated Tactile Perception and Feedback2024/2/1
- ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments2023/4/1
- BEVBert: Multimodal Map Pre-training for Language-guided Navigation2022/12/1
- 1st Place Solutions for RxR-Habitat Vision-and-Language Navigation Competition (CVPR 2022)2022/6/1