Jing Zhang
Renmin University of China
収録論文 40本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AdaOcc: 身体性タスクのための適応的3D占有予測3D占有予測2026/9/30
様々なセンサ構成や計算予算に適応できる、点ベースの3D意味占有予測手法AdaOccを提案し、Occ-ScanNetで最先端性能を達成した。
- RoboHarn-Evo: 階層的物理知識を進化させ自己改善するロボットマニピュレーションマニピュレーション2026/9/29
物理的な試行錯誤からタスク知識と行動知識を階層的に蓄積・修正し、基盤モデルを更新せずにロボット操作の成功率を高めるフレームワークを提案。
- 相互作用中心モデリングによる2本指グリッパ操作の統一的クロスドメイン表現の実現マニピュレーション2026/9/25
2本指グリッパの共通構造をパラメータ化した抽象化で捉え、VLMとSAMで相互作用 triplet を推定し、Flow-Matching Transformerで7自由度動作を生成することで、異なるロボット間や視点間でのゼロショットsim-to-real転移を可能にした模倣学習手法。
- RoboRecover: 実行逸脱下におけるロボット方策の回復力ベンチマークベンチマーク2026/9/24
実行中の逸脱状態から元のタスクを回復する能力を評価するベンチマークを提案し、初期状態の性能が回復性能を決めないことを示した。
- ロボット学習における潜在アクションの重要要素ロボット学習2026/8/20
ロボット操作のための潜在アクションモデル(LAM)の設計選択を体系的に比較し、41の設計選択肢を3次元で評価。VLMバックボーンの微調整が下流のポリシー学習に有効であることを示した。
- JEPA-WAM: 共同埋め込み世界モデリングによる視覚-言語-行動ポリシーの学習VLA/世界モデル2026/8/1
事前学習済みV-JEPA空間に基づく潜在世界モデルを構築し、遷移予測と行動生成を共有予測器で結合することで、効率的かつ高精度なロボット制御を実現した。
- RCM制約付き視覚サーボの統合ベンチマーク:腹腔鏡ロボットにおけるモデリングと制御器の相互作用およびロバスト性解析医療ロボティクス/視覚サーボ2026/7/1
腹腔鏡下手術ロボットのRCM制約付き視覚サーボを評価するための、3つのRCMモデリング手法と6つのIBVS制御アーキテクチャを統合したオープンソースのシミュレーションフレームワークを提案し、モデリングと制御の相互作用による構造的感度を明らかにした。
- 密な身体化チェーン・オブ・ソート監視による視覚言語行動モデルの訓練VLA2026/6/1
ロボット間の転移を改善するため、視覚言語モデルに密な身体化チェーン・オブ・ソート(ECoT)監視を導入し、推論時にはECoT生成をスキップできるデュアルストリームアーキテクチャのVLAモデルZR-0を提案した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- ワールドモデル:アーキテクチャ、方法論、推論パラダイム、応用に関する包括的サーベイサーベイ2026/5/28
環境の構造とダイナミクスを学習する内部シミュレータであるワールドモデルについて、アーキテクチャ、方法論、推論戦略、応用領域の4軸で分類する包括的なサーベイを提供する。
- ピクセルからトークンへ:視覚言語行動モデルにおける潜在行動教師あり学習の体系的研究VLA2026/5/1
視覚言語行動モデル(VLA)の学習における潜在行動の教師あり手法を体系的に比較し、画像ベースと行動ベースの潜在行動がそれぞれ長期的推論と複雑な運動制御に有効であることを示した。
- ProcVLM: 手順に基づく進捗報酬を学習するロボット操作モデルマニピュレーション2026/5/1
長期的なロボット操作タスクにおいて、手順の構造と視覚変化に基づいて進捗を推定し、密な報酬信号を生成する視覚言語モデルProcVLMを提案した。
- MAGS-SLAM: 単眼マルチエージェント・ガウススプラッティングSLAMによる幾何・光度整合的な再構成SLAM2026/5/1
RGBカメラのみを用いた複数エージェントによる3DガウススプラッティングSLAMを提案し、各エージェントが局所サブマップを構築して圧縮情報を交換することで、深度センサなしで協調的な高品質3D再構成を実現した。
- ArtiCAD: マルチエージェントコード生成による関節CADアセンブリ設計CAD生成2026/4/13
テキストや画像から編集可能な関節CADアセンブリを生成する、訓練不要のマルチエージェントシステムを提案。設計段階で接続関係を予測し、検証とロールバック機構で品質を確保する。
- 一緒に歩こう:人間中心の屋外支援のための長期的社会的ナビゲーションナビゲーション2026/4/1
高レベルの自然言語指示から屋外での長期的な社会的ナビゲーションを実現する、地図不要のフレームワークを提案。GPSと公開地図APIのPOIを用いて目的地を推定し、高レベルVLMと低レベルVLAを状況に応じて切り替えることで、安全で社会的に適切な移動を実現する。
- SAMe: ロボット超音波のための意味的解剖マッピングエンジン医用ロボティクス2026/4/1
ロボット超音波の走査開始を支援するため、臨床症状から標的臓器を特定し、患者の外観画像から解剖学的表現を構築して、6自由度のプローブ初期化状態を生成する意味的解剖マッピングエンジンSAMeを提案した。
- アクション草案と検証:視覚言語行動モデルのための自己検証フレームワークVLA2026/3/1
拡散アクション専門家が複数のアクション候補を生成し、VLMが一回のフォワードパスでスコアリングして最適なものを選択する自己検証フレームワークを提案。シミュレーションと実世界で成功率を向上させた。
- EgoPush: 移動ロボットのための自己中心視点によるエンドツーエンド多物体再配置学習マニピュレーション2026/2/1
単一の自己中心カメラ映像のみから、移動ロボットが散らかった環境で複数物体を押して再配置する方策を、特権RL教師から視覚生徒への蒸留で学習し、実機へゼロショット転移した研究。
- AdaWorldPolicy: 世界モデル駆動型拡散ポリシーとオンライン適応学習によるロボットマニピュレーションマニピュレーション2026/2/1
世界モデル・行動エキスパート・力予測器をFlow Matching Diffusion Transformerで統合し、オンライン適応学習で動的環境に適応するロボットマニピュレーション手法を提案。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- Wanderland:オープンワールド身体性AIのための幾何学的に接地したシミュレーションsim2real2025/11/1
実世界のマルチセンサーキャプチャから高精度な幾何学とフォトリアルな描画を両立する実→シミュレーション基盤を構築し、屋内・屋外都市シーンのデータセットを整備して、身体性ナビゲーションの再現可能な評価基盤を提供する。
- AVA-VLA: 能動的視覚注意による視覚言語行動モデルの改善VLA2025/11/1
VLAモデルを部分観測マルコフ決定過程として再定式化し、履歴を反映した再帰状態と能動的視覚注意で行動生成を改善する手法を提案。LIBEROやCALVINで最高性能を達成し、実機双腕タスクにも転移。
- Compressor-VLA: 指示に基づく視覚トークン圧縮による効率的なロボットマニピュレーションVLA2025/11/1
言語指示に応じて視覚トークンを動的に圧縮する2段階の手法を提案し、VLAモデルの計算量を削減しつつLIBEROベンチマークで高い成功率と実機転移を実現した。
- RGB単眼カメラの深度推定に基づくリハビリ用下肢外骨格の非接触ジェスチャ操作制御HRI/リハビリ外骨格2025/4/1
RGB単眼カメラの深度推定を用いて、リハビリ用下肢外骨格を非接触のジェスチャで操作する手法を提案し、94.11%の動作精度と平均0.615秒の応答時間を達成した。
- MapNav: 注釈付きセマンティックマップによる視覚言語ナビゲーションの新たな記憶表現VLA2025/2/1
視覚言語ナビゲーションにおいて、過去の観測フレームの代わりに注釈付きセマンティックマップを構築・更新して用いることで、記憶と計算の負荷を抑えつつ最先端性能を達成した研究。
- 物理AIのためのCosmos世界基盤モデルプラットフォーム世界モデル2025/1/1
物理AI開発者向けに、カスタマイズ可能な世界モデルを構築するための基盤モデル・動画キュレーション・トークナイザを提供するオープンソースプラットフォーム。
- データ多様性の敵対的活用による視覚的ローカリゼーションの改善視覚的ローカリゼーション2024/12/1
外観多様性を持つ3Dガウススプラッティングで訓練データを合成し、敵対的判別器でsyn-to-realギャップを埋めることで、絶対姿勢回帰のロバスト性を大幅に向上させた。
- CityWalker: Web規模の動画から身体性を伴う都市ナビゲーションを学習ナビゲーション2024/11/1
Web上の街歩き・運転動画から行動教師信号を抽出し、地図なし・路上外でも動ける都市ナビゲーション方策を大規模模倣学習で獲得した研究。
- FusionSense: 常識・視覚・触覚を融合したロバストな疎視点再構成触覚2024/10/1
基盤モデルの事前知識と視覚・触覚の疎な観測を統合し、透明・反射・暗色物体でも高精度に3D再構成するフレームワークを提案。
- BEVNav: 鳥瞰図表現の時空間コントラスト学習によるロボット自律ナビゲーションナビゲーション2024/9/1
点群の鳥瞰図(BEV)表現を時空間コントラスト学習で獲得し、強化学習と組み合わせることで、地図なし環境での歩行者密集下でも頑健に動作するナビゲーション手法を提案した。
- あなたのHDマップ構築はセンサー劣化に耐えられるか?自動運転/HDマップ/ロバスト性2024/6/1
カメラやLiDARの29種類のセンサー劣化に対するHDマップ構築手法の頑健性を評価する初のベンチマークMapBenchを提案し、31手法を評価して性能低下を明らかにした。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- SurgicalPart-SAM: Part-to-Whole Collaborative Prompting for Surgical Instrument Segmentation2023/12/1
- Hierarchical Reinforcement Learning Based on Planning Operators2023/9/1
- SurgicalSAM: Efficient Class Promptable Surgical Instrument Segmentation2023/8/1
- Event-based Simultaneous Localization and Mapping: A Comprehensive Survey2023/4/1
- Localizing Scan Targets from Human Pose for Autonomous Lung Ultrasound Imaging2022/12/1
- 1st Workshop on Maritime Computer Vision (MaCVi) 2023: Challenge Results2022/11/1
- Center-of-Mass-based Robust Grasp Pose Adaptation Using RGBD Camera and Force/Torque Sensing2022/5/1
- SerialTrack: ScalE and Rotation Invariant Augmented Lagrangian Particle Tracking2022/3/1