Jian Tang
Beijing Innovation Center of Humanoid Robotics
収録論文 66本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WholeBodyWAM:スケーラブルな動作事前分布を用いた全身ワールドアクションモデルの学習全身マニピュレーション2026/9/16
人間やヒューマノイドの大規模動作データを事前学習に活用し、全身動作を予測するMotion Expertを組み込んだワールドアクションモデルを提案。実機ヒューマノイドの全身マニピュレーション性能を向上させた。
- Pelican-Sim 1.0:身体性知能のための汎用ワールドモデルシミュレータワールドモデル2026/9/10
視覚文脈とロボット行動から将来の観測を予測する汎用ワールドモデルシミュレータを提案し、統一行動表現やMoE、効率的なロールアウト生成により行動制御性と映像品質を大幅に向上させた。
- SOLO: 安定した全地形・長距離知覚ヒューマノイド歩行歩行2026/8/27
長距離歩行で累積する知覚・制御誤差による不安定化を解決するため、地形再構成の鮮明化と時間的クレジット割り当てを改善した統合フレームワークを提案。シミュレーションと実機で高い成功率を達成した。
- ロボットの世界モデルは本当に行動に従うのか?行動条件付き生成の診断とポリシー学習のための整合世界モデル/行動条件付き生成2026/8/25
ロボットの世界モデルが任意の行動に正しく従うかを評価するベンチマークWorldEchoを導入し、既存モデルが専門家の行動は再現できるが多様な非専門家軌道では失敗することを示した。さらに、行動追従を強化するWorldSyncを提案し、シミュレーションと実機タスクでポリシー改善の信頼性を向上させた。
- HAF: 階層的アクションフローとスペクトル潜在RLによる汎用VLAのヒューマノイド全身移動操作への適応ヒューマノイド/VLA/強化学習2026/8/17
汎用VLA基盤モデルをヒューマノイドの全身移動操作に適応させるための2部構成フレームワークHAFを提案。階層的なアクション生成とオンラインRLによるポリシー改善を実現する。
- GAINS: 強化学習における不整合な人間介入信号の活用介入学習/強化学習2026/8/16
人間の介入信号の遅延や不整合性を扱うため、分布強化学習と悲観的探索を用いた介入ベースのロボット操作学習フレームワークを提案し、シミュレーションと実機で高い成功率を達成した。
- Robo-ValueRL: オフラインからオンラインへの強化学習における信頼性の高い価値推定強化学習2026/7/1
オフラインからオンラインへの強化学習において、価値関数の信頼性がポリシー最適化に与える影響を分析する統一フレームワークを提案し、信頼性の高い価値推定が下流の性能向上に寄与することを実験で示した。
- Pelican-VLA 0.5: 行動前に注意を向けることで汎化を向上VLA2026/7/1
視覚言語理解、未来フレーム生成、行動予測を統合したVLAモデルを提案し、注意レベルの汎化を達成。ボトルネックトークンの導入により、未見のシーンやロボットでも操作対象に注意が向くことを示した。
- WAM4D: 空間レジスタトークンによる高速4DワールドアクションモデルVLA2026/6/1
ロボットの行動予測と未来観測を同時に行うワールドアクションモデルにおいて、軽量な空間レジスタトークンを用いて事前学習済みの幾何学的特徴を因果的なビデオ・アクショントランスフォーマーに転送し、高コストな幾何学的デコードを避けつつ4D空間整合性を向上させる手法を提案した。
- Labimus: 化学実験室における人型器用操作のためのシミュレーションとベンチマークシミュレーション/ベンチマーク2026/6/1
有機化学実験室での人型ロボットによる精密な器用操作を評価する初のベンチマークを提案し、実世界の作業台を再現したシミュレーション環境と精密さを考慮した評価プロトコルを導入した。
- SafeDojo: インタラクティブワールドモデルによるVLAのための安全強化学習安全強化学習/VLA2026/6/1
視覚言語行動(VLA)ポリシー向けに、ワールドモデルベースの想像を通じて安全な行動を学習する初のモデルベース安全強化学習フレームワークを提案。
- MV-WAM: 多様体を考慮した価値拡張付き世界行動モデル操作2026/6/1
視覚と行動のモダリティ間の構造的不整合を解消するため、多様体認識最適化と価値誘導ロールバックを備えた世界行動モデルMV-WAMを提案し、ロボット操作の汎化性能を向上させた。
- IOI: インタラクティブ世界モデルのための運動学と物理の分離世界モデル2026/6/1
解析的な運動学の事前知識と学習された物理ダイナミクスを組み合わせたハイブリッドなインタラクティブ世界モデルを提案し、正確な制御と物理的に妥当な視覚フィードバックを実現する。
- Pelican-Unify 1.0: 理解・推論・想像・行動を統合した身体化基盤モデルVLA2026/5/1
単一のVLMと統一未来生成器を用いて、理解・推論・想像・行動を一つのモデルで統合的に学習・実行する身体化基盤モデルを提案し、各能力のベンチマークで高い性能を達成した。
- VEGA: 空間認識型視覚言語行動モデルのための視覚エンコーダ接地整列VLA2026/5/1
VLAモデルの視覚エンコーダ出力を、3D空間認識を持つDINOv2-FiT3Dの特徴に直接整列させることで、空間認識能力を向上させる軽量なフレームワークを提案。推論時には追加コストなしで性能が向上する。
- HEX: 人間型アライメント専門家によるクロスエンボディ全身操作全身操作/VLA2026/4/1
全身協調操作を実現するため、人間型ロボットに特化した状態中心フレームワークHEXを提案。多様な身体構造に適用可能な状態表現と、全身協調と時間的運動ダイナミクスをモデル化する専門家混合機構を導入し、実機での操作成功率と汎化性能を向上させた。
- RobotPan: 身体化知覚のための360度全方位ロボット視覚システム視覚システム2026/4/1
6台のカメラとLiDARを組み合わせ、ロボット周囲を360度カバーする視覚システムを構築し、リアルタイムレンダリング・再構成・ストリーミングを可能にする3Dガウシアン予測フレームワークを提案した。
- 産業運搬タスクにおける人型ロボットの負荷対応歩行制御歩行制御2026/3/1
人型ロボットが荷物を運搬する際の安定歩行を実現するため、強化学習と運動学に基づく参照軌道を組み合わせた負荷対応フレームワークを提案し、シミュレーションと実機で有効性を検証した。
- Heracles: 精密追従と生成的合成を橋渡しする汎用人型制御人型制御2026/3/1
人型ロボットの汎用制御において、厳密な参照追従と生成的な適応を統合する拡散モデルベースの中間層を提案し、外乱に対する頑健性と自然な回復動作を実現した。
- RoboGene: 多様性駆動型エージェントフレームワークによる実世界タスク生成でVLA事前学習を強化VLA2026/2/1
多様で物理的に実現可能な操作タスクを自動生成するエージェントフレームワークを提案し、VLAモデルの事前学習データ収集を効率化して汎化性能を向上させた。
- CRAFT: 力覚対応カリキュラム微調整による接触の多いマニピュレーションへのVLAモデル適応マニピュレーション2026/2/1
VLAモデルに力覚情報を優先的に学習させるカリキュラム微調整フレームワークCRAFTを提案し、接触の多い操作タスクでの成功率と汎化性能を向上させた。
- RoboAug: 領域対比データ拡張による単一アノテーションから数百シーンへのロボットマニピュレーションマニピュレーション2026/2/1
1枚の画像のバウンディングボックス注釈だけで生成モデルと領域対比損失を用いてデータ拡張を行い、ロボットマニピュレーションの汎化性能を向上させる手法を提案。
- MeshMimic: 3Dシーン再構成による幾何学認識型ヒューマノイド動作学習ヒューマノイド/動作生成/sim2real2026/2/1
動画から3Dシーンと人間の動きを再構成し、地形との接触を保ったままヒューマノイドロボットの動作を学習させるフレームワークを提案。
- Wow, wo, val! 具現化世界モデル評価のためのチューリングテスト世界モデル評価2026/1/1
ロボット操作データ609件を用い、動画基盤モデルを世界モデルとして評価する5能力・22指標のベンチマークを提案し、人間の選好との相関0.93超を達成した。
- LaST₀:ロボット視覚言語行動モデルのための潜在時空間チェーン・オブ・ソートVLA2026/1/1
言語ではなく潜在空間で未来の視覚・3D・固有感覚を推論する時空間Chain-of-Thoughtを導入し、低頻度推論と高頻度行動生成を分離した二重システムVLAフレームワークを提案。
- TC-IDM: 実行可能なゼロショットロボット動作のための動画生成の接地VLA2026/1/1
生成された動画から道具の3D軌道を抽出し、それを6自由度のエンドエフェクタ動作に変換する逆動力学モデルを提案。ゼロショットで変形物体操作を含むタスクを実現した。
- RoboMIND 2.0:汎用身体知能のためのマルチモーダル両腕移動マニピュレーションデータセットマニピュレーション2025/12/1
6種類のロボットで集めた31万件超の両腕操作・移動マニピュレーション軌道(触覚・シミュレーション含む)を公開し、階層型VLM+VLAシステムMIND-2を提案した論文。
- シミュレーションと現実を繋ぐ:セマンティック2Dガウシアンスプラッティングによるドメイン間転移sim2real2025/12/1
物体中心のドメイン不変な空間特徴を抽出するセマンティック2Dガウシアンスプラッティングを提案し、シミュレーションから実世界への操作タスクの転移性能を向上させた。
- 不完全な介入を活用する実世界強化学習マニピュレーション2025/12/1
人間の介入が常に最適とは限らない実世界ロボット操作において、状態ごとの不確実性に基づく制約付き強化学習SiLRIを提案し、介入を活用しつつ性能劣化を防ぐ。
- Pelican-VL 1.0:身体知能のための基盤ブレインモデルVLA2025/11/1
7B〜72Bパラメータのオープンソース身体知能向けマルチモーダル基盤モデルを開発し、大規模データと新学習機構DPPOにより既存モデルを上回る性能を達成した。
- XR-1: 統合視覚運動表現の学習による汎用視覚-言語-行動モデルVLA2025/11/1
視覚ダイナミクスとロボット運動を統合した離散潜在表現UVMCを二枝VQ-VAEで学習し、異種ロボットデータを横断する汎用VLAモデルXR-1を三段階学習で構築した研究。
- PoseDiff: ロボット姿勢推定と動画から行動への制御を橋渡しする統合拡散モデルVLA2025/9/1
単一のRGB画像からロボットの3Dキーポイントや関節角度を推定し、さらに動画のキーフレームから長期行動列を生成する拡散モデルを提案。姿勢推定と逆動力学を一つの枠組みで統合した。
- MLA: ロボットマニピュレーションにおけるマルチモーダル理解と予測のためのマルチセンサリー言語行動モデルVLA2025/9/1
2D画像・3D点群・触覚を位置対応で統合し、将来のマルチセンサリー情報を予測する言語行動モデルを提案。接触の多い実世界タスクで従来の2D/3D VLAを大きく上回る。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- LHM-Humanoid: 雑然とした環境での連続物体運搬のための長期的ヒューマンモーション制御マニピュレーション2025/8/1
物理シミュレーション上のヒューマノイドが、リセットなしで繰り返し物体を運ぶ長期的動作を実現するため、サイクル間の遷移を「回復可能性」として学習する手法を提案。
- VLMから時間的に一貫した報酬を学習なしで生成する手法VLA2025/7/1
VLMを用いてサブゴールの状態変化を追跡し、ベイズ推定で報酬を生成することで、追加学習なしにロボット操作の強化学習を高精度化するフレームワークを提案。
- ヒューマノイド占有:汎用マルチモーダル占有知覚システムの実現占有知覚2025/7/1
ヒューマノイドロボット向けに、マルチモーダル融合と時系列統合を用いた占有グリッド知覚システムを構築し、専用のパノラマ占有データセットを整備した。
- RoboPARA: タスク間の並列割当と再構成による双腕ロボット計画マニピュレーション2025/6/1
LLMを活用し、依存グラフの生成と再探索によって双腕ロボットのタスク並列性を最大化する計画フレームワークを提案し、新データセットX-DAPTで有効性を示した。
- ArtVIP:ロボット学習のための視覚的リアリズム、モジュラー相互作用、物理的忠実性を備えた関節デジタルアセットsim2real2025/6/1
ロボット学習向けに、視覚的リアリズムと物理的忠実性を高めた関節物体のデジタルツインを多数収録したオープンソースデータセットArtVIPを構築し、模倣学習と強化学習で有効性を検証した。
- FreqPolicy: 周波数一貫性による効率的なフローベース視覚運動ポリシーVLA2025/6/1
フローベースの視覚運動ポリシーに周波数領域の一貫性制約を導入し、時間的連続性を保ちながら1ステップでの高品質な行動生成を可能にした手法。
- SwitchVLA: 実行状態を考慮したタスク切り替えが可能な視覚-言語-行動モデルVLA2025/6/1
実行中に指示が変わっても柔軟に対応できるVLAフレームワークを提案し、外部プランナーや専用データなしで滑らかなタスク切り替えを実現した。
- ロボットのための占有世界モデル世界モデル2025/5/1
屋内ロボット向けに、時空間受容野と自己回帰トランスフォーマーを組み合わせて3D占有シーンの進化を予測するRoboOccWorldを提案し、新しいベンチマークで有効性を示した。
- RoboOcc: ロボットのための幾何・意味シーン理解を強化する3D占有予測3D占有予測2025/4/1
3Dガウシアンの不透明度と幾何特性を活用したエンコーダで、ロボット周囲のシーンの細かい形状と意味を高精度に予測する手法を提案。
- HACTS: 人間を副操縦士とするロボット学習用遠隔操作システム遠隔操作2025/3/1
ロボットアームと遠隔操作デバイスの双方向リアルタイム関節同期を実現し、人間が介入しながら修正データを収集できる低コストなシステムを開発した。模倣学習と強化学習の性能を向上させる。
- HumanoidPano:ヒューマノイドロボットのための球面パノラマ-LiDARハイブリッドクロスモーダル知覚クロスモーダル知覚2025/3/1
パノラマ視覚とLiDARを球面ビジョントランスフォーマーで融合し、ヒューマノイドの自己遮蔽と狭視野を克服する360度BEV知覚フレームワークを提案。
- EmbodiedVSR: 動的シーングラフ誘導による視覚空間タスクの連鎖推論VLA2025/3/1
動的シーングラフとChain-of-Thought推論を組み合わせ、微調整なしで身体性エージェントの空間推論を強化するフレームワークを提案し、新ベンチマークで有効性を示した。
- ACL-QL: オフライン強化学習のためのQ学習における適応的保守レベルオフライン強化学習2024/12/1
オフライン強化学習において、状態行動ペアごとに保守性の度合いを適応的に制御する手法ACL-QLを提案し、過度に保守的になる問題を緩和して性能を向上させた。
- RoboMIND:ロボットマニピュレーションのためのマルチエンボディメント知能規範データセットマニピュレーション2024/12/1
4種類のロボットによる10.7万件の模倣学習用デモンストレーション軌道と失敗例、デジタルツイン環境を提供する大規模データセットを構築し、VLAモデルの性能を評価した。
- REGNet V2: 異なるサイズのグリッパ向けエンドツーエンド領域ベース把持検出ネットワークマニピュレーション2024/10/1
点群にグリッパパラメータを埋め込み、スコア・領域・精緻化の3段階ネットワークで多様な物体への把持を予測するシステムを提案し、実環境で高い成功率を達成した。
- DexDiff: 制約のない環境で掴めない物体を外的手先で操作するマニピュレーション2024/9/1
VLMによる高レベル計画と目標条件付き拡散モデルを組み合わせ、壁や机の端を利用して本や鍋のような掴みにくい物体を掴む外的手先操作を実現した。
- 離散ポリシー:マルチタスクロボット操作のための分離された行動空間の学習マニピュレーション2024/9/1
ベクトル量子化で行動系列を離散潜在空間にマッピングし、タスク固有のコードを学習することで、マルチタスク操作を可能にするロボット学習手法を提案。実機実験でDiffusion PolicyやOpenVLAを上回る成功率を達成。
- TinyVLA: ロボットマニピュレーションのための高速・データ効率的な視覚言語行動モデルVLA2024/9/1
大規模事前学習不要で高速推論が可能なコンパクトな視覚言語行動モデルTinyVLAを提案し、シミュレーションと実機でOpenVLAを上回る速度とデータ効率を実現した。
- ロボット操作のための10億パラメータへの拡散方策のスケーリング模倣学習2024/9/1
拡散方策のスケーリング問題を解決するため、観測特徴の分解と非因果的注意を用いたスケーラブル拡散トランスフォーマー方策を提案し、10億パラメータまで拡張可能にした。
- MMRo:マルチモーダルLLMは家庭内ロボットの脳として適格か?VLA2024/6/1
家庭内ロボットの脳としてマルチモーダルLLMを評価する初のベンチマークMMRoを提案し、知覚・計画・視覚推論・安全性の4能力14指標で商用・オープンソースモデルを比較した。
- 検索拡張型身体性エージェントマニピュレーション2024/4/1
ロボットに外部のポリシー記憶を検索させて過去の経験を活用し、複雑な操作タスクの性能を高める手法を提案した。
- 基盤モデルを用いたロボティクス:身体性AIに向けたサーベイVLA2024/2/1
ロボットの自律マニピュレーションを対象に、基盤モデルを活用した研究を高レベル計画と低レベル制御の両面から整理し、データセット・シミュレータ・ベンチマークや今後の課題をまとめたサーベイ。
- Learning from Imperfect Demonstrations with Self-Supervision for Robotic Manipulation2024/1/1
- SM$^3$: Self-Supervised Multi-task Modeling with Multi-view 2D Images for Articulated Objects2024/1/1
- Visual Robotic Manipulation with Depth-Aware Pretraining2024/1/1
- Language-Conditioned Robotic Manipulation with Fast and Slow Thinking2024/1/1
- Object-Centric Instruction Augmentation for Robotic Manipulation2024/1/1
- Efficient Training of Generalizable Visuomotor Policies via Control-Aware Augmentation2024/1/1
- DTF-Net: Category-Level Pose Estimation and Shape Reconstruction via Deformable Template Field2023/8/1
- CMG-Net: An End-to-End Contact-Based Multi-Finger Dexterous Grasping Network2023/3/1
- Prioritized Planning for Target-Oriented Manipulation via Hierarchical Stacking Relationship Prediction2023/3/1
- Robotic Grasping from Classical to Modern: A Survey2022/2/1