Weinan Zhang
Shanghai Jiao Tong University
収録論文 52本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SplineWAM: Bスプライン表現によるワールドアクションモデルの適応的行動ホライズンVLA2026/9/30
行動軌道を3次Bスプラインで圧縮し、動作の複雑さに応じて行動チャンクの時間解像度と長さを適応的に変えるワールドアクションモデルを提案。推論呼び出しを削減しつつ成功率を向上させた。
- NEXUS: 地形適応型テレオペレーションのための知覚的全身体制御テレオペレーション2026/9/30
人間の動作指令と機体のセンサ情報を組み合わせ、異なる地形でもロボットが姿勢と接地を適応させて全身テレオペレーションを実現する制御フレームワークを提案。
- InternW0-Δ: 予測ダイナミクスと行動を橋渡しする20K時間超のオープンデータによるワールドアクションモデルVLA2026/9/25
視覚ダイナミクスと行動生成を統合したワールドアクションモデルを、20,000時間超の異種オープンデータで事前学習し、シミュレーションと実機で従来手法を上回る性能を達成した。
- 視覚言語行動ポリシーのためのアドバンテージ誘導事後学習の分解VLA2026/9/23
視覚言語行動ポリシーの事後学習において、アドバンテージ誘導強化学習の設計選択を分解し、段階的評価で有効なモジュール式レシピを特定した。
- InternW0: 効率的な実世界インタラクションのための基盤的物理世界モデル世界モデル2026/9/23
上海AI Labが、視覚予測とロボット制御を非対称なvideo-actionアーキテクチャで統合した物理世界モデルInternW0を提案。約7,200時間のデータで学習し、化学合成やピペッティングなどの実世界タスクで評価した。
- RoboStriker: 自律型ヒューマノイドボクシングのための潜在空間戦略ゲーム強化学習/ヒューマノイド2026/8/17
ヒューマノイドボクシングを2プレイヤーの潜在空間ゼロサムマルコフゲームとして定式化し、戦略的探索と物理的実現性の矛盾を解決する階層的フレームワークを提案した。
- GAUGE: 物理的忠実性を測定するための実世界基盤ベンチマーク物理シミュレーション/ベンチマーク2026/8/1
シミュレーションエンジンと生成ビデオワールドモデルの物理的忠実性を、実世界の軌跡に基づいて診断するベンチマークを提案した。22のタスクファミリーで剛体・柔軟物・布・変形物体の物理過程を評価し、既存の物理エンジンやビデオモデルの不一致を明らかにした。
- ワールドモデルの定義とロードマップワールドモデル2026/7/7
AIの各分野で使われる「ワールドモデル」の定義を明確化し、技術的側面と開発段階のロードマップを提案する視点論文。
- 人型ロボットのためのスケーリング行動基盤モデル人型ロボット制御2026/7/1
人型ロボットの制御を大規模行動データで学習する行動基盤モデル(BFM)のスケーリング手法を提案し、学習パラダイム、データ、モデル構造の協調により性能が向上することを示した。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- HELP: ロールアウト分割による人間効率的な大規模ロボットポストトレーニングVLA/ポストトレーニング2026/7/1
VLAモデルのポストトレーニングにおいて、2人の専門オペレータが12台のロボットを同時監視し、ロールアウトを自動分割する手法を提案し、人間の労力あたりのポリシー改善とタスクスループットを最大化する。
- RoboSnap: ワンショット実世界からシミュレーションへのシーン生成による汎用ロボット学習と評価sim2real2026/7/1
単一のRGB画像から物理的に安定し視覚的にも忠実なシミュレーション環境を自動生成するフレームワークを提案し、ロボットの軌道再現やポリシー学習・評価に活用できることを示した。
- AHA-WAM:非同期・地平線適応型ワールドアクションモデルと観測誘導コンテキストルーティング操作学習2026/6/8
世界予測と行動実行を異なる時間解像度で行う非同期ワールドアクションモデルを提案し、ロボット操作タスクで性能を向上させた。
- LLMエージェントのオフ方策評価のための自己回帰拡散ワールドモデルLLMエージェント評価2026/6/4
事前収集した軌跡のみから、新しいLLMエージェント方策の性能を推定する評価フレームワークADWMを提案。各遷移を独立した拡散過程としてモデル化し、方策条件付きスコア関数でエージェントの意思決定を反映したシミュレーションを実現する。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- PRTS: 対比表現を用いたプリミティブ推論とタスク実行システムVLA2026/4/1
視覚言語行動モデルを、教師あり模倣学習ではなく目標条件付き強化学習として再構成し、言語指示を目標として扱うことで、物理的な到達可能性を評価する統一埋め込み空間を学習する基盤モデルを提案した。
- PEPA: 個性を持つ持続的自律型身体性エージェント自律エージェント2026/3/1
性格特性を内在的な目標生成の原理として用い、三層認知アーキテクチャにより四足歩行ロボットが外部指示なしに自律的に目標を生成・実行するフレームワークを提案。
- EAGLE: 具現化を考慮した汎用・特化蒸留による統合ヒューマノイド全身制御全身制御2026/2/1
汎用ポリシーとロボット特化ポリシーを反復的に蒸留し合うことで、複数の異なるヒューマノイドを単一のポリシーで制御できる全身制御手法を提案した。
- 模倣を超えて:VLAモデルのための強化学習ベースのSim-Real協調学習VLA2026/2/1
実機とシミュレーションのデモでSFT後、シミュレーションで強化学習しつつ実機データの補助損失で忘却を防ぐ協調学習フレームワークを提案し、実機卓上操作タスクで成功率と汎化性能を向上させた。
- 異なるヒューマノイド間で汎用化する全身制御フレームワークXHugWBC全身制御/sim2real2026/2/1
形態をランダム化した多数のヒューマノイドで一度学習させることで、未知の機体にもゼロショットで転移できる汎用全身制御ポリシーを実現した。
- TextOp: テキストでリアルタイムに動くヒューマノイドの動作生成と制御ヒューマノイド制御2026/2/1
テキスト指示を逐次受け取りながら、上位の拡散モデルで動作軌道を生成し下位の追従制御で実機ヒューマノイドを動かす、対話的に指示変更できる枠組みを提案した。
- UniCon:異種ロボット間の効率的な学習転送を実現する統合システムsim2real2026/1/1
ロボットの状態・制御・計測を標準化し、実行グラフでワークフローを分解する軽量フレームワークUniConを提案。ROSより高効率な推論とsim-to-real転送を実現し、7社12機種以上で実証。
- RoboStriker: 自律ヒューマノイドボクシングのための階層的意思決定ヒューマノイド制御2026/1/1
人間のモーションキャプチャからボクシングスキルを学習し、潜在空間での自己対戦強化学習により、シミュレーションと実機で競技可能なヒューマノイドボクシングを実現した。
- H-Zero: ヒューマノイド横断歩行事前学習による少数ショット新規身体転移歩行2025/12/1
複数のヒューマノイドで歩行方策を事前学習し、未知のヒューマノイドや直立四足歩行ロボットへ30分の微調整で転移できることを示した研究。
- RLinf-VLA:視覚言語行動モデルの強化学習のための統合効率フレームワークVLA2025/10/1
多様なVLAモデルとRLアルゴリズム、シミュレータを統合し、効率的な強化学習を可能にするフレームワークを提案。LIBEROやManiSkillなどで高い成功率を達成。
- KungfuBot2: ヒューマノイド全身制御のための多様な運動スキル学習全身制御2025/9/1
多様な人間の動きを追従させることで、単一の方策でヒューマノイドの全身運動スキルを学習する統合制御器VMSを提案し、シミュレーションと実機で動的スキルの模倣と長時間安定性、未見動作への汎化を実証した。
- シミュレーションと同じ操作を実現:ロボットにおける正確な幾何認識の実現sim2real2025/9/1
深度カメラのノイズを除去して正確なメートル深度を推定するCamera Depth Models(CDMs)を提案し、シミュレーションで訓練した方策を実世界ロボットにそのまま適用可能にした。
- TrajBooster: 軌道中心学習によるヒューマノイド全身マニピュレーションの強化VLA2025/9/1
車輪型ヒューマノイドの豊富なデータを活用し、エンドエフェクタ軌道を形態非依存のインターフェースとして二足歩行ヒューマノイドのVLAを効率的に学習させるフレームワークを提案。
- CookBench: 複雑な料理シナリオにおける長期的身体性計画ベンチマーク身体性計画2025/8/1
高忠実度Unityシミュレータ上で、ユーザ意図の認識と長期的・細粒度の身体動作による料理遂行を評価するベンチマークを提案。
- UniTracker: ヒューマノイドロボットのための汎用全身運動トラッカー学習全身運動制御2025/7/1
3段階の学習フレームワークで、多様な人間の動きをヒューマノイドロボットが追従できる汎用全身運動トラッカーを実現し、実機でも高い性能を示した。
- MobileUse: 階層的リフレクションを備えた自律モバイル操作GUIエージェントGUIエージェント2025/7/1
モバイル操作を自動化するGUIエージェントMobileUseを提案。階層的リフレクションで長期的タスクのエラー回復を実現し、能動的探索で未知環境のコールドスタート問題に対処、AndroidWorldとAndroidLabで最高性能を達成した。
- KungfuBot:物理ベースのヒューマノイド全身制御による高ダイナミック技能の学習ヒューマノイド全身制御2025/6/1
人間のカンフーやダンスのような高速・高ダイナミックな動作を、物理制約を考慮した動作処理と適応的な追従カリキュラムでヒューマノイドに模倣させる全身制御フレームワークを提案し、Unitree G1で実機検証した。
- GenPO: 拡散生成モデルとオンポリシー強化学習の融合VLA2025/5/24
拡散ポリシーをPPOなどのオンポリシーRLに組み込むため、正確な拡散反転と二重ダミー行動機構で対数尤度計算を可能にした生成ポリシー最適化フレームワークを提案。
- MARFT: マルチエージェント強化学習ファインチューニングマルチエージェント強化学習2025/4/1
LLMベースのマルチエージェントシステムを強化学習でファインチューニングするための新しい定式化とフレームワークを提案し、従来のマルチエージェント強化学習との違いを分析した。
- PALo: 四足歩行ロボットの姿勢認識型移動制御の学習歩行2025/3/1
四足歩行ロボットの速度追従に加え、体高やピッチ・ロール角をリアルタイムに調整できる姿勢認識型の移動制御を、深層強化学習で実現し実機へ転移した研究。
- DriveGen: 大規模モデルによる無限で多様な交通シナリオ生成交通シミュレーション2025/3/1
大規模言語モデルと視覚言語モデルを組み合わせ、地図・車両アセット生成から軌道計画までを一貫して行う交通シミュレーションフレームワークDriveGenを提案。さらに失敗を活用したコーナーケース自動生成も実現した。
- 動的バランスと強化学習による狭所でのヒューマノイド全身移動歩行2025/2/1
固有感覚のみを用い、ZMPに基づく動的バランス報酬と全身のactor-critic強化学習で、ヒューマノイドが狭い足場や予期せぬ障害物を安定して歩行できる手法を提案した。
- BeamDojo: 疎な足場上での俊敏なヒューマノイド歩行の学習歩行2025/2/1
多角形の足に適したサンプリングベースの足場報酬と二重クリティック、2段階強化学習を組み合わせ、疎な足場を正確に踏み分けるヒューマノイド歩行を実現した。LiDARによるオンボード標高マップで実機展開も可能。
- RHINO: 人間のデモンストレーションからリアルタイムなヒューマノイド-人間-物体インタラクションを学習ヒューマノイド/インタラクション2025/2/1
人間の指示や動作にリアルタイムで反応し、割り込みにも即応できるヒューマノイドロボットのための階層的学習フレームワークRHINOを提案。人間の意図を推定する高レベルプランナと反応動作・物体操作を実行する低レベルコントローラで構成される。
- 多様な移動を実現する統合型ヒューマノイド全身コントローラ歩行2025/2/1
歩行・跳躍・ホッピングなど多様な歩容をパラメータ調整可能に生成し、上半身操作との統合も可能にするヒューマノイド全身制御ポリシーHugWBCを提案した。
- Re$^3$Sim: 3DフォトリアルなReal-to-Simによる高忠実度シミュレーションデータ生成sim2real2025/2/1
実世界の3D再構成とニューラルレンダリングでフォトリアルなシミュレーション環境を構築し、模倣学習でロボット操作方策を訓練、ゼロショットで実機転移を実現した研究。
- GenSim2: マルチモーダル推論LLMによるロボットデータ生成のスケーリングsim2real2024/10/1
マルチモーダル推論LLMを活用して多様なシミュレーションタスクとデモデータを自動生成し、生成データで学習するマルチタスク方策により実機へのゼロショット転移や実データとの共同学習で性能向上を実現した。
- 世界モデルに基づく知覚による視覚的脚式移動歩行2024/9/1
環境の世界モデルを構築し、それを用いて視覚入力から直接脚式ロボットの制御方策を学習する手法を提案。シミュレーションで訓練しながら実世界でも正確な予測が可能で、従来手法より高い走破性と頑健性を示した。
- LoopSR: 脚式ロボットの生涯ポリシー適応のためのSim-and-Realループsim2real2024/9/1
実世界の軌道からデジタルツインを再構築し、シミュレーションでの継続学習を通じて脚式ロボットのポリシーを展開後も適応させ続けるフレームワークを提案。
- OmniH2O:汎用的で器用な人間からヒューマノイドへの全身遠隔操作と学習遠隔操作2024/6/1
VR・音声・RGBカメラなど多様な入力で人間がヒューマノイド全身を遠隔操作できる学習ベースのシステムを構築し、実世界でのスポーツや物体操作を実現した。
- 大規模アクションなし動画事前学習による実行可能な離散拡散ポリシーの学習VLA2024/2/1
人間のアクションなし動画で離散拡散モデルを事前学習し、少数のロボット動画で微調整することで、ロボットの行動ポリシーを効率的に学習する手法を提案。
- Vision-Language Foundation Models as Effective Robot Imitators2023/11/1
- Bridging the Sim-to-Real Gap from the Information Bottleneck Perspective2023/5/1
- Sim-to-Real Transfer for Quadrupedal Locomotion via Terrain Transformer2022/12/1
- Multi-embodiment Legged Robot Control as a Sequence Modeling Problem2022/12/1
- NeurIPS 2022 Competition: Driving SMARTS2022/11/1
- Bootstrapped Transformer for Offline Reinforcement Learning2022/6/1