Bin Zhao
Shanghai AI Laboratory
収録論文 41本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternW0-Δ: 予測ダイナミクスと行動を橋渡しする20K時間超のオープンデータによるワールドアクションモデルVLA2026/9/25
視覚ダイナミクスと行動生成を統合したワールドアクションモデルを、20,000時間超の異種オープンデータで事前学習し、シミュレーションと実機で従来手法を上回る性能を達成した。
- InternW0: 効率的な実世界インタラクションのための基盤的物理世界モデル世界モデル2026/9/23
上海AI Labが、視覚予測とロボット制御を非対称なvideo-actionアーキテクチャで統合した物理世界モデルInternW0を提案。約7,200時間のデータで学習し、化学合成やピペッティングなどの実世界タスクで評価した。
- OpenFlyScan:民生ドローン向け品質誘導型空中再構成システムsim2real2026/9/21
3Dガウシアンスプラッティングの再構成品質を予測し、不足領域を補う追加撮影を計画・実行する民生ドローン向けシステムを提案。
- WOLF: 予測フロンティアを用いた世界モデル誘導LiDAR探索探索2026/9/20
LiDAR搭載UAVの自律探索において、再帰的世界モデルで将来の観測を予測し、予測フロンティアを生成することで遮蔽物の先の有望領域を推定し探索効率を高める手法を提案。
- GRADE: 視界不良下での単一フレーム生成レーダー深度推定深度推定/レーダー2026/9/9
煙や霧、暗闇でも使えるmmWaveレーダーの単一フレームから、生成モデルの事前知識を活用して高精度なメートル深度を推定する手法を提案。
- ワールドモデルの定義とロードマップワールドモデル2026/7/7
AIの各分野で使われる「ワールドモデル」の定義を明確化し、技術的側面と開発段階のロードマップを提案する視点論文。
- 無重力状態を学ぶ:人型ロボットにおける非自己安定動作の模倣模倣学習/全身制御2026/4/1
人型ロボットが環境に依存する動作(椅子に座る、横になる、壁に寄りかかるなど)を実行する際、人間が行う「無重力状態」を模倣し、関節を選択的に弛緩させる手法を提案した。
- RPG: 人間型格闘における複数スキル遷移のためのロバストなポリシーゲーティング歩行/格闘/スキル遷移2026/4/1
人間型ロボットの格闘動作において、複数のスキルを切り替える際の不安定さを解決するため、遷移ランダム化と時間ランダム化を用いたハイブリッド専門家ポリシーフレームワークを提案し、シミュレーションと実機で検証した。
- PhyGile: 物理プレフィックス誘導による俊敏な汎用人型ロボット動作追従のための動作生成ヒューマノイド動作生成2026/3/1
物理誘導プレフィックスを用いて人型ロボットのネイティブ動作を直接生成し、汎用動作追従コントローラと組み合わせることで、実機で俊敏かつ安定した全身動作を実現するフレームワークを提案した。
- 動的補正を備えた閉ループアクションチャンクによる学習不要の拡散ポリシー拡散ポリシー/操作2026/3/1
拡散ベースのポリシーに動的環境情報を注入し、リアルタイムでアクションを補正する閉ループ拡散ポリシーフレームワークDCDPを提案。再学習なしで動的シナリオへの適応性を向上させる。
- 平均流に基づく一段階視覚言語行動モデルVLA2026/3/1
フローマッチング型VLAの遅延問題を解決するため、ノイズ起因の問題を解消し一段階の行動生成を可能にする平均流ベースの手法を提案。実機実験で既存手法より大幅に高速な生成を実現した。
- ZeroWBC: 一人称視点の人間データから自然な全身ヒューマノイド動作を学習全身制御2026/3/1
人間の一人称視点動画と全身動作・テキスト注釈から、テレオペレーションなしでヒューマノイドの全身インタラクションを学習するフレームワークを提案し、Unitree G1で多様なシーン適応行動を実現した。
- 人間の手のマルチ剛体近似とデジタルツインへの応用デジタルツイン2025/12/1
人間の手の動作を光学式モーションキャプチャから取り込み、MANOモデルを関節軸が解剖学的に整合したURDFに変換することで、リアルタイム物理シミュレーション可能なマルチ剛体近似を構築するパイプラインを提案した。
- DexCanvas: 人間の実演とロボット学習を繋ぐ巧みな操作の大規模データセットマニピュレーション2025/10/1
70時間の人間の実演を基に、物理シミュレーションで検証された接触力注釈付きの7000時間の巧みな手操作データセットを構築した。
- FastUMI-100K:大規模UMI形式データセットによるデータ駆動型ロボットマニピュレーションの進展マニピュレーション2025/10/1
モジュール型ハードウェアと軽量トラッキングを備えたFastUMIシステムで収集した10万件超の家庭内タスク実演データセットを構築し、多様な模倣学習アルゴリズムで高い成功率を示した。
- 軌道条件付き異形態間スキル転移模倣学習2025/10/1
人間のデモ動画から疎なオプティカルフロー軌道を抽出し、それを条件としてロボットの操作動画と実行行動を生成することで、形態の違いを超えたスキル転移を実現した研究。
- RadarSFD: 事前学習済み事前分布を用いた単一フレーム拡散によるレーダ点群生成点群生成/拡散モデル2025/9/1
単一のミリ波レーダフレームから、事前学習済み単眼深度推定器の幾何学的知識を活用した条件付き潜在拡散モデルにより、LiDARのような高密度点群を再構成する手法を提案。
- EO-1: 汎用ロボット制御のためのオープンな統合身体性基盤モデルVLA2025/8/1
視覚・言語・行動を統合的に扱う基盤モデルEO-1と150万件のデータセットEO-Data1.5Mを提案し、多様なロボットでの長期的な器用マニピュレーションを実現した。
- MLM: アーム付き四足ロボットのマルチタスク全身移動操作制御の学習移動操作2025/8/1
実世界とシミュレーションのデータを活用した強化学習フレームワークMLMを提案し、6自由度アーム付き四足ロボットが複数タスクの全身移動操作を自律的または遠隔操作で行えるようにした。
- Skill-Nav: ウェイポイントインターフェースによる多様な四足歩行を統合したナビゲーション歩行2025/6/1
四足ロボットの歩行スキルをウェイポイントを介して階層的ナビゲーションに統合し、障害物を避けながら目標地点へ自律移動できるようにした研究。
- Hume:視覚-言語-行動モデルにシステム2思考を導入VLA2025/5/1
価値誘導型の熟考(システム2)と軽量な反応型ポリシー(システム1)を組み合わせた二重システムVLAモデルを提案し、器用なロボット制御を実現した。
- 3次元変形物体の動的マニピュレーション:シミュレーション・ベンチマーク・学習戦略マニピュレーション2025/5/1
低次元ダイナミクスに基づく3Dロープ操作のシミュレーション環境とベンチマークを構築し、模倣学習と物理情報を組み合わせた拡散ポリシー(DIDP)を提案した。
- 左脳から右脳へ:視覚と言語によるナビゲーションのための適応的テキストドリーマーVLA2025/5/1
視覚と言語によるナビゲーション(VLN)において、LLMをベースに左脳(論理統合)と右脳(想像的予測)の二重分岐構造で将来の環境意味を言語形式で適応的に想像し、ナビゲーション専門モジュールと統合する手法を提案。R2Rベンチマークで少ないパラメータで最先端性能を達成。
- 小さく考え、大きく行動する:生涯ロボットマニピュレーションのためのプリミティブプロンプト学習マニピュレーション2025/4/1
スキル間で共有されるプリミティブをプロンプトとして学習し、生涯にわたるロボットマニピュレーションを実現する手法を提案。
- MoMa-Kitchen: モバイルマニピュレーションにおけるアフォーダンスに基づく最終接近ナビゲーションのための10万件超ベンチマークモバイルマニピュレーション2025/3/1
キッチン環境でロボットが物体を掴むために最適な最終ナビゲーション位置を学習するための10万件超のデータセットとベンチマークを構築し、軽量なベースラインモデルNavAffを提案した。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- OpenFly: 空中視覚言語ナビゲーションのための包括的プラットフォームVLA2025/2/1
空中視覚言語ナビゲーションのための多様なレンダリングエンジンと自動データ収集ツールチェーンを統合したプラットフォームを提案し、10万軌道の大規模ベンチマークとキーフレーム重視のナビゲーションモデルを構築した。
- SpatialVLA:視覚-言語-行動モデルのための空間表現の探求VLA2025/1/1
ロボット操作における空間理解の重要性に着目し、3D位置エンコーディングと適応的行動グリッドを導入した視覚-言語-行動基盤モデルSpatialVLAを提案。110万件の実世界ロボットデータで事前学習し、ゼロショットでの操作や新環境への適応を実現した。
- 空間表現の探索による空中視覚言語ナビゲーションにおけるLLM推論の強化空中VLN2024/10/1
空中VLNタスクにおいて、LLMをエージェントとして活用し、意味論的トポロジカル距離表現(STMR)を導入することで空間推論能力を高め、訓練不要のゼロショットフレームワークを実現した。
- FastUMI: スケーラブルでハードウェア非依存の汎用マニピュレーションインターフェースとデータセットマニピュレーション2024/9/1
ロボットアームの実世界データ収集を低コスト・ハードウェア非依存で実現するため、UMIを再設計したFastUMIを提案し、22タスク・1万軌跡超のデータセットを公開した。
- AlignBot: ユーザーのリマインダーに沿ったVLM駆動型家庭用ロボットのカスタマイズタスクプランニングVLA2024/9/1
家庭用ロボット向けに、微調整したLLaVA-7BをGPT-4oのアダプタとして用い、ユーザーのリマインダーを構造化指示に変換してカスタマイズされたタスク計画を生成するフレームワークを提案し、実環境実験で成功率86.8%を達成した。
- COHERENT: 大規模言語モデルによる異種マルチロボット協調システムマルチロボット協調2024/9/1
ドローン・ロボット犬・ロボットアームなど異種ロボットの協調を、LLMによる提案・実行・フィードバック・調整のループで計画するフレームワークを提案し、100タスクのベンチマークで従来手法を大きく上回った。
- 奥行きが効く:RGBベースの事前学習済み方策への奥行き情報注入による改善マニピュレーション2024/8/1
RGB入力のみで動作するロボット操作方策に、学習時のみRGB-Dを使う奥行き情報注入フレームワークを提案し、3D知覚能力を高めて細かい操作タスクの性能を向上させた。
- KOI: ハイブリッドキー状態ガイダンスによるオンライン模倣学習の加速模倣学習2024/8/1
視覚言語モデルとオプティカルフローで専門家軌道から意味的・動作的キー状態を抽出し、報酬推定を改善することでオンライン模倣学習の探索効率を高める手法を提案。
- 相互作用予測によるマニピュレーション学習マニピュレーション2024/6/1
初期・最終状態と言語指示から遷移フレームと操作対象物体を予測する事前学習手法MPIを提案し、実機・シミュレーションで従来手法を10〜64%上回る性能を達成した。
- SAM-E: 視覚基盤モデルと系列模倣による身体性マニピュレーションマニピュレーション2024/5/1
大規模画像で事前学習されたSegment Anything (SAM) を基盤モデルとして活用し、ロボットデータで効率的に微調整することで、長期的な行動推論と汎化性能を高めたマニピュレーション手法を提案。
- 大規模アクションなし動画事前学習による実行可能な離散拡散ポリシーの学習VLA2024/2/1
人間のアクションなし動画で離散拡散モデルを事前学習し、少数のロボット動画で微調整することで、ロボットの行動ポリシーを効率的に学習する手法を提案。
- Kinematic-aware Prompting for Generalizable Articulated Object Manipulation with LLMs2023/11/1
- Affordance-Driven Next-Best-View Planning for Robotic Grasping2023/9/1
- Robust Quadrupedal Locomotion via Risk-Averse Policy Learning2023/8/1
- On the Value of Myopic Behavior in Policy Reuse2023/5/28