Jian Zhang
Inspire Robots
収録論文 48本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EWAM:統合身体モデルにおける創発的な深さ方向の専門化——意味理解から視覚的先読み、行動までVLA2026/9/30
行動中心の統合身体モデルEWAMを提案し、層ごとの監督なしに浅い層で意味、中間層で予測未来、深い層で行動に注意が向く創発的な深さ方向の専門化が生じることを示した。
- Bench2Dex: 多様な器用ハンドにおける視触覚両手マニピュレーションのベンチマークマニピュレーション2026/9/14
12種類の器用ハンドに対応した共通の触覚インターフェースを備えるシミュレーションベンチマークを構築し、26の両手操作タスクと約1.3Kのテレオペデモを提供して視触覚マニピュレーションを評価可能にした。
- MiniWorld: ビデオワールドモデルのスクラッチ学習を民主化するビデオ生成2026/8/2
ビデオワールドモデルをスクラッチから効率的に学習するための軽量で再現可能なフレームワークMiniWorldを提案した。
- 運転シーン生成のための物理認識3Dガウシアン編集自動運転シミュレーション2026/5/25
道路形状の編集と車両ダイナミクスを統合し、物理的に整合性のある運転シーン生成を実現するシステムを提案。
- A1: 完全透過型オープンソースの適応的かつ効率的なトランケート型視覚言語行動モデルVLA2026/4/1
低コストで高スループットな推論を実現するため、事前学習済みVLMと適応的早期終了・層間トランケートフローマッチングを導入したVLAモデルA1を提案し、シミュレーションと実機でSOTA性能と推論コスト削減を達成した。
- SpatialStack: 3D VLM空間推論のための階層的幾何学-言語融合VLA2026/3/28
3D空間推論に弱い視覚言語モデルに対し、視覚・幾何・言語表現を階層的に融合するフレームワークを提案し、複数のベンチマークで最高性能を達成した。
- 状況計算とSTL反証による汎用ロボットの検証検証2026/1/1
自然言語指示で多様な作業を行う汎用ロボットの検証のため、状況計算による抽象的推論とSTLモニタリングによるシミュレーション反証を組み合わせた二層フレームワークを提案し、GR00Tコントローラの失敗事例を発見できることを示した。
- ReGlove: 手首装着カメラによる視覚誘導型ソフト空気圧グローブソフトロボティクス/アシスティブデバイス2025/12/1
低コストの市販空気圧リハビリグローブに手首装着カメラとエッジ推論を組み合わせ、筋電信号に頼らず日常生活動作を支援する視覚誘導型装具を実現した。
- ヒューマノイドに着想を得た因果表現学習によるドメイン汎化因果表現学習2025/10/18
人間の視覚処理を模した構造的因果モデル(HSCM)を提案し、色・テクスチャ・形状などの画像属性を分離・再重み付けすることで、ドメイン汎化性能と解釈性を向上させた。
- ReNiL: IMUを用いたイベント駆動型歩行者ベイズ位置推定の実世界応用位置推定2025/8/1
歩行者の慣性位置推定において、イベント駆動型のベイズ深層学習フレームワークReNiLを提案し、不確実性を考慮した高精度かつ効率的な位置推定を実現した。
- 取扱説明書を読んで家電を操作するロボットVLA2025/5/1
家電の取扱説明書を大規模視覚言語モデルで解釈し、記号的なモデルを構築して実際の操作に結びつけるロボットシステムApBotを提案した。
- EgoDex:大規模一人称視点動画からの巧みな操作の学習マニピュレーション2025/5/1
Apple Vision Proで収集した829時間の一人称視点動画と3D手・指トラッキングデータからなる大規模データセットEgoDexを構築し、模倣学習のベンチマークを提供した。
- A0: 汎用ロボットマニピュレーションのためのアフォーダンス認識階層モデルマニピュレーション2025/4/1
物体との接触点と接触後軌道を予測するアフォーダンス表現を用い、高レベルな空間理解と低レベル行動実行を階層的に分けた拡散モデルを提案。複数ロボットで汎用性と実世界性能を示した。
- ヒューマノイド方策~ヒューマン方策VLA2025/3/1
一人称視点の人間の操作データをヒューマノイドロボットの学習に活用するため、人間とロボットの状態行動空間を統合したHuman Action Transformer (HAT)を提案し、汎化性能とロバスト性を向上させた。
- ELEGNT:非人型ロボットのための表現的で機能的な動作設計非人型ロボット/HRI2025/1/1
ランプ型ロボットを題材に、機能と表現の両立を目指す動作生成フレームワークを提案し、ユーザー研究で表現重視の動作がエンゲージメントとロボットの印象を高めることを示した。
- ARMOR: ヒューマノイドロボットの衝突回避と動作計画のための自己中心知覚動作計画2024/12/1
ウェアラブル深度センサを活用した自己中心的な知覚システムARMORを開発し、模倣学習ポリシーと組み合わせてヒューマノイドロボットの動的な衝突回避と動作計画を実現した。
- ARMADA: 拡張現実によるロボット操作とロボット不要のデータ収集模倣学習データ収集2024/12/1
Apple Vision Proに仮想ロボットのリアルタイムフィードバックを重ねるARシステムを構築し、実機なしでもロボット模倣学習用の高品質な人間データを収集できることを15人のユーザー研究で示した。
- C2F-TP: 不確実性を考慮した軌道予測のための粗から細へのデノイジングフレームワーク軌道予測2024/12/1
車両軌道予測の不確実性に対処するため、時空間相互作用で多様な軌道を生成し、条件付きデノイジングで精緻化する二段階の粗から細への予測手法を提案した。
- DR-MPC: 実世界のソーシャルナビゲーションのための深層残差モデル予測制御ソーシャルナビゲーション2024/10/1
MPCとモデルフリー深層強化学習を組み合わせ、実世界の群衆ナビゲーションデータから安全に学習する手法を提案。シミュレーションと実機実験で有効性を示した。
- 局所ポリシーによるゼロショット長期的マニピュレーションsim2real2024/10/1
ロボットの絶対姿勢や物体配置に依存しない「局所ポリシー」を基盤モデルと組み合わせ、シミュレーションから実機へのゼロショット転移で最大8段階の長期タスクを実現した。
- EMOTION: 大規模言語モデルの文脈内学習によるヒューマノイドロボットの表情豊かな動作生成ヒューマンロボットインタラクション2024/10/1
大規模言語モデルの文脈内学習を活用し、人間とのインタラクションに適した表情豊かなジェスチャー動作列をヒューマノイドロボット向けに生成するフレームワークを提案し、ユーザー調査で人間と同等以上の自然さと理解しやすさを示した。
- SkillMimic: デモンストレーションからバスケットボールのインタラクションスキルを学習模倣学習2024/8/1
人間と物体のインタラクションを模倣する統一的な報酬設計で、バスケットボールのドリブル・レイアップ・シュートなど多様なスキルを単一の方策で学習し、スキル遷移や長期タスクも可能にした研究。
- MakeWay: LiDARを用いた物体認識型コストマップによる先読み屋内ナビゲーションナビゲーション2024/8/1
LiDARの3D物体検出と追跡で物体マップを構築し、物体のアフォーダンスに基づくコストマップで先回り的な衝突回避を実現する屋内ナビゲーションシステムを提案した。
- OpenGaussian: 3Dガウシアンを用いた点レベルのオープンボキャブラリ理解3D理解2024/6/1
3Dガウシアンスプラッティングを基盤に、3D点レベルでのオープンボキャブラリ理解を実現する手法を提案。インスタンス特徴の3D一貫性学習と2段階コードブック、3D-2D特徴連携により、従来の2Dピクセルレベルの手法を超える性能を示した。
- Region-Transformer: 自己注意領域ベースのクラス非依存点群セグメンテーション点群セグメンテーション2024/3/1
領域成長法に自己注意機構を組み合わせ、意味ラベルなしで点群をクラス非依存にセグメンテーションするRegion-Transformerを提案。
- 埋め込みポーズグラフ:コンパクト表現で3D基盤モデル機能を実現3D表現/ナビゲーション2024/3/1
ポーズグラフのノードに基盤モデルの特徴量を付与することで、ボクセルや点群より軽量かつスケーラブルに3D空間を表現し、開語彙クエリや言語誘導ナビゲーション、再位置推定などを可能にする手法を提案した。
- PhysHOI: Physics-Based Imitation of Dynamic Human-Object Interaction2023/12/1
- Language-Assisted 3D Scene Understanding2023/12/1
- Shareable Driving Style Learning and Analysis with a Hierarchical Latent Model2023/10/1
- Multimodal Large Language Model for Visual Navigation2023/10/1
- Human Following in Mobile Platforms with Person Re-Identification2023/9/1
- An Object SLAM Framework for Association, Mapping, and High-Level Tasks2023/5/1
- Self-Supervised Object Goal Navigation with In-Situ Finetuning2022/12/1
- SAFER: Safe Collision Avoidance using Focused and Efficient Trajectory Search with Reinforcement Learning2022/9/1
- EDA: Explicit Text-Decoupling and Dense Alignment for 3D Visual Grounding2022/9/1
- The Foreseeable Future: Self-Supervised Learning to Predict Dynamic Scenes for Indoor Navigation2022/8/1
- Eco-driving for Electric Connected Vehicles at Signalized Intersections: A Parameterized Reinforcement Learning approach2022/6/1
- Learning the policy for mixed electric platoon control of automated and human-driven vehicles at signalized intersection: a random search approach2022/6/1
- AI based Algorithms of Path Planning, Navigation and Control for Mobile Ground Robots and UAVs2021/10/1
- Research on the Inverse Kinematics Prediction of a Soft Biomimetic Actuator via BP Neural Network2021/10/1
- Learning Spatiotemporal Occupancy Grid Maps for Lifelong Navigation in Dynamic Scenes2021/8/1
- Self-Supervised Learning of Lidar Segmentation for Autonomous Indoor Navigation2020/12/1
- Relational Mimic for Visual Adversarial Imitation Learning2019/12/1
- Acting Is Seeing: Navigating Tight Space Using Flapping Wings2019/2/1
- Flappy Hummingbird: An Open Source Dynamic Simulation of Flapping Wing Robots and Animals2019/2/1
- Learning Extreme Hummingbird Maneuvers on Flapping Wing Robots2019/2/1
- Structured Control Nets for Deep Reinforcement Learning2018/2/1
- Global Pose Estimation with an Attention-based Recurrent Network2018/2/1