Lei Zhang
収録論文 62本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PIVOT: マルチターンVLMエージェントのためのピボット認識型オンポリシー自己蒸留VLA2026/9/28
マルチターンVLMエージェントのRL訓練において、失敗の起点となる「ピボット」ステップを内部化して特定・状態復元するフレームワークを提案し、環境ロールバックなしで性能を向上させた。
- 汎用的協調知能:レジリエントなマルチエージェント生態系のための認知アーキテクチャ群制御2026/9/19
マルチエージェント無人システムの協調知能に関する研究を、5次元の分類軸と3つの認知的相乗条件で統合的に整理し、V2X・ドローン・物流・スマートシティへの応用と安全性・プライバシー・有用性の課題を展望したレビュー。
- ForceDelta-VLA: 接触の多いマニピュレーションのための力条件付き行動補正の蒸留VLA2026/9/16
力覚対応VLAポリシーを、参照行動と力補正に分解して蒸留するフレームワークを提案し、接触の多いタスクで成功率を54.4%から82.2%に向上させた。
- グローバル・ローカル可観測量を用いたKoopman演算子による多セグメント柔軟ロボットアームのリアルタイム形状制御制御2026/9/2
多セグメント柔軟ロボットアームの形状制御を、Koopman演算子に基づくモデル予測制御とグローバル・ローカル可観測量の組み合わせで実現し、最大10セグメントの数値実験と3・5セグメントの物理実験でリアルタイム性能とロバスト性を示した。
- 反復LQゲームによる多腕システムの協調動作計画群制御2026/8/27
多関節ロボットアームの共有作業空間での動作計画を、各アームを独立エージェントとする反復線形二次ゲームとして定式化し、衝突ペナルティを組み込んで協調的で安全な軌道を生成する手法を提案した。
- 手術映像生成:拡散モデルからワールドモデルへの調査手術映像生成2026/8/26
手術映像生成の研究を、無条件生成・条件付き生成・ワールドモデル生成の3分類で整理し、ピクセル忠実度と臨床的妥当性のギャップや課題を明らかにしたサーベイ論文。
- MOON: マルチタスク学習のための多目的正規直交更新マルチタスク学習/最適化2026/8/12
マルチタスク学習における勾配操作を、行列構造を考慮したスペクトル・核ノルム幾何で行う新しい最適化手法を提案し、理論的収束保証と実験的改善を示した。
- 大規模基盤モデル時代の手と物体のインタラクション:再構築、生成、身体化転移サーベイ2026/7/30
手と物体のインタラクション(HOI)モデリングにおける基盤モデルの活用を体系的にレビューし、幾何・意味・視覚の8つの事前知識に分類して、各タスクへの導入方法とロボット学習への応用を分析した論文。
- SIEVE: VLAモデルを用いた模倣学習のための構造認識データ選択データ選択/模倣学習/VLA2026/7/1
ロボットのデモデータから再利用可能なプリミティブと遷移構造を抽出し、構造的な被覆率を最大化するようにデータを選択することで、少ないデータと学習ステップで高性能なVLAポリシーを学習する手法を提案した。
- ScaleHP: メートル空間での手の姿勢推定手の姿勢推定2026/6/24
手の骨の比例関係からメートル単位の手のサイズを推定し、深度モジュールなしで絶対スケールの手の姿勢を高精度に復元する新しいフレームワークを提案した。
- テキストとビジョンの共同指示による画像編集画像編集2026/6/15
テキスト指示の意味表現力とビジュアル指示の空間精度を統合した画像編集フレームワークTV-Editを提案し、動画から構築したデータセットとベンチマークで性能を評価した。
- 反射型VLA:文脈内の行動結果がVLAの汎化を促進するVLA2026/6/1
視覚言語行動モデル(VLA)の汎化性能を向上させるため、観察・行動・結果の三つ組を文脈として利用する「Reflective VLA」を提案した。従来の反応型モデルでは捉えられない環境固有の要因を、行動後の変化から推定することで、分布シフト下での成功率を向上させた。
- LocateAnything: 並列ボックスデコードによる高速・高品質な視覚言語グラウンディングVLA2026/5/1
視覚言語モデルによる物体検出・グラウンディングを、ボックス座標を並列に一度でデコードする方式に変え、推論速度と精度を両立させた。
- ガイド・思考・行動:視覚言語行動モデルにおける対話型身体化推論VLA2026/5/1
ユーザーが視覚的な手がかりでロボットのポリシーを誘導できる対話型VLAフレームワークを提案し、空間的推論と行動生成を統合してOOD環境での堅牢性を向上させた。
- ALAS: 非同期パスウェイストリーム分離による適応的長期的行動合成長期的行動生成2026/4/1
人間-シーン相互作用における長期的タスクを、環境理解とスキル学習を分離する二重ストリームアーキテクチャで学習し、環境やスキルの新たな組み合わせへの汎化を実現するフレームワークを提案した。
- フローからワンステップへ:暗黙的最大尤度推定に基づく分布蒸留によるリアルタイムマルチモーダル軌道ポリシーVLA2026/3/1
条件付きフローマッチングの専門家を暗黙的最大尤度推定で単一ステップの生徒モデルに蒸留し、多様な動作モードを保ちながらリアルタイムな閉ループ制御を可能にした。
- MetaWorld-X: VLMが統括する階層的世界モデルによる人型ロボットの移動操作人型ロボット制御2026/3/1
人型ロボットの移動と操作を同時に行う制御を、専門エキスパートポリシーとVLMによるルーティングで階層的に分解し、自然で安定した全身制御を実現する手法を提案した。
- SpatialPoint: 身体化された位置特定のための空間認識ポイント予測身体化AI/位置特定2026/3/1
視覚と言語指示に基づいて実行可能な3Dポイントを予測する身体化位置特定問題を定式化し、深度情報を視覚言語モデルに統合するSpatialPointを提案。RGB-Dデータセットを構築し、実ロボットでの把握・配置タスクで有効性を検証した。
- DECO: 触覚アダプタを備えた双腕巧み操作のための分離型マルチモーダル拡散トランスフォーママニピュレーション2026/2/1
視覚・固有感覚・触覚を分離した条件付け経路で統合する拡散トランスフォーマDECOを提案し、双腕巧み操作の触覚データセットDECO-50を公開。実機実験で成功率72.25%を達成し、触覚アダプタが複雑な接触タスクで20%向上。
- BEVDilation:LiDAR中心のマルチモーダル融合による3D物体検出3D物体検出2025/12/1
LiDARを主軸に画像BEV特徴をガイダンスとして活用し、点群の疎性と意味的制約を補う3D物体検出手法を提案。nuScenesで高精度かつ深度ノイズに頑健。
- OmniDexVLG:視覚言語モデルが導く把持意味論・分類・機能的アフォーダンスからの器用な把持生成学習マニピュレーション2025/12/1
言語と視覚の指示に基づき、把持分類・接触意味論・機能的アフォーダンスを統合的に扱う器用な把持生成フレームワークを提案。大規模データ生成パイプラインとマルチモーダル推論モジュールを組み合わせ、意味的に制御可能な把持を実現する。
- 責任あるロボットマニピュレーションのベンチマーク:マルチモーダル大規模言語モデルによる評価マニピュレーション2025/12/1
電気・化学・人関連の危険を含む23の多段階タスクで、ロボットがリスク検知・安全推論・行動計画・人間支援要請を行う能力を評価するベンチマークを提案。
- 観測前のリスクを見抜く:視覚言語モデルによる自動運転の潜在的リスク推論VLA2025/11/1
自動運転における「まだ観測されていない潜在的リスク」を推論するための視覚言語データセットPotentialRiskQAと、それに基づく推論フレームワークPR-Reasonerを提案した。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- 病院の手の届かない場所へ:肝臓超音波検査のための自律型軽量超音波ロボット医療ロボティクス2025/10/1
AIエージェントと588gの軽量6自由度ケーブル駆動ロボットを組み合わせ、腹部に装着して肝臓の標準超音波断面を自律的に取得し病変を検出するシステムを開発した。高地や荒野など医療資源の乏しい環境でも専門医レベルの診断を可能にする。
- セグメント別射影を用いたKoopman演算子による多セグメント連続体ロボットの形状制御形状制御2025/9/1
腱駆動の軟体連続体ロボットのシミュレーションデータから、セグメントごとの射影でKoopmanモデルを学習し、線形MPCでリアルタイムな形状制御を実現した。
- FunCanon: 機能的な物体正規化による姿勢認識型行動プリミティブの学習と汎用ロボットマニピュレーションマニピュレーション2025/9/1
長期的なマニピュレーションタスクを行為者・動作・対象からなる行動チャンクに分解し、大規模視覚言語モデルのアフォーダンス手がかりで物体を共通の機能座標系に正規化することで、カテゴリレベルで汎化し再利用可能な拡散ポリシーを学習する枠組みを提案。
- M4Diffuser: 多視点拡散ポリシーと可操作度を考慮した制御による堅牢な移動マニピュレーション移動マニピュレーション2025/9/1
多視点の拡散ポリシーで目標を生成し、可操作度を考慮したQP制御器で移動ロボットの全身協調動作を実現する手法を提案。シミュレーションと実機で成功率向上と衝突低減を達成。
- DETACH: 分離された専門家の混合による長期的タスクのためのクロスドメイン学習クロスドメイン学習2025/8/1
脳の「どこ・何」二重経路に着想を得て、環境理解とスキル実行を分離する二流構成で、人間-シーン相互作用の長期的タスクをクロスドメインで学習するフレームワークを提案。
- 3DRot: RGBベース3D拡張のための失われた基本操作の再発見3Dデータ拡張2025/8/1
シーン深度を使わずにカメラ光学中心周りの回転・鏡映でRGB画像とカメラ内部パラメータ・3Dアノテーションを同期更新し、幾何整合性を保つプラグアンドプレイなデータ拡張を提案。単眼3D検出や深度推定で精度向上を実証。
- DORA: 物体アフォーダンス誘導による器用なロボットマニピュレーションのための強化学習マニピュレーション2025/5/1
物体のアフォーダンスマップを活用し、把持姿勢の候補生成と投票型分類で意味的に妥当な制約を与えることで、多指ハンドの強化学習を効率化しタスク成功率を平均15.4%向上させた。
- UGNA-VPR:不確かさ誘導型NeRF拡張による視覚的位置認識の新学習パラダイムVPR/NeRF/sim2real2025/3/1
既存のVPRデータセットにNeRFと自己教師あり不確かさ推定を組み合わせ、不確かな視点の合成画像を生成して学習データを拡張し、VPR性能を向上させる手法を提案した。
- 二人プレイヤーの衝突回避インタラクションにおけるナッシュ均衡ハミルトニアンの学習マルチエージェント制御2025/3/1
衝突回避が支配的な二プレイヤー微分ゲームにおいて、均衡コスト状態の単純構造を利用し、ポントリャーギンの最大原理に基づく能動学習でデータ効率よくナッシュ均衡方策を学習する手法を提案した。
- 状態制約付き一般和微分ゲームのためのパラメトリック価値近似ゲーム理論/制御2025/3/1
状態制約下の一般和微分ゲームの価値関数を、ゲームパラメータから価値関数へ写像するハイブリッドニューラルオペレータで近似し、安全性を向上させた研究。
- 物理情報を活用した分割Koopman演算子によるデータ効率的なソフトロボットシミュレーションソフトロボティクス2025/2/1
物理情報を組み込んだKoopman演算子同定法を提案し、連続・離散近似を分割統合することで、腱駆動ソフトロボットアームの形状誤差を従来法より桁違いに改善した。
- SMPLest-X:表現豊かな人体姿勢・形状推定のための究極のスケーリング人体姿勢推定2025/1/1
人体・手・顔の動きを統合的に捉えるEHPSにおいて、40のデータセットと最大ViT-Hugeのモデルを用いてスケーリング則を調査し、汎用基盤モデルを構築した研究。
- ロボットを危険にしないで:安全をポリシーとする責任あるロボットマニピュレーションマニピュレーション2024/11/1
人間の指示を無思考に実行すると危険が生じるため、世界モデルで危険シナリオを生成し、メンタルモデルで安全認知を育成するSafety-as-policyを提案し、安全なロボット操作を実現した。
- IntelliMove: セマンティックマップによるロボット計画の強化セマンティックナビゲーション2024/10/1
階層的なセマンティックトポメトリックマップを構築するIntelliMapと、それを用いた計画モジュールを提案し、意味を考慮したロボットナビゲーションを実現した。
- ClearDepth: ロボットマニピュレーションのための透明物体のステレオ知覚強化透明物体知覚2024/9/1
透明物体の深度を高精度に推定するVision Transformerベースのステレオアルゴリズムを開発し、Sim2Realデータ生成と特徴後融合モジュールでロボット操作を支援する。
- SkillMimic: デモンストレーションからバスケットボールのインタラクションスキルを学習模倣学習2024/8/1
人間と物体のインタラクションを模倣する統一的な報酬設計で、バスケットボールのドリブル・レイアップ・シュートなど多様なスキルを単一の方策で学習し、スキル遷移や長期タスクも可能にした研究。
- TAPTRv2: 注意に基づく位置更新で任意点追跡を改善任意点追跡2024/7/1
Transformerベースの任意点追跡手法TAPTRを改良し、コストボリュームへの依存を排除する注意ベースの位置更新(APU)を導入して精度を大幅に向上させた。
- Voxel Mamba: 点群3D物体検出のためのグループフリー状態空間モデル3D物体検出2024/6/1
3Dボクセルを単一の系列にシリアライズするグループフリーな状態空間モデルを提案し、階層構造と位置エンコーディングで空間的近接性を保ちつつ、3D物体検出の精度と計算効率を向上させた。
- ContactDexNet: 接触セマンティックマップによる多指ロボットハンドの混雑環境把持マニピュレーション2024/4/1
物体点群から接触セマンティックマップを生成し、多指ハンドの把持姿勢を推定・評価することで、混雑環境でも高い成功率で把持を実現する手法を提案した。
- ToolEENet:道具のアフォーダンス6D姿勢推定マニピュレーション2024/4/1
道具の把持時の遮蔽に対応するため、道具のエンドエフェクタのアフォーダンス分割と6D姿勢推定を行うデータセットと拡散モデルベースのフレームワークを提案。
- TAPTR: 検出としてのTransformerによる任意点追跡点追跡2024/3/1
点追跡を物体検出・追跡と類似とみなし、DETR風のTransformerで各追跡点をクエリとして扱うシンプルで高性能な任意点追跡フレームワークを提案。
- A Collision-Aware Cable Grasping Method in Cluttered Environment2024/2/1
- Pontryagin Neural Operator for Solving Parametric General-Sum Differential Games2024/1/1
- A Closed-Loop Multi-perspective Visual Servoing Approach with Reinforcement Learning2023/12/1
- PhysHOI: Physics-Based Imitation of Dynamic Human-Object Interaction2023/12/1
- Value Approximation for Two-Player General-Sum Differential Games with State Constraints2023/11/1
- Solving Two-Player General-Sum Games Between Swarms2023/10/1
- Towards Precise Model-free Robotic Grasping with Sim-to-Real Transfer Learning2023/1/1
- Maximizing the Use of Environmental Constraints: A Pushing-Based Hybrid Position/Force Assembly Skill for Contact-Rich Tasks2022/8/1
- Approximating Discontinuous Nash Equilibrial Values of Two-Player General-Sum Differential Games2022/7/1
- When Shall I Be Empathetic? The Utility of Empathetic Parameter Estimation in Multi-Agent Interactions2020/11/1
- FlowFusion: Dynamic Dense RGB-D SLAM Based on Optical Flow2020/3/1
- Gait Graph Optimization: Generate Variable Gaits from One Base Gait for Lower-limb Rehabilitation Exoskeleton Robots2020/1/1
- Solving Rubik's Cube with a Robot Hand2019/10/1
- Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation2018/11/1
- Proceedings of the Third International Conference on Cloud and Robotics (ICCR2016)2017/6/1
- Towards An Architecture-Centric Approach to Manage Variability of Cloud Robotics2017/1/1
- Automatic Image Segmentation by Dynamic Region Merging2010/12/1