Jianwei Zhang
収録論文 52本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ForceDelta-VLA: 接触の多いマニピュレーションのための力条件付き行動補正の蒸留VLA2026/9/16
力覚対応VLAポリシーを、参照行動と力補正に分解して蒸留するフレームワークを提案し、接触の多いタスクで成功率を54.4%から82.2%に向上させた。
- ReactVLA: 改良平均流アクション生成による高速・軽量なリアクティブロボット操作VLA/操作2026/6/1
拡散型VLAの推論遅延を改善するため、改良平均流アクション生成と注意残差機構を備えた軽量・低遅延なVLAフレームワークを提案し、シミュレーションと実機で性能と速度を向上させた。
- MetaWorld-X: VLMが統括する階層的世界モデルによる人型ロボットの移動操作人型ロボット制御2026/3/1
人型ロボットの移動と操作を同時に行う制御を、専門エキスパートポリシーとVLMによるルーティングで階層的に分解し、自然で安定した全身制御を実現する手法を提案した。
- フローからワンステップへ:暗黙的最大尤度推定に基づく分布蒸留によるリアルタイムマルチモーダル軌道ポリシーVLA2026/3/1
条件付きフローマッチングの専門家を暗黙的最大尤度推定で単一ステップの生徒モデルに蒸留し、多様な動作モードを保ちながらリアルタイムな閉ループ制御を可能にした。
- ReTac-ACT: 精密組立のための状態ゲート型視覚-触覚融合トランスフォーマーマニピュレーション2026/3/1
視覚が遮蔽される精密組立の最終段階で、触覚情報を動的に重視するゲート機構と双方向クロスアテンションを備えた視覚-触覚模倣学習ポリシーを提案し、NISTベンチマークで高い成功率を達成した。
- 責任あるロボットマニピュレーションのベンチマーク:マルチモーダル大規模言語モデルによる評価マニピュレーション2025/12/1
電気・化学・人関連の危険を含む23の多段階タスクで、ロボットがリスク検知・安全推論・行動計画・人間支援要請を行う能力を評価するベンチマークを提案。
- OmniDexVLG:視覚言語モデルが導く把持意味論・分類・機能的アフォーダンスからの器用な把持生成学習マニピュレーション2025/12/1
言語と視覚の指示に基づき、把持分類・接触意味論・機能的アフォーダンスを統合的に扱う器用な把持生成フレームワークを提案。大規模データ生成パイプラインとマルチモーダル推論モジュールを組み合わせ、意味的に制御可能な把持を実現する。
- ヒューマノイドロボットの顔面感情表現の覚醒表情生成2025/10/1
生体模倣型のロボット顔とKAN・注意機構による学習フレームワークを構築し、表情模倣を自動獲得する手法を提案。ヒューマノイドロボット向け初のオープンソース表情データセットも公開した。
- 時空間ニューラルネットワークによる外力下の連続体ロボット形状推定連続体ロボット/形状推定2025/10/1
腱駆動連続体ロボットの形状を、腱変位の時系列データとRGB画像を融合する時空間ニューラルネットで推定し、外力下でも高精度に点群とベジェ曲線を生成する手法を提案した。
- M4Diffuser: 多視点拡散ポリシーと可操作度を考慮した制御による堅牢な移動マニピュレーション移動マニピュレーション2025/9/1
多視点の拡散ポリシーで目標を生成し、可操作度を考慮したQP制御器で移動ロボットの全身協調動作を実現する手法を提案。シミュレーションと実機で成功率向上と衝突低減を達成。
- FunCanon: 機能的な物体正規化による姿勢認識型行動プリミティブの学習と汎用ロボットマニピュレーションマニピュレーション2025/9/1
長期的なマニピュレーションタスクを行為者・動作・対象からなる行動チャンクに分解し、大規模視覚言語モデルのアフォーダンス手がかりで物体を共通の機能座標系に正規化することで、カテゴリレベルで汎化し再利用可能な拡散ポリシーを学習する枠組みを提案。
- 身体性AI時代における物理シミュレータを用いたロボットナビゲーションとマニピュレーションの調査sim2real2025/5/1
物理シミュレータがsim-to-realギャップをどう埋めるかに着目し、ナビゲーションとマニピュレーションのタスク、ハードウェア要件、ベンチマークデータセットや評価指標を調査したサーベイ。
- DORA: 物体アフォーダンス誘導による器用なロボットマニピュレーションのための強化学習マニピュレーション2025/5/1
物体のアフォーダンスマップを活用し、把持姿勢の候補生成と投票型分類で意味的に妥当な制約を与えることで、多指ハンドの強化学習を効率化しタスク成功率を平均15.4%向上させた。
- 深層Koopmanモデル予測制御による多セグメントソフトロボットの制御ソフトロボティクス2025/5/1
深層学習でKoopman作用素を近似してソフトロボットの非線形ダイナミクスを線形化し、モデル予測制御で高精度な軌道追従を実現した。
- SoccerDiffusion: 試合記録からエンドツーエンドのヒューマノイドサッカーを学習するVLA2025/4/1
RoboCupの試合記録からトランスフォーマー拡散モデルでヒューマノイドロボットのサッカー制御を直接学習し、蒸留により実機でリアルタイム推論を実現した。
- カリキュラム強化学習による回転卓球ボールのシミュレーション捕球sim2real2025/3/1
カリキュラム強化学習とReal2Sim転移を用いて、強い回転がかかった卓球ボールをロボットが捕球できるようにする手法を提案した論文。
- FABG:身体性を持つ感情的人間-ロボットインタラクションのためのエンドツーエンド模倣学習模倣学習/ヒューマンロボットインタラクション2025/3/1
VRで操作者がロボット視点を体験してデモを収集し、遅延補償付きのエンドツーエンド模倣学習で自然な表情・視線・ジェスチャーを生成するシステムを25自由度ヒューマノイドに実装した。
- ロボットを危険にしないで:安全をポリシーとする責任あるロボットマニピュレーションマニピュレーション2024/11/1
人間の指示を無思考に実行すると危険が生じるため、世界モデルで危険シナリオを生成し、メンタルモデルで安全認知を育成するSafety-as-policyを提案し、安全なロボット操作を実現した。
- PAVLM:視覚言語モデルによる点群のアフォーダンス理解の高度化アフォーダンス理解2024/10/1
大規模言語モデルの知識を活用し、点群データから3D物体の操作可能領域(アフォーダンス)を高精度に理解するフレームワークPAVLMを提案。
- ClearDepth: ロボットマニピュレーションのための透明物体のステレオ知覚強化透明物体知覚2024/9/1
透明物体の深度を高精度に推定するVision Transformerベースのステレオアルゴリズムを開発し、Sim2Realデータ生成と特徴後融合モジュールでロボット操作を支援する。
- 3Dマルチエンティティ物理環境における部分同変強化学習強化学習/マルチエージェント2024/7/1
複数エンティティからなる3D環境で、タスク割当てにより局所グラフに分解し、部分同変メッセージパッシングで効率的に方策を学習するSHNNを提案し、新ベンチマークMEBENで有効性を示した。
- RoboGolf:反射的マルチモーダル視覚言語モデルによる実世界ミニゴルフの習得VLA2024/6/1
2台のカメラによる知覚と閉ループ行動修正、さらに反射的均衡ループを組み合わせたVLMベースの枠組みで、実世界のミニゴルフをプレイするロボットを実現した。
- 基盤モデルがマニピュレーションのロボット学習にもたらすもの:サーベイマニピュレーション2024/4/1
基盤モデルをロボットのマニピュレーション学習に統合するための包括的枠組みを提案し、各モジュールでの課題と貢献、今後の研究方向を整理したサーベイ。
- ToolEENet:道具のアフォーダンス6D姿勢推定マニピュレーション2024/4/1
道具の把持時の遮蔽に対応するため、道具のエンドエフェクタのアフォーダンス分割と6D姿勢推定を行うデータセットと拡散モデルベースのフレームワークを提案。
- ContactDexNet: 接触セマンティックマップによる多指ロボットハンドの混雑環境把持マニピュレーション2024/4/1
物体点群から接触セマンティックマップを生成し、多指ハンドの把持姿勢を推定・評価することで、混雑環境でも高い成功率で把持を実現する手法を提案した。
- 入力遅延のない滑らかな計算:ロボットマニピュレータ計画のためのロバストチューブ型モデル予測制御マニピュレーション2024/3/1
モデル予測制御の計算遅延を、次状態を予測して1ステップ先に最適制御問題を解くことで解消し、線形化誤差の上限を設けて応答速度を最大90%向上させた。
- A Collision-Aware Cable Grasping Method in Cluttered Environment2024/2/1
- A Closed-Loop Multi-perspective Visual Servoing Approach with Reinforcement Learning2023/12/1
- RobotGPT: Robot Manipulation Learning from ChatGPT2023/12/1
- Learning Semantic-Agnostic and Spatial-Aware Representation for Generalizable Visual-Audio Navigation2023/4/1
- PoseFusion: Robust Object-in-Hand Pose Estimation with SelectLSTM2023/4/1
- Reinforcement Learning Based Pushing and Grasping Objects from Ungraspable Poses2023/2/1
- Towards Precise Model-free Robotic Grasping with Sim-to-Real Transfer Learning2023/1/1
- Learning 6-DoF Task-oriented Grasp Detection via Implicit Estimation and Visual Affordance2022/10/1
- Maximizing the Use of Environmental Constraints: A Pushing-Based Hybrid Position/Force Assembly Skill for Contact-Rich Tasks2022/8/1
- Sim-to-Real Transfer of Robotic Assembly with Visual Inputs Using CycleGAN and Force Control2022/8/1
- Improving Robotic Grasping Ability Through Deep Shape Generation2022/6/1
- Impedance Adaptation by Reinforcement Learning with Contact Dynamic Movement Primitives2022/3/1
- Learning Friction Model for Magnet-actuated Tethered Capsule Robot2021/9/1
- TransSC: Transformer-based Shape Completion for Grasp Evaluation2021/7/1
- Learning compliant grasping and manipulation by teleoperation with adaptive force control2021/7/1
- Combining Learning from Demonstration with Learning by Exploration to Facilitate Contact-Rich Tasks2021/3/1
- Proactive Action Visual Residual Reinforcement Learning for Contact-Rich Tasks Using a Torque-Controlled Robot2020/10/1
- Self-Adapting Recurrent Models for Object Pushing from Learning in Simulation2020/7/1
- Center-of-Mass-based Robust Grasp Planning for Unknown Objects Using Tactile-Visual Sensors2020/6/1
- Model-Based Compensation of Moving Tissue for State Recognition in Robotic-Assisted Pedicle Drilling2020/6/1
- A Mobile Robot Hand-Arm Teleoperation System by Vision and IMU2020/3/1
- Robust Robotic Pouring using Audition and Haptics2020/3/1
- Making Sense of Audio Vibration for Liquid Height Estimation in Robotic Pouring2019/3/1
- Attention based visual analysis for fast grasp planning with multi-fingered robotic hand2018/9/1
- PointNetGPD: Detecting Grasp Configurations from Point Sets2018/9/1
- Vision-based Teleoperation of Shadow Dexterous Hand using End-to-End Deep Neural Network2018/9/1