Hao Su
収録論文 93本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界モデルによる汎化可能なロボット挿入マニピュレーション2026/9/23
手首カメラの視覚と固有感覚を統合した単一の世界モデルを最大90の挿入タスクで訓練し、未知形状の物体へのゼロショット挿入を実現した研究。
- 身体性を超えた知能クロスエンボディメント学習2026/9/22
ロボットの身体性の違いを超えて汎用的な知能を獲得するには、経験の蓄積に伴い多様な身体性へ転移できる表現を学習すべきだと提唱し、身体性の多様性をスケーリング軸として提案した位置論文。
- 四足歩行のための迅速な身体適応フレームワーク歩行2026/8/1
四足ロボットが身体の変化(関節の制限や質量の変化)に迅速に適応するためのオンライン適応フレームワークを提案し、シミュレーションと実機で有効性を示した。
- TacCoRL: シミュレーションによる触覚フィードバックのVLAへの統合触覚/VLA/sim2real2026/6/10
視覚と言語と行動の事前知識を持つVLAモデルに触覚フィードバックを注入し、シミュレーションと実機の共学習と強化学習で接触を要するタスクの成功率を向上させるフレームワークを提案した。
- SAGE-Nav: LLM計画とアライメント融合を活用した階層的シーングラフ誘導ナビゲーションナビゲーション2026/6/1
LLMによる大域計画と階層的シーングラフ符号化、目標認識アライメント融合ネットワークを組み合わせ、物体目標ナビゲーションの性能と汎化性を向上させた。
- リスクを考慮した選択的マルチモーダルドライバーモニタリング:ドライバー状態のワールドモデリングを用いてドライバーモニタリング2026/6/1
自動運転車のドライバーモニタリングにおいて、軽量なRGB-生理信号モデルと学習されたゲートを用いて、高速予測と安全介入のための棄却を選択するコスト考慮型フレームワークを提案した。
- Driver-WM: 運転者中心の交通条件付き潜在世界モデルによる車内ダイナミクスの展開世界モデル2026/5/1
車外の交通状況に基づいて車内の運転者状態を予測する潜在世界モデルを提案し、運転者の行動・感情認識と物理的運動予測を統合した。
- ロボットマニピュレータのための汎用ニューラルモーションプランナーに向けて:課題と機会モーションプランニング2026/3/1
この論文は、ロボットマニピュレータのモーションプランニングにおけるニューラルプランナーの現状をレビューし、その利点と限界を分析して、汎用性の高いプランナーを構築するための道筋を示しています。
- イベント駆動型プロアクティブ支援操作:接地された視覚言語プランニングによる実現マニピュレーション2026/3/1
ユーザーの指示を待たず、作業空間の状態変化(イベント)を検知して能動的に支援行動を生成するロボット操作フレームワークを提案した。実機のテーブルトップタスクで有効性を検証した。
- SG-VLA: 移動操作のための空間基盤型視覚言語行動モデルの学習VLA2026/3/1
移動操作ロボットのための視覚言語行動モデルを、補助タスクの共学習とマルチモーダル入力強化により空間理解を強化するフレームワークを提案し、家庭内再配置タスクで性能を向上させた。
- PhysMem: 身体性物理推論のためのテスト時メモリのスケーリングVLA2026/2/1
VLMロボットプランナがテスト時に経験から物理法則を学び、仮説を検証してから適用するメモリフレームワークを提案。実世界の操作タスクで成功率が大幅に向上。
- マルチエージェントロボットシステム(MARS)チャレンジの進歩と革新マルチエージェント2026/1/1
NeurIPS 2025ワークショップで開催されたMARSチャレンジを紹介し、VLMを用いたマルチエージェントの計画とロボットマニピュレーションの制御という2領域での取り組みを概説した論文。
- TouchGuide: 触覚ガイダンスによる視覚運動ポリシーの推論時ステアリング触覚2026/1/1
事前学習済みの視覚運動ポリシーの生成過程に、触覚に基づく接触物理モデルで介入し、接触を伴う繊細な操作を高精度化する手法を提案。低コストな触覚データ収集系TacUMIも開発した。
- Dextraの家:器用なハンドのためのクロスエンボディド共同設計マニピュレーション2025/12/1
タスクに特化したハンドの形態と制御方策を同時に学習する共同設計フレームワークを提案し、24時間以内に新しいロボットハンドを設計・訓練・製作・展開できることを示した。
- 巧みな操作のためのクロスエンボディメント世界モデルのスケーリングマニピュレーション2025/11/1
人間とロボットの手を3D粒子で表現し、エンドエフェクタの粒子変位場を行動として定義することで、異なる身体構造を超えて共有できる世界モデルを学習し、新しいハードウェアでの操作制御を実現した。
- 大規模マルチタスク世界モデルによる連続制御の学習マルチタスク強化学習2025/11/1
200の多様なタスクで言語条件付き世界モデルを事前学習し、オンライン強化学習で微調整することで、マルチタスク性能とデータ効率を向上させた研究。
- 全体像を見る:モバイルマニピュレーション方策学習のための3D潜在マップモバイルマニピュレーション2025/10/1
3D潜在特徴マップ上で直接動作するエンドツーエンドの方策学習手法SBPを提案し、画像のみに頼る方策よりも空間的・時間的推論に優れ、未知シーンでも高い成功率を示した。
- オンライン模倣事前学習付きワールドモデルによるマニピュレーションの効率的なSim-to-Real転移レシピsim2real2025/10/1
ロボットシミュレータでのオンライン模倣学習と実機データでのオフライン微調整を組み合わせたワールドモデルベースの枠組みを提案し、限られた実機専門家データでもsim-to-real転移の成功率を大幅に改善した。
- 事前学習済み表現を保持してVision-Language-Actionモデルの汎化性能を向上VLA2025/9/1
VLMから微調整したVLAモデルで、凍結エンコーダと文字列ベースの行動トークナイザ、空間推論データとの共訓練により、事前学習表現を保ちながらロボット操作の汎化性能を高めるフレームワークを提案。
- LodeStar: 人間のデモンストレーションからの合成データ拡張による長期的器用操作マニピュレーション2025/8/1
人間のデモを基礎モデルでスキルに分解し、強化学習で合成データを生成して、長期的な器用操作を実現する学習フレームワークを提案。
- CogDDN: 認知的需求駆動ナビゲーションと二重プロセス思考による意思決定最適化ナビゲーション2025/7/1
VLMを用いて人間の速い思考と遅い思考を模倣し、未知環境で暗黙の要求に応じて対象物体を探索・ナビゲートするフレームワークを提案。
- MorphoCopter:変形可能なクアッド・バイコプターの設計・モデリング・制御変形ドローン2025/6/1
単一の回転関節で機体幅を約70%縮められる新型変形ドローンの設計・モデル化・制御を提案し、飛行実験で有効性を検証した。
- 通路通過を考慮した最適経路計画:サンプリングベースアルゴリズムによるアプローチ経路計画2025/6/1
経路が通過する通路を最適化する新たな枠組みPTOPPを提案し、近接グラフによる通路検出と自由空間分解を用いて、サンプリングベースの最適経路計画アルゴリズムを開発した。
- 世界モデルオンライン模倣学習のための結合分布的ランダムエキスパート蒸留模倣学習2025/5/4
世界モデルの潜在空間で専門家と行動方策の分布を同時推定するRNDベースの報酬モデルを提案し、オンライン模倣学習を安定化させた。
- ManiTaskGen: 視覚言語エージェントの身体的意思決定を評価・改善するための包括的タスク生成器VLA2025/5/1
任意のシーンに対して多様で実行可能な移動操作タスクを自動生成するシステムを提案し、シミュレーションと実環境でその有効性を示すとともに、生成タスクを用いたベンチマーク構築とエージェント性能向上手法を提示した。
- ロボット歩行における身体性スケーリング則への試み歩行2025/5/1
約1000種のロボット身体を手続き的に生成し、多様な身体で訓練するほど未知の身体への汎化が向上することを歩行タスクで示し、実機のUnitree Go2やH1にもゼロショット転移した。
- デモンストレーション拡張型報酬・方策・世界モデル学習による多段階マニピュレーションマニピュレーション2025/3/1
視覚入力からの長期的マニピュレーションタスクに対し、多段階の密報酬学習と世界モデルを組み合わせたデモンストレーション活用型強化学習フレームワークDEMO3を提案し、データ効率を大幅に改善した。
- 単一実演から適応的な器用把持を学習するフレームワークマニピュレーション2025/3/1
人間の単一実演から把持スキルを効率的に学習し、視覚言語モデルで指示に応じて適切なスキルを選択する手法を提案。実機で90%の成功率を達成。
- 布操作のための生成的状态推定を伴う拡散ダイナミクスモデル変形物体操作2025/3/1
拡散モデルを用いて布の状態推定とダイナミクス予測を行い、モデル予測制御と組み合わせて実機で布折り畳みを実現した研究。
- 応答性ノイズリレー拡散ポリシー:応答的で効率的な視覚運動制御VLA2025/2/1
拡散ポリシーの応答性を高めるため、ノイズレベルを段階的に増やすバッファと逐次ノイズ除去を導入し、最新の観測に基づく即時行動生成を可能にした手法を提案。
- ポリシーデコレーター:大規模ポリシーモデルのためのモデル非依存オンライン改良模倣学習2024/12/1
模倣学習で訓練済みの大規模ポリシーに対し、モデル非依存の残差ポリシーをオンラインで学習させて性能を安定かつサンプル効率よく向上させる手法を提案。
- 状態から視覚へのDAggerと視覚強化学習はいつ選ぶべきか?VLA2024/12/1
状態方策を事前学習してからオンライン模倣で視覚方策を学ぶ2段階手法State-to-Visual DAggerと視覚RLを16タスクで比較し、難タスクではDAggerが安定して優れるがサンプル効率の利点は限定的だと示した実証研究。
- ManiSkill-HAB:家庭内整理タスクにおける低レベル操作のベンチマークマニピュレーション2024/12/1
家庭内の物体整理タスク向けに、GPU高速化した低レベル操作ベンチマークMS-HABを構築し、強化学習・模倣学習のベースラインと安全基準に基づくデモンストレーションフィルタリングを提供した。
- ManiSkill-ViTac 2025:視覚と触覚を用いたマニピュレーション技能学習チャレンジ触覚2024/11/1
触覚と視覚を融合させた接触の多いマニピュレーション技能学習を競うチャレンジを開催し、触覚操作・視触覚融合・触覚センサ設計の3部門で評価する。
- ManiSkill3: 汎化可能な身体性AIのためのGPU並列ロボティクスシミュレーションとレンダリングsim2real2024/10/1
接触の多い操作タスク向けに、シミュレーションとレンダリングをGPUで並列化した高速ロボティクスシミュレータManiSkill3を開発し、12分野の多様なタスクとデモデータ、ベースラインを提供した。
- 実世界ロボットマニピュレーションポリシーのシミュレーション評価sim2real2024/5/1
実環境とシミュレーションの制御・視覚ギャップを緩和し、実機セットアップに対応した評価環境SIMPLERを構築。実機とシミュレーションの性能が強く相関することを示した。
- 逆方向カリキュラム学習と順方向カリキュラム学習を組み合わせた強化学習による極限のサンプル・デモ効率強化学習2024/5/1
少数のデモンストレーションから逆方向カリキュラムで初期方策を学習し、順方向カリキュラムで全初期状態に展開することで、サンプル効率とデモ効率を大幅に改善する手法を提案。
- 階層型ワールドモデルによる視覚ベース全身ヒューマノイド制御全身制御2024/5/1
視覚観測から56自由度ヒューマノイドの全身制御を強化学習で実現するため、高レベルエージェントが視覚に基づきコマンドを生成し低レベルエージェントが実行する階層型ワールドモデルを提案した。
- DrS: 多段階タスクのための再利用可能な密報酬の学習強化学習/報酬設計2024/4/1
タスクの段階構造を利用し、スパース報酬とデモから高品質な密報酬を学習して、未見タスクでも再利用可能にする手法を提案。
- AdaDemo: 汎用ロボットエージェントのためのデータ効率的なデモンストレーション拡張模倣学習2024/4/1
既存方策の弱点を特定し、適応的にデモンストレーションを収集・拡張することで、データ効率的に多タスク模倣学習を改善するフレームワークAdaDemoを提案。
- パート誘導型3D強化学習による関節物体操作のSim2Realsim2real2024/4/1
2Dセグメンテーションと3D強化学習を組み合わせ、実機での関節物体操作をデモなしで学習するフレームワークを提案。不確実性を考慮したサンプリングで実機での安定性を向上させた。
- EgoPAT3Dv2: 一人称視点の2D画像から3D行動ターゲットを予測し人間-ロボット協調を実現人間-ロボット協調2024/3/1
一人称視点のRGB画像のみから手の動作の3D目標座標を予測するデータセットとアルゴリズムを拡張し、実機ロボットでその有用性を示した研究。
- CyberDemo: Augmenting Simulated Human Demonstration for Real-World Dexterous Manipulation2024/2/1
- Robo360: A 3D Omnispective Multi-Material Robotic Manipulation Dataset2023/12/1
- DiffVL: Scaling Up Soft Body Manipulation using Vision-Language Driven Differentiable Physics2023/12/1
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches2023/11/1
- Adaptive Hierarchical Origami Metastructures2023/11/1
- TD-MPC2: Scalable, Robust World Models for Continuous Control2023/10/1
- How to Model Brushless Electric Motors for the Design of Lightweight Robotic Systems2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- AnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System2023/7/1
- One-2-3-45: Any Single Image to 3D Mesh in 45 Seconds without Per-Shape Optimization2023/6/1
- On the Efficacy of 3D Point Cloud Reinforcement Learning2023/6/1
- EasyHeC: Accurate and Automatic Hand-eye Calibration via Differentiable Rendering and Space Exploration2023/5/1
- DexDeform: Dexterous Deformable Object Manipulation with Human Demonstrations and Differentiable Physics2023/4/1
- Chain-of-Thought Predictive Control2023/4/1
- Boosting Reinforcement Learning and Planning with Demonstrations: A Survey2023/3/1
- ManiSkill2: A Unified Benchmark for Generalizable Manipulation Skills2023/2/1
- On Pre-Training for Visuo-Motor Control: Revisiting a Learning-from-Scratch Baseline2022/12/1
- PartSLIP: Low-Shot Part Segmentation for 3D Point Clouds via Pretrained Image-Language Models2022/12/1
- MoDem: Accelerating Visual Model-Based Reinforcement Learning with Demonstrations2022/12/1
- DexPoint: Generalizable Point Cloud Reinforcement Learning for Sim-to-Real Dexterous Manipulation2022/11/1
- On the Feasibility of Cross-Task Transfer with Model-Based Reinforcement Learning2022/10/1
- LESS: Label-Efficient Semantic Segmentation for LiDAR Point Clouds2022/10/1
- Frame Mining: a Free Lunch for Learning Robotic Manipulation from 3D Point Clouds2022/10/1
- A Real2Sim2Real Method for Robust Object Grasping with Neural Surface Reconstruction2022/10/1
- Abstract-to-Executable Trajectory Translation for One-Shot Task Generalization2022/10/1
- Multi-skill Mobile Manipulation for Object Rearrangement2022/9/1
- Contact Points Discovery for Soft-Body Manipulations with Differentiable Physics2022/5/1
- Approximate Convex Decomposition for 3D Meshes with Collision-Aware Concavity and Tree Search2022/5/1
- From One Hand to Multiple Hands: Imitation Learning for Dexterous Manipulation from Single-Camera Teleoperation2022/4/1
- Temporal Difference Learning for Model Predictive Control2022/3/1
- Close the Optical Sensing Domain Gap by Physics-Grounded Active Stereo Sensor Simulation2022/1/1
- Stabilizing Deep Q-Learning with ConvNets and Vision Transformers under Data Augmentation2021/7/1
- ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations2021/7/1
- Single RGB-D Camera Teleoperation for General Robotic Manipulation2021/6/1
- O2O-Afford: Annotation-Free Large-Scale Object-Object Affordance Learning2021/6/1
- PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics2021/4/1
- OCRTOC: A Cloud-Based Competition and Benchmark for Robotic Grasping and Manipulation2021/4/1
- Design and Actuator Optimization of Lightweight and Compliant Knee Exoskeleton for Mobility Assistance of Children with Crouch Gait2021/1/1
- Medical Robots for Infectious Diseases: Lessons and Challenges from the COVID-19 Pandemic2020/12/1
- Rearrangement: A Challenge for Embodied AI2020/11/1
- Deep Keypoint-Based Camera Pose Estimation with Geometric Constraints2020/7/1
- Quasi-Direct Drive Actuation for a Lightweight Hip Exoskeleton with High Backdrivability and High Bandwidth2020/4/1
- SAPIEN: A SimulAted Part-based Interactive ENvironment2020/3/1
- Deep Stereo using Adaptive Thin Volume Representation with Uncertainty Awareness2019/11/1
- S4G: Amodal Single-view Single-Shot SE(3) Grasp Detection in Cluttered Scenes2019/10/1
- Spine-Inspired Continuum Soft Exoskeleton for Stoop Lifting Assistance2019/7/1
- Design and Control of a Quasi-Direct Drive Soft Exoskeleton for Knee Injury Prevention during Squatting2019/2/1
- A Soft High Force Hand Exoskeleton for Rehabilitation and Assistance of Spinal Cord Injury and Stroke Individuals2019/2/1
- Comfort-Centered Design of a Lightweight and Backdrivable Knee Exoskeleton2019/2/1
- ShapeNet: An Information-Rich 3D Model Repository2015/12/1
- Pose Estimation Based on 3D Models2015/6/1