Hang Su
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WALL-SS: 次スケール自己回帰による長期的世界モデルのスケーリング世界モデル2026/8/26
ロボットの視覚的未来予測をスケール単位の自己回帰で生成する世界モデルを提案し、行動制御可能で長期的なシミュレーションを実現した。
- 単一の人間ビデオから数秒でロボットが操作スキルを獲得操作スキル獲得2026/7/1
ロボットが1本の人間のデモ動画から、数秒で新しい操作スキルを獲得しつつ、既存スキルを保持できるフレームワークHOSTを提案した。
- SpatialClaw:エージェント的空間推論のためのアクションインターフェース再考空間推論2026/6/11
視覚言語モデルによる空間推論を強化するため、コードをアクションインターフェースとして用いる訓練不要のフレームワークSpatialClawを提案。状態を持つPythonカーネル上で柔軟に知覚・幾何プリミティブを組み合わせ、中間結果に応じて分析を適応させる。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- X-Tokenizer: 視覚・言語・行動事前学習のためのマルチモーダル行動トークナイザーVLA2026/6/1
ロボットの行動を離散コードに変換する際、単なる再構成ではなく意味的なインターフェースとして学習する新しいトークナイザーを提案。マスク行動モデリングと対照学習により、行動コードが視覚言語の意味と整合するようにした。
- WALL-WM: イベント接合部での世界行動モデリングの彫刻VLA2026/6/1
WALL-WMは、ビデオ行動学習をチャンク中心の最適化からイベント基盤の視覚言語行動事前学習へと移行させ、意味的に一貫した行動イベントを学習の原子単位として使用する世界行動モデルです。
- Wall-OSS-0.5 技術報告書VLA2026/5/1
大規模VLA事前学習がロボットの実行可能な行動を直接生み出すかを検証し、ゼロショットで実ロボット動作を達成するオープンソース4Bモデルを提案した。
- RDT2:UMIデータのスケーリング限界を探り、ゼロショットのクロスエンボディメント汎化を実現VLA2026/2/1
7BパラメータのVLMを基盤とし、1万時間超のUMIデータと3段階学習で、未知の物体・シーン・指示・ロボット機体にゼロショットで汎化するロボット基盤モデルを構築した。
- ReflexDiffusion: 自動運転における高横加速度シナリオ向け反射強化型軌道計画自動運転/軌道計画2026/1/1
拡散ベースの軌道計画器のノイズ除去過程に勾配ベースの調整機構を導入し、道路曲率や横方向の車両動力学を強調することで、急旋回などの高横加速度シナリオでの安全性と安定性を向上させた。
- Motus: 統合潜在行動ワールドモデルVLA2025/12/1
理解・映像生成・行動の3エキスパートをMixture-of-Transformerで統合し、光流から潜在行動を学習する統一ワールドモデルを提案。シミュレーションと実世界で既存手法を上回る性能を示した。
- Vidarc: 閉ループ制御のための身体性ビデオ拡散モデルVLA2025/12/1
マスク付き逆動力学モデルを組み合わせた自己回帰的な身体性ビデオ拡散モデルにより、低遅延で高精度なロボットアームの閉ループ制御を実現した研究。
- H-RDT: 人間の操作データで強化した両腕ロボットマニピュレーションマニピュレーション2025/7/1
大規模な一人称視点の人間操作動画と3D手姿勢を事前学習に活用し、拡散トランスフォーマーとフローマッチングでロボットの両腕操作ポリシーを学習する手法を提案。シミュレーションと実機で既存手法を上回る性能を示した。
- AnyPos: 双腕マニピュレーションのためのタスク非依存動作の自動生成マニピュレーション2025/7/1
タスクに依存しない動作データを大規模に自動収集し、逆動力学学習で身体ダイナミクスをモデル化することで、様々なタスクやプラットフォームに転用可能な双腕マニピュレーション基盤を構築した研究。
- Vidar: 汎用マニピュレーションのための身体性ビデオ拡散モデルマニピュレーション2025/7/1
インターネット規模で事前学習したビデオ拡散モデルを実機ロボットの軌道で追加学習し、マスク付き逆動力学モデルで適応させることで、未知のロボットでも20分の実演だけで新タスクや背景・視点変化に汎化する手法を提案。
- RoboEngine: セマンティックロボットセグメンテーションと背景生成によるプラグアンドプレイなロボットデータ拡張データ拡張2025/3/1
ロボットのセグメンテーションと背景生成を組み合わせ、数行のコードで物理・タスクを考慮した視覚データ拡張を可能にするツールキットを提案。単一シーンのデモから6つの新規シーンへの汎化を実現し、性能を200%以上向上させた。
- イベントカメラを用いた動きに頑健な光カメラ通信光カメラ通信2024/12/1
イベントカメラと動的マーカーを組み合わせ、画面リフレッシュやカメラの動きに影響されにくい高速・高精度な光カメラ通信システムを実現した。
- ManiBox: スケーラブルなシミュレーションデータ生成による身体性空間汎化の強化sim2real2024/11/1
バウンディングボックスを入力とする学生ポリシーを強化学習教師から蒸留し、シミュレーションでスケールしたデータで実機へのゼロショット転移を実現したフレームワーク。
- RDT-1B:双腕マニピュレーションのための拡散基盤モデルマニピュレーション2024/10/1
双腕ロボット操作のための12億パラメータの拡散ベース基盤モデルRDTを提案し、統一行動空間と大規模マルチロボットデータで事前学習することで、未知物体へのゼロショット汎化や言語指示追従、少数デモからの新スキル学習を実現した。
- PEAC: クロスエンボディメント強化学習のための教師なし事前学習クロスエンボディメントRL2024/5/23
報酬なし環境でのオンライン相互作用を通じて、身体性に依存しない汎用的な知識を獲得するクロスエンボディメント教師なし強化学習(CEURL)を定式化し、そのための新しいアルゴリズムPEACを提案した。
- 周波数領域で動くロボット制御ネットワークFCNet模倣学習/制御2024/5/1
ロボット軌道の特徴が低周波に集中することに着目し、短時間フーリエ変換で時変特徴を符号化する制御ネットワークFCNetを提案。Transformerより高効率・低遅延で実時間意思決定を実現した。
- Score Regularized Policy Optimization through Diffusion Behavior2023/10/11
- Meta-Reinforcement Learning Based on Self-Supervised Task Representation Learning2023/5/1
- Human-Robot Shared Control for Surgical Robot Based on Context-Aware Sim-to-Real Adaptation2022/4/1
- Neuromorphic Visual Odometry System for Intelligent Vehicle Application with Bio-inspired Vision Sensor2019/9/1