Shuran Song
収録論文 114本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 連続ロボット学習のためのメモリアンカー連続学習2026/8/27
ロボットが新しいタスクを学習しても過去のタスクを忘れないようにするため、リプレイバッファ内の重要経験(メモリアンカー)を特定し、それを活用することで破滅的忘却を大幅に軽減する手法を提案した。
- ROSA: ロボット工場向けロボティクス基盤モデル配信システムシステム/基盤モデル配信2026/7/1
ロボット工場向けに、複数ロボットが共有GPUプールで基盤モデルを効率的に利用できる配信システムを提案し、工場生産性を最大12倍向上させた。
- Handroid: 器用な手とヒューマノイドを橋渡しする再構成可能ロボットヒューマノイド/器用操作/再構成ロボット2026/7/1
27自由度の電動ボディを器用な手または卓上ヒューマノイドとして再構成できる小型ロボットを開発し、操作・移動・再構成を含む長期的タスクを実証した。
- フレーム混合ポリシー:双腕移動操作のためのマルチフレーム行動ノイズ除去拡散ポリシー/双腕操作/移動操作2026/7/1
拡散ベースの視覚運動ポリシーにおいて、複数の座標フレームで同期して行動ノイズ除去を行う新しい手法を提案し、シミュレーションと実機の双腕移動操作タスクで性能を実証した。
- Transformer Transformer: 動作条件付きロボット共設計のための統一モデルロボット設計2026/7/1
ロボットの設計と制御を統一的に扱う拡散トランスフォーマーを提案し、目標軌道を追従するロボット設計を生成する。
- ModPack: 双腕移動操作のための拡張可能な遠隔操作インターフェース遠隔操作2026/7/1
多様なロボットとタスクに対応するモジュール式遠隔操作システムを開発し、異なるプラットフォームでの実証とオープンソース化を行った。
- ロボット操作の堅牢性:基礎と最前線マニピュレーション2026/6/1
ロボット操作における堅牢性の定義を明確化し、確率論的・制御理論的観点から定式化、各モジュールでの実現機構を整理し、評価方法と将来課題を論じたサーベイ論文。
- 多感覚継続学習:事前学習済み視覚運動ポリシーの力覚への適応継続学習/力覚/ロボット操作2026/6/1
事前学習済みの視覚のみのロボットポリシーに、力覚などの新しいモダリティを追加し、元のタスク性能を保ちながら接触を伴う新タスクへ適応させる手法を提案した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- DF-ExpEnse: 拡散フィルタ探索によるサンプル効率的なファインチューニング強化学習/探索2026/6/1
事前学習済みの生成制御ポリシーをオンライン経験でファインチューニングする際、探索の質を高めてサンプル効率を向上させる手法を提案。
- 1つのデモは千の軌道に値する:視運動ポリシーのためのアクション・ビュー拡張データ拡張2026/6/1
実世界のデモから魚眼画像シーケンスと物理的に実現可能なアクション軌道を生成するデータ拡張フレームワークを提案し、シミュレーションと実世界で操作タスクの成功率を向上させた。
- 行動プロンプト方策:操作のためのデモンストレーションをプロンプトとして活用マニピュレーション2026/6/1
単一の人間のデモンストレーションをプロンプトとして用い、推論時に新しいタスクを実行できるロボットのパラダイムを提案。新しいアーキテクチャ、データ収集インターフェース、評価ベンチマークを導入し、微調整なしで新しいスキルを教える柔軟な方法を示した。
- PanoVine: ソフト成長型つるロボットの全身視覚運動制御ソフトロボティクス/視覚運動制御2026/6/1
つるロボットの全身にカメラを配置し、デモから学習したエンドツーエンドの視覚運動ポリシーで複雑環境での自律ナビゲーションと操作を実現した。
- ロボットトレーナーは人に楽しまれるか?ペーサーロボットSnoopieのケーススタディヒューマンロボットインタラクション2026/4/1
四足歩行ロボットがランニングのインターバルトレーニングのペーサーとして機能し、ウェアラブル端末と比較してペース順守率と一貫性が向上し、ユーザーにも好意的に受け入れられることを示した。
- EgoVerse:世界各地から収集したロボット学習用の自己中心視点人間データセットデータセット/模倣学習2026/4/1
人間の自己中心視点のデモデータを大規模に収集・共有するプラットフォームとデータセットを構築し、人間データからロボットへの転移学習の大規模実験を行った。
- ゲート付きメモリポリシー:文脈内記憶と適応マニピュレーション2026/4/1
ロボット操作タスクの記憶要件に応じて、履歴を選択的に記憶・想起する視覚運動ポリシーを提案。メモリゲートと軽量クロスアテンションにより、非マルコフ的タスクで性能を向上させた。
- UMI-Underwater: 水中テレオペレーションなしで水中マニピュレーションを学習するマニピュレーション2026/3/1
自己教師ありデータ収集と陸上デモからの知識転移により、水中ロボットの把持を学習するシステムを提案。
- HoMMI: 人間のデモンストレーションから全身移動マニピュレーションを学習移動マニピュレーション2026/3/1
ロボットを使わずに人間のデモンストレーションから全身移動マニピュレーションを学習するデータ収集・方策学習フレームワークを提案し、自己中心視センシングと身体差を埋めるハンド・アイ方策設計により長期的な移動操作タスクを実現した。
- 事前学習から熟達へ:分布収縮型強化学習による効率的なスキル習得強化学習/操作2026/3/1
事前学習済みの生成ロボットポリシーを、分布収縮型強化学習(DICE-RL)で微調整し、高成功率の行動を増幅して高性能な「プロ」ポリシーへと進化させる手法を提案。シミュレーションと実機で高次元ピクセル入力からの複雑な長期的操作スキルの習得を実証した。
- 最小限のコンプライアンス制御コンプライアンス制御2026/3/1
力センサや学習を使わず、モータの電流・電圧信号のみで外部力を推定し、タスク空間アドミッタンス制御に組み込むことで、多様なロボットで安全なコンプライアンス動作を実現する手法を提案した。
- SAGE: 身体性AIのためのスケーラブルなエージェント型3Dシーン生成sim2real2026/2/1
ユーザーが指定した身体性タスクを理解し、複数の生成器と評価器を組み合わせて物理的に妥当でシミュレータ対応の3D環境を自動生成するエージェントフレームワークを提案。
- 基盤モデルはロボティクスにおけるフルスタック転移への道か?転移学習2026/2/1
ロボティクスにおける転移学習を言語から運動技能までの階層で整理し、基盤モデルやTransformerが「フルスタック転移」にどう貢献するかを概観した記事。
- 足に頼らないロコモーション歩行2026/1/1
人型ロボットが手や膝、肘も使って複雑な地形を移動する全身運動システムを、物理ベースのキーフレームアニメーションと強化学習を組み合わせて実現した。
- Cosmos Policy: 視覚運動制御と計画のための動画モデル微調整VLA2026/1/1
大規模事前学習済み動画モデルを、アーキテクチャ変更なしの一段階の追加学習だけでロボット方策に変換し、行動・将来画像・価値を潜在フレームとして生成して計画も可能にした手法。
- UMI-FT:実環境でのコンプライアントマニピュレーションマニピュレーション2026/1/1
指先に6軸力覚センサを搭載したハンドヘルドデータ収集デバイスUMI-FTを開発し、力加減が重要な接触作業を実世界デモから学習できる適応型コンプライアンス方策を訓練した。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- UMI-on-Air: 機体特性を考慮した汎用視覚運動ポリシーの空中マニピュレーション展開空中マニピュレーション2025/10/1
手持ちグリッパで収集した人間の操作データから汎用視覚運動ポリシーを学習し、拡散サンプリングに制御器の追従コスト勾配を組み込むことで、空中マニピュレータなど制約の強い機体でも動的に実行可能な軌道を生成する手法を提案した。
- 潜在ポリシーバリア:分布内に留まることで堅牢な視覚運動ポリシーを学習するVLA2025/8/1
専門家デモの潜在表現を障壁として扱い、拡散ポリシーとダイナミクスモデルを組み合わせて、追加の人間修正なしに視覚運動ポリシーの堅牢性とデータ効率を向上させるフレームワークを提案。
- ロボットがロボットを訓練:ヒューマノイドのための実世界ポリシー自動適応と学習sim2real2025/8/1
ロボットアームの教師がヒューマノイドの生徒を保護・誘導しながら、実世界で効率的に強化学習を行うフレームワークを提案し、歩行速度追従や起き上がり動作で有効性を示した。
- ロボット操作のための幾何学認識4D動画生成VLA2025/7/1
複数視点の点群整合性を訓練時に監督することで、単一RGB-D画像から時空間的に整合した未来動画を生成し、ロボットの操作軌道復元に応用する4D動画生成モデルを提案。
- コンプライアント残差DAgger:人間の修正による実世界の接触を伴うマニピュレーションの改善マニピュレーション2025/6/1
人間がロボットの動作を止めずに力加減を調整しながら修正を加えられるインターフェースと、力フィードバックを組み込んだ残差方策を提案し、接触の多い繊細な作業の成功率を大幅に向上させた。
- 整流点フロー:汎用的な点群姿勢推定点群姿勢推定2025/6/1
点群のペア位置合わせとマルチパーツ形状組み立てを単一の条件付き生成問題として定式化し、点ごとの速度場を学習して部品姿勢を復元する手法を提案。
- DynaGuide: 動的ガイダンスによる拡散ポリシーの能動的制御VLA2025/6/1
拡散ポリシーの生成過程に外部のダイナミクスモデルからのガイダンスを注入することで、追加学習なしに既存ポリシーを多様な目的へ誘導できる手法を提案。
- 行動の中の視覚:人間の実演から能動的知覚を学ぶマニピュレーション2025/6/1
6自由度のロボット首とVRテレオペレーションを用いて、人間の能動的知覚戦略を実演から直接学習し、視覚遮蔽を含む両腕マニピュレーションタスクで高い性能を達成した。
- 拡散ポリシーに对称性を組み込むための実践的ガイドVLA2025/5/1
拡散ポリシーに完全な同変設計を必要とせず、不変表現や同変視覚エンコーダ、フレーム平均化などの実践的手法で対称性の利点を組み込む方法を検討し、その有効性を実験的に示した。
- DexUMI:人間の手を汎用マニピュレーションインターフェースとして使う巧みな操作マニピュレーション2025/5/1
人間の手の動きをウェアラブル外骨格と映像インペインティングでロボットハンドに転移し、巧みな操作スキルを学習させるデータ収集・方策学習フレームワークを提案。
- DexMachina:両手巧みな操作のための機能的リターゲティングマニピュレーション2025/5/1
人間の両手による物体操作のデモンストレーションから、関節物体を長期的に操作する巧みなロボットハンドのポリシーを学習する手法を提案。仮想物体コントローラを徐々に弱めるカリキュラム学習により、人間とロボットの身体性ギャップを克服する。
- 統合動画行動モデルVLA2025/3/1
動画と行動を統合的に学習し、推論時は動画生成を省略して高速に行動を予測できるロボティクス向けモデルを提案。
- BEHAVIORロボットスイート:日常家事のための実世界全身マニピュレーションを効率化全身マニピュレーション2025/3/1
両腕・車輪・4自由度胴体を備えたロボットで、全身遠隔操作インターフェースと視覚運動ポリシー学習アルゴリズムを統合し、家庭内の全身マニピュレーションタスクを実現するフレームワークを提案。
- Cosmos-Reason1:物理的常識から身体性推論へVLA2025/3/1
物理世界を理解し、長い思考連鎖を通じて自然言語で身体的行動決定を生成するマルチモーダル大規模言語モデルCosmos-Reason1を提案し、物理的常識と身体性推論のベンチマークで評価した。
- 介護タスクにおけるソフトロボティクスの知覚的安全性に関する研究ソフトロボティクス2025/3/1
入浴など身体接触が不可避な介護場面を想定し、正負圧を組み合わせた3Dプリント製ソフトグリッパを設計。硬質グリッパより低く均一な圧力で把持でき、実演後に参加者のロボットへの信頼が有意に向上した。
- ToddlerBot: 移動操作のためのオープンソース機械学習対応ヒューマノイドプラットフォームヒューマノイド2025/2/1
低コストでオープンソースの小型ヒューマノイドロボットToddlerBotを開発し、シミュレーションから実世界へのゼロショット転移や遠隔操作によるデータ収集を可能にした。
- RoboPanoptes: 全身視覚で全身巧緻性を実現する全方位ロボット全身マニピュレーション2025/1/1
ロボット表面に分散配置したカメラによる全身視覚と、全身を使った操作を可能にする視覚運動ポリシーを組み合わせ、狭所での開梱や大型物体の掃き寄せなど多様なタスクを実現した。
- TidyBot++: ロボット学習のためのオープンソース全方向移動マニピュレータ移動マニピュレーション2024/12/1
模倣学習による家庭内移動マニピュレーションのデータ収集を容易にするため、動力付きキャスタで全方向移動を実現し、任意のアームを搭載できる低コストなオープンソース移動マニピュレータを提案した。スマホ遠隔操作インタフェースで収集したデータから学習した方策が家庭内タスクを実行できることを示した。
- 適応コンプライアンスポリシー:拡散誘導制御のための近似コンプライアンス学習マニピュレーション2024/10/1
人間のデモから操作タスクに応じて空間的・時間的にシステムのコンプライアンスを動的に調整する枠組みを提案し、接触の多い複雑な操作タスクで従来の視覚運動ポリシーを50%以上上回る性能を達成した。
- 微分可能ロボットレンダリングsim2real2024/10/1
ロボットの見た目を制御パラメータで微分可能に描画する手法を提案し、画像からの姿勢復元や視覚言語モデルによる制御に応用した。
- 自己改善型の自律水中マニピュレーション水中マニピュレーション2024/10/1
人間のデモからの行動クローニングと自己学習最適化を組み合わせ、水中で物体把持・ゴミ分別・救助回収を自律遂行し、人間の遠隔操作より41%高速化したシステムAquaBotを開発した。
- 意味的に制御可能な拡張による汎化可能なロボット学習sim2real2024/9/1
画像テキスト生成モデルをデータ拡張に活用し、ロボット操作データを多様化することで、未見の実環境への汎化を可能にする学習フレームワークを提案した。
- GET-Zero: 身体構造グラフを考慮したTransformerによるゼロショット身体汎化マニピュレーション2024/7/1
身体構造のグラフ接続をTransformerの注意機構に組み込み、ハードウェア構成の変化に再学習なしで適応できる制御方策を実現した研究。指の欠損やリンク長変更にもゼロショットで汎化し、ベースラインを20%上回った。
- EquiBot: 汎化性とデータ効率を両立するSIM(3)同変拡散ポリシーマニピュレーション2024/7/1
拡散ポリシーにSIM(3)同変なネットワークを組み合わせ、スケール・回転・並進の変化に不変なロボットマニピュレーション方策を実現した。各タスク5分の実演だけで新しい物体や環境に汎化できる。
- 操作インターフェースとしてのフロー:Im2Flow2Actsim2real2024/7/1
物体の動き(フロー)を人間とロボットの共通インターフェースとして使い、人間の動画とシミュレーションのロボットデータだけで実世界の多様な操作スキルを獲得する学習フレームワーク。
- 脚付きUMI:操作中心の全身コントローラによる移動型マニピュレーションマニピュレーション2024/7/1
手持ちグリッパで実世界の操作データを収集し、シミュレーションで全身コントローラを訓練して、四足歩行ロボットに操作スキルを実装するフレームワークを提案。
- ManiWAV: 実環境の音声・視覚データからロボットマニピュレーションを学習マニピュレーション2024/6/1
手に装着する「耳」型デバイスで人間の実演を音声・視覚同期で収集し、接触の多いロボット操作スキルを実演から直接学習する手法を提案した。
- Dreamitate: 動画生成による実世界視覚運動ポリシー学習VLA2024/6/1
動画拡散モデルを人間の実演で微調整し、新しい場面の画像から生成した実行動画でロボットを直接制御することで、既存の行動クローニングより高い汎化性能を実現した。
- ContactHandover: 接触誘導によるロボットから人への物体受け渡しマニピュレーション2024/4/1
ロボットが人に物体を渡す際、人が持ちやすい接触点を塞がない把持姿勢を選び、受け渡し時には人の負担が小さくなる手先姿勢を計画するシステムを提案した。
- DoughNet: 変形物体のトポロジー操作のための視覚予測モデル変形物体操作2024/4/1
生地のような弾塑性物体の分割・融合を伴うトポロジー変化を潜在空間で予測し、ロボットによる操作計画を可能にするTransformerベースのモデルを提案。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- PaperBot:紙で実世界の道具を設計する学習マニピュレーション2024/3/1
紙を折る・切る・投げる動作を自己教師あり学習で最適化し、紙飛行機や紙グリッパーを実機ロボットで設計・使用する手法を提案。
- 動力学誘導拡散モデルによるセンサレスロボットマニピュレータ設計マニピュレーション2024/2/1
物体形状とタスク仕様から、センサなしで開ループ動作により物体を操作できるマニピュレータ設計を生成する拡散モデルベースのフレームワークを提案。
- Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots2024/2/1
- 粒状媒体中の物体を触覚で探索・把持するロボットシステムGEOTACT触覚2024/2/1
触覚フィードバックのみを用いた学習により、粒状環境に埋もれた未知形状の物体を把持・回収するロボットシステムを開発し、実機へのゼロショット転移を実現した。
- Foundation Models in Robotics: Applications, Challenges, and the Future2023/12/1
- DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object Manipulation2023/12/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Rearrangement Planning for General Part Assembly2023/7/1
- Scaling Up and Distilling Down: Language-Guided Robot Skill Acquisition2023/7/1
- XSkill: Cross Embodiment Skill Discovery2023/7/1
- RoCo: Dialectic Multi-Robot Collaboration with Large Language Models2023/7/1
- REFLECT: Summarizing Robot Experiences for Failure Explanation and Correction2023/6/1
- TidyBot: Personalized Robot Assistance with Large Language Models2023/5/1
- Pick2Place: Task-aware 6DoF Grasp Estimation via Object-Centric Perspective Affordance2023/4/1
- Decision Making for Human-in-the-loop Robotic Agents via Uncertainty-Aware Reinforcement Learning2023/3/1
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion2023/3/1
- Dynamic Grasping with a Learned Meta-Controller2023/2/1
- RoboNinja: Learning an Adaptive Cutting Policy for Multi-Material Objects2023/2/1
- CACTI: A Framework for Scalable Multi-Task Multi-Scene Visual Imitation Learning2022/12/1
- Cloth Funnels: Canonicalized-Alignment for Multi-Purpose Garment Manipulation2022/10/1
- Bag All You Need: Learning a Generalizable Bagging Strategy for Heterogeneous Objects2022/10/1
- TANDEM3D: Active Tactile Exploration for 3D Object Recognition2022/9/1
- BusyBot: Learning to Interact, Reason, and Plan in a BusyBoard Environment2022/7/1
- Semantic Abstraction: Open-World 3D Scene Understanding from 2D Vision-Language Models2022/7/1
- FishGym: A High-Performance Physics-based Simulation Framework for Underwater Robot Learning2022/6/1
- Learning Pneumatic Non-Prehensile Manipulation with a Mobile Blower2022/4/1
- DextAIRity: Deformable Manipulation Can be a Breeze2022/3/1
- Iterative Residual Policy: for Goal-Conditioned Dynamic Manipulation of Deformable Objects2022/3/1
- CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object Navigation2022/3/1
- TANDEM: Learning Joint Exploration and Decision Making with Tactile Sensors2022/3/1
- Continuous Scene Representations for Embodied AI2022/3/1
- Scene Editing as Teleoperation: A Case Study in 6DoF Kit Assembly2021/10/1
- UMPNet: Universal Manipulation Policy Network for Articulated Objects2021/9/1
- Learning to See before Learning to Act: Visual Pre-training for Manipulation2021/7/1
- Visual Perspective Taking for Opponent Behavior Modeling2021/5/1
- FlingBot: The Unreasonable Effectiveness of Dynamic Manipulation for Cloth Unfolding2021/5/1
- GarmentNets: Category-Level Pose Estimation for Garments via Canonical Space Shape Completion2021/4/1
- Spatial Intention Maps for Multi-Agent Mobile Manipulation2021/3/1
- Dynamic Grasping with Reachability and Motion Awareness2021/3/1
- Perspectives on Sim2Real Transfer for Robotics: A Summary of the R:SS 2020 Workshop2020/12/1
- SSCNav: Confidence-Aware Semantic Scene Completion for Visual Semantic Navigation2020/12/1
- Learning a Decentralized Multi-arm Motion Planner2020/11/1
- Learning 3D Dynamic Scene Representations for Robot Manipulation2020/11/1
- AdaGrasp: Learning an Adaptive Gripper-Aware Grasping Policy2020/11/1
- Fit2Form: 3D Generative Model for Robot Gripper Form Design2020/11/1
- Spatial Action Maps for Mobile Manipulation2020/4/1
- Grasping in the Wild:Learning 6DoF Closed-Loop Grasping from Low-Cost Demonstrations2019/12/1
- Category-Level Articulated Object Pose Estimation2019/12/1
- Visual Hide and Seek2019/10/1
- ClearGrasp: 3D Shape Estimation of Transparent Objects for Manipulation2019/10/1
- Form2Fit: Learning Shape Priors for Generalizable Assembly from Disassembly2019/10/1
- DensePhysNet: Learning Dense Physical Object Representations via Multi-step Dynamic Interactions2019/6/1
- TossingBot: Learning to Throw Arbitrary Objects with Residual Physics2019/3/1
- Learning Synergies between Pushing and Grasping with Self-supervised Deep Reinforcement Learning2018/3/1
- Robotic Pick-and-Place of Novel Objects in Clutter with Multi-Affordance Grasping and Cross-Domain Image Matching2017/10/1
- Multi-view Self-supervised Deep Learning for 6D Pose Estimation in the Amazon Picking Challenge2016/9/1
- ShapeNet: An Information-Rich 3D Model Repository2015/12/1