Ruohan Zhang
Stanford University
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MANIGUARD: 仕様に基づく安全性評価とロボット操作改善のためのベンチマークとデータセット安全性評価/操作2026/8/18
ロボット操作の基盤モデルの安全性を評価・改善するための、仕様に基づくフレームワークとベンチマーク、データセットを提案した論文。
- スキルは重みに、記憶はコードに:記憶依存ロボット操作のためのハイブリッド学習操作学習2026/8/1
長期的な記憶が必要なロボット操作タスクにおいて、低レベルスキルは勾配ベースの模倣学習で、高レベルの記憶管理戦略はコーディングエージェントによるヒューリスティック学習で獲得するハイブリッドフレームワークHyMeSを提案。デモデータを効率的に活用し、ベースラインを上回る性能を達成した。
- 仮想ヒューマンロボットインタラクションによる全身社会的触覚センシングの要求駆動設計触覚2026/7/1
社会的物理的ヒューマンロボットインタラクションのための触覚センシングを、ハードウェア駆動ではなく相互作用データから要求を導出する枠組みを提案。VRプラットフォームで全身接触分布を収集し、9つの社会的タッチジェスチャを特定、18名の参加者から5,520試行のデータセットを構築した。
- 行動アンクローニング:推論時ステアリングなしでモードリダイレクションをポリシー重みに蒸留する手法模倣学習/ポリシー編集2026/6/1
デモデータに含まれる望ましくない行動モードを抑制するため、一時的なモード分類器からのリダイレクション信号をポリシー重みに蒸留し、推論時オーバーヘッドなしで安全な行動を実現する手法MoREを提案した。
- SimFoundry: ポリシー学習と評価のためのモジュール式自動シーン生成sim2real2026/6/1
実世界のビデオからシミュレーション用のシーンを自動生成し、多様なバリエーションを作成してロボットポリシーの訓練と評価を行うシステムを提案。シミュレーションでの評価が実世界性能を強く予測し、訓練時のバリエーション追加が成功率を向上させることを示した。
- ステレオポリシー:ステレオ知覚によるロボット操作ポリシーの改善マニピュレーション2026/5/1
ステレオ画像ペアを直接利用して3次元幾何推論を強化する視覚運動ポリシー学習フレームワークを提案し、シミュレーションと実ロボットの操作タスクで性能を向上させた。
- EmboAlign: ビデオ生成と構成的制約の整合によるゼロショット操作操作2026/3/1
ビデオ生成モデルの出力を、推論時に視覚言語モデルが生成する構成的制約で整合させ、物理的に妥当なロボット軌道を生成するデータ不要のフレームワークを提案した。
- IMPASTO: モデルベース計画と学習された力学モデルを統合したロボット油絵再現ロボットアート/計画2026/3/1
ロボットが油絵の画像列から筆の軌道や力、色を推論して再現するシステムを提案。学習したピクセル力学モデルとモデル予測制御を統合し、自己対戦のみで学習する。
- FruitTouch:優しくスケーラブルな果実収穫のための知覚型グリッパ触覚2026/2/1
高解像度の視覚ベース触覚センシングを統合したコンパクトなグリッパを提案し、果実の把持安定性と損傷防止を実現した。
- Dream2Flow: 3Dオブジェクトフローで動画生成とオープンワールド操作をつなぐマニピュレーション2025/12/1
生成動画から3Dオブジェクトの動きを再構成し、それを中間表現として軌道追跡問題に変換することで、実演なしに多様な物体を操作できるフレームワークを提案。
- ENACT: 自己中心的なインタラクションの世界モデリングによる身体性認知の評価身体性認知/ベンチマーク2025/11/1
ロボティクスシミュレーションから生成した自己中心視点の行動と観測の系列並べ替えタスクにより、視覚言語モデルが身体性認知の能力(アフォーダンス認識、行動効果推論など)をどの程度持つかを評価するベンチマークを提案。
- MoMaGen: ソフト・ハード制約下で多段階両腕移動マニピュレーションのデモを生成sim2real2025/10/1
移動ベースと両腕の多段階タスク向けに、到達可能性などのハード制約と視認性などのソフト制約を満たすデータ生成を制約付き最適化として定式化し、多様なデモを自動生成する手法を提案。
- PneuGelSight:柔軟ロボットのための視覚ベース固有感覚・触覚センシング触覚2025/8/1
柔軟空気圧マニピュレータにカメラを内蔵し、高解像度の固有感覚と触覚を視覚的に取得する手法を提案。シミュレーションから実機へのゼロショット転移を可能にするパイプラインも構築した。
- UAD: ロボットマニピュレーションの汎化のための教師なしアフォーダンス蒸留マニピュレーション2025/6/1
大規模視覚モデルと視覚言語モデルを組み合わせて、手動アノテーションなしでタスク条件付きアフォーダンスモデルを学習し、ロボット操作の汎化性能を向上させる手法を提案。
- 言語と実演から構成可能な行動を学習するフレームワークBLADEマニピュレーション2025/5/1
言語注釈付き実演とLLMを活用し、長期ロボットマニピュレーションのための構造化された高レベル行動表現を自動構築する手法を提案。新規状況への一般化性能をシミュレーションと実機で検証した。
- Chain-of-Modality: マルチモーダル人間動画と視覚言語モデルによる操作プログラムの学習VLA2025/4/1
筋電アームバンドやマイクなどで計測した人間の操作動画から、視覚言語モデルがタスク計画と力などの制御パラメータを抽出し、ロボットに操作タスクを実行させる手法を提案した。
- BEHAVIORロボットスイート:日常家事のための実世界全身マニピュレーションを効率化全身マニピュレーション2025/3/1
両腕・車輪・4自由度胴体を備えたロボットで、全身遠隔操作インターフェースと視覚運動ポリシー学習アルゴリズムを統合し、家庭内の全身マニピュレーションタスクを実現するフレームワークを提案。
- ロバストな方策学習のためのデジタルいとこの自動生成sim2real2024/10/1
実世界のシーンを模した「デジタルいとこ」を自動生成し、シミュレーションから実世界へのゼロショット転移で高い成功率を達成する手法を提案。
- 身体性エージェントインターフェース:身体的意思決定のためのLLMベンチマークVLA2024/10/1
LLMを用いた身体的意思決定を統一的に評価するための汎用インターフェースを提案し、多様なタスク・モジュール・細粒度エラー指標でLLMの能力を体系的に分析するベンチマークを構築した。
- ReKep: ロボットマニピュレーションのための関係的キーポイント制約の時空間推論マニピュレーション2024/9/1
環境中の3Dキーポイント間の関係をPython関数で表す制約(ReKep)を導入し、大規模視覚モデルと言語モデルを用いて自由形式の指示から自動生成することで、多様なマニピュレーションタスクをリアルタイムに実行する手法を提案。
- TRANSIC: オンライン修正から学ぶSim-to-Realポリシー転移sim2real2024/5/1
人間が実世界でロボットの動作を観察・介入して修正を加え、その修正から残差ポリシーを学習することで、シミュレーションと実世界のギャップを埋めて家具組立などの接触の多いタスクを実現する手法。
- TeleMoMa: モバイルマニピュレーションのためのモジュール式で汎用的な遠隔操作システム遠隔操作2024/3/1
RGB-DカメラやVRコントローラなど複数の入力インターフェースを統合し、移動マニピュレータの全身遠隔操作を可能にするモジュール式システムを開発。模倣学習用の実演データ収集を容易にし、その有効性を実機とシミュレーションで示した。
- BEHAVIOR-1K:1000の日常活動とリアルなシミュレーションによる人間中心の身体性AIベンチマークsim2real2024/3/1
人間がロボットにやってほしいと望む1000の日常活動を、50のシーンと9000以上の物体を含む物理シミュレーション環境OMNIGIBSONで再現し、実世界への転移も検証したベンチマークを提案した。
- DexCap: 巧みな操作のためのスケーラブルでポータブルなモーションキャプチャデータ収集システムマニピュレーション2024/3/1
SLAMと電磁場を組み合わせたポータブルな手のモーションキャプチャシステムDexCapと、そのデータから直接ロボットの巧みな操作スキルを学習する模倣アルゴリズムDexILを提案した。
- NOIR: Neural Signal Operated Intelligent Robots for Everyday Activities2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Mini-BEHAVIOR: A Procedurally Generated Benchmark for Long-horizon Decision-Making in Embodied AI2023/10/1
- VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models2023/7/1
- Primitive Skill-based Robot Learning from Human Evaluative Feedback2023/7/1
- MimicPlay: Long-Horizon Imitation Learning by Watching Human Play2023/2/1