Zhiyang Dou
Massachusetts Institute of Technology
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 予想外のロボットポリシー:GPT-6 AstraのRoboDojoとその先における初期評価VLA2026/9/21
大規模言語モデルをロボット操作のポリシーとして直接使えるかを検証し、GPT-6 Astraが公開ポリシーを上回る成功率を示す一方、精度や動的制御を要するタスクは苦手であることを明らかにした。
- MoSAT: 空間オーディオとテキスト記述からの人間動作生成動作生成2026/9/20
空間オーディオと自然言語を条件として全身動作を生成する新タスクを提案し、データセットSTAMと階層的クロスアテンションを用いた潜在フローマッチング手法MoSATを開発した。
- S4R: 剛体の相互貫入を解消するスケーリング手法物理シミュレーション2026/9/17
物体を一度小さく縮めてから徐々に元のサイズに戻すことで、剛体同士のめり込みを解消する手法を提案し、大規模シーンでも高速かつ高精度に処理できることを示した。
- SPOT: 空間知覚指向の長時間ヒューマノイド遠隔操作遠隔操作2026/9/7
長時間の移動操作タスクで必要な空間認識を拡張するため、ロボット搭載の魚眼カメラと視点分離型の自由視点表示を組み合わせたVR遠隔操作システムSPOTを提案した。
- RoboEdit: 人間の操作動画をスケーラブルなロボット経験へ変換するVLA2026/8/19
人間の操作動画を、ロボットの学習に使えるアクション整合性のある物理的に妥当なロボット動画へ変換するビデオ編集スイートを提案。大規模データセットと編集エンジンを構築し、実世界の操作タスクで有効性を実証した。
- 物理的インタラクションの学習:触覚・力覚を考慮したロボット学習のサーベイ触覚・力覚学習2026/8/1
触覚・力覚センシングを統合したロボット学習手法を、マルチモーダルかつ多段階のシステム設計の観点から統一的な分類学TF-ARTを用いて整理し、今後の研究課題を考察したサーベイ論文。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- NeuralActuator: ロボット動力学と外力知覚のためのニューラルアクチュエータモデリングアクチュエータモデリング2026/7/1
低コストロボットのアクチュエータ動力学をニューラルネットでモデル化し、トルク予測・外力知覚・異常検知を同時に行う手法を提案した。
- HumanScale: 身体中心の人間ビデオは実ロボットデータを凌駕する身体化事前学習の可能性身体化事前学習2026/6/18
身体化基盤モデルの事前学習データとして、遠隔操作の実ロボット軌跡と身体中心の人間ビデオを比較し、適切なフィルタリングとラベリング処理を施した人間ビデオが実ロボットデータよりも優れた性能を示すことを発見した。
- RigidFormer: トランスフォーマーを用いた剛体力学の学習シミュレーション2026/5/1
メッシュフリーの点群入力から剛体の力学を学習するオブジェクト中心のトランスフォーマーモデルを提案し、アンカーとKabsch整列により剛性を保ちつつ高速で高精度なシミュレーションを実現した。
- Switch-JustDance:家庭用ゲーム機で全身運動追従コントローラを評価するベンチマーク全身制御ベンチマーク2025/11/1
Nintendo Switchの『Just Dance』を利用し、ゲーム内の振り付けをロボットの動作に変換して、ヒューマノイドの全身制御コントローラを実機で評価する低コストで再現可能なベンチマーク手法を提案した。
- MOSPA: 空間オーディオに駆動される人間モーション生成モーション生成2025/7/1
空間オーディオに反応する人間の動きを生成するため、初の空間オーディオ駆動モーション(SAM)データセットを構築し、拡散モデルベースの生成フレームワークMOSPAを提案した。
- CoDA: 関節物体の全身操作のための協調拡散ノイズ最適化マニピュレーション2025/5/1
身体・左右の手の3つの拡散モデルをノイズ空間で協調最適化し、関節物体を高精度に全身操作する動作を生成する手法を提案。
- SymBridge: 人間参加型サイバーフィジカル対話システムによる適応的人間-ロボット共生人間-ロボットインタラクション2025/2/1
拡張現実を用いて実人間と仮想ロボットを物理環境で対話させ、人間のフィードバックからロボットの対話モデルを継続的に学習・適応させるシステムを提案。
- ModSkill: 身体キャラクタースキルのモジュール化モーション生成/模倣学習2025/2/1
全身の複雑な運動スキルを身体部位ごとのモジュール型スキルに分解し、生成モデルによる適応的サンプリングで学習を強化することで、高精度な全身モーショントラッキングと再利用可能なスキル埋め込みを実現した研究。
- MotionWavelet: ウェーブレット多様体学習による人体動作予測動作予測2024/11/1
ウェーブレット変換と拡散モデルを組み合わせ、空間周波数領域で人体動作の時系列パターンを学習することで、将来の動作を高精度に予測するフレームワークを提案した。