Shuo Yang
収録論文 46本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ECHO-G: 音声に同期したヒューマノイド全身動作生成動作生成2026/9/30
音声とタイミング付きテキストを条件に、拡散トランスフォーマでヒューマノイドロボットの全身発話動作を直接生成するフレームワークを提案し、実機展開まで示した。
- 直接経験による世界モデル最適化:行動模倣を超えた世界の学習マニピュレーション2026/9/29
展開後のロボット学習において、行動模倣に加えて視覚経験から世界表現を洗練させ、成功・失敗の未来を活用したガイダンスで巧みな操作の成功率を向上させる手法を提案。
- 全身UMI:実時間動作生成によるヒューマノイド全身マニピュレーションへのUMIスキル転移全身マニピュレーション2026/9/19
UMIの手先軌道データからヒューマノイドの全身協調動作を実時間生成し、拡散方策と組み合わせて4タスクで全身マニピュレーションを実現した。
- TouchWorld: 器用な操作のための予測・反応型触覚基盤モデル触覚/操作2026/7/1
触覚を予測と高速フィードバックの両方に活用する階層型ポリシーを提案し、視覚言語によるタスク計画と触覚による接触適応を分離することで、長期的な操作タスクの成功率を向上させた。
- 知覚行動基盤モデル:人間の動作プリエントをロボット中心の地形に適応させるヒューマノイド制御2026/6/1
人間の動作データを基盤としたヒューマノイド制御モデルを、ロボットの周囲地形に適応させるフレームワークを提案。地形に合わせた参照動作を合成し、教師-学生学習で実ロボットに展開する。
- MotionWAM: 実時間ヒューマノイド移動操作のための基盤ワールドアクションモデルヒューマノイド/移動操作2026/6/1
本論文は、ビデオワールドモデルの中間特徴を利用して、単一の行動空間で全身動作を予測する実時間ヒューマノイド移動操作モデルMotionWAMを提案し、実機で高い成功率を達成した。
- ESARBench: エージェント型UAV身体化捜索救助のためのベンチマークUAV/ベンチマーク2026/5/1
マルチモーダル大規模言語モデル(MLLM)を搭載したUAVによる捜索救助(SAR)のための、新しいタスク「身体化捜索救助(ESAR)」と、その評価ベンチマーク「ESARBench」を提案した。Unreal Engine 5とAirSimを用いて現実のGISデータから高忠実度の環境を構築し、600タスクのデータセットと評価指標を提供する。
- TouchAnything: 自己中心視点映像からの両手触覚推定のためのデータセットとフレームワーク触覚推定2026/5/1
自己中心視点の映像から触覚情報を推定するための大規模データセットと、視覚から触覚を予測するベースラインフレームワークを提案した論文。
- TapSampling: タスク進捗理解型検証器を用いた推論時サンプリングによるロボット操作マニピュレーション2026/5/1
ロボット操作の汎用ポリシーに対して、推論時に複数の行動候補をサンプリングし、タスク進捗を予測する検証器で最適な行動を選ぶプラグアンドプレイなフレームワークを提案した。
- 形態に依存しない人間型ロボットの表情模倣表情模倣2026/3/1
人間型ロボットの表情模倣において、顔の形態の影響を排除し、表情と形態を分離して学習することで、より自然で正確な表情を再現する手法を提案した。
- DiT4DiT: ビデオダイナミクスと行動の統合モデリングによる汎用ロボット制御VLA2026/3/1
ビデオ生成と行動予測を統合したエンドツーエンドのVideo-Actionモデルを提案し、シミュレーションと実機で高い成功率とサンプル効率を達成した。
- 語彙候補と拡散によるシーン適応的洗練を統合したEnd-to-End自動運転End-to-End自動運転2026/2/1
固定の軌道語彙候補に、語彙条件付き拡散で生成したシーン適応候補を加え、共有選択モジュールで両者を評価するEnd-to-End自動運転手法を提案。
- 一度注入すれば生き残る:下流ファインチューニングを耐え抜くVLAモデルへのバックドア攻撃VLAセキュリティ2026/2/1
VLAモデルのファインチューニングで消えにくいモジュールにバックドアを注入し、ユーザー側の追加学習後も攻撃が持続する手法INFUSEを提案した。
- APEX: 非同期空中物体ゴールナビゲーションのための分離型記憶ベース探索器空中ナビゲーション2026/2/1
VLMによる動的空間記憶と強化学習による行動決定、オープンボキャブラリ検出を組み合わせ、UAVが言語指示に基づき空中で目標物体を自律探索する階層型エージェントを提案。
- 適応的視覚トークンキャッシュによるVision-Language-Actionモデルの高速化学習VLA2026/2/1
VLAモデルの推論を、再利用する視覚トークンを動的に選ぶ学習可能なポリシーとして最適化し、精度を保ちながら最大1.76倍の高速化を実現した。
- ConLA: 人間動画からの対照的潜在行動学習によるロボットマニピュレーションVLA2026/2/1
人間の動画からロボットの行動を教師なしで学習する際、対照学習で動きと見た目を分離し、実ロボット軌道での事前学習を上回る性能を実現した。
- 自転車測位のためのMoEベース学習型慣性オドメトリ慣性オドメトリ2025/10/1
マルチライダー・多路面のIMUデータで学習した速度予測器をEKFと密結合し、疎ゲート型Mixture of Expertsで計算量を抑えつつ高精度な自転車測位を実現した。
- 脚式ロボットのためのマルチIMUセンサフュージョン状態推定2025/7/1
脚式ロボットの複数リンクに搭載した低コストIMUと関節エンコーダ、カメラを拡張カルマンフィルタと因子グラフで融合し、着地衝撃や足滑りがあっても低ドリフトな姿勢・速度推定を実現した。
- GEMINUS:エンドツーエンド自動運転のためのデュアル認識型グローバル・シーン適応型Mixture-of-Experts自動運転/End-to-End2025/7/1
グローバル専門家とシーン適応型専門家群をデュアル認識ルーターで動的に組み合わせるMixture-of-Experts型のエンドツーエンド自動運転フレームワークを提案し、単眼視のみでBench2Driveベンチマークの運転スコアと成功率で最高性能を達成した。
- 射影幾何代数を用いたハイブリッド拡散ポリシーによる効率的なロボットマニピュレーション学習マニピュレーション2025/7/1
射影幾何代数(PGA)をネットワークに組み込み、空間的な帰納バイアスを与えることで、拡散ポリシーの学習効率とタスク性能を向上させるハイブリッド手法を提案した。
- 自動運転のためのChain-of-Thought:包括的サーベイと今後の展望自動運転2025/5/1
自動運転におけるChain-of-Thought推論の研究を体系的に整理し、動機・手法・課題・将来方向を分析したサーベイ。自己学習との組み合わせによる自己進化の可能性も提案。
- RoboFAC: ロボット失敗分析と修正のための包括的フレームワークVLA2025/5/1
ロボット操作の失敗を診断・修正するための大規模データセットと軽量マルチモーダルモデルを構築し、VLA制御の回復性能を向上させた。
- 漸進的エキスパート混合ネットワークによる自動運転の継続的適応自動運転/継続学習2025/2/1
強化学習と教師あり学習を組み合わせた動的漸進的最適化フレームワークと、タスク特性に応じて複数のエキスパートモデルを選択的に活性化するMoPEネットワークを提案し、複雑な市街地環境で行動クローニングを最大7.8%上回る性能を達成した。
- 拡散ポリシーの動的ランク調整による効率的で柔軟な学習模倣学習2025/2/1
特異値分解を用いて拡散ポリシーの学習中にランクを動的に調整するDRIFTを提案し、オフラインとオンラインを切り替えるDRIFT-DAggerでサンプル効率と学習速度を改善した。
- STLGame: 敵対的マルチエージェント系における信号時相論理ゲームマルチエージェント/ゲーム理論2024/12/1
信号時相論理(STL)タスクを敵対的環境で解くため、マルチエージェント系を2人ゼロサムゲームとしてモデル化し、微分可能STLとFSPでナッシュ均衡方策を求めるフレームワークを提案。
- 姿勢を持つロボット:敏捷な脚式ロボットのための特異点のないクォータニオンベースのモデル予測制御歩行2024/9/1
脚式ロボットの姿勢表現にクォータニオンを用い、大角度回転時の特異点を回避するモデル予測制御フレームワークを提案。iLQRを拡張し、四足歩行ロボットとヒューマノイドで性能と計算効率を実証した。
- 大規模モデルによる指示誘導型マニピュレーションアフォーダンスの学習マニピュレーション2024/8/1
視覚言語モデルと大規模言語モデルを活用し、言語指示に応じて対象物の操作領域を予測するアフォーダンスネットワークを提案。自動データ拡張により実世界タスクでの性能と未知物体・指示への汎化を向上させた。
- 自動運転システムの意思決定と制御のための安全で効率的な自己進化アルゴリズム自動運転/強化学習2024/8/1
人間の運転経験に基づく走行傾向で探索空間を絞り、力学モデルに基づく制約付き最適化で安全性を担保することで、強化学習による自動運転の自己進化を安全かつ効率的にする手法を提案した。
- 敵対的ポリシー探索に基づく自動運転シナリオ難易度の定量的表現自動運転テスト/敵対的シナリオ生成2024/8/1
強化学習で敵対的行動を取るエージェントを訓練し、その学習過程のポリシー群から難易度の異なる交通シナリオを連続的に生成・定量化する手法を提案した論文。
- 自律運転のための安全指向自己学習アルゴリズム:基本モデルからの進化自律運転2024/8/1
Transformerエンコーダの基本モデルと方策混合・後退ホライズン最適化を組み合わせ、安全性を保ちながら自律運転の方策を自己学習で進化させる手法を提案し、歩行者と車両が混在する環境で有効性を検証した。
- MPGNet:遮蔽環境における目標指向把持のための移動・押し・把持の連携学習マニピュレーション2024/8/1
遮蔽された環境で目標物体を効率的に把持するため、移動・押し・把持の3動作を連携させる三枝ネットワークMPGNetと多段階学習戦略を提案し、シミュレーションと実機で有効性を示した。
- ゲーム理論の離散戦略と動的環境における連続運動計画の橋渡しゲーム理論・運動計画2024/3/1
政策特性空間を用いてエージェントの政策を低次元空間に写像し、離散的な政策切替と連続的な制御を両立させる手法を提案。敵対的環境での自動運転レース実験で勝率を向上させ、未知環境への汎化も示した。
- Learning Local Control Barrier Functions for Hybrid Systems2024/1/1
- ROS package search for robot software development: a knowledge graph-based approach2023/12/1
- Safe Control Synthesis for Hybrid Systems through Local Control Barrier Functions2023/11/1
- Learning Adaptive Safety for Multi-Agent Systems2023/9/1
- SLoMo: A General System for Legged Robot Motion Imitation from Casual Videos2023/4/1
- Safe Perception-Based Control under Stochastic Sensor Uncertainty using Conformal Prediction2023/4/1
- MEGA-DAgger: Imitation Learning with Multiple Imperfect Experts2023/3/1
- Towards Explainability in Modular Autonomous Vehicle Software2022/12/1
- Cerberus: Low-Drift Visual-Inertial-Leg Odometry For Agile Locomotion2022/9/1
- A Benchmark Comparison of Imitation Learning-based Control Policies for Autonomous Racing2022/9/1
- Fast Contact-Implicit Model-Predictive Control2021/7/1
- Optimal Control for Structurally Sparse Systems using Graphical Inference2021/4/1
- Equality Constrained Linear Optimal Control With Factor Graphs2020/11/1
- Learning Actions from Human Demonstration Video for Robotic Manipulation2019/9/1