Yi Ma
Shanxi University
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- コードがシミュレーションを担い、Jevが評価を担うVLA2026/10/1
判断モデルJevは入力記述から評価できるタスクは得意だが、相手の行動や順序予測などシミュレーションが必要なタスクは苦手であり、シミュレーションをコードに任せるべきだと示した。
- ピクセルからポーズへ:人間のデモンストレーションによる物体中心のツール操作学習マニピュレーション2026/9/28
人間の動画デモから物体中心の世界モデルを事前学習し、ポーズ認識方策と組み合わせることで、ロボットとの対応データなしに複雑なツール操作を実現した。
- 生成動画プランをシミュレーションで接地し多様な器用操作コントローラを実現マニピュレーション2026/9/9
生成された手と物体のインタラクション動画をシミュレーションで接地し、多様な把持や操作を実行できる器用なロボットハンドコントローラを学習する手法を提案。
- WarpSAC: 探索と活用の再考によるスケーラブルなオフ方策強化学習の頂点を目指して強化学習2026/8/25
データ量に応じて安定化手法を適応させるオフ方策RLアルゴリズムWarpSACを提案し、CPU/GPU並列環境で既存手法を大幅に上回る性能を達成した。
- 模倣者ゲーム:行動予測を超えたロボットの模倣能力のベンチマーク模倣学習2026/8/23
人間のデモンストレーションから意図を推論して実行するロボットの能力を評価するため、4段階のベンチマーク「The Imitator Game」と大規模データセット「IG-10K」を構築し、既存モデルが意図レベルの模倣で失敗することを示した。
- DexVerse: 多タスク・多形態の器用操作のためのモジュール型ベンチマーク器用操作/ベンチマーク2026/7/1
多様な操作スキル、ロボット形態、視覚変化をカバーする大規模ベンチマークDexVerseを構築し、既存手法の汎化性能を評価した。
- Embodied-R1.5:身体化基盤モデルによる物理的知能の進化身体化基盤モデル2026/6/1
身体化された認知・計画・修正・指示を統合した基盤モデルを構築し、大規模データとマルチタスク強化学習で身体化VLMのSOTAを達成。さらに少量データでVLAに転移可能なことを示した。
- RoboLineage: ロボットポリシー反復にわたるエージェントネイティブなデータライフサイクル管理データ管理2026/6/1
ロボットポリシーの反復改善プロセスを、データ収集から評価・リリースまでを型付きの系統情報として管理するシステムを提案し、実ロボット操作ワークフローでの効率性と監査可能性を実証した。
- DexHoldem: 巧みな身体システムによるテキサス・ホールデムのプレイ操作/ベンチマーク2026/5/1
実世界の巧みな操作システムを評価するためのベンチマークDexHoldemを提案。ShadowHandを用いたテキサス・ホールデムの操作プリミティブの実行と、エージェントがゲーム状態を認識する能力を評価する。
- 非定常性で失われるランクと勾配:強化学習における可塑性損失を緩和するサンプル重み減衰強化学習2026/4/2
強化学習の可塑性損失をネットワーク最適化の理論的観点から分析し、勾配減衰を補正する軽量な手法「サンプル重み減衰」を提案した。
- フローポリシー勾配によるロボット制御強化学習2026/2/1
フローマッチングを用いたポリシー勾配法を改良し、脚式移動やヒューマノイド動作追従、マニピュレーション、sim-to-real転移を実現した研究。
- 選択ポリシーによる協調型ヒューマノイドマニピュレーションマニピュレーション2025/12/1
モジュール式遠隔操作で収集したデータを用い、複数の候補行動を生成・評価する模倣学習「Choice Policy」でヒューマノイドの全身協調マニピュレーションを実現した。
- GenDexHand:多指ハンドのための生成的シミュレーションマニピュレーション2025/11/1
VLMのフィードバックで物体配置を調整する閉ループ生成により、多指ハンド操作用の多様なタスクと環境を自動生成し、サブタスク分解で強化学習の効率と成功率を高める手法を提案。
- PROFusion: カメラ姿勢回帰と最適化によるロバストで高精度な密な再構成SLAM/3D再構成2025/9/1
カメラ姿勢回帰ネットワークで初期値を予測し、ランダム化最適化で深度画像を幾何学的に整合させることで、不安定なカメラ動作でもリアルタイムに高精度な密なシーン再構成を実現した。
- Viser: Pythonによる命令型Webベース3D可視化ライブラリ可視化2025/7/1
コンピュータビジョンとロボティクス向けの3D可視化ライブラリViserを提案。命令型APIとWebベースビューアにより、最小限のセットアップで拡張可能な3Dシーンと2D GUIを提供する。
- PyRoki: ロボット運動学最適化のためのモジュラーツールキット運動学最適化2025/5/1
運動学的最適化問題を解くためのモジュラーで拡張可能なクロスプラットフォームツールキットを提案し、CPU/GPU/TPUで動作し、既存のGPUライブラリより高速で低誤差に収束することを示した。
- 単純な技能から複雑な技能へ:ハンド内物体再配向の事例マニピュレーション2025/1/1
既存の回転スキルを再利用した階層的方策により、シミュレーションから実世界への転移が容易で外乱に頑健なハンド内物体再配向を実現し、固有感覚情報と低レベルスキル予測から物体姿勢を推定する手法も提案した。
- 生成的ロボットシミュレーションの評価についてsim2real2024/10/1
生成されたロボットタスクの品質・多様性・汎化性を評価する枠組みを提案し、人間評価との高い一致を確認した。
- 生成期待を用いた閉ループ視覚運動制御によるロボットマニピュレーションマニピュレーション2024/9/1
テキスト条件付き動画拡散モデルで視覚計画を生成し、誤差を定量化する埋め込み空間とフィードバック制御器を組み合わせて、長期的なロボット操作を閉ループで適応制御するフレームワークCLOVERを提案した。
- ペンを回す学習から得られた教訓マニピュレーション2024/7/1
シミュレーションで強化学習と軌道データを生成し、実世界で微調整することで、ペンのような物体を手の中で回転させる技能を習得した研究。
- CleanDiffuser: 意思決定のための拡散モデル向け使いやすいモジュール式ライブラリ拡散モデル意思決定2024/6/1
意思決定アルゴリズムに特化した初の拡散モデルライブラリCleanDiffuserを提案し、モジュール式で柔軟な実装と広範な評価を通じてその信頼性と設計上の知見を示した。
- Uni-RLHF:多様な人間フィードバックを用いた強化学習のための汎用プラットフォームとベンチマークスイートRLHF2024/2/1
多様な人間フィードバックを扱うRLHFのための注釈プラットフォーム、大規模クラウドソーシングデータセット、モジュール式オフラインRLHFベースラインを提供する統合システムを構築し、30以上のタスクで1500万ステップを超えるデータを収集して評価した。
- Role of Uncertainty in Anticipatory Trajectory Prediction for a Ping-Pong Playing Robot2023/12/1
- RLIF: Interactive Imitation Learning as Reinforcement Learning2023/11/1
- General In-Hand Object Rotation with Vision and Touch2023/9/1
- ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles2023/6/1
- In-Hand Object Rotation via Rapid Motor Adaptation2022/10/1