Yikai Wang
Beijing Normal University
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- KPI: ヒューマノイドの物理的インタラクションのためのプロンプト可能なカーネルマニピュレーション2026/9/28
軌道源と全身トラッカー間に、方向ごとに追従・柔軟・力保持を指示する契約を送り、接触時に腕の剛性・減衰・参照・フィードフォワードを適応させるカーネルを提案。VLAエージェントが指示から軌道と契約を生成し、ウィンチ操作やドア開け、箱運搬を実現した。
- 単調最適停止による予測的ロボットゴールキーピング歩行2026/9/21
ロボットが相手の意図が完全に分かる前に動き出す必要があるゴールキーピング課題で、いつ動き始めるかを単調最適停止問題として定式化し、強化学習で訓練した四足歩行のセーブ方策を起動するタイミングを学習する手法を提案した。
- 学習ベースロボットPKにおけるダイナミクス由来のコミットメントsim2real2026/9/17
人型ロボットのシュートと四足ロボットのセーブからなるPKシステムを構築し、身体能力に起因する『コミットメント(選択肢の消失)』を解析するDIC-Mapを提案した。推定器の置き換えがセーブ率を0.240から0.472へ大幅に改善することを示した。
- 未来を保持し、ロールアウトを捨てる:ワールドアクションモデルのためのRIFTVLA2026/8/1
ロボットの行動生成に使われるワールドアクションモデル(WAM)において、反復的なビデオロールアウトを必要とせず、学習された予測トークンを用いて将来のキャッシュを一回のパスで構築する手法RIFTを提案し、遅延を大幅に削減しつつ成功率を維持できることを示した。
- 分解された視覚プロキシによる直接的な3D認識オブジェクト挿入画像生成/拡散モデル2026/6/4
背景画像へのオブジェクト挿入を、3Dポーズ制御可能な拡散モデルベースのフレームワークDIRECTを提案。外観・幾何・文脈の3条件を分離注入し、高品質な合成とポーズ操作を両立する。
- EvoScene-VLA: アクションデコーダ内でシーン信念を進化させ、チャンク化ロボット制御を実現VLA2026/5/1
ロボットのアクションによって変化するシーン状態を、チャンク間で持続的に更新するVLAポリシーを提案し、シミュレーションと実機で成功率を向上させた。
- HALO: 異種エージェント・リアプノフ方策最適化による人間とロボットの協調学習群制御2026/3/1
人間とロボットの協調作業において、ロボットと人間の意思決定の非対称性(合理性ギャップ)による学習の不安定さを、リアプノフ安定性理論に基づく方策更新の収束保証で解決する新しい強化学習フレームワークを提案した。
- APEX:ヒューマノイドロボットのための適応的高プラットフォーム踏破学習歩行2026/2/1
深層強化学習を用いて、脚長を超える高さのプラットフォームを登攀・歩行・這行・立ち上がり・伏せの6スキルを統合した単一ポリシーで自律的に踏破するシステムを開発し、Unitree G1で実機ゼロショット転移を実現した。
- ActiveVLA: 能動的知覚を視覚-言語-行動モデルに統合した高精度3DロボットマニピュレーションVLA2026/1/1
静的な手首カメラに頼る従来のVLAモデルに対し、重要領域の特定と能動的な視点選択・3Dズームインを行う2段階の枠組みを導入し、長期的・微細な操作精度を向上させた。
- 時空間認識を組み込んだ視覚運動拡散ポリシー学習VLA2025/7/1
動的ガウス世界モデルを用いて3D空間・4D時空間認識を拡散ポリシーに組み込み、シミュレーションと実機で成功率を向上させた視覚模倣学習手法。
- Human2LocoMan: 人間データの事前学習による多様な四足歩行ロボットのマニピュレーション学習マニピュレーション2025/6/1
人間と四足ロボットLocoManのデータを統合した遠隔操作・データ収集パイプラインとモジュール型アーキテクチャを構築し、人間データでの事前学習により実世界タスクの成功率を大幅に向上させた。
- LocoTouch:触覚センシングによる動的四足歩行運搬の学習触覚2025/5/1
四足ロボットの背中全体を覆う高密度触覚センサと高忠実度シミュレーションを組み合わせ、固定されていない円筒物体を長距離運搬する触覚対応歩容ポリシーを学習させ、実機へゼロショット転移した。
- FlowDreamer: フローベースの動作表現を用いたロボットマニピュレーションのためのRGB-Dワールドモデルワールドモデル2025/5/1
3Dシーンフローを明示的な動作表現として用い、U-Netと拡散モデルを組み合わせてロボット操作のためのRGB-Dワールドモデルを構築し、映像予測と視覚計画タスクで性能を向上させた。
- EMOS: 身体性を考慮した異種マルチロボットOSとLLMエージェント群制御2024/10/1
異種ロボット群がURDFから自身の身体能力を理解し、LLMエージェントが協調して操作・知覚・ナビゲーション・物体再配置を行うフレームワークとベンチマークを提案。
- Guardians as You Fall: Active Mode Transition for Safe Falling2023/10/1
- Learning Robust, Agile, Natural Legged Locomotion Skills in the Wild2023/4/1
- Sound Adversarial Audio-Visual Navigation2022/2/1
- Elastic Tactile Simulation Towards Tactile-Visual Perception2021/8/1
- Elastic Interaction of Particles for Robotic Tactile Simulation2020/11/1