Yang Li
Renmin University of China
収録論文 68本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- テスト時適応型視覚言語ナビゲーションのためのクレジット誘導方策改善VLA2026/9/29
テスト時適応VLNにおいて、行動による観測遷移から符号付き意思決定クレジットを推定し、軽量な方策更新を提案・検証するCGPIを提案。
- RoboHarn-Evo: 階層的物理知識を進化させ自己改善するロボットマニピュレーションマニピュレーション2026/9/29
物理的な試行錯誤からタスク知識と行動知識を階層的に蓄積・修正し、基盤モデルを更新せずにロボット操作の成功率を高めるフレームワークを提案。
- すべての道はローマに通ず:流れ駆動型マルチアンカー探索によるオープン環境能動的3Dマッピング能動的マッピング2026/9/29
未知環境の3Dマッピングにおいて、条件付きフローマッチングで複数の探索アンカーを生成し、長期的な探索経路を頑健に計画する手法を提案。
- RoboRecover: 実行逸脱下におけるロボット方策の回復力ベンチマークベンチマーク2026/9/24
実行中の逸脱状態から元のタスクを回復する能力を評価するベンチマークを提案し、初期状態の性能が回復性能を決めないことを示した。
- HarnessPAI:物理AIのための進化するハーネスVLA2026/9/24
物理AI向けに、コードを実行可能で進化可能なインターフェースとして扱い、ロールアウト内では固定プログラムで実行し、ロールアウト間では実行フィードバックでプログラムを進化させるモデル・身体非依存のフレームワークを提案。
- FWBC-VLA: 接触を伴う移動操作のための力認識全身補償移動操作/VLA/力推定2026/9/3
車輪付き脚ロボットの接触を伴う移動操作において、力センサを使わずに接触力を推定し、その情報をVLAモデルに統合することで、タスクレベルの行動生成と低レベルの全身補償制御を橋渡しするフレームワークを提案した。
- RoboStriker: 自律型ヒューマノイドボクシングのための潜在空間戦略ゲーム強化学習/ヒューマノイド2026/8/17
ヒューマノイドボクシングを2プレイヤーの潜在空間ゼロサムマルコフゲームとして定式化し、戦略的探索と物理的実現性の矛盾を解決する階層的フレームワークを提案した。
- DF$^3$: デコーダ不要の特徴予測による自律航法の世界モデリング世界モデル/自律航法2026/8/3
ビデオから未来の状態を予測する世界モデルにおいて、デコーダを使わずに潜在空間内で特徴を予測し、直接タスク出力を得る新しいフレームワークを提案した。
- CoNav-UAV: スタッケルベルグ学習による協調的二重高度空中ナビゲーションナビゲーション2026/8/1
高高度と低高度の2台のUAVをスタッケルベルグゲームとして協調させ、視覚と言語のみで目標探索と接近を行う空中ナビゲーション手法を提案した。
- JEPA-WAM: 共同埋め込み世界モデリングによる視覚-言語-行動ポリシーの学習VLA/世界モデル2026/8/1
事前学習済みV-JEPA空間に基づく潜在世界モデルを構築し、遷移予測と行動生成を共有予測器で結合することで、効率的かつ高精度なロボット制御を実現した。
- 手動、ジョイスティック、または触覚制御?ロボット介入神経放射線処置におけるナビゲーション戦略のin vitro比較医療ロボティクス2026/7/1
ロボット介入神経放射線処置のためのコントローラインターフェースを比較し、触覚フィードバック付きデバイス模倣コントローラがジョイスティックより優れていることを示した。
- 未知環境・未知パートナー・規模変動に対応するマルチロボットのオープン適応型チーミング群制御2026/7/1
ロボットチームが未知の環境や仲間、チーム規模の変化に同時に適応する問題を定式化し、ハイパーグラフゲーム理論に基づく学習アルゴリズムHOLAを提案。実機実験で有効性を確認した。
- ループ型ワールドモデルワールドモデル2026/6/16
パラメータ共有のトランスフォーマーブロックを反復適用して潜在状態を精緻化する、初のループ型ワールドモデルを提案。従来比100倍のパラメータ効率と適応的計算量を実現し、反復的な潜在深度を新たなスケーリング軸として確立した。
- S$^2$-VLA: 長期的操作のための状態空間誘導型視覚言語行動モデルVLA/操作2026/6/1
長期的なロボット操作タスクで性能が劣化する問題を解決するため、タスクの進行状態を追跡し動的に特徴量を融合する適応的注意機構を導入したVLAモデルを提案した。
- 英語を超えて:視覚・言語・行動モデルにおける多言語ギャップの解明VLA2026/6/1
視覚・言語・行動モデルが英語以外の指示で性能が大幅に低下する多言語ギャップを初めて体系的に調査し、その原因を分析した。
- 密な身体化チェーン・オブ・ソート監視による視覚言語行動モデルの訓練VLA2026/6/1
ロボット間の転移を改善するため、視覚言語モデルに密な身体化チェーン・オブ・ソート(ECoT)監視を導入し、推論時にはECoT生成をスキップできるデュアルストリームアーキテクチャのVLAモデルZR-0を提案した。
- PhysForge: 物理に基づくインタラクティブな仮想世界向け3Dアセット生成3Dアセット生成2026/5/6
物理的に正しい3Dアセットを生成するための2段階フレームワークを提案。VLMが物理設計図を作成し、拡散モデルが形状と運動学パラメータを生成する。
- ピクセルからトークンへ:視覚言語行動モデルにおける潜在行動教師あり学習の体系的研究VLA2026/5/1
視覚言語行動モデル(VLA)の学習における潜在行動の教師あり手法を体系的に比較し、画像ベースと行動ベースの潜在行動がそれぞれ長期的推論と複雑な運動制御に有効であることを示した。
- ソフトグリッパを用いた紙状柔軟材料の把持戦略への環境制約の導入把持戦略2026/5/1
紙のような柔軟材料の把持を、環境制約を利用した戦略で系統的に研究し、把持力と成功率を評価するシステムを定義して実験的に検証した。
- 動作プリミティブからの幾何的組み立てによるスパース構成フローマッチング生成モデル2026/5/1
ロボットの動作軌跡を、再利用可能な動作プリミティブの構成として直接軌跡空間で生成するフローマッチング手法を提案した論文。
- ロボットによる机の整理:環境制約を活用した異種物体操作のためのマルチプリミティブ手法マニピュレーション2026/5/1
机の上にある剛体・変形物体を収集や積み重ねなどの目的に応じて整理するタスク指向フレームワークを提案し、環境制約を利用した複数の操作プリミティブとタスクプランナーを統合した。
- 検索が記憶になるとき:ロボット設計の試行錯誤を転移可能なスキルへ変換する進化ロボット設計/LLM2026/5/1
進化的ロボット設計の探索履歴を自然言語のスキルライブラリとして蓄積し、LLMエージェントがそれを参照して設計を改善する自己進化システムを提案した。
- EmbodiedHead: 会話エージェントのためのリアルタイム聴話アバターアバター生成2026/4/19
LLMと会話できるリアルタイムの音声駆動型アバターを生成するフレームワークを提案。単一ストリームの音声入力と状態制御により、聞き手と話し手の動作をシームレスに切り替え、高品質な映像を少数ステップで生成する。
- VTouch++: バイマニュアル操作のための視覚ベース触覚拡張を備えたマルチモーダルデータセットデータセット/触覚/バイマニュアル操作2026/4/1
両手操作の接触を伴うタスクを改善するため、視覚ベースの触覚センシングを用いた大規模マルチモーダルデータセットVTOUCHを構築し、その有効性を実験と実ロボット評価で示した。
- PEPA: 個性を持つ持続的自律型身体性エージェント自律エージェント2026/3/1
性格特性を内在的な目標生成の原理として用い、三層認知アーキテクチャにより四足歩行ロボットが外部指示なしに自律的に目標を生成・実行するフレームワークを提案。
- アクション草案と検証:視覚言語行動モデルのための自己検証フレームワークVLA2026/3/1
拡散アクション専門家が複数のアクション候補を生成し、VLMが一回のフォワードパスでスコアリングして最適なものを選択する自己検証フレームワークを提案。シミュレーションと実世界で成功率を向上させた。
- APPLV: 視覚言語行動モデルからの適応的プランナーパラメータ学習ナビゲーション2026/3/1
古典的プランナーのパラメータを視覚言語モデルから予測して自動調整し、高制約環境でのナビゲーション性能と汎化性を向上させる手法を提案した。
- AgentChemist: 化学認識と精密制御を統合したマルチエージェント実験ロボットプラットフォーム実験自動化2026/3/1
化学実験の自動化における長尾分布問題に対処するため、マルチエージェントロボットプラットフォームを提案。化学認識とフィードバック駆動制御を統合し、酸塩基滴定の検証で自律的な進行追跡と適応的な分注制御を実証した。
- ForceVLA2: 力認識によるハイブリッド力-位置制御で接触を伴う操作を実現VLA/操作2026/3/1
接触を伴う操作のための視覚言語行動モデルに、力認識とハイブリッド力-位置制御を導入し、成功率を大幅に向上させた。
- どんな家でもどんなタスクでも:抽象的ヒューマンタスクのためのスケーラブルな長期計画タスク計画2026/2/1
大規模家庭環境での曖昧な指示に対応するため、LLMで指示とシーングラフをPDDLサブゴールに変換し、記号推論で長期計画を生成する手法AHATを提案。中間推論の外部修正をGRPOに統合したTGPOで性能を向上。
- DemoBot:第三者視点の人間動画から器用な両手マニピュレーションを効率的に学習マニピュレーション2026/1/1
1本の注釈なしRGB-D動画から両腕多指ロボットの操作スキルを獲得する学習フレームワークを提案し、動きの事前分布と強化学習を組み合わせて長期的な両手組み立てタスクを実現した。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- 現実ギャップの解消:力ベースの巧みな把持と操作のためのゼロショットSim-to-Real展開sim2real2026/1/1
高密度触覚フィードバックと関節トルクセンシングを活用した強化学習フレームワークを構築し、シミュレーションのみで訓練した五指ハンドの制御方策を実機にゼロショット転移させ、把持力追従と物体の再配向を実現した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- 障害物属性を考慮したマルチモーダル分類ネットワーク誘導型4輪独立操舵自動駐車軌道計画軌道計画2025/12/1
視覚情報と車両状態を融合したマルチモーダル認識ネットワークでシーンを理解し、障害物を「通行不可・またぎ越し・乗り越え」に分類して4輪独立操舵車の駐車軌道を効率的に計画する手法を提案した。
- 共有自律によるエンドツーエンドの器用な腕・手VLAポリシー:自律ハンドVLAポリシーで拡張したVRテレオペレーションによる効率的なデータ収集VLA2025/11/1
VRテレオペレーションで腕を人間が操作し、手は自律VLAポリシーが触覚・視覚フィードバックで制御する共有自律フレームワークを提案し、効率的に高品質な腕・手協調のデモを収集してエンドツーエンドVLAポリシーを学習、多様な物体で90%の成功率を達成した。
- Audio-VLA: 接触音知覚を視覚-言語-行動モデルに統合したロボットマニピュレーションVLA2025/11/1
接触音を入力に加えたマルチモーダルVLAモデルを提案し、視覚のみの制約を克服。シミュレーションに衝突音生成を追加し、動的プロセス評価指標TCRを導入して実験的に有効性を示した。
- FastUMI-100K:大規模UMI形式データセットによるデータ駆動型ロボットマニピュレーションの進展マニピュレーション2025/10/1
モジュール型ハードウェアと軽量トラッキングを備えたFastUMIシステムで収集した10万件超の家庭内タスク実演データセットを構築し、多様な模倣学習アルゴリズムで高い成功率を示した。
- 異なるサイズ・形状・柔らかさの靴を梱包するためのセマンティックキーポイントに基づくロボットマニピュレーションフレームワークマニピュレーション2025/9/1
靴のペアを任意の初期状態から梱包するため、セマンティックキーポイントによる知覚、再配向プランナ、梱包プランナを統合したロボットフレームワークを提案し、実機実験で有効性を検証した。
- Chain-of-Action: ロボットマニピュレーションのための軌道自己回帰モデリングマニピュレーション2025/6/1
目標から逆算して行動系列を自己回帰的に生成する視覚運動ポリシーを提案し、RLBenchと実機タスクで最先端性能を達成した。
- VLM支援シャムフロー拡散による双腕協調マニピュレーションマニピュレーション2025/6/1
VLMと拡散モデルを組み合わせ、少数の人間の実演から双腕ロボットの協調動作を学習・汎化するフレームワークを提案。
- TacCompress: 巧みな手の多点触覚データ圧縮ベンチマーク触覚2025/5/1
巧みな手の把持における多点触覚信号を画像化し、可逆・非可逆圧縮コーデックで圧縮性能を評価するベンチマークを提案した。
- 円筒ボクセルに基づく全方位深度支援占有予測3D知覚2025/4/1
全方位深度推定を幾何学的事前情報として活用し、極座標に基づく円筒ボクセル表現で自動運転向けの3D占有予測を行う手法を提案。魚眼カメラ6台の仮想データセットも構築した。
- 到達可能集合に基づく強化学習とiLQRを組み合わせた軌道計画軌道計画2025/3/1
運転リスク場を考慮した到達可能集合を構築し、安全強化学習で初期軌道を生成後、制約付きiLQRで最適化する知的車両の軌道計画手法を提案。
- 人間のリスク選好に整合した安全強化学習による密集交通での高速道路合流安全強化学習/自動運転2025/3/1
ユーザのリスク選好を制約付きMDPの安全制約に組み込み、ファジィ制御で制約のコスト上限を調整し、MPCによる行動シールドで安全でない行動を除去する合流意思決定手法を提案した。
- AT-Drone: マルチドローン追跡における適応的チーミングのベンチマーク群制御2025/2/1
初対面の仲間と協調する「適応的チーミング」をマルチドローン追跡で訓練・評価する初のベンチマークを提案し、シミュレーションから実機への展開パイプラインと新アルゴリズム群を整備した。
- 超音波による時空間エンコードを用いたエンドツーエンド生成型オドメトリ・マッピングフレームワークSLAM2024/12/1
煙や粉塵など低視界環境でも使えるよう、超音波センサアレイの時空間情報を生成モデルで処理し、高密度点群と自己位置推定をエンドツーエンドで生成するSLAM手法を提案した。
- 汎用ロボットマニピュレーションポリシーの効果的なファインチューニング戦略マニピュレーション2024/10/1
汎用マニピュレーションポリシーのファインチューニングにおいて、行動空間やポリシーヘッド、監督信号、調整可能パラメータの選択が性能に与える影響を大規模実験で調査し、低データ領域での有効な設計指針を提示した。
- 教師なしデータを用いた教師-生徒学習による実環境向けリアルタイム全方位深度推定全方位深度推定2024/9/1
ラベルなし実データを教師モデルの疑似ラベルで学習させる教師-生徒戦略と軽量ネットワークにより、エッジ上でリアルタイムに全方位深度推定を行う手法と、魚眼カメラを用いたシステムを提案した。
- HOLA-Drone: ハイパーグラフ型オープンエンド学習によるゼロショット複数ドローン協調追跡群制御2024/9/1
ハイパーグラフ形式のゲームモデリングに基づき学習目標を継続的に適応させる手法を提案し、未見の複数ドローン仲間と協調して複数の逃走者を捕獲するゼロショット協調を実現した。
- SF-TIM: 地形想像と計測を組み合わせた四足ロボットの跳躍敏捷性を高める簡易フレームワーク歩行2024/8/1
地形の想像と計測を統合した単一ポリシーで、四足ロボットの盲歩行能力を保ちつつ高所やギャップを跳び越える敏捷性を向上させ、実機でゼロショット転移を実現した。
- オフライン強化学習のための適応的アドバンテージ誘導方策正則化オフライン強化学習2024/5/1
VAEと拡張挙動方策から高アドバンテージ行動を抽出し、OOD行動への保守性を保ちつつ方策改善を促すオフラインRL手法A2PRを提案。D4RLで最先端性能を達成。
- ClothPPO: 観測整合行動空間を持つロボット布操作のための近接方策最適化強化フレームワークマニピュレーション2024/5/1
布の展開タスクにおいて、観測に整合した大規模行動空間で事前学習モデルをPPOにより微調整するフレームワークを提案し、展開性能を向上させた。
- Realistic Safety-critical Scenarios Search for Autonomous Driving System via Behavior Tree2023/5/1
- Coordinated Control of Path Tracking and Yaw Stability for Distributed Drive Electric Vehicle Based on AMPC and DYC2023/4/1
- A reproducible approach to merging behavior analysis based on High Definition Map2023/3/1
- Delving into the Devils of Bird's-eye-view Perception: A Review, Evaluation and Recipe2022/9/1
- Level 2 Autonomous Driving on a Single Device: Diving into the Devils of Openpilot2022/6/1
- Homography Decomposition Networks for Planar Object Tracking2021/12/1
- Pareto-optimal lane-changing motion planning in mixed traffic2021/9/1
- Hierarchical automatic lane-changing motion planning: from self-optimum to local-optimum2021/8/1
- Exploration of lane-changing duration for heavy vehicles and passenger cars: a survival analysis approach2021/8/1
- FlowFusion: Dynamic Dense RGB-D SLAM Based on Optical Flow2020/3/1
- SuPer Deep: A Surgical Perception Framework for Robotic Tissue Manipulation using Deep Learning for Feature Extraction2020/3/1
- SuPer: A Surgical Perception Framework for Endoscopic Tissue Manipulation with Surgical Robotics2019/9/1
- From Natural to Artificial Camouflage: Components and Systems2018/9/1
- Distributed Camouflage for Swarm Robotics and Smart Materials2017/9/1
- Morphological and Embedded Computation in a Self-contained Soft Robotic Hand2016/5/1