Liang Lin
Sun Yat-sen University
収録論文 46本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LexiconVLA: 未知タスク向けの再利用可能な原子行動コードブックの学習VLA2026/9/29
視覚言語行動モデルが未知タスクで繰り返し現れる動作を再利用できるよう、原子行動をコードブック化して検索・適用する手法を提案し、未知タスクの成功率を向上させた。
- 視界を取り戻せ:ロボットマニピュレーションにおける遮蔽回復のための物理的アクティブビジョンベンチマークマニピュレーション2026/9/29
両腕ロボットの遮蔽回復を評価するベンチマークBAVO-Benchを提案し、未来予測を活用したアクティブビジョン方策A-FARで遮蔽への頑健性を向上させた。
- CometVLA: 身体性データピラミッドの共学習による物理理解の獲得VLA2026/8/31
ロボット操作タスクにおける物理常識の欠如を補うため、身体性に整合した物理VQAデータとベンチマークを構築し、VLAモデルを共学習させる手法を提案。実世界とシミュレーションで性能向上を確認した。
- Dream2Reward: 正のデモンストレーションからの遷移整合報酬モデルによるロボット操作マニピュレーション2026/8/19
成功デモから遷移レベルの潜在変位を予測し、観測された動作との整合性で密な報酬を生成する手法を提案。失敗アノテーション不要で報酬ハッキングを軽減し、実ロボット操作を含む下流性能を向上させる。
- WorldSimProbe: 身体的操作のための行動条件付きワールドモデルにおけるシミュレータ忠実度の診断シミュレーション評価2026/8/1
行動条件付きワールドモデル(ACWM)が物理シミュレータとして忠実に機能するかを検証するための評価手法「WorldSimProbe」を提案し、複数のベンチマークで既存モデルの欠陥を明らかにした。
- CrossTracer: VLAモデルの推論とトレース残差適応によるクロスエンボディメントナビゲーションナビゲーション2026/8/1
ロボットの種類に応じた移動制約を考慮したナビゲーション経路を生成するため、VLAモデルと適応的残差補正を組み合わせた階層的フレームワークを提案した。
- PhyAgentOS: 認知計画と物理実行を分離した自己進化型身体化エージェントOS身体化エージェント/OS2026/7/1
身体化エージェント向けに、セッション単位のスケジューリング、検証、記憶、安全をOSサービスとして提供する実行基盤を提案。状態をファイルとして扱うことで認知と物理実行を分離し、検証済み結果を知識として蓄積する自己進化ループを実現した。
- 視覚と言語によるナビゲーションのためのオン・オフ方策統合学習ナビゲーション2026/7/1
視覚と言語によるナビゲーション(VLN)において、模倣学習と強化学習を統合した3段階トレーニング手法JOP-VLNを提案し、ベンチマークで最高性能を達成した。
- Bridge-WA: ロボット行動のための世界の変化箇所と変化方法の予測VLA2026/7/1
ロボット操作のための軽量な世界行動モデルを提案し、将来の変化を教師モデルから蒸留した3つの事前知識で行動生成を条件付け、外乱に強い汎化を実現した。
- JoyAI-Sim: 具現化データピラミッドのためのシミュレーション対応相互変換ツールチェーンシミュレーション2026/6/1
実ロボットのデータ収集と評価の限界を補うため、シミュレーションを介してロボットと人間のデータを相互変換するツールチェーンを提案し、評価とデータ生成のスケーラビリティを向上させる。
- PACE: 位相を考慮したロボットポリシーのチャンク実行ロボットポリシー実行2026/6/1
アクションチャンキングを用いるロボットポリシーにおいて、予測されたチャンク内の速度プロファイルから低速度の遷移点を検出し、その点を再計画境界として実行ホライゾンをオンラインで選択する訓練不要の実行手法PACEを提案した。シミュレーションと実機で成功率を向上させた。
- 文脈内モデル予測生成:言語モデルから物理へのオープンボキャブラリ動作合成動作合成2026/6/1
テキスト記述から人間の動作を合成する際に、言語モデルの意味理解と物理シミュレーションの現実性を統合したフレームワークICMPGを提案し、オープンボキャブラリの指示に対して物理的に妥当な動作を生成する。
- NavIsaacLab: 並列ロボット学習による現実的な群衆生成と人間を考慮したナビゲーションのベンチマーキングナビゲーション2026/6/1
物理ベースで写実的なシミュレーション環境を提供し、データ駆動の歩行者モデルを用いて人間らしい群衆を生成することで、人間を考慮したナビゲーションポリシーの訓練と評価を可能にするフレームワークを提案した。
- RePO-VLA: 回復駆動型ポリシー最適化による視覚言語行動モデルVLA2026/5/1
成功軌跡のみの模倣学習では実行時のずれに対処できないため、失敗軌跡を活用して回復行動を学習するフレームワークを提案。成功・回復・失敗の軌跡に役割を割り当て、価値関数で進捗を評価し、ポリシーを改善する。
- SkiP: ロボット操作の効率化のためのスキップと精密化のタイミングマニピュレーション2026/5/1
模倣学習のポリシーが毎ステップ予測するのをやめ、動作が単調な区間はスキップし、接触や把持などの重要区間だけを高解像度で予測する新しい手法を提案。動作の複雑さを自動検出して区間を分割し、実行ステップを15〜40%削減しつつ成功率を維持・向上させる。
- RoVLA: ロバストな視覚言語行動モデルのための多重整合性制約VLA2026/5/1
視覚言語行動モデルのロバスト性を高めるため、指示意味・軌道進化・観測摂動の3つの変換に対する整合性制約を導入したRoVLAを提案。
- 多様性を考慮したレッドチーミングによる視覚言語行動モデルの言語的脆弱性の解明VLA/ロバスト性/レッドチーミング2026/4/1
ロボット操作のための視覚言語行動モデル(VLA)の言語的変化に対する頑健性を評価するため、多様な敵対的指示を生成するフレームワークDAERTを提案し、既存手法より多様で効果的な失敗パターンを発見した。
- JoyAI-RA 0.1: ロボット自律性のための基盤モデルVLA2026/4/1
オープンワールドでのロボット操作の汎化を目指し、ウェブデータ、人間の操作動画、シミュレーション、実ロボットデータを統合したVLA基盤モデルJoyAI-RAを提案。実世界とシミュレーションで最先端性能を達成した。
- 参照認識型ビジュモータポリシー学習による閉ループ操作操作2026/4/1
人間や高次プランナーからの疎な参照点を即時統合し、予期せぬ状況に適応できる閉ループ操作フレームワークReVを提案。拡散ヘッドの結合と軌道誘導戦略により、専門家デモのみで学習しつつ動的な軌道再計画を実現。
- ロボット操作は視覚から幾何への写像である:言語・ビデオモデルを超えた視覚幾何バックボーンマニピュレーション2026/4/1
ロボット操作を視覚から3次元幾何への写像と捉え、言語やビデオのバックボーンではなく事前学習済み3次元表現を用いたVGAモデルを提案し、シミュレーションと実機で優れた性能を示した。
- EgoLive: 実世界の人間タスクから得た大規模エゴセントリックデータセットデータセット2026/4/1
ロボット操作学習のための大規模で高品質なエゴセントリックデータセットEgoLiveを構築し、実世界の非制約環境での人間の作業データを収集・公開した。
- TAG: 物体中心推論のためのターゲット非依存ガイダンスによるVLAポリシーの安定化VLA2026/3/1
VLAポリシーが散らかった環境で誤った物体や位置を掴む問題を、物体を消した観察との差分を利用した推論時ガイダンスで改善する手法を提案。
- 事前学習済みビデオモデルから物理を学ぶ:ロボット操作のためのマルチモーダル連続・逐次世界相互作用モデル操作2026/3/1
ロボットデータ不足を補うため、事前学習済みビデオ生成モデルを物理シミュレータとして活用し、ビデオと行動を共通の物理トークンで表現することで、操作タスクを解く枠組みPhysGenを提案した。
- AtomicVLA: ロボットにおける原子スキル学習の可能性を解き放つVLA/操作/継続学習2026/3/1
長期的・多段階のロボット操作タスクを扱うため、タスク計画・原子スキル抽象化・細粒度アクションを統合的に生成するフレームワークAtomicVLAを提案。スキル誘導型Mixture-of-Expertsによりスケーラブルな原子スキルライブラリを構築し、継続学習も可能にした。
- OOWM: オブジェクト指向プログラムによる世界モデリングで身体性推論と計画を構造化VLA2026/2/25
LLMの身体性タスク推論を、UMLのクラス図とアクティビティ図を用いたオブジェクト指向の世界モデルとして明示的に構造化し、SFTとGRPOで訓練する枠組みを提案。
- DDP-WM: 効率的なワールドモデルのための分離型ダイナミクス予測ワールドモデル2026/2/1
観測シーンの潜在状態変化を、物理相互作用による疎な主要ダイナミクスと背景更新に分離して予測するワールドモデルを提案し、推論を約9倍高速化しつつ操作タスクの成功率を向上させた。
- RADAR: 実世界ダイナミクス・空間物理知能・自律評価による視覚言語行動モデルの汎化ベンチマークVLA2026/2/1
VLAモデルの実世界汎化を評価するため、物理ダイナミクス・空間推論タスク・3D指標による完全自律評価を統合したベンチマークRADARを提案し、既存モデルを監査した。
- 視覚言語行動モデルのための安定した言語ガイダンスVLA2026/1/1
VLAモデルが言語の言い回しの変化に弱い「モダリティ崩壊」を解決するため、意味意図と視覚的アフォーダンスを分離する確率的フレームワークRSSを提案し、敵対的な言語摂動下でも頑健な操作性能を実現した。
- AdaMorph: 身体性適応型Transformerによる統合モーションリターゲティングモーションリターゲティング2026/1/1
人間の動作を多様なロボット形態へ変換する際、単一モデルで対応できる統合的なニューラルリターゲティング手法を提案。身体性制約に応じて特徴を動的に調整し、12種の人型ロボットでゼロショット汎化を実証した。
- VLAモデルは思われているよりずっと汎化する:物理・空間モデリングの再検討VLA2025/12/1
VLAモデルの視点変化への脆弱性は空間モデリングのずれが主因だと示し、4Kパラメータの特徴トークン変調で視点精度を48.5%から87.1%へ改善、低ランク適応で90.8%を達成した。
- GraspView: 乱雑環境におけるロボット把持のための能動的知覚スコアリングと最適視点最適化マニピュレーション2025/11/1
RGB画像のみを用いて、乱雑環境での把持を実現するパイプラインを提案。多視点再構成と能動的視点選択により、透明物体や近距離でも高精度な把持を可能にする。
- E0: Tweedie離散拡散によるVLAモデルの汎化性と細粒度制御の向上VLA2025/11/1
量子化された行動トークン上でTweedie離散拡散を行うVLAフレームワークE0を提案し、視点摂動拡張と合わせて多様な環境での汎化と細かい制御を実現した。
- RoVer: 視覚-言語-行動モデルのためのテスト時検証器としてのロボット報酬モデルVLA2025/10/1
VLAモデルの推論時にロボット過程報酬モデルを検証器として使い、候補行動を生成・評価・選択することで、追加学習なしに性能を向上させるフレームワークを提案。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- 見て行動することを学ぶ:ロボットマニピュレーションのためのタスク認識型仮想視点探索VLA2025/8/1
再構成したシーンからタスクに適した仮想カメラ視点を選んで観測を再描画し、タスク特化型のMixture-of-Experts視覚エンコーダと組み合わせることで、遮蔽や視覚的分布シフトに頑健な多タスクロボット操作を実現した。
- AutoLayout: 低速・高速協調推論による閉ループレイアウト合成シーン生成/レイアウト合成2025/7/1
低速な推論と高速な生成を組み合わせた二重システムと自己検証ループにより、物理的に整合し意味的にも妥当な物体配置レイアウトを自動生成する手法を提案。
- RoboPearls: ロボットマニピュレーションのための編集可能なビデオシミュレーションsim2real2025/6/1
3Dガウススプラッティングを用いて実演ビデオからフォトリアルなシミュレーションを構築し、LLMで自動化された編集操作を可能にするロボットマニピュレーション向けフレームワークを提案。
- RoBridge:汎用ロボット操作のための認知と実行を橋渡しする階層型アーキテクチャマニピュレーション2025/5/1
大規模視覚言語モデルによる高レベル認知プランナと強化学習による汎用身体エージェントを、不変操作表現を介して階層的に統合し、認知と実行のギャップを埋めるロボット操作手法を提案。
- InfiniteWorld: 汎用視覚言語ロボットインタラクションのための統合スケーラブルシミュレーションフレームワークsim2real2024/12/1
Nvidia Isaac Sim上に構築された、汎用視覚言語ロボットインタラクション向けの統合スケーラブルなシミュレータを提案し、3Dアセット構築やReal2Sim、自動注釈などの機能と4つの新しいベンチマークを提供する。
- すべてのロボットを一つに:多用途な汎用身体性エージェントのための新標準と統合データセットデータセット2024/8/1
実世界とシミュレーションのデータを統合した新標準ARIOを提案し、約300万エピソード・32万タスクからなる大規模データセットを構築した。
- サイバー空間と物理世界の融合:Embodied AIに関する包括的サーベイEmbodied AI2024/7/1
Embodied AIの最新動向を、ロボット・シミュレータ、知覚・相互作用・エージェント・sim-to-realの4研究領域、マルチモーダル大規模モデルの活用まで網羅的に整理したサーベイ論文。
- 摂動を考慮した対照学習による逸脱に頑健なエージェントナビゲーションVLA2024/3/1
視覚と言語によるナビゲーション(VLN)エージェントが、障害物や人間の妨害などによる経路逸脱に対して頑健になるよう、経路摂動と対照学習を組み合わせた学習パラダイムPROPERを提案した。
- Reward-Adaptive Reinforcement Learning: Dynamic Policy Gradient Optimization for Bipedal Locomotion2021/7/1
- Continuous Transition: Improving Sample Efficiency for Continuous Control Problems via MixUp2020/11/1
- NADPEx: An on-policy temporally consistent exploration method for deep reinforcement learning2018/12/1
- Neural Task Planning with And-Or Graph Representations2018/8/1