Xin Jin
収録論文 21本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FAN: 視覚-言語-行動モデルの継続適応のための先見的行動正規化VLA2026/9/18
VLAモデルの継続学習において、行動の正規化統計を較正セットから一度だけ推定して固定するFANを提案し、単腕・両腕操作の実タスクで高い性能と安定性を示した。
- GEM-Occ: 視覚幾何学的証拠から身体化された意味的占有記憶へ意味的占有マッピング2026/7/1
屋内エージェントのための階層的意味的占有マッピングを実現するため、新しいベンチマークHIOccと、局所的な視覚幾何学予測を一時的な証拠として扱い、永続的な階層記憶に融合するGEM-Occフレームワークを提案した。
- WorldScape Policy 2.0:推論強化メモリによる操縦可能なワールドアクションモデリングの実現操作2026/7/1
ロボット操作のためのワールドアクションモデルを拡張し、長期・短期メモリと推論強化により、タスク進行の追跡と細かい言語-映像-行動の対応付けを可能にした。
- LIBERO-Safety: 視覚言語行動モデルにおける物理的・意味的安全性の包括的ベンチマークVLA/安全性評価2026/6/1
VLAモデルの安全性を評価するため、パラメトリックな安全ベンチマークと大規模データセットを構築し、8つのVLAモデルと2つの基盤モデルの系統的評価を行った。
- DeformGen: 変形操作ポリシー学習のための動力学に基づくトポロジー拡張変形操作2026/6/1
変形物体の操作学習において、物理的に妥当な状態と軌道を生成する動力学ベースのデータ拡張フレームワークを提案した。
- ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?VLA2026/6/1
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。
- GTA: 幾何学から外観へのビデオ拡散による画像から3Dワールド生成の高度化3D生成2026/5/13
単一画像から3Dシーンを生成する際、まず粗い幾何構造を生成し、その後に外観を生成する二段階のビデオ拡散モデルを提案し、構造の忠実性と視点間の一貫性を向上させた。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- 前方・逆動力学の事前学習分離によるロボット学習の非絡み合い化VLA2026/4/1
視覚と言語・行動の予測を分離し、前方動力学モデルと逆動力学モデルを別々に事前学習してから統合するフレームワークDeFIを提案し、CALVINやSimplerEnvなどのベンチマークで最先端性能を達成した。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- VLA-JEPA:潜在世界モデルで視覚-言語-行動モデルを強化VLA2026/2/1
未来のフレームを教師信号に使い、現在の観測だけから潜在空間で状態予測を学習するJEPA型事前学習で、VLAポリシーの汎化とロバスト性を高めた。
- ReWorld: 身体性ワールドモデルのための多次元報酬モデリングワールドモデル2026/1/1
ロボット学習向け動画ベースのワールドモデルを、物理的忠実性・タスク論理・身体性・視覚品質の多次元報酬で強化学習により人間の選好に整合させるフレームワークを提案。
- PvP: 固有感覚と特権情報の対照表現によるデータ効率の良いヒューマノイドロボット学習全身制御2025/12/1
固有感覚状態と特権状態の相補性を活かした対照学習で、ヒューマノイドの全身制御を少ないデータで効率的に学習する手法を提案し、評価用フレームワークも構築した。
- DreamVLA: 包括的な世界知識を夢見る視覚-言語-行動モデルVLA2025/7/1
動的・空間・意味情報を統合した世界知識予測により逆動力学モデリングを行い、知覚-予測-行動ループを実現する新しいVLAフレームワークを提案。
- 行動基盤モデルサーベイ:ヒューマノイドロボットの次世代全身制御システム全身制御2025/6/1
ヒューマノイドの全身制御に向けた行動基盤モデル(BFM)の研究動向を、事前学習パイプラインや応用、課題、今後の展望まで体系的にまとめたサーベイ論文。
- 過去と未来を橋渡しする:履歴予測と計画を用いたEnd-to-End自動運転自動運転2025/3/1
自動運転のEnd-to-Endモデルにおいて、過去の予測・計画クエリを未来の各タイムステップに対応付けて再利用するBridgeADを提案し、nuScenesで最先端性能を達成した。
- SoFar: 言語に基づく物体の向きが空間推論と物体操作を橋渡しするVLA2025/2/1
自然言語で物体の向きを定義する「意味的向き」を導入し、大規模データセットとゼロショット予測モデルを構築して、6自由度の空間推論とロボット動作生成を可能にした。
- MSSF: 自律走行における3D物体検出のためのマルチステージサンプリングを用いた4Dレーダーとカメラの融合フレームワークセンサーフュージョン2024/11/1
4Dミリ波レーダーとカメラを融合し、マルチステージサンプリングと意味誘導ヘッドで3D物体検出の精度を高める手法を提案した論文。
- ユーザー習慣に基づく車両ナビゲーションのためのパーソナライズ経路推薦経路推薦2024/9/1
ユーザーの過去のナビゲーション履歴データを用いて、経路の並べ替えスコアを学習し、個人に合わせた経路推薦を行うDCRモデルを提案した。
- Motion Planning and Control of A Morphing Quadrotor in Restricted Scenarios2023/12/1
- Trajectory Planning and Tracking of Hybrid Flying-Crawling Quadrotors2023/12/1