Linxi "Jim" Fan
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ASENA: 自己進化型エージェントによる身体性ナビゲーションナビゲーション2026/9/30
コーディングエージェントがプログラムを書いて実行・修正・経験を蓄積しながらロボットをナビゲーションさせるシステムを提案し、4Bの単眼ナビゲーション方策と組み合わせてR2RやRxRで高性能を達成した。
- RoboTTT: ロボットポリシーのためのコンテキストスケーリングVLA2026/7/1
ロボットポリシーの視覚運動コンテキストを8Kタイムステップまで拡張し、推論遅延を増やさずに、人間のビデオからのワンショット模倣や長期的タスクの性能向上を実現する手法を提案。
- GaP: 変動的オートメーションタスクのためのグラフとしてのポリシーを用いたマルチエージェント自己学習ハーネスタスク計画2026/7/1
ロボットの信頼性を高めるため、エージェント型コーディングと解釈可能なロボットプログラミングを組み合わせ、タスクをグラフ構造で表現して自己学習する手法を提案した。
- ASPIRE: ロボットのためのエージェント的スキル発見スキル発見/継続学習2026/7/1
ロボット制御プログラムを自律的に作成・改善し、再利用可能なスキルライブラリを構築する継続学習システムASPIREを提案。シミュレーションと実世界で高い性能とゼロショット汎化を示した。
- 視覚運動制御のための対比的行動-画像事前学習視覚エンコーダ/事前学習/模倣学習2026/6/15
大規模な人間の第一人称ビデオから手のキーポイントを行動の代理として抽出し、対比学習でロボットの視覚エンコーダを事前学習する手法を提案。実機の器用操作タスクで既存手法を30%以上上回る性能を達成した。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- CaP-X: ロボットマニピュレーションのためのコーディングエージェントのベンチマークと改善フレームワークマニピュレーション2026/3/1
コードを方策として使うエージェントを体系的に評価する環境CaP-GymとベンチマークCaP-Benchを構築し、テスト時計算の拡張で人間レベルの信頼性を達成する手法を提案した。
- 世界行動モデルはゼロショット方策であるVLA2026/2/1
動画拡散モデルを基盤に未来の世界状態と行動を予測するWorld Action Model「DreamZero」を提案し、実機でVLAを上回る汎化性能と7Hzのリアルタイム閉ループ制御を実現した。
- DreamDojo: 大規模人間動画から学ぶ汎用ロボット世界モデル世界モデル2026/2/1
44,000時間の一人称視点人間動画から汎用的なロボット世界モデルを学習し、連続潜在行動を代理ラベルとして活用することで、巧みな操作の物理理解と精密な行動制御を実現した研究。
- ヒューマノイドのピクセル入力から行動へのポリシー転移におけるSim-to-Realの扉を開くsim2real2025/12/1
GPU加速のフォトリアルシミュレーションと教示者-生徒-ブートストラップ学習を用い、RGB画像のみからヒューマノイドが多様な扉を開けるロコマニピュレーションポリシーをシミュレーションだけで学習し、実機でゼロショット転移を実現した。
- CHIP: 後知恵摂動によるヒューマノイドの適応的コンプライアンス制御マニピュレーション2025/12/1
後知恵摂動を用いて、動的動作の追従性を保ちながらエンドエフェクタの硬さを調整可能にするプラグアンドプレイモジュールCHIPを提案し、力強いマニピュレーションタスクを実現した。
- Isaac Lab:マルチモーダルロボット学習のためのGPU加速シミュレーションフレームワークsim2real2025/11/1
GPU並列物理演算とフォトリアル描画を統合し、強化学習・模倣学習を大規模に実行できるロボット学習用シミュレーションプラットフォームを提案。
- 残差強化学習によるデータ生成で自己改善する視覚言語行動モデルVLA2025/11/1
VLAモデルの失敗領域を残差RLで探索し、展開分布に沿った軌道を収集・蒸留することで、追加の人間デモなしに性能を自己改善させるフレームワークPLDを提案。
- SONIC: 自然なヒューマノイド全身制御のための運動追跡の超大規模化ヒューマノイド制御2025/11/1
運動追跡をスケーラブルなタスクと位置づけ、モデル容量・データ・計算量を大規模化することで、自然で堅牢な全身運動が可能な汎用ヒューマノイド制御器を構築した研究。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
- ASAP: シミュレーションと実世界物理の整合による俊敏なヒューマノイド全身スキルの学習sim2real2025/2/1
シミュレーションと実世界のダイナミクス差を補正する残差行動モデルを実機データから学習し、事前学習済みの運動追従方策を微調整することで、ヒューマノイドの俊敏な全身動作を実現する二段階フレームワークを提案した。
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Cross-Episodic Curriculum for Transformer Agents2023/10/1