Xin Li
Texas A&M University
収録論文 50本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- S4VY: フィードフォワード4D視覚幾何におけるセグメントエニシング4Dセグメンテーション2026/9/29
RGB観測からフィードフォワードな4D視覚幾何特徴を抽出し、時空間クエリデコーダで永続的な4Dインスタンスマスクを生成するセグメンテーションモデルを提案。言語指示に基づく4Dグラウンディングも可能。
- ForeTac-VLA: 接触の多いロボットマニピュレーションのための触覚予測に基づく視覚-言語-行動モデルVLA2026/9/17
未来の触覚状態を予測して行動生成を導く触覚・視覚・言語融合モデルを提案し、接触の多い実世界タスクで高い成功率を達成した。
- EMERGE-Policy: ロボットの心は単一ポリシーを超えて出現するVLA2026/8/30
複数の専門エージェントが協調して知覚・推論・検証・記憶を行うグラフ構造のエージェントフレームワークを提案し、追加のファインチューニングなしでベンチマークと実ロボット実験で高い性能を達成した。
- RynnValue: 時間的距離によるロボット価値基盤モデルのスケーリング価値基盤モデル2026/8/1
ロボット操作のための価値基盤モデルRynnValueを提案。時間的距離を報酬ラベルとして用いることで、大規模データから好みラベルなしで学習し、実世界の成功率を向上させた。
- RynnWorld-Teleop: デジタル遠隔操作のための行動条件付きワールドモデルデータ生成2026/7/1
物理的な遠隔操作に代わり、生成ワールドモデルを用いてロボット中心の映像を合成し、実機不要で模倣学習用の軌道データを生成するデジタル遠隔操作パラダイムを提案した。
- RynnBrain 1.1:より高機能で汎用的な具現化基盤モデルを目指してVLA/基盤モデル2026/7/1
RynnBrain 1.1は、2Bから122B-A10Bまでの規模を持つ具現化基盤モデル群で、接触点予測や3Dグラウンディングを導入し、ロボット操作に直接対応する表現と出力を実現。実機実験では、Qwenベースや汎用VLAを上回る性能を示した。
- VLA-Corrector: 適応アクションホライズンのための軽量検出・修正推論VLA/行動生成2026/7/1
VLA-Correctorは、アクションチャンク方式のVLAポリシーに軽量な視覚モニタとオンライン勾配ガイダンスを追加し、実行中のずれを検出して修正再計画を行うことで、閉ループ応答性を向上させる。
- ActFovea: 時空間的な視覚-行動整合性によるVLAポリシーの実行時保護VLA/安全制御2026/7/1
VLAポリシーを再学習せずに実行時の外乱を検出・緩和するプラグアンドプレイの保護フレームワークを提案。視覚と行動の整合性を監視し、回復不能な場合は安全に失敗させる。
- RynnWorld-4D: ロボット操作のための4D具現化ワールドモデルワールドモデル2026/7/1
RGB、深度、オプティカルフローを統合した4Dワールドモデルを提案し、将来のシーン変化を予測してロボット操作のポリシー学習を支援する。
- Goku: 命令ベース動画編集のための100万規模のユニバーサルデータセットとベンチマーク動画編集2026/6/29
複雑な編集指示に応えるため、200万ペアの大規模データセットと、マスク分岐と外観レンダリング分岐を分離したデュアルブランチモデルを構築し、新ベンチマークで性能を検証した論文。
- リー群埋め込みによるニューラルダイナミクスの計画:教師付き射影多様体学習を通じて制御/ロボティクス2026/5/24
リー群を多様体の対称性の内在表現として用い、勾配降下と計量射影に基づく学習アルゴリズムを開発し、一般のリー群上で学習可能かつ安定なダイナミクスを実現する。
- OmniLiDAR: マルチドメイン3D LiDAR生成のための統一拡散フレームワークLiDAR生成2026/5/1
異なるセンサー条件やプラットフォームにわたる8つのドメインでLiDARスキャンを生成する統一テキスト条件付き拡散モデルを提案し、ドメイン間の特徴シフトを扱う新しいトレーニング戦略と特徴変調を導入した。
- 非対称・連続動作を実現するスナッピングアクチュエータソフトロボティクス2026/2/1
偏心ドーム型のスナッピングアクチュエータを開発し、単一の圧力入力で4脚ロボットの波状歩行を実現した研究。
- Ori-Sense:ソフトロボティクス応用のための折り紙容量センシング触覚2026/2/1
逆Kresling折り紙構造を模した柔軟な容量センサを開発し、ねじり変形を容量変化に変換してソフトロボットの固有感覚フィードバックを可能にした。
- RynnBrain: オープンな身体性基盤モデルVLA2026/2/1
知覚・推論・計画を統合した時空間基盤モデルRynnBrainを提案し、2B/8B/30B-A3B MoEの3規模と下流タスク向け4変種を公開、20の身体性ベンチマークで既存モデルを大幅に上回った。
- 全身ロボット操作のための非同期Fast-Slow視覚言語行動ポリシーVLA2025/12/1
VLM推論と高速行動生成を非同期に分離し、潜在表現バッファと全身行動トークナイザで統合したVLAフレームワークを提案。3Bモデルで30Hzの全身行動生成を実現した。
- RynnVLA-002:視覚言語行動と世界モデルの統合VLA2025/11/1
視覚言語行動モデルと世界モデルを統合し、環境の物理を学習して行動生成を洗練させるフレームワークを提案。シミュレーションと実機で性能向上を実証。
- ガウススプラッティングによる実世界ゼロショットロボットマニピュレーション学習のための高忠実度シミュレーションデータ生成sim2real2025/10/1
実世界の多視点画像から3DGSとメッシュを組み合わせて物理的に操作可能な高忠実度シミュレーション環境を構築し、MLLMで物体の物理特性や関節構造を自動推定することで、シミュレーションのみで訓練した方策が実世界の多様なマニピュレーションタスクへゼロショット転移できることを示した。
- RynnVLA-001:人間のデモンストレーションを活用したロボットマニピュレーションの改善VLA2025/9/1
人間の操作動画で大規模に事前学習した視覚-言語-行動モデルを提案し、2段階の事前学習とActionVAEで行動予測を効率化してロボット操作性能を向上させた。
- Veila: 単眼RGB画像からのパノラマLiDAR生成LiDAR生成2025/8/1
単眼RGB画像を条件として、拡散モデルによりパノラマLiDAR点群を生成するフレームワークを提案。信頼度に基づく条件付けと幾何学的整合性により、RGBとLiDARのモダリティギャップを克服する。
- 人間らしい事前知識を活用したアフォーダンス認識型ロボット巧み把持マニピュレーション2025/8/1
人間の手の動きを模倣した事前学習と、機能的に不適切な接触領域を避けるアフォーダンス認識モジュールを組み合わせ、自然で汎用的な巧み把持を実現するフレームワークAffordDexを提案。
- RynnEC:MLLMを身体性認知の世界へVLA2025/8/1
汎用視覚言語モデルに領域エンコーダとマスクデコーダを組み込み、領域中心の動画理解で物体属性・セグメンテーション・空間推論を高精度化した身体性認知向けMLLMを提案。
- La La LiDAR: LiDARデータからの大規模レイアウト生成LiDAR生成2025/8/1
LiDARシーンの前景物体配置と空間関係を制御可能にする、シーングラフ誘導の生成フレームワークを提案し、大規模データセットと評価指標を導入した。
- WorldVLA:自己回帰型行動世界モデルへの挑戦VLA2025/6/1
視覚・言語・行動モデルと世界モデルを統合し、行動と画像の相互生成を通じて行動生成と将来画像予測を同時に改善する自己回帰型フレームワークを提案。
- メタオリガミ:非線形インフレータブルソフトアクチュエータのためのモノリシックメタオリガミソフトロボティクス2025/3/1
3Dプリント可能なメタマテリアルと折り紙を組み合わせ、非線形な空気圧応答を示すモノリシックなソフトアクチュエータを開発し、その設計ツールと動作を実証した。
- ECBench:マルチモーダル基盤モデルは自己中心的世界を理解できるか?包括的身体認知ベンチマークVLA2025/1/1
ロボットの自己認知や動的シーン知覚、幻覚といった身体認知能力を体系的に評価するため、30次元の認知軸を持つベンチマークECBenchと評価システムECEvaluを提案し、各種LVLMを評価した。
- UniAff:視覚言語モデルによる道具使用と関節物体操作のためのアフォーダンス統合表現マニピュレーション2024/9/1
道具と関節物体の操作を統一的に扱うため、アフォーダンス認識と3D運動制約の推論を視覚言語モデルで行う手法UniAffを提案し、シミュレーションと実世界で汎化性能を向上させた。
- SKT: 状態認識キーポイント軌道と視覚言語モデルを統合したロボット衣類操作衣類操作/VLA2024/9/1
視覚言語モデル(VLM)を用いて、多様な衣類の状態を単一モデルで認識しキーポイントを予測することで、ロボットによる衣類操作を汎用的に実現する手法を提案した。大規模合成データで学習し、キーポイント検出精度とタスク成功率を向上させた。
- ループクロージャを活用した堅牢なガウシアンスプラッティングSLAMSLAM2024/9/1
回転する複数のRGB-Dカメラ入力に対応したガウシアンスプラッティングSLAMを提案し、ループクロージャで追跡ドリフトを抑えて高精度な自己位置推定と写実的レンダリングを実現した。
- DriveArena: 自動運転のための閉ループ生成シミュレーションプラットフォーム自動運転シミュレーション2024/8/1
生成モデルで実写のような画像を作り出し、交通シミュレータと組み合わせて自動運転エージェントを閉ループで評価できる高忠実度シミュレーションシステムを構築した。
- スキル認識型相互情報量最適化による強化学習の汎化メタ強化学習2024/6/1
メタ強化学習において、スキルを区別する相互情報量目的関数SaMIとその推定器SaNCEを提案し、未見タスクへのゼロショット汎化とサンプル効率を改善した。
- 自己組織化マップとDubins経路生成による複数AUVの運動学的タスク割り当て群制御2024/5/1
複数AUVの運動学的制約下でのタスク割り当て問題に対し、改良SOMニューラルネットとDubins経路生成を組み合わせ、経路計画が失敗する場合に重みを変更して再割り当てする手法を提案した。
- 継続的に学習・適応・改善する:自動運転のための二重プロセスアプローチ自動運転2024/5/1
人間の認知プロセスに着想を得て、注意選択と二重プロセス意思決定(分析的推論とヒューリスティック処理)を組み合わせ、反省機構と記憶バンクで自己改善する自動運転フレームワークLeapADを提案。CARLAでの閉ループ評価でカメラ入力のみの手法を上回り、ラベルデータも大幅に削減できることを示した。
- ユニバーサルLiDARセグメンテーションに向けたマルチスペースアラインメントLiDARセグメンテーション2024/5/1
異なるセンサやシーンで収集された大規模運転データセットを統合し、データ・特徴・ラベル空間でのアラインメントを行うことで、単一パラメータでマルチタスク・マルチデータセット・マルチモダリティのLiDARセグメンテーションを実現するM3Netを提案。
- HDA-LVIO: ハイブリッドデータ関連付けによる都市環境向け高精度LiDAR-視覚-慣性オドメトリ自己位置推定2024/3/1
LiDAR-慣性子系と視覚-慣性子系を統合し、特徴点と平面投影点をハイブリッドに関連付けて再投影誤差を最小化することで、都市環境での自己位置推定精度を高める手法を提案した。
- Towards Knowledge-driven Autonomous Driving2023/12/1
- On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving2023/11/1
- DiLu: A Knowledge-Driven Approach to Autonomous Driving with Large Language Models2023/9/1
- Drive Like a Human: Rethinking Autonomous Driving with Large Language Models2023/7/1
- Robo3D: Towards Robust and Reliable 3D Perception against Corruptions2023/3/1
- Agent-Controller Representations: Principled Offline RL with Rich Exogenous Information2022/11/1
- PVI-DSO: Leveraging Planar Regularities for Direct Sparse Visual-Inertial Odometry2022/4/1
- Underwater Soft Robotic Hand with Multi-Source Coupling Bio-Inspired Soft Palm and Six Fingers Driven by Water Hydraulic2021/6/1
- Co-Planar Parametrization for Stereo-SLAM and Visual-Inertial Odometry2020/9/1
- Robust Trajectory Forecasting for Multiple Intelligent Agents in Dynamic Scene2020/5/1
- Leveraging Planar Regularities for Point Line Visual-Inertial Odometry2020/4/1
- GRIP++: Enhanced Graph-based Interaction-aware Trajectory Prediction for Autonomous Driving2019/7/1
- HE-SLAM: a Stereo SLAM System Based on Histogram Equalization and ORB Features2019/2/1
- Design of an Autonomous Precision Pollination Robot2018/8/1
- Context Reasoning in Underwater Robots Using MEBN2017/6/1