Jiwen Lu
Tsinghua University
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GigaBrain-WBC-0.5:環境との相互作用に頑健な全身制御のための行動世界モデル全身制御2026/8/18
ヒューマノイドの全身運動追跡制御において、環境との接触を考慮した行動世界モデルを提案し、不適切なコマンドや外乱に対して頑健な制御を実現した。
- SkillMemo: 専門家ガイドによるスキル記憶フレームワークを用いた構成的手操作操作2026/8/1
長期的なデモンストレーションを潜在的な原子スキルに分解し、動的エピソード記憶バンクに統合することで、構成的一般化を向上させるフレームワークを提案。
- GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現VLA2026/7/1
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
- GigaWorld-1: ロボットポリシー評価のためのワールドモデル構築ロードマップワールドモデル2026/7/1
ロボットポリシーの評価を効率化するため、ワールドモデルの信頼性を体系的に研究し、ベンチマークWMBenchを構築して、7つのビデオワールドモデルと4つの行動表現を比較した。
- SM4RT: 4D再構成のための構造化モーション幾何学の学習4D再構成2026/7/1
単眼RGBビデオから、物体の剛体運動をSE(3)のモーションベースに分解して表現し、3D再構成と構造化された動きの知覚をエンドツーエンドで行うTransformerモデルを提案した。
- R2RDreamer: 空間的に汎化する2次元操作ポリシーのための3次元認識データ拡張操作学習2026/6/15
実デモから3D編集と2Dビデオ補完を組み合わせて、物体位置や視点が変わっても動作する操作ポリシーを学習するためのデータ拡張手法を提案した。
- iMaC: 動作と接触画像への変換による具現化ワールドモデルVLA2026/6/8
ロボット操作のための新しい制御パラダイムを提案し、画像をアクション表現として用いることで、従来のベクトルベースのアクションよりも表現力と汎化性を向上させる。
- IVGT: 暗黙的視覚幾何トランスフォーマーによるニューラルシーン表現3D再構成2026/5/1
カメラポーズが未知の多視点画像から、連続的で一貫した3D幾何と外観を暗黙的にモデル化する手法を提案。SDFと色を予測する軽量デコーダを用いて、任意の3D位置での空間クエリを可能にし、メッシュ再構成や新規視点合成など多様なタスクで高い性能を示した。
- AwareVLN: 自己認識による視覚言語ナビゲーションの推論VLA2026/5/1
視覚と言語によるナビゲーションにおいて、エージェントの状態とタスクの進捗を理解する自己認識推論機構を導入し、エンドツーエンドで高性能なナビゲーションを実現した。
- CMP: 能力多様体投影による移動操作の堅牢な全身追従移動操作2026/4/1
脚式移動マニピュレータの全身制御において、センサノイズや非現実的なユーザーコマンドによる分布外入力への堅牢性を高めるため、能力多様体投影(CMP)を提案した。
- DVGT-2: 大規模自動運転のためのビジョン・ジオメトリ・アクションモデル自動運転2026/4/1
自動運転のための新しいVGAパラダイムを提案し、オンライン推論可能なストリーミング型のDVGT-2を導入。密な3Dジオメトリと軌道計画を同時に出力し、多様なカメラ設定で微調整なしに適用可能。
- F2F-AP: フローから未来への非同期ポリシーによるリアルタイム動的マニピュレーションマニピュレーション2026/4/1
非同期推論の遅延問題を解決するため、物体のフロー予測を用いて未来の観測を合成し、視覚特徴を整合させることで、動的環境での操作を先読みして実行するフレームワークを提案した。
- ShapeGen: カテゴリレベル操作のためのロボットデータ生成データ生成2026/4/1
形状多様な操作データをシミュレータなしで3D的に生成する手法を提案し、実世界でカテゴリ内の形状一般化性能を向上させることを示した。
- DriveTok: 3D運転シーンのトークン化による統一的な多視点再構成と理解自動運転/トークン化2026/3/19
多視点の運転シーンを効率的にトークン化する3Dシーン・トークナイザーを提案し、画像再構成やセマンティックセグメンテーション、深度予測、3D占有予測を統一的に扱えることを示した。
- Vega: 自然言語指示による自動運転学習自動運転2026/3/1
多様な運転指示と軌道を含む大規模データセットを構築し、視覚と言語を統合して指示に従った軌道生成と計画を行う統一モデルVegaを提案した。
- CLAP: 人間の動画から視覚-言語-行動モデルを学習するための対照的潜在行動事前学習VLA2026/1/1
人間の動画からロボットの行動スキルを抽出し、視覚-言語-行動モデルを事前学習するフレームワークCLAPを提案。対照学習で人間の動画をロボットの行動語彙に整合させ、効率的なスキル転移を実現した。
- Astra: 自己回帰デノイジングによる汎用インタラクティブ世界モデル世界モデル2025/12/9
過去の観測と行動から多様なシーンの未来映像を予測する汎用世界モデルAstraを提案。自己回帰デノイジングと行動認識アダプタにより、運転やロボット把持などの精密な行動制御と長期的予測を実現した。
- 運転視覚幾何Transformer3D再構成2025/12/1
自動運転向けに、カメラパラメータ不要で多視点画像列からメートルスケールの密な3D点群と自車姿勢を推定するTransformerモデルを提案。
- Terra: 点潜在表現による探索可能なネイティブ3D世界モデル3D世界モデル2025/10/16
3D入力を点潜在表現に符号化し、3Dガウスプリミティブとして復号する世界モデルを提案。単一生成で任意視点からの高品質レンダリングと探索可能な環境生成を実現した。
- R2RGEN: 空間的に汎化されたマニピュレーションのための実世界間3Dデータ生成マニピュレーション2025/10/1
点群の観測と行動のペアを直接拡張し、シミュレータやレンダリングを使わずに実世界データを生成するフレームワークを提案。空間的に多様なデータを効率的に生成し、模倣学習による汎化性能を高める。
- MoTo: 汎用モバイルマニピュレーションのためのゼロショット・プラグイン型インタラクション認識ナビゲーションモバイルマニピュレーション2025/9/1
固定ベースのマニピュレーション基盤モデルにプラグインするだけで、VLMと軌道最適化によりゼロショットで移動マニピュレーションを実現する手法を提案。
- GC-VLN: グラフ制約としての指示による学習不要の視覚言語ナビゲーションVLA2025/9/1
人間の指示を空間制約の有向非巡回グラフに分解し、制約ソルバで経路を解くことで、学習なしに連続環境でロボットをナビゲートするフレームワークを提案した。
- IGL-Nav: 画像ゴールナビゲーションのためのインクリメンタル3Dガウシアンローカリゼーションナビゲーション2025/8/1
3Dガウシアンスプラッティングを用いて、探索中に逐次更新されるシーン表現からゴール画像の位置を粗く特定し、近づくと微分可能レンダリングで精密化する画像ゴールナビゲーション手法を提案。
- ManiGaussian++:階層的ガウス世界モデルによる汎用ロボット両腕マニピュレーションマニピュレーション2025/6/1
両腕ロボットのマルチタスク操作のため、役割の異なる腕を区別するガウス表現とリーダー・フォロワー型の階層的世界モデルを導入し、時空間ダイナミクスを予測して性能を向上させた。
- UniGoal: 汎用的なゼロショット目標指向ナビゲーションに向けてナビゲーション2025/3/1
異なる種類の目標を統一的なグラフ表現で扱い、LLMによるグラフ推論でゼロショット目標指向ナビゲーションを実現するフレームワークを提案。
- GPD-1: 自動運転のための生成的事前学習自動運転2024/12/1
自車・エージェント・地図をトークン化し、自己回帰トランスフォーマで統一的に生成することで、追加学習なしにシーン生成・交通シミュレーション・地図予測・運動計画など多様な運転タスクをこなすモデルを提案。
- SG-Nav: 3Dシーングラフを用いたLLMベースのゼロショット物体ナビゲーションナビゲーション2024/10/1
観測した環境を3Dシーングラフで表現し、LLMに階層的な思考プロンプトを与えることで、ゼロショット物体ナビゲーションを高精度かつ説明可能に実現した研究。
- EmbodiedSAM: 実時間で任意の3D物体をオンラインセグメンテーション3D知覚2024/8/1
SAMを活用し、RGB-Dストリームからオンラインでリアルタイムに3Dインスタンスセグメンテーションを行う手法を提案。
- 未知環境における身体性指示追従VLA2024/6/1
マルチモーダル大規模言語モデルを用いた階層的フレームワークにより、未知環境を探索しながら複雑な人間の指示を実行する身体性エージェントを実現した。
- ManiGaussian: マルチタスクロボット操作のための動的ガウシアンスプラッティングマニピュレーション2024/3/1
将来のシーン再構成を通じてシーンの動きを捉える動的ガウシアンスプラッティング手法を提案し、言語条件付きロボット操作タスクの成功率を向上させた。
- Anyview: Generalizable Indoor 3D Object Detection with Variable Frames2023/10/1
- Embodied Task Planning with Large Language Models2023/7/1
- Category-level Shape Estimation for Densely Cluttered Objects2023/2/1
- Planning Irregular Object Packing via Hierarchical Reinforcement Learning2022/11/1
- GE-Grasp: Efficient Target-Oriented Grasping in Dense Clutter2022/7/1
- LiDAR Distillation: Bridging the Beam-Induced Domain Gap for 3D Object Detection2022/3/1
- Similarity-Aware Fusion Network for 3D Semantic Segmentation2021/7/1
- P$^2$GNet: Pose-Guided Point Cloud Generating Networks for 6-DoF Object Pose Estimation2019/12/1
- DensePoint: Learning Densely Contextual Representation for Efficient Point Cloud Processing2019/9/1