Jieqi Shi
Nanjing University
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 行動識別型ワールドモデルによる反事実モデル予測制御モデルベース制御/ワールドモデル2026/9/24
計画時に候補行動を区別できるよう、逆動力学と行動復元正則化を組み込んだワールドモデルAD-WMを提案し、MPCの成功率と実機ゼロショット転移を改善した。
- Wh0: 生成的世界モデルによるスケーラブルな自己中心視点の人間手操作データ生成VLA/データ生成2026/6/1
生成ビデオ世界モデルを用いて、ロボット学習に使える自己中心視点の人間手操作ビデオデータを大量生成し、実ロボットデータと組み合わせて器用な操作VLAモデルの性能を大幅に向上させる手法を提案した。
- Uni-LaViRA: 言語・視覚・ロボット行動の翻訳による統合具現化ナビゲーションナビゲーション2026/5/1
ナビゲーションの意思決定構造を言語と視覚の行動出力に分解し、事前学習済みMLLMを活用してゼロショットで4つのタスクと4種類のロボットに適用する統合エージェントアーキテクチャを提案した。
- FineCog-Nav: 細粒度認知モジュール統合によるゼロショットマルチモーダルUAVナビゲーションナビゲーション2026/4/1
人間の認知プロセスを模倣した細粒度モジュールを統合し、ゼロショットでUAVの視覚言語ナビゲーションを行うフレームワークを提案した論文。
- V-Dreamer: ビデオ生成事前知識によるロボットシミュレーションと軌道合成の自動化シミュレーション/データ生成2026/3/1
自然言語の指示から、シミュレーション可能な3D環境と実行可能なロボット軌道を自動生成するフレームワークを提案。ビデオ生成モデルを動作の事前知識として活用し、シミュレーションから実世界への転移を実現した。
- RoTri-Diff: 空間的なロボット-物体三者間相互作用に基づく両腕操作のための拡散モデル両腕操作/拡散モデル/模倣学習2026/3/1
両腕と操作対象物の間の相対的な6D姿勢を符号化した三者間相互作用表現を導入し、階層的拡散過程で軌道生成する模倣学習フレームワークを提案。シミュレーションと実機で高い性能を実証した。
- MoMaStage: スキル状態グラフによる計画と閉ループ実行を統合した長期的屋内移動操作移動操作2026/3/1
屋内移動操作ロボット向けに、明示的なシーン地図を使わず、階層スキルライブラリとトポロジー認識スキル状態グラフでVLMの計画を制約し、閉ループ実行で堅牢性を高めるフレームワークを提案した。
- AdaClearGrasp: 密集環境でのロバストなゼロショット器用把持のための適応的クリアリング学習マニピュレーション2026/3/1
密集環境での器用な把持を実現するため、視覚言語モデルを用いて直接把持するか周囲をクリアするかを適応的に決定する閉ループ意思決定・実行フレームワークを提案した。
- ST-VLA: 汎用ロボット操作のための4D認識時空間理解の実現VLA/操作2026/3/1
ロボット操作のための階層型VLAフレームワークST-VLAを提案し、3D-4D表現で知覚と行動を橋渡し、大規模データセットST-Humanで訓練した。RLBenchと実世界で成功率を大幅に向上させた。
- INHerit-SG: 増分階層型セマンティックシーングラフとRAG型検索シーングラフ2026/2/1
ロボットナビゲーション向けに、3D環境を非同期の二重ストリームで階層的なセマンティックシーングラフとして構築し、LLMとトポロジーを組み合わせた検索で複雑な embodied クエリに応答するシステムを提案。
- ManiLong-Shot: 長期的操作のためのインタラクション認識ワンショット模倣学習模倣学習2025/12/1
物理的インタラクションイベントに基づいて長期的タスクをプリミティブに分解し、VLMやルールベースの推論でワンショット模倣学習を実現するフレームワークを提案。
- LaViRA: 連続環境におけるゼロショット視覚言語ナビゲーションのための言語・視覚・ロボット行動翻訳ナビゲーション2025/10/1
自然言語指示に基づき未学習の連続環境をナビゲートするゼロショット手法。行動を言語・視覚・ロボットの3階層に分解し、各段階で異なる規模のマルチモーダル大規模言語モデルを活用することで、汎化性能と実機制御の効率を両立した。
- RoboHiMan: 長期的マニピュレーションにおける構成的一般化のための階層的評価パラダイムマニピュレーション2025/10/1
長期的なマニピュレーションタスクにおけるスキル構成の一般化を評価するため、多様な摂動下での原子タスクと構成タスクのベンチマークHiMan-Benchと3つの評価パラダイムを提案し、代表的なモデル・アーキテクチャの能力ギャップを明らかにした。
- SEA: 不確実領域の能動的探索のための意味地図予測能動的探索2025/10/1
観測から地図の欠損領域を反復予測し、予測と実地図の差分を強化学習で探索に活かすことで、限られた時間で高精度な意味地図を構築する手法を提案。
- DeCo: 長期的3Dマニピュレーションにおけるゼロショット汎化のためのタスク分解とスキル合成マニピュレーション2025/5/1
模倣学習のデモを把持物体の相互作用に基づいて原子タスクに分解し、VLMで指示を解析してスキルを動的に組み合わせることで、未見の長期的3D操作タスクへのゼロショット汎化を実現するフレームワーク。
- SEPT: 標準地図を活用した自動運転のためのシーン知覚とトポロジー推論の強化自動運転知覚2025/5/1
高精細地図に頼らず、標準地図を事前知識としてBEV特徴と融合し、シーン知覚とトポロジー推論を高精度化するフレームワークを提案。
- SG-Reg: 汎用性と効率性を備えたシーングラフ位置合わせシーングラフ位置合わせ2025/4/1
複数の意味的シーングラフを位置合わせするため、意味・トポロジー・形状特徴を統合したノード表現と粗から細へのマッチング、ロバスト姿勢推定を組み合わせた手法を提案。視覚基盤モデルによるデータ生成も導入し、SLAMベンチマークで有効性を示した。
- GravMAD: 接地された空間価値マップによる汎用3Dマニピュレーションのための行動拡散マニピュレーション2024/9/1
言語指示をサブゴールに分解し、基盤モデルと拡散方策を組み合わせて未知の3D操作タスクへの汎化を実現した手法。
- FM-Fusion: 視覚言語基盤モデルで強化されたインスタンス認識セマンティックマッピングセマンティックマッピング2024/2/1
視覚言語基盤モデルから得られるオープンセットな検出結果を確率的に融合し、過分割を統合することで、ゼロショットで汎用的なインスタンス認識セマンティックマップを構築する手法を提案。
- Efficient Implicit Neural Reconstruction Using LiDAR2023/2/1
- Graph-Guided Deformation for Point Cloud Completion2021/12/1
- Coarse-To-Fine Visual Localization Using Semantic Compact Map2019/10/1
- DF-SLAM: A Deep-Learning Enhanced Visual SLAM System based on Deep Local Features2019/1/1
- An Efficient Volumetric Mesh Representation for Real-time Scene Reconstruction using Spatial Hashing2018/3/1