Jie Zhou
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 信頼できる合成視覚メディア:メディアライフサイクル全体にわたる証拠生成メディア信頼性2026/9/28
生成メディアの信頼性を、メディアから復元できる証拠と制作時に記録・保存すべき証拠に分け、通常処理や改ざん後も意味を持つ条件を整理したレビュー。
- SM4RT: 4D再構成のための構造化モーション幾何学の学習4D再構成2026/7/1
単眼RGBビデオから、物体の剛体運動をSE(3)のモーションベースに分解して表現し、3D再構成と構造化された動きの知覚をエンドツーエンドで行うTransformerモデルを提案した。
- R2RDreamer: 空間的に汎化する2次元操作ポリシーのための3次元認識データ拡張操作学習2026/6/15
実デモから3D編集と2Dビデオ補完を組み合わせて、物体位置や視点が変わっても動作する操作ポリシーを学習するためのデータ拡張手法を提案した。
- AwareVLN: 自己認識による視覚言語ナビゲーションの推論VLA2026/5/1
視覚と言語によるナビゲーションにおいて、エージェントの状態とタスクの進捗を理解する自己認識推論機構を導入し、エンドツーエンドで高性能なナビゲーションを実現した。
- IVGT: 暗黙的視覚幾何トランスフォーマーによるニューラルシーン表現3D再構成2026/5/1
カメラポーズが未知の多視点画像から、連続的で一貫した3D幾何と外観を暗黙的にモデル化する手法を提案。SDFと色を予測する軽量デコーダを用いて、任意の3D位置での空間クエリを可能にし、メッシュ再構成や新規視点合成など多様なタスクで高い性能を示した。
- CMP: 能力多様体投影による移動操作の堅牢な全身追従移動操作2026/4/1
脚式移動マニピュレータの全身制御において、センサノイズや非現実的なユーザーコマンドによる分布外入力への堅牢性を高めるため、能力多様体投影(CMP)を提案した。
- F2F-AP: フローから未来への非同期ポリシーによるリアルタイム動的マニピュレーションマニピュレーション2026/4/1
非同期推論の遅延問題を解決するため、物体のフロー予測を用いて未来の観測を合成し、視覚特徴を整合させることで、動的環境での操作を先読みして実行するフレームワークを提案した。
- ShapeGen: カテゴリレベル操作のためのロボットデータ生成データ生成2026/4/1
形状多様な操作データをシミュレータなしで3D的に生成する手法を提案し、実世界でカテゴリ内の形状一般化性能を向上させることを示した。
- DriveTok: 3D運転シーンのトークン化による統一的な多視点再構成と理解自動運転/トークン化2026/3/19
多視点の運転シーンを効率的にトークン化する3Dシーン・トークナイザーを提案し、画像再構成やセマンティックセグメンテーション、深度予測、3D占有予測を統一的に扱えることを示した。
- Vega: 自然言語指示による自動運転学習自動運転2026/3/1
多様な運転指示と軌道を含む大規模データセットを構築し、視覚と言語を統合して指示に従った軌道生成と計画を行う統一モデルVegaを提案した。
- Astra: 自己回帰デノイジングによる汎用インタラクティブ世界モデル世界モデル2025/12/9
過去の観測と行動から多様なシーンの未来映像を予測する汎用世界モデルAstraを提案。自己回帰デノイジングと行動認識アダプタにより、運転やロボット把持などの精密な行動制御と長期的予測を実現した。
- Terra: 点潜在表現による探索可能なネイティブ3D世界モデル3D世界モデル2025/10/16
3D入力を点潜在表現に符号化し、3Dガウスプリミティブとして復号する世界モデルを提案。単一生成で任意視点からの高品質レンダリングと探索可能な環境生成を実現した。
- R2RGEN: 空間的に汎化されたマニピュレーションのための実世界間3Dデータ生成マニピュレーション2025/10/1
点群の観測と行動のペアを直接拡張し、シミュレータやレンダリングを使わずに実世界データを生成するフレームワークを提案。空間的に多様なデータを効率的に生成し、模倣学習による汎化性能を高める。
- GC-VLN: グラフ制約としての指示による学習不要の視覚言語ナビゲーションVLA2025/9/1
人間の指示を空間制約の有向非巡回グラフに分解し、制約ソルバで経路を解くことで、学習なしに連続環境でロボットをナビゲートするフレームワークを提案した。
- IGL-Nav: 画像ゴールナビゲーションのためのインクリメンタル3Dガウシアンローカリゼーションナビゲーション2025/8/1
3Dガウシアンスプラッティングを用いて、探索中に逐次更新されるシーン表現からゴール画像の位置を粗く特定し、近づくと微分可能レンダリングで精密化する画像ゴールナビゲーション手法を提案。
- UniGoal: 汎用的なゼロショット目標指向ナビゲーションに向けてナビゲーション2025/3/1
異なる種類の目標を統一的なグラフ表現で扱い、LLMによるグラフ推論でゼロショット目標指向ナビゲーションを実現するフレームワークを提案。
- GPD-1: 自動運転のための生成的事前学習自動運転2024/12/1
自車・エージェント・地図をトークン化し、自己回帰トランスフォーマで統一的に生成することで、追加学習なしにシーン生成・交通シミュレーション・地図予測・運動計画など多様な運転タスクをこなすモデルを提案。
- SG-Nav: 3Dシーングラフを用いたLLMベースのゼロショット物体ナビゲーションナビゲーション2024/10/1
観測した環境を3Dシーングラフで表現し、LLMに階層的な思考プロンプトを与えることで、ゼロショット物体ナビゲーションを高精度かつ説明可能に実現した研究。
- EmbodiedSAM: 実時間で任意の3D物体をオンラインセグメンテーション3D知覚2024/8/1
SAMを活用し、RGB-Dストリームからオンラインでリアルタイムに3Dインスタンスセグメンテーションを行う手法を提案。
- Touch100k:触覚中心のマルチモーダル表現学習のための大規模触覚・言語・視覚データセット触覚2024/6/1
触覚・言語・視覚をペアにした10万規模のデータセットTouch100kを構築し、カリキュラム学習に基づく事前学習手法TLV-Linkを提案して触覚表現学習の性能を向上させた。
- Planning Irregular Object Packing via Hierarchical Reinforcement Learning2022/11/1
- GE-Grasp: Efficient Target-Oriented Grasping in Dense Clutter2022/7/1
- LiDAR Distillation: Bridging the Beam-Induced Domain Gap for 3D Object Detection2022/3/1
- ApolloRL: a Reinforcement Learning Platform for Autonomous Driving2022/1/1
- Similarity-Aware Fusion Network for 3D Semantic Segmentation2021/7/1
- P$^2$GNet: Pose-Guided Point Cloud Generating Networks for 6-DoF Object Pose Estimation2019/12/1