Jian Liu
Tongji University
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GenCOPE: ロボットピッキングのための合成から実への汎化カテゴリレベル物体姿勢推定sim2real2026/10/1
合成データのみで学習し実世界に直接汎化するカテゴリレベル物体姿勢推定手法を提案。2D/3D意味的一貫性制約と2D-3D相互融合によりドメインギャップを克服し、軽量なアーキテクチャでロボット操作に応用可能。
- GeoAAC: VLAポリシーのノイズ除去軌道の幾何に基づく適応的アクションチャンキングVLA2026/9/17
フローベースVLAポリシーにおいて、ノイズ除去軌道の幾何情報から予測信頼性を推定し、追加学習なしでアクションホライズンを適応的に決定する手法を提案。シミュレーションと実機で成功率を改善。
- WorldCycle: 長期的ビデオワールドモデルのための自己検証型強化学習ワールドモデル/強化学習2026/8/5
可逆なアクションサイクルを用いて、長期的な正確性を検証する自己教師あり強化学習フレームワークを提案し、ワールドモデルのドリフトを大幅に低減した。
- SAP-Nav:階層的オープンボキャブラリ物体ナビゲーションのための空間意味表現と能動的知覚の融合ナビゲーション2026/8/1
未知環境で自由形式の指示に従う階層的オープンボキャブラリ物体ナビゲーションを、能動的視点選択と空間意味表現の構築によりゼロショットで解決するフレームワークを提案した。
- DiffUE: 拡散オートエンコーダによる非学習可能例の実用性と非学習性のトレードオフ向上プライバシー保護2026/7/12
画像のピクセル空間ではなく意味空間にノイズを注入することで、視覚品質を保ちながら敵対的訓練などの再学習戦略に耐性を持つ非学習可能例を生成する手法を提案した。
- RL-MACRO: マルチモーダル適応型ロボット開頭術のためのサイバネティック閉ループ知能フレームワーク手術ロボット/強化学習2026/7/1
ロボット開頭術において、力覚・音響センサから隠れた温度状態を推定し、強化学習で切削パラメータを適応制御する閉ループ知能フレームワークを提案した。
- DexLink Hand: 人間らしい器用さを備えたコンパクトで低コストな16自由度リンク駆動ハンドハンド/機構設計2026/6/1
高自由度でありながら人間の手のサイズに収まる、低コストで器用なリンク駆動のロボットハンドを開発した。
- 触覚対応ワールドアクションモデル:非対称注意による触覚統合触覚/操作2026/6/1
接触を伴う操作タスクで、視覚と触覚を統合した世界行動モデルを提案。触覚トークンが視覚ダイナミクスを乱す問題を非対称注意機構で解決し、実ロボットで成功率を向上させた。
- 対称性を考慮したSim(3)一貫特徴と球面インセプション畳み込みによる9次元姿勢推定姿勢推定2026/6/1
カテゴリレベルの物体姿勢推定において、大規模視覚モデルを用いた対称性認識モジュールで並進・サイズを推定し、球面インセプション畳み込みで特徴融合を行うことで、未知物体やクラス内変動に頑健な姿勢推定を実現した。
- SyLink Hand:人間の巧緻性を目指したシナジー着想リンク駆動の擬人化ハンドハンド/機構設計2026/6/1
人間の手のシナジー(協調運動)に着想を得て、リンク機構で駆動する擬人化ハンドを設計・試作し、外観・運動学・機能の擬人性と機械的簡素さを両立した。
- WorldCraft: カメラナビゲーションからオブジェクト操作へ - インタラクティブビデオワールドモデルにおけるビデオワールドモデル2026/5/24
ビデオベースのワールドモデルをカメラ操作からオブジェクトレベルの軌跡操作へ拡張するフレームワークを提案。ユーザーのクリックと描画パスに基づき、選択オブジェクトが軌跡に沿って動く未来フレームを生成する。
- Robo-Cortex: 二重粒度認知記憶と自律知識誘導による自己進化型具現化エージェントナビゲーション2026/5/1
ロボットが過去の経験からナビゲーションのヒューリスティックを自律的に抽出し、戦略を進化させる自己進化型フレームワークを提案した。
- 具身AIとロボットシミュレーションのための3D生成:サーベイ3D生成/サーベイ2026/4/1
本論文は、具身AIとロボットシステムにおける3D生成の役割を、データ生成、シミュレーション環境構築、Sim2Real橋渡しの3つの観点から整理したサーベイである。物理的整合性やインタラクション対応など、視覚的リアリズムを超えた要件に焦点を当て、現状の課題を分析している。
- LangMap: 人間検証済みの階層的オープンボキャブラリ目標ナビゲーションのベンチマークナビゲーション2026/2/1
言語条件付き目標ナビゲーションのための、シーン・部屋・領域・インスタンスの4階層の目標を人間が検証した注釈でカバーする初の実世界3D屋内ナビゲーションベンチマークLangMapを提案し、RGBのみの強力なベースラインPlaNaVidも導入した。
- UAV映像理解のためのBLIP-2を用いたエッジ最適化マルチモーダル学習VLA2026/1/1
BLIP-2にYOLO-WorldとYOLOv8-Segを組み合わせ、キーフレーム選定とプロンプト最適化により、UAVのエッジ機器でも動作する軽量なマルチモーダル映像理解プラットフォームを提案した。
- BLM₁:デジタルと物理を横断する汎用大規模モデルVLA2025/10/1
デジタル空間と物理空間、異なるタスクやロボット身体をまたいで動作する統合型マルチモーダル基盤モデルBLM₁を提案し、2段階学習で身体性知識と制御を両立させた。
- ピンプレッショングリッパの設計とオンライン把持調整を伴う巧みな把持の学習マニピュレーション2025/5/1
ピンプレッション玩具に着想を得た、各指に独立伸縮可能なピンアレイを持つ平行グリッパを開発し、強化学習とカリキュラム学習で把持中の再配向を含む巧みな把持スキルを学習させ、実機転移も実証した。
- ニューラルブレイン:身体性エージェントのための神経科学に着想を得たフレームワーク身体性AI2025/5/1
身体性エージェントの中核となる知能システム「ニューラルブレイン」の統一フレームワークを提案し、マルチモーダル能動センシング、知覚・認知・行動の統合、神経可塑性に基づく記憶、ニューロモーフィック最適化を組み合わせた生物学的着想アーキテクチャを示した。
- MonoDiff9D: 拡散モデルによる単眼カテゴリレベル9D物体姿勢推定姿勢推定2025/4/1
単眼RGB画像から拡散モデルを用いてカテゴリレベルの9D物体姿勢を推定する手法を提案し、形状事前知識やCADモデルを必要とせずに最先端精度を達成した。
- G-DexGrasp: 部位認識型事前知識検索と生成支援による汎用性の高い巧みな把持合成マニピュレーション2025/3/1
未見の物体カテゴリや言語指示に対応するため、把持の事前知識(接触部位やアフォーダンス分布)を検索し、生成モデルと最適化を組み合わせて巧みな手の把持姿勢を合成する手法を提案。
- 単一参照画像からの未見物体6自由度姿勢推定とロボット統合姿勢推定2025/3/1
ロボット操作中に撮影した1枚の参照RGB-D画像だけから、未見物体の6自由度絶対姿勢を推定する手法SinRef-6Dを提案し、実機ロボットシステムに統合した。
- Diff9D: 拡散モデルによるドメイン汎化可能なカテゴリレベル9自由度物体姿勢推定姿勢推定2025/2/1
合成データのみで訓練した拡散モデルを用い、実世界シーンへ汎化できるカテゴリレベル9自由度の物体姿勢・サイズ推定手法を提案し、ロボット把持システムで有効性を示した。
- DINO-SD: ICRA 2024 RoboDepthチャレンジ優勝ソリューション深度推定2024/5/1
追加データなしで周囲視点の深度推定を高精度かつ頑健に行うDINO-SDを提案し、ICRA 2024 RoboDepthチャレンジのトラック4で最高性能を達成した。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- 物理を考慮した反復学習と顕著性マップ予測による両手把持計画マニピュレーション2024/4/1
片手把持のデータを活用し、物理バランスを考慮した損失と洗練モジュールで両手把持の接触点を予測する枠組みを提案。
- Adaptive Shape Servoing of Elastic Rods using Parameterized Regression Features and Auto-Tuning Motion Controls2020/8/1
- Caging Loops in Shape Embedding Space: Theory and Computation2018/7/1