Xin Zhang
University of Georgia
収録論文 32本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- NeuIDO: 物理情報に基づく4D世界モデルのためのニューラル内在ダイナミクス演算子世界モデル2026/9/21
視覚観測から統一的な内在ダイナミクス表現を学習し、物理情報に基づく4D生成を世界モデルへと発展させるフレームワークを提案。
- ロボット収穫のための選択的ワタボール位置推定:圃場条件下での深層学習視覚モデル評価農業ロボティクス2026/9/17
圃場で撮影したワタの画像データセットを用い、YOLO系やSAM系の深層学習モデルによるワタボールの検出・セグメンテーション性能を比較評価した。
- CLASP: 生食用ブルーベリー収穫のためのソフトローリングバンドグリッパを備えたクラスタ単位自律選択収穫ロボット農業ロボティクス2026/9/16
生食用ブルーベリーの房をソフトなローリングバンドグリッパで包み込み、成熟果実のみを選択的に引き離して収穫するクラスタ単位の自律ロボットを開発し、圃場試験で92%の把持成功率を達成した。
- TourPhysics: 物理を世界モデルに導入し、単一画像からの探索と操作を実現世界モデル2026/9/4
単一画像と物理設定から初期化し、シミュレーションとビデオ生成を組み合わせて、長期的な物理的一貫性を保ちながら探索と操作を行うオンラインフレームワークを提案する。
- SkillGLoW: 手続き的ファミリーのスキル統合による長期的タスクストリーム上の自己改善エージェントLLMエージェント2026/9/2
LLMエージェントが長期的なタスク群で自己改善する際、タスク間で共有される解決手順を「手続き的ファミリー」として集約・圧縮し、タスク固有の詳細は再生成するスキル管理手法SkillGLoWを提案した。
- IMPACT: 注意はスケーラブルな相互作用認識ワールドモデル学習のための相互作用マップワールドモデル2026/8/31
ワールドモデルの学習において、静的領域が支配的なMSE損失により動的物体の相互作用が過小評価される問題を指摘し、注意マップを用いて損失を再重み付けするフレームワークIMPACTを提案した。
- 因果的作用効果の再重み付けによるワールドモデル学習の改善ワールドモデル2026/8/31
アクション条件付きビデオ生成のワールドモデル学習において、背景トークンに偏った損失を避け、アクションの影響を受けるトークンに重点を置く再重み付け手法を提案した。
- DriftingVLA: 次元別時間ドリフトによるネイティブ一段階視覚言語行動生成VLA2026/8/30
フローベースのVLAモデルの多段階推論による遅延を解消するため、分布ドリフト目的関数を用いてノイズから行動チャンクへの直接マッピングを学習する一段階VLAモデルを提案した。行動次元ごとに時間的ドリフトを適用することで、制御性能を保ちつつ3.36倍の高速化を実現した。
- ReTouch: オンライン更新型触覚予測による接触豊富な器用操作の実現触覚/操作2026/8/1
触覚予測を実行時のフィードバックでオンライン更新するVLAモデルReTouchを提案し、接触を伴う器用操作の成功率を大幅に向上させた。
- Worldscape-MoE: スケーラブルな異種行動制御のための統一Mixture-of-Experts世界モデル世界モデル2026/7/1
異なる行動モダリティ(カメラ軌道、ロボット動作、手の関節信号など)を統一的に扱える拡張可能な世界モデルを提案し、MoEアーキテクチャにより異種の行動制御を共有の世界ダイナミクスに統合する。
- TacWAM: 力学を考慮した触覚予測を備えたアンカー誘導型ワールドアクションモデル触覚/操作2026/7/1
接触を伴う操作タスクにおいて、視覚だけでなく触覚の未来予測を活用し、力や変形などの物理情報を捉えつつ、アクション生成に特権的な手がかりとして使わないようにする新しいワールドアクションモデルを提案した。
- WorldScape Policy 2.0:推論強化メモリによる操縦可能なワールドアクションモデリングの実現操作2026/7/1
ロボット操作のためのワールドアクションモデルを拡張し、長期・短期メモリと推論強化により、タスク進行の追跡と細かい言語-映像-行動の対応付けを可能にした。
- GEAR-VLA: 汎用ロボット操作のための幾何認識行動表現の学習VLA/操作2026/6/7
VLAモデルの実世界での汎化を改善するため、幾何認識型の行動表現を学習するGEAR-VLAを提案。粗密行動学習、3D特徴の整合、エンボディメント正準化により、未見物体や異なるロボットへの汎化を実現した。
- PhysOmni: 単一画像からの物理基盤マルチオブジェクトシーン生成とリアルタイムインタラクションシーン生成2026/5/19
単一画像から物理的に一貫性のある3Dシーンを再構成し、リアルタイムで操作可能なビデオを生成するトレーニング不要のフレームワークを提案。
- WorldVLN: 空中視覚言語ナビゲーションのための自己回帰的世界行動モデルVLA2026/5/1
空中VLNを予測駆動の世界行動問題として捉え、自己回帰ビデオバックボーンで世界状態遷移を予測し、実行可能なウェイポイント行動に直接デコードする初のモデルWorldVLNを提案。2段階訓練と強化学習により、ベンチマークで12%以上の成功率向上を達成し、実ドローンへのゼロショット転送も実証。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- Safe-SDL:AI駆動型自律実験室の安全境界と制御メカニズムの確立安全制御2026/2/1
AIとロボット自動化による自律実験室(SDL)の安全性を確保するため、操作設計領域(ODD)や制御バリア関数(CBF)、トランザクション型安全プロトコル(CRUTD)を組み合わせたフレームワークを提案し、既存システムへの適用を通じて有効性を示した。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- RoboScape-R: 報酬と観測を統合したワールドモデルによる汎化可能なロボティクス強化学習強化学習/ワールドモデル2025/12/1
ワールドモデルを汎用環境プロキシとして用い、状態遷移の理解から報酬を生成する強化学習フレームワークを提案し、多様なシーンへの汎化性能を向上させた。
- 大規模グリッドマップの経路計画のための1000倍高速なLLM強化アルゴリズム経路計画2025/10/1
LLM-A*を改良し、A*の最適化・LLMのインクリメンタル学習・適切なウェイポイント選択を組み合わせることで、大規模グリッドマップの経路計画を平均1000倍以上高速化した。
- ER-LoRA: 有効ランク誘導適応による天候汎化深度推定深度推定2025/9/1
視覚基盤モデルを少量の晴天データのみでパラメータ効率良く微調整し、悪天候下でも汎化する単眼深度推定手法を提案。有効ランクに基づく選択・調整・維持戦略で適応と事前知識保持を両立。
- AirScape: 運動制御可能な空中生成ワールドモデル世界モデル2025/7/1
6自由度ドローンの視覚入力と運動意図から将来の観測を予測する世界モデルを構築し、運動意図に沿った3D空間想像力で既存モデルを大幅に上回った。
- RoboScape: 物理情報を組み込んだ身体性世界モデル世界モデル2025/6/1
RGB動画生成と物理知識を統合して学習する世界モデルを提案し、3D形状や運動ダイナミクスを考慮した物理的に妥当なロボット動画生成を実現した。
- CottonSim: Gazeboシミュレーションにおける視覚誘導型自律綿花収穫ロボットシステム農業ロボティクス2025/5/1
小型軽量な視覚誘導型自律綿花収穫ロボットをGazebo上で開発し、YOLOv8n-segによる綿花検出とGPS・地図ベースのナビゲーションで自律走行・収穫をシミュレーション検証した。
- オンラインプロトタイプ適応を用いた自己教師あり走行可能領域学習:オフロード自動運転に向けて走行可能領域推定/自己教師あり学習/オフロード自動運転2025/4/1
手動アノテーション不要の自己教師あり学習で、BEV表現を入力に用いた走行可能領域推定手法を提案。走行中にプロトタイプをオンライン更新し、動的な環境変化に対応する。
- CTSAC: カリキュラム学習ベースのTransformer Soft Actor-Criticによる目標指向ロボット探索ロボット探索/強化学習/sim2real2025/3/1
TransformerをSACの知覚ネットワークに組み込み、周期的レビュー型カリキュラム学習とLiDARクラスタリング最適化により、ロボット探索の効率とSim-to-Real転移性能を向上させた手法を提案。
- 人間の腕運動と力推定に基づく俊敏な大作業空間テレオペレーションインタフェーステレオペレーション2024/10/1
IMUと表面筋電図アームバンドで人間の腕運動と力を推定し、ロボットを直感的に操作する大作業空間テレオペレーションインタフェースを開発した。Omega 7との比較実験で競争力のある性能と優れた操作体験を示した。
- A Human Motion Compensation Framework for a Supernumerary Robotic Arm2023/10/1
- GICI-LIB: A GNSS/INS/Camera Integrated Navigation Library2023/6/1
- Design, Modeling, and Redundancy Resolution of Soft Robot for Effective Harvesting2023/3/1
- Robust Extrinsic Self-Calibration of Camera and Solid State LiDAR2023/2/1
- Safe Human-Interactive Control via Shielding2021/10/1