Zhizhong Su
Horizon Robotics
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Ego4WAM:ロボット学習のための自己中心的人間データのスケーリングで重要な要素は何か?VLA2026/9/30
自己中心的人間データをロボット学習に活用する際、人間とロボットのアライメント、タスク多様性、行動監督、利用戦略が下流性能に与える影響を体系的に分析し、データ設計の指針を示した。
- CogWAM: イベント駆動型インターフェースによる意味認知と世界行動モデリングの整合VLA2026/9/29
タスク推論と世界行動学習の間に持続的な意味状態を介した明示的なインターフェースを設け、進捗条件付きクエリで未来予測と行動生成を整合させる認知誘導型世界行動モデルを提案。
- 世界行動モデルの表現設計を見直すReWAMVLA2026/9/29
事前学習済みDINO特徴を基盤に、特徴校正と時間表現ボトルネックで世界状態を圧縮し、行動損失のみで表現を整形する世界行動モデルを提案。動画生成事前学習なしでRoboTwin 2.0で93.6%の成功率を達成。
- InstructMove: 指示追従操作のためのテキスト必須ベンチマークVLA/ベンチマーク2026/8/24
視覚的に顕著な物体や唯一の動作候補に頼らず、言語指示にのみ従って正解が決まる「テキスト必須」な操作ベンチマークInstructMoveを提案し、VLAモデルの指示追従能力を診断・改善する。
- Faster-WAM: ロバストな世界行動モデルのための効率的な推論時未来条件付けロボット操作2026/8/5
世界行動モデル(WAM)の推論時における未来条件付けの重要性を示し、計算コストを抑えつつ未来表現を活用する効率的なフレームワークFaster-WAMを提案した。
- NativeMEM: 長期ホライズンのロボット操作のためのネイティブメモリ圧縮VLA/長期メモリ/操作2026/7/1
事前学習済みVLAモデルが高頻度更新で長い視覚履歴を保持できるように、VLA自身の視覚エンコーダを再利用して各フレームを単一トークンに圧縮するメモリ圧縮方式を提案。外部メモリや新規モジュール不要で、シミュレーション成功率を32.4%から84.0%に向上させた。
- EmbodiedGen V2: 具身知能のためのエージェント型・シミュレーション対応3Dワールドエンジンシミュレーション環境生成2026/7/1
シミュレーション対応の3Dアセットを自動で組み立て、操作・ナビゲーションなどのタスク環境を生成できる世界エンジンを提案。生成環境での強化学習により、シミュレーション成功率と実ロボット成功率を大幅に向上させた。
- ManiSplat: 単眼ビデオからの操作軌道合成 - 分離型3Dガウシアンスプラッティングによるアプローチ3D再構成/操作軌道合成2026/6/9
ロボットの単眼ビデオから、ロボット・物体・背景を分離した3Dガウシアン表現を構築し、操作タスクの軌道を合成するフレームワークを提案した。
- HoloAgent-0: 3D空間メモリを備えた統合具現化エージェントフレームワークVLA2026/6/1
言語指示を実行可能なスキルグラフに変換し、3D空間メモリとロボットスキルを統合して実ロボットで閉ループ実行を実現する統一エージェントフレームワークを提案した。
- SimWeaver: 変形物操作のためのゼロショットRGBシミュレーションから実世界への転移変形物操作/sim2real2026/6/1
変形物操作のためのRGBシミュレーションから実世界への転移を、実世界での微調整なしで実現する手法を提案。シミュレーション上のデモンストレーションのみで訓練したVLAポリシーが、5つの多様な変形物タスクで高い成功率を達成した。
- GeoFlow-SLAM++: 再位置推定を備えた堅牢なマルチカメラ視覚慣性SLAMシステムSLAM2026/6/1
複数カメラを統合した視覚慣性SLAMシステムを提案し、単眼やRGB-Dセンサの限界を克服して、外観変化に強いニューラル特徴量と再位置推定を組み合わせることで、様々な環境で高精度な位置推定を実現した。
- HoloMotion-1 技術報告書:ゼロショット全身動作追跡のための人型ロボット動作基盤モデル全身動作追跡/基盤モデル2026/5/1
大規模なハイブリッド動作データ(動画再構成・モーションキャプチャ等)で制御ポリシーを学習し、未見の動作や実機へゼロショットで汎化する人型ロボットの全身動作追跡基盤モデルを提案した。
- 生成3D世界によるロボットVLAのSim-to-Real強化学習のスケーリングVLA2026/3/1
生成3Dモデルと言語駆動シーン設計で多様なシミュレーション環境を自動生成し、VLAモデルの強化学習をスケールさせて実世界への転移性能を大幅に向上させた。
- RISE: 構成可能な世界モデルによる自己改善ロボット方策VLA2026/2/1
ロボット操作のための構成可能な世界モデルを提案し、想像空間での強化学習により実世界での安全性・コスト問題を回避しつつ、動的タスクで大幅な性能向上を実現した。
- HoloBrain-0 技術報告VLA2026/2/1
ロボットの身体情報(カメラ配置やURDF)を組み込んだVLAフレームワークを提案し、事前学習と事後学習でシミュレーションと実機のマニピュレーションタスクを高精度に達成、エコシステム全体をオープンソース化した。
- IRIS-SLAM: 幾何・インスタンス統合表現による堅牢な意味論的定位とマッピングSLAM2026/2/1
幾何基盤モデルを拡張して密な幾何と視点間で一貫したインスタンス埋め込みを同時予測し、意味論的に対応付けられたループ閉じ込み検出を可能にしたRGB意味論SLAMシステムを提案。
- MapDream:視覚言語ナビゲーションのためのタスク駆動型地図学習VLA2026/2/1
視覚言語ナビゲーションにおいて、ナビゲーション目的に直接最適化されたBEV地図を自己回帰的に生成し、行動予測と統合学習するフレームワークを提案。
- Motus: 統合潜在行動ワールドモデルVLA2025/12/1
理解・映像生成・行動の3エキスパートをMixture-of-Transformerで統合し、光流から潜在行動を学習する統一ワールドモデルを提案。シミュレーションと実世界で既存手法を上回る性能を示した。
- Progress-Think: 視覚言語ナビゲーションのための意味的進捗推論VLA2025/11/1
視覚観測から指示文の進捗を意味的に推論し、ナビゲーション方策を導く三段階フレームワークを提案。R2R-CEとRxR-CEで最高性能を達成。
- FSR-VLN: 階層的マルチモーダルシーングラフによる視覚言語ナビゲーションの高速・低速推論VLA2025/9/1
階層的マルチモーダルシーングラフと高速・低速推論を組み合わせ、長距離視覚言語ナビゲーションの成功率を向上させつつ応答時間を82%削減し、ヒューマノイドロボットに実装した。
- MonoDream:パノラマドリーミングによる単眼視覚言語ナビゲーションVLA2025/8/1
単眼入力のみでパノラマRGB-D相当の空間表現を潜在空間で学習し、視覚言語ナビゲーションの性能を向上させる軽量VLAフレームワークを提案。
- FineGrasp: 繊細な物体のためのロバスト把持マニピュレーション2025/7/1
小さく繊細な物体でも把持しやすい姿勢を生成する把持手法FineGraspを提案し、ネットワーク改良・ラベル正規化・sim-to-real混合学習で性能を向上させた。
- H-RDT: 人間の操作データで強化した両腕ロボットマニピュレーションマニピュレーション2025/7/1
大規模な一人称視点の人間操作動画と3D手姿勢を事前学習に活用し、拡散トランスフォーマーとフローマッチングでロボットの両腕操作ポリシーを学習する手法を提案。シミュレーションと実機で既存手法を上回る性能を示した。
- EmbodiedGen: 身体性知能のための生成的3D世界エンジンsim2real2025/6/1
物理的リアリティと正確なスケールを持つ3Dアセットを低コストで生成し、物理シミュレーションに直接インポート可能な基盤プラットフォームを提案。
- SEM: ロボットマニピュレーションのための空間理解を強化する拡散ポリシーマニピュレーション2025/5/1
視覚表現に3D幾何情報を付加する空間エンハンサと、関節依存をグラフで捉えるロボット状態エンコーダを組み合わせ、空間理解を高めた拡散ベースのマニピュレーションポリシーを提案。
- Aux-Think: データ効率の良い視覚言語ナビゲーションのための推論戦略の探求VLA2025/5/1
視覚言語ナビゲーション(VLN)において推論戦略を体系的に評価し、推論時の推論崩壊問題を明らかにした上で、CoT教師あり学習で推論パターンを内部化しつつ直接行動予測を行うAux-Thinkを提案した。
- GeoFlow-SLAM:動的脚式ロボティクスのための堅牢な密結合RGBD慣性・脚式オドメトリ融合SLAMSLAM2025/3/1
高速・高頻度動作する脚式ロボット向けに、幾何学的整合性・脚式オドメトリ・デュアルストリームオプティカルフローを統合し、特徴マッチングや姿勢初期化の失敗、テクスチャレス環境での視覚特徴不足を解決する密結合RGBD慣性SLAMを提案。
- ガウシアン物体彫刻: 表面補完を伴う物体合成的ガウシアンスプラッティング3D再構成2024/12/1
3Dガウシアンスプラッティングと単眼幾何事前分布を組み合わせ、遮蔽領域の表面をゼロショットで補完しながら物体単位で編集可能な3Dシーン再構成を実現した研究。
- ManiBox: スケーラブルなシミュレーションデータ生成による身体性空間汎化の強化sim2real2024/11/1
バウンディングボックスを入力とする学生ポリシーを強化学習教師から蒸留し、シミュレーションでスケールしたデータで実機へのゼロショット転移を実現したフレームワーク。
- Sparse4D v3: Advancing End-to-End 3D Detection and Tracking2023/11/1