Zhuoyang Liu
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Lift3D-VLA: 3次元幾何と動力学を考慮した操作のためのVLAモデルのリフティングVLA/操作2026/7/1
VLAモデルに明示的な3次元点群推論と時間的に一貫した行動生成を組み込む統一フレームワークを提案。2Dモデルを3Dに持ち上げる戦略と自己教師あり学習で幾何と物理ダイナミクスを内部化し、LLMの多層で行動チャンクを予測する。
- 視覚運動制御のための対比的行動-画像事前学習視覚エンコーダ/事前学習/模倣学習2026/6/15
大規模な人間の第一人称ビデオから手のキーポイントを行動の代理として抽出し、対比学習でロボットの視覚エンコーダを事前学習する手法を提案。実機の器用操作タスクで既存手法を30%以上上回る性能を達成した。
- T-Rex: 触覚反応型巧みな操作触覚/操作2026/6/1
触覚信号に動的に反応する操作を実現するため、大規模な触覚データセットと可変レートのMixture-of-Transformersアーキテクチャを導入し、12の操作タスクで成功率を大幅に向上させた。
- FTP-1: 触覚センサを横断する接触リッチ操作のための汎用基盤触覚ポリシー触覚/基盤モデル2026/6/1
多様な触覚センサとロボット構成に対応する初の汎用基盤触覚ポリシーFTP-1を提案し、約3000時間のデータで事前学習して未見センサへの転移を実証した。
- TwinRL: デジタルツイン駆動強化学習による実世界ロボットマニピュレーションVLA2026/2/1
スマホ撮影から高忠実度デジタルツインを構築し、SFT・ツインRL・実世界RLの3段階でVLAモデルの探索空間を拡張・誘導する協調ポストトレーニング手法を提案。
- LaST₀:ロボット視覚言語行動モデルのための潜在時空間チェーン・オブ・ソートVLA2026/1/1
言語ではなく潜在空間で未来の視覚・3D・固有感覚を推論する時空間Chain-of-Thoughtを導入し、低頻度推論と高頻度行動生成を分離した二重システムVLAフレームワークを提案。
- ManualVLA:思考連鎖による手順書生成とロボット操作を統合したVLAモデルVLA2025/12/1
目標状態から実行手順を推論する「Manual Chain-of-Thought」を導入し、手順書生成と操作実行をMixture-of-Transformersで統合したVLAモデルを提案。3D Gaussian Splattingによるデジタルツインで訓練データを自動生成する。
- RoboMIND 2.0:汎用身体知能のためのマルチモーダル両腕移動マニピュレーションデータセットマニピュレーション2025/12/1
6種類のロボットで集めた31万件超の両腕操作・移動マニピュレーション軌道(触覚・シミュレーション含む)を公開し、階層型VLM+VLAシステムMIND-2を提案した論文。
- DualVLA: 推論と行動の部分的デカップリングによる汎用身体性エージェントの構築VLA2025/11/1
ロボット実演で訓練したVLAモデルにマルチモーダル推論を追加すると行動性能が劣化する「行動退化」を解決するため、二層データ選別と二重教師適応蒸留を提案し、推論能力を保ちつつ行動精度を向上させた。
- MLA: ロボットマニピュレーションにおけるマルチモーダル理解と予測のためのマルチセンサリー言語行動モデルVLA2025/9/1
2D画像・3D点群・触覚を位置対応で統合し、将来のマルチセンサリー情報を予測する言語行動モデルを提案。接触の多い実世界タスクで従来の2D/3D VLAを大きく上回る。
- AC-DiT: 移動マニピュレーションのための適応協調拡散トランスフォーマ移動マニピュレーション2025/7/1
移動ベースとマニピュレータの協調を改善するため、ベース運動を事前情報として全身動作を予測する機構と、2D画像と3D点群の融合重みを動的に調整する知覚戦略を備えた拡散トランスフォーマを提案した。
- Fast-in-Slow:高速操作と低速推論を統合するデュアルシステム基盤モデルVLA2025/6/1
VLMベースの推論システムに実行モジュールを部分的にパラメータ共有して組み込み、高速かつ精密なロボット操作を実現する統合型VLAモデルを提案。
- H2R: 動画からのロボット事前学習のための人間からロボットへのデータ拡張sim2real2025/5/1
一人称視点の人間動画をロボット視点の映像に変換するデータ拡張パイプラインH2Rを提案し、人間とロボットの見た目のギャップを埋めることで、シミュレーションと実機の両方で下流タスクの成功率を向上させた。
- HybridVLA:拡散と自己回帰を統合した視覚-言語-行動モデルVLA2025/3/1
拡散モデルによる連続的な行動生成と自己回帰による文脈推論を単一の大規模言語モデル内で統合し、両者を協調的に学習・アンサンブルするロボット操作フレームワークを提案。