Shiqi Zhang
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WAM-OPD: オンポリシー蒸留によるワールドアクションモデルの高性能化VLA2026/9/28
事前学習済みワールドアクションモデルを、環境ロールアウトを繰り返さずにオンポリシー蒸留で専門タスクに適応させる手法WAM-OPDを提案。
- DriftingVLA: 次元別時間ドリフトによるネイティブ一段階視覚言語行動生成VLA2026/8/30
フローベースのVLAモデルの多段階推論による遅延を解消するため、分布ドリフト目的関数を用いてノイズから行動チャンクへの直接マッピングを学習する一段階VLAモデルを提案した。行動次元ごとに時間的ドリフトを適用することで、制御性能を保ちつつ3.36倍の高速化を実現した。
- ReTouch: オンライン更新型触覚予測による接触豊富な器用操作の実現触覚/操作2026/8/1
触覚予測を実行時のフィードバックでオンライン更新するVLAモデルReTouchを提案し、接触を伴う器用操作の成功率を大幅に向上させた。
- iFLYTEK-Embodied-Omni技術報告VLA2026/6/24
視覚・言語・行動を単一のOmniフレームワークで統合したマルチモーダル基盤モデルを提案し、脳と小脳の協調に例えられる設計で、指示理解から行動生成までを一貫して行う。
- GEAR-VLA: 汎用ロボット操作のための幾何認識行動表現の学習VLA/操作2026/6/7
VLAモデルの実世界での汎化を改善するため、幾何認識型の行動表現を学習するGEAR-VLAを提案。粗密行動学習、3D特徴の整合、エンボディメント正準化により、未見物体や異なるロボットへの汎化を実現した。
- ドリフトベース方策最適化:オンラインロボット制御のためのネイティブ一段階方策学習ロボット制御2026/4/1
多段階生成方策の推論コストを削減するため、固定点ドリフト目的で訓練時に反復精錬を内部化した一段階生成方策(DBP)と、そのオンラインRLフレームワーク(DBPO)を提案した。
- 能動的知覚を備えたロボットの計画と状況対応タスク計画/能動的知覚2026/4/1
ロボットの実行中に発生する予期せぬ状況を能動的に知覚し対処するためのフレームワークVAP-TAMPを提案した。視覚言語モデルとシーングラフを活用し、タスクと動作の統合計画を行う。
- 鳴き声から言葉へ:音声コミュニケーションを備えた知能ロボット盲導犬に向けてアシスティブ・ロボティクス2026/3/1
視覚障害者を支援するロボット盲導犬にLLMを用いた対話システムを導入し、ナビゲーション計画や周囲の状況を言葉で説明することで、ハンドラーとの協調的意思決定を可能にする手法を開発した。人間対象の実験とシミュレーションで、異なる言語化戦略の評価とナビゲーションの効率・精度を検証した。
- PROTEA: ロボットのタスク計画と実行を安全に守るタスク計画/安全性2026/1/1
LLMを審判として使う防御機構PROTEAを提案し、基盤モデルベースのロボットタスク計画に対する敵対的攻撃への耐性を評価・強化する。
- LLM-GROP: 大規模言語モデルによる視覚に基づくロボットのタスク・動作計画タスク・動作計画2025/11/1
大規模言語モデルの常識知識と視覚情報を活用し、複数物体の移動を伴うモバイルマニピュレーションのタスク・動作計画を統合するフレームワークを提案。実環境とシミュレーションで成功率と効率を評価した。
- MuTRAP:ロボットタスクプランニングを攻撃するマルチトリガートロイの木馬VLA2025/4/1
LLMを用いたロボットタスクプランナーに対し、少数のタスク特化パラメータでバックドアを注入し、複数のトリガーで悪意ある行動を引き起こす初のマルチトリガートロイ攻撃手法を提案。
- 視覚言語モデルによる間取り図マップの解析VLA2024/9/1
視覚言語モデル(VLM)に間取り図を与え、複雑な屋内ナビゲーションのタスク計画を生成させることで、地図解析能力を評価した研究。
- DKPROMPT: ドメイン知識で視覚言語モデルを誘導するオープンワールド計画手法VLA2024/6/1
PDDLのドメイン知識を使って視覚言語モデルへのプロンプトを自動生成し、オープンワールドでのロボットタスク計画・実行を高精度化するフレームワークを提案した論文。
- 最適化ベースのタスク・動作計画のサーベイ:古典的手法から学習ベース手法までタスク・動作計画2024/4/1
タスク計画と動作計画を統合するTAMPについて、最適化ベースの手法を古典的手法から学習ベース手法まで体系的にレビューしたサーベイ論文。
- ORLA*: Mobile Manipulator-Based Object Rearrangement with Lazy A Star2023/9/1
- Seeing-Eye Quadruped Navigation with Force Responsive Locomotion Control2023/9/1
- Symbolic State Space Optimization for Long Horizon Mobile Manipulation Planning2023/7/1
- Integrating Action Knowledge and LLMs for Task Planning and Situation Handling in Open Worlds2023/5/1
- ARDIE: AR, Dialogue, and Eye Gaze Policies for Human-Robot Collaboration2023/5/1
- LLM+P: Empowering Large Language Models with Optimal Planning Proficiency2023/4/1
- Grounding Classical Task Planners via Vision-Language Models2023/4/1
- Task and Motion Planning with Large Language Models for Object Rearrangement2023/3/1
- Learning Visualization Policies of Augmented Reality for Human-Robot Collaboration2022/11/1
- GLAD: Grounded Layered Autonomous Driving for Complex Service Tasks2022/10/1
- Robot Task Planning and Situation Handling in Open Worlds2022/10/1
- Learning to Ground Objects for Robot Task and Motion Planning2022/2/1
- Reasoning with Scene Graphs for Robot Planning under Partial Observability2022/2/1
- Visually Grounded Task and Motion Planning for Mobile Manipulation2022/2/1
- ARROCH: Augmented Reality for Robots Collaborating with a Human2021/9/1
- Learning to Guide Human Attention on Mobile Telepresence Robots with 360 Vision2021/9/1
- Learning Quadruped Locomotion Policies using Logical Rules2021/7/1
- Planning Multimodal Exploratory Actions for Online Robot Attribute Learning2021/6/1
- Guiding Robot Exploration in Reinforcement Learning via Automated Planning2020/4/1
- Task-Motion Planning for Safe and Efficient Urban Driving2020/3/1
- Negotiation-based Human-Robot Collaboration via Augmented Reality2019/9/1
- Augmenting Knowledge through Statistical, Goal-oriented Human-Robot Dialog2019/7/1
- Integrating Task-Motion Planning with Reinforcement Learning for Robust Decision Making in Mobile Robots2018/11/1
- REBA: A Refinement-Based Architecture for Knowledge Representation and Reasoning in Robotics2015/8/1
- Combining Answer Set Programming and POMDPs for Knowledge Representation and Reasoning on Mobile Robots2013/7/1