Siyuan Li
Harbin Institute of Technology
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MemForest: EventTree分割と段階的マージによる効率的なエージェントメモリ管理エージェントメモリ管理2026/9/8
エージェントの履歴メモリをイベント単位に分割し、最大全域木と冗長ノードの段階的マージで圧縮するフレームワークを提案。メモリ圧縮率50%で性能をほぼ維持しつつ、検索を高速化した。
- 具現化エージェントのための長期グラフメモリを用いた安全なタスク計画タスク計画2026/9/8
LLM/VLMによるタスク計画に、環境の長期意味グラフメモリを組み合わせ、物理的リスクを予測して安全な行動を計画するフレームワークSafeMemを提案した。
- DVPSFormer: 自動運転のための効率的なオンライン深度対応ビデオパノプティックセグメンテーションパノプティックセグメンテーション2026/7/28
自動運転向けに、深度・セマンティックセグメンテーション・インスタンス追跡を統合したオンライン4Dシーン理解アーキテクチャを提案。明示的なシーン離散化とオンライン多数決により、リアルタイム処理を実現し、ベンチマークでSOTAを達成。
- ConceptTree: ロボット操作のブラックボックス意思決定に意味的透明性をもたらすマニピュレーション2026/7/1
ロボット操作の高レベルスキル選択を、人間が解釈可能な概念に基づく決定木で表現し、透明性と介入可能性を実現するフレームワークを提案した。実世界の複雑な長期的タスクで既存手法より優れた性能を示し、個々の概念の修正による細かい介入も可能にした。
- ワールドモデル:アーキテクチャ、方法論、推論パラダイム、応用に関する包括的サーベイサーベイ2026/5/28
環境の構造とダイナミクスを学習する内部シミュレータであるワールドモデルについて、アーキテクチャ、方法論、推論戦略、応用領域の4軸で分類する包括的なサーベイを提供する。
- Key-Gram: 身体化操作のための拡張可能な世界知識操作2026/5/1
言語由来の世界知識を視覚状態推論から分離する条件付きメモリフレームワークKey-Gramを提案し、指示をタスク固有のキーグラムに分解して外部メモリから検索・注入することで、バックボーンの視覚推論能力を保ちつつ知識拡張を容易にした。
- 音声・視覚・固有感覚の階層的融合による精密ロボットマニピュレーションマニピュレーション2026/2/1
音声・視覚・固有感覚を階層的に融合し、拡散ポリシーで連続動作を生成するロボットマニピュレーション手法を提案。液体注ぎやキャビネット開けなどの実タスクで評価した。
- FUTURE-VLA: 実時間実行下での統合軌道予測VLA2026/2/1
長時間の映像履歴を効率的に圧縮し、潜在空間での自己回帰により将来の視覚予測と行動生成を単一のフォワードパスで行うVLAアーキテクチャを提案。予測に基づく人間参加型の実行ゲーティングも実現した。
- MrCoM: マルチシナリオに汎化するメタ正則化ワールドモデルモデルベースRL2025/11/9
同一シミュレータ内の力学特性の共通性を利用し、潜在状態を動的特性ごとに分解してメタ状態・メタ価値正則化を施すことで、複数シナリオに汎化する統一ワールドモデルを構築した。
- 抽象障害物マップとトポロジカルグラフを活用したゼロショット視覚言語ナビゲーションVLA2025/9/1
MLLMと抽象障害物マップ上のウェイポイント予測を組み合わせ、訪問履歴付きトポロジカルグラフをプロンプトに組み込むことで、連続環境でのゼロショット視覚言語ナビゲーションを高精度化した研究。
- Safe Planner: 大規模事前学習モデルに安全性認識を付与するロボットタスクプランニングタスクプランニング2024/11/1
大規模事前学習モデルによるロボットのタスクプランニングに、シミュレータで学習した安全性予測モジュールを組み合わせ、実環境でも安全かつ実行可能な計画を生成するフレームワークを提案した。
- 追跡・ロックオン・発射ミッションのための模倣強化学習フレームワーク強化学習2024/6/1
専門家データを活用した模倣学習と強化学習を組み合わせ、UCAVの近接空中戦における追跡・ロックオン・発射を自律的に学習するフレームワークを提案。
- Learning to Solve Tasks with Exploring Prior Behaviours2023/7/1