Si Liu
Beihang University
収録論文 37本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 再計画ではなく修正:閉ループWorld-Actionモデルのための修正可能な視覚プランVLA2026/9/28
予測した視覚的未来を行動条件として保持し、実行フィードバック後に学習済みの修正ブリッジで中間状態から継続を適応させるRTPを提案。RoboMMEとRMBenchで高い成功率を示した。
- DyMD: 分布マッチング蒸留による少数ステップ動画世界モデルでの相互作用ダイナミクス保持動画生成/蒸留2026/9/25
動画拡散モデルの蒸留において、ロボットと物体の動きを保ちながら4ステップで生成できるDyMDを提案し、身体性動画ベンチマークでタスク遵守率を9.6ポイント改善した。
- GaussianDream++: ロボット操作のための効率的な3Dガウス世界モデリングVLA/3Dガウス/世界モデル2026/8/26
VLAポリシーに世界状態トークンと世界予測トークンを挿入し、訓練時のみ3Dガウス表現で現在と未来の世界を監督することで、推論時の追加コストなしに操作性能を向上させる手法を提案。
- SoftVTBench: 変形を考慮した視覚触覚データセットと変形物体操作のベンチマーク変形物体操作/データセット/ベンチマーク2026/8/19
変形物体操作の物理的相互作用品質を評価するため、視覚触覚データセットと閉ループベンチマークを構築し、変形許容度を考慮した成功率を提案した。
- パノラマ認識型VLAによる全身遠隔操作を用いた移動操作の学習VLA2026/8/1
全身遠隔操作システムとパノラマ認識型VLAポリシーを開発し、移動操作タスクの成功率を大幅に向上させた。
- RoboInter1.5: 身体性世界モデリングとロボット操作のための包括的中間表現スイート操作/データセット/世界モデル2026/7/1
ロボット操作と身体性世界モデリングのための、多様な中間表現(サブタスク、プリミティブスキル、物体・グリッパー接地、セグメンテーション、アフォーダンス、把持姿勢、接触点、動作軌跡など)を備えた大規模データセット、ベンチマーク、モデル群を構築した。
- SoftVTBench: 物理的制約下での変形物体操作のための安全性を考慮した視覚触覚ベンチマークベンチマーク/変形物体操作/触覚2026/7/1
変形物体の操作において、タスク完了だけでなく物理的安全性(落下や過度な変形の回避)を評価するベンチマークを提案し、触覚センシングが安全性向上に寄与することを示した。
- EVA-Client: 実ロボット上の身体化ポリシーのための統合データ収集・推論・展開フレームワークマニピュレーション2026/7/1
実ロボットで学習済み操作ポリシーを展開・評価・データ収集するためのオープンソースフレームワークを提案。コンポーネント分離アーキテクチャとデバッグ/収集/評価ワークフローを備え、評価がそのまま次の学習用データ収集になる。
- CR-Solver: 腱駆動連続体ロボット向けGPU高速化キネマティクスソルバー連続体ロボット2026/7/1
腱駆動連続体ロボットの運動生成のための、GPU並列最適化に基づく2段階ソルバーを提案し、逆運動学・経路追従・軌道計画を統一的に扱い、高速かつ高精度な解を実現した。
- TORL-VLA: 触覚誘導による接触を伴う操作のためのオンライン強化学習操作/強化学習2026/6/1
触覚フィードバックを利用して、接触を伴う操作タスクでオフラインポリシーをオンライン適応させる強化学習フレームワークを提案。実機実験で成功率と効率を向上。
- パイロットのように考える:高精度な長期間UAVナビゲーションUAVナビゲーション2026/6/1
UAVエージェント向けに、多段階の指示と高密度な6自由度軌道を備えたベンチマークFLIGHTを導入し、低頻度の推論と高頻度の制御を分離する非同期アーキテクチャFLIGHT VLAを提案した。
- GE-Sim 2.0: ロボット操作のための包括的クローズドループ映像世界シミュレータへのロードマップシミュレーション2026/5/1
ロボット操作のためのクローズドループ映像世界シミュレータGE-Sim 2.0を提案。実ロボットデータで再学習し、状態デコーダ、世界判定器、高速化モジュールを追加して、映像シミュレーションからポリシー学習へのループを閉じる。
- ManiSoft: ソフト連続体ロボットのための視覚言語操作に向けてソフトロボティクス/操作2026/5/1
ソフトロボットアームの視覚言語操作を研究するためのベンチマークとシミュレータを提案し、変形制御の課題を評価する。
- GaussianDream: ロボット操作のためのフィードフォワード3Dガウス世界モデルVLA/世界モデル2026/5/1
本論文は、ロボット操作のためのフィードフォワード型3Dガウス世界モデルを提案し、現在の3D空間構造と短期的な未来の進化を捉えることで、行動生成の精度を向上させる。
- VGGT-Segmentor: 幾何学強化によるクロスビューセグメンテーションセグメンテーション2026/4/15
異なる視点(自己中心視点と外部視点)間での物体インスタンスセグメンテーションを、幾何学モデルVGGTと新しいUnionセグメンテーションヘッドを組み合わせて高精度化し、教師なし学習で汎化を実現した。
- AdaTracker: クロスエンボディメント能動的視覚追跡のための適応的インコンテキストポリシー学習視覚追跡/クロスエンボディメント2026/4/1
多様なロボット形態で動作する統一モデルによる能動的視覚追跡を実現するため、エンボディメント固有の制約を文脈として学習し、未知のロボットへゼロショット適応するフレームワークを提案した。
- BiCoord: 長時間・空間時間的協調を目指す両腕操作ベンチマーク両腕操作/ベンチマーク2026/4/1
両腕操作のための長時間かつ密に協調したタスクを含む新しいベンチマークを提案し、既存のポリシーが困難を抱えることを示した。
- OmniVTA: 接触を伴うロボット操作のための視覚-触覚世界モデル操作2026/3/1
接触を伴う操作タスクのために、大規模な視覚-触覚-行動データセットと、触覚信号を予測・閉ループ制御に活用する世界モデルベースのフレームワークを提案した論文。
- シーングラフ上の探索と逐次マニピュレーションを統合したLLMベース状況再計画マニピュレーション2026/2/1
未知環境でロボットが探索と逐次操作計画を統合するため、シーングラフ上でグラフ編集操作により行動列を生成し、LLMで状況に応じて再計画するフレームワークEPoGを提案。家庭環境タスクで91.3%の成功率を達成。
- RoboInter:ロボットマニピュレーションのための包括的中間表現スイートマニピュレーション2026/2/1
ロボット操作のためのデータ・ベンチマーク・モデルを統合した中間表現スイートを提案し、大規模データセットとVQAベンチマーク、計画実行フレームワークを提供する。
- 指示からイベントへ:音トリガー型モバイルマニピュレーションモバイルマニピュレーション2026/1/1
音を発する物体を自律的に検知・操作する「音トリガー型モバイルマニピュレーション」を提案し、音響レンダリングと物理操作を統合したデータ基盤Habitat-Echoとベースライン手法を開発した。
- ACoT-VLA: 視覚言語行動モデルのための行動連鎖推論VLA2026/1/1
行動空間で直接推論する「行動連鎖推論(ACoT)」を提案し、粗い行動意図を明示的・暗黙的に生成して最終方策を導くVLAアーキテクチャを実現した。
- 手描きスケッチマップによる未知環境ナビゲーションの学習ナビゲーション2025/8/1
手描きのスケッチマップだけを頼りに未知環境で目的地を目指すナビゲーションタスクSkeNaを提案し、大規模データセットSoRと手法SkeNavigatorを構築した。
- Genie Envisioner:ロボット操作のための統合ワールド基盤プラットフォームVLA2025/8/1
指示条件付き動画拡散モデルを核に、方策学習・評価・シミュレーションを一つの動画生成フレームワークへ統合した基盤を提案し、軽量デコーダで行動軌跡を生成、専用ベンチマークも整備した。
- AirStar:音声とジェスチャーで操る知能ドローンアシスタントVLA2025/7/1
大規模言語モデルを頭脳に、音声やジェスチャーで指示できるドローン「AirStar」を開発。地理空間知識と文脈推論を組み合わせ、バドミントンコートまで案内するなど、長距離ナビゲーションと近距離制御を実現した。
- RoboCerebra:長期的ロボットマニピュレーション評価のための大規模ベンチマークマニピュレーション2025/6/1
家庭環境での長期的なロボット操作タスクを評価する大規模ベンチマークを提案し、VLMによる高レベル計画とVLAによる低レベル制御を組み合わせた階層的フレームワークと評価プロトコルを構築した。
- OctoNav: 汎用身体性ナビゲーションに向けてナビゲーション2025/6/1
マルチモーダルで多能力な自由形式指示に従える汎用ナビゲーションエージェントのための大規模ベンチマークOctoNav-Benchと、MLLMをVLA化したOctoNav-R1を提案。
- UAV-Flow Colosseo:言葉に反応して飛ぶUAV模倣学習の実世界ベンチマークVLA2025/5/1
言語指示に応じて短距離・反応的な飛行を行う「Flying-on-a-Word」タスクを定式化し、実世界データセット・制御フレームワーク・シミュレータを備えた初のベンチマークUAV-Flowを構築した。
- 敵対的データ収集:効率的でロバストなロボット模倣学習のための人間協調型摂動模倣学習2025/3/1
人間がリアルタイムで環境や指示を攪乱するHiL型データ収集法を提案し、少ないデモ数で模倣学習の汎化・ロバスト性・回復能力を大幅に向上させた。
- TopV-Nav: マルチモーダル大規模言語モデルの俯瞰視点空間推論能力を活用したゼロショット物体ナビゲーションナビゲーション2024/11/1
マルチモーダル大規模言語モデルが俯瞰地図を直接推論できるようにする手法を提案し、未知環境でのゼロショット物体ナビゲーション精度を向上させた。
- 現実的なUAV視覚言語ナビゲーションに向けて:プラットフォーム・ベンチマーク・手法VLA2024/10/1
UAV向けの視覚言語ナビゲーション(VLN)を現実的にするため、飛行制御を備えたOpenUAVプラットフォーム、約1.2万軌道のデータセット、補助情報付きベンチマークUAV-Need-Help、およびマルチモーダルLLMベースのナビゲーション手法を提案した論文。
- CooHOI: 操作物体の動力学を活用した協調的人間-物体インタラクションの学習マニピュレーション2024/6/1
単一ヒューマノイドの模倣学習とマルチエージェント強化学習を組み合わせ、複数体で協調して物体を運ぶスキルを獲得するフレームワークを提案。
- 自動運転のための非同期LLM拡張プランナー自動運転2024/6/1
LLMの推論を非同期化してリアルタイムプランナーを誘導し、計算コストを抑えつつ自動運転の軌道計画性能を向上させたフレームワーク。
- Realistic Rainy Weather Simulation for LiDARs in CARLA Simulator2023/12/1
- Optimizing the Placement of Roadside LiDARs for Autonomous Driving2023/10/1
- Analyzing Infrastructure LiDAR Placement with Realistic LiDAR Simulation Library2022/11/1
- Delving into the Devils of Bird's-eye-view Perception: A Review, Evaluation and Recipe2022/9/1