Boyi Li
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 計画整合型トークン圧縮による長文脈自動運転自動運転2026/6/1
自動運転のためのモノリシックな視覚行動モデルにおいて、長期の文脈を圧縮する際に計画情報を活用するフレームワークを提案し、成功率を向上させた。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- 万能ポリシー:幾何学を考慮した行動潜在表現による異種ロボット間操作マニピュレーション2026/3/1
異なるロボット間で共有可能な行動潜在表現を学習し、単一のポリシーで複数のロボットを操作するフレームワークを提案。
- 自動運転における構造化Chain-of-Thoughtの高速化VLA2026/2/1
自動運転のVLAモデル向けに、Chain-of-Thought推論を依存グラフに分解し並列デコードすることで、精度を保ちつつ3〜4倍高速化する手法を提案。
- DexImit: 単眼人間動画からの両手巧みなマニピュレーション学習マニピュレーション2026/2/1
単眼の人間の操作動画を物理的に妥当なロボットデータへ自動変換する4段階パイプラインを提案し、両手巧みなマニピュレーションの学習を可能にした。
- 反事実的VLA:適応的推論を備えた自己反省型視覚-言語-行動モデルVLA2025/12/1
自動運転VLAモデルが計画した行動を反事実的に推論して修正する自己反省フレームワークを提案し、軌道精度と安全性を向上させた。
- Alpamayo-R1: 長尾シナリオにおける汎化可能な自動運転のための推論と行動予測の橋渡し自動運転/VLA2025/11/1
視覚言語行動モデルに因果連鎖推論を組み込み、拡散ベースの軌道デコーダと強化学習を組み合わせることで、長尾の安全臨界シナリオでの自動運転計画精度と推論品質を向上させた研究。
- ネガティブデータの活用:衝突報告から反事実推論へ、安全な自動運転のための判断支援自動運転2025/9/1
衝突報告を自車視点の言語に正規化し、ログと衝突を統一シーン行動表現に変換して検索可能にすることで、提案行動の妥当性を過去事例から判断する自動運転システムを構築した。
- シミュレーションの音:生成的音声でマルチモーダルなsim-to-realロボット方策を学習sim2real2025/7/1
物理シミュレータに大規模生成モデルを統合し、映像に条件づけたリアルな音声を合成することで、実機データなしに注ぐタスクのマルチモーダル方策を学習し、未知の容器や液体へのゼロショット転移を実現した。
- テスト時観測介入による再想像:視覚モデル予測制御のための妨害物に頑健な世界モデル予測モデルベース強化学習2025/6/1
世界モデルが未知の視覚的妨害物に弱い問題に対し、テスト時に妨害物を検出・除去して予測を再想像し、事後的に妨害物を戻すことで、行動検証を頑健にする手法を提案。
- PhysBench:視覚言語モデルの物理世界理解を評価・強化するベンチマークVLA2025/1/1
視覚言語モデル(VLM)の物理世界理解を評価する10,002件のベンチマークPhysBenchを提案し、75モデルの評価と、視覚モデルを組み合わせて物理理解を強化するPhysAgentを開発した。
- LoRA3D: 3D幾何学基盤モデルの低ランク自己校正3D再構成2024/12/1
スパースなRGB画像から3D幾何学基盤モデルを自己校正し、低ランク適応でシーンに特化させる手法を提案。単一GPUで5分以内に完了し、3D再構成と多視点姿勢推定で最大88%の性能向上を達成。
- 外挿的な都市ビュー合成ベンチマークsim2real2024/12/1
自動運転向けの新規視点合成(NVS)において、訓練視点から大きく外れた視点での性能を評価する初のベンチマークEUVSを構築し、既存手法が訓練視点に過適合しやすいことを示した。
- プロンプト可能な閉ループ交通シミュレーション交通シミュレーション2024/9/1
数値・カテゴリ・テキストのプロンプトで各エージェントの挙動を指示し、閉ループで交通シナリオを生成するマルチモーダル交通シミュレーション手法ProSimを提案。
- 世界をオブジェクト知識にトークン化し、自動運転のロングテール事象に対処する自動運転/VLA2024/7/1
自動運転のロングテール事象に対処するため、シーンをオブジェクトレベルの知識にトークン化してLLMの推論能力を活用するマルチモーダルLLM「TOKEN」を提案し、軌道誤差と衝突率を大幅に削減した。
- 大規模言語モデルによる運転ポリシーの適応でどこでも走行自動運転2024/2/1
大規模言語モデルを使って各地域の交通ルールを解釈し、自動運転車の運転行動を新しい環境に適応させる手法LLaDAを提案した。
- Interactive Task Planning with Language Models2023/10/1