Borong Zhang
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FabriVLA: 軽量視覚言語行動モデルと共形アクションチャンク不確実性VLA/不確実性/操作2026/7/1
軽量なVLAモデルFabriVLAを提案し、Meta-World MT50で90%の成功率を達成。さらに、共形予測を用いてアクションの不確実性を定量化するJCAC法を導入し、実行前のリスク評価を可能にした。
- 暗黙の仮想リーダー:マルチロボット編隊のための分散型視覚のみの相対姿勢推定群制御2026/7/1
GPSの使えない環境で、各ロボットの単眼画像と通信メッセージから6自由度の相対姿勢を推定する学習ベースの手法を提案。チーム重心に仮想的なリーダーを暗黙に学習し、単一障害点を排除した分散推定を実現。
- E²DT:経験認識サンプリングによる効率的かつ効果的なロボット操作のためのディシジョン・トランスフォーマー強化学習2026/5/1
ロボット操作の強化学習において、ディシジョン・トランスフォーマーの性能を向上させるため、経験の質と多様性を考慮したサンプリング手法を提案した論文。
- RedVLA: 視覚言語行動モデルに対する物理的レッドチーミング安全性2026/4/1
VLAモデルの物理的安全性リスクを事前検出するため、リスクシナリオ合成とリスク増幅の2段階からなるレッドチーミングフレームワークRedVLAを提案し、生成データで軽量ガードSimpleVLA-Guardも構築した。
- 120分とノートPCだけで実現する画像ゴールナビゲーション:教師なし探索とオフライン強化学習による最小構成アプローチナビゲーション2026/3/1
大規模データや高価な計算資源を前提とせず、ノートPC上で120分以内にデータ収集から実環境でのポリシー展開までを自動で行う画像ゴールナビゲーション手法MINavを提案した。
- VLA-Arena: 視覚言語行動モデルを評価するためのオープンソースベンチマークフレームワークVLA2025/12/1
VLAモデルの能力限界と失敗モードを定量化するため、タスク構造・言語・視覚の3軸で難易度を設計した170タスクのベンチマークを提案し、最先端モデルの汎化不足や安全性軽視を明らかにした。
- 部分観測下の強化学習における記憶の分析ツールとPOPGym Arcade強化学習/部分観測/記憶2025/3/1
部分観測環境でエージェントが記憶をどう使うかを分析するツールと、完全観測/部分観測の対照実験が可能なAtari風ベンチマークPOPGym Arcadeを提案し、価値関数が無関係な履歴にクレジットを拡散する問題を明らかにした。
- SafeVLA:制約付き学習による視覚言語行動モデルの安全アラインメントVLA2025/3/1
視覚言語行動モデル(VLA)に制約付きマルコフ決定過程を用いた安全強化学習を適用し、タスク成功率を維持しつつ安全違反コストを大幅に削減する手法を提案した。