Zhangyang Wang
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VASO: 物理AIエージェントのための形式的検証可能な自己進化スキルスキル学習2026/6/3
LLMが生成したロボットスキル契約を、モデル検査による形式的検証と反例に基づくテキスト勾配で自己進化させるフレームワークVASOを提案。未テスト条件下でも時間的安全性を満たすスキルを少数サンプルで獲得できる。
- 物理基盤のマルチエージェントダイナミクスベンチマーク:ワールドモデルにおけるワールドモデル2026/6/1
ワールドモデルの生成するマルチエージェント衝突シナリオの物理的妥当性を評価するフレームワークCrashTwinを提案し、既存モデルが視覚品質は高いが物理法則に反する挙動を示すことを明らかにした。
- 物体が「何であるか」ではなく「何を可能にするか」:アフォーダンス推論のための機能的潜在空間アフォーダンス推論2026/6/1
外見ではなく機能(アフォーダンス)に基づく潜在空間を導入し、ロボットのプランニングにおける物体の機能推論を可能にする手法A4Dを提案した。
- どこに展開するかを見る:空中から地上への隠れた空間検査のためのメトリックRGBベースの走行可能性解析sim2real2026/3/1
UAVがUGVを隠れた空間に投入するため、RGB画像からメトリックな幾何・意味再構成を行い、展開可能領域を評価する枠組みを提案した。
- UNCAP: 不確実性誘導型ニューロシンボリック計画と自然言語通信による協調自動運転VLA2025/10/1
自動運転車同士が自然言語メッセージで通信し、知覚の不確実性を明示的に考慮して協調計画を行う視覚言語モデルベースの手法を提案。通信帯域を削減しつつ安全性を向上させる。
- LAD-VF: LLM自動微分による形式手法フィードバックを用いたファインチューニング不要のロボットプランニングVLA2025/9/1
形式検証のフィードバックをプロンプト改善に活用し、モデルの再学習なしでLLMのロボット計画の安全性・仕様遵守を高めるフレームワークを提案。
- VLN-Zero:ゼロショット移動のための高速探索とキャッシュ活用型ニューロシンボリック視覚言語ナビゲーションVLA2025/9/1
VLMでシーングラフを効率的に構築し、ニューロシンボリックな計画とキャッシュ実行を組み合わせることで、未知環境でのゼロショット視覚言語ナビゲーションを高速・高精度に実現した研究。
- AutoTrust: 自動運転向け大規模視覚言語モデルの信頼性ベンチマークVLA2024/12/1
自動運転向け視覚言語モデルの信頼性を、信憑性・安全性・堅牢性・プライバシー・公平性の観点から評価するベンチマークを構築し、6つのモデルを比較評価した。
- マルチモーダル基盤モデルによる計画時の不確実性を分離・定量化する形式的手法VLA2024/11/1
視覚理解に起因する知覚不確実性と計画生成の決定不確実性を分離し、形式検証とConformal Predictionで定量化して、能動的再観測や高確信データでの微調整によりロボットタスクの信頼性を高める枠組みを提案した。
- OpenAI o1モデルの計画能力:実現可能性・最適性・汎化性の評価LLM計画2024/9/1
OpenAIのo1モデルの計画能力を、制約の多いタスクや空間的に複雑な環境で評価し、制約遵守や状態遷移管理に優れる一方、冗長な行動や空間的汎化に課題があることを明らかにした。
- MM3DGS SLAM:視覚・深度・慣性計測を用いたマルチモーダル3DガウシアンスプラッティングSLAMSLAM2024/4/1
3Dガウシアンスプラッティングと視覚・深度・慣性計測を統合し、未姿勢カメラ画像から高精度なSLAMを実現する手法を提案。追跡精度が3倍、描画品質が5%向上し、リアルタイムで高解像度3Dマップを生成できる。
- Fine-Tuning Language Models Using Formal Methods Feedback2023/10/1
- Skeleton-Graph: Long-Term 3D Motion Prediction From 2D Observations Using Deep Spatio-Temporal Graph CNNs2021/9/1
- Scalable Perception-Action-Communication Loops with Convolutional and Graph Neural Networks2021/6/1
- Automated Synthetic-to-Real Generalization2020/7/1