Zirui Song
収録論文 5本 ・ フィジカルAI/ロボット学習
画像編集評価/マルチモーダルLLMVLAVLA/計画マニピュレーション家庭内ロボット
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MLLM審判は編集を正しく評価しているか?品質保持を検証した画像編集評価におけるバイアスの監査画像編集評価/マルチモーダルLLM2026/10/1
編集品質を保つよう検証された反事実ベンチマークEditJudgeBiasを構築し、5つのMLLM審判が無関係な手がかりに影響されるバイアスを3つの観点から監査した。
- LayerRoute: 行動条件付きレイヤー混合ルーティングによる視覚言語行動ポリシーVLA2026/9/5
視覚言語行動(VLA)ポリシーにおいて、行動モジュールの状態に応じてVLMのレイヤー表現を動的に混合・再利用するルーティング手法を提案し、シミュレーションと実世界で性能を向上させた。
- トークン予測は計画ではない:物理に基づく因果推論エージェントの構築VLA/計画2026/6/1
身体性を持つ視覚言語計画の評価では、言語的な次トークン予測が重視されがちですが、本研究では物理的な因果推論を促すベンチマークと大規模データセットを構築し、因果推論を学習したモデルが計画性能を向上させることを示しました。
- ManipLVM-R1: 大規模視覚言語モデルによる具現化マニピュレーションの推論のための強化学習マニピュレーション2025/5/1
高価な人手アノテーションに頼らず、検証可能な報酬を用いた強化学習で大規模視覚言語モデルを訓練し、ロボットマニピュレーションの汎化と物理的推論を向上させるフレームワークを提案。
- 家庭内の危険を先回りして検知・対処するロボット家庭内ロボット2024/11/1
基盤モデルとマルチエージェント議論で家庭内の危険シナリオを自動生成し、ロボットが異常を能動的に発見・対処するスキルを学習する手法を提案した。