Linus Nwankwo
収録論文 7本 ・ フィジカルAI/ロボット学習
視覚グラウンディングVLAデータセット
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Pro-Bench: 実世界の異種環境におけるプロンプト頑健なオープンボキャブラリ視覚グラウンディングのベンチマーク視覚グラウンディング2026/9/22
地下・産業・屋内・屋外・都市など多様な実環境のロボット画像13k枚以上と515の多様なクエリを用い、16のオープンボキャブラリモデルのゼロショット視覚グラウンディング性能とプロンプト頑健性を評価するベンチマークを提案した。
- SIL: 言語条件付き人間-エージェント共適応のための共生インタラクティブ学習VLA2025/11/1
人間とエージェントが共有潜在タスク空間で双方向に信念を更新し合い、能動的な確認や提案を行う共生インタラクティブ学習フレームワークを提案。実世界・シミュレーションタスクで90.4%の完了率を達成。
- リアルタイム3D視覚言語埋め込みマッピングVLA2025/8/1
視覚言語モデルの2次元埋め込みを、実時間でメートル精度の3次元表現に統合する手法を提案し、自然言語による対象物の位置特定を可能にした。
- ReLI: 言語に依存しない人間-ロボットインタラクション手法VLA2025/5/1
大規模基盤モデルを言語から行動へのモデルに変換し、多言語での自然な対話を通じてロボットが環境を推論しタスクを実行できる言語非依存の手法を提案。140言語で90%以上の精度を達成。
- EnvoDat: 異種環境におけるロボットの空間認識と意味推論のための大規模マルチセンサデータセットデータセット2024/10/1
都市以外の多様で過酷な環境(地下トンネル、自然地形、屋内など)で収集した10種類のセンサモダリティ、1.9TB超、82クラス以上の注釈付き大規模マルチモーダルデータセットを構築し、SLAMや視覚モデルのベンチマークを可能にした。
- 事前学習済み言語・視覚基盤モデルを用いた人間と自律エージェントのマルチモーダル対話VLA2024/3/1
LLM・視覚言語モデル・音声認識モデルを組み合わせ、人間が音声やテキストで自律ロボットと自然に対話し指示できるフレームワークを構築し、音声コマンドの理解精度や実行成功率を評価した。
- The Conversation is the Command: Interacting with Real-World Autonomous Robot Through Natural Language2024/1/1