Yonatan Bisk
Carnegie Mellon University
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 文脈的観察者接地:視覚言語モデルにおける状況的空間推論の評価VLA/空間推論2026/9/7
ロボットなどの身体化タスクで、話者の視点に基づく空間関係の理解を評価するベンチマークPOVBenchを構築し、最新の視覚言語モデルが文脈から観察者の視点を推論して対象を特定できるかを検証した。
- 再構成の迷子:視覚-言語-行動モデルにおける行動表現と言語の整合VLA2026/8/1
行動軌跡には言語的意味情報が含まれるが、再構成のみのトークン化で失われるため、凍結VLMで指示を復元する補助損失を加えた意味整合トークナイザSALTを提案し、SimplerEnvで成功率を大幅に向上させた。
- 平坦性が視覚言語行動モデルの指示追従を維持するVLA2026/6/1
視覚言語行動モデルの微調整時に平坦性を保つ最適化を適用し、指示無視の失敗を大幅に改善した。
- ロボット操作における帰納的一般化マニピュレーション2026/6/1
視覚運動ポリシーの一般化能力を、従来の分布内シフトではなく、より困難な分布外タスク変種で評価する「帰納的一般化」プロトコルを提案し、既存のVLAモデルがこのテストに失敗することを示した論文。
- ELASTIC: 生成制御ポリシーのテスト時計算を適応的にスケールする効率的学習制御ポリシー2026/6/1
ロボット制御の生成ポリシー(拡散ポリシーやVLAモデル)において、状態に応じて推論時の計算量(逐次ステップ数と並列サンプル数)を強化学習で適応的に割り当てる手法を提案し、シミュレーションと実機で性能と効率を両立した。
- IndoorR2X: LLM駆動計画による屋内ロボット対全機器連携群制御2026/3/1
屋内環境のIoTセンサーと移動ロボットを統合し、LLMによる計画でマルチロボットのタスク効率を高めるベンチマークとシミュレーションフレームワークを提案した。
- アフォーダンスRAG:モバイルマニピュレーションのためのアフォーダンス認識型身体化記憶を用いた階層的マルチモーダル検索マニピュレーション2025/12/1
自由形式の指示に基づく移動マニピュレーションのため、事前探索画像からアフォーダンス認識型の身体化記憶を構築し、階層的マルチモーダル検索で対象物を特定するゼロショット手法を提案した。
- RobotArena ∞: 実機からシミュレーションへの変換によるスケーラブルなロボットベンチマークVLA2025/10/1
実機の動画デモを生成モデルでシミュレーション環境に自動変換し、VLAポリシーを大規模かつ再現可能に評価するベンチマークフレームワークを提案。
- RAVEN: オープンセット意味記憶と行動適応による堅牢な空中ナビゲーション空中ナビゲーション2025/9/1
屋外の大規模環境で対象物を探す空中ロボット向けに、3D意味ボクセルマップを記憶として使い、ビヘイビアツリーで探索行動を切り替えるナビゲーション手法を提案。
- マイクロロボット向け高トルク密度PCBアキシャルフラックス永久磁石モータアクチュエータ2025/9/1
IC基板HDI技術で作製した48層PCB巻線により、直径19mm・厚さ5mmで銅充填率45%を達成したマイクロアキシャルフラックスモータを開発し、電磁・熱解析と試作機で性能を検証した。
- Casper: 視覚言語モデルによる多様な意図推論を実現する支援型遠隔操作遠隔操作2025/6/1
視覚言語モデルの常識知識を活用し、ユーザーの操作入力から多様な意図をリアルタイムに推論して、長期的な移動マニピュレーション作業を支援する遠隔操作システムを提案した。
- ANAVI: 屋内環境の視覚情報を用いた音騒音認識によるナビゲーションナビゲーション2024/10/1
屋内環境の視覚情報から音の大きさを予測し、ロボットが周囲に配慮した静かな経路計画を行えるようにした研究。
- MotIF: 動作指示ファインチューニングVLA2024/9/1
ロボットの動作の成否を判定するために、キーポイント軌跡を最終画像に重ねた抽象表現で視覚言語モデルをファインチューニングする手法を提案し、MotIF-1Kデータセットを構築した。
- Embodied-RAG: 具現化エージェントのための汎用ノンパラメトリック記憶検索生成VLA2024/9/1
ロボットの探索で得たマルチモーダルな知識を階層的な「意味の森」として記憶し、ナビゲーションや言語生成に活用するRAGフレームワークを提案した。
- DegustaBot: 個人の好みに基づくマルチオブジェクト再配置のためのゼロショット視覚嗜好推定マニピュレーション2024/7/1
視覚言語基盤モデルとゼロショット視覚プロンプトを用いて、家庭内の物体再配置タスクを個人の視覚的嗜好に合わせて解く手法を提案し、シミュレーションで評価した。
- 状況依存型指示追従指示追従2024/7/1
人間がその場で発する曖昧で時間的に変化する指示を、過去の行動や文脈から解釈してロボットが実行する「状況依存型指示追従」を提案し、既存のEIFモデルが人間の意図を十分に理解できないことを示した。
- 家庭内でのオープンワールド移動マニピュレーションに向けて:NeurIPS 2023 HomeRobotオープン語彙移動マニピュレーションチャレンジからの教訓移動マニピュレーション2024/7/1
家庭環境で任意の物体を見つけて任意の場所に置くオープン語彙移動マニピュレーションのベンチマークを提案し、NeurIPS 2023コンペを実施。シミュレーションと実世界で評価し、成功チームに共通するエラー検出・回復と知覚・意思決定の統合の重要性を示した。
- ロボットとの対話:SLIVARコミュニティの参加と研究を広げるための提案音声対話2024/4/1
ロボットとの音声対話研究の近年の動向をまとめ、教育・ベンチマーク・言語モデリングの3つの提案を示したホワイトペーパー。
- Vid2Robot: クロスアテンションTransformerによる動画条件付きエンドツーエンド方策学習VLA2024/3/1
人間の操作動画を入力として、クロスアテンションTransformerでロボットの行動を生成するエンドツーエンド方策を提案し、実機で従来手法を20%以上上回る性能と物体間の動作転移を実現した。
- Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation2023/12/1
- Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis2023/12/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- MOSAIC: Learning Unified Multi-Sensory Object Property Representations for Robot Learning via Interactive Perception2023/9/1
- Reasoning about the Unseen for Efficient Outdoor Object Navigation2023/9/1
- MAEA: Multimodal Attribution for Embodied AI2023/7/1
- HomeRobot: Open-Vocabulary Mobile Manipulation2023/6/1
- Spatial-Language Attention Policies for Efficient Robot Learning2023/4/1
- Self-Supervised Object Goal Navigation with In-Situ Finetuning2022/12/1
- Transformers are Adaptable Task Planners2022/7/1
- A Framework for Learning to Request Rich and Contextually Useful Information from Humans2021/10/1
- Language Grounding with 3D Objects2021/7/1
- ALFWorld: Aligning Text and Embodied Environments for Interactive Learning2020/10/1
- RMM: A Recursive Mental Model for Dialog Navigation2020/5/1
- ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks2019/12/1
- Improving Robot Success Detection using Static Object Data2019/4/1
- Tactical Rewind: Self-Correction via Backtracking in Vision-and-Language Navigation2019/3/1
- Prospection: Interpretable Plans From Language By Predicting the Future2019/3/1
- Early Fusion for Goal Directed Robotic Vision2018/11/1
- Balancing Shared Autonomy with Human-Robot Communication2018/5/1