Jiebo Luo
収録論文 6本 ・ フィジカルAI/ロボット学習
ビデオ生成/編集マルチモーダルナビゲーションVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EditStream: 対話型ビデオ生成と編集のための統一オートリグレッシブフレームワークビデオ生成/編集2026/8/16
ビデオ生成と編集を単一のDiTベースモデルで統合し、高速な数ステップのオートリグレッシブモデルに変換するフレームワークを提案。テキストからビデオ、画像からビデオ、編集伝播など多様なタスクをサポートし、対話的なクリエイティブワークフローを実現する。
- 大規模基盤モデルにおける音声視覚知能マルチモーダル2026/5/5
音声と視覚の統合的理解・生成・対話を大規模基盤モデルの観点から体系的に整理した初のサーベイ論文。
- Uni-LaViRA: 言語・視覚・ロボット行動の翻訳による統合具現化ナビゲーションナビゲーション2026/5/1
ナビゲーションの意思決定構造を言語と視覚の行動出力に分解し、事前学習済みMLLMを活用してゼロショットで4つのタスクと4種類のロボットに適用する統合エージェントアーキテクチャを提案した。
- ロボティクスにおける視覚言語行動モデルの敵対的脆弱性の探究VLA2024/11/1
VLAモデルに対する敵対的パッチ攻撃を提案し、シミュレーションと実環境で最大100%のタスク成功率低下を引き起こすことを示した。
- SurgicalPart-SAM: Part-to-Whole Collaborative Prompting for Surgical Instrument Segmentation2023/12/1
- SurgicalSAM: Efficient Class Promptable Surgical Instrument Segmentation2023/8/1