Yara Mahmoud
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AgenticFocus: 人間の一人称視点ビデオからの物体保持型MR合成による器用なヒューマノイド学習模倣学習2026/7/1
人間の一人称視点ビデオから、隠れた物体の形状復元と手の動きの再構築を行い、ヒューマノイドロボットの学習用デモを生成するMR合成パイプラインを提案した。
- アクションエージェント:エージェント型ビデオ生成とフロー制約拡散の融合ナビゲーション2026/5/1
LLMによるビデオ生成とフロー制約拡散モデルを組み合わせ、複数のロボット形態でナビゲーションを実現する2段階フレームワークを提案した。
- GenerativeMPC: VLM-RAGガイドによる仮想インピーダンスを用いた全身MPCによる双腕移動マニピュレーションマニピュレーション2026/4/1
視覚言語モデルと検索拡張生成を用いて、双腕移動マニピュレータの全身MPCの制御パラメータ(速度制限や安全マージン、仮想インピーダンス)を文脈に応じて調整する階層的フレームワークを提案した。
- DiffusionAnything: 統一ナビゲーションと把持前動作のためのエンドツーエンド・インコンテキスト拡散学習VLA/ナビゲーション/マニピュレーション2026/3/1
RGB画像のみから、メートル規模のナビゲーションとセンチメートル規模のマニピュレーションを単一モデルで計画する拡散ポリシーを提案。タスクごとに5分の自己教師ありデータで学習し、未知シーンへのゼロショット汎化を実現する。
- HumanoidVLM: 視覚言語ガイドによるインピーダンス制御で接触の多いヒューマノイドマニピュレーションマニピュレーション2026/1/1
視覚言語モデルとRAGを用いて、一人称視覚画像からタスクに適したインピーダンスパラメータと把持設定を選択し、Unitree G1ヒューマノイドの柔軟な操作を実現した。
- SafeHumanoid: VLMとRAGによる人型ロボット上半身インピーダンス制御ヒューマンロボットインタラクション2025/11/1
視覚言語モデルと検索拡張生成を組み合わせ、周囲の状況や人間との距離に応じて人型ロボットのインピーダンスと速度を調整する制御パイプラインを提案し、安全性の向上を実証した。
- PhysicalAgent:基盤世界モデルによる汎用認知ロボティクスの実現VLA2025/9/1
テキスト指示から拡散モデルで動画デモを生成し、ロボットで実行・失敗時に再計画する反復ループで、多様なロボットのマニピュレーション成功率を最大80%まで高めた。
- VLH:視覚・言語・触覚基盤モデル触覚2025/8/1
視覚と言語の理解から空中での力覚・振動フィードバックを生成する基盤モデルVLHを提案し、ドローンとVRで人間とのインタラクション性能を評価した。
- HapticVLM:視覚言語モデルによる触覚テクスチャ認識と知的ハプティックインタラクション触覚2025/5/1
物体の素材を画像から認識し、環境温度も推定して、振動と熱で触感を再現するマルチモーダル触覚フィードバックシステムを提案した論文。
- LLMグラス:視覚障害者ナビゲーションのための触覚フィードバック付き生成AI駆動メガネ触覚2025/3/1
YOLO-WorldとGPT-4oを組み合わせ、視覚情報を触覚パターンに変換して視覚障害者をリアルタイムに誘導するウェアラブルナビゲーションシステムを開発し、その有効性を3つの実験で検証した。