Mikhail Konenkov
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ORCESTRA: 複合現実におけるVLM駆動の視覚的ロボットプログラミングHRI/プログラミング2026/8/1
複合現実環境で、ユーザーがロボットのデジタルツインを配置し、軌道を教示したり、言語で指示を与えることで、視覚言語モデルが構造化された計画に変換し、ロボットをプログラミングするシステムを提案した論文。
- AgenticFocus: 人間の一人称視点ビデオからの物体保持型MR合成による器用なヒューマノイド学習模倣学習2026/7/1
人間の一人称視点ビデオから、隠れた物体の形状復元と手の動きの再構築を行い、ヒューマノイドロボットの学習用デモを生成するMR合成パイプラインを提案した。
- VersualRL: 視覚的実行フィードバックによる閉ループ言語強化学習を用いたタスクレベルロボット計画タスク計画2026/3/1
視覚言語モデルが実行結果を批評し、言語モデルが行動木を更新する閉ループ枠組みを提案し、実機ロボットの多段階タスクで有効性を示した。
- PhysicalAgent:基盤世界モデルによる汎用認知ロボティクスの実現VLA2025/9/1
テキスト指示から拡散モデルで動画デモを生成し、ロボットで実行・失敗時に再計画する反復ループで、多様なロボットのマニピュレーション成功率を最大80%まで高めた。
- Industry 6.0:生成AIと異種ロボット群が駆動する次世代産業群制御2024/9/1
自然言語の指示だけで製品設計から製造・組立までを自律的に行う完全自動生産システムを提案し、熟練開発者チームの4.4倍の速さで生産を完了できることを示した。
- VLM-Auto: 複雑な道路シーンに対応する人間らしい振る舞いと理解を備えたVLMベースの自動運転アシスタント自動運転/VLM2024/5/1
視覚言語モデル(VLM)を用いて道路シーンを理解し、調整可能な運転行動を生成する自動運転支援システムを提案。CARLAとROS2で検証し、夜間・薄暗いシーンでも高い予測精度を達成した。
- FlockGPT: 言語指示でドローン群れを誘導する群制御2024/5/1
大規模言語モデルを使い、自然言語の指示からドローン群れの目標形状を生成・制御するインターフェースを開発し、ユーザー研究で直感的な操作と高い形状認識率を示した。
- VR-GPT: インテリジェントなVRアプリケーションのための視覚言語モデルVLA2024/5/1
Unity上に視覚言語モデルを組み込み、音声対話でVR内のユーザーをタスクへ誘導するシステムを開発し、従来のVR操作より作業時間短縮と快適性向上を示した。
- HawkDrive: 夜間自動運転のためのTransformer駆動型視覚認識システム自動運転/視覚認識2024/4/1
夜間の自動運転向けに、ステレオ視とTransformerベースのニューラルネットワークを組み合わせ、低照度強調・深度推定・セマンティックセグメンテーションをROS2上で統合した認識システムを開発した。
- CognitiveOS: Large Multimodal Model based System to Endow Any Type of Robot with Generative AI2024/1/1
- CognitiveDog: Large Multimodal Model Based System to Translate Vision and Language into Action of Quadruped Robot2024/1/1
- AirTouch: Towards Safe Human-Robot Interaction Using Air Pressure Feedback and IR Mocap System2023/8/1