Artem Lykov
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ORCESTRA: 複合現実におけるVLM駆動の視覚的ロボットプログラミングHRI/プログラミング2026/8/1
複合現実環境で、ユーザーがロボットのデジタルツインを配置し、軌道を教示したり、言語で指示を与えることで、視覚言語モデルが構造化された計画に変換し、ロボットをプログラミングするシステムを提案した論文。
- AgenticFocus: 人間の一人称視点ビデオからの物体保持型MR合成による器用なヒューマノイド学習模倣学習2026/7/1
人間の一人称視点ビデオから、隠れた物体の形状復元と手の動きの再構築を行い、ヒューマノイドロボットの学習用デモを生成するMR合成パイプラインを提案した。
- DreamToNav: 生成ビデオ計画によるロボットの汎用ナビゲーションナビゲーション2026/3/1
生成ビデオモデルを計画エンジンとして使い、自然言語指示からロボットの動作を合成し、その映像から軌道を抽出して実機で実行するナビゲーションフレームワークを提案した。
- 拡散モデルによるテキスト指示からの空撮シネマトグラフィドローン制御2026/1/1
自然言語の指示と機体カメラの初期画像から拡散モデルで飛行軌道を生成し、ドローンが自動でシネマティックな映像を撮影するシステムを提案した。
- SafeHumanoid: VLMとRAGによる人型ロボット上半身インピーダンス制御ヒューマンロボットインタラクション2025/11/1
視覚言語モデルと検索拡張生成を組み合わせ、周囲の状況や人間との距離に応じて人型ロボットのインピーダンスと速度を調整する制御パイプラインを提案し、安全性の向上を実証した。
- FlightDiffusion:拡散モデルによるFPV動画生成で自律ドローン訓練を革新VLA2025/9/1
単一フレームからFPV動画と行動空間を生成する拡散モデルを提案し、大規模な訓練データを合成してドローンのナビゲーション性能とsim-to-real転移を向上させた。
- PhysicalAgent:基盤世界モデルによる汎用認知ロボティクスの実現VLA2025/9/1
テキスト指示から拡散モデルで動画デモを生成し、ロボットで実行・失敗時に再計画する反復ループで、多様なロボットのマニピュレーション成功率を最大80%まで高めた。
- GestOS: 大規模言語モデルによる高度なハンドジェスチャー解釈で多様なロボットを操作VLA2025/9/1
手のジェスチャーをLLMで意味解釈し、複数ロボットの能力に応じてタスクを動的に割り振る操作システムを提案した。
- UAV-CodeAgents: マルチエージェントReActと視覚言語推論によるスケーラブルなUAVミッション計画VLA2025/5/1
LLM/VLMを活用したマルチエージェントフレームワークで、衛星画像と自然言語指示からUAVのミッションを自動生成し、火災検知タスクで93%の成功率を達成した。
- UAV-VLRR: 視覚言語情報を用いたNMPCによるUAV捜索救助の迅速応答VLA2025/3/1
視覚言語モデルとLLMでシーンを解釈し、障害物回避機能付き非線形モデル予測制御でドローンを飛行させる捜索救助システムを開発し、既存の自動操縦や人間のパイロットより高速な応答を実現した。
- RaceVLA: 人間らしい挙動を実現するVLAベースのレーシングドローン航法VLA2025/3/1
視覚・言語・行動(VLA)モデルをドローンレース用データセットで微調整し、人間パイロットのような適応的な航法を実現した研究。
- CognitiveDrone: UAVのリアルタイム認知タスク解決と推論のためのVLAモデルと評価ベンチマークVLA2025/3/1
ドローンの複雑な認知タスク向けに、一人称視点の画像とテキスト指示からリアルタイム4D行動指令を生成するVLAモデルと、推論モジュールを組み合わせた改良版、および認知タスク評価用ベンチマークを提案した論文。
- UAV-VLPA*:大規模環境での最適経路生成のための視覚・言語・経路・行動システム経路計画2025/3/1
衛星画像と視覚言語モデル、GPTの自然言語処理を組み合わせ、テキスト指示から飛行計画を生成するUAVシステムを提案。TSP最適化とA*による障害物回避で経路長を18.5%削減した。
- Evolution 6.0:生成AIによるロボット進化VLA2025/2/1
VLM・VLA・テキストto3D生成モデルを組み合わせ、人間の指示に必要な道具をロボットが自律的に設計・製作し、その使い方を学習してタスクを遂行するシステムを提案。
- GestLLM:大規模言語モデルによる高度なハンドジェスチャー解釈とヒューマンロボットインタラクションHRI2025/1/1
MediaPipeで手の特徴を抽出し大規模言語モデルで解釈することで、事前定義に縛られない多様なジェスチャーでロボットを直感的に操作できるシステムを提案した。
- UAV-VLA:大規模航空ミッション生成のための視覚言語行動システムVLA2025/1/1
衛星画像とVLM・GPTを組み合わせ、テキスト指示から飛行経路と行動計画を生成するUAV向けシステムを提案。
- Industry 6.0:生成AIと異種ロボット群が駆動する次世代産業群制御2024/9/1
自然言語の指示だけで製品設計から製造・組立までを自律的に行う完全自動生産システムを提案し、熟練開発者チームの4.4倍の速さで生産を完了できることを示した。
- METDrive: 時系列ガイダンスを用いたマルチモーダル端到端自動運転自動運転2024/9/1
自車状態の時系列特徴を活用した時間的ガイダンスにより、知覚データの幾何特徴と統合してウェイポイント予測を行う端到端自動運転システムを提案し、CARLAベンチマークで評価した。
- VLM-Auto: 複雑な道路シーンに対応する人間らしい振る舞いと理解を備えたVLMベースの自動運転アシスタント自動運転/VLM2024/5/1
視覚言語モデル(VLM)を用いて道路シーンを理解し、調整可能な運転行動を生成する自動運転支援システムを提案。CARLAとROS2で検証し、夜間・薄暗いシーンでも高い予測精度を達成した。
- ロボットは感じられる:LLMベースのロボット倫理推論フレームワーク倫理推論2024/5/1
感情重み係数を用いて人間らしい感情をシミュレートし、ロボットに倫理的判断を行わせるLLMベースのフレームワークを開発し、8つのLLMで評価した。
- Bi-VLA: 視覚-言語-行動モデルによる双腕ロボットの巧みな操作システムVLA2024/5/1
視覚・言語・行動を統合したBi-VLAモデルを提案し、人間の指示からサラダ調理などの双腕家庭タスクを実行、83.4%の成功率を達成した。
- FlockGPT: 言語指示でドローン群れを誘導する群制御2024/5/1
大規模言語モデルを使い、自然言語の指示からドローン群れの目標形状を生成・制御するインターフェースを開発し、ユーザー研究で直感的な操作と高い形状認識率を示した。
- VR-GPT: インテリジェントなVRアプリケーションのための視覚言語モデルVLA2024/5/1
Unity上に視覚言語モデルを組み込み、音声対話でVR内のユーザーをタスクへ誘導するシステムを開発し、従来のVR操作より作業時間短縮と快適性向上を示した。
- FADet: 局所特徴注意に基づくマルチセンサー3D物体検出ネットワーク3D物体検出/マルチセンサー融合2024/5/1
カメラ・LiDAR・レーダーそれぞれの特性に応じた局所特徴注意モジュールを設計し、これらを融合することで複雑な長尾シーンでも高精度な3D物体検出を実現した。
- DogSurf: Quadruped Robot Capable of GRU-based Surface Recognition for Blind Person Navigation2024/2/1
- CognitiveOS: Large Multimodal Model based System to Endow Any Type of Robot with Generative AI2024/1/1
- CognitiveDog: Large Multimodal Model Based System to Translate Vision and Language into Action of Quadruped Robot2024/1/1
- LLM-MARS: Large Language Model for Behavior Tree Generation and NLP-enhanced Dialogue in Multi-Agent Robot Systems2023/12/1
- LLM-BRAIn: AI-driven Fast Generation of Robot Behaviour Tree based on Large Language Model2023/5/1
- DeltaFinger: a 3-DoF Wearable Haptic Display Enabling High-Fidelity Force Vector Presentation at a User Finger2022/11/1