Kaushik Roy
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 非IIDマルチロボットマニピュレーションのための連合部分空間誘導型視覚-言語-行動ポリシー蒸留VLA2026/9/26
複数ロボットが非IID環境で連合学習する際に、低ランク部分空間と行動分布の蒸留、および互換性に基づくクラスタリングで表現ドリフトを抑え、マニピュレーションポリシーの知識転移を改善する手法を提案。
- 自然環境における幾何条件付き視覚位置認識視覚位置認識2026/9/23
深度センサなしで幾何基盤モデルから得た幾何情報を視覚基盤モデルのトークン表現に蒸留し、外観変化に頑健な視覚位置認識を実現した。
- SG-CPG: 継続的なアクチュエータ劣化下での適応的四足歩行のための重症度ゲート付き中枢パターン生成器歩行2026/9/22
動物が弱った脚をかばいながら歩行を続ける仕組みに着想を得て、アクチュエータの劣化度に応じて残差ゲートと振幅ゲートで四足歩行を適応させるCPG手法を提案し、シミュレーションと実機で有効性を示した。
- GLAMDRING: 強化学習によるCPGの歩容学習と形態の共設計歩行2026/9/16
歩行タスクに最適な四足ロボットの形態とCPG歩容制御器を強化学習で同時に設計するフレームワークを提案。
- UAV-UGV協調システムのための信頼度ゲート付き視覚のみの方位合わせ群制御2026/7/1
UAVとUGVの協調において、視覚ベースの方位予測をいつ信頼してコマンドとして発行するかを決定する軽量な信頼度ゲートフレームワークを提案し、低信頼区間でのコマンド更新方法を評価した。
- TOLiD: 視覚基盤モデルからLiDAR事前学習へのアーキテクチャギャップをトークンリフティング蒸留で橋渡しする手法自己教師あり学習/3D認識2026/7/1
視覚基盤モデル(VFM)の特徴をLiDARバックボーンへ蒸留する自己教師あり事前学習法TOLiDを提案。点群をパッチトークン化し、トークン単位の蒸留と可視性マスクでモダリティ・アーキテクチャのギャップを解消する。
- デモの数だけではない:反実仮想的行動感度カバレッジによるデータ効率的で堅牢なロボット模倣学習模倣学習2026/7/1
視覚運動模倣学習の堅牢性を向上させるため、クリーンなデモと妨害観測をペアにして行動ドリフトを測定し、ポリシー固有の感度信号に基づいて少数の修復データを選択するオフライン手法CFNBCを提案した。
- 深度認識蒸留による森林環境での視覚的位置認識視覚的位置認識2026/6/1
森林環境での視覚的位置認識の課題に対し、DINOv2ベースのモデルに幾何学的手がかりを注入する軽量な深度認識蒸留フレームワークを提案し、WildCrossベンチマークで外観変動に対する頑健性を向上させた。
- SPREAD: 生涯模倣学習のための部分空間表現蒸留生涯学習/模倣学習2026/3/1
生涯模倣学習において、特異値分解を用いてタスク間のポリシー表現を低ランク部分空間で整列させ、幾何構造を保ちながら知識転移と忘却防止を実現する手法を提案した。
- リアルタイム神経形態ナビゲーション:イベントベースセンシングとタスク特化型再構成可能自律スタックによる実機ロボット誘導神経形態ナビゲーション2025/3/1
イベントベース神経形態ビジョンを用いたナビゲーション枠組みを提案し、地上ロボットとドローンの実機実験でリアルタイム自律航行の有効性を示した。
- 動的視覚センサと物理誘導ニューロモルフィック手法による省エネ自律飛行ナビゲーションニューロモルフィック/自律飛行2025/2/1
イベントカメラとスパイキングニューラルネット、物理誘導ニューラルネットを組み合わせ、移動するゲートを通過しつつ衝突を避ける省エネドローン航法をGazebo上で実現した。
- エッジにおける知能的なセンシング・トゥ・アクション:堅牢な自律性の機会と課題エッジ自律性2025/2/1
動的環境でのリアルタイム意思決定に向け、センシング・処理・アクチュエーションを統合するセンシング・トゥ・アクションループの課題と、ニューロモルフィック計算やマルチエージェント協調による効率化の可能性を論じたサーベイ。
- Neuro-LIFT: ニューロモルフィックとLLMを統合したドローン自律飛行フレームワークニューロモルフィック/ドローン2025/1/1
イベントカメラとスパイキングニューラルネットワーク、大規模言語モデルを組み合わせ、音声指示に基づく低遅延・省エネなドローン自律ナビゲーションを実機で実現した。
- TOFFE:イベントカメラによる時間ビン化物体フローで高速・省エネな物体検出と追跡イベントカメラ/検出・追跡2025/1/1
イベントカメラの出力をスパイキングニューラルネットと通常のニューラルネットを組み合わせて処理し、物体の姿勢・方向・速度を推定する軽量フレームワークを提案した論文。
- M2Distill: 生涯模倣学習のためのマルチモーダル蒸留模倣学習2024/10/1
視覚・言語・行動の潜在空間を一貫させ、GMM方策のずれを抑えるマルチモーダル蒸留により、破滅的忘却を防ぎつつ新タスクを継続学習する手法を提案。
- SHIRE: 人間の直感を活用した強化学習のサンプル効率向上強化学習2024/9/1
人間の直感を確率的グラフィカルモデルで符号化し、深層強化学習の学習に組み込むことで、サンプル効率を25〜78%改善しつつ方策の説明可能性も高めるフレームワークを提案した。
- ASMA: シーン認識型制御バリア関数による視覚言語ドローン航法のための適応的安全マージンアルゴリズムVLA2024/9/1
RGB-Dカメラと視覚言語モデルを用いたドローン航法において、シーン認識型制御バリア関数と適応的安全マージンをMPCに組み込み、動的障害物を回避しながら安全に飛行する手法を提案した。
- リアルタイム神経形態ナビゲーション:イベントベース視覚と物理駆動型計画のParrot Bebop2クアッドロータへの統合ドローン自律飛行2024/7/1
イベントカメラとスパイキングニューラルネットワーク、物理駆動型計画を組み合わせ、Parrot Bebop2ドローンが動くリングをリアルタイムで通り抜ける省エネナビゲーションを実現した。
- Ev-Edge: 民生エッジプラットフォーム上でのイベントベース視覚アルゴリズムの効率的実行イベントカメラ/エッジ推論2024/3/1
イベントカメラ向けのANN/SNN/ハイブリッド処理を民生エッジで高速化するため、イベントのスパースフレーム変換・動的集約・ネットワークマッピングを行うフレームワークEv-Edgeを提案。
- EV-Planner: Energy-Efficient Robot Navigation via Event-Based Physics-Guided Neuromorphic Planner2023/7/1
- FEDORA: Flying Event Dataset fOr Reactive behAvior2023/5/1
- RAMP-Net: A Robust Adaptive MPC for Quadrotors via Physics-informed Neural Network2022/9/1