Igor Gilitschenski
収録論文 48本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 終点制約付き軌道最適化によるエンドツーエンド運転モデルの誘導自動運転2026/9/25
エンドツーエンド運転ポリシーの出力軌道を、予測終点を保ちながら走行履歴に基づいて中間ウェイポイントを再整形する軽量後処理ECOを提案し、閉ループ性能を改善した。
- 統一動的顔ランドマーク検出に向けて顔ランドマーク検出2026/8/11
顔ランドマーク検出において、異なるN点データセットを統一する新しい表現とクエリベースの手法を提案し、単一モデルで任意のランドマークを予測可能にした。
- SeededGrasp: 複数身体を持つ複雑なシーンにおける言語誘導型把持マニピュレーション2026/7/1
視覚言語モデルで把持位置のシード点を予測し、軽量な把持生成モデルを条件付けることで、複数ロボット形態に対応したデータ効率の良い言語誘導把持を実現した。
- QPILOTS: フローポリシーのための効率的なテスト時Qステアリング強化学習/拡散ポリシー2026/6/11
フローマッチングや拡散ポリシーを強化学習で最適化する際、推論時にノイズ除去プロセスをQ値の勾配で操縦する手法QPILOTSを提案し、オフラインからオンラインへのRLベンチマークで高い成功率を達成した。
- Gamma-World: 2人を超える生成型マルチエージェント世界モデル世界モデル2026/5/27
複数エージェントが同時に動作する環境向けの生成型世界モデルを提案し、エージェントの対称性を保つ符号化と効率的な注意機構により、リアルタイムなインタラクティブシミュレーションを実現した。
- 効率的かつ転移可能な制御学習のためのダイナミクス蒸留自動運転/強化学習/sim2real2026/5/1
高忠実度シミュレータのダイナミクスを並列化可能な学習モデルに蒸留し、その中で強化学習を行って元のシミュレータへ展開するSim2Sim2Simフレームワークを提案した。
- 良いトークンの狩り方:視覚幾何学トランスフォーマーにおけるトークン選択の手引き3D再構成2026/5/1
視覚幾何学トランスフォーマーの計算コストを削減するため、フレーム間・フレーム内の2段階でトークンを選択する手法を提案し、精度を保ちつつ85%以上の高速化を実現した。
- ActionParty: 生成ビデオゲームにおけるマルチサブジェクト行動バインド世界モデル/マルチエージェント2026/4/2
ビデオ拡散モデルで複数のエージェントを同時に制御するための世界モデルを提案し、各被写体の状態トークンを導入して行動と被写体の対応を明確化した。Melting Potベンチマークで最大7プレイヤーを同時制御できる初のビデオ世界モデルを実証した。
- 推論トレース付きロングテール運転シナリオ:KITScenes LongTailデータセット自動運転/データセット2026/3/1
自動運転の稀なシナリオへの汎化を目的とし、マルチビュー動画、軌跡、指示、詳細な推論トレースを含むデータセットを構築し、VLMやVLAのベンチマークを提供した。
- 検証器による更新不要のオン方策ステアリングマニピュレーション2026/3/1
ロボットの行動成功率を予測する検証器を訓練し、実行時に方策を高成功率の行動へと誘導する、パラメータ更新不要の手法を提案。実タスクで成功率を平均49%向上させた。
- 知覚不確実性伝播が知覚ベース運動計画に与える影響運動計画2026/2/1
自動運転の運動計画において、知覚の不確実性を伝播させる手法とそのキャリブレーションが閉ループ性能に与える影響をnuPlanベンチマークで分析した。
- 目標条件付き強化学習のためのテスト時グラフ探索強化学習2025/10/8
既存の目標条件付き強化学習ポリシーに、学習不要の軽量なグラフ探索ラッパーを組み合わせることで、長期的タスクの成功率を大幅に向上させる手法を提案した。
- 追跡・修復・再スプラット:被写体駆動型3D/4D生成のための漸進的テクスチャ補完3D/4D生成2025/10/1
既存の3D生成モデルが作った3Dアセットに対し、動画トラッキングで修正領域を特定し、被写体駆動型の2Dインペインティングで段階的に補完した後、再スプラッティングで3Dに戻すことで、特定被写体の同一性を保った3D/4D生成を実現する手法を提案。
- VibES: 持続的なイベントベースセンシングのための誘起振動イベントカメラ2025/8/1
回転する不平衡質量で周期的な振動を加え、イベントカメラが静止・低運動シーンでもイベントを生成し続けるようにする軽量手法を提案し、動き補償パイプラインで注入した動きを除去して画像再構成とエッジ検出を改善した。
- AGENTS-LLM: エージェント型LLMフレームワークによる難易度の高い交通シナリオの拡張生成自動運転シナリオ生成2025/7/1
自然言語指示で実走行シナリオを拡張し、自動運転評価用の難易度の高い交通シナリオを生成するLLMエージェントフレームワークを提案。
- 大規模倉庫自動化のための箱の姿勢・形状推定とドメイン適応sim2real2025/7/1
倉庫ロボットの実世界の未ラベル画像を活用し、箱の姿勢と形状を自己教師ありで推定するドメイン適応パイプラインを開発した。シミュレーションのみの学習より大幅に高精度で、ゼロショット3Dバウンディングボックス推定も上回る。
- SAFE: 視覚言語行動モデル向けマルチタスク故障検知VLA2025/6/1
VLAの内部特徴からタスク失敗の可能性を予測する汎用的な故障検知器SAFEを提案し、未見タスクでも高精度・早期検知を実現した。
- 自動運転のための疑似シミュレーション評価自動運転評価2025/6/1
3Dガウススプラッティングで生成した合成観測を実データに付加し、閉ループに近い相関で自動運転を評価する疑似シミュレーション手法を提案。
- MORE: 接地された言語推論による移動マニピュレーション再配置移動マニピュレーション2025/5/1
シーングラフと能動的フィルタリングでタスク関連サブグラフを抽出し、言語モデルによるゼロショットの長期的移動マニピュレーション計画を高信頼化する手法を提案。BEHAVIOR-1Kで大幅に性能向上。
- GeoMatch++: 形態条件付き幾何マッチングによる多様なハンドでの把持マニピュレーション2024/12/1
グリッパの形態情報をアテンションで活用し、未知のエンドエフェクタにも汎化する把持方策を学習。未学習の3種のハンドで把持成功率が平均9.64%向上。
- BEV特徴量への直接アテンションによるオンラインマッピングと行動予測の高速化自動運転/予測2024/7/1
自動運転向けに、オンラインマップ推定の内部BEV特徴量を直接活用して軌道予測と統合する手法を提案し、推論速度を最大73%向上、予測精度を最大29%改善した。
- NAVSIM: データ駆動型非反応的自動運転シミュレーションとベンチマーク自動運転ベンチマーク2024/6/1
大規模データセットと非反応的シミュレータを組み合わせ、実世界に近い大規模ベンチマークを可能にする評価手法NAVSIMを提案。CVPR 2024コンペで143チームが参加し、新たな知見を得た。
- 軌道予測におけるオンラインマップの不確かさの生成と活用自動運転2024/3/1
オンラインマップ推定に不確かさ推定を追加し、軌道予測と統合することで、学習収束を最大50%高速化し、予測性能を最大15%向上させた。
- Vid2Robot: クロスアテンションTransformerによる動画条件付きエンドツーエンド方策学習VLA2024/3/1
人間の操作動画を入力として、クロスアテンションTransformerでロボットの行動を生成するエンドツーエンド方策を提案し、実機で従来手法を20%以上上回る性能と物体間の動作転移を実現した。
- Geometry Matching for Multi-Embodiment Grasping2023/12/1
- trajdata: A Unified Interface to Multiple Human Trajectory Datasets2023/7/1
- Multi-Abstractive Neural Controller: An Efficient Hierarchical Control Architecture for Interactive Driving2023/5/1
- See, Plan, Predict: Language-guided Cognitive Planning with Video Prediction2022/10/1
- Solving Continuous Control via Q-learning2022/10/1
- Neighborhood Mixup Experience Replay: Local Convex Interpolation for Improved Sample Efficiency in Continuous Control Tasks2022/5/1
- Is Bang-Bang Control All You Need? Solving Continuous Control with Bernoulli Policies2021/11/1
- Learning Interactive Driving Policies via Data-driven Simulation2021/11/1
- VISTA 2.0: An Open, Data-driven Simulator for Multimodal Sensing and Policy Learning for Autonomous Vehicles2021/11/1
- HYPER: Learned Hybrid Trajectory Prediction via Factored Inference and Adaptive Sampling2021/10/1
- Deep Latent Competition: Learning to Race Using Visual Control Policies in Latent Space2021/2/1
- Deep Context Maps: Agent Trajectory Prediction using Location-specific Latent Maps2019/12/1
- Map Management for Efficient Long-Term Visual Localization in Outdoor Environments2018/8/1
- Appearance-Based Landmark Selection for Efficient Long-Term Visual Localization2018/8/1
- LandmarkBoost: Efficient Visual Context Classifiers for Robust Localization2018/7/1
- Learning 3D Segment Descriptors for Place Recognition2018/4/1
- Free LSD: Prior-Free Visual Landing Site Detection for Autonomous Planes2018/2/1
- Voliro: An Omnidirectional Hexacopter With Tiltable Rotors2018/1/1
- Why and How to Avoid the Flipped Quaternion Multiplication2018/1/1
- maplab: An Open Framework for Research in Visual-inertial Mapping and Localization2017/11/1
- Visual-inertial self-calibration on informative motion segments2017/8/1
- Recursive Bayesian Filtering in Circular State Spaces2015/1/1
- Unscented Orientation Estimation Based on the Bingham Distribution2013/11/1
- Recursive Estimation of Orientation Based on the Bingham Distribution2013/4/1