Lingdong Kong
収録論文 59本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ワールドモデリングはどこへ向かうのか?世界モデル2026/8/1
エージェントの継続的改善のための世界モデルの概念を、物理状態遷移からエージェント中心の情報遷移へと拡張し、6つのプロキシ形式と3つの活用レベルを提案する。
- 遅い推論器から速いプランナーへのトークン単位潜在ストリーミングによる動的視覚言語ナビゲーションナビゲーション2026/7/1
動的な人間中心環境での視覚言語ナビゲーションにおいて、遅いVLMの推論中に中間隠れ状態をストリーミングして高速なプランナーを逐次更新するSPARK-VLNを提案し、ナビゲーション成功率と社会的コンプライアンスを向上させた。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- 全ての点が等しいわけではない:不確実性を考慮した4D LiDARシーン合成LiDARシーン生成2026/6/1
LiDARシーン生成において、空間的不確実性を利用して「難しい領域から簡単な領域へ」というスケジュールで生成を導く新しいフレームワークU4Dを提案した。
- OmniLiDAR: マルチドメイン3D LiDAR生成のための統一拡散フレームワークLiDAR生成2026/5/1
異なるセンサー条件やプラットフォームにわたる8つのドメインでLiDARスキャンを生成する統一テキスト条件付き拡散モデルを提案し、ドメイン間の特徴シフトを扱う新しいトレーニング戦略と特徴変調を導入した。
- あなたの運転ワールドモデルは万能選手か?自動運転/評価ベンチマーク2026/5/1
運転ワールドモデルの性能を画質から閉ループ運転まで多面的に評価する統一ベンチマークWorldLensを提案し、既存モデルが全軸で優れないことを示した。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- FLUX: 整流フローと静的から動的への学習によるクロス身体性生成ナビゲーションポリシーの高速化ナビゲーション2026/3/1
動的ナビゲーションベンチマークDynBenchを導入し、フローベースの統一ナビゲーションポリシーFLUXを提案。直線軌道で推論を高速化し、静的から動的へのカリキュラムで社会的ナビゲーションと静的タスクの堅牢性を向上、ゼロショットで多種ロボットに転移可能。
- NavThinker: 社会的ナビゲーションにおける結合予測と計画のための行動条件付きワールドモデルナビゲーション2026/3/1
ロボットの行動に応じて将来のシーンと歩行者動態を予測する行動条件付きワールドモデルを強化学習と組み合わせ、社会的ナビゲーションの性能を向上させた。
- 視覚ナビゲーションのための言語条件付きワールドモデリング視覚ナビゲーション2026/3/1
言語指示に基づく視覚ナビゲーションを、初期の一人称視点のみから将来の軌道を予測する問題として定式化し、大規模データセットと2つのモデル群を提案した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- 自動運転のための視覚-言語-行動モデル:過去・現在・未来VLA2025/12/1
自動運転における視覚-言語-行動(VLA)フレームワークの進化を整理し、End-to-End型とDual-System型の2つのパラダイムに分類して、その特徴と課題を概観したサーベイ論文。
- 空間知能の構築:自律システムのためのマルチモーダル事前学習ロードマップマルチモーダル事前学習2025/12/1
自動運転車やドローンなどの自律システムに向けて、カメラやLiDARなどのマルチモーダルセンサーデータを活用した事前学習技術を整理し、統一的な分類と今後の課題・ロードマップを提示したサーベイ論文。
- U4D: LiDAR系列からの不確実性を考慮した4D世界モデリング4D世界モデリング2025/12/1
LiDARデータから動的な3D環境を生成する際に、不確実性マップを用いて難しい領域から順に生成し、時空間ブロックで時間的一貫性を高めるフレームワークを提案。
- 3EED: あらゆる場所のあらゆるものを3Dでグラウンディング3Dグラウンディング2025/11/1
車・ドローン・四足歩行ロボットのRGBとLiDARデータを統合した大規模3D視覚グラウンディングベンチマークを構築し、クロスプラットフォーム評価手法を提案した。
- 記憶拡張型の計画と予見による視覚ナビゲーションのための統合世界モデルに向けてナビゲーション2025/10/1
視覚的予見と計画を単一のマルチモーダル自己回帰バックボーンに統合し、階層的記憶機構で長期推論を安定化させた世界モデルUniWMを提案。4つのベンチマークでナビゲーション成功率を最大30%改善し、未見環境へのゼロショット汎化も示した。
- 4D LiDARシーケンスの生成を学習するLiDAR生成2025/9/1
自由形式の言語指示から編集可能な4D LiDARシーケンスを生成する統合フレームワークLiDARCrafterを提案し、シーン・物体・シーケンスレベルの評価ベンチマークEvalSuiteも提供する。
- 3D・4D世界モデリングのサーベイ世界モデル2025/9/1
RGB-D画像や占有グリッド、LiDAR点群といったネイティブな3D/4D表現を用いた世界モデリング研究を初めて体系的に整理し、定義・分類・データセット・評価指標をまとめたサーベイ。
- イベントカメラによる視覚的グラウンディングVLA2025/9/1
イベントカメラデータを用いた言語駆動型物体グラウンディングのための大規模ベンチマークTalk2Eventを構築し、動的環境でのマルチモーダル知覚を可能にした。
- Veila: 単眼RGB画像からのパノラマLiDAR生成LiDAR生成2025/8/1
単眼RGB画像を条件として、拡散モデルによりパノラマLiDAR点群を生成するフレームワークを提案。信頼度に基づく条件付けと幾何学的整合性により、RGBとLiDARのモダリティギャップを克服する。
- LiDARCrafter: LiDAR系列からの動的4D世界モデリング4D生成2025/8/1
自然言語指示からLiDARの4Dシーケンスを生成・編集する統合フレームワークを提案し、nuScenesで最先端の忠実性・制御性・時間的一貫性を達成した。
- La La LiDAR: LiDARデータからの大規模レイアウト生成LiDAR生成2025/8/1
LiDARシーンの前景物体配置と空間関係を制御可能にする、シーングラフ誘導の生成フレームワークを提案し、大規模データセットと評価指標を導入した。
- 単一視点・単一ショットを超えて:LiDAR表現学習のためのクロスビュー・長期蒸留LiDAR表現学習2025/7/1
LiDARシーケンスの時空間的手がかりを活用し、複数カメラ視点と長期フレームの画像特徴を統合してLiDAR表現学習を強化するLiMAを提案。セグメンテーションと3D物体検出を改善。
- マスク付きリカレントネットワークによる単眼セマンティックシーン補完3Dシーン理解2025/7/1
単眼RGB画像からボクセル単位の占有と意味カテゴリを予測するMSSCを、粗い予測とマスク付きリカレントネットワークの2段階に分解し、屋内・屋外両方で最先端性能を達成した研究。
- 視点不変な3D物体検出3D物体検出2025/7/1
車両・四足歩行ロボット・ドローンで収集したLiDARデータセットPi3DETを構築し、車両から他プラットフォームへ知識を転移する視点不変な3D検出フレームワークを提案した。
- Talk2Event: イベントカメラによる動的シーンの言語接地理解VLA2025/7/1
イベントカメラの非同期ストリームを言語と結びつける大規模ベンチマークTalk2Eventを構築し、属性を考慮した接地フレームワークEventReferを提案した。
- 成功への階段:LLM駆動の粗から細への探索によるオンライン階層対応ゼロショット物体目標ナビゲーションフレームワークナビゲーション2025/5/1
事前地図や再学習なしで多階層建物内の物体を目指すゼロショットナビゲーションを実現するASCENTを提案。階層表現構築とLLMによる粗密探索でHM3D/MP3Dで最高性能を達成し、四足ロボットで実機検証した。
- 視覚言語モデルによるゼロショット3D視覚グラウンディング3D視覚グラウンディング2025/5/1
2Dの視覚言語モデルを活用し、3D専用の学習データなしで3Dシーン内の物体を自然言語で特定するゼロショット手法SeeGroundを提案。
- HA-VLN 2.0:動的な複数人環境における人間認識ナビゲーションのためのオープンベンチマークとリーダーボードVLA2025/3/1
離散・連続空間での人間認識型視覚言語ナビゲーションを統一評価するベンチマークを提案し、社会的制約を考慮したデータセット・シミュレータ・実機検証・リーダーボードを公開した。
- 画像からLiDARへのデータ事前学習における時空間一貫性の強化LiDAR事前学習2025/3/1
連続するLiDAR-カメラペアを用いて時空間的手がかりを統合するSuperFlow++を提案し、11の異なるLiDARデータセットで最先端性能を達成した。
- EventFly: 地上から空まで対応するイベントカメラ知覚のクロスプラットフォーム適応イベントカメラ/クロスプラットフォーム適応2025/3/1
イベントカメラ知覚を車両・ドローン・四足歩行ロボットなど異なるプラットフォームへ適応させるためのフレームワークEventFlyを提案し、大規模ベンチマークEXPoで有効性を示した。
- MSC-Bench: 自動運転知覚におけるマルチセンサー劣化のベンチマークと分析自動運転知覚2025/1/1
カメラとLiDARの入力が個別または同時に劣化・欠損した際の自動運転知覚モデルの頑健性を評価する初の総合ベンチマークを提案し、3D物体検出6モデルとHDマップ構築4モデルを評価した。
- VLMは自動運転に本当に使えるのか?信頼性・データ・評価指標の観点からの実証研究VLA2025/1/1
自動運転向けVLMの信頼性を17設定・約2万フレームで評価するベンチマークDriveBenchを構築し、VLMが視覚ではなく一般知識やテキスト手がかりに依存しがちであることを明らかにした。
- LiMoE: 自動車シーン向けLiDAR表現の混合エキスパート学習3D認識2025/1/1
LiDARの複数表現(距離画像・疎ボクセル・生点群)をMixture of Expertsで統合し、事前学習からセグメンテーションまで一貫して活用するフレームワークを提案。
- LargeAD: 自動運転のための大規模クロスセンサデータ事前学習自動運転/3D知覚2025/1/1
2D画像から視覚基盤モデルでスーパーピクセルを抽出しLiDAR点群と対応付けることで、自動運転向けのクロスモーダル3D表現を大規模事前学習するフレームワークを提案。
- FlexEvent: 動作周波数が変化する環境での柔軟なイベントフレーム物体検出イベントカメラ/物体検出2024/12/1
イベントカメラとRGBフレームを適応的に融合し、周波数に応じた微調整を行うことで、20Hzから180Hzまで様々な周波数で高精度な物体検出を可能にするフレームワークを提案。
- SeeGround: ゼロショットオープンボキャブラリ3D視覚グラウンディングのための見て接地する手法3D視覚グラウンディング2024/12/1
2D視覚言語モデルを活用し、3Dシーンをクエリに合わせたレンダリング画像と空間記述のハイブリッドで表現することで、ゼロショットでオープンボキャブラリな3D視覚グラウンディングを実現した。
- DynamicCity: 動的シーンからの大規模4D占有生成4D生成2024/10/1
動的運転環境の大規模4D占有シーンを生成するフレームワークを提案し、HexPlane表現のVAEとDiTベース拡散モデルで高品質な生成を実現した。
- 4DコントラスティブSuperFlow:密な3D表現学習器3D知覚2024/7/1
LiDARとカメラの連続ペアを用いた時空間事前学習フレームワークSuperFlowを提案し、点群密度変化への不感性と流れベースのコントラスティブ学習で3D知覚モデルを効率的に学習する。
- あなたのHDマップ構築はセンサー劣化に耐えられるか?自動運転/HDマップ/ロバスト性2024/6/1
カメラやLiDARの29種類のセンサー劣化に対するHDマップ構築手法の頑健性を評価する初のベンチマークMapBenchを提案し、31手法を評価して性能低下を明らかにした。
- 自動運転におけるBird's Eye View知覚のロバスト性のベンチマークと改善BEV知覚2024/5/1
BEV知覚モデルのロバスト性を評価するベンチマークRoboBEVを提案し、33モデルを検証してCLIPベースの改善手法を設計した。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- OpenESS: オープン語彙によるイベントベースの意味的シーン理解イベントカメラ/セグメンテーション2024/5/1
画像・テキスト・イベントデータを統合し、CLIPの知識をイベントストリームに転移することで、アノテーション不要でイベントカメラの意味的セグメンテーションを実現した。
- ユニバーサルLiDARセグメンテーションに向けたマルチスペースアラインメントLiDARセグメンテーション2024/5/1
異なるセンサやシーンで収集された大規模運転データセットを統合し、データ・特徴・ラベル空間でのアラインメントを行うことで、単一パラメータでマルチタスク・マルチデータセット・マルチモダリティのLiDARセグメンテーションを実現するM3Netを提案。
- 自動運転向けマルチモーダルなデータ効率の良い3Dシーン理解3Dシーン理解2024/5/1
LiDARセマンティックセグメンテーションの半教師あり学習において、LiDARとカメラの対応や言語知識を活用するLaserMix++を提案し、少ないアノテーションで高精度を実現した。
- 最先端LiDARセグメンテーションモデル訓練の実証研究LiDARセグメンテーション2024/5/1
LiDARセグメンテーション研究を統一するツールボックスMMDetection3D-lidarsegを提案し、多様なモデル・データ拡張・疎畳み込みバックエンドを統合してベンチマークを効率化した。
- LiDAR配置は3Dシーン理解に最適化されているか?LiDAR配置最適化2024/3/1
複数LiDARの配置を最適化する指標M-SOGと最適化戦略を提案し、悪天候やセンサ故障を含む大規模データセットで3D物体検出とセマンティックセグメンテーションの性能向上を示した。
- Calib3D:信頼できる3Dシーン理解のためのモデル選好の校正3Dシーン理解2024/3/1
3Dシーン理解モデルの不確実性推定の信頼性を評価するベンチマークCalib3Dを提案し、28モデル・10データセットで検証。校正を改善する深度対応スケーリング手法DeptSも導入。
- FRNet: Frustum-Range Networks for Scalable LiDAR Segmentation2023/12/1
- RoboDepth: Robust Out-of-Distribution Depth Estimation under Corruptions2023/10/1
- The RoboDepth Challenge: Methods and Advancements Towards Robust Depth Estimation2023/7/1
- Segment Any Point Cloud Sequences by Distilling Vision Foundation Models2023/6/1
- RoboBEV: Towards Robust Bird's Eye View Perception under Corruptions2023/4/1
- Rethinking Range View Representation for LiDAR Segmentation2023/3/1
- Robo3D: Towards Robust and Reliable 3D Perception against Corruptions2023/3/1
- LaserMix for Semi-Supervised LiDAR Semantic Segmentation2022/7/1
- ConDA: Unsupervised Domain Adaptation for LiDAR Segmentation via Regularized Domain Concatenation2021/11/1
- Modification of Gesture-Determined-Dynamic Function with Consideration of Margins for Motion Planning of Humanoid Robots2020/8/1
- Kinematic Resolutions of Redundant Robot Manipulators using Integration-Enhanced RNNs2020/8/1