Kai Chen
The Chinese University of Hong Kong
収録論文 68本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 強化学習ファインチューニングによる協調マルチエージェント視覚言語行動モデルVLA2026/9/29
事前学習済みVLAを3段階の強化学習ファインチューニングでマルチロボット協調に適応させ、初期化対応データ収集・オフライン信用フィルタリング・潜在空間オンラインRLにより成功率を大幅に向上させた。
- ActionPiece:自己回帰型視覚言語行動モデルのための行動トークン化の再考VLA2026/9/16
行動トークン化の関係的忠実度を測る「物理ランク整合性(PRC)」を提案し、表現学習と量子化を共同監督するActionPieceで局所的な行動の順序関係を保つトークン化を実現した。
- PhysBrain 1.5:視覚言語モデルから物理基盤モデルへVLA2026/9/14
人間のインタラクション動画から身体動作を学習し、行動生成と未来状態予測を統合した8Bの物理基盤モデルを構築、28の身体理解ベンチマークでオープンソース最高性能を達成した。
- FBFM: ワールドアクションモデル実行のための訓練不要な非同期フィードバック機構VLA2026/7/1
フローマッチングに基づくワールドアクションモデルにおいて、チャンク境界を待たずに実観測を内部フィードバックとして注入し、長期タスクでのドリフトを抑制する訓練不要の推論機構を提案した。
- SIEVE: VLAモデルを用いた模倣学習のための構造認識データ選択データ選択/模倣学習/VLA2026/7/1
ロボットのデモデータから再利用可能なプリミティブと遷移構造を抽出し、構造的な被覆率を最大化するようにデータを選択することで、少ないデータと学習ステップで高性能なVLAポリシーを学習する手法を提案した。
- ヒューマノイドVLAにおけるループの閉鎖:検証可能な移動操作のための持続的3DオブジェクトトークンVLA/ヒューマノイド/操作2026/7/1
RGB-D観測から役割インデックス付きの3Dオブジェクト記録を維持し、それをオブジェクトトークンとして行動生成と幾何学的述語チェックの両方に使用することで、検証可能な閉ループ実行を実現するPOT-VLAを提案。実機でベースラインを大幅に上回る成功率を達成。
- EPS3D: エンドツーエンドのフィードフォワード型3Dパノプティックセグメンテーション3Dセグメンテーション2026/6/8
多視点画像から3Dセマンティック特徴とインスタンス特徴を直接予測するエンドツーエンドのフレームワークを提案し、相互強化モジュールでセマンティクスとインスタンスの一貫性を高めた。
- EgoPriMo: 対話型ヒューマノイド制御のための自己中心視点動作生成ヒューマノイド制御2026/6/7
自己中心視点の人間デモから全身動作の事前分布を学習し、テキスト指示に基づいて動作の再構築・生成・予測を行う統一フレームワークを提案した。
- ヒューマン・アズ・ヒューマノイド:人間に合わせた身体を持つエゴ・エクソ人間ビデオからのゼロショット人型ロボット学習模倣学習2026/6/1
人間のデモ動画を高自由度ヒューマノイドのVLA学習に使えるように、身体・センシング・行動ラベルを揃えるフレームワークを提案し、実機で検証した。
- ロボセマンティックベンチ:VLAモデルの行動予測における意味的接地の診断VLA/評価ベンチマーク2026/6/1
VLAモデルが複雑な指示の意味を理解して正しい物体を操作できるかを診断するベンチマークを提案し、多くのモデルが物体把握はできるが意味的に正しい選択がランダム以下であることを示した。
- 周波数認識フローマッチングによる連続かつ一貫したロボット動作生成動作生成2026/6/1
離散的な動作チャンクに依存せず、周波数領域でフローマッチングを行うことで、異なる制御周波数や時間的不整合に頑健な連続動作を生成する手法を提案した。
- 基礎特徴量の幾何誘導モデリングによる一般化可能な物体形状変形学習3D再構成2026/5/28
単眼画像から3D物体形状を復元するため、カテゴリレベルのテンプレートを変形させる枠組みを提案し、基礎特徴量にテンプレートのトポロジーを組み込む幾何誘導機構と視点適応型特徴集約により、未知カテゴリや多視点への頑健な一般化を実現した。
- IntentVLA:曖昧なロボット操作のための短期的意図モデリングVLA/操作2026/5/1
視覚と言語の観察が似ていても異なる行動を取るマルチモーダルな模倣データに対し、過去の視覚観察を短期的意図として符号化し、行動生成を条件付けるVLAフレームワークを提案。曖昧さを評価するベンチマークAliasBenchも導入し、複数の環境で安定性と性能を向上させた。
- FrameSkip: VLAトレーニングにおける少数だが情報量の多いフレームからの学習VLA/データ選択2026/5/1
ロボットのデモ軌道から全フレームを均等に使う代わりに、動作変化や視覚-動作の整合性などに基づいて重要フレームを選び、その割合を増やして学習するフレーム選択手法を提案。データローダのみを変更し、VLAアーキテクチャはそのままに、3つのベンチマークで成功率を向上させた。
- EA-WM: イベント認識型生成ワールドモデルと構造化された運動学から視覚へのアクションフィールドワールドモデル2026/5/1
ロボットのワールドモデルにおいて、アクション信号を利用してビデオ生成を誘導し、正確なロボットの空間幾何学と物体との相互作用を保持する新しい生成モデルを提案した。
- PhysBrain 1.0 技術報告書VLA2026/5/1
大規模な人間の一人称視点ビデオから物理的常識を抽出し、視覚言語行動モデルとロボット制御ポリシーに転移する手法を提案し、複数のベンチマークで最高性能を達成した。
- 未知かつ障害物の多い環境における方向認識型凸自由領域生成による安全なナビゲーションナビゲーション2026/4/1
未知で障害物の多い環境でのロボットナビゲーションのために、候補運動方向とロボット形状を考慮した凸自由領域生成と連続安全軌道生成を統合したフレームワークを提案した。
- STARRY: ロボット操作のための時空間アクション中心世界モデルVLA/操作2026/4/1
将来の時空間予測とアクション生成を統一拡散プロセスで統合し、幾何学的注意変調により3次元制御を強化する世界モデル拡張型VLAポリシーを提案。
- CrashSight: 事故現場理解と推論のための位相認識型・インフラ中心ビデオベンチマークベンチマーク/事故理解2026/4/1
路側カメラ映像を用いた事故理解のための大規模ビジョン言語ベンチマークを構築し、既存のVLMが時間的・因果的推論に課題があることを示した。
- 3D-Mix for VLA: VGGTベースの3D情報を視覚言語行動モデルに統合するプラグアンドプレイモジュールVLA/空間知能/3D認識2026/3/1
VLAモデルの空間知能を向上させるため、VGGTによる3D情報をタスク文脈に応じて適応的に融合するプラグアンドプレイモジュール「3D-Mix」を提案し、複数のVLAアーキテクチャとベンチマークで一貫した性能向上を実証した。
- Cybo-Waiter: ヒューマノイド全身移動操作のための物理エージェントフレームワークヒューマノイド/移動操作2026/3/1
VLMプランを検証可能なタスクプログラムに変換し、3D幾何学的監視でループを閉じるヒューマノイドエージェントフレームワークを提案。移動と操作を統合し、長期的なタスク実行の堅牢性を向上させる。
- CyboRacket: ヒューマノイドラケットスポーツのための知覚から行動へのフレームワークヒューマノイド制御2026/3/1
ヒューマノイドロボットがラケットスポーツでボールを打つための、視覚追跡・軌道予測・全身制御を統合した階層的フレームワークを提案し、実機で成功を実証した。
- 遮蔽歩行者シナリオにおける能動的推論による人間らしいロボット・人間間のインタラクション自動運転/歩行者予測2026/2/1
遮蔽された歩行者の突然の出現に対処するため、能動的推論に基づく枠組みを提案し、RBPFによる状態推定と信念リセット・仮説注入で人間らしい認知を模倣、CEM強化MPPIで計画を行う。
- ALORE: 脚式マニピュレータによる大型物体の自律再配置マニピュレーション2026/2/1
脚式マニピュレータが多様な大型物体を衝突回避しながら効率的に再配置するシステムを提案。階層強化学習とタスク・モーション計画を組み合わせ、実機実験で有効性を示した。
- 内視鏡下シーンにおける単眼2D/3Dリアルタイム知覚による柔軟ロボット内視鏡器具の制御医療ロボティクス2026/2/1
単眼内視鏡画像から柔軟器具の位置・姿勢と組織との距離をリアルタイムに推定する2D/3D学習ベース知覚アルゴリズムを提案し、物理シミュレータでデータを生成して連続体ロボットの制御性能を評価した。
- LangForce: 潜在行動クエリによる視覚言語行動モデルのベイズ分解VLA2026/1/1
視覚言語行動モデルが言語指示を無視して視覚のみに依存する「情報崩壊」問題を、ベイズ分解と潜在行動クエリで解決し、未知環境での汎化性能を向上させた研究。
- ニューラル配置空間距離場による移動マニピュレータの高速かつ安全な軌道最適化マニピュレーション2026/1/1
移動マニピュレータの全身衝突回避を配置空間で直接モデル化するGCDFを提案し、GPUバッチ処理可能なニューラル距離場と逐次凸最適化により高速・安全な軌道生成を実現した。
- TwinBrainVLA: 非対称Mixture-of-Transformersによる汎用VLMの身体化タスクへの活用VLA2026/1/1
凍結した汎用VLM(左脳)と学習可能な専門家(右脳)を非対称Mixture-of-Transformersで統合し、汎用知識を保ちながら操作タスクを高精度に実行するVLAモデルを提案。
- PhysBrain:自己中心視点データで視覚言語モデルを身体知能へ橋渡しVLA2025/12/1
人間の自己中心視点動画をスキーマ駆動で身体化監督に変換するパイプラインを提案し、大規模データセットE2E-3Mで訓練した身体化脳PhysBrainがロボット制御のサンプル効率と成功率を向上させることを示した。
- 条件付き拡散モデルによる接触マップ転送で汎用性の高い巧みな把持を生成マニピュレーション2025/11/1
形状テンプレートから新規物体へ高品質な把持を転送するため、接触マップ生成を条件付き拡散モデルで定式化し、パートマップと方向マップも連鎖的に転送する枠組みを提案した。
- RobustVLA: マルチモーダル摂動に対する視覚-言語-行動モデルのロバスト性VLA2025/10/1
VLAモデルの17種類の摂動に対するロバスト性を評価し、行動が最も脆弱であることを発見。出力と入力の両方に対するロバスト化手法を提案し、LIBEROで大幅な性能向上を達成。
- 脚式ロボットのための信頼度校正知覚とトポロジカルサブゴール選択による意思決定駆動型意味的物体探索歩行2025/9/1
脚式ロボットがノイズの多い意味的観測を信頼度校正で統合し、トポロジカル記憶とサブゴール選択により効率的に物体探索する手法を提案。
- 人間型ロボットによる大型物体の抱え込み:強化学習を用いた全身マニピュレーション全身マニピュレーション2025/9/1
人間の動作事前分布とニューラル符号付距離場を強化学習に統合し、人間型ロボットが大型物体を全身で抱え込む多接触・長時間タスクを実現した。
- SAMP: 空間アンカーに基づく衝突を考慮したロボットマニピュレータの動作方策マニピュレーション2025/9/1
ロボットと環境の形状を共有空間グリッド上の符号付き距離場で同時に表現し、衝突を考慮した滑らかな軌道を生成するニューラル動作方策を提案した。
- 脚式マニピュレータのための学習ベース腕押し制御による対話型ナビゲーション移動マニピュレーション2025/3/1
脚式ロボットが腕を使って障害物を押しのけ、狭い空間でも効率的に移動できる対話型ナビゲーション手法を強化学習で実現した。
- 画像からLiDARへのデータ事前学習における時空間一貫性の強化LiDAR事前学習2025/3/1
連続するLiDAR-カメラペアを用いて時空間的手がかりを統合するSuperFlow++を提案し、11の異なるLiDARデータセットで最先端性能を達成した。
- LargeAD: 自動運転のための大規模クロスセンサデータ事前学習自動運転/3D知覚2025/1/1
2D画像から視覚基盤モデルでスーパーピクセルを抽出しLiDAR点群と対応付けることで、自動運転向けのクロスモーダル3D表現を大規模事前学習するフレームワークを提案。
- UDMC: 交通参加者の運動予測を統合した都市自動運転のための意思決定・制御統合フレームワーク自動運転2025/1/1
都市環境での自動運転において、意思決定と運動制御を単一の最適制御問題として統合し、周辺車両や歩行者、信号などの動的相互作用を考慮した解釈可能なLevel 4フレームワークを提案。CARLAでの高忠実度シミュレーションで有効性を示した。
- 自由領域の木構造を用いた混雑・未知環境でのロボットナビゲーションナビゲーション2024/10/1
自由領域の木構造をオンラインで構築し、狭い通路を含む混雑・未知環境でロボットの形状を考慮した経路計画を行うナビゲーションフレームワークを提案。
- 幾何モデリングによる単眼内視鏡シーンのスケール対応深度推定の強化深度推定2024/8/1
単眼内視鏡画像のみから、器具の3D姿勢を幾何学的に推定してスケールを復元し、スケール対応の深度推定を可能にするフレームワークを提案した。
- 4DコントラスティブSuperFlow:密な3D表現学習器3D知覚2024/7/1
LiDARとカメラの連続ペアを用いた時空間事前学習フレームワークSuperFlowを提案し、点群密度変化への不感性と流れベースのコントラスティブ学習で3D知覚モデルを効率的に学習する。
- 自動運転向けマルチモーダルなデータ効率の良い3Dシーン理解3Dシーン理解2024/5/1
LiDARセマンティックセグメンテーションの半教師あり学習において、LiDARとカメラの対応や言語知識を活用するLaserMix++を提案し、少ないアノテーションで高精度を実現した。
- 自動運転におけるBird's Eye View知覚のロバスト性のベンチマークと改善BEV知覚2024/5/1
BEV知覚モデルのロバスト性を評価するベンチマークRoboBEVを提案し、33モデルを検証してCLIPベースの改善手法を設計した。
- SimEndoGS: ロボット手術動画からの物理埋め込み3Dガウシアンによる効率的なデータ駆動型シーンシミュレーションsim2real2024/5/1
ステレオ内視鏡動画から3Dガウシアンを用いて手術シーンを再構成し、マテリアルポイント法で物理変形をシミュレートする手法を提案。数分で再構成でき、リアルタイムに近い速度で変形を生成できる。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- 目標条件付きGPTベース決定トランスフォーマーによる手術ロボットタスク自動化のための多目的クロスタスク学習手術ロボット/クロスタスク学習2024/5/1
GPTベースの目標条件付き決定トランスフォーマーとクロスタスク事前学習を組み合わせ、手術ロボットの長期的な目標達成タスクを自動化する学習フレームワークを提案した。
- MCGMapper: 平面マーカーとカメラ群を用いた軽量インクリメンタルSfMと視覚的自己位置推定SLAM/自己位置推定2024/5/1
平面マーカーと既知の外部パラメータを持つ複数カメラを使い、PnPとバンドル調整でマーカーマップを逐次構築する軽量SfMフレームワークを提案し、テクスチャの少ない屋内・産業環境での地図構築の精度と速度を向上させた。
- 最先端LiDARセグメンテーションモデル訓練の実証研究LiDARセグメンテーション2024/5/1
LiDARセグメンテーション研究を統一するツールボックスMMDetection3D-lidarsegを提案し、多様なモデル・データ拡張・疎畳み込みバックエンドを統合してベンチマークを効率化した。
- 大規模言語モデルに基づくインテリジェント工場向けマルチエージェント製造システムマルチエージェント製造2024/5/1
大規模言語モデルの推論能力を活用し、事前学習なしで動的に工場情報を分析して加工機械を選定するマルチエージェント製造システムを提案した。
- Sums-of-Squares計画法による混雑環境での衝突回避軌道最適化軌道最適化2024/4/1
ロボット形状を多項式不等式で表し、自由空間をSOS最適化で扱うことで、障害物の多い3D環境での衝突回避軌道を生成する手法を提案した。
- 星形ロードマップと動的システム変調による未知の混雑環境でのロボットナビゲーションナビゲーション2024/3/1
センサデータから星形の自由空間表現とロードマップを逐次構築し、動的システム変調に基づく反応型制御で未知の混雑環境を安全かつ効率的に移動する手法を提案した。
- Calib3D:信頼できる3Dシーン理解のためのモデル選好の校正3Dシーン理解2024/3/1
3Dシーン理解モデルの不確実性推定の信頼性を評価するベンチマークCalib3Dを提案し、28モデル・10データセットで検証。校正を改善する深度対応スケーリング手法DeptSも導入。
- Efficient Physically-based Simulation of Soft Bodies in Embodied Environment for Surgical Robot2024/2/1
- Any-point Trajectory Modeling for Policy Learning2024/1/1
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI2023/12/1
- Geometry-Aware Safety-Critical Local Reactive Controller for Robot Navigation in Unknown and Cluttered Environments2023/10/1
- RGBManip: Monocular Image-based Robotic Manipulation through Active Object Pose Estimation2023/10/1
- Visual-Kinematics Graph Learning for Procedure-agnostic Instrument Tip Segmentation in Robotic Surgeries2023/9/1
- Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot2023/7/1
- Segment Any Point Cloud Sequences by Distilling Vision Foundation Models2023/6/1
- Integrated Behavior Planning and Motion Control for Autonomous Vehicles with Traffic Rules Compliance2023/4/1
- RoboBEV: Towards Robust Bird's Eye View Perception under Corruptions2023/4/1
- Robo3D: Towards Robust and Reliable 3D Perception against Corruptions2023/3/1
- Demonstration-Guided Reinforcement Learning with Efficient Exploration for Task Automation of Surgical Robot2023/2/1
- StereoPose: Category-Level 6D Transparent Object Pose Estimation from Stereo Images via Back-View NOCS2022/11/1
- Sim-to-Real 6D Object Pose Estimation via Iterative Self-training for Robotic Bin Picking2022/4/1
- CODA: A Real-World Road Corner Case Dataset for Object Detection in Autonomous Driving2022/3/1
- Self-Localization of Parking Robots Using Square-Like Landmarks2018/12/1