Chen Wang
University at Buffalo
収録論文 103本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HOPHY: オフロード経路・ミッション計画のための階層的ハイパーグラフ表現経路計画2026/9/17
地形を意味的領域とハイパーエッジで階層化し、オフロードでの経路・ミッション計画を高速化する手法を提案。実地図で成功率100%・コスト誤差0.01%未満を達成し、実機で1.5kmのミッションを実証した。
- PIVOT: 知覚を考慮した独立視点のオンライン最適化知覚・視点最適化2026/9/16
ジンバルカメラやMEMS LiDARなど向きを独立制御できるセンサ向けに、移動軌跡に沿って視点方向をオンラインで最適化し特徴の見えやすさを最大化する軽量手法を提案。
- PhysStream: 構造化シーンメモリと細粒度運動制御による物理に基づくストリーミング動画生成動画生成2026/9/15
生成途中でも物理的に意味のある速度変化信号で動画内の物体運動を細かく操作できる自己回帰型の画像から動画への生成モデルを提案し、物理的一貫性と軌道精度を改善した。
- スーパーオドメトリ2.0:階層的適応による頑健なオドメトリオドメトリ2026/8/26
環境劣化に応じてセンサ融合を動的に適応させる頑健なオドメトリフレームワークを提案。IMUをカメラやLiDARと同等に扱い、劣化時でも信頼性を確保する。
- VeCAS: 血管介入のための血管焦点型無造影剤血管造影合成医用画像合成2026/8/24
非造影X線画像から血管造影画像を合成する2段階フレームワークを提案し、血管構造の局在化と造影外観の合成を分離することで、高品質な合成を実現した。
- S-squared-VLA: 自動運転のための視覚言語行動モデルにおける意味ストリームと空間ストリームの分離自動運転/VLA2026/7/1
自動運転向けの視覚言語行動モデルにおいて、意味情報と空間情報のストリームを分離し、空間表現の崩壊を防ぐことで、高精度な制御を実現する新しいアーキテクチャを提案した。
- 水中ソフトグリッパの接触前センシングに向けたグリッパ一体型能動電気感覚の検討水中マニピュレーション/センシング2026/6/1
濁りや遮蔽で視覚が使えない水中環境でのソフトグリッパ操作を支援するため、電場の乱れを測る能動電気感覚をグリッパに組み込み、接触前に物体を検知できるかをシミュレーションと水槽実験で検証した。
- 複雑な論理制約下での長期的タスク計画のためのニューロシンボリック学習タスク計画2026/6/1
ロボットの長期的タスク計画において、ニューラルスコアラーとシンボリックプランナーを二段階最適化で統合し、学習と計画の不一致を解消する手法を提案。並列リカバリ戦略により性能を向上させた。
- PhyWorld: 物理的に忠実な世界モデルによるビデオ生成ビデオ生成2026/5/19
ビデオ生成モデルを物理法則に従う世界シミュレータとして機能させるため、2段階のポストトレーニング(フローマッチングとDPO)を導入し、物理的整合性を向上させた。
- インピーダンス駆動の異方性誘導場による共有自律支援共有自律/遠隔操作2026/5/1
ロボットの意図を人間に物理的・直感的に伝えるため、インピーダンス制御に着想を得た誘導場を共有自律制御に組み込み、タスク性能と協調性を向上させた。
- G-DRAGON: 屋外ナビゲーションのための地理空間推論と動的計画を備えた検索拡張フレームワークナビゲーション2026/5/1
自然言語の指示からOSM地図を検索して大域経路を計画し、SLAMと組み合わせてロボットを目的地まで誘導し、最後の区間はフロンティア探索とセマンティックボクセルマッピングで目標物を探索する屋外ナビゲーション手法を提案した。
- 階層的認知と文脈認識型探索を備えた実装可能な具現化視覚言語ナビゲーションシステムナビゲーション2026/4/1
実世界ロボット向けに、高速な知覚行動層と深い推論層を非同期に動作させ、共有メモリで連携するVLNシステムを提案。探索問題を重み付き巡回修理人問題として定式化し、実機でも高効率・高推論性能を実現した。
- ビデオから制御へ:時間的視覚データから操作インターフェースを学習する手法のサーベイ操作学習/サーベイ2026/4/1
ロボットの行動ラベルを使わない時間的ビデオデータから、ロボット操作のための制御インターフェースを学習する手法を分類・分析したサーベイ論文。
- GSMem: 3Dガウススプラッティングを永続的空間記憶として用いたゼロショット身体化探索と推論探索/ナビゲーション2026/3/1
3Dガウススプラッティングを永続的な空間記憶として活用し、エージェントが初期観察で見逃した対象を後から再観察できるようにする、ゼロショットの身体化探索・推論フレームワークを提案した。
- 跳ぶべき時を学ぶオフロードナビゲーションナビゲーション2026/2/1
地形ごとの走行コストを速度の関数としてモデル化し、溝を跳び越えるなど速度に応じた安全な経路計画を実現した研究。
- CLEAR: 大規模非構造環境のための意味幾何学的地形抽象化ナビゲーション2026/1/1
大規模非構造地形を凸で意味的に整合した領域に抽象化し、地形対応グラフとして表現するフレームワークCLEARを提案。生グリッドA*より最大19.6倍高速な計画と短い実行経路を実現。
- 遠隔操作ロボットアームの動きから操作者の感情を推定する遠隔操作2025/12/1
遠隔操作ロボットの機能的動作から、機械学習を用いて操作者の感情状態を83.3%の精度で推定できることを示した研究。
- ロボティクスに最適な3Dシーン表現は何か?幾何表現から基盤モデルまで3Dシーン表現2025/12/1
ロボティクスにおける点群・ボクセル・SDF・NeRF・3DGS・基盤モデルなどの3Dシーン表現を、知覚・地図構築・自己位置推定・ナビゲーション・マニピュレーションの5モジュール別に整理・比較したサーベイ。
- GContextFormer: マルチモーダル軌道予測のためのグローバル文脈認識型ハイブリッドマルチヘッド注意とスケール付加集約軌道予測2025/11/1
地図に依存せず、グローバル文脈を考慮したハイブリッド注意とスケール付加集約により、意図に沿ったマルチモーダル軌道予測を実現するエンコーダ・デコーダ型モデルを提案。
- BagIt! 布製バッグへの物体詰め込みのための適応型双腕マニピュレーションマニピュレーション2025/9/1
変形する布製バッグの状態をGMMで推定し、双腕ロボットが視覚フィードバックに基づいて適応的に物体を袋詰めするシステムを提案した。
- BridgeDepth: 潜在表現の整合による単眼・ステレオ推論の橋渡し深度推定2025/8/1
単眼深度推定の文脈情報とステレオの幾何情報を、双方向クロスアテンションで反復的に整合させる統合フレームワークを提案し、透明・反射面の曖昧さを解消しつつゼロショット汎化誤差を40%以上削減した。
- ニューロシンボリック緩和による高速タスクプランニングタスクプランニング2025/7/1
ニューラルネットで重要物体を予測しつつ記号プランナで緩和・拡張を行うことで、長期的タスク計画を高速かつ高成功率で実現する手法を提案。
- 空間強化リカレントメモリによる長距離マップレスナビゲーションのためのエンドツーエンド強化学習ナビゲーション2025/6/1
既存のRNNの空間記憶能力の限界を指摘し、空間記憶を強化するSRUを提案。単眼ステレオカメラを用いた長距離マップレスナビゲーションを実現し、既存RNN比で23.5%の性能向上を達成。
- 遠隔操作ロボットシステムにおける触覚フィードバックを用いたユーザ認証触覚2025/6/1
遠隔操作ロボットでの人間とロボットのインタラクション中に得られる触覚フィードバックからユーザ固有の行動特徴を抽出し、トランスフォーマーモデルで時系列解析することで、なりすましやリプレイ攻撃に強い認証手法を提案した。15人の参加者による7タスクの力覚データセットで90%以上の精度を達成した。
- RGB単眼カメラの深度推定に基づくリハビリ用下肢外骨格の非接触ジェスチャ操作制御HRI/リハビリ外骨格2025/4/1
RGB単眼カメラの深度推定を用いて、リハビリ用下肢外骨格を非接触のジェスチャで操作する手法を提案し、94.11%の動作精度と平均0.615秒の応答時間を達成した。
- Chain-of-Modality: マルチモーダル人間動画と視覚言語モデルによる操作プログラムの学習VLA2025/4/1
筋電アームバンドやマイクなどで計測した人間の操作動画から、視覚言語モデルがタスク計画と力などの制御パラメータを抽出し、ロボットに操作タスクを実行させる手法を提案した。
- SuperPC:点群の補完・アップサンプリング・ノイズ除去・着色を同時に行う単一拡散モデル点群処理2025/3/1
点群の欠損・低解像度・ノイズ・無色という4つの問題を、単一の拡散モデルで同時に解決する手法を提案。
- BEHAVIORロボットスイート:日常家事のための実世界全身マニピュレーションを効率化全身マニピュレーション2025/3/1
両腕・車輪・4自由度胴体を備えたロボットで、全身遠隔操作インターフェースと視覚運動ポリシー学習アルゴリズムを統合し、家庭内の全身マニピュレーションタスクを実現するフレームワークを提案。
- VL-Nav: ニューロシンボリック推論に基づく視覚言語ナビゲーション視覚言語ナビゲーション2025/2/1
記号的3Dシーングラフと画像メモリを活用したニューロシンボリックなタスクプランナと探索システムにより、複雑な指示に基づく大規模未知環境でのロボットナビゲーションを実現した。
- AnyNav: 視覚による神経記号的摩擦学習を用いたオフロードナビゲーションオフロードナビゲーション2025/1/1
視覚から地形の摩擦係数を推定し、物理モデルと組み合わせてオフロード走行の経路と速度を計画する神経記号的手法を提案。実機へのsim2real転移も実証した。
- iKap: 運動学を考慮した命令的学習による計画計画2024/12/1
視覚から計画を生成するシステムにロボットの運動学モデルを組み込み、自己教師あり学習と微分可能な二段階最適化で衝突回避と運動学制約を同時に満たす軌道計画を実現した。
- 効率的なキーポイント検出と系列情報によるシーン座標回帰の強化visual localization2024/12/1
シーン座標回帰において、キーポイント検出とシーンエンコーディングを統合し、系列情報を活用することで、繰り返しテクスチャ環境での精度と効率を向上させた。
- 人間の手の動きデータを用いた物体中心の巧みな操作マニピュレーション2024/11/1
人間の手の動作データから物体操作のための階層的な方策を学習し、シミュレーションと実機の双腕多指ハンドで汎化性能を示した。
- EROAM: イベントカメラによる実時間回転オドメトリとマッピングオドメトリ/イベントカメラ2024/11/1
イベントカメラのデータを単位球面に投影する球面表現とES-ICPという幾何最適化を導入し、カメラ回転の推定とパノラマ再構成を実時間で高精度に行うシステムを提案した。
- EgoMimic: 一人称視点映像による模倣学習のスケーリング模倣学習2024/10/1
スマートグラスで撮影した一人称視点の人間の手の映像とロボットのデータを統合して模倣学習を行い、多様な長期的マニピュレーションタスクの性能と汎化を向上させるフレームワークを提案。
- ARCap: 拡張現実フィードバックで高品質な人間デモンストレーションを収集するロボット学習システム模倣学習/データ収集2024/10/1
ARによる視覚フィードバックと触覚警告で初心者でもロボット実行可能な高品質デモを収集できる携帯型データ収集システムを提案し、混雑環境での操作や長期的なクロスエンボディメント操作を実現した。
- ロバストな方策学習のためのデジタルいとこの自動生成sim2real2024/10/1
実世界のシーンを模した「デジタルいとこ」を自動生成し、シミュレーションから実世界へのゼロショット転移で高い成功率を達成する手法を提案。
- Eagerモードでのバンドル調整SLAM2024/9/1
PyTorchに統合したEagerモードのバンドル調整ライブラリを提案し、スパース性を考慮した自動微分とGPU演算で従来比最大23倍の高速化を実現した。
- ReKep: ロボットマニピュレーションのための関係的キーポイント制約の時空間推論マニピュレーション2024/9/1
環境中の3Dキーポイント間の関係をPython関数で表す制約(ReKep)を導入し、大規模視覚モデルと言語モデルを用いて自由形式の指示から自動生成することで、多様なマニピュレーションタスクをリアルタイムに実行する手法を提案。
- MapEx: 地図予測に基づく確率的情報利得を用いた屋内構造探査探査2024/9/1
観測情報から複数の予測地図を生成し、その分散と可視領域を考慮して確率的な情報利得を推定することで、屋内環境を効率的に探索するフレームワークを提案した。
- iWalker: 歩行人型ロボットのための命令的視覚計画歩行2024/9/1
視覚に基づく障害物回避と足場計画を同時に行う、エンドツーエンドの人間型ロボット歩行システムを提案。自己教師あり学習によりシミュレーションと実環境で有効性を実証した。
- AirSLAM: 照明変化に頑健な効率的点・線ベースVisual SLAMシステムVisual SLAM2024/8/1
深層学習による特徴検出・マッチングと従来の最適化を組み合わせ、点と線を統合的に扱う照明変化に強いVisual SLAMを提案。C++とTensorRTで高速化し、PCで73Hz、組込みで40Hzを実現した。
- 命令的学習:ロボット自律性のための自己教師ありニューロシンボリック学習フレームワークニューロシンボリック2024/6/1
ニューラルモジュール・推論エンジン・記憶システムを二段階最適化で相互学習させる自己教師ありニューロシンボリック手法を提案し、経路計画や最適制御など5タスクで有効性を検証した。
- TRANSIC: オンライン修正から学ぶSim-to-Realポリシー転移sim2real2024/5/1
人間が実世界でロボットの動作を観察・介入して修正を加え、その修正から残差ポリシーを学習することで、シミュレーションと実世界のギャップを埋めて家具組立などの接触の多いタスクを実現する手法。
- 命令的学習による最小最大複数巡回セールスマン問題の解法群制御2024/5/1
複数エージェントの巡回経路の最大長を最小化する問題を、割当ネットワークと自己教師あり二段階最適化で解く手法を提案し、大規模問題で既存手法より短い経路を高速に得た。
- ポーズのみの教師あり学習による顕著スパース視覚オドメトリ視覚オドメトリ2024/4/1
ポーズ情報のみを教師信号として使うハイブリッド視覚オドメトリを提案し、自己教師ありホモグラフィ事前学習とランダムパッチ顕著点検出により、密なオプティカルフロー教師なしでも高い汎化性能を実現した。
- PhysORD: 物理法則を組み込んだニューロシンボリックなオフロード走行の運動予測sim2real2024/4/1
オイラー・ラグランジュ方程式をニューラルモデルに組み込み、オフロード走行の車両運動を高精度かつデータ効率的に予測する手法を提案した。
- POMDPに基づく能動的な力探索によるロボット挿入マニピュレーション2024/4/1
接触状態の情報を活用し、POMDPとして定式化した探索戦略でロボット挿入を効率化する手法を提案。
- BEHAVIOR-1K:1000の日常活動とリアルなシミュレーションによる人間中心の身体性AIベンチマークsim2real2024/3/1
人間がロボットにやってほしいと望む1000の日常活動を、50のシーンと9000以上の物体を含む物理シミュレーション環境OMNIGIBSONで再現し、実世界への転移も検証したベンチマークを提案した。
- iA*: 命令的学習に基づくA*探索による経路計画経路計画2024/3/1
ニューラルネットによるノードコスト予測と微分可能なA*探索を二段階最適化で自己教師あり学習させ、探索効率と経路最適性のバランスを改善した経路計画手法。
- DexCap: 巧みな操作のためのスケーラブルでポータブルなモーションキャプチャデータ収集システムマニピュレーション2024/3/1
SLAMと電磁場を組み合わせたポータブルな手のモーションキャプチャシステムDexCapと、そのデータから直接ロボットの巧みな操作スキルを学習する模倣アルゴリズムDexILを提案した。
- Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis2023/12/1
- NOIR: Neural Signal Operated Intelligent Robots for Everyday Activities2023/11/1
- AirIMU: Learning Uncertainty Propagation for Inertial Odometry2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- PyPose v0.6: The Imperative Programming Interface for Robotics2023/9/1
- Sequential Dexterity: Chaining Dexterous Policies for Long-Horizon Manipulation2023/9/1
- StairNetV3: Depth-aware Stair Modeling using Deep Learning2023/8/1
- Primitive Skill-based Robot Learning from Human Evaluative Feedback2023/7/1
- VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models2023/7/1
- SubT-MRS Dataset: Pushing SLAM Towards All-weather Environments2023/7/1
- iSLAM: Imperative SLAM2023/6/1
- Learning-on-the-Drive: Self-supervised Adaptation of Visual Offroad Traversability Models2023/6/1
- AirLine: Efficient Learnable Line Detection with Local Edge Voting2023/3/1
- MimicPlay: Long-Horizon Imitation Learning by Watching Human Play2023/2/1
- iPlanner: Imperative Path Planning2023/2/1
- AirVO: An Illumination-Robust Point-Line Visual Odometry2022/12/1
- RGB-D-based Stair Detection using Deep Learning for Autonomous Stair Climbing2022/12/1
- PyPose: A Library for Robot Learning with Physics-based Optimization2022/9/1
- NeRF-Loc: Transformer-Based Object Localization Within Neural Radiance Fields2022/9/1
- Robotic Interestingness via Human-Informed Few-Shot Object Detection2022/8/1
- Generalizable Task Planning through Representation Pretraining2022/5/1
- Off-Policy Evaluation with Online Adaptation for Robot Exploration in Challenging Environments2022/4/1
- Unsupervised Online Learning for Robotic Interestingness with Visual Memory2021/11/1
- AirObject: A Temporally Evolving Graph Embedding for Object Identification2021/11/1
- AirLoop: Lifelong Loop Closure Detection2021/9/1
- AirDOS: Dynamic SLAM benefits from Articulated Objects2021/9/1
- Co-GAIL: Learning Diverse Strategies for Human-Robot Collaboration2021/8/1
- What Matters in Learning from Offline Human Demonstrations for Robot Manipulation2021/8/1
- Encirclement Guaranteed Cooperative Pursuit with Robust Model Predictive Control2021/8/1
- F-LOAM: Fast LiDAR Odometry And Mapping2021/7/1
- AirCode: A Robust Object Encoding Method2021/5/1
- Towards Real-time Semantic RGB-D SLAM in Dynamic Environments2021/4/1
- Few-Shot Meta-Learning on Point Cloud for Semantic Segmentation2021/4/1
- Generalization Through Hand-Eye Coordination: An Action Space for Learning Spatially-Invariant Visuomotor Control2021/3/1
- Decentralized Circle Formation Control for Fish-like Robots in the Real-world via Reinforcement Learning2021/3/1
- Intensity-SLAM: Intensity Assisted Localization and Mapping for Large Scale Environment2021/2/1
- Lightweight 3-D Localization and Mapping for Solid-State LiDAR2021/2/1
- SwingBot: Learning Physical Features from In-hand Tactile Exploration for Dynamic Swing-up Manipulation2021/1/1
- Online Visual Place Recognition via Saliency Re-identification2020/7/1
- Motion Planning for Heterogeneous Unmanned Systems under Partial Observation from UAV2020/7/1
- Visual Memorability for Robotic Interestingness via Unsupervised Online Learning2020/5/1
- Intensity Scan Context: Coding Intensity and Geometry Relations for Loop Closure Detection2020/3/1
- TartanAir: A Dataset to Push the Limits of Visual SLAM2020/3/1
- Transferable Force-Torque Dynamics Model for Peg-in-hole Task2019/12/1
- 6-PACK: Category-level 6D Pose Tracker with Anchor-Based Keypoints2019/10/1
- DenseFusion: 6D Object Pose Estimation by Iterative Dense Fusion2019/1/1
- Graph Optimization Approach to Range-based Localization2018/2/1
- Correlation Flow: Robust Optical Flow Using Kernel Cross-Correlators2018/2/1
- Robust Target-relative Localization with Ultra-Wideband Ranging and Communication2018/2/1
- Ultra-Wideband Aided Fast Localization and Mapping System2017/10/1
- GroundSLAM: A Robust Visual SLAM System for Warehouse Robots Using Ground Textures2017/10/1
- Non-Iterative SLAM2017/1/1