Yang Liu
Sun Yat-sen University
収録論文 111本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視界を取り戻せ:ロボットマニピュレーションにおける遮蔽回復のための物理的アクティブビジョンベンチマークマニピュレーション2026/9/29
両腕ロボットの遮蔽回復を評価するベンチマークBAVO-Benchを提案し、未来予測を活用したアクティブビジョン方策A-FARで遮蔽への頑健性を向上させた。
- LexiconVLA: 未知タスク向けの再利用可能な原子行動コードブックの学習VLA2026/9/29
視覚言語行動モデルが未知タスクで繰り返し現れる動作を再利用できるよう、原子行動をコードブック化して検索・適用する手法を提案し、未知タスクの成功率を向上させた。
- AquaMend: 身体性エージェントの潜在信念故障に対する最小再プロービングと条件付きロールバックロボティクス/信念修復2026/9/24
物理変化やセンシング誤りでエージェントの信念が崩れた際に、再プロービング・ロールバック・継続支援を確率的に選択する手法を提案し、シミュレーションで再起動より損失を21.6%削減した。
- UCON: 動的環境における不確実性を考慮した履歴再関連付けナビゲーションナビゲーション2026/9/24
動的環境での知覚不安定性と不確実性最適化の不一致に対処するため、点群の履歴再関連付けとカルマンフィルタによる不確実性セクターを軌道最適化に組み込んだナビゲーション手法を提案。
- Fysiverse-3D-Vision: 画像から実行可能な3D世界を生成する統合空間推論フレームワーク3D生成2026/9/22
単一画像から物体の意味・形状・配置を統合的に推論し、物理シミュレーション可能な3Dシーンを生成する視覚言語幾何フレームワークを提案。
- 不完全データを活用した高精度ロボットマニピュレーションマニピュレーション2026/9/22
低精度なタスク固有データと高精度なタスク不一致データをフローマッチングのノイズレベルに応じて使い分け、高精度マニピュレーションのVLAモデルを効率的に訓練する手法を提案。
- AquaCap: コードを方策とする学習不要の水中エンボディドエージェント水中ロボティクス2026/9/19
大規模学習データ不要で、コード生成により水中ロボットの自律航行とマニピュレーションを実現するフレームワークを提案し、実機ROVで把持・運搬を実証した。
- PileBelief:相互作用駆動型世界モデルのための持続的物理状態世界モデル2026/9/19
掘削環境において、局所観測から土壌の内部状態を推定し、複数ステップの地形変化予測と行動選択を行う持続的物理信念に基づく世界モデルを提案。
- 粒状物すくいにおける手首力覚による物理的接触観測性触覚2026/9/19
6,700回の実機すくい実験から、手首の6軸力覚センサが最終的な収集体積を予測できることを示し、接触時の物理状態を推論する知覚モダリティとしての可能性を実証した。
- コンパクトだが動く:リカレント世界モデルにおける介入関連幾何学世界モデル2026/9/18
リカレント世界モデルにおいて、介入による修正が固定部分空間を離れてもヤコビアン輸送で捉えられることを示し、介入構造の持続性を明らかにした。
- OmniRisk: 機敏なクアッドロータの動的回避のための全方向軌道リスク学習飛行ロボット2026/9/16
LiDARの距離パノラマと動的マスク、表面速度を統合したテンソル表現と非対称リスク場を用い、候補軌道のリスクをオフライン学習してオンボードで高速に動的障害物を回避する全方向プランニング手法を提案。
- TIO-Former:ストリーミング因果トランスフォーマによるナノUAV向け超軽量6方向ToF慣性オドメトリオドメトリ2026/9/15
IMUと6つの直交8x8 ToFアレイのみを用い、ストリーミング因果トランスフォーマでナノUAVの6自由度自己位置推定を軽量・高精度に実現した。
- 不確実性誘導スパースリファインメントによるアクションチャンキングトランスフォーマーポリシーマニピュレーション2026/9/14
アクションチャンキング型視覚運動ポリシーの予測誤差が大きいタイムステップのみを不確実性で特定し、残差補正をスパースに適用する手法を提案。RoboTwinの双腕操作タスクで成功率を最大13%改善。
- FolDeX: 変形可能物体の長期的ロボット操作のための実世界ベンチマーク変形物体操作2026/9/9
衣類折りたたみを主タスクとし、2000時間以上の実ロボットデータと10種以上の機体を用いて、変形物体の長期的な両手操作を評価する実世界ベンチマークを構築した。
- WM-Craftnet: 汎用かつ堅牢な器用な手内操作のための世界共感覚モデルマニピュレーション2026/9/7
ノイズの多い観測から物体の状態を推定し、頑健な手内操作を実現するため、世界モデルをタスクコンテキストとして活用するフレームワークを提案した。
- アプリケーションストリーム上の継続的GUIエージェント学習のための選択的知識制御継続学習2026/9/6
GUIエージェントの継続学習において、ニューロン単位の勾配操作により過去の知識を保護しつつ新しいアプリケーションに適応する軽量な選択的知識保持手法を提案した。
- HaptiNet: ネットワーク化されたハプティックロボットによる地理的制約を超えた身体的共存の実現遠隔リハビリテーション/ハプティックインタラクション2026/9/4
遠隔リハビリテーションにおいて、力覚を介した身体的共存を可能にするネットワーク型ハプティックロボットシステムHaptiNetを提案し、模倣学習に基づく遅延補償により遠隔地間での協調運動を実現した。284名の健常者と111名の神経障害患者を対象に検証し、ハプティック協調訓練がタスク性能を向上させることを示した。
- マトリックスゲーム3.5:パッチメモリによるリアルタイムストリーミング対話型ワールドモデルの強化ワールドモデル2026/8/30
本論文は、対話型ワールドモデルをリアルタイムで長時間安定生成するため、幾何認識メモリ、静的動的分解表現、二段階蒸留を導入したMatrix-Game 3.5を提案する。
- Riemann-1.0: 物理AIのための具現化世界行動モデルVLA2026/8/27
ロボットの行動と世界の変化を統一的な因果系列としてモデル化し、単一モデルでポリシー実行と世界シミュレーションを実現する世界行動モデルを提案。大規模データで事前学習し、シミュレーションと実世界の操作タスクで最高性能を達成。
- LAC: 人型全身制御のための線形・角コンプライアンス全身制御2026/8/26
人型ロボットの全身制御において、外力に対する線形および角方向のコンプライアンスを同時に実現する新しい制御手法を提案し、シミュレーションと実機実験でその有効性を示した。
- GCS-Bridging: 凸集合の非連結性を回復するグラフ・オブ・凸集合運動計画運動計画2026/8/23
凸集合のグラフ(GCS)に基づく運動計画で、開始・目標領域が異なる連結成分にある場合に、衝突回避経路と凸領域の膨張で連結性を回復する手法を提案。シミュレーションで99.8%の成功率、実機でも有効性を確認。
- 特徴ロバスト拡張と根拠に基づく説明最適化による説明可能なディープフェイク検出ディープフェイク検出2026/8/21
画像品質低下への耐性と説明の正確性を両立するため、劣化対応の拡張と教師あり対比学習、および証拠に基づく選好最適化を導入した説明可能なディープフェイク検出フレームワークを提案した。
- EATR-Stereo: 身体性を考慮したステレオ証拠のルーティングによるヒューマノイド視覚言語行動制御VLA/ヒューマノイド2026/8/18
頭部搭載ステレオカメラを持つヒューマノイドのVLA制御において、主視点のトークンを保持しつつ補助視点の情報を身体状態に応じて選択的に統合するフレームワークを提案し、実機で高い成功率を達成した。
- 学習済みワールドモデルにおける反実仮想ロールアウトのための低ランク動的実効潜在キャリアワールドモデル2026/8/15
学習済みワールドモデルの隠れ状態に小さな低ランク修正を加えることで、将来の観測や教師なしで反実仮想の未来を自律的に生成できることを示した論文。
- ビデオと画像の統一表現学習によるビデオ顔偽造検出顔偽造検出2026/8/13
ビデオ内の一部フレームのみが改ざんされた部分偽造を検出するため、追加の注釈付き画像を活用して細かい監視を行う統一エンコーダとマルチタスク学習を備えたフレームワークUVIFを提案した。
- State2State: 環境から導出された中間学習によるLLMエージェントの訓練LLMエージェント2026/8/5
外部タスク指定なしに環境との相互作用のみでエージェントを訓練する手法を提案。探索した環境状態を目標状態に変換し、ルールベースの状態一致で検証することで、スケーラブルで検証可能な訓練目標を提供する。
- GraphThink: グラフ強化LLM思考による長期的身体性タスク計画タスク計画2026/8/1
LLMベースの身体性エージェントの計画における幻覚や長期タスクへの汎化不足を解決するため、タスクグラフとシーングラフを統合したフレームワークを提案。ALFREDベンチマークで最先端性能を達成した。
- HCPG-Flow:フローポリシーによるロボット操作のための階層的接触進行ガイダンスマニピュレーション2026/7/1
フローポリシーによるロボット操作において、接触前後で階層的な物体中心の進行指標を用いて候補動作を選択する手法を提案し、シミュレーションと実機で成功率を向上させた。
- 時間的比率によるビデオ行動汎化ギャップの理解と緩和VLA2026/7/1
ビデオ基盤モデルをロボット行動データで微調整すると構成的一般化能力が失われる問題を分析し、注意機構に基づく指標「時間的比率」を導入してその原因を解明し、推論時に適応的にガイドする手法を提案した。
- Bridge-WA: ロボット行動のための世界の変化箇所と変化方法の予測VLA2026/7/1
ロボット操作のための軽量な世界行動モデルを提案し、将来の変化を教師モデルから蒸留した3つの事前知識で行動生成を条件付け、外乱に強い汎化を実現した。
- PhyAgentOS: 認知計画と物理実行を分離した自己進化型身体化エージェントOS身体化エージェント/OS2026/7/1
身体化エージェント向けに、セッション単位のスケジューリング、検証、記憶、安全をOSサービスとして提供する実行基盤を提案。状態をファイルとして扱うことで認知と物理実行を分離し、検証済み結果を知識として蓄積する自己進化ループを実現した。
- 基盤モデル連携の再考:代理タスク推論による特化モデルの強化VLA2026/6/30
基盤モデルと特化モデルの協調をタスク分解として捉え、特化モデルの予測候補を基盤モデルが選択・検証する代理タスクで改善するフレームワークFATを提案。2D/3D物体検出、軌道予測、セマンティックセグメンテーションで効果を実証。
- ABot-Earth 0.5: 生成型3D地球モデル3D生成2026/6/8
衛星画像から広大な3D環境を生成する生成モデルを提案し、3Dガウススプラッティングを用いてリアルな都市景観を高速に合成する。
- RoboProcessBench: 視覚言語ロボット操作におけるプロセス認識理解のベンチマークVLA/ベンチマーク2026/6/1
ロボット操作の実行過程を静的監視と動的推論の2次元で評価するベンチマークを構築し、12種類の診断質問群と約58kのQAペアを含むデータセットを提供した。既存のVLMがプロセス理解に乏しいことを示し、教師あり微調整による改善効果も検証した。
- 文脈内モデル予測生成:言語モデルから物理へのオープンボキャブラリ動作合成動作合成2026/6/1
テキスト記述から人間の動作を合成する際に、言語モデルの意味理解と物理シミュレーションの現実性を統合したフレームワークICMPGを提案し、オープンボキャブラリの指示に対して物理的に妥当な動作を生成する。
- VLAMotor: エージェントベースのデータ合成による視覚言語行動モデルのテスト駆動型強化VLA2026/6/1
VLAモデルのエッジケースでの失敗を検出し、その失敗を教師データに変換してモデルを微調整するフレームワークVLAMotorを提案した。
- イベント条件付き診断:受動的オブジェクト状態ワールドモデルにおける運動学的・接触・物体永続性フィールドの解析ワールドモデル2026/6/1
物理的状態を予測するワールドモデルの内部表現が、自由運動・衝突・遮蔽などのイベントに応じてどのように情報を編成・再重み付けするかを診断する手法を提案し、予測への機能的影響を検証した。
- 動きから触覚を見る:触覚運動相関を用いた統一モダリティ認識視触覚ポリシーマニピュレーション2026/6/1
接触を伴う操作において、触覚センサの画像から過渡的運動と累積運動の相関を利用して細かい接触状態を識別する新しい触覚表現を提案し、視覚と触覚の効果的な融合を実現するポリシーを開発した。
- ARP: 視覚的整合と反復的洗練による量子化スキル抽象化の強化でロボット操作を実現操作学習2026/6/1
長期的な操作タスク向けに、視覚と行動を整合させ、離散スキル表現の精度を反復的に洗練する新しいポリシーを提案し、ベンチマークと実機で効果を実証した。
- STELLAR: 自動運転向け3D知覚大規模モデルのスケーリング自動運転/3D知覚2026/5/1
自動運転の3D知覚モデルを大規模化し、LiDAR・レーダー・カメラ・地図情報を統合して5000万データで学習し、Waymoデータセットで最高性能を達成した研究。
- RoVLA: ロバストな視覚言語行動モデルのための多重整合性制約VLA2026/5/1
視覚言語行動モデルのロバスト性を高めるため、指示意味・軌道進化・観測摂動の3つの変換に対する整合性制約を導入したRoVLAを提案。
- BrainMem: 身体性エージェントのタスク計画のための脳に着想を得た進化する記憶VLA2026/4/1
人間の認知に着想を得た、訓練不要の階層的記憶システムを提案し、エージェントの過去の経験を知識グラフと記号的ガイドラインに変換して、LLMベースのプランナーが長期的なタスクをより成功させることを実証した。
- 多様性を考慮したレッドチーミングによる視覚言語行動モデルの言語的脆弱性の解明VLA/ロバスト性/レッドチーミング2026/4/1
ロボット操作のための視覚言語行動モデル(VLA)の言語的変化に対する頑健性を評価するため、多様な敵対的指示を生成するフレームワークDAERTを提案し、既存手法より多様で効果的な失敗パターンを発見した。
- AcceRL: 視覚言語行動モデルのための分散非同期強化学習と世界モデルフレームワークVLA/強化学習2026/3/19
同期バリアと環境データ取得コストによるボトルネックを解消するため、環境ロールアウト・モデル推論・勾配更新を物理的に分離した分散非同期RLフレームワークを提案し、スループットとサンプル効率を大幅に向上させた。
- ACCURATE: ロバストな適応的二視点推定に基づく任意形状連続体の再構成医用画像処理2026/3/1
X線画像からガイドワイヤやカテーテルなどの任意形状の連続体を高精度に3次元再構成するフレームワークを提案した。
- TacMamba: 高速反射と低速VLA推論を橋渡しする触覚履歴圧縮アダプタ触覚/VLA2026/3/1
触覚データの高周波処理と視覚ポリシーの低周波処理のギャップを埋めるため、Mambaベースの触覚履歴圧縮器を導入し、VLAモデルにプラグイン可能な高速触覚融合を実現した。
- OccTrack360: 全方位魚眼カメラによる4Dパノプティック占有追跡占有予測/追跡2026/3/1
全方位魚眼カメラ向けの長尺4Dパノプティック占有追跡ベンチマークOccTrack360と、球面歪みと位置ずれに対処するベースライン手法FoSOccを提案した。
- MMaDA-VLA:マルチモーダル指示と生成を統合した大規模拡散視覚-言語-行動モデルVLA2026/3/1
離散拡散を用いて将来の目標観察と行動チャンクを同一トークン空間で同時にデノイズするVLAモデルを提案し、LIBEROで98.0%の成功率を達成した。
- ReMemNav: ゼロショット物体ナビゲーションのための再考とメモリ拡張フレームワークナビゲーション2026/3/1
視覚言語モデルの空間的幻覚や局所探索のデッドロックを解決するため、パノラマ意味情報とエピソード記憶を統合した階層型ナビゲーションフレームワークReMemNavを提案した。
- DDP-WM: 効率的なワールドモデルのための分離型ダイナミクス予測ワールドモデル2026/2/1
観測シーンの潜在状態変化を、物理相互作用による疎な主要ダイナミクスと背景更新に分離して予測するワールドモデルを提案し、推論を約9倍高速化しつつ操作タスクの成功率を向上させた。
- Eva-Tracker: ESDF更新不要の可視性考慮型計画と目標再捕捉による堅牢な空中追跡空中追跡2026/2/1
ESDFの更新を不要にする視野特化型ESDFを導入し、遮蔽を避けつつ目標を見失っても再捕捉できる空中追跡の軌道計画手法を提案した。
- FRAPPE: 複数未来表現アラインメントによる汎用ロボット方策への世界モデリングの注入VLA2026/2/1
未来の観測の潜在表現を予測し、複数の視覚基盤モデルと並列にアラインメントすることで、汎用ロボット方策に世界認識を効率的に組み込む手法を提案。
- 見えた!:生ピクセルからのエンドツーエンドヒューマノイド歩行学習歩行2026/2/1
生の深度画像からヒューマノイドの歩行をエンドツーエンドで学習するフレームワークを提案し、高忠実度深度センサシミュレーションと視覚認識行動蒸留、地形別報酬設計により、実機での多様な地形適応を実現した。
- 磁気駆動によるマンタ型マイクロソフトロボットの作製と遊泳運動の研究ソフトロボティクス/磁気駆動2026/1/1
マンタ(トビエイ)の遊泳原理を模倣し、NdFeBとPDMSで作製した磁気応答型マイクロソフトロボットを3次元ヘルムホルツコイルで駆動し、磁場パラメータが遊泳性能に与える影響を実験的に調べた。
- PUMA: 知覚駆動型統合足場事前分布による機動性拡張四足パルクール歩行2026/1/1
視覚知覚と足場の事前分布を単一段階の学習に統合し、地形特徴から自己中心的な極座標足場を推定して四足ロボットのパルクールを実現するフレームワークを提案。
- 多様性誘導メタモルフィックテストによる身体性エージェントの非最適意思決定の検出タスク計画評価2025/12/1
身体性エージェントのタスク計画において、タスクは成功するが非効率な「非最適意思決定」を検出するため、4つのメタモルフィック関係と多様性誘導のテスト選択戦略を組み合わせたフレームワークNoD-DGMTを提案し、AI2-THOR上で有効性を示した。
- Vision-Language-Actionモデルの解剖学:モジュールからマイルストーン、課題までVLA2025/12/1
VLAモデルの基本構成から歴史的発展、そして表現・実行・汎化・安全性・データセットと評価という5大課題を整理したサーベイ論文。
- HiF-VLA: 運動表現による視覚-言語-行動モデルのための後知恵・洞察・先見VLA2025/12/1
ロボット操作のためのVLAモデルに、過去・現在・未来の運動情報を統合する世界モデルを組み込み、長期的なタスクの一貫性を向上させた研究。
- 記述を超えて:身体性エージェントのための細粒度行動の認知ベンチマーク身体性AIベンチマーク2025/11/1
身体性エージェントの細粒度行動知能を評価する新ベンチマークCFG-Benchを提案し、最先端MLLMの限界を明らかにした。
- 位相ベースのマルチ歩容学習によるサンショウウオ型ロボット歩行2025/11/1
位相変数と位相カバレッジ報酬を用いて、参照動作なしにサンショウウオ型ロボットへ多様な歩容を獲得させる学習フレームワークを提案し、22種類の歩容を実現した。
- HDCNet: 透明・反射物体把持のためのハイブリッド深度補完ネットワークマニピュレーション2025/11/1
透明・反射物体の深度計測を改善するため、Transformer・CNN・Mambaを統合した深度補完ネットワークHDCNetを提案し、把持成功率を最大60%向上させた。
- 投げて回転させる動作の学習マニピュレーション2025/10/1
ロボットが物体を投げて、指定した位置と向きに着地させる「スローフリップ」を実現する手法を提案。物理モデルと学習を組み合わせ、未見の姿勢への汎化とサンプル効率を向上させた。
- RoVer: 視覚-言語-行動モデルのためのテスト時検証器としてのロボット報酬モデルVLA2025/10/1
VLAモデルの推論時にロボット過程報酬モデルを検証器として使い、候補行動を生成・評価・選択することで、追加学習なしに性能を向上させるフレームワークを提案。
- 知覚と計画の橋渡し:Signal Temporal Logicタスクのためのエンドツーエンド計画タスク・モーションプランニング2025/9/1
多視点カメラ画像とSTL仕様から直接軌道を生成する微分可能な計画フレームワークS-MSPを提案し、工場物流シミュレーションで有効性を示した。
- 火星走行性予測:マルチモーダル自己教師あり学習によるコストマップ生成走行性予測2025/9/1
カメラとLiDARを融合し、IMU由来のラベルで自己教師あり学習する惑星探査ローバー向けの走行性コストマップ予測フレームワークを提案。
- 見て行動することを学ぶ:ロボットマニピュレーションのためのタスク認識型仮想視点探索VLA2025/8/1
再構成したシーンからタスクに適した仮想カメラ視点を選んで観測を再描画し、タスク特化型のMixture-of-Experts視覚エンコーダと組み合わせることで、遮蔽や視覚的分布シフトに頑健な多タスクロボット操作を実現した。
- AR-VRM: 類推推論による視覚ロボット操作のための人間動作模倣VLA2025/8/1
人間の動作動画から手のキーポイントを予測するVLMを事前学習し、ロボット微調整時に人間とロボットの対応関係を類推推論で学習することで、視覚ロボット操作の性能を向上させた研究。
- Long-VLA:ロボットマニピュレーションのための長期的タスクに挑む視覚言語行動モデルVLA2025/8/1
長期的なロボット操作タスクに特化した初のエンドツーエンドVLAモデルを提案し、フェーズ認識入力マスキングでサブタスクの連携を改善、新ベンチマークL-CALVINで評価した。
- 振動を考慮したLiDAR慣性オドメトリ:点ごとの歪み補正後不確かさに基づく手法LiDARオドメトリ2025/7/1
高速移動ロボットの激しい振動によるLiDARスキャンの歪みを、点ごとの歪み補正後不確かさを導入してモデル化し、その不確かさを活用した点群マッチングとカルマンフィルタで高精度なオドメトリを実現した。
- ULC: ヒューマノイドの移動操作のための統合された細粒度コントローラ移動操作2025/7/1
ヒューマノイドの移動と上半身操作を単一のポリシーで統合制御するULCを提案し、Unitree G1で有効性を実証した。
- GFM-Planner: 幾何特徴メトリックを用いた知覚考慮型軌道計画軌道計画2025/7/1
LiDAR自己位置推定の精度を高めるため、環境の幾何特徴量を指標化し、特徴が豊富な領域を通る軌道をロボットが選択する計画手法を提案した。
- AutoLayout: 低速・高速協調推論による閉ループレイアウト合成シーン生成/レイアウト合成2025/7/1
低速な推論と高速な生成を組み合わせた二重システムと自己検証ループにより、物理的に整合し意味的にも妥当な物体配置レイアウトを自動生成する手法を提案。
- 高周波残差ポリシーとプルバックチューブ加速による正確な全身投擲の学習マニピュレーション2025/6/1
脚式移動マニピュレータによる全身投擲を、名目追従ポリシー・高周波残差ポリシー・最適化ベースの加速制御を組み合わせて実現し、6m先の目標に平均0.28mの誤差で投擲できることを示した。
- 適応的カリキュラムと反事実グループアドバンテージによるMARLの環境メタ定常性の克服マルチエージェント強化学習2025/6/1
対戦相手の強さを勝率に応じて自動調整するカリキュラム学習と、各エージェントの貢献を分離する反事実ベースのアドバンテージ推定を組み合わせ、StarCraft協調タスクで既存手法を上回る性能を達成した研究。
- DCIRNet: 透明・反射物体の巧みな把持のための反復改良による深度補完マニピュレーション2025/6/1
RGB画像と不完全な深度マップを融合し、多段階の監督と深度改良で透明・反射物体の深度補完精度を高め、巧みな把持の成功率を44%向上させた。
- OpenHelix: ロボットマニピュレーションのためのデュアルシステムVLAモデルの短いサーベイ、実証分析、オープンソース化VLA2025/5/1
既存のデュアルシステムVLAアーキテクチャを整理・比較し、設計要素を実証評価した上で、低コストなオープンソースモデルを提供するプロジェクト。
- ノイズ耐性通信と注意機構を備えたMARLによる堅牢なマルチUAV協調群制御2025/3/1
COMAをベースに注意機構付き通信プロトコルを組み込み、ノイズ環境下でも複数UAVの経路計画を堅牢かつ効率的に行うマルチエージェント強化学習フレームワークを提案した。
- 不整地を歩く知覚型ヒューマノイドロコモーションの学習歩行2025/3/1
教師-生徒蒸留と変分情報ボトルネックによる世界モデルを組み合わせ、ノイズの多い地形知覚でも頑健に歩行できるヒューマノイド制御器を学習した。実環境で2kmの不整地を自律走行できることを示した。
- 世界モデル再構成によるヒューマノイド歩行の学習歩行2025/2/1
センサ情報から世界状態を明示的に再構成する推定器を歩行ポリシーと切り離して学習させ、不整地・滑りやすい地形でのブラインドヒューマノイド歩行を実現した研究。
- InfiniteWorld: 汎用視覚言語ロボットインタラクションのための統合スケーラブルシミュレーションフレームワークsim2real2024/12/1
Nvidia Isaac Sim上に構築された、汎用視覚言語ロボットインタラクション向けの統合スケーラブルなシミュレータを提案し、3Dアセット構築やReal2Sim、自動注釈などの機能と4つの新しいベンチマークを提供する。
- ニューラルネットワークによる報酬予測をヒューリスティックに用いた移動ロボット経路計画のためのQ学習高速化経路計画2024/12/1
ニューラルネットワークの出力をヒューリスティックとして活用し、Q学習の収束を最大90%高速化する経路計画手法NDR-QLを提案した。
- Depth-PC: クロスモーダル融合を統合したSim2Real転移のためのビジュアルサーボフレームワークsim2real2024/11/1
深度と点群のクロスモーダル特徴融合とグラフニューラルネットワークを組み合わせ、シミュレーション学習から実機へのゼロショット転移を実現したビジュアルサーボ手法を提案。
- サイバー空間と物理世界の融合:Embodied AIに関する包括的サーベイEmbodied AI2024/7/1
Embodied AIの最新動向を、ロボット・シミュレータ、知覚・相互作用・エージェント・sim-to-realの4研究領域、マルチモーダル大規模モデルの活用まで網羅的に整理したサーベイ論文。
- SuperVINS: 厳しい撮像条件に挑むリアルタイム視覚慣性SLAMフレームワークSLAM2024/7/1
VINS-Fusionをベースに、深層学習による特徴抽出(SuperPoint)と特徴マッチング(LightGlue)を統合し、低照度やモーションブラー下でも高精度・高ロバストなリアルタイム視覚慣性SLAMを実現した。
- 人間中心の屋内 embodied 配送ベンチマークembodied AI/配送2024/6/1
極地研究基地を模した多層建物内で、人間キャラクターと把持・移動可能なロボットによる配送タスクを再現する仮想環境と、13kの言語指示を含むデータセットを構築し、大規模マルチモーダルモデルを基盤としたベースライン手法を提案した。
- MAS-SAM: 集約特徴による海洋動物セグメンテーションセグメンテーション2024/4/1
水中環境向けのアダプタを組み込んだSAMエンコーダとピラミッド型デコーダを構築し、海洋動物のセグメンテーション精度を向上させた研究。
- NEDS-SLAM: 3Dガウシアンスプラッティングを用いたニューラル明示的密セマンティックSLAMフレームワークセマンティックSLAM2024/3/1
3Dガウシアン表現に基づく密セマンティックSLAMシステムを提案し、空間的に一貫した特徴融合と軽量エンコーダ・デコーダ、仮想カメラビュープルーニングにより、リアルタイムで高品質な3Dセマンティックマッピングとカメラトラッキングを実現した。
- ロボットが家庭へ:家電市場におけるAIロボットの台頭ヒューマノイド2024/3/1
NVIDIAのGR00TやTeslaのOptimus Gen 2を例に、産業用から家庭用へと広がるAIロボットの動向と、家庭環境への統合が難しい理由を概説した記事。
- GarchingSim: An Autonomous Driving Simulator with Photorealistic Scenes and Minimalist Workflow2024/1/1
- R$\times$R: Rapid eXploration for Reinforcement Learning via Sampling-based Reset Distributions and Imitation Pre-training2024/1/1
- Mobile-Seed: Joint Semantic Segmentation and Boundary Detection for Mobile Robots2023/11/1
- Alexa, play with robot: Introducing the First Alexa Prize SimBot Challenge on Embodied AI2023/8/1
- NNPP: A Learning-Based Heuristic Model for Accelerating Optimal Path Planning on Uneven Terrain2023/8/1
- Sampling-based Exploration for Reinforcement Learning of Dexterous Manipulation2023/3/1
- A reproducible approach to merging behavior analysis based on High Definition Map2023/3/1
- FLYOVER: A Model-Driven Method to Generate Diverse Highway Interchanges for Autonomous Vehicle Testing2023/1/1
- The Design and Realization of Multi-agent Obstacle Avoidance based on Reinforcement Learning2022/10/1
- OA-Bug: An Olfactory-Auditory Augmented Bug Algorithm for Swarm Robots in a Denied Environment2022/9/1
- Research on Stable Obstacle Avoidance Control Strategy for Tracked Intelligent Transportation Vehicles in Non-structural Environment Based on Deep Learning2022/8/1
- A Solution to Adaptive Mobile Manipulator Throwing2022/7/1
- Design and experimental investigation of a vibro-impact self-propelled capsule robot with orientation control2022/2/1
- A Survey on Scenario-Based Testing for Automated Driving Systems in High-Fidelity Simulation2021/12/1
- The Unified Mathematical Framework for IMU Preintegration in Inertial-Aided Navigation System2021/11/1
- VISITRON: Visual Semantics-Aligned Interactively Trained Object-Navigator2021/5/1
- The Role of the Hercules Autonomous Vehicle During the COVID-19 Pandemic: An Autonomous Logistic Vehicle for Contactless Goods Transportation2020/4/1
- Predicting Unobserved Space For Planning via Depth Map Augmentation2019/11/1
- Federated Transfer Reinforcement Learning for Autonomous Driving2019/10/1
- DF-SLAM: A Deep-Learning Enhanced Visual SLAM System based on Deep Local Features2019/1/1
- Characterization of a RS-LiDAR for 3D Perception2017/9/1
- A Control Performance Index for Multicopters Under Off-nominal Conditions2017/5/1
- Motion Imitation Based on Sparsely Sampled Correspondence2016/7/1