Yi Yang
収録論文 63本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RAVEL: フローベースVLAモデルのための非同期ローリング推論VLA2026/9/28
フローベースVLAのVLMエンコードと多段拡散による遅延を、非同期ローリングバッファと軽量観測経路で削減し、低遅延な閉ループ制御を実現した。
- VDGS: 可視性駆動による大規模空中シーン再構成のための3Dガウシアンスプラッティング3D再構成/sim2real2026/9/19
カメラ分布を考慮した可視性統計を導入し、シーンの分割と勾配補償を行うことで、視点が偏った大規模空中シーンの3DGS再構成を効率化・高品質化した手法。
- TAPVid-MV: 複数視点にわたる3次元任意点追跡のベンチマークトラッキング2026/9/1
複数カメラ映像における長期的な3次元点追跡のための最初のベンチマークを構築し、既存手法の性能を評価した。
- Chat-Edit-3D++: 大規模言語モデルによる対話型3D・4Dシーン編集3D編集2026/8/29
大規模言語モデルを中心に対話で3D/4Dシーンを編集する手法を提案。2Dアトラス画像への変換で編集と再構成を分離し、多様な視覚ツールを自動的に呼び出す。
- EAGLE-360: 360度環境における身体化された能動的全域から局所への探索探索2026/7/2
360度パノラマ環境での能動的視覚探索を改善するため、グローバルな事前情報を活用して探索空間を段階的に絞り込むフレームワークを提案し、大規模データセットと位置エンコーディングの改良により性能を向上させた。
- UAV支援ISACシステムにおけるCRB駆動のビームフォーミングと軌道最適化通信・センシング統合2026/7/1
UAVが基地局のセンシング能力を強化するISACシステムにおいて、センシング性能を表すCRBを最小化するよう、UAVの軌道とビームフォーミングを深層強化学習とヌル空間投影を用いて共同最適化した。
- 単一の人間ビデオから数秒でロボットが操作スキルを獲得操作スキル獲得2026/7/1
ロボットが1本の人間のデモ動画から、数秒で新しい操作スキルを獲得しつつ、既存スキルを保持できるフレームワークHOSTを提案した。
- 世界・言語・行動モデル:統一的世界モデリング、言語推論、行動合成VLA2026/6/4
テキスト指示、画像、ロボット状態から、テキストのサブタスク、サブゴール画像、ロボット行動を同時予測する新しい基盤モデルWLAを提案。ARトランスフォーマーを用いて世界予測と言語推論を統合し、推論時には世界予測を無効化できる。
- DeformX: 変形可能な線状物体のための多用途共シミュレーションフレームワークシミュレーション2026/6/1
ワイヤやケーブルなどの変形可能な線状物体(DLO)を、物理的に正確かつ視覚的にリアルにシミュレートするための共シミュレーションフレームワークを提案する。Cosseratロッド物理エンジンとNVIDIA Isaac Simを統合し、ロボット学習パイプラインとの互換性を実現している。
- 信頼性の高い自律システムの構築:課題と解決策自律システム2026/6/1
自律システムの信頼性を高めるための課題と解決策をまとめたワークショップ報告書であり、検証・実世界応用・安全なソフトウェアアーキテクチャの3分野に焦点を当て、今後の研究と産業協力のロードマップを提示している。
- TORL-VLA: 触覚誘導による接触を伴う操作のためのオンライン強化学習操作/強化学習2026/6/1
触覚フィードバックを利用して、接触を伴う操作タスクでオフラインポリシーをオンライン適応させる強化学習フレームワークを提案。実機実験で成功率と効率を向上。
- ロボットアームを用いたイチゴの位置特定と非破壊糖度測定のための分光センシング農業ロボティクス2026/6/1
ロボットアームに分光センサを搭載し、イチゴの検出・位置特定・接近・非破壊糖度推定を閉ループで行うシステムを構築した。実験では88.10%の成功率を達成し、ハンドアイキャリブレーションの比較も行った。
- ロボティクスにおける視覚言語行動モデルに対する部分観測敵対的パッチ攻撃VLA/敵対的攻撃2026/6/1
視覚言語行動(VLA)モデルに対する敵対的パッチ攻撃を、全軌跡ではなく短いプレフィックスのみを利用する部分観測設定で行う手法を提案。注意マップで重要領域を特定し、パッチを最適化して知覚と制御の両方を妨害する。
- 次世代医療に向けて:知覚・意思決定・行動のための医療具現化AIのサーベイ具現化AI/医療2026/6/1
医療分野における具現化AI(身体を持つAI)の研究を、知覚・意思決定・行動の統合システムとして体系的に整理したサーベイ論文。応用事例やデータセット、実臨床での課題と今後の研究方向をまとめている。
- CubifyGS: 生涯動的シーン維持のためのオブジェクト中心3Dガウススプラッティング3DGS/動的シーン/マッピング2026/6/1
ロボットの長期的なシーン更新において、動く物体を再利用可能なガウス資産として管理し、再構築ではなく資産の取得・剛体変換・明示的刈り込みで地図を更新する手法を提案。編集後の領域に限定した適応的最適化でゴーストや不整合を抑える。
- CM-EVS: 完全なシーンカバレッジのためのスパースなパノラマRGB-D-ポーズデータデータセット2026/5/1
3Dアセットを、冗長性が低く完全なシーンカバレッジを持つスパースなパノラマRGB-D-ポーズデータに変換する手法COVERを提案し、大規模データセットCM-EVSを構築した。
- PaMoSplat: 部品認識と動作ガイドによる動的シーン再構成のためのガウススプラッティング動的シーン再構成2026/5/1
動的シーン再構成のための新しいガウススプラッティングフレームワークを提案し、部品認識とオプティカルフローによる動作推定を統合して、高品質なレンダリングと正確なトラッキングを実現した。
- 一歩ずつ報酬を与えよう:連続環境における視覚言語ナビゲーションのためのステップ認識型対照アライメントVLA2026/3/1
連続環境での視覚言語ナビゲーションにおいて、失敗軌跡から有効な接頭辞と逸脱点を特定するステップ単位の監査と、状況に応じたグループ構築により、密な報酬信号を抽出して学習を安定化させるSACAを提案し、最先端性能を達成した。
- DM0: フィジカルAIに向けた身体性ネイティブな視覚-言語-行動モデルVLA2026/2/1
身体性を後付けでなく最初から統合し、大規模事前学習からフローマッチング行動専門家と空間Chain-of-Thoughtで操作とナビゲーションを統一的に学習するVLAフレームワークDM0を提案。
- 一度見れば実行できる:ワンショット動画デモからタスクを学習する視覚-言語-行動モデルVLA2025/12/1
テスト時に1本の専門家デモ動画を見るだけで新しい操作スキルを獲得できるVLAモデルViVLAを提案し、未見タスクで30%以上の性能向上を達成した。
- 腱駆動伝達と分散アクチュエーションを備えた15自由度バイオニックハンドの開発マニピュレーション2025/12/1
人間の手の構造を模倣し、前腕に5個・手のひらに10個のモータを分散配置した腱駆動式の15自由度ロボットハンドを開発した。軽量1.4kgで高い把持力と繊細な操作を両立した。
- UniBYD: 人間の模倣を超えた多様なロボットハンドの操作学習のための統合フレームワークマニピュレーション2025/12/1
ロボットと人間の身体差を超え、多様なロボットハンド形態に適応する操作方策を強化学習で獲得する統合フレームワークUniBYDを提案。動的PPOと影エンジンにより人間模倣を超えた適応的探索を実現。
- GPT-4にヒューマノイドの身体を与える:既製VLMと物理世界を繋ぐ架け橋の構築VLA2025/11/1
既製の視覚言語モデル(GPT-4など)をヒューマノイドエージェントの制御に活用する手法BiBoを提案。指示を低レベルコマンドに変換するコンパイラと拡散モデルによる動作実行器で、オープン環境での相互作用タスク成功率90.2%を達成。
- ManiAgent:汎用ロボットマニピュレーションのためのエージェント型フレームワークマニピュレーション2025/10/1
複数のエージェントが協調して環境認識・サブタスク分解・行動生成を行い、複雑なマニピュレーションを効率的にこなすエージェント型アーキテクチャを提案した論文。
- 限られた通信下での未知の構造的制約環境における分散型マルチロボット相対ナビゲーション群制御2025/10/1
統一座標系なしで、軽量なトポロジカルマップを交換する戦略層と局所的なサンプリングベースの脱出点戦略を組み合わせ、通信制限下でもデッドロックを避けて効率的にナビゲートする完全分散型フレームワークを提案した。
- OmniMap: 光学・幾何・意味を統合する汎用マッピングフレームワーク3Dマッピング2025/9/1
光学・幾何・意味の3属性をリアルタイムで同時に捉えるオンラインマッピングフレームワークOmniMapを提案し、3DGSとボクセルのハイブリッド表現で高精度なレンダリング・形状復元・ゼロショット意味セグメンテーションを実現した。
- GLUE: キーパッチ追跡による模倣学習のためのグローバル・ローカル統合エンコーディング模倣学習2025/9/1
テキスト誘導でタスク関連のキーパッチを追跡し、グローバル特徴とローカル特徴を融合することで、遮蔽や混雑に強い模倣学習ポリシーを実現した。
- SSR-ZSON: 階層的探索フレームワーク内の空間-意味関係によるゼロショット物体ナビゲーションナビゲーション2025/9/1
未知環境でのゼロショット物体ナビゲーションにおいて、意味的密度と空間被覆のバランスを取る視点生成とLLMによる全体誘導を組み合わせ、効率的な探索を実現する手法を提案した。
- Text-Scene: 3Dシーン理解のためのシーン・トゥ・言語解析フレームワーク3Dシーン理解2025/9/1
3Dシーンを物体属性や空間関係を含むテキスト記述へ自動変換するフレームワークを提案し、3Dタスク計画のベンチマークInPlan3Dも構築した。
- OpenMulti: オープンボキャブラリなインスタンスレベル分散型マルチエージェント暗黙的マッピングマルチエージェントマッピング2025/9/1
複数ロボットが協調して、オープンボキャブラリでインスタンスレベルの意味理解を伴う暗黙的マップを分散構築するフレームワークを提案。
- CVPR2024 E2Eチャレンジ準優勝ソリューション:視覚言語モデルを用いたエンドツーエンド自動運転自動運転/VLM2025/9/1
単一カメラと視覚言語モデル(VLM)を組み合わせたエンドツーエンド自動運転手法を提案し、CVPR2024のE2Eチャレンジでカメラのみの手法として最高性能を達成した。
- FMimic: 基盤モデルによる人間動画からの細粒度行動学習模倣学習2025/7/1
少数の人間動画から基盤モデルを用いてロボットの細かい行動スキルを直接学習する手法を提案し、RLBenchや実世界タスクで大幅な性能向上を達成した。
- 構造・意味推論に基づくマルチレベルマップとマルチモーダル意思決定LLMによる物体ナビゲーション物体ナビゲーション2025/6/1
未知環境でのゼロショット物体ナビゲーションのため、環境属性マップ(EAM)とMLLM階層推論(MHR)を組み合わせたフレームワークを提案し、長距離探索の効率と成功率を改善した。
- MCOO-SLAM: マルチカメラ全方位物体SLAMシステムSLAM2025/6/1
複数の全方位カメラを活用し、オープンボキャブラリな意味情報を統合した物体レベルのSLAMシステムを提案。大規模屋外環境でのロバストな物体マッピングと階層的3Dシーングラフ構築を実現した。
- STEPプランナー: embodied長期的タスクプランナーとしての階層横断サブゴール木構築タスクプランニング2025/6/1
LLMによるサブゴール分解と終了判定を組み合わせ、粗から細への階層的木を構築することで、ロボットの長期的タスク計画の成功率を向上させるフレームワークを提案。
- LoHoVLA:長期的な身体タスクのための統合視覚言語行動モデルVLA2025/6/1
大規模視覚言語モデルを基盤に、言語と行動トークンを統合生成し、階層的閉ループ制御で長期的身体タスクを遂行するVLAフレームワークを提案。
- HiMo: 点群における高速物体の動き補償点群処理2025/3/1
LiDAR点群中の動的物体による歪みを補正するため、シーンフロー推定を非自己運動補償に転用したパイプラインHiMoと、そのためのリアルタイムシーンフロー推定器SeFlow++を提案し、新しい評価指標で有効性を示した。
- ロボット運動制御における時変二次計画法のための厳密な事前定義時間収束・耐雑音分数階ゼロ化ニューラルネットワーク運動制御/ニューラルネットワーク2025/3/1
ロボットの運動制御で生じる時変二次計画問題を解くため、雑音に強く、あらかじめ定めた時間で厳密に収束する分数階ゼロ化ニューラルネットワークを提案し、シミュレーションと実機で有効性を示した。
- 航空データを用いた自動運転車の精密学習ベース自己位置推定におけるグローバルな地理的アライメントの評価自己位置推定2025/3/1
航空データと自動運転車のセンサデータ間のアライメントを改善することが学習ベース自己位置推定の性能に重要であることを示し、ファクターグラフを用いた2つのデータアライメント手法を比較評価した。1600kmのデータセットで0.3m未満、0.5度未満の誤差を達成した。
- OpenVox: リアルタイムなインスタンスレベルのオープンボキャブラリ確率的ボクセル表現オープンボキャブラリマッピング2025/2/1
VLMを活用し、インスタンス単位でオープンボキャブラリな意味理解とロバストな逐次再構成をリアルタイムで行う確率的ボクセル表現を提案した論文。
- MCRL4OR: オフロード環境知覚のためのマルチモーダル対照表現学習環境知覚2025/1/1
オフロード走行データにおいて、視覚画像・移動状態・制御行動を対照学習で統合し、下流の環境知覚タスクに有効なマルチモーダル表現を事前学習する手法を提案。
- 自動運転のための世界モデルに関するサーベイ自動運転2025/1/1
自動運転における世界モデルの研究を、将来の物理世界の生成・エージェントの行動計画・予測と計画の相互作用の3層に分類して体系的にレビューした論文。
- トラクタ・トレーラ型車輪ロボットにおける統合動画安定化とスティッチングのための統一点運動推定動画安定化・スティッチング2024/12/1
トラクタ・トレーラ型ロボットの振動や姿勢変化、視差に対応するため、統一点運動推定法を提案し、動画安定化とスティッチングを統合した。実機で検証した。
- ロボット運動計画のための事前定義時間収束・耐雑音ゼロ化ニューラルネットワークモデル運動計画2024/12/1
時間変動二次計画問題を解くために、事前定義時間で収束し雑音に強い分数階ゼロ化ニューラルネットワークを提案し、ロボットアームの運動計画で有効性を示した。
- 自動運転における動画生成と世界モデルの相互作用の探求:サーベイ自動運転/世界モデル2024/11/1
自動運転における世界モデルと動画生成技術の関係を調査し、拡散モデルを中心とした構造的類似性や評価指標、課題と今後の研究方向を整理したサーベイ論文。
- LCP-Fusion: 局所制約と計算可能な事前情報を強化したニューラル暗黙SLAMSLAM2024/11/1
スパースボクセルオクツリーとSDF事前情報を組み合わせたハイブリッド表現により、局所制約を強化しつつ未知のシーン境界でも高精度なマッピングとトラッキングを実現するニューラル暗黙SLAMを提案。
- VLMimic: 視覚言語モデルによる細粒度動作の視覚的模倣学習模倣学習2024/10/1
少数の人間動画から、視覚言語モデルを用いて細かい動作レベルまで直接学習し、ロボットの模倣学習を効率化する手法を提案。
- SeFlow: 自動運転のための自己教師ありシーンフロー手法シーンフロー2024/7/1
LiDARスキャン間の点ごとの3D動きを推定するシーンフローを、動的・静的の分類と物体レベルの制約を取り入れて自己教師ありで学習する手法を提案し、Argoverse 2とWaymoで最高性能を達成した。
- OpenObj: 細粒度理解を備えたオープン語彙オブジェクトレベルNeRF3D再構成/NeRF2024/6/1
視覚言語モデルを活用し、オブジェクト内部の細部まで理解できるオープン語彙のオブジェクトレベルNeRFを構築する手法を提案。ゼロショットセマンティックセグメンテーションやロボット操作タスクで優れた性能を示す。
- 点群位置合わせのためのポイントツリートランスフォーマー点群位置合わせ2024/6/1
点群の階層的な特徴木を構築し、木構造に沿って注意領域を重要な点へと段階的に絞り込む新しい注意機構により、線形計算量で局所・大域特徴を効率的に抽出する点群位置合わせ手法を提案した。
- ニューラル相互作用エネルギーによるマルチエージェント軌道予測軌道予測2024/4/1
エージェント間の相互作用をニューラル相互作用エネルギーとしてモデル化し、時間的安定性を高める2つの制約を導入することで、マルチエージェント軌道予測の精度と汎化性能を向上させた研究。
- LGSDF: 局所更新に支援された符号付距離場の継続的グローバル学習マッピング2024/4/1
局所的な軸並行グリッド更新とニューラルネットワークによる継続的自己教師学習を組み合わせ、従来より高精度なESDFマップを構築する手法を提案。
- 精密配置タスクのための深層SE(3)同変幾何推論マニピュレーション2024/4/1
物体を正確に配置するタスクに対し、SE(3)同変性を持つ幾何推論層を導入し、少ないデモから高精度な相対姿勢予測を実現する手法を提案。
- OpenGraph: 大規模屋外環境におけるオープン語彙階層型3Dグラフ表現3Dシーン理解2024/3/1
視覚言語モデルを用いて画像から物体とその説明を抽出し、LiDAR点群に投影して3Dマップを構築、レーングラフで階層化することで、大規模屋外環境でのオープン語彙なシーン理解を実現した。
- DeFlow: Decoder of Scene Flow Network in Autonomous Driving2024/1/1
- Human-Centric Autonomous Systems With LLMs for User Command Reasoning2023/11/1
- RMP: A Random Mask Pretrain Framework for Motion Prediction2023/9/1
- AIoT-Based Drum Transcription Robot using Convolutional Neural Networks2023/8/1
- RoboTAP: Tracking Arbitrary Points for Few-Shot Visual Imitation2023/8/1
- Lana: A Language-Capable Navigator for Instruction Following and Generation2023/3/1
- Sector Patch Embedding: An Embedding Module Conforming to The Distortion Pattern of Fisheye Image2023/3/1
- Generating Safe Autonomous Decision-Making in ROS2022/9/1
- DS-SLAM: A Semantic Visual SLAM towards Dynamic Environments2018/9/1