Jianfei Yang
Nanyang Technological University
収録論文 58本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RawVLA: ロボットマニピュレーションのための身体性ニューラル画像信号処理プロセッサVLA2026/9/29
VLAモデルが通常使うRGB画像処理(ISP)を見直し、RAWデータから適応的に画像を生成するニューラルISPを提案。劣化した撮像条件下でもマニピュレーションの頑健性を大幅に向上させた。
- LIBERO-MAX:世界が変化したときロボット政策は適応するか?VLA2026/9/29
タスク実行中に環境変化が起きた際のロボット政策の頑健性を評価する8,000ペアのベンチマークLIBERO-MAXを提案し、14のVLA政策が11.0〜25.7ポイントの成功率低下を示すことを明らかにした。
- mmHRI: ミリ波レーダによるプライバシー保護型ヒューマンロボットインタラクションHRI2026/9/28
ミリ波レーダで人の動作と3D姿勢を推定し、それをテキスト指示に変換してVLAポリシーを制御する、プライバシー保護型のロボットマニピュレーション枠組みを提案した。
- F4R: 失敗駆動型の認識・再構築・洗練・再展開によるロボットの継続的自己改善マニピュレーション2026/9/28
ロボットの失敗を自動で診断し、シミュレーション環境で再構築して強化学習で改善する閉ループ学習フレームワークを提案。実世界での追加デモ収集なしに、4つのマニピュレーションタスクで高い成功率を達成した。
- 高速計画と忠実な行動:階層型視覚言語行動モデルにおける計画・実行ギャップの解消VLA2026/9/25
階層型VLAの計画器と実行器の不一致を分析し、ブロック自己回帰デコーディングと正規化ゴール変調で計画遅延を8.7倍削減しつつ計画の活用を改善した。
- MemBodied: 視覚-言語-行動モデルのための再帰的連想記憶VLA2026/9/23
VLAモデルに固定サイズのエピソード記憶を導入し、過去の観測を保持せずに履歴依存のマニピュレーションタスクを高成功率で実現した。
- RoboDreamer: 予測状態空間モデルによる先読み型ヒューマノイド歩行歩行2026/9/7
観測マスキングと蒸留を用いた2段階教師-学生フレームワークで、不完全なセンシング下でも安定したヒューマノイド歩行を実現する。
- 物理フィルタリングがロボット学習の汎化を促進するロボット学習/汎化2026/8/24
この論文は、物理フィルタリングによるフィードバック機構(PhyFilter)を提案し、限られた訓練データでもロボットが動的環境の不確実性に対して効果的に汎化できることを示した。
- 統一条件・行動モデリングによる高精度ワンステップ行動生成マニピュレーション2026/8/17
条件と行動を共有トークン空間で統一的にモデリングするUCA-Flowを提案し、推論速度を大幅に向上させつつ成功率を9.3ポイント改善した。
- GaussianDWM++: 言語基盤の3Dガウス駆動世界モデルによる統一的なシーン理解・編集・マルチモーダル生成世界モデル/3Dシーン理解2026/8/17
3Dガウス表現に視覚言語特徴を蒸留し、シーン理解・言語推論・4D編集・マルチモーダル生成を単一フレームワークで統合した駆動世界モデルを提案した。
- ω-0: 人間型ロボットの同時移動操作のための潜在予測世界行動モデルヒューマノイド2026/8/1
言語指示と視覚・状態入力から、移動と操作を同時に行う全身行動を直接予測する世界行動モデルを提案し、実機で11種類の家庭タスクを達成した。
- 物理的インタラクションの学習:触覚・力覚を考慮したロボット学習のサーベイ触覚・力覚学習2026/8/1
触覚・力覚センシングを統合したロボット学習手法を、マルチモーダルかつ多段階のシステム設計の観点から統一的な分類学TF-ARTを用いて整理し、今後の研究課題を考察したサーベイ論文。
- RynnValue: 時間的距離によるロボット価値基盤モデルのスケーリング価値基盤モデル2026/8/1
ロボット操作のための価値基盤モデルRynnValueを提案。時間的距離を報酬ラベルとして用いることで、大規模データから好みラベルなしで学習し、実世界の成功率を向上させた。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- RynnBrain 1.1:より高機能で汎用的な具現化基盤モデルを目指してVLA/基盤モデル2026/7/1
RynnBrain 1.1は、2Bから122B-A10Bまでの規模を持つ具現化基盤モデル群で、接触点予測や3Dグラウンディングを導入し、ロボット操作に直接対応する表現と出力を実現。実機実験では、Qwenベースや汎用VLAを上回る性能を示した。
- FORGE: キーポイント軌道推論による機能的一般化を目指したツール使用マニピュレーション2026/7/1
ロボットが特定の道具にしか使えない問題を解決するため、道具の機能に基づく一般化を実現する手法を提案。キーポイント軌道を中間表現として用い、機能推論と動作実行を分離する2段階ポリシーを開発し、未見の道具での成功率を2倍以上向上させた。
- AXIS:拡張可能なロボット操作のためのコミュニティ駆動型データエンジンデータエンジン/操作学習2026/7/1
ブラウザベースの遠隔操作で大規模なデモ収集を可能にし、タスクの自動生成・検証とデータ品質向上を組み合わせた、拡張可能なロボット操作学習用データエンジンとベンチマークを提案。
- 統一空間意味プロンプトによる身体化視覚追跡と潜在ダイナミクス学習視覚追跡2026/6/24
身体化視覚追跡において、言語のみのターゲット指示では曖昧さが生じる問題を解決するため、空間的・意味的プロンプトを統合したフレームワークUSSを提案し、実ロボット実験で有効性を示した。
- GIVE: 視覚言語行動モデルにおける人間のジェスチャーの接地VLA/ジェスチャー理解2026/6/1
人間のジェスチャーを視覚・意味の2経路でVLAモデルに統合し、曖昧な指示でも物体接地と操作意図の推定を改善する手法を提案。実世界実験で成功率を大幅に向上させた。
- ActiveVital: ホームヘルスケアロボットのための幾何学を考慮した身体装着型バイタルサイン計測ヘルスケアロボティクス2026/6/1
家庭用ロボットが非接触で呼吸数と心拍数を正確に計測できるよう、ミリ波レーダーの観測角度を視覚情報で能動的に調整するフレームワークを提案した。
- EM-Fall: ヒューマノイドロボットによる昼夜を問わない転倒検知のための身体化ミリ波センシング転倒検知2026/6/1
移動型ヒューマノイドロボットにミリ波センシングを統合し、視点を能動的に調整して遮蔽や照明条件に影響されずに転倒を検知するフレームワークを提案した。
- ADAPT: 解析的擾乱認識型ポリシートレーニングによる人型ロコモーション歩行2026/6/1
外力による擾乱を物理モデルに基づく観測器で推定し、その情報をポリシーに直接入力することで、人型ロボットの外乱に対する頑健性と速度追従精度を向上させるフレームワークを提案した。
- AerialClaw: LLM駆動の自律型空中エージェントのためのオープンソースフレームワークドローン/LLMエージェント2026/6/1
自然言語のミッションを理解し、実行可能な空中スキルを呼び出し、フィードバックを閉ループで反映するLLMベースの自律UAVエージェントを実現するオープンソースフレームワークを提案する。
- 視覚運動ポリシー学習における暗黙的空間表現の再考模倣学習2026/6/1
空間ソフトマックスプーリングがロボット操作の視覚表現として有効であることを示し、その限界を克服する新しいエンコーダPRISMを提案した論文。
- APEX: 精密操作のための適応的ポリシー実行マニピュレーション2026/6/1
ポリシーと低レベル制御器の間に挿入するプラグアンドプレイ型フレームワークを提案し、実行ギャップを埋めて操作成功率を向上させた。
- Gaze2Act: 視線条件付き視覚言語行動ポリシーによる対話的ロボット操作VLA2026/5/1
人間の視線を意図信号として活用し、ロボット操作の精度を高める新しいVLAフレームワークを提案した論文。
- ロボット学習のためのワールドモデル:包括的サーベイサーベイ2026/5/1
ロボット学習におけるワールドモデルの役割と進化を体系的にレビューし、ポリシー学習、シミュレーション、評価への応用や課題を整理したサーベイ論文。
- FLASH: スパースサンプリングによる効率的な視覚運動ポリシーVLA2026/5/1
拡散モデルやフローマッチングの反復処理による遅延を解消するため、ルジャンドル多項式で軌道を表現し、履歴係数から生成を開始することで単一推論で長い行動範囲を実現する高速な視覚運動ポリシーを提案した。
- フィードバックワールドモデルによる拡散ポリシーの精密なガイダンスロボット操作2026/5/1
実行時の観測を利用して予測誤差をオンライン補正するフィードバックワールドモデルを提案し、分布シフト下での予測精度とポリシー性能を向上させた。
- MARSポリシー:必要な時だけマルチモーダルに模倣学習2026/5/1
ロボット操作の模倣学習において、タスクの全フェーズで多様性が必要とは限らないことに着目し、必要な時だけ確率的生成を適応的に行い、単一モードのフェーズでは決定的学習に切り替えるMARSポリシーを提案した。シミュレーションと実機で成功率向上と推論遅延削減を実証した。
- CompassAD: 機能が競合する物体における意図駆動型3Dアフォーダンス接地3Dアフォーダンス接地2026/4/1
複数の物体が同じ機能を持つ場合に、自然言語の意図に基づいて正しい物体の3Dアフォーダンス領域を特定する新しいタスクを提案し、ベンチマークと手法を構築した。
- OmniVLN: 空中・地上プラットフォームを横断する視覚言語ナビゲーションのための全方位3D知覚とトークン効率的LLM推論ナビゲーション2026/3/1
全方位3D知覚と階層的推論を組み合わせたゼロショット視覚言語ナビゲーションフレームワークを提案し、空中・地上ロボットの両方で動作する。
- RoboForge: 物理最適化されたテキスト誘導型ヒューマノイド全身歩行歩行2026/3/1
テキストから生成した人間らしい動作をヒューマノイドロボットで物理的に実行可能にするため、物理的妥当性を最適化する双方向結合フレームワークを提案した。
- カメレオン:視覚運動操作のための制御インデックス型予測記憶マニピュレーション2026/3/1
観察と行動の間に時間差があるタスクで、過去の観察を記憶し将来の行動に活用するための視覚運動ポリシー「Chameleon」を提案し、実ロボットベンチマークで高い成功率を達成した。
- AAAI 2026 RoCoチャレンジ:産業オートメーションに向けたロボット協調組立操作のベンチマーク協調操作/組立/ベンチマーク2026/3/1
産業用ロボットの協調組立操作を評価するため、惑星歯車組立タスクを用いたシミュレーションと実世界のチャレンジを開催し、データセットと評価システムを提供した。
- Action-to-Actionフローマッチング:固有感覚履歴を起点とした高速ロボット方策VLA2026/2/1
ランダムノイズではなく過去の固有感覚行動を起点にフローマッチングで行動生成する方策を提案し、1ステップ推論と高い汎化性能を実現した。
- 実行履歴に着目した拡散ポリシーによる長期的ロボット操作における多峰性行動の曖昧性解消マニピュレーション2026/2/1
ロボットの実行履歴を視覚空間に投影して拡散ポリシーの条件に加えることで、長期タスクで観測が似ていても行動が異なる曖昧さを解消し、背景の乱れにも頑健にした手法を提案。
- RynnBrain: オープンな身体性基盤モデルVLA2026/2/1
知覚・推論・計画を統合した時空間基盤モデルRynnBrainを提案し、2B/8B/30B-A3B MoEの3規模と下流タスク向け4変種を公開、20の身体性ベンチマークで既存モデルを大幅に上回った。
- RF-MatID: 無線周波数による材料識別のためのデータセットとベンチマークRFセンシング2026/1/1
4〜43.5GHzの広帯域RFデータ14.2万サンプルを収集し、深層学習モデルによる材料識別のベンチマークを構築した研究。
- WaveMan: ヒューマノイドロボットのためのミリ波による部屋規模の人間インタラクション知覚ヒューマンロボットインタラクション2026/1/1
ミリ波センシングを用いて、ユーザーの位置に依存せずプライバシーを守りながら部屋規模で人間のインタラクションを認識するシステムを提案し、未学習の位置でも高精度を実現した。
- ロボットはいつ「わからない」と言うべきか:身体性質問応答における棄権のベンチマークVLA2025/12/1
身体性質問応答(EQA)において、エージェントが答えを保留すべき状況を評価するベンチマークAbstainEQAを構築し、最先端モデルでも棄権の判断が難しいことを示した。
- M³Aポリシー:フォトメトリック再レンダリングによる可変材料操作拡張ポリシーマニピュレーション2025/12/1
単一の実演から光輸送に基づくフォトメトリック再レンダリングで多様な材料の実演を生成し、材料に依存しない操作ポリシーを学習する枠組みを提案。
- 人間の意図から行動予測へ:意図駆動型エンドツーエンド自動運転自動運転2025/12/1
自然言語による高レベルな人間の意図を解釈して運転行動を生成する「意図駆動型エンドツーエンド自動運転」を定義し、大規模データセットと生成的ワールドモデルによる新評価指標IFAを備えたベンチマークIntention-Driveを構築した。
- DIPOLE: 視覚と幾何を融合したロバストな視覚運動汎化VLA2025/11/1
視覚と言語・幾何の相補的なモダリティを訓練時のドロップアウトとクロスアテンションで融合し、照明や視点変化に強い拡散ポリシーを実現した。
- ロールモデル強化学習による精密ロボットマニピュレーションマニピュレーション2025/10/1
人間のデモンストレーションなしで、ロールモデル戦略によりオンライン学習データへ自動的にラベルを付与し、精密なロボット操作を実現する強化学習フレームワークを提案した。
- Mask2IV: マスク軌跡によるインタラクション中心の動画生成動画生成2025/10/1
人間やロボットが物体と相互作用する動画を、アクターと物体の軌跡を予測してから生成する2段階フレームワークで高品質に生成する手法。
- REI-Bench: 曖昧な人間指示を身体性エージェントは理解できるか?タスク計画2025/5/1
人間の曖昧な指示がLLMベースのロボットタスク計画に与える影響を評価する初のベンチマークを提案し、曖昧さが成功率を最大36.9%低下させることを示した。また、タスク指向の文脈認識により指示を明確化する手法を提案し、最先端性能を達成した。
- QLIO: 量子化LiDAR慣性オドメトリLiDAR-慣性オドメトリ2025/3/1
LiDAR慣性オドメトリをマルチプロセッサ分散構成で量子化し、残差データを圧縮して計算負荷と帯域を削減しつつ精度を維持するフレームワークを提案した。
- LiDAR疑似ラベルを用いた音響アレイによる3次元UAV軌道推定音響センシング2024/12/1
音響アレイのメルスペクトログラムからUAVの3次元軌道を推定する自己教師あり学習フレームワークを提案し、LiDAR点群による推定を疑似ラベルとして音響知覚ネットワークを訓練することで、展開時には音響信号のみで高精度な軌道推定を実現した。
- NoisyEQA: ノイズを含む質問に対する身体性質問応答のベンチマークVLA2024/12/1
実世界で発生する4種類のノイズを含む質問に対して、身体性質問応答エージェントのノイズ検出・訂正能力を評価するベンチマークNoisyEQAを提案し、自己訂正プロンプト機構と新評価指標を導入した。
- スパース点群を用いた教師なしUAV 3次元軌道推定UAV追跡2024/12/1
複数のLiDARスキャンを時空間的に融合し、教師なしで小型UAVの3次元軌道を高精度に推定する手法を提案。CVPR 2024 UG2+チャレンジで4位に入賞した。
- AV-PedAware: 自己教師あり音視覚融合による動的歩行者認識音視覚融合2024/11/1
低コストな音声と視覚の融合により、足音を手がかりに周囲の歩行者の3D位置を推定する自己教師あり学習システムを提案。LIDARラベルで学習し、照明変化や遮蔽に強い。
- AIR-Embodied: 具現化大規模言語モデルによる効率的な能動的3DGSインタラクション・再構成フレームワーク3D再構成2024/9/1
具現化AIエージェントとマルチモーダル大規模言語モデルを統合し、視点選択とインタラクションを閉ループ推論で計画することで、能動的な3Dガウシアンスプラッティング再構成の効率と品質を向上させるフレームワークを提案。
- ポーズのみの教師あり学習による顕著スパース視覚オドメトリ視覚オドメトリ2024/4/1
ポーズ情報のみを教師信号として使うハイブリッド視覚オドメトリを提案し、自己教師ありホモグラフィ事前学習とランダムパッチ顕著点検出により、密なオプティカルフロー教師なしでも高い汎化性能を実現した。
- 高密度ビジュアルSLAMのためのコンパクト3DガウシアンスプラッティングSLAM2024/3/1
3Dガウシアンを用いたSLAMのメモリと計算コストを削減するため、スライディングウィンドウによるマスキングと幾何コードブックでガウシアン楕円体を圧縮し、高精度な姿勢推定とリアルタイム描画を両立させた。
- MMAUD: 現代の小型ドローン脅威に対応する包括的マルチモーダル対UAVデータセット対UAV検出2024/2/1
小型UAVの検出・機種分類・軌道推定のため、ステレオ視・LiDAR・レーダー・音響アレイを統合し、Leicaによる高精度正解データを備えたマルチモーダルデータセットを構築した。
- MoPA: Multi-Modal Prior Aided Domain Adaptation for 3D Semantic Segmentation2023/9/1
- Multi-Modal Continual Test-Time Adaptation for 3D Semantic Segmentation2023/3/1