Yue Zhang
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Ego2Act: 一人称視点動画生成における目標指向マニピュレーションの評価動画生成/マニピュレーション2026/10/1
一人称視点の動画生成モデルが、高レベルの目標から多段階の物体操作をどれだけ現実的にシミュレートできるかを評価するベンチマークEgo2Actと、参照不要の評価器Ego2ActJudgeを提案した。
- Uranus: 身体性AIのための次世代シミュレーション基盤の構築sim2real2026/9/21
関節軌道条件付き自己回帰拡散モデルを用いたデータ駆動型ロボットシミュレータUranusを提案し、ストリーミング生成、低遅延、多様なロボット制御に対応した。
- SmartMage: 3Dシーン理解のための動的モダリティ編成3Dシーン理解2026/8/5
3Dシーン理解において、クエリに応じて必要なモダリティを動的に選択するMLLMを提案し、固定のモダリティ組み合わせによるノイズや計算浪費を改善した。
- TableVerse: 実世界の接地レイアウトを備えた大規模テーブルトップデータセットによる汎用操作の実現データセット/操作2026/7/1
インターネット上の未整理画像から物理的に妥当なテーブルトップ環境を自動再構成し、100,000件の操作デモを含む大規模データセットを構築した論文。
- 劣化周波数曲線:全一括画像復元のための明示的な周波数量化表現画像復元2026/5/17
劣化を周波数領域の帯域別エネルギー比で定量化する「劣化周波数曲線(DFC)」を提案し、これをトークンとして活用するDFC-IRフレームワークにより、複合・未知の劣化を含む全一括画像復元で高性能を達成した。
- EgoMemReason: 長時間の自己中心視点映像理解のための記憶駆動型推論ベンチマークビデオ理解2026/5/11
数日間にわたる自己中心視点映像の理解を評価する新しいベンチマークを提案し、エンティティ記憶、イベント記憶、行動記憶の3種類の記憶に基づく推論をテストする。
- 想像をいつ信じるか:ワールドアクションモデルにおける適応的アクション実行マニピュレーション2026/5/1
ロボット操作のためのワールドアクションモデル(WAM)において、予測と実世界の観測の一致度を検証する軽量な検証器(FFDC)を導入し、実行するアクション数を適応的に調整する手法を提案した。
- TacUMI:接触の多いタスクのためのマルチモーダル汎用マニピュレーションインターフェースマニピュレーション2026/1/1
手持ちデモ装置UMIに触覚・力覚・姿勢センサを統合し、接触の多い作業のマルチモーダルデータを収集できるようにした。さらに時系列モデルで作業を意味のある区間に分割する手法を提案し、ケーブル取付タスクで90%以上の分割精度を達成した。
- モデル脱獄を超えて:身体性AIにおける「十の大罪」の体系的解剖身体性AIセキュリティ2025/12/1
Unitree Go2ロボットを対象に、無線設定・コアモジュール・外部インターフェースの3層にわたる10の脆弱性を発見し、身体性AIのセキュリティにはモデル単体の対策では不十分であることを示した。
- Prune-Then-Plan: 身体性質問応答における安定したフロンティア探索のためのステップレベル校正VLA2025/11/1
VLMの過信によるフロンティア振動を抑えるため、ステップレベルで候補を枝刈りしてからカバレッジベースのプランナに決定を委ねる枠組みを提案し、EQAの探索効率と回答品質を改善した。
- ESVC足を用いた二足歩行ロボットのためのノイズ解析と階層型適応身体状態推定器歩行2025/6/1
人間の足の転がり形状に着想を得たESVC足は歩行のエネルギー効率を高めるが、支持脚の傾きにより接触モデル誤差が増幅し状態推定が難しくなる。本研究ではノイズ解析を行い、ノイズ時間回帰モデルと二段階の階層型適応状態推定器を提案し、従来のEKFや適応EKFより高精度かつ高速収束を実現した。
- マルチモーダル知覚を用いた複数ロボットによる変形可能な線状物体の組立マニピュレーション2025/6/1
視覚と触覚を統合した物体中心の知覚・計画フレームワークにより、複数ロボットが協調してケーブルなどの変形可能な線状物体を産業組立する手法を提案し、実機実験で有効性を示した。
- 二足歩行ロボットのための楕円ベース分割可変曲率足のモデル解析と設計歩行2025/6/1
人間の足の分割曲率転がり形状に着想を得て、楕円ベースの分割可変曲率(ESVC)足を設計し、解析的接触モデルと最適化手法を構築して、二足ロボットの歩行エネルギー効率を最大18.52%改善した。
- MAPFを実世界へ:スケーラブルなマルチエージェント現実的テストベッド(SMART)群制御2025/3/1
物理エンジンを用いてロボットの運動特性や不確実性を考慮し、数千台規模のマルチエージェント経路計画アルゴリズムを評価できるシミュレータSMARTを開発した。
- LEMMo-Plan: マルチモーダル実演からのLLM強化学習による接触の多い逐次マニピュレーション計画マニピュレーション2024/9/1
人間の実演から触覚・力覚情報も取り込み、LLMが接触の多い逐次操作タスクの計画を生成できるようにするインコンテキスト学習フレームワークを提案した。
- Learning 6-DoF Fine-grained Grasp Detection Based on Part Affordance Grounding2023/1/1
- Human-in-the-loop Robotic Grasping using BERT Scene Representation2022/9/1
- Analysis of lane-change conflict between cars and trucks at merging section using UAV video data2022/1/1