Song-Chun Zhu
収録論文 38本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HappyWorld-Bench:世界モデルの信頼性を評価する総合ベンチマーク世界モデル評価2026/9/21
生成世界モデルがエージェントの相互作用下でどれだけ信頼できるかを、動画・空間・身体性の3トラックで評価するベンチマークを提案し、14の動画モデル、9の空間システム、8の身体性モデルを評価した。
- UniLM-Nav: ゼロショット・ラストマイルナビゲーションのための統合フレームワークナビゲーション2026/7/1
モバイルマニピュレーションにおけるラストマイルナビゲーションを、視点選択・アフォーダンス接地・ベースポーズ推論に分解し、共有のMLLMで解決する統合フレームワークを提案。OVMMベンチマークでSOTAを達成。
- ヒューマノイドロボットによる効率的な多地点検査のための経路・動作最適化マニピュレーション2025/10/1
階層的計画とMPCを組み合わせ、ヒューマノイドが多地点をミリメートル精度で高速に検査する枠組みを提案し、Kuavo 4Proで検証した。
- VideoArtGS: 単眼動画から関節物体のデジタルツインを構築3D再構成2025/9/1
単眼動画から関節物体の形状・部位分割・関節パラメータを同時に復元し、高精度なデジタルツインを構築する手法を提案。
- Aegis: マルチエージェントシステムのための自動エラー生成と帰属マルチエージェント2025/9/1
LLMベースのマルチエージェントシステムにおいて、成功軌道に文脈依存のエラーを注入して大規模なエラー帰属データセットを自動生成し、教師あり・強化学習・対照学習でエラー原因エージェントを特定する手法を提案。
- ロボットとシーンの運動学を統合した逐次移動マニピュレーション計画移動マニピュレーション2025/8/1
環境構造を運動学モデルとして取り込み、ロボットとシーンの統合配置空間で計画することで、関節物体を含む長期的な移動マニピュレーションを実現する枠組みを提案した。
- ControlVLA: 事前学習済み視覚言語行動モデルのための少数ショット物体中心適応VLA2025/6/1
ControlNet風のアーキテクチャで物体中心表現を導入し、10〜20回のデモンストレーションだけで多様な実世界操作タスクに適応できるフレームワークを提案。
- MetaScenes: 実世界3Dスキャンからの自動レプリカ生成に向けてsim2real2025/5/1
実世界スキャンから構築した大規模シミュラブル3DシーンデータセットMetaScenesと、アセットを自動置換するマルチモーダル整合モデルScan2Simを提案し、ロボット操作とVLNのベンチマークで有効性を示した。
- 微分可能情報を活用したモデルベース強化学習の強化モデルベース強化学習2025/3/1
微分可能環境の情報を活用し、Sobolev損失でモデル予測精度を高め、混合長さの切り詰め学習で方策勾配の分散を抑えるMBRL手法MB-MIXを提案。ヒューマノイド制御や変形物体操作で既存手法を上回る。
- ArtGS: ガウシアンスプラッティングによる複雑な関節物体の操作可能なレプリカ構築3D再構成/関節物体2025/2/1
3Dガウシアンを用いて複数パーツの関節物体を異なる状態間で統合し、パーツメッシュ再構成と関節パラメータ推定を高精度・高効率で行う手法を提案。
- ロボットハンド全体への高解像度触覚埋め込みによる適応的な人間らしい把持触覚2024/12/1
表面の70%に0.1mm解像度の触覚センサを備えた生体模倣ハンドを開発し、生成アルゴリズムと組み合わせることで、動的な実環境での把持性能が触覚なしの場合より大幅に向上することを示した。
- M3Bench:3Dシーンにおけるモバイルマニピュレーションの全身動作生成ベンチマークモバイルマニピュレーション2024/10/1
3Dシーンで物体を並べ替える全身動作軌道を生成するモバイルマニピュレーションの新ベンチマークM3Benchを提案し、自動データ生成ツールと物理シミュレーション評価を提供する。
- M2Diffuser: 3Dシーンにおけるモバイルマニピュレーションのための拡散ベース軌道最適化モバイルマニピュレーション2024/10/1
ロボット中心の3Dスキャンから移動と操作を統合した全身軌道を拡散モデルで生成し、推論時に物理制約とタスク目的を最適化する手法を提案。20以上のシーンで既存手法を上回り、実機転移も成功。
- InterPreT: 言語フィードバックからの対話的述語学習による汎化可能なタスクプランニングタスクプランニング2024/5/1
人間の非専門家による言語フィードバックから記号述語と作用素を学習し、PDDLに変換してロボットの長期タスクプランニングを実現するLLMベースのフレームワーク。
- Ag2Manip: エージェント非依存の視覚・行動表現による新規マニピュレーションスキルの学習マニピュレーション2024/4/1
人間の操作動画からエージェント非依存の視覚表現と、ロボットの運動学を汎用エージェント代理に抽象化した行動表現を学習し、ドメイン固有のデモなしで新規マニピュレーションタスクの性能を大幅に向上させた。
- LLM³: 動作失敗の推論を組み込んだ大規模言語モデルベースのタスク・動作計画マニピュレーション2024/3/1
大規模言語モデルを使ってタスク計画と動作計画を橋渡しし、動作計画の失敗フィードバックをプロンプトで与えて提案を反復改善する、ドメイン非依存のTAMPフレームワークを提案した。
- An Embodied Generalist Agent in 3D World2023/11/18
- Sim2Plan: Robot Motion Planning via Message Passing between Simulation and Reality2023/7/1
- Part-level Scene Reconstruction Affords Robot Interaction2023/7/1
- ARNOLD: A Benchmark for Language-Grounded Task Learning With Continuous States in Realistic 3D Scenes2023/4/1
- Rearrange Indoor Scenes for Human-Robot Co-Activity2023/3/1
- A Reconfigurable Data Glove for Reconstructing Physical and Virtual Grasps2023/1/1
- Sequential Manipulation Planning on Scene Graph2022/7/1
- Understanding Physical Effects for Effective Tool-use2022/6/1
- Towards Human-Level Bimanual Dexterous Manipulation with Reinforcement Learning2022/6/1
- Efficient Task Planning for Mobile Manipulation: a Virtual Kinematic Chain Perspective2021/8/1
- Consolidating Kinematic Models to Promote Coordinated Mobile Manipulations2021/8/1
- Synthesizing Diverse and Physically Stable Grasps with Arbitrary Hand Structures using Differentiable Force Closure Estimator2021/4/1
- Congestion-aware Multi-agent Trajectory Prediction for Collision Avoidance2021/3/1
- Reconstructing Interactive 3D Scenes by Panoptic Mapping and CAD Model Alignments2021/3/1
- Show Me What You Can Do: Capability Calibration on Reachable Workspace for Human-Robot Collaboration2021/3/1
- Weighted Entropy Modification for Soft Actor-Critic2020/11/1
- Human-Robot Interaction in a Shared Augmented Reality Workspace2020/7/1
- Joint Mind Modeling for Explanation Generation in Complex Human-Robot Collaborative Tasks2020/7/1
- Joint Inference of States, Robot Knowledge, and Human (False-)Beliefs2020/4/1
- VRGym: A Virtual Testbed for Physical and Interactive AI2019/4/1
- Learning Social Affordance Grammar from Videos: Transferring Human Interactions to Human-Robot Interactions2017/3/1
- Learning Social Affordance for Human-Robot Interaction2016/4/1