Bingbing Liu
Huawei Foundation Model Department
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PhysVGGT: 単一画像からのフィードフォワード高密度物性推定物性推定2026/9/16
1枚のRGB画像から摩擦係数・硬さ・ヤング率・密度の高密度マップと物体質量を1回の順伝播で予測するモデルを提案し、擬似ラベル生成により大規模弱教師学習を可能にした。
- Robust-WAM:生成事前学習と意味的先見を橋渡しするワールドアクションモデルVLA2026/8/1
ビデオ生成モデルの事前学習を活かしつつ、意味的潜在空間での先見アライメントを追加することで、見た目の変化に頑健なロボット制御を実現するポストトレーニング手法を提案した。
- 関節・ヒンジ軸推定を伴うパーツレベル3Dガウシアン車両生成3D生成/自動運転シミュレーション2026/4/1
単一画像や疎な多視点入力から、可動部を持つアニメーション可能な3Dガウシアン車両を生成するフレームワークを提案。パーツ境界の歪みを防ぐエッジ精緻化と、関節位置・ヒンジ軸を予測する運動学ヘッドにより、実世界の車両を忠実に再現する。
- DualCoT-VLA: 視覚と言語の連鎖的推論を並列化した視覚言語行動モデルVLA2026/3/1
複雑なタスクで苦戦するVLAモデルに対し、視覚的CoTと言語的CoTを並列に統合し、推論遅延を減らして高性能を実現した。
- S-VAM: 幾何学的・意味的先読みの自己蒸留によるショートカット動画行動モデルロボット学習/VLA2026/3/1
動画行動モデル(VAM)の推論速度と先読み精度のトレードオフを解決するため、単一パスで幾何・意味表現を予測するショートカットモデルS-VAMを提案。多段階拡散の生成事前知識を一段階推論に凝縮する自己蒸留戦略を導入し、シミュレーションと実世界で高性能を実証した。
- UniScale:ロボット知覚のための事前情報注入による統一スケール対応多視点3D再構成3D再構成2026/2/1
多視点画像からカメラ内部・外部パラメータ、スケール不変な深度と点群、実スケールを単一のフィードフォワードネットワークで推定し、既存モデルの事前情報を活用してロボット向け3D再構成を高精度化するフレームワーク。
- 知覚誘導型自己教師あり学習:エンドツーエンド自動運転における因果モデリングの新パラダイム自動運転2025/11/1
知覚出力を主要な教師信号として使う自己教師あり学習を導入し、模倣学習の因果混乱を抑えて閉ループ自動運転の性能を向上させた研究。
- SQS: 自動運転におけるクエリベーススプラッティングによるスパース知覚モデルの強化自動運転知覚2025/9/1
スパースクエリから3Dガウシアンを予測する自己教師ありスプラッティング事前学習を導入し、占有予測や3D物体検出などの自動運転知覚タスクの性能を向上させた研究。
- UnPose: 不確実性誘導拡散事前分布によるゼロショット姿勢推定姿勢推定2025/8/1
事前学習済み拡散モデルの3D事前分布と不確実性推定を活用し、CADモデル不要で新規物体の6D姿勢推定と3D再構成をゼロショットで行うフレームワークを提案。
- ニューラルレンダリングモデルを用いた自動運転データセットの姿勢最適化自動運転データセット2025/4/1
NeRFをベースに自動運転データセットのセンサ姿勢とキャリブレーションを最適化し、再投影誤差や新規視点合成品質を改善する手法を提案。
- Occ-LLM:占有表現を活用した自動運転向け大規模言語モデル自動運転/LLM2025/2/1
占有グリッド表現を大規模言語モデルに統合し、動的物体と静的シーンを分離するMS-VAEで効率的に符号化することで、4D占有予測や自己計画、シーン質問応答の性能を向上させた研究。
- HIPPo: 画像から3Dへの事前分布を活用したモデルフリーゼロショット6D姿勢推定6D姿勢推定2025/2/1
拡散モデルによる画像から3Dメッシュ生成とオンライン観測の統合により、CADモデルや参照画像なしで未知物体の6D姿勢を推定・追跡するフレームワークを提案。
- HUGSIM:自動運転のためのリアルタイム・フォトリアル・閉ループシミュレータ自動運転シミュレーション2024/12/1
3Dガウシアンスプラッティングで2D画像を3D空間に持ち上げ、自動運転アルゴリズムを評価するためのリアルタイムでフォトリアルな閉ループシミュレータを構築した。
- VisionPAD: 自動運転のための視覚中心の事前学習パラダイム自動運転/自己教師あり学習2024/11/1
画像のみを教師信号に3Dガウシアンスプラッティングで多視点表現を再構成し、ボクセル速度推定と多フレーム測光整合性で自動運転向け視覚モデルを自己教師あり事前学習する手法。
- PCGen: Point Cloud Generator for LiDAR Simulation2022/10/1
- (AF)2-S3Net: Attentive Feature Fusion with Adaptive Feature Selection for Sparse Semantic Segmentation Network2021/2/1
- Bidirectional Attention Network for Monocular Depth Estimation2020/9/1