Daojie Peng
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- オープンボキャブラリ・インスタンスナビゲーションのための物体-経路グラフによるトポロジカル表現ナビゲーション2026/9/21
物体と経路を統合したグラフ表現を提案し、密な地図構築なしにオープンボキャブラリな意味推論とトポロジカルナビゲーションを実現した。
- EmoPose: 視覚言語モデルが導く感情を考慮したヒューマノイドロボットのジェスチャー生成ヒューマノイド/ジェスチャー生成2026/9/20
視覚言語モデルがジェスチャーの種類や強度を選び、ロボット側の動作ライブラリで実行する枠組みを提案し、社会的文脈に応じた表情豊かなジェスチャーを実現した。
- 遅延耐性を持つクラウド・エッジ協調型視覚言語行動モデル:創発的表現特化による実現VLA2026/8/1
クラウド上の大規模VLAモデルとエッジの軽量ヘッドを組み合わせ、通信遅延があってもロボット制御を維持する手法を提案。遅延フレームと現在フレームを同じ行動目標で学習させ、クラウド表現にタスク情報を、エッジに状態補正を担わせる。
- SSTG-Nav: 再利用可能な物体ナビゲーションのための計量基盤型空間意味トポロジカルグラフナビゲーション2026/8/1
サービスロボットが同じ環境で長期間運用される際、事前の探索情報を再利用可能な意味メモリとして構築し、物体ナビゲーションの成功率と効率を大幅に向上させる手法を提案した。
- LeapBot-WA: 予測的潜在アライメントによるワールドアンカー行動モデルVLA2026/7/1
ピクセルレベルの動画生成に依存せず、潜在空間での予測的意味アライメントを用いて物理ダイナミクスを抽出する新しいワールドアクションモデルを提案し、LIBEROやRoboTwinで高い性能を達成した。
- GeoSem-WAM: 幾何・意味を考慮した世界行動モデルVLA2026/6/1
将来のRGB予測に加えて、幾何と意味の予測を補助タスクとして導入し、ロボットの行動決定に有効な潜在表現を学習する世界モデルを提案した。
- AttenA+: ロボット基盤モデルにおける行動の不平等性の是正VLA2026/5/1
ロボットの軌道における速度の不均一性に着目し、速度に基づく行動注意機構で重要区間を強調して学習する、既存モデルに追加可能なフレームワークを提案した。
- LiteViLNet: 効率的な道路セグメンテーションのための軽量ビジョン-LiDAR融合ネットワークセグメンテーション2026/5/1
RGBとLiDARの情報を軽量に融合し、エッジデバイスでも高速動作する道路セグメンテーションネットワークを提案した。
- 効率的で汎化性の高い視覚言語ナビゲーションのための構造化観測言語VLA2026/3/1
視覚言語ナビゲーションにおいて、RGB-D画像をグリッド分割し各セルの意味・色・深度情報を構造化テキストに変換して言語モデルに入力するフレームワークSOL-Navを提案し、モデルサイズとデータ依存を削減しつつ汎化性能を向上させた。
- TopoNav: トポロジカルグラフを活用した高度な物体ナビゲーションナビゲーション2025/9/1
トポロジカルグラフを空間記憶として用いることで、長期的な物体ナビゲーションタスクにおける記憶管理と動的環境への対応を改善するフレームワークを提案。
- LOVON: 脚式ロボットのためのオープン語彙物体ナビゲータナビゲーション2025/7/1
大規模言語モデルによる階層的タスク計画とオープン語彙の視覚検出を統合し、動的で非構造化環境での長距離物体ナビゲーションを実現するフレームワークを提案。