Fulong Ma
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EmoPose: 視覚言語モデルが導く感情を考慮したヒューマノイドロボットのジェスチャー生成ヒューマノイド/ジェスチャー生成2026/9/20
視覚言語モデルがジェスチャーの種類や強度を選び、ロボット側の動作ライブラリで実行する枠組みを提案し、社会的文脈に応じた表情豊かなジェスチャーを実現した。
- 遅延耐性を持つクラウド・エッジ協調型視覚言語行動モデル:創発的表現特化による実現VLA2026/8/1
クラウド上の大規模VLAモデルとエッジの軽量ヘッドを組み合わせ、通信遅延があってもロボット制御を維持する手法を提案。遅延フレームと現在フレームを同じ行動目標で学習させ、クラウド表現にタスク情報を、エッジに状態補正を担わせる。
- GeoSem-WAM: 幾何・意味を考慮した世界行動モデルVLA2026/6/1
将来のRGB予測に加えて、幾何と意味の予測を補助タスクとして導入し、ロボットの行動決定に有効な潜在表現を学習する世界モデルを提案した。
- LiteViLNet: 効率的な道路セグメンテーションのための軽量ビジョン-LiDAR融合ネットワークセグメンテーション2026/5/1
RGBとLiDARの情報を軽量に融合し、エッジデバイスでも高速動作する道路セグメンテーションネットワークを提案した。
- AttenA+: ロボット基盤モデルにおける行動の不平等性の是正VLA2026/5/1
ロボットの軌道における速度の不均一性に着目し、速度に基づく行動注意機構で重要区間を強調して学習する、既存モデルに追加可能なフレームワークを提案した。
- 効率的で汎化性の高い視覚言語ナビゲーションのための構造化観測言語VLA2026/3/1
視覚言語ナビゲーションにおいて、RGB-D画像をグリッド分割し各セルの意味・色・深度情報を構造化テキストに変換して言語モデルに入力するフレームワークSOL-Navを提案し、モデルサイズとデータ依存を削減しつつ汎化性能を向上させた。
- LHPF: 自動運転における履歴を振り返り未来を計画する手法自動運転計画2024/11/1
過去の計画意図を集約して現在の観測と組み合わせる模倣学習型プランナを提案し、実データと合成データで既存手法を上回り、純粋な学習ベース手法として初めて専門家を超える性能を達成した。
- FisheyeDepth:魚眼カメラ向け実スケール自己教師あり深度推定モデル深度推定2024/9/1
魚眼カメラの歪みを考慮した投影・再投影と実スケールの姿勢情報を組み合わせ、自己教師ありで実用的な深度推定を可能にしたモデルを提案。
- DragTraffic: 自動運転のための対話的で制御可能な交通シーン生成シーン生成2024/4/1
画像生成のDragGANに着想を得て、条件付き拡散モデルにより非専門家でも多様でリアルな交通シナリオを対話的に生成・制御できるフレームワークを提案した。
- CurbNet: LiDAR点群セグメンテーションに基づく縁石検出フレームワーク点群セグメンテーション2024/3/1
LiDAR点群のセグメンテーションを用いて道路上の縁石を検出するCurbNetを提案し、大規模な3D縁石データセット3D-Curbを構築した。
- The Role of the Hercules Autonomous Vehicle During the COVID-19 Pandemic: An Autonomous Logistic Vehicle for Contactless Goods Transportation2020/4/1