Bo Wang
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 鋭い目から専門家の頭脳へ:改ざんテキスト検出のためのMLLMへの専門知識の内部化マルチモーダルLLM2026/9/28
改ざんテキスト検出において、専門家モデルの細粒度な知覚能力をマルチモーダル大規模言語モデル(MLLM)に段階的に内部化する手法を提案し、ドメイン内外での検出性能を向上させた。
- 移動ロボットのための部分スキャン・移動型ソースシーキングソースシーキング2026/9/20
オフセットスカラーセンサを搭載した移動ロボットが、毎回全周スキャンせずに部分的な測定だけで次の移動方向を判断し、ノイズ下でも高確率で有限回で源に到達する手法を提案。
- ZimaBlue: スケーラブルなビデオ事前学習による汎化可能な世界行動モデルの進化VLA2026/8/31
大規模な一人称視点ビデオからロボット制御のための世界行動モデルを学習するフレームワークを提案し、実機ゼロショット評価で成功率を大幅に向上させた。
- OptiGeo: 光学的に困難なシーンにおける身体化知覚のための効率的な単眼幾何学深度推定2026/8/30
透明・反射・鏡面環境での単眼深度推定の信頼性を向上させるため、センサ由来のバイアスを補正する学習フレームワークOptiGeoを提案した。
- 非ホロノミック移動ロボットのためのスケーリングに基づく相互制御障壁関数安全制御2026/8/23
非ホロノミック移動ロボットの位置レベルの障害物回避における相対次数2の安全制約に対して、運動依存のスケーリング因子を導入した相互障壁関数の構築法を提案し、安全集合の内部不変性を保証する。
- 大規模視覚言語モデルを用いたトークンベースのアフォーダンス接地VLA2026/7/1
大規模視覚言語モデルの出力トークンの注意マップを活用し、外部教師なしで行動関連領域を特定するゼロショットのアフォーダンス接地フレームワークを提案した。
- メタ強化学習における知識再利用フレームワークメタ強化学習2026/6/16
メタ強化学習で、単純化したエージェントで学習したタスク知識を異なる形態のエージェントに転移するフレームワークを提案し、追従誤差を大幅削減しデータ効率を向上させた。
- JoyAI-Image: 統一マルチモーダル理解と生成における空間知能の覚醒VLA2026/5/5
視覚理解・テキストからの画像生成・指示による画像編集を統合したマルチモーダル基盤モデルを提案し、空間認識能力を強化した。
- 三重対称ブリカールパラレル機構に基づく新規な再構成可能な器用ハンドハンド/機構設計2026/3/1
三重対称ブリカールリンクを再構成可能な掌に用いたロボットハンドを設計し、機構解析と試作実験により多様な物体の安定把持を実証した。
- 折りたたみ力学からロボット機能へ:コンプライアント折り紙のための統一模倣フレームワーク折り紙ロボティクス2026/3/1
離散微分幾何学に基づき、パネルの弾性と折り目回転を単一の変分形式で統合した、コンプライアント折り紙の力学モデリングフレームワークを提案した。
- HIMM: 身体性探索と質問応答のための人間に着想を得た長期記憶モデリングVLA2026/2/1
エピソード記憶と意味記憶を分離した非パラメトリック記憶フレームワークを提案し、身体性エージェントの長期観測下での探索と質問応答を改善した。
- MG-Nav: 疎な空間メモリによる二段階スケールの視覚ナビゲーション視覚ナビゲーション2025/11/1
領域ごとに多視点のキーフレームと物体意味を集約した疎な空間メモリグラフを用い、大域的な記憶誘導計画と局所的な幾何制御を組み合わせてゼロショット視覚ナビゲーションを実現した研究。
- 効率的な視覚-言語-行動モデルのサーベイVLA2025/10/1
視覚-言語-行動モデル(VLA)の効率化に関する初の包括的サーベイであり、モデル設計・学習・データ収集の3つの柱で既存研究を整理し、課題と今後の方向性を示す。
- 生物に学ぶ水中ソフトロボット:生物学からロボティクスへ、そして再び生物学へソフトロボティクス2025/8/1
海洋生物に着想を得た水中ソフトロボットの研究を、生物学とロボティクスの双方向の枠組みとして捉え直し、生物学的検証や進化仮説の検証への応用、および種を超えた収斂原理に基づく新たな設計パラダイムを提案する。
- PI-WAN: 物理情報に基づく風適応ネットワークによる未知環境下のクアッドロータ動力学予測モデルベース制御/ドローン2025/7/1
物理制約を学習に組み込んだTCNベースのモデルでクアッドロータの動力学を予測し、MPCと組み合わせて未知環境での追従精度とロバスト性を向上させた。
- 3DTTNet: マルチモーダル融合によるオフロード環境向け3D走行可能地形モデリング走行可能領域認識/マルチモーダル融合2024/12/1
LiDAR点群と単眼画像を融合し、オフロード環境の走行可能領域を3Dセマンティックシーン補完で推定する手法を提案。車両の障害物跨ぎ条件を考慮した4段階の走行コストラベルと新データセットRELLIS-OCCを導入し、シーン補完IoUを42%改善した。
- SegSTRONG-C: 非敵対的生成劣化に対する手術器具のロバストセグメンテーション — EndoVis'24チャレンジセグメンテーション2024/7/1
手術器具セグメンテーションの深層学習モデルが、出血・煙・低照度などの現実的な画像劣化に対してどれだけ頑健かを評価するEndoVis'24チャレンジを開催し、ベースラインと参加手法を比較した。
- C³P-VoxelMap: コンパクト・累積・統合可能な確率的ボクセルマッピングSLAM/マッピング2024/6/1
LiDARオドメトリ向けに、点群を保持せず統計量のみを累積更新する確率的ボクセルマップを提案し、さらに同一平面のボクセルを遅延統合することでメモリ削減と精度向上を実現した。