類似エゴセントリック動画のマイニングで器用操作の成功率を大幅改善—SiMDex
SiMDexは、約3200万件のエゴセントリックな人間の動画から、ロボットの器用操作に有効なデータを類似性に基づいて選別するフレームワーク。約149万件(全体の5%未満)の選別データで、ランダム抽出のベースラインと比較して成功率を47.7%から61.1%に向上させた。VLAアーキテクチャや学習プロセスを変更せずに、データ選択の重要性を示した。
世界のフィジカルAIを、日本語で。
SiMDexは、約3200万件のエゴセントリックな人間の動画から、ロボットの器用操作に有効なデータを類似性に基づいて選別するフレームワーク。約149万件(全体の5%未満)の選別データで、ランダム抽出のベースラインと比較して成功率を47.7%から61.1%に向上させた。VLAアーキテクチャや学習プロセスを変更せずに、データ選択の重要性を示した。
水中無人機(UUV)向けに、リアルタイムで自己位置推定・自律航法・3Dマッピングを統合した視覚ベースの制御フレームワークが提案された。合成データセットと実機実験で検証され、動的で視覚的に困難な環境でのロバスト性が示された。海洋ロボットの現場展開を支援する技術とみられる。
arXivに公開された論文で、身体性タスク向けの新たなエージェントパラダイム「Embodied Task Agent (ETA)」が提案された。ETAはプランナー、インターフェース、ワールドのループで構成され、ロボットが未知のタスクや環境に適応し、経験から学習することを目指す。オープンソース実装「OpenETA」も公開され、Codexのプラグインとしても動作する。
エントリー級組み込みボード「Jetson Orin Nano Super (8GB)」上で、模倣学習による両腕操作ポリシーを実行する研究が公開された。ACTモデルをTensorRTでFP16/INT8変換し、推論レイテンシを最大9倍削減、タスク成功率も維持した。一方、Diffusion Policyは同条件では収束せず、組み込み展開にはACTが適するとみられる。
アマゾン傘下のZooxが、米国展開に向けた量産型ロボタクシーの最終デザインを公開した。乗り心地改善のためデザインを微調整し、テストを拡大している。
米海軍はBlue Water Autonomyを選定し、自律船舶による深海調査を進める。同社の無人船は外洋で数ヶ月間自律航行できる。
視覚・言語・行動(VLA)モデルにおけるロボットの自己受容状態の入力方法を体系的に比較した研究がarXivで公開された。5種類のインターフェースを実装し、45の基本タスクと20の複合タスクで評価。状態履歴の長さを1〜96フレームまで変化させ、設計原則を導出した。
世界行動モデル(WAM)の新設計「Dock of Transformer(DoT)」を提案。ビデオバックボーンを表現ハブとし、軽量な出力ヘッドをドッキングする方式で、推論レイテンシを66.5msに短縮。既存のFast-WAM比3.2倍の高速化を達成した。
VLAモデルは指示の言い換えで性能が激減する問題があるが、原因はアーキテクチャにあると判明。提案手法GSRはLIBERO-Paraで成功率を最大44.6%向上させ、PRIDEスコア70.4を達成。Xiaomi-Robotics-0を上回る指示生成能力を示した。
ロボット制御で有効なアクション・チャンキングの性能向上要因を検証し、既存仮説が不十分であることを示した。代わりに、非マルコフ的表現力と複合誤差の低減が寄与し、遅延ポリシーで再現可能であることを発見。さらに、暗黙的アンサンブル効果がロバスト性を高め、チャンキングなしで同等性能を達成できることを実証した。
軽量20gのウェアラブル触覚デバイス「HJ-Haptic」が開発された。ハニカムジャミング機構により剛性を1.15〜2.64 N/mmに可変でき、遠隔操作で物体の硬さを再現する。真空圧30kPaで動作し、安全性も確保されている。
遠隔操作ロボットにおいて、抽象的な触覚パターンで状態情報を伝える「意味的触覚」が提案された。片手作業では既存手法と同等だが、両手作業では作業負荷の低減、状況認識の向上、選好の向上が確認された。空気圧・振動式リストバンドを用いたモジュール型レンダリングパイプラインを実装している。
スウォームロボティクスにおける自己再構成システム向けに、外部インフラや高価なセンサを必要としない接触駆動型の位置推定手法が提案された。ロボット間の二値接触情報のみを利用し、仮想力フレームワークで姿勢を反復的に洗練する。シミュレーションでタワーやカンチレバーの組み立て時の有効性が示された。
人間の一人称視点操作動画をロボット学習データに変換するスケーラブルなパイプライン「Ego2Robot」が発表された。アクションのリターゲティング、ロボットアームの視覚合成、多段階の品質管理により、15種類のロボット形態に対応する18,561時間のデータセットを構築。ロボットデータとの併用事前学習が分布外汎化を向上させ、実機展開でも有効性が確認された。
CUDA MPCは、モデル予測制御(MPC)のオンライン最適化をGPU上で完結させる新フレームワーク。ADMM分割と融合カーネルにより、CPUソルバーより1〜2桁長いホライズンをリアルタイムで処理する。10エージェント群ロボットの衝突回避問題で、既存ソルバーが解けない状況でも唯一の実時間解を達成した。
LiDARを用いた3D物体検出で、Mambaを活用した知識蒸留フレームワークを提案。教師モデルから軽量学生モデルへボクセル特徴を転移し、計算負荷を大幅に削減しつつ精度を維持。公開データセットと実データで有効性を確認した。
arXivに投稿された論文「RoboReact」は、単一の視点RGB-D観察から全身ヒューマノイド操作スキルを自動合成するフレームワークを提案する。ビデオ生成モデルと視覚言語モデルを組み合わせ、遠隔操作や人間のデモなしで多様な物体構成に汎化し、外乱から回復できることを実機で実証した。
新たなフレームワーク「Context-Aware Motion Priors (CMP)」が、タスク文脈に応じてモーションプライアを適応させ、人型ロボットの制御性能とサンプル効率を向上させる。手動のスキルラベルやデータセット分割を不要とし、5つのタスクで有効性を確認した。
Tactusは、低コストの抵抗式圧力アレイのみからテキストクエリで物体を認識するオープンモデル。STAGベンチマークで教師ありCNNと同等以上の精度を達成。少数データとキャリブレーションが鍵で、失敗事例も詳細に報告。
人間とロボットの協調環境(HRI)向けに、拡散モデルと一貫性蒸留を用いた拘束付き軌道生成手法が提案された。RRT/RRT*で生成したデータセットで拡散モデルを訓練し、ガイド付きサンプリングで衝突回避と自己衝突回避を満たす軌道を生成。蒸留により推論時間を短縮し、100ms未満で150候補を生成可能とした。