日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読

ニュース

NEWS

ヒューマノイドの移動と操作を統合する世界行動モデル「ω-0」、11種の家事タスクで実証

ヒューマノイドロボットが移動しながら物体操作を行う「同時移動操作」を実現する潜在予測型世界行動モデル「ω-0」が提案された。言語指示・視覚・自己受容感覚から全身の行動潜在変数を直接予測し、将来の映像再構成ではなくコンパクトな観測埋め込みを予測する軽量な手法を採用。40時間超の実世界データセット「ω-HOME」を用いた11種の家事タスクで、既存の模倣学習やVLA、ヒューマノイド、WAMベースラインを上回る性能を示した。

NEWS

世界行動モデルの新フレームワークPILOT、意図と軌道の分離でロボット操作性能を向上

世界行動モデル(WAM)の構造的ボトルネックを解消するため、PILOTフレームワークが提案された。PILOTは表現演繹(RD)により、高次物理状態の遷移と低次動作軌道を分離し、思考連鎖(CoT)として統合する。実験では複雑なロボット操作タスクでの成功率と汎化性が向上し、少数ショット実機ファインチューニングにも有効とされる。

NEWS

触覚センシングで把持物体の外部接触をミリ秒検出する新手法「TECDAR」

ロボットの繊細な操作を可能にするため、把持物体と環境との過渡的な外部接触を検出・測距する新手法「TECDAR」が提案された。グリッパ先端に6D慣性センサを搭載し、7kHzのサンプリングでサブミリ秒の変形を捉え、拡張カルマンフィルタで接触位置を180ms以内にミリメートル精度で推定する。実験では平均約7mmの位置決め精度を達成し、精密組立や手術支援などへの応用が期待される。

NEWS

AtlasVLA:手首カメラのみで長期的タスクを高精度に遂行する新フレームワーク

AtlasVLAは、視覚言語行動モデル(VLA)の反応的パラダイムを克服し、持続的な世界・自我状態モデリングを導入した新フレームワークである。手首カメラのみでLIBERO-Longで9.4%、実世界の長期タスクで17.5%の成功率向上を達成した。拡散トランスフォーマーを活用し、部分観測や長期タスクでの性能を大幅に改善する。

NEWS

家庭用サービスロボットの「不可避な故障」に備える新安全設計と評価基盤FailBench

家庭環境で動作するサービスロボットの不可避な故障に備え、故障時の影響を確率と重大性で定量評価する新たな安全設計が提案された。併せて、多様な故障モードを再現するMuJoCoベースのシミュレーション基盤「FailBench」も公開された。これにより、安全性とタスク効率を両立する動作計画や学習ポリシーの開発が期待される。

NEWS

音響駆動ミリメートル級ヘリカルロボット、生体内閉鎖環境での推進を実証

音響放射力と音響流の相乗効果により、ミリメートル級ヘリカルロボットの推進効率を向上させる手法が提案された。多物理場シミュレーションと実験により、平面移動・傾斜登坂・垂直移動などの運動能力が確認された。ブタ静脈血管を用いたin vitro試験では、生体関連の閉鎖環境下での一方向・往復運動が実証された。

NEWS

世界モデルの未見ロボットへの汎化は「見た目」依存、物理ダイナミクス欠如が明らかに

アクション条件付き世界モデルは、未見のロボットを正しく描画できず、物理的類似性ではなく視覚的類似性で汎化していることが判明。ゼロショットではピクセル空間アクションなどの強い手掛かりが必要で、数ショット適応では破滅的忘却が発生。物理ダイナミクスと視覚的外観を分離するアーキテクチャ革新が不可欠とされる。

NEWS

複数ロボットによる大規模解体の効率化手法「CoMuDi」を提案

arXivに公開された論文で、複数ロボットによる解体作業の効率化手法「CoMuDi」が提案された。CoMuDiは時間制約の伝播とST-RRT*プランナーを統合し、最大9台のロボットで49部品のアセンブリを低アイドル時間で解体できることを示した。

NEWS

不確実な接地条件下での脚式ロボット向け自己位置推定手法TRACEを提案

脚式ロボットの自己位置推定において、接地状態が不確実な状況下での精度向上を目指す新手法TRACEが提案された。IMUと脚の関節測定値を用い、接地や滑りの閾値に依存しないクロスアテンション機構を導入する。シミュレーションと実機での実験により、従来手法と比較して位置ドリフトの低減が確認された。

NEWS

NVIDIA Isaac Sim向けファジング手法「IcFuzz」、コードカバレッジ約2倍・11件のバグを発見

NVIDIA Isaac Simの複雑性に起因するソフトウェアバグを検出するため、LLMベースのセマンティックステージ分割と多段階ミューテーションを備えたファジング手法「IcFuzz」が提案された。IcFuzzはベースライン比で約190%~205%のコードカバレッジを達成し、12時間テストで平均3.7件のクラッシュを検出。約4ヶ月で11件のバグを発見し、うち9件は開発者により確認または修正された。

NEWS

触覚センサの近接センサ処理でロボット保護反射を約6倍高速化、347mWの低消費電力FPGAパイプラインを実装

近接センサ型コンピューティングにより、視触覚センサの深度再構成をストリーミングハードウェアパイプラインで実装し、ロボットの保護反射ループを169.9msから28.3msへ短縮した。消費電力は347mW、固定レイテンシは0.211msで、精度は参照値に対し0.17%の誤差。

NEWS

アメーバ型ロボットが視覚なしで地面状態を分類、人工固有受容感覚を実装

アメーバに着想を得た自律歩行ロボットが、画像を使わずに地面の状態(平坦・粗い)を高精度で分類する手法を開発。3軸加速度計と8つの足圧センサー、リザバーコンピューティングを統合した人工固有受容感覚を実装。歩行中の動的ノイズがあっても分類可能で、地面に応じた歩容切替の実証にも成功した。

NEWS

VLAモデルに「言語を消費する能力」を付与する新フレームワーク「In-Context VLA」、シミュレーションと実機でSOTA達成

arXivに公開された論文で、Vision-Language-Action (VLA) モデルに言語生成ではなく「接地された言語を消費する能力」を与える新フレームワーク「In-Context VLA」が提案された。自由形式のテキストによる思考連鎖(CoT)は低レベル制御を劣化させることを実証・分析し、代わりに文脈内ポストトレーニングとエージェント的ツール使用を導入。RoboCasa-GR1、SimplerEnv、LIBEROの各ベンチマークと8つの実世界ロボット操作タスクで、CoTベースの手法と比較してSOTAを達成した。

NEWS

JoyAI-RA 0.5:人間の動画データでロボット操作学習を大規模化する新フレームワーク

ロボット操作の汎用モデルを、人間の一人称視点動画・シミュレーション・実機データを統合して学習するVLWAフレームワーク「JoyAI-RA 0.5」が発表された。二重のアクション整合により、ラベルなしの人間データを物理ダイナミクス学習に活用し、実機ベンチマークで高い性能を示した。人間の動画データ量の増加に伴いタスクスコアが向上し、スケーリングの可能性が示唆された。

NEWS

人型ロボット向けマルチモーダルオドメトリ「KILVO」、センサ故障に強い新手法を提案

人型ロボット向けに、関節エンコーダ、IMU、LiDAR、カメラを統合したオドメトリ手法「KILVO」が提案された。非同期・逐次ハイブリッド誤差状態反復カルマンフィルタを採用し、センサ故障への適応的耐性を持つ。公開データセットと実機実験で高い精度と効率を実証し、コードとデータセットを公開している。