Jianan Wang
Astribot
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ECHO: 手首装着イベントカメラによる過去と未来の文脈を統合したマニピュレーションマニピュレーション2026/9/28
手首装着イベントカメラの観測を圧縮表現に符号化し、過去の把持軌跡と未来のイベント予測を組み合わせて操作方策を学習する手法を提案。露出変動に強く、RLBenchと実機でRGBベースラインを上回る。
- 実演動画から明示的な行動意味論を蒸留する世界モデルVIDEAS世界モデル2026/9/27
ロボット操作動画を離散的な行動軌跡に分解し、VLMと事前知識ガイド付きシミュレーションで行動の前提条件と効果を構造化知識として抽出、言語ベース世界モデルを学習する枠組み。
- 見て、思い出して、行動する:並行身体ストリームにおける常時稼働ロボットVLA2026/9/23
常時稼働ロボット向けに、ライブ知覚・身体状態・自身の過去行動を非同期に統合するストリーミングポリシーARMSを提案し、両腕同時作業でのタスク成功率を向上させた。
- CoRe-WAM: 対応整合型時間差分によるワールドアクションモデルVLA2026/9/23
物体追跡の対応関係を用いて過去の視覚特徴を現在位置に移動させ、その差分を軽量アダプタでポリシーに組み込むことで、ロボットマニピュレーションの成功率を向上させた研究。
- MIRA: 身体性を備えたコンパニオン向けリアルタイム全二重ヒューマンロボットインタラクションヒューマンロボットインタラクション2026/9/21
ストリーミング音声から応答と身体動作を同時生成し、割り込み可能な動作をリアルタイムで実行する全二重対話フレームワークを提案し、ヒューマノイドロボットに実装した。
- AR-WAM: 視覚条件付きエージェント対応ワールドアクションモデルによるロボットマニピュレーションVLA2026/9/20
言語指示の代わりにバウンディングボックスと操作トークンで条件付けする0.5Bパラメータの世界行動モデルを提案し、エージェント駆動のロボット制御を実現した。
- SmoothRL: 非同期実行中のオンライン強化学習強化学習2026/8/30
事前学習済みロボットポリシーを非同期推論ループ内でオンライン強化学習により微調整するフレームワークを提案。非同期実行を考慮した学習により、高レイテンシ環境でもスムーズな制御を実現する。
- 視覚言語行動モデルをオンザフライツール使用エージェントへ進化させるVLA/ツール使用2026/8/14
VLAモデルにツール注入フレームワークを統合し、低次視覚・高次アフォーダンス・身体性を強化するエージェントARTを提案。ツール使用により行動解空間を縮小し、汎用性向上とデータ依存低減を実現。
- 予測的で整合性のあるスケーラブルなロボット学習に向けてVLA2026/7/1
潜在世界モデルと行動生成を統合したLumo-2を提案し、潜在空間での予測的推論とモダリティ整合により、ロボット学習の性能と汎化を向上させる。
- 知的ロボットとの長期的な物理的共存への一瞥群制御2026/7/1
複数のロボットを統合するエージェント「PHILIA」を提案し、ユーザーインターフェースやロボットの種類、ポリシーをプラグイン可能にするアーキテクチャを実証した。
- PhysMani: 動的物体操作のための物理原理に基づく3Dワールドモデル操作2026/7/1
高速で動く物体を操作するための、物理原理に基づく3Dガウシアンワールドモデルと将来予測を考慮した行動ポリシーを組み合わせたフレームワークを提案し、シミュレーションと実機で高い成功率を示した。
- StableVLA: 追加データなしで堅牢な視覚言語行動モデルを実現VLA2026/5/1
視覚障害に対するVLAモデルの脆弱性を調査し、情報理論に基づく軽量アダプタ(IB-Adapter)を提案。追加データや拡張なしで平均30%の性能向上を達成し、パラメータ増加は10M未満。
- 想像をいつ信じるか:ワールドアクションモデルにおける適応的アクション実行マニピュレーション2026/5/1
ロボット操作のためのワールドアクションモデル(WAM)において、予測と実世界の観測の一致度を検証する軽量な検証器(FFDC)を導入し、実行するアクション数を適応的に調整する手法を提案した。
- CLAP: 人間の動画から視覚-言語-行動モデルを学習するための対照的潜在行動事前学習VLA2026/1/1
人間の動画からロボットの行動スキルを抽出し、視覚-言語-行動モデルを事前学習するフレームワークCLAPを提案。対照学習で人間の動画をロボットの行動語彙に整合させ、効率的なスキル転移を実現した。
- LogicEnvGen: タスク論理に基づく多様な具現化AI向けシミュレーション環境の生成sim2real2026/1/1
LLMを用いてエージェントのタスク実行論理を解析し、論理的に多様なシミュレーション環境をテストケースとして自動生成する手法を提案。
- 心から手へ:身体性推論による目的志向のロボット制御VLA2025/12/1
視覚言語モデルの推論能力を身体性推論と行動予測へ段階的に拡張し、二腕移動マニピュレータAstribot S1での実機評価で高い性能を示した汎用VLAモデルLumo-1を提案。
- SimTac:生体模倣構造を持つ視覚ベース触覚センシングの物理シミュレータ触覚2025/11/1
生体の触覚構造に着想を得た形状の触覚センサを設計・検証するための物理シミュレータを提案し、物体分類や滑り検出などのSim2Realタスクで有効性を示した。
- DSPv2: 全身移動マニピュレーションのための効果的で汎化可能な高密度ポリシーの改良移動マニピュレーション2025/9/1
3D空間特徴と多視点2D意味特徴を融合する新たなエンコーディングとDense Policyの拡張により、全身移動マニピュレーションの模倣学習における汎化性能と動作生成精度を向上させた。
- 人間らしい全身マニピュレーションによる人間レベルの知能への挑戦全身マニピュレーション2025/7/1
人間の全身動作を模倣して学習するロボット学習スイート「Astribot Suite」を提案し、安全なハードウェア、直感的な遠隔操作インターフェース、全身視覚運動ポリシー学習を統合して、多様な日常タスクでの有効性を示した。
- ControlVLA: 事前学習済み視覚言語行動モデルのための少数ショット物体中心適応VLA2025/6/1
ControlNet風のアーキテクチャで物体中心表現を導入し、10〜20回のデモンストレーションだけで多様な実世界操作タスクに適応できるフレームワークを提案。
- BeSimulator: 大規模言語モデルによるテキストベース行動シミュレータ行動シミュレーション2024/9/1
ロボットの行動論理を検証するため、LLMを用いてテキスト環境で意味レベルの行動シミュレーションを行うフレームワークを提案し、ベンチマークで性能向上を示した。
- Learning Object Bounding Boxes for 3D Instance Segmentation on Point Clouds2019/6/1