Yiannis Aloimonos
収録論文 63本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 何に注目し、何を保持するか:スキル条件付き視触覚表現と進捗誘導型イベントメモリ触覚2026/9/29
スキルごとに視覚と触覚の役割が変わる点に着目し、スキルで条件付けした融合と過去スキルの終端観測を保持する疎なイベントメモリを組み合わせた視触覚表現を提案。接触が重要なタスクで進捗推定の遅延と誤差を大幅に削減した。
- ForceBand: sEMGを用いた力強い操作の学習マニピュレーション2026/6/1
筋電位センサを搭載したリストバンドで人間の指先の力を推定し、力情報を含むデモンストレーションを生成してロボットの力制御を学習する手法を提案した。
- HumanEgo: 人間の一人称視点動画数分からのゼロショットロボット学習模倣学習2026/5/1
人間の一人称視点動画からロボット操作スキルをゼロショットで転移するフレームワークを提案。手と物体の相互作用をエンティティレベルで表現し、フローマッチングポリシーと補助損失で学習することで、ロボットデータ不要で高効率な学習を実現した。
- FEEL(力強化エゴセントリック学習):物理的行動理解のためのデータセットデータセット/行動理解2026/3/1
圧電抵抗グローブで計測した力データとエゴセントリックビデオを組み合わせた大規模データセットFEELを構築し、接触理解と行動表現学習に応用した。
- 単眼画像からの神経触覚場の再構成触覚2026/2/1
1枚のRGB画像から、接触時の触覚応答を空間的に予測する「神経触覚場」を推定する初の手法を提案し、経路計画と組み合わせて抵抗の低い領域を選んで進む経路生成を可能にした。
- 人工マイクロサッカード補償:オーニソプターのための安定視覚視覚安定化2025/12/1
12-20Hzで振動する尾なしオーニソプターのカメラ映像を、SO(3)上の3D回転最適化によりリアルタイムで歪みなく安定化する手法を開発した。
- EREBUS: 水中環境向けエンドツーエンド堅牢イベントベースシミュレーションイベントカメラ/水中ロボティクス/sim2real2025/11/1
AUV搭載のイベントカメラ向けに、水中環境のリアルな合成データを生成するパイプラインを提案し、低視界・浮遊粒子下での岩石検出タスクで有効性を示した。
- 敵対的ゲーム理論による多指ハンドの把持合成アルゴリズムマニピュレーション2025/11/1
把持生成を2人ゲームとして定式化し、ロボット側と物体の脱出運動を敵対的に競わせることで、外乱に強い多指ハンドの把持姿勢を高速に合成する手法を提案した。
- EmbodiSwap:ゼロショットロボット模倣学習のための身体置換模倣学習2025/10/1
人間の動画にロボットのCGオーバーレイを合成し、V-JEPAを視覚バックボーンに用いることで、実機ロボットのゼロショット模倣学習を実現した研究。
- NavMoE:専門家混合による局所ナビゲーションのためのハイブリッドモデル・学習ベース走行可能性推定ナビゲーション2025/9/1
地形ごとに特化したモデルベースと学習ベースの推定器を専門家として組み合わせ、ゲーティングネットワークで動的に重み付けする走行可能性推定手法を提案。未見環境への汎化と推論効率を両立。
- 巧みな触覚による物体姿勢推定触覚2025/9/1
強化学習でロボットハンドを能動的に動かして触覚データを収集し、物体の形状と姿勢を反復的に推定する手法を提案。
- DREAM: ドメイン認識推論による効率的な自律型水中モニタリング水中ロボット/VLA2025/9/1
VLMを活用し、事前位置情報なしで牡蠣や沈没船などの対象を探索・監視する水中ロボットの自律フレームワークを提案し、従来手法より少ないステップで広範囲をカバーできることを示した。
- ControlTac: 単一参照画像による力と位置を制御した触覚データ拡張触覚2025/5/1
単一の参照触覚画像と接触力・接触位置を条件として、物理的に妥当な触覚画像を生成する2段階の制御可能なフレームワークを提案し、触覚データセットの拡張に有効であることを示した。
- NatSGLD: 自然な人間-ロボットインタラクションにおける音声・ジェスチャ・論理・実演を統合したロボット学習データセットHRIデータセット2025/2/1
人間が自律型と信じて操作したロボットとの対話を記録し、音声・ジェスチャのマルチモーダル指示と実演軌道、線形時相論理式を対応付けたデータセットを構築した。
- 人間行動認識の未来展望:新興技術と倫理的影響の探求行動認識2024/12/1
次世代センサーや合成動画生成、強化学習を活用して人間行動認識の課題を克服する方向性と、研究における倫理的課題を論じた展望論文。
- 視覚的場所認識における新興トレンドと研究機会の探求VLA2024/11/1
ロボットの自己位置推定やSLAMで重要となる視覚的場所認識について、Vision-Languageモデルなど最近の研究動向と今後の機会を概観したサーベイ。
- 触覚フィードバックによる極値探索制御ウィグリング挿入触覚2024/10/1
GelSight Miniセンサのひずみを最小化しながら挿入深さを最大化するようエンドエフェクタをウィグリングさせる極値探索制御則を提案し、鍵や組立タスクで高い成功率を達成した。
- FeelAnyForce: 視覚ベース触覚センサの触感から接触力フィードバックを推定触覚2024/10/1
視覚ベース触覚センサを用いて任意物体への3D接触力(最大15N)を推定するマルチヘッドトランスフォーマを提案し、未見物体で平均絶対誤差4%を達成、他センサへのキャリブレーション手法も示した。
- 身体性に基づく視覚運動表現身体性知能2024/10/1
外部単位のキャリブレーションなしに、行動に基づく距離感覚を学習し、障害物回避やギャップ跳躍を実現する手法を提案。
- ODYSSEE: エッジ電子機器上のセンサシステムによるカキ検出水中ロボティクス2024/9/1
Stable Diffusionで実データを水増しし、YOLOv10ベースのモデルを水中ロボットのエッジ環境で動かしてカキを検出、mAP@50 0.657を達成した研究。
- 知覚行動APIと大規模言語モデルによる物体属性の発見VLA2024/9/1
視覚言語モデルと大規模言語モデルを組み合わせた知覚行動APIを提案し、ロボットが能動的な知覚を通じて物体の重さなどの非視覚的属性を検出できるようにした。
- ViewActive: 単一画像からの能動的視点最適化視点最適化2024/9/1
1枚の2D画像から3D視点品質場を予測し、ロボットが最適な観測視点を能動的に選べるようにする軽量ネットワークを提案。
- Air-FAR: 大規模複雑未知環境における航空ナビゲーションのための高速で適応的な経路計画経路計画2024/9/1
階層的3D可視性グラフを用いて、大規模で複雑な未知環境をリアルタイムに飛行する経路計画手法を提案し、従来手法より大幅に高速かつ効率的な経路生成を実現した。
- 自律型UAVによる能動的人間姿勢推定姿勢推定2024/7/1
ドローンが自ら視点を移動し、遮蔽を避けて人間の姿勢推定精度を高めるシステムを提案。NeRFによるデータ生成、視点誤差推定ネットワーク、飛行計画を組み合わせる。
- 符号化視覚オドメトリ:CodedVO視覚オドメトリ2024/7/1
独自の光学系で画像に実スケールの奥行き情報を物理的に埋め込み、単眼視覚オドメトリのスケール曖昧性を解消する手法を提案。屋内環境で平均軌道誤差0.08mを達成。
- マイクロサッカードに着想を得たロボティクス用イベントカメライベントカメラ2024/5/1
回転ウェッジプリズムをイベントカメラの前に取り付け、マイクロサッカードのように光を振ることで、動きに平行なエッジも安定して捉えられる新しい視覚システムを開発した。
- Interactive-FAR: 複雑未知環境における可動障害物を考慮した対話的・高速・適応的経路計画ナビゲーション2024/4/1
未知環境で可動障害物を押しのけながらナビゲーションするリアルタイム経路計画アルゴリズムを提案し、従来手法より33%の移動時間短縮と49%の経路効率向上を実現した。
- NatSGD: 音声・ジェスチャー・実演を統合した自然なヒューマンロボットインタラクション学習データセットVLA2024/3/1
音声とジェスチャーによる人間の指示とロボットの実演を同期させたマルチモーダルHRIデータセットを構築し、マルチモーダル指示からのタスク理解学習における有効性を示した。
- MARVIS: 動きと幾何学を考慮した実像・虚像セグメンテーションセグメンテーション2024/3/1
水面での反射・屈折による実像と虚像を、動きと幾何学の情報を活用して高精度に領域分割する手法を提案し、シミュレーションと実世界の両方で再学習なしに機能することを示した。
- LEAP: LLM-Generation of Egocentric Action Programs2023/12/1
- Cook2LTL: Translating Cooking Recipes to LTL Formulae using Large Language Models2023/10/1
- AcTExplore: Active Tactile Exploration of Unknown Objects2023/10/1
- UIVNAV: Underwater Information-driven Vision-based Navigation via Imitation Learning2023/9/1
- Whale Detection Enhancement through Synthetic Satellite Images2023/8/1
- ChatSim: Underwater Simulation with Natural Language Prompting2023/8/1
- Detecting Olives with Synthetic or Real Data? Olive the Above2023/8/1
- Considerations for Minimizing Data Collection Biases for Eliciting Natural Behavior in Human-Robot Interaction2023/4/1
- WorldGen: A Large Scale Generative Simulator2022/10/1
- OysterSim: Underwater Simulation for Enhancing Oyster Reef Monitoring2022/9/1
- EVIMO2: An Event Camera Dataset for Motion Segmentation, Optical Flow, Structure from Motion, and Visual Inertial Odometry in Indoor Scenes with Monocular or Stereo Algorithms2022/5/1
- GradTac: Spatio-Temporal Gradient Based Tactile Sensing2022/3/1
- TTCDist: Fast Distance Estimation From an Active Monocular Camera Using Time-to-Contact2022/3/1
- DiffPoseNet: Direct Differentiable Camera Pose Estimation2022/3/1
- NudgeSeg: Zero-Shot Object Segmentation by Repeated Physical Interaction2021/9/1
- EVPropNet: Detecting Drones By Finding Propellers For Mid-Air Landing And Following2021/6/1
- Detecting and Counting Oysters2021/5/1
- SpikeMS: Deep Spiking Neural Network for Motion Segmentation2021/5/1
- Grasping in the Dark: Zero-Shot Object Grasping Using Tactile Feedback2020/11/1
- MorphEyes: Variable Baseline Stereo For Quadrotor Navigation2020/11/1
- Egocentric Object Manipulation Graphs2020/6/1
- PRGFlow: Benchmarking SWAP-Aware Unified Deep Visual Inertial Odometry2020/6/1
- EVDodgeNet: Deep Dynamic Obstacle Dodging with Event Cameras2019/6/1
- Computational Tactile Flow for Anthropomorphic Grippers2019/3/1
- Topology-Aware Non-Rigid Point Cloud Registration2018/11/1
- Unsupervised Learning of Dense Optical Flow, Depth and Egomotion from Sparse Event Data2018/9/1
- cilantro: A Lean, Versatile, and Efficient Library for Point Cloud Data Processing2018/7/1
- Extracting Contact and Motion from Manipulation Videos2018/7/1
- SalientDSO: Bringing Attention to Direct Sparse Odometry2018/3/1
- GapFlyt: Active Vision Based Minimalist Structure-less Gap Detection For Quadrotor Flight2018/2/1
- Revisiting Active Perception2016/3/1
- What Can I Do Around Here? Deep Functional Scene Understanding for Cognitive Robots2016/2/1
- Neural Self Talk: Image Understanding via Continuous Questioning and Answering2015/12/1
- Learning the Semantics of Manipulation Action2015/12/1