Jeffrin Sam
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AgenticFocus: 人間の一人称視点ビデオからの物体保持型MR合成による器用なヒューマノイド学習模倣学習2026/7/1
人間の一人称視点ビデオから、隠れた物体の形状復元と手の動きの再構築を行い、ヒューマノイドロボットの学習用デモを生成するMR合成パイプラインを提案した。
- 出力レベル正則化が単一GPU VLAファインチューニングにおけるシード抽選問題を解消するVLA2026/6/1
VLAモデルのファインチューニングで、ランダムシードによって成功率が大きく低下する「シード抽選」問題を発見し、出力レベルの正則化(VICReg、Dropout、学習率減衰)がこの問題を完全に解消することを示した論文。
- アクションエージェント:エージェント型ビデオ生成とフロー制約拡散の融合ナビゲーション2026/5/1
LLMによるビデオ生成とフロー制約拡散モデルを組み合わせ、複数のロボット形態でナビゲーションを実現する2段階フレームワークを提案した。
- GenerativeMPC: VLM-RAGガイドによる仮想インピーダンスを用いた全身MPCによる双腕移動マニピュレーションマニピュレーション2026/4/1
視覚言語モデルと検索拡張生成を用いて、双腕移動マニピュレータの全身MPCの制御パラメータ(速度制限や安全マージン、仮想インピーダンス)を文脈に応じて調整する階層的フレームワークを提案した。
- DreamToNav: 生成ビデオ計画によるロボットの汎用ナビゲーションナビゲーション2026/3/1
生成ビデオモデルを計画エンジンとして使い、自然言語指示からロボットの動作を合成し、その映像から軌道を抽出して実機で実行するナビゲーションフレームワークを提案した。
- DiffusionAnything: 統一ナビゲーションと把持前動作のためのエンドツーエンド・インコンテキスト拡散学習VLA/ナビゲーション/マニピュレーション2026/3/1
RGB画像のみから、メートル規模のナビゲーションとセンチメートル規模のマニピュレーションを単一モデルで計画する拡散ポリシーを提案。タスクごとに5分の自己教師ありデータで学習し、未知シーンへのゼロショット汎化を実現する。
- 拡散モデルによるテキスト指示からの空撮シネマトグラフィドローン制御2026/1/1
自然言語の指示と機体カメラの初期画像から拡散モデルで飛行軌道を生成し、ドローンが自動でシネマティックな映像を撮影するシステムを提案した。
- DroneVLA:視覚言語行動モデルによる空中マニピュレーションVLA2026/1/1
自然言語の指示を理解するVLAモデルとGrounding DINOを組み合わせ、1自由度グリッパ付きドローンが対象物を把持し人へ受け渡すシステムを構築した。実機実験で位置推定・ナビゲーションの精度を検証した。
- Glove2UAV: 直感的なUAV操作のためのウェアラブルIMUグローブウェアラブル操作インターフェース2026/1/1
手と指のジェスチャーでUAVを直感的に操作するIMUグローブを開発し、速度閾値超過時に振動触覚警告を提示する。シミュレーションと実機飛行でリアルタイム性とコマンド実行の安定性を検証した。
- SafeHumanoid: VLMとRAGによる人型ロボット上半身インピーダンス制御ヒューマンロボットインタラクション2025/11/1
視覚言語モデルと検索拡張生成を組み合わせ、周囲の状況や人間との距離に応じて人型ロボットのインピーダンスと速度を調整する制御パイプラインを提案し、安全性の向上を実証した。
- YawSitter: ヨー制御を強化したテールシッターUAVのモデリングと制御飛行制御2025/10/1
差動推力によるプロペラ後流の影響をモデル化し、ロール結合なしでヨーによる横方向位置制御を可能にするテールシッターUAVの新手法を提案・検証した。
- PhysicalAgent:基盤世界モデルによる汎用認知ロボティクスの実現VLA2025/9/1
テキスト指示から拡散モデルで動画デモを生成し、ロボットで実行・失敗時に再計画する反復ループで、多様なロボットのマニピュレーション成功率を最大80%まで高めた。
- UAV-CodeAgents: マルチエージェントReActと視覚言語推論によるスケーラブルなUAVミッション計画VLA2025/5/1
LLM/VLMを活用したマルチエージェントフレームワークで、衛星画像と自然言語指示からUAVのミッションを自動生成し、火災検知タスクで93%の成功率を達成した。