Taisuke Kobayashi
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ソフトな身体性を活かした最適化トリックによるマルチバウンスドラムロールソフトロボティクス2026/9/8
ソフトロボットドラマーが、叩いた後の引き上げ動作と微小振動という2つのトリックをベイズ最適化で調整し、1ストロークあたりのバウンス回数と音量を高めるドラムロールを実現した論文。
- 効果的なポリシー平滑化のための正則化の再設計強化学習2026/6/1
強化学習におけるポリシー関数の平滑化を効果的に行うため、既存の正則化手法の問題点を特定し、改良した正則化を提案する論文。複数のタスクとアルゴリズムで性能向上と滑らかな動作を実現し、四足ロボットのsim-to-real学習で目標速度の急変に対する頑健性を示した。
- 拡張ベスト・オブ・Nサンプリングによる推論時の柔軟なエンパワーメント強化学習2026/4/17
強化学習において、エンパワーメントを報酬ボーナスとして与える代わりに、ベスト・オブ・Nサンプリングを適用し、探索と活用のバランスを柔軟に調整する手法を提案した。
- 皮膚センサを操作インタフェースに用いるマルチモーダル接触動作分類器触覚2025/7/1
皮膚センサで計測したマルチモーダル触覚時系列をRNNで接触動作に分類し、ロボットの動作プリミティブに対応付ける操作インタフェースを提案。柔軟支持や3軸加速度計の活用など設計条件も明らかにした。
- 変分適応ノイズとドロップアウトによる安定なリカレントニューラルネットワーク模倣学習2025/6/1
RNNの最適化を変分推論として再解釈し、内部状態へのノイズとドロップアウトを統合的に導出するVANDを提案。移動マニピュレータの模倣学習で周期的・連続的な動作の再現に成功した。
- CubeDAgger: 動的システムのための低リスクで効率的な対話型模倣学習模倣学習2025/5/1
動的タスクでも安定性を損なわずに専門家の負担を抑えてロバストな制御方策を学習する対話型模倣学習手法を提案し、実機のスクープ実験で有効性を示した。
- 制御を推論として捉えた時間差分学習におけるウェーバー・フェヒナーの法則強化学習2024/12/1
強化学習のTD誤差と更新量の非線形性に着目し、制御を推論として定式化する枠組みからウェーバー・フェヒナーの法則を導出して、その有用性を示す実装を提案した論文。
- 計算効率を両立する任意の確率方策に向けた制限付き正規化フローの設計強化学習・確率方策2024/12/1
正規化フローを適切に制限して解析的平均を可能にし、二峰性student-t分布をベースに用いることで表現力と計算効率を両立した確率方策Bit-RNFを提案し、強化学習ベンチマークと実機ロボット実験で有効性を示した。
- ドメインを目的として扱う:明示的なマルチドメイン凸被覆集合学習によるドメイン不確実性を考慮した方策最適化sim2real2024/10/1
ドメインランダム化における不確実性を考慮した方策の学習を、各ドメインの性能を独立した目的とみなす多目的強化学習の凸被覆集合問題として再定式化し、より効率的な最適化を可能にした論文。
- LiRA: 実世界のモデルベース強化学習のための軽量ロバスト敵対学習強化学習2024/9/1
変分推論に基づく敵対学習でロバスト性と保守性のバランスを自動調整し、四足ロボットの力反応型歩行制御を2時間未満の実データで学習した。
- Intentionally-underestimated Value Function at Terminal State for Temporal-difference Learning with Mis-designed Reward2023/8/1
- Soft Actor-Critic Algorithm with Truly-satisfied Inequality Constraint2023/3/1
- Reward Bonuses with Gain Scheduling Inspired by Iterative Deepening Search2022/12/21
- Real-time Sampling-based Model Predictive Control based on Reverse Kullback-Leibler Divergence and Its Adaptive Acceleration2022/12/1
- Sparse Representation Learning with Modified q-VAE towards Minimal Realization of World Model2022/8/1
- L2C2: Locally Lipschitz Continuous Constraint towards Stable and Smooth Reinforcement Learning2022/2/1
- Consolidated Adaptive T-soft Update for Deep Reinforcement Learning2022/2/1
- Towards Autonomous Driving of Personal Mobility with Small and Noisy Dataset using Tsallis-statistics-based Behavioral Cloning2021/11/1
- Latent Representation in Human-Robot Interaction with Explicit Consideration of Periodic Dynamics2021/6/1
- Sample-efficient Gear-ratio Optimization for Biomechanical Energy Harvester2021/4/1
- Optimization Algorithm for Feedback and Feedforward Policies towards Robot Control Robust to Sensing Failures2021/4/1
- Mirror-Descent Inverse Kinematics for Box-constrained Joint Space2021/1/1
- Proximal Policy Optimization with Relative Pearson Divergence2020/10/1
- Adaptive and Multiple Time-scale Eligibility Traces for Online Deep Reinforcement Learning2020/8/1
- Towards Deep Robot Learning with Optimizer applicable to Non-stationary Problems2020/7/1
- q-VAE for Disentangled Representation Learning and Latent Dynamical Systems2020/3/1