Categorical Policies: Multimodal Policy Learning and Exploration in Continuous Control
2508.13922v1
cs.LG, cs.AI
2025-08-21
Авторы:
SM Mazharul Islam, Manfred Huber
Резюме на русском
#### Контекст
Углубленное управление глубоким оптимизатором при поддержке нейронных сетей (Deep Reinforcement Learning, DRL) широко применяется для решения задач подбора решений в системах с нетривиальными переменными. Однако существующие подходы, опирающиеся на политики, описываемые нормальной (гауссовой) распределением, ограничиваются унимодальностью. Это ограничивает возможности эффективного исследования среды и стратегического адаптирования. Эти проблемы значительно усиливаются в области непрерывного управления, где допустимые действия обычно представляют собой многообразие стратегий. Особенно важное влияние имеет ситуация, когда внешние факторы требуют многовариантного поведения. Таким образом, есть необходимость в развитии моделей, позволяющих выражать многомерность поведения на всех стадиях обучения.
#### Метод
Мы предлагаем "Категориальные политики" (Categorical Policies), которые описывают многомодальное поведение с помощью категориального распределения, представляющего возможные режимы поведения. Для каждого режима сеть генерирует выходное действие с учетом выбранного режима. Для обеспечения непрерывности и дифференцируемости мы используем два способа семплирования: семплирование с гаассианской интерполяцией и семплирование с возвратом к среднему. Эти техники позволяют сохранить точность и эффективность алгоритмов градиентного подбора. Мы также реализуем комбинацию градиентного семплирования и управления многоканальной информацией для оптимизации и повышения затратных ресурсов.
#### Результаты
Мы проверили нашу модель на среде DeepMind Control Suite, представляющей собой коллекцию задач в непрерывном пространстве действий, таких как ходьба, прыжки и другие сложные движения. Наши эксперименты показали, что "Категориальные политики" позволяют значительно улучшить эффективность исследования среды, что приводит к быстрейшему получению оптимальных решений и высокой стабильности работы. Это продемонстрировано с помощью сравнения с решениями на основе нормальных распределений. Мы также продемонстрировали, что наш подход лучше справляется с задачами, требующими стратегического адаптирования, такими как задачи с малым количеством вознаграждений.
#### Значимость
Наш подход имеет широкие применения в области искусственного интеллекта и управления, в том числе в системах робототехники, играх с подвижными субъектами, автоматизированному управлению и даже в задачах оптимизации в жизнеспособных системах. Значительным преимуществом является улучшение эффективности обучения, благодаря более широкой экспериментальной поддержке и стратегич
Abstract
A policy in deep reinforcement learning (RL), either deterministic or
stochastic, is commonly parameterized as a Gaussian distribution alone,
limiting the learned behavior to be unimodal. However, the nature of many
practical decision-making problems favors a multimodal policy that facilitates
robust exploration of the environment and thus to address learning challenges
arising from sparse rewards, complex dynamics, or the need for strategic
adaptation to varying contexts. This issue is exacerbated in continuous control
domains where exploration usually takes place in the vicinity of the predicted
optimal action, either through an additive Gaussian noise or the sampling
process of a stochastic policy. In this paper, we introduce Categorical
Policies to model multimodal behavior modes with an intermediate categorical
distribution, and then generate output action that is conditioned on the
sampled mode. We explore two sampling schemes that ensure differentiable
discrete latent structure while maintaining efficient gradient-based
optimization. By utilizing a latent categorical distribution to select the
behavior mode, our approach naturally expresses multimodality while remaining
fully differentiable via the sampling tricks. We evaluate our multimodal policy
on a set of DeepMind Control Suite environments, demonstrating that through
better exploration, our learned policies converge faster and outperform
standard Gaussian policies. Our results indicate that the Categorical
distribution serves as a powerful tool for structured exploration and
multimodal behavior representation in continuous control.
Ссылки и действия
Дополнительные ресурсы: