Mutual Information Tracks Policy Coherence in Reinforcement Learning

2509.10423v1 cs.AI, cs.LG, cs.RO 2025-09-16

Авторы:

Cameron Reid, Wael Hafez, Amirhossein Nazeri

Резюме на русском

## Контекст Многие современные Reinforcement Learning (RL) системы применяются в реальном времени в сложных и нестабильных средах. Однако эти системы часто сталкиваются с ограничениями, такими как поломки сенсоров, износ актуаторов и изменения окружающей среды. Эти проблемы могут привести к деградации производительности и непредсказуемости поведения агента. Несмотря на развитие методов RL, не существует достаточно эффективных механизмов для диагностики и адаптации во время выполнения. Отсутствие таких механизмов ограничивает широкое развертывание RL в критичных приложениях, где достоверность и надежность критичны. Целью данной работы является разработка информационно-теоретического фреймворка для выявления и мониторинга динамики RL, а также для извлечения практических инсайдов, которые позволят определять и корректировать неполадки в системах RL во время их работы. ## Метод Мы предлагаем информационно-теоретический подход, основанный на измерении взаимной информации (Mutual Information, MI) между состояниями, действиями и следующими состояниями в RL-системах. Исследования проводились в рамках роботизированного контроля, где использовались тестовые задачи для оценки характеристик информационного поведения агента. Мы разработали методы для измерения MI между состоянием и действием (MI(S, A)), а также между состоянием, действием и следующим состоянием (MI(S, A; S')). Эти метрики были использованы для анализа динамики обучения и для выявления недостатков в системе. Для эмпирического обоснования, мы проводили эксперименты, в которых вводили контролируемые помехи в состояниях и действиях, чтобы исследовать диагностическую способность нашего подхода. ## Результаты Наши эксперименты показали, что успешное обучение RL сопровождается очертанием особых информационных сигнатур. Например, MI(S, A) увеличивается во время обучения, что указывает на то, что агент научился выбирать более значимые действия в зависимости от состояния. Однако MI(S, A; S') демонстрирует инвертированный У-образный тренд, начиная с высоких значений в начале обучения и переходя в низкие значения по мере специализации агента, что указывает на переход от широкой эксплуатации к эффективной эксплуатации. Более того, мы продемонстрировали, что информационные метрики позволяют выявлять различные типы ошибок в системе. Например, шум в обзорном пространстве (например, отказ сенсора) приводит к общему снижению всех информационных каналов, в том числе MI(S, A), что указывает на общую деградацию. Напротив, шум в пространстве действий (например, отказ актуатора) оказывает специфич

Abstract

Reinforcement Learning (RL) agents deployed in real-world environments face degradation from sensor faults, actuator wear, and environmental shifts, yet lack intrinsic mechanisms to detect and diagnose these failures. We present an information-theoretic framework that reveals both the fundamental dynamics of RL and provides practical methods for diagnosing deployment-time anomalies. Through analysis of state-action mutual information patterns in a robotic control task, we first demonstrate that successful learning exhibits characteristic information signatures: mutual information between states and actions steadily increases from 0.84 to 2.83 bits (238% growth) despite growing state entropy, indicating that agents develop increasingly selective attention to task-relevant patterns. Intriguingly, states, actions and next states joint mutual information, MI(S,A;S'), follows an inverted U-curve, peaking during early learning before declining as the agent specializes suggesting a transition from broad exploration to efficient exploitation. More immediately actionable, we show that information metrics can differentially diagnose system failures: observation-space, i.e., states noise (sensor faults) produces broad collapses across all information channels with pronounced drops in state-action coupling, while action-space noise (actuator faults) selectively disrupts action-outcome predictability while preserving state-action relationships. This differential diagnostic capability demonstrated through controlled perturbation experiments enables precise fault localization without architectural modifications or performance degradation. By establishing information patterns as both signatures of learning and diagnostic for system health, we provide the foundation for adaptive RL systems capable of autonomous fault detection and policy adjustment based on information-theoretic principles.

Ссылки и действия

Читать на arXiv Скачать PDF

Дополнительные ресурсы:

Mutual Information Tracks Policy Coherence in Reinforcement Learning

Авторы:

Резюме на русском

Abstract

Ссылки и действия

Связанные статьи

Learning Human-Like RL Agents Through Trajectory Optimization With Action Quanti...

TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal ...

Навигация