Quantum Reinforcement Learning with Dynamic-Circuit Qubit Reuse and Grover-Based Trajectory Optimization
2509.16002v1
quant-ph, cs.LG
2025-09-23
Авторы:
Thet Htar Su, Shaswot Shresthamali, Masaaki Kondo
Резюме на русском
#### Контекст
Исследование сферы квантовых систем в рамках машинного обучения получило значительное развитие в последние годы. Однако существуют существенные технические и ограничительные проблемы, в том числе высокий потребление ресурсов, например, требования к количеству кубитов для реализации конфигурации статичного контроля. Эти проблемы ограничивают практическое применение квантовых систем в решении задач многошагового взаимодействия агента с окружающей средой. Основной мотивацией для разработки данного фреймворка является задача уменьшения потребления ресурсов, оптимизировав использование кубитов за счет использования динамичных квантовых циклических циклов и комбинации квантовых алгоритмов.
#### Метод
Разработанный фреймворк основывается на интеграции трех ключевых компонентов: квантового марковского решающего процесса (Quantum Markov Decision Process, QMDP), динамических квантовых циклических циклов с возможностью циклического ресутка кубитов, и алгоритма Grover для оптимизации траекторий. Квантовые циклические циклы позволяют повторно использовать физические кубиты в течение различных итераций предельного поиска, уменьшая затраты ресурсов. Алгоритм Grover используется для поиска оптимального распределения возможных траекторий, используя суперпозицию всех возможных состояний. Для расчета квантовых траекторий используется квантовая арифметика, что позволяет эффективно вычислять значения награды по траектории.
#### Результаты
На основе разработанной модели производились симуляционные эксперименты, которые позволили подтвердить эффективность динамического квантового подхода. Эксперименты показали, что использование динамических квантовых циклов позволяет уменьшить требования к количеству кубитов на 66% в сравнении с статическими конфигурациями. Была доказана возможность сохранения точности и предсказуемости траекторий, даже при динамическом использовании ресурсов. Результаты проверки на реальном квантовом оборудовании IBM Heron подтвердили надежность работы уменьшенной модели в условиях шума и нестабильности, которые характерны для нынешних интерпретируемых квантовых систем.
#### Значимость
Разработанный фреймворк может быть применен в различных областях, где имеются задачи многошагового взаимодействия с окружающей средой, включая робототехнические системы, игровые системы, а также задачи управления и рекомендации. Он обеспечивает эффективное использование ресурсов, уменьшая требования к кубитам и расходам на энергию. Этот подход имеет потенциал для улучшения масштабируемост
Abstract
A fully quantum reinforcement learning framework is developed that integrates
a quantum Markov decision process, dynamic circuit-based qubit reuse, and
Grover's algorithm for trajectory optimization. The framework encodes states,
actions, rewards, and transitions entirely within the quantum domain, enabling
parallel exploration of state-action sequences through superposition and
eliminating classical subroutines. Dynamic circuit operations, including
mid-circuit measurement and reset, allow reuse of the same physical qubits
across multiple agent-environment interactions, reducing qubit requirements
from 7*T to 7 for T time steps while preserving logical continuity. Quantum
arithmetic computes trajectory returns, and Grover's search is applied to the
superposition of these evaluated trajectories to amplify the probability of
measuring those with the highest return, thereby accelerating the
identification of the optimal policy. Simulations demonstrate that the
dynamic-circuit-based implementation preserves trajectory fidelity while
reducing qubit usage by 66 percent relative to the static design. Experimental
deployment on IBM Heron-class quantum hardware confirms that the framework
operates within the constraints of current quantum processors and validates the
feasibility of fully quantum multi-step reinforcement learning under noisy
intermediate-scale quantum conditions. This framework advances the scalability
and practical application of quantum reinforcement learning for large-scale
sequential decision-making tasks.
Ссылки и действия
Дополнительные ресурсы: