SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
2509.16548v1
cs.LG, cs.CL
2025-09-24
Авторы:
Yuyang Ding, Xinyu Shi, Juntao Li, Xiaobo Liang, Zhaopeng Tu, Min Zhang
Резюме на русском
#### **Контекст**
Process reward models (PRMs) представляют собой мощный инструмент для тонкой оценки результатов подкрепления в процессах, обеспечивая глубокий рассужденческий подход в обучении бо LLM. Однако их развитие сталкивается с тем, что получение высококачественных данных для обучения требует больших вложений и времени. Обычные методы, основанные на Monte Carlo (MC), хотя и позволяют генерировать синтетические данные, имеют высокий уровень шума, что приводит к переобучению и снижению эффективности обучения. Наша мотивация заключается в разработке метода, способного обрабатывать помехи в синтетических данных и масштабироваться для эффективного обучения PRMs.
#### **Метод**
Мы предлагаем Self-Denoising Monte Carlo Annotation (SCAN) — рамку для синтеза данных и устойчивого обучения, которая адресует проблемы шума в синтетических данных MC. Мы определили, что модели аннотации часто искажают правильность шагов, порождая шум. SCAN использует самонадлежащую стратегию самокоррекции, позволяющую более точно оценивать корректность шагов. Мы архитектурно оптимизировали модель, достигнув эффективности и высокого качества, даже при использовании небольших моделей (например, 1.5B параметров).
#### **Результаты**
Наши эксперименты показали, что SCAN достигает выдающихся результатов. Когда применяется 1.5B-параметровая модель, она показывает сравнимое качество с моделями, обученными на больших объемах человеческих данных, но с 6% затрат на инференс по сравнению с ванильным MC. На ProcessBench мы получили F1-результат 59.1, что является значительным ростом по сравнению с базовым результатом 19.9. Благодаря мощности SCAN, PRMs смогут обучаться с меньшими затратами и более высоким качеством, даже при масштабировании.
#### **Значимость**
Проработанная стратегия позволяет применять SCAN в различных областях, где требуются точные оценки процессов, такие как математическое моделирование, программирование и диагностика. Наш подход обеспечивает значительные преимущества, включая экономию ресурсов и увеличение точности. Мы видим будущее развитие SCAN в плане увеличения масштаба и улучшения моделей PRM, что будет влиять на развитие широкого спектра задач.
#### **Выводы**
Мы успешно разработали SCAN, эффективный метод для синтеза данных и обучения устойчивых PRMs. Наши результаты указывают на высокую эффективность и масштабируемость SCAN, даже при ограниченных ресурсах. Мы планируем дальнейшие исследования по улучшению точности моделей PRM и их применению в новых, требующих точности задачах.
Abstract
Process reward models (PRMs) offer fine-grained, step-level evaluations that
facilitate deeper reasoning processes in large language models (LLMs), proving
effective in complex tasks like mathematical reasoning. However, developing
PRMs is challenging due to the high cost and limited scalability of
human-annotated data. Synthetic data from Monte Carlo (MC) estimation is a
promising alternative but suffers from a high noise ratio, which can cause
overfitting and hinder large-scale training. In this work, we conduct a
preliminary study on the noise distribution in synthetic data from MC
estimation, identifying that annotation models tend to both underestimate and
overestimate step correctness due to limitations in their annotation
capabilities. Building on these insights, we propose Self-Denoising Monte Carlo
Annotation (SCAN), an efficient data synthesis and noise-tolerant learning
framework. Our key findings indicate that: (1) Even lightweight models (e.g.,
1.5B parameters) can produce high-quality annotations through a self-denoising
strategy, enabling PRMs to achieve superior performance with only 6% the
inference cost required by vanilla MC estimation. (2) With our robust learning
strategy, PRMs can effectively learn from this weak supervision, achieving a
39.2 F1 score improvement (from 19.9 to 59.1) in ProcessBench. Despite using
only a compact synthetic dataset, our models surpass strong baselines,
including those trained on large-scale human-annotated datasets such as
PRM800K. Furthermore, performance continues to improve as we scale up the
synthetic data, highlighting the potential of SCAN for scalable,
cost-efficient, and robust PRM training.
Ссылки и действия
Дополнительные ресурсы: