SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning

2509.16548v1 cs.LG, cs.CL 2025-09-24
Авторы:

Yuyang Ding, Xinyu Shi, Juntao Li, Xiaobo Liang, Zhaopeng Tu, Min Zhang

Резюме на русском

#### **Контекст** Process reward models (PRMs) представляют собой мощный инструмент для тонкой оценки результатов подкрепления в процессах, обеспечивая глубокий рассужденческий подход в обучении бо LLM. Однако их развитие сталкивается с тем, что получение высококачественных данных для обучения требует больших вложений и времени. Обычные методы, основанные на Monte Carlo (MC), хотя и позволяют генерировать синтетические данные, имеют высокий уровень шума, что приводит к переобучению и снижению эффективности обучения. Наша мотивация заключается в разработке метода, способного обрабатывать помехи в синтетических данных и масштабироваться для эффективного обучения PRMs. #### **Метод** Мы предлагаем Self-Denoising Monte Carlo Annotation (SCAN) — рамку для синтеза данных и устойчивого обучения, которая адресует проблемы шума в синтетических данных MC. Мы определили, что модели аннотации часто искажают правильность шагов, порождая шум. SCAN использует самонадлежащую стратегию самокоррекции, позволяющую более точно оценивать корректность шагов. Мы архитектурно оптимизировали модель, достигнув эффективности и высокого качества, даже при использовании небольших моделей (например, 1.5B параметров). #### **Результаты** Наши эксперименты показали, что SCAN достигает выдающихся результатов. Когда применяется 1.5B-параметровая модель, она показывает сравнимое качество с моделями, обученными на больших объемах человеческих данных, но с 6% затрат на инференс по сравнению с ванильным MC. На ProcessBench мы получили F1-результат 59.1, что является значительным ростом по сравнению с базовым результатом 19.9. Благодаря мощности SCAN, PRMs смогут обучаться с меньшими затратами и более высоким качеством, даже при масштабировании. #### **Значимость** Проработанная стратегия позволяет применять SCAN в различных областях, где требуются точные оценки процессов, такие как математическое моделирование, программирование и диагностика. Наш подход обеспечивает значительные преимущества, включая экономию ресурсов и увеличение точности. Мы видим будущее развитие SCAN в плане увеличения масштаба и улучшения моделей PRM, что будет влиять на развитие широкого спектра задач. #### **Выводы** Мы успешно разработали SCAN, эффективный метод для синтеза данных и обучения устойчивых PRMs. Наши результаты указывают на высокую эффективность и масштабируемость SCAN, даже при ограниченных ресурсах. Мы планируем дальнейшие исследования по улучшению точности моделей PRM и их применению в новых, требующих точности задачах.

Abstract

Process reward models (PRMs) offer fine-grained, step-level evaluations that facilitate deeper reasoning processes in large language models (LLMs), proving effective in complex tasks like mathematical reasoning. However, developing PRMs is challenging due to the high cost and limited scalability of human-annotated data. Synthetic data from Monte Carlo (MC) estimation is a promising alternative but suffers from a high noise ratio, which can cause overfitting and hinder large-scale training. In this work, we conduct a preliminary study on the noise distribution in synthetic data from MC estimation, identifying that annotation models tend to both underestimate and overestimate step correctness due to limitations in their annotation capabilities. Building on these insights, we propose Self-Denoising Monte Carlo Annotation (SCAN), an efficient data synthesis and noise-tolerant learning framework. Our key findings indicate that: (1) Even lightweight models (e.g., 1.5B parameters) can produce high-quality annotations through a self-denoising strategy, enabling PRMs to achieve superior performance with only 6% the inference cost required by vanilla MC estimation. (2) With our robust learning strategy, PRMs can effectively learn from this weak supervision, achieving a 39.2 F1 score improvement (from 19.9 to 59.1) in ProcessBench. Despite using only a compact synthetic dataset, our models surpass strong baselines, including those trained on large-scale human-annotated datasets such as PRM800K. Furthermore, performance continues to improve as we scale up the synthetic data, highlighting the potential of SCAN for scalable, cost-efficient, and robust PRM training.

Ссылки и действия