Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
2508.03763v1
cs.CV, cs.AI
2025-08-09
Авторы:
Ziheng Jia, Jiaying Qian, Zicheng Zhang, Zijian Chen, Xiongkuo Min
Резюме на русском
**Резюме**
В статье предлагается Refine-IQA, многоступенчатый подход к рефине-тюнингу для имитации человеческого восприятия качества изображений (IQA). Основная проблема заключается в том, что существующие RFT-методы в IQA обучаются прямо на задаче оценки качества, не уделяя достаточного внимания улучшению собственной визуальной перцепции модели. Это приводит к ограниченной эффективности. Refine-IQA решает эту проблему в двух этапах: в первом этапе создаётся набор данных Refine-Perception-20K с 12 основными дефектами и многозадачными функциями награды для улучшения перцепции; во втором этапе добавляется стратегия управления "think"-процессом с использованием ре wards на основе правдоподобия. Это приводит к значительному повышению качества оценки и восприятия качества изображений. Основные результаты показывают, что предложенное решение достигает значительных улучшений в обоих задачах и активирует сильный «процесс мышления», который оказывается эффективен в задачах интерпретации качества.
Abstract
Reinforcement fine-tuning (RFT) is a proliferating paradigm for LMM training.
Analogous to high-level reasoning tasks, RFT is similarly applicable to
low-level vision domains, including image quality assessment (IQA). Existing
RFT-based IQA methods typically use rule-based output rewards to verify the
model's rollouts but provide no reward supervision for the "think" process,
leaving its correctness and efficacy uncontrolled. Furthermore, these methods
typically fine-tune directly on downstream IQA tasks without explicitly
enhancing the model's native low-level visual quality perception, which may
constrain its performance upper bound. In response to these gaps, we propose
the multi-stage RFT IQA framework (Refine-IQA). In Stage-1, we build the
Refine-Perception-20K dataset (with 12 main distortions, 20,907
locally-distorted images, and over 55K RFT samples) and design multi-task
reward functions to strengthen the model's visual quality perception. In
Stage-2, targeting the quality scoring task, we introduce a probability
difference reward involved strategy for "think" process supervision. The
resulting Refine-IQA Series Models achieve outstanding performance on both
perception and scoring tasks-and, notably, our paradigm activates a robust
"think" (quality interpreting) capability that also attains exceptional results
on the corresponding quality interpreting benchmark.
Ссылки и действия
Дополнительные ресурсы: