GCond: Gradient Conflict Resolution via Accumulation-based Stabilization for Large-Scale Multi-Task Learning

2509.07252v1 cs.LG, cs.CV 2025-09-11
Авторы:

Evgeny Alves Limarenko, Anastasiia Alexandrovna Studenikina

Резюме на русском

## Контекст В области многозадачного обучения (Multi-Task Learning, MTL) существуют значительные вызовы, в том числе конфликт градиентов (gradient conflict), когда разные задачи делают свой вклад в обучение с разными темпами и направлениями. Это приводит к неэффективному обучению и повышению потребления ресурсов. Традиционные методы, такие как PCGrad, CAGrad и GradNorm, показали эффективность в меньших моделях, но требуют высокой вычислительной сложности, что ограничивает их применение в современных больших моделях и трансформерах. Наша мотивация заключается в разработке метода, устраняющего этот конфликт с меньшим расходом ресурсов, чтобы расширить границы применения многозадачного обучения в масштабных моделях. ## Метод Мы предлагаем Gradient Conductor (GCond), новый метод для решения конфликта градиентов. GCond сочетает принципы PCGrad с техникой аккумуляции градиентов и адаптивным механизмом арбитража. Это позволяет эффективно решать конфликты градиентов, сохраняя высокую эффективность вычислений. Метод был реализован с использованием градиентной аккумуляции для уменьшения вычислительной нагрузки и адаптивным методом решения конфликтов, чтобы обеспечить более стабильное обучение. GCond нацелен на уменьшение количества вычислительных операций, необходимых для решения конфликта, что делает его применимым в больших моделях. ## Результаты Мы провести эксперименты с GCond на двух наборах данных: ImageNet 1K и наборе данных из сканов головных и шейных травм. Мы сравнили GCond с оригинальными методами, такими как PCGrad, CAGrad и GradNorm, а также с линейными комбинациями градиентов. GCond показал значительный выигрыш в скорости вычислений — до двух раз по сравнению с базовыми методами. Он также показал лучшую эффективность в задачах обучения, достигнув низких значений L1 и SSIM-потерь. Эти результаты доказывают высокую эффективность GCond в решении ключевых проблем многозадачного обучения в больших моделях. ## Значимость GCond может быть применен в различных областях, где требуется многозадачное обучение, таких как обработка изображений, текстовое понимание и синтез речи. Он предоставляет выгоду в скорости обучения и качестве решения задач, что делает его привлекательным для применения в моделях с большим масштабом. Этот метод также может помочь уменьшить расходы на ресурсы во время обучения, что имеет преимущества для мобильных устройств и ресурсораспределенных систем. ## Выводы Мы представили GCond, новую методику для устранения конфликтов градиентов в многозадачном обучении. Этот метод демонстрирует высокую эффективность и скорость работы, эксперименты показали его превосходство по сравнению с базовыми методами. Будущи

Abstract

In multi-task learning (MTL), gradient conflict poses a significant challenge. Effective methods for addressing this problem, including PCGrad, CAGrad, and GradNorm, in their original implementations are computationally demanding, which significantly limits their application in modern large models and transformers. We propose Gradient Conductor (GCond), a method that builds upon PCGrad principles by combining them with gradient accumulation and an adaptive arbitration mechanism. We evaluated GCond on self-supervised learning tasks using MobileNetV3-Small and ConvNeXt architectures on the ImageNet 1K dataset and a combined head and neck CT scan dataset, comparing the proposed method against baseline linear combinations and state-of-the-art gradient conflict resolution methods. The stochastic mode of GCond achieved a two-fold computational speedup while maintaining optimization quality, and demonstrated superior performance across all evaluated metrics, achieving lower L1 and SSIM losses compared to other methods on both datasets. GCond exhibited high scalability, being successfully applied to both compact models (MobileNetV3-Small) and large architectures (ConvNeXt-tiny and ConvNeXt-Base). It also showed compatibility with modern optimizers such as AdamW and Lion/LARS. Therefore, GCond offers a scalable and efficient solution to the problem of gradient conflicts in multi-task learning.

Ссылки и действия