GCond: Gradient Conflict Resolution via Accumulation-based Stabilization for Large-Scale Multi-Task Learning
2509.07252v1
cs.LG, cs.CV
2025-09-11
Авторы:
Evgeny Alves Limarenko, Anastasiia Alexandrovna Studenikina
Резюме на русском
## Контекст
В области многозадачного обучения (Multi-Task Learning, MTL) существуют значительные вызовы, в том числе конфликт градиентов (gradient conflict), когда разные задачи делают свой вклад в обучение с разными темпами и направлениями. Это приводит к неэффективному обучению и повышению потребления ресурсов. Традиционные методы, такие как PCGrad, CAGrad и GradNorm, показали эффективность в меньших моделях, но требуют высокой вычислительной сложности, что ограничивает их применение в современных больших моделях и трансформерах. Наша мотивация заключается в разработке метода, устраняющего этот конфликт с меньшим расходом ресурсов, чтобы расширить границы применения многозадачного обучения в масштабных моделях.
## Метод
Мы предлагаем Gradient Conductor (GCond), новый метод для решения конфликта градиентов. GCond сочетает принципы PCGrad с техникой аккумуляции градиентов и адаптивным механизмом арбитража. Это позволяет эффективно решать конфликты градиентов, сохраняя высокую эффективность вычислений. Метод был реализован с использованием градиентной аккумуляции для уменьшения вычислительной нагрузки и адаптивным методом решения конфликтов, чтобы обеспечить более стабильное обучение. GCond нацелен на уменьшение количества вычислительных операций, необходимых для решения конфликта, что делает его применимым в больших моделях.
## Результаты
Мы провести эксперименты с GCond на двух наборах данных: ImageNet 1K и наборе данных из сканов головных и шейных травм. Мы сравнили GCond с оригинальными методами, такими как PCGrad, CAGrad и GradNorm, а также с линейными комбинациями градиентов. GCond показал значительный выигрыш в скорости вычислений — до двух раз по сравнению с базовыми методами. Он также показал лучшую эффективность в задачах обучения, достигнув низких значений L1 и SSIM-потерь. Эти результаты доказывают высокую эффективность GCond в решении ключевых проблем многозадачного обучения в больших моделях.
## Значимость
GCond может быть применен в различных областях, где требуется многозадачное обучение, таких как обработка изображений, текстовое понимание и синтез речи. Он предоставляет выгоду в скорости обучения и качестве решения задач, что делает его привлекательным для применения в моделях с большим масштабом. Этот метод также может помочь уменьшить расходы на ресурсы во время обучения, что имеет преимущества для мобильных устройств и ресурсораспределенных систем.
## Выводы
Мы представили GCond, новую методику для устранения конфликтов градиентов в многозадачном обучении. Этот метод демонстрирует высокую эффективность и скорость работы, эксперименты показали его превосходство по сравнению с базовыми методами. Будущи
Abstract
In multi-task learning (MTL), gradient conflict poses a significant
challenge. Effective methods for addressing this problem, including PCGrad,
CAGrad, and GradNorm, in their original implementations are computationally
demanding, which significantly limits their application in modern large models
and transformers. We propose Gradient Conductor (GCond), a method that builds
upon PCGrad principles by combining them with gradient accumulation and an
adaptive arbitration mechanism. We evaluated GCond on self-supervised learning
tasks using MobileNetV3-Small and ConvNeXt architectures on the ImageNet 1K
dataset and a combined head and neck CT scan dataset, comparing the proposed
method against baseline linear combinations and state-of-the-art gradient
conflict resolution methods. The stochastic mode of GCond achieved a two-fold
computational speedup while maintaining optimization quality, and demonstrated
superior performance across all evaluated metrics, achieving lower L1 and SSIM
losses compared to other methods on both datasets. GCond exhibited high
scalability, being successfully applied to both compact models
(MobileNetV3-Small) and large architectures (ConvNeXt-tiny and ConvNeXt-Base).
It also showed compatibility with modern optimizers such as AdamW and
Lion/LARS. Therefore, GCond offers a scalable and efficient solution to the
problem of gradient conflicts in multi-task learning.
Ссылки и действия
Дополнительные ресурсы: