M-PACE: Mother Child Framework for Multimodal Compliance
2509.15241v1
cs.CV, cs.CL
2025-09-22
Авторы:
Shreyash Verma, Amit Kesari, Vinayak Trivedi, Anupam Purwar, Ratnesh Jamidar
Резюме на русском
## Контекст
Современные платформы и приложения пользуются всемирным распространением, которое определяет высокую степень ответственности за соблюдение соответствия стандартам, законодательству и политикам сообществ. Однако обеспечение соответствия в многомодальных контентах, сочетающих текст, звук и изображения, было сложным и требовало непрерывного внимания от экспертов. Традиционные подходы, основанные на нескольких стадиях и ручных проверках, становятся неэффективными в условиях быстрого роста данных и меняющихся нормативных требований. Особенно выгодно использование многомодальных языковых моделей (MLLMs) для значительного упрощения процесса, объединяя все этапы в единую платформу. Мы предлагаем архитектуру M-PACE, которая не только обеспечивает соответствие, но и снижает затраты на обработку.
## Метод
M-PACE представляет собой инновационную объединенную модель, основанную на модели МLLМ. Используется двухуровневая структура: "родительская" модель (mother MLLM), которая отвечает за основные проверки, и "потомков" (child MLLMs), которые выполняют специализированные задачи. Эта структура эффективно распределяет задачи и снижает необходимость вручную проверять результаты. Модель упрощает анализ визуальных и текстовых элементов в одном проходе, что позволяет уменьшить время обработки и повысить точность. Мы применяем M-PACE к рекламному контенту, где модель оценивает более 15 атрибутов соответствия, включая ограничения во внешнем виде, нецензурные слова и другие аспекты.
## Результаты
Мы проводили тесты на большом наборе данных рекламных объявлений, включая видео, текст и изображения. Модель M-PACE эффективно обрабатывает не только визуальные и текстовые данные, но и звуковые сигналы, если они присутствуют. Мы провели серьезные эксперименты, в том числе использование модели Gemini 2.0 Flash в качестве потомка, которая позволяет снизить затраты на более чем 31 раз по сравнению с моделью Gemini 2.5 Pro, не уменьшая точности. Также мы использовали откорректированные данные с артефактами, такими как визуальные зашумления и нецензурные слова, чтобы проверить модель на реальных условиях.
## Значимость
M-PACE демонстрирует значительные преимущества в цене, эффективности и точности. Она позволяет уменьшить затраты на обработку, а также обеспечивает быстрое реагирование на изменения политик и нормативных требований. Модель может применяться в различных областях, включая рекламу, социальные сети и юридические проверки. Мы также предлагаем бенчмарк для оценки моделей соответствия, чтобы помочь другим исследователям и практикам. Будущ
Abstract
Ensuring that multi-modal content adheres to brand, legal, or
platform-specific compliance standards is an increasingly complex challenge
across domains. Traditional compliance frameworks typically rely on disjointed,
multi-stage pipelines that integrate separate modules for image classification,
text extraction, audio transcription, hand-crafted checks, and rule-based
merges. This architectural fragmentation increases operational overhead,
hampers scalability, and hinders the ability to adapt to dynamic guidelines
efficiently. With the emergence of Multimodal Large Language Models (MLLMs),
there is growing potential to unify these workflows under a single,
general-purpose framework capable of jointly processing visual and textual
content. In light of this, we propose Multimodal Parameter Agnostic Compliance
Engine (M-PACE), a framework designed for assessing attributes across
vision-language inputs in a single pass. As a representative use case, we apply
M-PACE to advertisement compliance, demonstrating its ability to evaluate over
15 compliance-related attributes. To support structured evaluation, we
introduce a human-annotated benchmark enriched with augmented samples that
simulate challenging real-world conditions, including visual obstructions and
profanity injection. M-PACE employs a mother-child MLLM setup, demonstrating
that a stronger parent MLLM evaluating the outputs of smaller child models can
significantly reduce dependence on human reviewers, thereby automating quality
control. Our analysis reveals that inference costs reduce by over 31 times,
with the most efficient models (Gemini 2.0 Flash as child MLLM selected by
mother MLLM) operating at 0.0005 per image, compared to 0.0159 for Gemini 2.5
Pro with comparable accuracy, highlighting the trade-off between cost and
output quality achieved in real time by M-PACE in real life deployment over
advertising data.
Ссылки и действия
Дополнительные ресурсы: