M-PACE: Mother Child Framework for Multimodal Compliance

2509.15241v1 cs.CV, cs.CL 2025-09-22

Авторы:

Shreyash Verma, Amit Kesari, Vinayak Trivedi, Anupam Purwar, Ratnesh Jamidar

Резюме на русском

## Контекст Современные платформы и приложения пользуются всемирным распространением, которое определяет высокую степень ответственности за соблюдение соответствия стандартам, законодательству и политикам сообществ. Однако обеспечение соответствия в многомодальных контентах, сочетающих текст, звук и изображения, было сложным и требовало непрерывного внимания от экспертов. Традиционные подходы, основанные на нескольких стадиях и ручных проверках, становятся неэффективными в условиях быстрого роста данных и меняющихся нормативных требований. Особенно выгодно использование многомодальных языковых моделей (MLLMs) для значительного упрощения процесса, объединяя все этапы в единую платформу. Мы предлагаем архитектуру M-PACE, которая не только обеспечивает соответствие, но и снижает затраты на обработку. ## Метод M-PACE представляет собой инновационную объединенную модель, основанную на модели МLLМ. Используется двухуровневая структура: "родительская" модель (mother MLLM), которая отвечает за основные проверки, и "потомков" (child MLLMs), которые выполняют специализированные задачи. Эта структура эффективно распределяет задачи и снижает необходимость вручную проверять результаты. Модель упрощает анализ визуальных и текстовых элементов в одном проходе, что позволяет уменьшить время обработки и повысить точность. Мы применяем M-PACE к рекламному контенту, где модель оценивает более 15 атрибутов соответствия, включая ограничения во внешнем виде, нецензурные слова и другие аспекты. ## Результаты Мы проводили тесты на большом наборе данных рекламных объявлений, включая видео, текст и изображения. Модель M-PACE эффективно обрабатывает не только визуальные и текстовые данные, но и звуковые сигналы, если они присутствуют. Мы провели серьезные эксперименты, в том числе использование модели Gemini 2.0 Flash в качестве потомка, которая позволяет снизить затраты на более чем 31 раз по сравнению с моделью Gemini 2.5 Pro, не уменьшая точности. Также мы использовали откорректированные данные с артефактами, такими как визуальные зашумления и нецензурные слова, чтобы проверить модель на реальных условиях. ## Значимость M-PACE демонстрирует значительные преимущества в цене, эффективности и точности. Она позволяет уменьшить затраты на обработку, а также обеспечивает быстрое реагирование на изменения политик и нормативных требований. Модель может применяться в различных областях, включая рекламу, социальные сети и юридические проверки. Мы также предлагаем бенчмарк для оценки моделей соответствия, чтобы помочь другим исследователям и практикам. Будущ

Abstract

Ensuring that multi-modal content adheres to brand, legal, or platform-specific compliance standards is an increasingly complex challenge across domains. Traditional compliance frameworks typically rely on disjointed, multi-stage pipelines that integrate separate modules for image classification, text extraction, audio transcription, hand-crafted checks, and rule-based merges. This architectural fragmentation increases operational overhead, hampers scalability, and hinders the ability to adapt to dynamic guidelines efficiently. With the emergence of Multimodal Large Language Models (MLLMs), there is growing potential to unify these workflows under a single, general-purpose framework capable of jointly processing visual and textual content. In light of this, we propose Multimodal Parameter Agnostic Compliance Engine (M-PACE), a framework designed for assessing attributes across vision-language inputs in a single pass. As a representative use case, we apply M-PACE to advertisement compliance, demonstrating its ability to evaluate over 15 compliance-related attributes. To support structured evaluation, we introduce a human-annotated benchmark enriched with augmented samples that simulate challenging real-world conditions, including visual obstructions and profanity injection. M-PACE employs a mother-child MLLM setup, demonstrating that a stronger parent MLLM evaluating the outputs of smaller child models can significantly reduce dependence on human reviewers, thereby automating quality control. Our analysis reveals that inference costs reduce by over 31 times, with the most efficient models (Gemini 2.0 Flash as child MLLM selected by mother MLLM) operating at 0.0005 per image, compared to 0.0159 for Gemini 2.5 Pro with comparable accuracy, highlighting the trade-off between cost and output quality achieved in real time by M-PACE in real life deployment over advertising data.

Ссылки и действия

Читать на arXiv Скачать PDF

Дополнительные ресурсы:

M-PACE: Mother Child Framework for Multimodal Compliance

Авторы:

Резюме на русском

Abstract

Ссылки и действия

Связанные статьи

Text-Only Training for Image Captioning with Retrieval Augmentation and Modality...

Generalized Medical Phrase Grounding

CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on...

Thinking with Programming Vision: Towards a Unified View for Thinking with Image...

See, Think, Learn: A Self-Taught Multimodal Reasoner

Навигация