M3Ret: Unleashing Zero-shot Multimodal Medical Image Retrieval via Self-Supervision
2509.01360v1
cs.CV, cs.LG
2025-09-05
Авторы:
Che Liu, Zheng Jiang, Chengyu Fang, Heng Guo, Yan-Jie Zhou, Jiaqi Qu, Le Lu, Minfeng Xu
Резюме на русском
#### Контекст
Medical image retrieval (MIR) является ключевым инструментом для клинического принятия решений и трансляционных исследований, требуя высококачественных визуальных представлений. Тем не менее, существующие подходы остаются в ограниченных подходах, привязанными к конкретным модальностям (2D, 3D, видео), что затрудняет развитие универсального подхода к обучению. Эта проблема мотивирует разработку методов, которые могут объединять различные модальности в единое целое и обеспечивать широкое применение в различных сценариях.
#### Метод
Модель M3Ret разработана как универсальный визуальный энкодер, не требующий модальности-специфического настройки. Она обучается на большом гибридном датасете, содержащем 867,653 семплов, включая 2D X-rays и ультразвуки, RGB-видео эндоскопии, а также 3D CT-сканы. Основной подход к обучению основывается на самостоятельных самосупервизированных методах (SSL), включая generative (MAE) и contrastive (SimDINO) парадигмы. Эта модель способна учитывать разные виды изображений и видео, без потерь в качестве представления.
#### Результаты
Проведенные эксперименты показали, что M3Ret достигает нового состояния знаний в задаче нулевого-значения (zero-shot) для изображений-к-изображениям. Она показала значительное превосходство над DINOv3 и BMC-CLIP с текстовой супервизой. Особое внимание уделено возможности обнаружения независимости от парных данных, что демонстрирует мощь самосупервизированных самоуправляемых методов. Также модель показала высокую общинность, успешно загружая магнитные резонансные изображения (MRI), независимо от того, были ли они присутствовали в обучении. Эксперименты показали, что M3Ret может объединять различные модальности без потерь качества.
#### Значимость
M3Ret открывает новые возможности для объединения различных модальностей в области здравоохранения. Он может применяться в клинической практике для быстрого поиска изображений, трансляционных исследований, а также развития базовых моделей для конвейеров медицинского изображения. Его общинность, эффективность и превосходство над существующими подходами делают его одним из самых универсальных инструментов в медицинской интеллектуальной системе.
#### Выводы
Результаты M3Ret показывают, что самосупервизированные методы могут стать основой для универсальных моделей медицинского изображения. В дальнейших исследованиях необходимо тестировать модель на более широком спектре задач и данных, чтобы продвигаться к созданию тяжелых моделей, объединяющих все модальности в единую систему.
Abstract
Medical image retrieval is essential for clinical decision-making and
translational research, relying on discriminative visual representations. Yet,
current methods remain fragmented, relying on separate architectures and
training strategies for 2D, 3D, and video-based medical data. This
modality-specific design hampers scalability and inhibits the development of
unified representations. To enable unified learning, we curate a large-scale
hybrid-modality dataset comprising 867,653 medical imaging samples, including
2D X-rays and ultrasounds, RGB endoscopy videos, and 3D CT scans. Leveraging
this dataset, we train M3Ret, a unified visual encoder without any
modality-specific customization. It successfully learns transferable
representations using both generative (MAE) and contrastive (SimDINO)
self-supervised learning (SSL) paradigms. Our approach sets a new
state-of-the-art in zero-shot image-to-image retrieval across all individual
modalities, surpassing strong baselines such as DINOv3 and the text-supervised
BMC-CLIP. More remarkably, strong cross-modal alignment emerges without paired
data, and the model generalizes to unseen MRI tasks, despite never observing
MRI during pretraining, demonstrating the generalizability of purely visual
self-supervision to unseen modalities. Comprehensive analyses further validate
the scalability of our framework across model and data sizes. These findings
deliver a promising signal to the medical imaging community, positioning M3Ret
as a step toward foundation models for visual SSL in multimodal medical image
understanding.
Ссылки и действия
Дополнительные ресурсы: