Hierarchical Retrieval: The Geometry and a Pretrain-Finetune Recipe
2509.16411v1
cs.IR, cs.CL, cs.LG, stat.ML
2025-09-24
Авторы:
Chong You, Rajesh Jayaram, Ananda Theertha Suresh, Robin Nittka, Felix Yu, Sanjiv Kumar
Резюме на русском
#### Контекст
Дуальные энкодеры (DE) — модели, сопоставляющие входные запросы и документы с помощью векторных представлений, широко используются в области информационного поиска из-за их простоты и масштабируемости. Однако ограничения римановой геометрии, в которой эти модели работают, приводят к потере точности в задачах, требующих высокой точности в выборке. Одна из таких задач — hierarchical retrieval (HR), в которой документы имеют иерархическую структуру, и для каждого запроса требуется найти все документы, входящие в его иерархию. В этой работе рассматривается возможность применения дуальных энкодеров в таких задачах и изучается их ограниченная эффективность при работе с документами, находящимися далеко в иерархии.
#### Метод
Мы исследуем свойства DE-моделей в HR и устанавливаем теоретические ограничения на их работу в зависимости от глубины иерархии и количества документов. Для решения недостатка точности в работе с документами далекого уровня иерархии предлагается метод, состоящий из двух этапов: предварительного обучения (pretraining) и особый рецепт файна-тюнинга (finetune). Эта модель называется **Hierarchical Retriever**. На основе её архитектуры мы стараемся повысить качество работы DE-моделей в задачах HR, когда необходимо выбрать документы, находящиеся глубоко в иерархии.
#### Результаты
Мы проводим эксперименты на данных организованных в иерархической структуре (WordNet). Мы показываем, что при использовании DE-моделей без рецепта pretrain-finetune, точность задачи HR падает при работе с документами, находящимися далеко в иерархии. Однако при использовании нашего рецепта, точность возврата документов далекого уровня увеличивается с 19% до 76%, не ухудшаясь для ближних документов. Также мы проводим эксперименты на данных релевантности поиска продуктов в интернет-магазине и показываем, что наш метод добавляет качеству работы DE-моделей при выборе подходящего документа.
#### Значимость
Наш метод может быть применен в различных приложениях, где необходима высокая точность в выборе документов в иерархических структурах, таких как веб-поиск, вопрос-ответ-системы и рекомендательные системы. Одна из ключевых преимуществ — улучшение точности при выборе документов далекого уровня в иерархии. Мы показываем, что наша модель не только повышает качество работы, но и может использоваться в реальной жизни для решения задач в области поиска и рекомендаций.
#### Выводы
Мы проанализировали ограничения дуальных энкодеров в задачах HR и предложили решение, позволяющее увеличить точность работы этих моделей на документах, находящихся далеко в иерархии. Наши эксперименты показали, что наш метод существенно повышает точность задачи с примен
Abstract
Dual encoder (DE) models, where a pair of matching query and document are
embedded into similar vector representations, are widely used in information
retrieval due to their simplicity and scalability. However, the Euclidean
geometry of the embedding space limits the expressive power of DEs, which may
compromise their quality. This paper investigates such limitations in the
context of hierarchical retrieval (HR), where the document set has a
hierarchical structure and the matching documents for a query are all of its
ancestors. We first prove that DEs are feasible for HR as long as the embedding
dimension is linear in the depth of the hierarchy and logarithmic in the number
of documents. Then we study the problem of learning such embeddings in a
standard retrieval setup where DEs are trained on samples of matching query and
document pairs. Our experiments reveal a lost-in-the-long-distance phenomenon,
where retrieval accuracy degrades for documents further away in the hierarchy.
To address this, we introduce a pretrain-finetune recipe that significantly
improves long-distance retrieval without sacrificing performance on closer
documents. We experiment on a realistic hierarchy from WordNet for retrieving
documents at various levels of abstraction, and show that pretrain-finetune
boosts the recall on long-distance pairs from 19% to 76%. Finally, we
demonstrate that our method improves retrieval of relevant products on a
shopping queries dataset.