Testing the assumptions about the geometry of sentence embedding spaces: the cosine measure need not apply

2509.01606v1 cs.CL, 68T50, I.2.7 2025-09-05
Авторы:

Vivi Nastase, Paola Merlo

Резюме на русском

## Контекст Основной контекст данного исследования заключается в оценке предположений о геометрии пространств слов и предложений, в частности, вопросе о том, может ли косинусная мера подходить для оценки их отношений. Мотивация для исследования лежит в том, что модели Transformer, такие как BERT, преобразуют текст в контекстные токенные представления. Эти представления используются в многих лингвистических задачах, но модели не всегда становятся понятными на уровне геометрии пространств. Авторы задаются вопросом о том, можно ли иметь вообще грубое представление о том, как выполняется это преобразование, если речь идет о некоторых лингвистических свойствах. Таким образом, основной вопрос, который рассматривается в работе, — как геометрия пространств предложений отражается на их поведении на различных лингвистических задачах, и можно ли определить какие-либо общие паттерны. ## Метод Для решения этой проблемы авторы представляют три основных метода, которые использовались для вычисления слов в пространстве слов: 1) усреднение токена, 2) использование специального токена [CLS] и 3) выбор случайного токена из предложения. Для оценки пространств предложений, авторы использовали косинусную меру, которая рассматривает лишь те структуры, которые есть на очень высоком уровне. Они исследуют, возможно ли использовать этот подход для поиска схожих свойств между предложениями, а также оценивают геометрические свойства, включая расстояния между токенами. Таким образом, основная теория, которую исследуют, заключается в том, можно ли добиться хорошей корреляции между расстоянием в пространстве слов и их лингвистическим смыслом, а также отношением к задачам. ## Результаты Результаты исследования показали, что косинусная мера, на самом деле, несет в себе лишь ограниченную информацию, не отражающую полноценные свойства предложений. В частности, авторы отмечают, что расстояние между словами или предложениями в пространстве не всегда сигнализирует о том, как они связаны в плане лингвистической семантики. Таким образом, как выяснилось в результатах, косинусная мера может давать некорректные выводы, когда речь идет о том, какие предложения принадлежат к той же группе с точки зрения лингвистики. Основной вывод заключается в том, что косинусная мера не может гарантировать достоверную корреляцию между расстоянием в пространстве и фактическим лингвистическим смыслом. ## Значимость Изучение геометрии пространств слов и предложений имеет реальную значимость в области применения моделей NLP. Данные результаты могут быть применены в техническо

Abstract

Transformer models learn to encode and decode an input text, and produce contextual token embeddings as a side-effect. The mapping from language into the embedding space maps words expressing similar concepts onto points that are close in the space. In practice, the reverse implication is also assumed: words corresponding to close points in this space are similar or related, those that are further are not. Does closeness in the embedding space extend to shared properties for sentence embeddings? We present an investigation of sentence embeddings and show that the geometry of their embedding space is not predictive of their relative performances on a variety of tasks. We compute sentence embeddings in three ways: as averaged token embeddings, as the embedding of the special [CLS] token, and as the embedding of a random token from the sentence. We explore whether there is a correlation between the distance between sentence embedding variations and their performance on linguistic tasks, and whether despite their distances, they do encode the same information in the same manner. The results show that the cosine similarity -- which treats dimensions shallowly -- captures (shallow) commonalities or differences between sentence embeddings, which are not predictive of their performance on specific tasks. Linguistic information is rather encoded in weighted combinations of different dimensions, which are not reflected in the geometry of the sentence embedding space.

Ссылки и действия

Связанные статьи

Prior-based Noisy Text Data Filtering: Fast and Strong Alternative For Perplexit...

------------------------------------------------------ ## Контекст -----------------------------------------------------...

2025-09-25

Charting a Decade of Computational Linguistics in Italy: The CLiC-it Corpus

## Контекст Область исследования, известная как Computational Linguistics (CL) или языковой моделирование, занимается ра...

2025-09-25

Quantifying Self-Awareness of Knowledge in Large Language Models

## Контекст Современные большие языковые модели (LLMs) представляют собой мощные инструменты, способные выполнять широки...

2025-09-23

Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence...

## Контекст В современном мире развитие интеллектуальных технологий приводит к появлению моделей языка, которые становя...

2025-09-05