Искусственный интеллект

Как LEMUR приближает поиск с поздним взаимодействием к традиционным векторным индексам в txtai?

В статье сообщества Hugging Face объясняется интеграция LEMUR с txtai для преобразования многовекторных представлений поиска в векторы фиксированного размера, пригодные для индексирования, а также добавление параметра mean centering для обработки геометрии векторов токенов в некоторых моделях. Результаты показывают заметное улучшение в ограниченных тестах, но не позволяют обобщить превосходство на все модели или методы индексирования.

2026-08-17
6 мин. чтения
9 просмотров
فريق تحرير certi.news
Как LEMUR приближает поиск с поздним взаимодействием к традиционным векторным индексам в txtai?

Интеграция LEMUR в txtai решает практическую проблему моделей поиска с поздним взаимодействием: такие модели сохраняют вектор для каждого токена запроса или документа, что обеспечивает более точные детали, чем представление всего текста одним вектором, но усложняет их использование с традиционными индексами плотного поиска. txtai предлагает способ преобразовать это многовекторное представление в вектор фиксированной размерности, который можно искать с помощью того же типа индексов, а также добавляет настраиваемый параметр mean centering для более эффективного использования направленных различий между векторами токенов, когда они слишком похожи.

Материал, опубликованный 13 августа 2026 года в блоге Hugging Face как статья сообщества, написанная Morgan Carr, рассматривает причины изменения, результаты конкретных экспериментов, а также способ обучения и загрузки артефакта LEMUR в txtai. В нём результат не представляется как общий рейтинг методов поиска, поскольку сравнения ограничены одной моделью, тремя наборами данных, одним устройством и точным поиском.

От нескольких векторов к индексируемому вектору

В поиске с поздним взаимодействием все токены запроса сравниваются с токенами документа с помощью MaxSim: для каждого токена запроса сохраняется наиболее сильное совпадение, после чего эти значения суммируются. LEMUR, или Learned Multi-Vector Retrieval, обучает кодирование фиксированной размерности, которое пытается приблизить результат этого взаимодействия, сохраняя возможность использовать традиционный векторный индекс.

Артефакт LEMUR в txtai состоит из кодировщика признаков, статистики нормализации выходных данных и выборки векторов токенов. Во время вывода запрос преобразуется в сумму обученных признаков, а документ представляется набором коэффициентов обычных наименьших квадратов над сохранённой выборкой. Внутреннее произведение двух векторов фиксированной размерности становится приближением исходного результата позднего взаимодействия.

Артефакт зависит от набора данных, использованного при обучении, и должен быть обучен до загрузки индекса embeddings в txtai. Артефакт сохраняется в виде config.json и model.safetensors. Параметр epochs=100 выбирает ориентированный на качество путь MLP, тогда как epochs=0 выбирает детерминированные случайные признаки ELM как менее затратную альтернативу.

Выбор обучающих данных был решающим фактором

Эксперимент по удалению компонентов на наборе nfcorpus показал, что распределение векторов, использованное для обучения карты признаков, влияет сильнее, чем некоторые другие параметры обучения. Когда MLP обучали на векторах токенов кодировщика данных, NDCG@10 составил 0.15870, что ниже результата необученного ELM — 0.19187. При использовании векторов кодировщика запроса результат вырос до 0.24868, а после выбора числа эпох на основе валидации достиг 0.25534.

Согласно анализу, приведённому в материале, выбор обучающего распределения объяснил 93% измеренного улучшения между экспериментом с векторами данных и итоговым результатом, тогда как выбор числа эпох обеспечил оставшиеся 7%. Поэтому LemurTrainer по умолчанию устанавливает learncategory в query, позволяя также выбрать data или передать отдельный обучающий набор.

Что показало сравнительное тестирование?

В сравнении использовались модель colbert-ir/colbertv2.0, видеокарта NVIDIA GeForce RTX 4080 SUPER, torch 2.13.0+cu130 и точный поиск Faiss через IDMap,Flat. Сравнивались версия MUVERA по умолчанию с размерностью 10 240, версия MUVERA, уменьшенная до 2 048 измерений, и LEMUR с MLP-кодированием размерностью 2 048.

  • На nfcorpus LEMUR получил 0.25524 против 0.16299 у MUVERA того же размера и 0.23544 у MUVERA с размером по умолчанию.
  • На scifact LEMUR получил 0.54910 против 0.36757 у уменьшенной MUVERA и 0.50021 у версии по умолчанию.
  • На arguana LEMUR получил 0.42556 против 0.26280 у уменьшенной MUVERA и 0.34614 у версии по умолчанию.

Это соответствует улучшению по сравнению с MUVERA того же размера на 56,6% для nfcorpus, 49,4% для scifact и 61,9% для arguana. По сравнению с вектором MUVERA по умолчанию улучшение составило соответственно 8,4%, 9,8% и 22,9%. Кроме того, использованные при измерении индексы LEMUR занимали одну пятую пространства индексов MUVERA по умолчанию, поскольку размерность вектора уменьшилась с 10 240 до 2 048.

Однако важен масштаб этих чисел: эксперименты с fiqa и scidocs не были завершены из-за требуемого набора данных, а измерения проводились с одной моделью, на одном устройстве и с точным поиском. txtai использует точный поиск до 5 000 строк, после чего переходит к индексу IVF. В эксперименте scifact стандартный IVF снизил NDCG@10 для LEMUR на 43% по сравнению с точным поиском, тогда как для MUVERA снижение составило 25%. Поэтому нельзя предполагать, что результат точного поиска сохранится при масштабировании или использовании приближённого поиска.

Зачем был добавлен mean centering?

При переходе от ColBERTv2 к lightonai/LateOn тестирование показало, что векторы токенов обладают сильной направленной однородностью. В выборке из 5 000 пар среднее косинусное сходство между векторами составило 0.9508, а разброс MaxSim — 0.0559. После вычитания среднего по набору и повторной нормализации сходство снизилось до 0.0033, а разброс MaxSim вырос до 0.4772. Это само по себе не является метрикой поиска, но указывает, что центрирование предоставило кодировщику фиксированной размерности более широкое направленное пространство для захвата.

Тесты поиска подтвердили, что польза зависит от модели. В матрице LateOn центрирование на уровне пакета оказалось сильнее, чем его отключение или использование среднего по набору, во всех четырёх измеренных ячейках. Например, результат LEMUR на nfcorpus вырос с 0.00000 без центрирования до 0.33309 при центрировании пакета, а на scifact — с 0.04985 до 0.69016. Однако эксперименты с ColBERTv2 показали, что центрирование может быть нейтральным или ухудшать результат MUVERA, поэтому оно не предлагается как универсальная безусловная настройка.

Правило по умолчанию в объединённых изменениях включает центрирование пакета, если загруженная модель содержит более одного линейного слоя torch.nn.Linear. Модели с нулём или одним слоем сохраняют прежнее поведение, при этом решение можно переопределить вручную. Центрирование выполняется после нормализации векторов токенов и перед LEMUR или MUVERA, после чего выполняется ещё одна нормализация. Можно выбрать область document, batch или collection; область collection также принимает встроенное среднее или файл Safetensors, содержащий center.mean.

Что практически меняется для пользователя?

Использование LEMUR требует отдельного шага обучения до создания индекса, а параметры векторов во время обучения должны соответствовать параметрам загрузки. В опубликованном примере показано использование center: true с артефактом LEMUR и фиксация Faiss на IDMap,Flat, когда точный поиск практически применим. Последняя опубликованная в материале версия txtai — v9.12.0, тогда как объединённые изменения предназначены для v9.13.0; для проверки исходного кода до выпуска можно установить версию master из репозитория GitHub в изолированной среде.

Практический вывод не состоит в том, что LEMUR или центрирование превосходят другие варианты во всех случаях. Скорее, txtai теперь предоставляет два отдельных инструмента для двух разных задач: LEMUR — для сокращения представления позднего взаимодействия до вектора фиксированного размера, а центрирование — для обработки неподходящей геометрии векторов токенов в некоторых моделях. До обобщения результатов по-прежнему необходимы более широкие испытания на разных моделях, наборах данных и настроенных приближённых индексах.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости