СтатьяСредний6 минОбновлено 2026-10-09

Метаданные, теги и PageRank

Метаданные документа и фильтрация по ним в ассистентах и API, наборы тегов для автоматической разметки фрагментов, PageRank базы и то, как всё это задаётся в интерфейсе и через API.

Метаданные, наборы тегов и PageRank являются тремя способами добавить к фрагментам сведения, которых нет в самом тексте, и тем самым управлять отбором источников. Эта статья описывает, что делает каждый из них и где он настраивается.

Метаданные документа

Метаданные хранятся у документа в виде JSON-объекта с произвольными ключами: автор, дата, подразделение, версия, адрес исходной страницы. Они не индексируются и не участвуют в поиске по словам или векторам. Их роль другая: если фрагменты документа попали в контекст ответа, метаданные дописываются в промпт перед фрагментами, и модель может сослаться на них, например указать источник и дату.

Задать метаданные можно двумя способами:

  • в списке документов базы действием «Установить метаданные»: откроется поле для JSON, значение должно быть корректным объектом, иначе изменение не применится;
  • через API: PUT /api/v1/datasets/{dataset_id}/documents/{document_id} с полем meta_fields, значение которого является объектом.
json
{ "meta_fields": { "Автор": "Отдел кадров", "Дата": "2026-02-01", "Версия": "3" } }

Массовой установки в интерфейсе нет, каждый документ редактируется отдельно; для сотен документов используйте цикл по API. Изменение метаданных записывается в журнал аудита как событие «Изменение метаданных».

Фильтрация по метаданным

У ассистента, к которому подключены базы, есть настройка метаданных с тремя режимами:

РежимПоведение
ВыключеноМетаданные не влияют на отбор документов
АвтоматическиМодель читает вопрос и доступные в базах значения метаданных и сама формирует условия отбора
ВручнуюАдминистратор задаёт условия: ключ, оператор, значение. Поиск идёт только по документам, которые им удовлетворяют

Ручной режим подходит, когда правило известно заранее, например ассистент отдела должен видеть только документы с «Подразделение: Бухгалтерия». Автоматический режим удобен, если вопросы содержат признаки отбора («по версии 3», «за 2025 год»), но требует единообразных ключей и значений во всех документах. В API ассистента тот же параметр называется meta_data_filter с полями method (disabled, automatic, manual) и списком условий manual из объектов key, op, value.

Совет

Договоритесь о словаре ключей до загрузки документов: один ключ «Дата» в формате ГГГГ-ММ-ДД, один ключ «Подразделение» с фиксированным списком значений. Разнобой в ключах делает фильтрацию бесполезной.

Наборы тегов

Набор тегов является отдельной базой знаний с методом фрагментации «Тег». Она содержит таблицу из двух столбцов: описание и тег. Описание является примером фрагмента или типичного вопроса, тег является меткой из закрытого списка; несколько тегов в одной строке разделяются запятой. Форматы: XLSX без строки заголовков, CSV или TXT в UTF-8 с разделителем TAB.

Порядок работы:

  1. Создайте базу, в её настройках выберите метод «Тег», загрузите и обработайте файл таблицы. На странице конфигурации появятся вкладки «Облако» и «Таблица» с частотой тегов; здесь теги можно переименовать или удалить.
  2. В целевой базе откройте «Расширенные настройки», в поле «Наборы тегов» выберите одну или несколько баз-наборов, при необходимости измените «Топ-N Тегов» и сохраните.
  3. Обработайте документы целевой базы заново. Каждый фрагмент сравнивается с описаниями из набора и получает ближайшие теги.

При вопросе ассистент тегирует и сам вопрос, и фрагменты с совпадающими тегами получают преимущество. Это помогает, когда фрагменты похожи друг на друга (например, большинство о аксессуарах и немногие о самом устройстве) и обычный поиск их не различает.

Отличия от авто-ключевых слов: теги являются закрытым множеством, заданным вами, и назначаются по векторному сходству без обращения к чат-модели; ключевые слова генерирует модель, множество открытое, и это дороже. Набор тегов не подключают к ассистенту: он не участвует в поиске напрямую. После изменения набора документы целевых баз нужно обработать заново.

PageRank базы

PageRank задаётся для базы целиком в «Расширенных настройках» целым числом от 0 до 100 и прибавляется к оценке всех её фрагментов. Он нужен, когда ассистент ищет по нескольким базам с одной моделью эмбеддинга и одна из них должна иметь приоритет: действующие регламенты выше архива, своя документация выше общедоступных материалов. Ноль означает «выключено». Через API значение передаётся полем pagerank в PUT /api/v1/datasets/{dataset_id}.

Примечание

PageRank работает только при поисковом движке Elasticsearch. В установках на Infinity параметр не применяется, и приоритет между базами задают через условия в промпте ассистента или разделение ассистентов.

Что выбрать

ЗадачаИнструмент
Модель должна назвать автора, дату или ссылку источникаМетаданные
Ограничить поиск частью документов по формальному признакуФильтр по метаданным
Различить похожие фрагменты по тематикеНабор тегов
Поднять одну базу над другойPageRank
Улучшить попадание по синонимамАвто-ключевые слова и авто-вопросы, см. Методы фрагментации

Результат любого изменения проверяется на вкладке «Тестирование поиска», см. Проверка поиска по базе.

Спросить Сему

Было полезно?