Метаданные, теги и PageRank
Метаданные документа и фильтрация по ним в ассистентах и API, наборы тегов для автоматической разметки фрагментов, PageRank базы и то, как всё это задаётся в интерфейсе и через API.
Метаданные, наборы тегов и PageRank являются тремя способами добавить к фрагментам сведения, которых нет в самом тексте, и тем самым управлять отбором источников. Эта статья описывает, что делает каждый из них и где он настраивается.
Метаданные документа
Метаданные хранятся у документа в виде JSON-объекта с произвольными ключами: автор, дата, подразделение, версия, адрес исходной страницы. Они не индексируются и не участвуют в поиске по словам или векторам. Их роль другая: если фрагменты документа попали в контекст ответа, метаданные дописываются в промпт перед фрагментами, и модель может сослаться на них, например указать источник и дату.
Задать метаданные можно двумя способами:
- в списке документов базы действием «Установить метаданные»: откроется поле для JSON, значение должно быть корректным объектом, иначе изменение не применится;
- через API:
PUT /api/v1/datasets/{dataset_id}/documents/{document_id}с полемmeta_fields, значение которого является объектом.
{ "meta_fields": { "Автор": "Отдел кадров", "Дата": "2026-02-01", "Версия": "3" } }Массовой установки в интерфейсе нет, каждый документ редактируется отдельно; для сотен документов используйте цикл по API. Изменение метаданных записывается в журнал аудита как событие «Изменение метаданных».
Фильтрация по метаданным
У ассистента, к которому подключены базы, есть настройка метаданных с тремя режимами:
| Режим | Поведение |
|---|---|
| Выключено | Метаданные не влияют на отбор документов |
| Автоматически | Модель читает вопрос и доступные в базах значения метаданных и сама формирует условия отбора |
| Вручную | Администратор задаёт условия: ключ, оператор, значение. Поиск идёт только по документам, которые им удовлетворяют |
Ручной режим подходит, когда правило известно заранее, например ассистент отдела должен видеть только документы с «Подразделение: Бухгалтерия». Автоматический режим удобен, если вопросы содержат признаки отбора («по версии 3», «за 2025 год»), но требует единообразных ключей и значений во всех документах. В API ассистента тот же параметр называется meta_data_filter с полями method (disabled, automatic, manual) и списком условий manual из объектов key, op, value.
Совет
Договоритесь о словаре ключей до загрузки документов: один ключ «Дата» в формате ГГГГ-ММ-ДД, один ключ «Подразделение» с фиксированным списком значений. Разнобой в ключах делает фильтрацию бесполезной.
Наборы тегов
Набор тегов является отдельной базой знаний с методом фрагментации «Тег». Она содержит таблицу из двух столбцов: описание и тег. Описание является примером фрагмента или типичного вопроса, тег является меткой из закрытого списка; несколько тегов в одной строке разделяются запятой. Форматы: XLSX без строки заголовков, CSV или TXT в UTF-8 с разделителем TAB.
Порядок работы:
- Создайте базу, в её настройках выберите метод «Тег», загрузите и обработайте файл таблицы. На странице конфигурации появятся вкладки «Облако» и «Таблица» с частотой тегов; здесь теги можно переименовать или удалить.
- В целевой базе откройте «Расширенные настройки», в поле «Наборы тегов» выберите одну или несколько баз-наборов, при необходимости измените «Топ-N Тегов» и сохраните.
- Обработайте документы целевой базы заново. Каждый фрагмент сравнивается с описаниями из набора и получает ближайшие теги.
При вопросе ассистент тегирует и сам вопрос, и фрагменты с совпадающими тегами получают преимущество. Это помогает, когда фрагменты похожи друг на друга (например, большинство о аксессуарах и немногие о самом устройстве) и обычный поиск их не различает.
Отличия от авто-ключевых слов: теги являются закрытым множеством, заданным вами, и назначаются по векторному сходству без обращения к чат-модели; ключевые слова генерирует модель, множество открытое, и это дороже. Набор тегов не подключают к ассистенту: он не участвует в поиске напрямую. После изменения набора документы целевых баз нужно обработать заново.
PageRank базы
PageRank задаётся для базы целиком в «Расширенных настройках» целым числом от 0 до 100 и прибавляется к оценке всех её фрагментов. Он нужен, когда ассистент ищет по нескольким базам с одной моделью эмбеддинга и одна из них должна иметь приоритет: действующие регламенты выше архива, своя документация выше общедоступных материалов. Ноль означает «выключено». Через API значение передаётся полем pagerank в PUT /api/v1/datasets/{dataset_id}.
Примечание
PageRank работает только при поисковом движке Elasticsearch. В установках на Infinity параметр не применяется, и приоритет между базами задают через условия в промпте ассистента или разделение ассистентов.
Что выбрать
| Задача | Инструмент |
|---|---|
| Модель должна назвать автора, дату или ссылку источника | Метаданные |
| Ограничить поиск частью документов по формальному признаку | Фильтр по метаданным |
| Различить похожие фрагменты по тематике | Набор тегов |
| Поднять одну базу над другой | PageRank |
| Улучшить попадание по синонимам | Авто-ключевые слова и авто-вопросы, см. Методы фрагментации |
Результат любого изменения проверяется на вкладке «Тестирование поиска», см. Проверка поиска по базе.
Спросить Сему