СтатьяСредний9 минОбновлено 2026-10-09

Методы фрагментации и настройки обработки

Какой метод фрагментации выбрать для каждого типа документов, как влияют размер фрагмента, разделитель и анализатор PDF, когда включать Excel в HTML, авто-ключевые слова, RAPTOR, граф знаний и PageRank.

Настройки обработки определяют, как документ превращается во фрагменты и что дополнительно записывается в индекс. Они задаются на вкладке «Обработка документов» в конфигурации базы знаний и действуют для новых документов; уже обработанные файлы нужно обработать заново.

Где находятся настройки

На вкладке видны модель эмбеддинга, «Анализатор PDF» и пояснение, что документы режутся автоматически по распознанным заголовкам, абзацам, спискам и таблицам. Остальное скрыто в блоке «Расширенные настройки»: «Метод фрагментации», параметры Docling, «Рекомендуемый размер фрагмента», «Разделитель текста», «PageRank», «Авто-ключевые слова», «Авто-вопросы», «Excel в HTML», RAPTOR, а для отдельных методов наборы тегов и граф знаний.

Метод базы является значением по умолчанию. Для отдельного документа его можно переопределить в списке документов действием «Метод фрагментации».

Методы фрагментации

МетодФорматыКак режетКогда использовать
Общий (General)MD, DOCX, XLSX, XLS, PPT, PDF, TXT, изображения, CSV, JSON, EML, HTMLРаспознаёт структуру, затем объединяет соседние сегменты до порога токеновРегламенты, инструкции, письма, смешанные базы
Вопрос-ответ (Q&A)XLSX, CSV, TXTПара вопрос-ответ становится фрагментом. В XLSX два столбца без заголовков, в CSV/TXT разделитель TABБазы часто задаваемых вопросов
Таблица (Table)XLSX, CSV, TXTПервая строка заголовки, каждая следующая строка отдельный фрагментСправочники, прайс-листы, реестры
Руководство (Manual)PDFРаздел по заголовкамТехнические руководства с рубрикацией
Научная статья (Paper)PDFПо разделам статьиПубликации; больше контекста, дороже обработка
Книга (Book)DOCX, PDF, TXTПо главам; для PDF задаётся диапазон страницКниги, объёмные отчёты
Законы (Laws)DOCX, PDF, TXTФрагменты на уровне статейКодексы, законы, договоры, положения
Презентация (Presentation)PDF, PPTXКаждый слайд отдельный фрагментСлайды
Изображение (Picture)ИзображенияOCR плюс описание визуальной модельюСхемы, сканы без текстового слоя
Один (One)DOCX, XLSX, XLS, PDF, TXTВесь документ один фрагментКороткие документы, которые нельзя разрывать
Тег (Tag)XLSX, CSV, TXTПары «описание, тег»База-набор тегов для разметки других баз, см. Метаданные, теги и PageRank

В списке также есть методы для писем, аудио и резюме. Если сомневаетесь, начните с метода «Общий» и проверьте результат в проверке поиска.

Размер фрагмента и разделитель

«Рекомендуемый размер фрагмента» задаёт порог в токенах: сегменты меньше порога склеиваются, пока сумма не превысит его. Маленькие фрагменты находятся точнее, но теряют контекст; большие размывают сходство с вопросом и быстрее заполняют окно модели. Для метода «Общий» обычная отправная точка 512 токенов; для таблиц и FAQ строка или пара уже являются фрагментом.

«Разделитель текста» перечисляет символы, по которым текст делится на сегменты до склейки: переводы строк, знаки конца предложения. Несколько символов в одном разделителе указываются в обратных кавычках.

Анализатор PDF

Параметр применяется только к PDF, Word обрабатывается отдельно. Варианты:

  • Docling (значение по умолчанию): распознаёт макет страницы, таблицы и списки. Поля: «Качество таблиц» (быстрый или точный режим), «OCR» для сканов, «Страниц в батче» для управления памятью, «Чанки с учётом структуры», при котором списки и заголовки остаются в одном фрагменте.
  • DeepDOC: встроенная визуальная модель распознавания текста, таблиц и макета. Требует времени и ресурсов.
  • «Простой»: только текстовый слой, без OCR и анализа макета. Подходит, если все PDF базы созданы из текста; существенно ускоряет обработку.
  • Визуальная модель провайдера: сторонняя модель распознавания изображений, если она настроена в организации; помечена как экспериментальная.

Сканы без OCR дают пустые или повреждённые фрагменты; это покажет оценка «Качество индекса» в прогрессе обработки.

Excel в HTML

При методе «Общий» таблицы Excel по умолчанию превращаются в пары «заголовок: значение». Для многоколоночных таблиц, объединённых ячеек и нескольких таблиц на листе включите «Excel в HTML»: лист сохраняется как HTML-таблица, таблицы длиннее 12 строк режутся по 12 строк. На PDF параметр не влияет.

Авто-ключевые слова и авто-вопросы

Каждый фрагмент отправляется в чат-модель, которая возвращает N ключевых слов (от 0 до 30) или N вопросов (от 0 до 10); они дописываются к фрагменту и улучшают попадание запросов с другими формулировками. Ноль отключает функцию. Для фрагментов около тысячи символов рекомендуется 3 до 5 ключевых слов и 1 до 2 вопросов; с ростом значения польза снижается. Обе функции увеличивают время обработки и расход токенов.

RAPTOR

RAPTOR группирует фрагменты по смысловой близости, просит чат-модель кратко пересказать каждую группу и повторяет это по уровням, пока не получится дерево от исходных фрагментов до общего резюме. Резюме попадают в индекс как дополнительные фрагменты, поэтому вопросы, требующие свести несколько мест документа, находят материал.

Включается переключателем «Использовать RAPTOR». Параметры: «Промпт» (рекомендуется оставить как есть), «Макс. токенов» на резюме, «Порог» сходства для объединения в кластер (выше порог, меньше фрагментов в кластере), «Макс. кластеров» и «Случайное зерно». Стоимость заметная: память, время и токены на каждом уровне. Включайте для баз с многошаговыми вопросами, не включайте для справочников и FAQ.

Граф знаний

Переключатель «Извлечь граф знаний» добавляет шаг, на котором модель извлекает из фрагментов сущности и связи и строит единый граф по всей базе. Поля: «Типы сущностей» (по умолчанию organization, person, event, category), «Метод» («Легкий» по умолчанию, экономнее; «Общий» на промптах GraphRAG), «Разрешение сущностей» (объединение похожих сущностей, дороже) и «Генерация отчетов сообществ» (резюме кластеров сущностей, дороже).

Граф обновляется только при обработке нового документа; удаление файла граф не перестраивает. Чтобы ассистент использовал граф, включите «Использовать граф знаний» в его настройках. Граф полезен для вопросов о связях между людьми, организациями и событиями и заметно удлиняет и обработку, и ответ.

PageRank

«PageRank» задаётся для базы целиком целым числом от 0 до 100 и прибавляет к оценке её фрагментов постоянную величину, поэтому при поиске по нескольким базам одного ассистента фрагменты базы с большим значением выходят раньше. Ноль означает «выключено». Параметр поддерживается только при поисковом движке Elasticsearch; в установках на Infinity он не применяется.

Примечание

Если обработка идёт слишком долго, проверьте, что включено: RAPTOR, граф знаний, авто-ключевые слова, авто-вопросы, OCR для текстовых PDF.

Спросить Сему

Было полезно?