Методы фрагментации и настройки обработки
Какой метод фрагментации выбрать для каждого типа документов, как влияют размер фрагмента, разделитель и анализатор PDF, когда включать Excel в HTML, авто-ключевые слова, RAPTOR, граф знаний и PageRank.
Настройки обработки определяют, как документ превращается во фрагменты и что дополнительно записывается в индекс. Они задаются на вкладке «Обработка документов» в конфигурации базы знаний и действуют для новых документов; уже обработанные файлы нужно обработать заново.
Где находятся настройки
На вкладке видны модель эмбеддинга, «Анализатор PDF» и пояснение, что документы режутся автоматически по распознанным заголовкам, абзацам, спискам и таблицам. Остальное скрыто в блоке «Расширенные настройки»: «Метод фрагментации», параметры Docling, «Рекомендуемый размер фрагмента», «Разделитель текста», «PageRank», «Авто-ключевые слова», «Авто-вопросы», «Excel в HTML», RAPTOR, а для отдельных методов наборы тегов и граф знаний.
Метод базы является значением по умолчанию. Для отдельного документа его можно переопределить в списке документов действием «Метод фрагментации».
Методы фрагментации
| Метод | Форматы | Как режет | Когда использовать |
|---|---|---|---|
| Общий (General) | MD, DOCX, XLSX, XLS, PPT, PDF, TXT, изображения, CSV, JSON, EML, HTML | Распознаёт структуру, затем объединяет соседние сегменты до порога токенов | Регламенты, инструкции, письма, смешанные базы |
| Вопрос-ответ (Q&A) | XLSX, CSV, TXT | Пара вопрос-ответ становится фрагментом. В XLSX два столбца без заголовков, в CSV/TXT разделитель TAB | Базы часто задаваемых вопросов |
| Таблица (Table) | XLSX, CSV, TXT | Первая строка заголовки, каждая следующая строка отдельный фрагмент | Справочники, прайс-листы, реестры |
| Руководство (Manual) | Раздел по заголовкам | Технические руководства с рубрикацией | |
| Научная статья (Paper) | По разделам статьи | Публикации; больше контекста, дороже обработка | |
| Книга (Book) | DOCX, PDF, TXT | По главам; для PDF задаётся диапазон страниц | Книги, объёмные отчёты |
| Законы (Laws) | DOCX, PDF, TXT | Фрагменты на уровне статей | Кодексы, законы, договоры, положения |
| Презентация (Presentation) | PDF, PPTX | Каждый слайд отдельный фрагмент | Слайды |
| Изображение (Picture) | Изображения | OCR плюс описание визуальной моделью | Схемы, сканы без текстового слоя |
| Один (One) | DOCX, XLSX, XLS, PDF, TXT | Весь документ один фрагмент | Короткие документы, которые нельзя разрывать |
| Тег (Tag) | XLSX, CSV, TXT | Пары «описание, тег» | База-набор тегов для разметки других баз, см. Метаданные, теги и PageRank |
В списке также есть методы для писем, аудио и резюме. Если сомневаетесь, начните с метода «Общий» и проверьте результат в проверке поиска.
Размер фрагмента и разделитель
«Рекомендуемый размер фрагмента» задаёт порог в токенах: сегменты меньше порога склеиваются, пока сумма не превысит его. Маленькие фрагменты находятся точнее, но теряют контекст; большие размывают сходство с вопросом и быстрее заполняют окно модели. Для метода «Общий» обычная отправная точка 512 токенов; для таблиц и FAQ строка или пара уже являются фрагментом.
«Разделитель текста» перечисляет символы, по которым текст делится на сегменты до склейки: переводы строк, знаки конца предложения. Несколько символов в одном разделителе указываются в обратных кавычках.
Анализатор PDF
Параметр применяется только к PDF, Word обрабатывается отдельно. Варианты:
- Docling (значение по умолчанию): распознаёт макет страницы, таблицы и списки. Поля: «Качество таблиц» (быстрый или точный режим), «OCR» для сканов, «Страниц в батче» для управления памятью, «Чанки с учётом структуры», при котором списки и заголовки остаются в одном фрагменте.
- DeepDOC: встроенная визуальная модель распознавания текста, таблиц и макета. Требует времени и ресурсов.
- «Простой»: только текстовый слой, без OCR и анализа макета. Подходит, если все PDF базы созданы из текста; существенно ускоряет обработку.
- Визуальная модель провайдера: сторонняя модель распознавания изображений, если она настроена в организации; помечена как экспериментальная.
Сканы без OCR дают пустые или повреждённые фрагменты; это покажет оценка «Качество индекса» в прогрессе обработки.
Excel в HTML
При методе «Общий» таблицы Excel по умолчанию превращаются в пары «заголовок: значение». Для многоколоночных таблиц, объединённых ячеек и нескольких таблиц на листе включите «Excel в HTML»: лист сохраняется как HTML-таблица, таблицы длиннее 12 строк режутся по 12 строк. На PDF параметр не влияет.
Авто-ключевые слова и авто-вопросы
Каждый фрагмент отправляется в чат-модель, которая возвращает N ключевых слов (от 0 до 30) или N вопросов (от 0 до 10); они дописываются к фрагменту и улучшают попадание запросов с другими формулировками. Ноль отключает функцию. Для фрагментов около тысячи символов рекомендуется 3 до 5 ключевых слов и 1 до 2 вопросов; с ростом значения польза снижается. Обе функции увеличивают время обработки и расход токенов.
RAPTOR
RAPTOR группирует фрагменты по смысловой близости, просит чат-модель кратко пересказать каждую группу и повторяет это по уровням, пока не получится дерево от исходных фрагментов до общего резюме. Резюме попадают в индекс как дополнительные фрагменты, поэтому вопросы, требующие свести несколько мест документа, находят материал.
Включается переключателем «Использовать RAPTOR». Параметры: «Промпт» (рекомендуется оставить как есть), «Макс. токенов» на резюме, «Порог» сходства для объединения в кластер (выше порог, меньше фрагментов в кластере), «Макс. кластеров» и «Случайное зерно». Стоимость заметная: память, время и токены на каждом уровне. Включайте для баз с многошаговыми вопросами, не включайте для справочников и FAQ.
Граф знаний
Переключатель «Извлечь граф знаний» добавляет шаг, на котором модель извлекает из фрагментов сущности и связи и строит единый граф по всей базе. Поля: «Типы сущностей» (по умолчанию organization, person, event, category), «Метод» («Легкий» по умолчанию, экономнее; «Общий» на промптах GraphRAG), «Разрешение сущностей» (объединение похожих сущностей, дороже) и «Генерация отчетов сообществ» (резюме кластеров сущностей, дороже).
Граф обновляется только при обработке нового документа; удаление файла граф не перестраивает. Чтобы ассистент использовал граф, включите «Использовать граф знаний» в его настройках. Граф полезен для вопросов о связях между людьми, организациями и событиями и заметно удлиняет и обработку, и ответ.
PageRank
«PageRank» задаётся для базы целиком целым числом от 0 до 100 и прибавляет к оценке её фрагментов постоянную величину, поэтому при поиске по нескольким базам одного ассистента фрагменты базы с большим значением выходят раньше. Ноль означает «выключено». Параметр поддерживается только при поисковом движке Elasticsearch; в установках на Infinity он не применяется.
Примечание
Если обработка идёт слишком долго, проверьте, что включено: RAPTOR, граф знаний, авто-ключевые слова, авто-вопросы, OCR для текстовых PDF.
Спросить Сему