Загрузка документов
Какие файлы принимает база знаний, что делает обработка с PDF, Word, Excel, презентациями и изображениями, как читать статусы и сообщения прогресса, когда нужна повторная обработка и где смотреть фрагменты.
Документ становится доступен ассистенту только после загрузки и успешной обработки. Эта статья описывает путь файла от кнопки «Добавить файл» до списка фрагментов.
Загрузка
- Откройте «База знаний», выберите базу и перейдите на вкладку «Документы».
- Нажмите «Добавить файл», выберите файлы в проводнике или перетащите их в область загрузки. Файлов может быть несколько, каждый загружается отдельно; интерфейс ограничивает размер одного файла одним гигабайтом.
- Проверьте имена и размеры и нажмите «Загрузить».
- Если в окне загрузки есть переключатель «Обработать сразу», оставьте его включённым, чтобы обработка началась автоматически. Иначе отметьте документы в списке и нажмите «Обработать».
Второй способ: загрузить файл в раздел «Управление файлами» и связать его с одной или несколькими базами значком цепочки «Связать с Базой Знаний». Тогда при удалении базы или документа исходный файл сохранится в файловом хранилище.
Совет
Перед загрузкой проверьте, что выбрана нужная организация и нужная база, что документ не защищён паролем и что такой файл ещё не загружен. Исправленную версию не загружайте под прежним именем без пометки о версии, если старый документ должен остаться в базе.
Поддерживаемые форматы
| Формат | Что делает обработка |
|---|---|
| Анализатор PDF распознаёт структуру страниц, таблицы и текст сканов (OCR). Для чисто текстовых PDF можно выбрать режим «Простой», он быстрее, но берёт только текстовый слой | |
| Word (DOC, DOCX) | Извлекаются текст, заголовки и таблицы. Обрабатывается отдельно от PDF, настройки анализатора PDF на него не влияют |
| Excel (XLS, XLSX, CSV) | По умолчанию каждая строка превращается в пары «заголовок столбца: значение». Для сложных таблиц с объединёнными ячейками включают «Excel в HTML» |
| PowerPoint (PPT, PPTX) | Текст слайдов; при методе «Презентация» каждый слайд становится отдельным фрагментом |
| Текст, Markdown, HTML, JSON | Текст делится по разделителям и порогу размера фрагмента |
| Письма (EML) | Разбираются как письмо: заголовки, тело, вложения |
| Изображения (JPEG, PNG, TIF, GIF и другие) | Текст снимается OCR, описание изображения строит модель распознавания изображений, если она настроена в организации |
| Аудио | Текст получается моделью распознавания речи, если она настроена |
Если формат не распознан, загрузка завершится сообщением об ошибке формата. Что именно происходит с файлом, определяет метод фрагментации базы или документа, см. Методы фрагментации.
Статусы обработки
В списке документов есть колонки «Название», «Фрагменты», «Размер», «Дата загрузки», «Метод фрагментации» и «Статус обработки».
| Статус | Значение | Что делать |
|---|---|---|
| ОЖИДАЕТ | Документ загружен, обработка не запущена или стоит в очереди | Запустить «Обработать» или подождать |
| ОБРАБАТЫВАЕТ | Идёт разбор, разрезание и индексация | Дождаться завершения; документ в это время удалить нельзя |
| УСПЕШНО | Фрагменты записаны в индекс | Проверить число фрагментов и сделать контрольный поиск |
| ОТМЕНЕНО | Обработка остановлена пользователем | Запустить заново, если нужно |
| ОШИБКА | Обработка прервана | Открыть сообщения прогресса и передать их владельцу базы |
В поиске участвуют только документы со статусом «УСПЕШНО» и включённым переключателем в колонке состояния («Включено»). Выключенный документ остаётся в базе, но не попадает в ответы.
Сообщения прогресса
У каждого документа есть поля «Начато в», «Длительность» и «Прогресс». В прогрессе по шагам видно, что делает обработка: распознавание страниц, создание фрагментов с их числом, построение векторов, запись в индекс и итоговое время. При включённых дополнительных функциях (ключевые слова, вопросы, теги, граф знаний, RAPTOR) появляются отдельные шаги, и обработка идёт заметно дольше.
После индексации выводится оценка качества: «Качество индекса: N/M подозрительных фрагментов» с причинами (пустые, пустые таблицы, повреждённый текст, слишком короткие, преимущественно символы). Высокая доля подозрительных фрагментов сопровождается предупреждением с советом повторить обработку, например включить OCR всей страницы или сменить режим обработки таблиц. Сообщение с префиксом ошибки говорит о причине остановки: превышен допустимый размер, файл не найден в хранилище, задача отменена.
Повторная обработка
Изменение настроек базы не меняет уже созданные фрагменты. После смены анализатора PDF, размера фрагмента или метода нужно отметить документы и нажать «Обработать». Платформа спросит подтверждение на очистку существующих фрагментов; после этого старые фрагменты удаляются и создаются новые.
Метод можно поменять для одного документа, не трогая базу: в действиях документа откройте «Метод фрагментации», выберите метод и параметры (для PDF, например, диапазон страниц) и сохраните. Перед повторной обработкой запишите текущее число фрагментов и результат контрольного поиска, чтобы сравнить качество.
Удаление и замена
Удаление выполняется из действий документа кнопкой «Удалить» с подтверждением. Фрагменты документа удаляются из индекса, и ассистенты перестают на него ссылаться. Если документ участвовал в графе знаний, связанные узлы удаляются, но сам граф обновится только при обработке следующего документа.
Чтобы заменить документ новой версией, загрузите новый файл, дождитесь статуса «УСПЕШНО», проверьте его контрольным поиском и только потом удалите старый. Так в базе не будет периода без документа.
Внимание
Удаление и повторная обработка меняют ответы всех ассистентов, которые используют базу. Перед массовыми действиями предупредите владельцев ассистентов.
Просмотр и правка фрагментов
Нажмите название обработанного документа: откроется страница фрагментов. Здесь можно:
- переключать режим «Полный текст» и «Сокращенный», искать по фрагментам;
- включать и выключать отдельные фрагменты, в том числе пакетно («Выбрать все», «Включить выбранные», «Отключить выбранные», «Удалить выбранные»);
- открыть фрагмент двойным щелчком, поправить текст, добавить «Ключевое слово» или «Вопрос». Ключевые слова повышают фрагмент в выдаче по запросам с этими словами; заданные вопросы используются при построении вектора фрагмента.
Проверяйте начало, середину и конец документа, таблицы (заголовки, числа, единицы измерения) и качество распознанного текста у сканов. Документ целиком открывается кнопкой просмотра и позволяет сопоставить фрагмент с исходной страницей.
Как проверить, что база находит нужные фрагменты: Проверка поиска по базе.
Спросить Сему