Intellos Hub
Шаблонv1.0.0стабильнаязаготовка

Приём нескольких файлов

Проверенная схема приёма до пяти документов: белый список форматов, Docling для DOCX ради нумерации пунктов, штатное извлечение для остального, MinerU для сканов и понятные сообщения вместо падения на битом файле. Основа для приложений, принимающих файлы.

Схема логики

Схема логики: Приём нескольких файлов

Как это работает

  1. Сотрудник: Загружает файлы — список файлов
  2. Автоматически: Берёт каждый файл — по очереди
  3. Документы: Читает DOCX — извлекает текст
  4. Документы: Читает остальные файлы — штатное извлечение
  5. Автоматически: Собирает текст — из прочитанного
  6. Автоматически: Оставляет текст как есть — текст уже полный
  7. Документы: Распознаёт скан — читает изображение
  8. Автоматически: Помечает формат — файл не поддержан
  9. Сотрудник: Файл не читается — сообщение вместо текста
  10. Автоматически: Сводит все файлы — общий результат
  11. Сотрудник: Получает тексты — и количество файлов

Приём нескольких файлов

Проверенная схема входа для приложений, которые принимают документы: каждый файл проходит проверку формата, читается подходящим извлекателем, а сканы распознаются MinerU. На выходе — текст всех файлов, готовый для следующих шагов. Схема измерена на тестовом наборе из 76 файлов и служит основой для своих решений; пригодится ИТ-службе и делопроизводству.

Что на входе

  • Поле формы «Файлы» — до пяти документов за запуск.
  • Пропускаются только проверенные форматы: .docx .pdf .xlsx .pptx .txt .md .markdown .mdx .csv .html .xml .eml.

Что на выходе

  • Текст всех файлов одной строкой: по каждому — номер, число знаков и начало текста.
  • Число обработанных файлов.
  • Вместо текста неподдерживаемого или нечитаемого файла — короткое объяснение; остальные файлы при этом обрабатываются.

Как работает

  1. Файлы обрабатываются по одному в цикле.
  2. Формат вне белого списка получает сообщение «формат не поддерживается» вместо падения всего запуска.
  3. DOCX читает Docling: только он восстанавливает автонумерацию пунктов Word, которую штатное извлечение теряет. Остальные форматы читает штатное извлечение платформы — Docling на русском скане работает минуты и возвращает мусор.
  4. Если текста меньше 200 знаков, а формат может быть сканом (PDF, DOCX, PPTX), файл уходит в MinerU с русским языком. Текстовые по природе форматы на распознавание не отправляются.
  5. Битый файл или PDF с паролем получает понятное сообщение за 3–7 секунд, а не уходит на распознавание.
  6. Тексты всех файлов собираются вместе.

Что настроить после установки

  • Плагин Docling (s20ss/docling) — для DOCX.
  • Плагин MinerU (langgenius/mineru) и его авторизация: Инструменты → MinerU → Авторизация — адрес сервиса, токен и тип сервера.
  • Выход в интернет, если используется официальный сервис MinerU.
  • Модель, базы знаний и секреты не нужны.

Ограничения

  • Конвертации в этой конфигурации нет: .doc, .xls, .ppt, .odt, .rtf, .epub и архивы получают сообщение о формате. Их перед приёмом приводит к читаемому виду решение «Конвертация старых форматов и архивов».
  • Документ больше 15 МБ площадка отклоняет при загрузке; файл без расширения — при запуске.
  • Скан, повёрнутый на 90°, и скан плохого качества MinerU не читает — 0 из 7 реквизитов, без ошибки. На скане обычного качества путаются кириллица и латиница («AKT» вместо «АКТ»).
  • Смешанный PDF (текст плюс страница-скан): текст берётся, страница-скан теряется — порог 200 знаков не срабатывает.
  • TXT в кодировке Windows-1251 теряет кириллицу молча. CSV из русского Excel с разделителем «;» ломается на запятых в числах. Таким пользователям предлагают пересохранить файл в UTF-8.
  • Текст длиннее 390 000 знаков (например, таблица на 10 000 строк) обрезается с пометкой.
  • Пустой файл даёт пустой текст без ошибки — приложение должно сказать об этом пользователю.
  • Итоговая сборка проверочная: с каждого файла показаны первые 300 знаков. Для работы с полным текстом шаг сборки настраивают под задачу.

Проверено

  • 23.09.2026 через эту схему на стенде прогнаны 76 файлов тестового набора: DOCX, PDF с текстом, XLSX, PPTX, MD, HTML, XML, EML извлекаются, договор — 10 из 10 эталонных реквизитов, автонумерация Word — 18 из 18 пунктов второго уровня; многостраничный скан договора — 9 из 10 реквизитов.
  • Отдельный прогон на четырёх файлах сразу (DOCX, PDF с текстом, PDF-скан, .doc): DOCX прочитан Docling, PDF — штатно, скан распознан MinerU за 14 секунд, .doc пропущен с сообщением; весь прогон — 19 секунд.