domovoy_bot/services/gis_pdf_pipeline/SPECKIT_SPEC.md

2.5 KiB
Raw Permalink Blame History

🎯 SPECKIT_SPEC: Требования

1. ЧТО мы строим? (User Story)

Как владелец юридического архива, я хочу, чтобы все сырые данные (скриншоты и ZIP с вложениями), выкачанные Жнецом из ГИС ЖКХ, автоматически обрабатывались, тегировались и собирались в один большой структурированный PDF-файл. Этот файл должен автоматически загружаться на Google Drive для последующего анализа в NotebookLM.

2. ЗАЧЕМ? (Бизнес-ценность)

NotebookLM лучше всего работает с едиными, хорошо структурированными и размеченными документами. Добавление тегов (Номер обращения, Дата, Время) прямо на страницы PDF обеспечивает жесткий "Grounding" — NotebookLM сможет давать точные ссылки на даты при генерации исковых заявлений, исключая галлюцинации ИИ.

3. Критерии приемки (Acceptance Criteria)

  1. Скрипт перебирает все папки в /volume1/web/legal/gis/raw/.
  2. Извлекает evidence.png, распознает на нем номер обращения, статус, дату и время.
  3. Конвертирует evidence.png в PDF, накладывая поверх картинки жирный текстовый тег (например, [ОБРАЩЕНИЕ №73... | ДАТА: ...]).
  4. Распаковывает attachments.zip.
  5. Конвертирует документы (Word, TXT, картинки) из ZIP в PDF. Если это уже PDF — просто читает его.
  6. Накладывает те же текстовые теги на первую (или каждую) страницу вложенных документов.
  7. Склеивает скриншот-PDF и вложения-PDF в единый блок по данному обращению.
  8. Склеивает все блоки обращений в один файл TOTAL_GIS_ARCHIVE.pdf.
  9. Загружает файл на Google Диск, перезаписывая старую версию.
  10. Отправляет уведомление в Telegram об успешной загрузке.