domovoy_bot/services/gis_pdf_pipeline/SPECKIT_SPEC.md

19 lines
2.5 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 🎯 SPECKIT_SPEC: Требования
## 1. ЧТО мы строим? (User Story)
Как владелец юридического архива, я хочу, чтобы все сырые данные (скриншоты и ZIP с вложениями), выкачанные Жнецом из ГИС ЖКХ, автоматически обрабатывались, тегировались и собирались в один большой структурированный PDF-файл. Этот файл должен автоматически загружаться на Google Drive для последующего анализа в NotebookLM.
## 2. ЗАЧЕМ? (Бизнес-ценность)
NotebookLM лучше всего работает с едиными, хорошо структурированными и размеченными документами. Добавление тегов (Номер обращения, Дата, Время) прямо на страницы PDF обеспечивает жесткий "Grounding" — NotebookLM сможет давать точные ссылки на даты при генерации исковых заявлений, исключая галлюцинации ИИ.
## 3. Критерии приемки (Acceptance Criteria)
1. Скрипт перебирает все папки в `/volume1/web/legal/gis/raw/`.
2. Извлекает `evidence.png`, распознает на нем номер обращения, статус, дату и время.
3. Конвертирует `evidence.png` в PDF, накладывая поверх картинки жирный текстовый тег (например, `[ОБРАЩЕНИЕ №73... | ДАТА: ...]`).
4. Распаковывает `attachments.zip`.
5. Конвертирует документы (Word, TXT, картинки) из ZIP в PDF. Если это уже PDF — просто читает его.
6. Накладывает те же текстовые теги на первую (или каждую) страницу вложенных документов.
7. Склеивает скриншот-PDF и вложения-PDF в единый блок по данному обращению.
8. Склеивает все блоки обращений в один файл `TOTAL_GIS_ARCHIVE.pdf`.
9. Загружает файл на Google Диск, перезаписывая старую версию.
10. Отправляет уведомление в Telegram об успешной загрузке.