pdf-parsing

Предоставляет полностью локальную, офлайн-утилиту для пакетного извлечения PDF (extract_to_markdown.py), которая изолирует счета в invoices/ и преобразует PDF в чистый…

npx skills add https://github.com/google-gemini/gemini-managed-agents-templates --skill pdf-parsing

PDF Invoice Local Extraction

This skill exposes a 100% offline, local PDF batch extraction utility (extract_to_markdown.py) that isolates all invoice documents inside the invoices/ directory and exports them into clean, readable Markdown files (.md).

This runs entirely offline without any external network, server, or API key dependencies. This decouples raw text extraction from structuring, allowing you (the LLM agent) to perform robust, flexible data extraction natively without relying on fragile regular expressions.

Batch Extraction Tool: extract_to_markdown.py

Processes a directory of PDF invoices sequentially, isolating all PDFs into a dedicated invoices/ subdirectory and converting each to a matching .md file.

python3 skills/pdf-parsing/scripts/extract_to_markdown.py --workspace .agents/workspace
  • Standard PDF Files: Uses pypdf locally to instantly extract text and save it as <filename>.md under .agents/workspace/invoices/.

Agent Orchestration Guidelines

As the LLM agent, you should coordinate the invoice structuring workflow as follows:

  1. Move and Batch Extract: Execute the batch extraction tool:

    python3 /.agents/skills/pdf-parsing/scripts/extract_to_markdown.py --workspace .agents/workspace
    

    This isolates all invoices inside .agents/workspace/invoices/ and populates the folder with matching <invoice_name>.md files.

  2. LLM-Native Structuring: Read the generated .md files under .agents/workspace/invoices/. Use your own agent reasoning (LLM context) to natively extract the structured fields from the markdown:

    • merchant_name
    • date (format: YYYY-MM-DD)
    • amount (float)
    • invoice_number
    • source_file
  3. Compile Structured Database: Combine all structured invoice objects into a single JSON list and save it directly as .agents/workspace/parsed_invoices.json using your file creation tools, matching this schema:

    [
      {
        "date": "2026-05-15",
        "merchant_name": "Google",
        "amount": 150.00,
        "invoice_number": "INV-GCP-1029",
        "source_file": "google_invoice.png"
      }
    ]
    

Dependencies

  • pypdf (>= 4.0.0)

Больше skills от google-gemini

agent-tui
google-gemini
Main Agents: Do NOT use this skill directly. If you need to test the TUI, invoke the `tui_tester` subagent. Drive terminal UI (TUI) applications…
gemini-api-cli
google-gemini
Руководство по использованию инструмента командной строки Gemini API. Используйте, когда вам нужно взаимодействовать с Gemini API через командную строку, управлять агентами или генерировать медиа (изображения,…
behavioral-evals
google-gemini
Руководство по созданию, запуску, исправлению и продвижению поведенческих оценок. Используется при проверке логики принятия решений агентом, отладке сбоев, отладке подсказок…
gemini-live-api-dev
google-gemini
Реализация двусторонней потоковой передачи в реальном времени с Gemini через WebSockets для аудио-, видео- и текстовых диалогов. Поддерживает ввод/вывод аудио (16 кГц PCM), видеокадры, текст и автоматические транскрипции с обнаружением голосовой активности для обработки прерываний. Включает встроенные аудиофункции: аффективный диалог, упреждающее аудио и режим размышления; вызов функций для синхронного и асинхронного использования инструментов; а также привязку к Google Search. Предлагает управление сессиями с сжатием контекста, возобновлением и...
gemini-omni-flash-api
google-gemini
Используйте этот навык для генеративного видеомонтажа, преобразования текста в видео, генерации видео по изображению-референсу и анимации переходов от первого кадра к видео с помощью…
gemini-api-dev
google-gemini
Создавайте приложения с моделями Google Gemini, поддерживающими мультимодальный контент, вызов функций и структурированные выходные данные на Python, JavaScript, Go и Java. Доступ к текущим моделям Gemini 3 (Pro, Flash, Pro Image) с контекстом в 1 миллион токенов; устаревшие модели Gemini 2.x и 1.5 больше не поддерживаются. Поддерживается генерация текста, понимание изображений, аудио и видео, вызов функций, структурированный вывод JSON, выполнение кода, кэширование контекста и эмбеддинги. Официальные SDK: google-genai (Python),...
gemini-interactions-api
google-gemini
Унифицированный интерфейс для моделей и агентов Gemini с состоянием на стороне сервера, потоковой передачей и оркестрацией инструментов. Поддерживает несколько актуальных моделей (gemini-3-flash-preview, gemini-3-pro-preview, gemini-2.5-flash/pro) и агента Deep Research; автоматически заменяет устаревшие идентификаторы моделей на актуальные альтернативы. Выгружает историю диалога на сервер через previous_interaction_id для многошаговых взаимодействий с сохранением состояния без ручного управления историей. Встроенная оркестрация инструментов, включая...
deliver
google-gemini
Публикует сжатую версию брифинга во входящий вебхук Google Chat или Slack, так что ежедневный запуск доставляет себя сам — молча пропускается, когда вебхук не…