pdf-parsing

Expone una utilidad de extracción por lotes de PDF 100% local y sin conexión (extract_to_markdown.py) que aísla facturas en invoices/ y traduce PDFs a texto limpio…

npx skills add https://github.com/google-gemini/gemini-managed-agents-templates --skill pdf-parsing

PDF Invoice Local Extraction

This skill exposes a 100% offline, local PDF batch extraction utility (extract_to_markdown.py) that isolates all invoice documents inside the invoices/ directory and exports them into clean, readable Markdown files (.md).

This runs entirely offline without any external network, server, or API key dependencies. This decouples raw text extraction from structuring, allowing you (the LLM agent) to perform robust, flexible data extraction natively without relying on fragile regular expressions.

Batch Extraction Tool: extract_to_markdown.py

Processes a directory of PDF invoices sequentially, isolating all PDFs into a dedicated invoices/ subdirectory and converting each to a matching .md file.

python3 skills/pdf-parsing/scripts/extract_to_markdown.py --workspace .agents/workspace
  • Standard PDF Files: Uses pypdf locally to instantly extract text and save it as <filename>.md under .agents/workspace/invoices/.

Agent Orchestration Guidelines

As the LLM agent, you should coordinate the invoice structuring workflow as follows:

  1. Move and Batch Extract: Execute the batch extraction tool:

    python3 /.agents/skills/pdf-parsing/scripts/extract_to_markdown.py --workspace .agents/workspace
    

    This isolates all invoices inside .agents/workspace/invoices/ and populates the folder with matching <invoice_name>.md files.

  2. LLM-Native Structuring: Read the generated .md files under .agents/workspace/invoices/. Use your own agent reasoning (LLM context) to natively extract the structured fields from the markdown:

    • merchant_name
    • date (format: YYYY-MM-DD)
    • amount (float)
    • invoice_number
    • source_file
  3. Compile Structured Database: Combine all structured invoice objects into a single JSON list and save it directly as .agents/workspace/parsed_invoices.json using your file creation tools, matching this schema:

    [
      {
        "date": "2026-05-15",
        "merchant_name": "Google",
        "amount": 150.00,
        "invoice_number": "INV-GCP-1029",
        "source_file": "google_invoice.png"
      }
    ]
    

Dependencies

  • pypdf (>= 4.0.0)

Más skills de google-gemini

agent-tui
google-gemini
Main Agents: Do NOT use this skill directly. If you need to test the TUI, invoke the `tui_tester` subagent. Drive terminal UI (TUI) applications…
gemini-api-cli
google-gemini
Guía para usar la herramienta CLI de la API de Gemini. Úsala cuando necesites interactuar con la API de Gemini a través de la línea de comandos, gestionar agentes o generar contenido multimedia (imágenes,…
behavioral-evals
google-gemini
Guía para crear, ejecutar, corregir y promover evaluaciones conductuales. Úsese al verificar la lógica de decisión del agente, depurar fallos, depurar indicaciones…
gemini-live-api-dev
google-gemini
Transmisión bidireccional en tiempo real con Gemini a través de WebSockets para conversaciones de audio, video y texto. Admite entrada/salida de audio (PCM de 16 kHz), fotogramas de video, texto y transcripciones automáticas con detección de actividad de voz para manejo de interrupciones. Incluye funciones de audio nativas: diálogo afectivo, audio proactivo y modo de pensamiento; llamada a funciones para uso sincrónico y asincrónico de herramientas; y fundamentación con Google Search. Ofrece gestión de sesiones con compresión de contexto, reanudación y...
gemini-omni-flash-api
google-gemini
Usa esta habilidad para edición generativa de video, texto a video, generación de video con referencia de imagen y animaciones de transición de primer fotograma a video utilizando el…
gemini-api-dev
google-gemini
Crea aplicaciones con los modelos Gemini de Google, compatible con contenido multimodal, llamadas a funciones y salidas estructuradas en Python, JavaScript, Go y Java. Accede a los modelos actuales Gemini 3 (Pro, Flash, Pro Image) con contexto de 1 millón de tokens; los modelos heredados Gemini 2.x y 1.5 están obsoletos. Admite generación de texto, comprensión de imágenes/audio/video, llamadas a funciones, salida JSON estructurada, ejecución de código, almacenamiento en caché de contexto y embeddings. SDKs oficiales disponibles: google-genai (Python),...
gemini-interactions-api
google-gemini
Interfaz unificada para modelos y agentes Gemini con estado del lado del servidor, transmisión y orquestación de herramientas. Soporta múltiples modelos actuales (gemini-3-flash-preview, gemini-3-pro-preview, gemini-2.5-flash/pro) y el agente Deep Research; sustituye automáticamente IDs de modelos obsoletos por alternativas actuales. Descarga el historial de conversación al servidor mediante previous_interaction_id para interacciones multi-turno con estado sin gestión manual del historial. Orquestación de herramientas integrada que incluye...
deliver
google-gemini
Publica una versión condensada del informe en un webhook entrante de Google Chat o Slack, de modo que el resumen diario se entregue solo — se omite silenciosamente cuando no hay un webhook…