gpu-document-processing

Use when processing large PDFs, document collections, or bulk text extraction tasks that benefit from GPU-accelerated processing. Triggers when the user…

npx skills add https://github.com/langchain-ai/deepagents --skill gpu-document-processing

GPU Document Processing Skill

Process large documents and document collections using GPU-accelerated tools. This skill uses the sandbox-as-tool pattern: the agent runs on CPU for reasoning, and sends document processing work to a GPU-equipped environment.

When to Use This Skill

Use this skill when:

  • Processing large PDF files (50+ pages)
  • Analyzing collections of documents (10+ files)
  • Extracting structured data from unstructured documents
  • Performing bulk text extraction and chunking
  • Generating embeddings for large document sets
  • The user uploads or references large documents for analysis

Architecture: Sandbox as Tool

This skill follows the sandbox-as-tool pattern for GPU execution:

  1. Agent reasons on CPU - planning, synthesis, report writing
  2. Processing sent to GPU sandbox - document parsing, embedding, extraction
  3. Results returned to agent - structured output for further analysis

This separation ensures:

  • API keys stay outside the sandbox (security)
  • Agent state persists independently of processing jobs
  • Processing can be parallelized across documents
  • Cost-efficient: GPU used only during processing, not during reasoning

Capabilities

PDF Text Extraction

Extract text content from PDF documents with layout preservation:

  • Headers, paragraphs, lists, and tables detected separately
  • Page numbers and section boundaries preserved
  • Multi-column layout handling

Tabular Data Extraction

Extract tables from documents into structured formats:

  • PDF tables to CSV/DataFrames using GPU-accelerated parsing
  • Automatic column type detection
  • Handles merged cells and multi-row headers

Document Chunking

Split large documents into meaningful chunks for analysis:

  • Semantic chunking (by topic/section boundaries)
  • Fixed-size chunking with overlap for embedding
  • Configurable chunk sizes (default: 512 tokens)

Embedding Generation

Generate vector embeddings for document chunks:

  • Uses NVIDIA NeMo Retriever NIM for GPU-accelerated embedding
  • Supports batch processing for large document sets
  • Compatible with standard vector stores (Milvus, ChromaDB)

Workflow

  1. Receive document reference from the orchestrator
  2. Determine processing type (extraction, analysis, embedding)
  3. Send to GPU sandbox for processing
  4. Collect structured results (text, tables, embeddings)
  5. Write findings to /shared/ for the orchestrator to synthesize

Processing Large Document Collections

For multiple documents:

  1. Process documents in parallel batches (3-5 concurrent)
  2. Extract key metadata first (title, date, author, page count)
  3. Generate per-document summaries
  4. Cross-reference findings across documents
  5. Write consolidated findings with per-document citations

Output Format

When reporting document processing results:

  • Include document metadata (filename, pages, size)
  • Structure extracted content by section/chapter
  • Format tables as markdown tables
  • Include page references for all extracted content
  • Note any extraction quality issues (scanned images, corrupted pages)

Integration with NVIDIA NIM

For production deployments, GPU document processing can leverage:

  • NVIDIA NeMo Retriever: GPU-accelerated embedding and retrieval
  • NVIDIA RAPIDS cuDF: Tabular data processing from extracted tables
  • NVIDIA Triton: Scalable inference for document classification models

See NVIDIA's NIM documentation for self-hosted deployment options.

Más skills de langchain-ai

langgraph-docs
langchain-ai
Accede a la documentación de LangGraph para construir agentes con estado y flujos de trabajo multiagente. Obtiene la documentación oficial de LangGraph en Python que cubre máquinas de estado, diseño de agentes basado en grafos y patrones de intervención humana. Prioriza la documentación relevante según el tipo de consulta: guías de implementación para preguntas de procedimiento, páginas conceptuales para teoría, tutoriales para ejemplos completos y referencias de API para detalles técnicos. Selecciona automáticamente de 2 a 4 URL de documentación más relevantes y recupera su contenido para responder...
official
langgraph-human-in-the-loop
langchain-ai
Pausar la ejecución del grafo para revisión, aprobación o validación humana, luego reanudar con su entrada. Requiere tres componentes: un checkpointer (InMemorySaver o PostgresSaver), un ID de hilo en la configuración y cargas de interrupción serializables en JSON. interrupt(value) pausa y expone datos; Command(resume=value) reanuda y devuelve ese valor al nodo pausado. Todo el código antes de interrupt() se re-ejecuta al reanudar, por lo que los efectos secundarios deben ser idempotentes (usar upsert, no insert). Soporta flujos de aprobación,...
official
web-research
langchain-ai
Usa esta habilidad para solicitudes relacionadas con investigación web; proporciona un enfoque estructurado para realizar investigaciones web exhaustivas.
official
langchain-oss-primer
langchain-ai
SIEMPRE EMPIEZA AQUÍ para cualquier proyecto de construcción de agentes LangChain, Deep Agents o LangGraph. Punto de partida requerido antes de elegir otras habilidades o escribir cualquier…
official
skill-creator
langchain-ai
Guía para crear habilidades efectivas que extiendan las capacidades del agente con conocimientos especializados, flujos de trabajo o integraciones de herramientas. Usa esta habilidad cuando el usuario…
official
social-media
langchain-ai
Redacta publicaciones para redes sociales específicas de cada plataforma, con contenido respaldado por investigación e imágenes complementarias generadas. Admite publicaciones de LinkedIn (1.300 caracteres con tono profesional) e hilos de Twitter/X (280 caracteres por tuit con formato 1/🧵). Requiere delegar la investigación a un subagente antes de redactar, y luego leer los hallazgos para garantizar precisión y relevancia. Genera automáticamente imágenes llamativas para redes sociales usando la herramienta generate_social_image con composiciones audaces y de alto contraste optimizadas para tamaños pequeños...
official
deep-agents-memory
langchain-ai
Backends de memoria y archivos conectables para Deep Agents con opciones de enrutamiento efímero, persistente e híbrido. Cuatro tipos de backend: StateBackend (efímero, con ámbito de hilo), StoreBackend (persistente entre sesiones), FilesystemBackend (acceso real a disco para desarrollo local) y CompositeBackend (enruta diferentes rutas a diferentes backends). FilesystemMiddleware proporciona seis herramientas de operación de archivos: ls, read_file, write_file, edit_file, glob, grep. CompositeBackend utiliza coincidencia de prefijo más largo para enrutar...
official
deep-agents-orchestration
langchain-ai
Orquestrar subagentes, planificar tareas de múltiples pasos y requerir aprobación humana para operaciones sensibles. Delegar trabajo a subagentes especializados mediante la herramienta de tareas; los subagentes personalizados admiten conjuntos de herramientas aislados y mensajes del sistema, mientras que el subagente "de propósito general" predeterminado hereda la configuración del agente principal. Planificar y rastrear flujos de trabajo complejos con write_todos, organizando tareas en estados pendientes, en curso y completados; requiere un thread_id para la persistencia entre invocaciones. Implementar...
official