IureOCR
OCR local con Tesseract: convierte PDFs escaneados e imágenes en PDFs buscables y permite que el modelo lea, renderice y edite páginas de PDF sin subir el documento.
Documentación
IureOCR
Convierte escaneos y fotos de documentos en PDFs con texto buscable, en tu propio ordenador.
Descargar para Linux · Windows · macOS
IureOCR reconoce el texto de PDFs escaneados y fotos de documentos con Tesseract y produce un PDF con texto buscable, listo para subir a Iurefficient. Es una de las aplicaciones de escritorio de Iurefficient y comparte la cuenta, el llavero y la sesión con ellas.
Por qué IureOCR
- Tus documentos permanecen en tu ordenador. El OCR se ejecuta localmente con Tesseract; ni el documento ni el texto se envían a ningún sitio. Solo se necesita una cuenta de Iurefficient para guardar el resultado allí.
- El PDF sigue teniendo el aspecto del original. El resultado conserva la imagen escaneada y añade una
capa de texto invisible encima, para que puedas buscar y copiar, además de un
.txtcon el texto plano. - Expedientes completos de una sola vez. Una cola con progreso por página, y los PDFs que ya tienen texto se omiten en lugar de procesarse de nuevo.
- Herramientas de página incluidas. Ver, eliminar, conservar, rotar y reordenar páginas sin abrir otro programa.
- Funciona con tu asistente de IA.
IureOCR --mcppermite que Claude, GitHub Copilot y otros clientes MCP ejecuten OCR y lean PDFs en este ordenador, sin necesidad de clave de OpenRouter.
Capturas de pantalla
![]() La cola: un archivo en proceso de reconocimiento (página 6 de 14), uno en espera, uno terminado y guardado en Iurefficient, y uno que ya tenía texto. | ![]() El texto reconocido de un documento terminado, listo para seleccionar y copiar. |
![]() Herramientas de página: marca páginas para rotar, conservar o eliminar, o arrástralas a un nuevo orden. | ![]() Configuración → Asistentes de IA: conecta Microsoft 365 Copilot, GitHub Copilot en VS Code o Claude Desktop. |
Características
- OCR local con Tesseract en español e inglés (más idiomas si tu Tesseract los tiene). Nada sale del ordenador: ni el documento ni el texto.
- Acepta PDFs escaneados e imágenes (JPG, PNG, TIFF, BMP, WEBP). El resultado es un PDF
con la imagen original y una capa de texto invisible encima: se puede buscar y copiar,
y el servidor de Iurefficient lo indexa sin procesarlo de nuevo. También deja un
.txtcon el texto plano. - Omite PDFs que ya tienen texto (misma regla que el servidor: menos de 100 caracteres en las tres primeras páginas = necesita reconocimiento). Se puede forzar.
- Cola con progreso por página, cancelar y reintentar. Abrir un archivo no inicia el OCR por sí mismo: permanece como "Sin OCR" para que puedas verlo, editar sus páginas o subirlo, y Reconocer texto (o Reconocer texto en N para todos) lo inicia. La configuración tiene una opción para reconocer archivos en cuanto se abren.
- Visor integrado: desplazamiento continuo, ir a página, zoom (botones,
+/-, Ctrl+rueda) y teclado (RePág, AvPág, Inicio, Fin, Esc). Solo se dibujan las páginas visibles, por lo que los archivos con cientos de páginas se abren sin esperar. Resalta la página que se está reconociendo y muestra el PDF resultante cuando el OCR termina. - Edición de páginas con miniaturas: eliminar páginas, conservar solo las seleccionadas, rotarlas
90°, o reordenarlas arrastrando (también "Al inicio", "Al final" y "Orden inverso"). Cada edición
escribe un nuevo PDF junto al original (
- pages removed,- rotated, …); el original no se modifica. - Añade archivos arrastrándolos a la ventana, abriéndolos con IureOCR desde el sistema o con
enlaces
iureocr://ocr?file=…. - Guardar en Iurefficient: a un proyecto (API REST) o a cualquier carpeta del árbol de documentos (WebDAV). Con la unidad IureDav montada, solo elígela como carpeta de salida.
- Para editar el resultado sugiere OnlyOffice Desktop Editors: lo detecta si está instalado y, si no, enlaza a su descarga. No viene incluido.
- Interfaz en inglés y español: inglés por defecto, y español si el sistema operativo está configurado en español; se puede cambiar en Configuración → Apariencia. Esto es independiente de los idiomas de texto que reconoce Tesseract.
Previsto para próximas versiones (ver el CHANGELOG): fusionar PDFs, dividir por rangos, protección con contraseña, marca de agua y números de página; compresión real de imágenes; rescate de páginas ilegibles con un modelo de visión; la lista de documentos pendientes de OCR de la instancia; y Tesseract incluido también en macOS.
Descarga e instalación
Obtén el instalador desde la última versión:
| Archivo | Sistema |
|---|---|
IureOCR_<version>_1-windows-x64.exe (o .msi) | Windows 10/11, x64. Tesseract está incluido. |
IureOCR_<version>_2-macos-universal.dmg | macOS 12 o posterior, Intel y Apple Silicon. Necesita brew install tesseract. |
IureOCR_<version>_3-linux-x64.deb / .rpm | Debian/Ubuntu o Fedora. Instalan Tesseract con español e inglés como dependencias. |
IureOCR_<version>_3-linux-x64.AppImage | Cualquier otra distribución de Linux. Instala Tesseract desde tu distribución primero. |
Los instaladores no están firmados con código, por lo que Windows y macOS avisan la primera vez que los abres; ver Política de firma de código para saber qué significa y cómo continuar.
Tesseract en cada sistema
| Sistema | De dónde viene Tesseract | Modelos de idioma |
|---|---|---|
| Linux | el paquete del sistema: los .deb/.rpm dependen de tesseract-ocr con spa y eng | los incluidos con la aplicación (tessdata_fast) |
| Windows | incluido en el instalador (compilación UB Mannheim, Apache-2.0) | incluidos |
| macOS | brew install tesseract (no incluido por ahora) | incluidos |
La aplicación busca Tesseract en este orden: la variable IUREOCR_TESSERACT, el que está dentro
del instalador, las rutas habituales del sistema y el PATH. La configuración muestra cuál encontró, su
versión y los idiomas disponibles.
Cómo funciona por dentro
- pdfium rasteriza cada página del PDF a JPEG en la resolución elegida (300 ppp por defecto). Las imágenes se pasan tal cual.
- Tesseract recibe la lista de páginas y produce el PDF con la capa de texto por sí mismo
(su renderizador
pdf, el mismo que usa ocrmypdf) y el.txt. - El resultado se guarda junto al original con el sufijo
- OCR(configurable) o en una carpeta fija.
Un PDF que ya tiene texto legible no se rasteriza: la aplicación lo indica y ofrece forzarlo.
Uso desde Claude, Copilot y otros agentes (MCP)
IureOCR --mcp inicia un servidor MCP sobre stdio, sin
ventana. Claude Desktop, Claude Code, Copilot en VS Code o cualquier cliente MCP puede entonces usar las herramientas
de OCR y PDF en este ordenador. El OCR se ejecuta aquí y el modelo del cliente lee el texto y hace
el resto, por lo que no se necesita clave de OpenRouter. Solo el texto que el agente elige leer sale del
ordenador.
| Herramienta | Qué hace |
|---|---|
ocr_file | OCR de un PDF escaneado o una imagen; escribe el PDF buscable y el .txt junto al original y devuelve el texto |
extract_text | Lee la capa de texto de un PDF por rango de páginas (o un .txt), para documentos largos |
pdf_info | Páginas, tamaños y si el PDF ya tiene texto |
render_page | Una página como imagen, para que el modelo pueda ver firmas, sellos o tablas |
edit_pdf_pages | Eliminar, conservar, rotar o reordenar páginas (nuevo archivo) |
ocr_languages | Versión de Tesseract e idiomas instalados |
El original nunca se modifica y las rutas deben ser absolutas. Los idiomas, la resolución y la carpeta
de salida provienen de la configuración de la aplicación. El registro va a iureocr-mcp.log, junto al de la aplicación.
IureOCR --mcp-config imprime qué pegar en la configuración del cliente, con la
ruta real del ejecutable:
{ "mcpServers": { "iureocr": { "command": "/path/to/IureOCR", "args": ["--mcp"] } } }
En IureOCR, Configuración → Asistentes de IA detecta qué asistentes hay en el ordenador y conecta cada uno de la forma que le funciona:
- Microsoft 365 Copilot (el que casi todo el mundo tiene) no puede usar programas del
ordenador, pero sí puede usar el servidor MCP de la instancia de Iurefficient. Mientras estés
conectado, Crear acceso para Copilot genera un token
iurmcp_…(válido por un año) y muestra la URL del servidor y los pasos para añadirlo a un agente en Copilot Studio (cabeceraX-MCP-Token). Copilot ve lo que el usuario ve en Iurefficient; para que lea un escaneo, guarda el resultado del OCR allí. Los tokens se revocan desde la misma fila. - GitHub Copilot en VS Code: Conectar abre el enlace
vscode:mcp/install?…; VS Code pide confirmación y guarda el servidor en su configuración. IureOCR no la escribe. - Claude Desktop: Conectar añade la entrada a
claude_desktop_config.jsonsin tocar nada más (se guarda una copia.bak-iureocr) y avisa si la aplicación se ha movido. Luego cierra y vuelve a abrir Claude Desktop.
Otros clientes: claude mcp add iureocr -- /path/to/IureOCR --mcp en Claude Code, o la
entrada --mcp-config en su configuración.
Parte de la suite Iurefficient
| Aplicación | Qué hace |
|---|---|
| IureTranscribe | Transcripción local con Whisper, grabación en vivo con quién habló, resúmenes y actas. |
| iureditor | Editor Markdown WYSIWYG con Mermaid, LaTeX y exportación a PDF/DOCX. |
| IureDav | Monta un servidor WebDAV (o Iurefficient) como unidad. |
| IureOCR | OCR local que convierte escaneos en PDFs buscables. |
| iureTI | Sonda de descubrimiento de activos de TI para el inventario de Iurefficient. |
Contribuciones
Las incidencias y solicitudes de extracción son bienvenidas. Buenas primeras contribuciones:
- Informes de errores con el archivo de registro adjunto (ver Dónde guarda las cosas para su ubicación), y el sistema y la versión que usas.
- Traducciones: un nuevo idioma de interfaz es un nuevo diccionario en
src/lib/i18n.svelte.ts, junto a los de inglés y español. - Documentación: correcciones y explicaciones más claras en este README.
Para compilar y ejecutar la aplicación, ver Desarrollo más abajo.
Desarrollo
Requisitos, compilación y comprobaciones
Requisitos: Node 22, Rust estable, las dependencias de Tauri 2 para tu sistema y Tesseract
instalado (en Linux sudo apt install tesseract-ocr tesseract-ocr-spa tesseract-ocr-eng).
npm ci
python3 scripts/descargar-pdfium.py # pdfium library for this platform
python3 scripts/descargar-tessdata.py # spa, eng and osd models (tessdata_fast)
npm run tauri dev
En Windows, python3 scripts/descargar-tesseract-windows.py también descarga el Tesseract que
se incluye (requiere 7z).
npm run check # frontend types
cd src-tauri && cargo check # backend
npm run tauri build # installers for this platform
Las capturas de pantalla y GIFs de este README se generan desde la interfaz real con un backend
simulado: ver scripts/readme-media/.
Publicar una versión
Sube la versión en package.json, src-tauri/Cargo.toml y src-tauri/tauri.conf.json,
añade la sección al CHANGELOG y etiqueta:
git commit -am "v0.2.0: …"
git tag -a v0.2.0 -m "IureOCR 0.2.0" && git push --follow-tags
.github/workflows/build.yml se construye en cada push y, con una etiqueta vX.Y.Z, publica el lanzamiento con instaladores para Windows (1-windows-x64), macOS (2-macos-universal) y Linux (3-linux-x64, .deb, .rpm y AppImage), además del latest.json del actualizador. Las actualizaciones están firmadas con la clave minisign de la aplicación (~/.tauri/iureocr-updater.key). El flujo de trabajo también incluye pasos de firma Authenticode mediante SignPath, que solo se ejecutan cuando existen el secreto y las variables SIGNPATH_*; no están configurados, por lo que los instaladores de Windows se publican sin firmar.
Actualizaciones
Al iniciar (se puede desactivar en Configuración) y con Buscar ahora, la aplicación busca una versión más reciente. El actualizador de Tauri la instala desde dentro de la aplicación y verifica primero su firma minisign. Cada instalación recibe su propio tipo de paquete: el .exe en Windows, el .app.tar.gz en macOS, el AppImage o el .deb/.rpm (instalar uno de estos solicita la contraseña de administrador). Si la actualización no se puede instalar, la aplicación muestra el error y un botón para abrir la página de descarga.
Dónde guarda las cosas
| Qué | Linux | Windows | macOS |
|---|---|---|---|
| Configuración | ~/.config/com.iurefficient.iureocr/settings.json | %APPDATA%\com.iurefficient.iureocr\settings.json | ~/Library/Application Support/com.iurefficient.iureocr/settings.json |
| Registro | ~/.local/share/com.iurefficient.iureocr/logs/iureocr.log | %APPDATA%\com.iurefficient.iureocr\logs\iureocr.log | ~/Library/Application Support/com.iurefficient.iureocr/logs/iureocr.log |
Las credenciales van al llavero del sistema, compartido con las otras aplicaciones de Iurefficient; la cuenta activa (instancia y correo electrónico) vive en <config>/iurefficient/.
Política de firma de código
- Los instaladores de Windows no están firmados con código por ahora. La primera vez que ejecutes uno, SmartScreen puede mostrar "Windows protegió tu PC" con un editor desconocido: elige Más información → Ejecutar de todos modos.
- macOS: la aplicación no está notarizada por Apple. La primera vez, haz clic derecho (o Control-clic) en IureOCR en Aplicaciones y elige Abrir, o ve a Configuración del sistema → Privacidad y seguridad y haz clic en Abrir de todos modos.
- Cada instalador se construye desde este repositorio mediante GitHub Actions (
.github/workflows/build.yml) y se publica solo en la página de lanzamientos. Descárgalo desde allí. - Lo que está firmado: los paquetes de actualización (
.exe,.msi,.app.tar.gz, AppImage,.deby.rpm) llevan una firma minisign (archivos.sigylatest.json), y la aplicación la verifica contra la clave pública que incluye antes de instalar una actualización. - Mantenedor (commits y revisiones): Eduardo Llaguno (@ellaguno).
Política de privacidad
Este programa no transferirá ninguna información a otros sistemas en red a menos que el usuario o la persona que lo instala u opera lo solicite específicamente.
El reconocimiento de texto se ejecuta completamente en el ordenador del usuario con Tesseract; los documentos nunca salen de la máquina. Específicamente, IureOCR se conecta solo a:
- la instancia de Iurefficient que el usuario configura, y solo una vez que se ha establecido una cuenta: para comprobar la sesión (al iniciar y en Configuración), y cuando el usuario inicia sesión, guarda un documento allí o gestiona los tokens de acceso para Copilot. Sin una cuenta, nunca se contacta con ella;
- GitHub (
api.github.comy los archivos de lanzamiento engithub.com): al iniciar, para comprobar si existe una versión más reciente (se puede desactivar en Configuración), y cuando se abre Configuración, para mostrar la última versión de las otras aplicaciones de Iurefficient.
No recopila telemetría ni estadísticas de uso. Las credenciales se almacenan en el llavero del sistema operativo, nunca en archivos de configuración.
Licencia
Licencia Apache 2.0 (ver LICENSE). Tesseract (Apache-2.0), pdfium (BSD-3) y los modelos tessdata_fast (Apache-2.0) conservan sus propias licencias.



