ToolGenie

OCR de PDF

Haz buscables los PDFs escaneados con OCR.

Loading tool…

Cómo usar OCR de PDF

  1. Sube el PDF escaneado o de solo imagen.

  2. Elige el idioma del texto del documento.

  3. Haz clic en Ejecutar OCR para reconocer el texto de todas las páginas.

  4. Descarga el PDF con texto buscable.

OCR PDF: convertir un escaneo en un PDF con texto que se puede buscar

Un PDF escaneado es, por dentro, una colección de fotografías: cada página es una imagen y el lector no sabe que en ella hay palabras. Por eso no puedes buscar un término con Ctrl+F, seleccionar un párrafo para copiarlo ni convertirlo a Word con sentido. Hacer OCR a un PDF («ocr pdf», como lo busca casi todo el mundo) consiste en reconocer el texto de esas imágenes y añadirlo como una capa invisible encima, alineada con lo impreso. El documento sigue viéndose exactamente igual, pero ahora es buscable, seleccionable y accesible.

Es el paso previo obligatorio para muchas otras cosas: convertir un escaneo a Word o Excel, resumirlo, traducirlo o simplemente encontrar en un expediente de 200 páginas la única en la que aparece un nombre. Si alguna vez has intentado buscar dentro de un contrato escaneado y el visor te ha dicho «sin resultados» aunque la palabra estaba ahí, esto es lo que faltaba.

Qué cambia y qué no en el PDF después del OCR

El aspecto visual no cambia: las páginas siguen siendo las mismas imágenes, con su resolución, sus manchas y su ligera inclinación si la tenían. Lo que se añade es la capa de texto, con cada palabra reconocida colocada en la posición donde aparece en la imagen. Al seleccionar con el ratón verás resaltarse el texto sobre la imagen, y al copiar obtendrás las palabras, no una captura.

Como la capa se apoya en lo que el motor ha reconocido, su calidad depende de la del escaneo: 300 ppp con la página recta y buen contraste dan un texto casi perfecto; un escaneo a 150 ppp en gris apagado o una foto de móvil producen más errores. Los errores no se ven —la imagen sigue intacta— pero afectan a las búsquedas: si «factura» se reconoció como «faclura», no la encontrarás. Con escaneos malos, conviene buscar por varias palabras del párrafo, no solo por una.

  • Las páginas siguen viéndose idénticas; el OCR no las retoca ni las comprime.
  • El texto reconocido queda en la posición de la imagen, así que copiar y pegar respeta el orden de lectura.
  • Un PDF que ya tenía texto no necesita OCR: pruébalo primero con Ctrl+F.

Elegir bien el idioma y preparar el escaneo

Indica el idioma en que está escrito el documento antes de lanzar el reconocimiento. El motor lo usa para resolver dudas entre caracteres parecidos y para reconocer acentos, eñes y signos de apertura; un contrato en español reconocido con el modelo inglés perderá buena parte de las tildes. Se admiten los principales idiomas de alfabeto latino —español, inglés, francés, alemán y otros—, y la lista sigue creciendo.

Si el escaneo está muy torcido o tiene márgenes negros de la tapa del escáner, corregirlo antes mejora el resultado: enderezar y recortar con las herramientas de rotar y recortar PDF cuesta un minuto y reduce los errores de forma visible. El OCR funciona página a página, así que con documentos largos puedes dejarlo trabajar mientras haces otra cosa en otra pestaña.

Reconocimiento en tu navegador, sin subir el escaneo

Todo el proceso ocurre dentro de tu navegador, con las APIs de WebAssembly y Canvas que tu dispositivo ya incluye. No se sube ningún archivo, no queda ninguna copia y nada espera en la cola de un servidor a ser borrado — por eso mismo la herramienta sigue funcionando con la conexión desactivada.

Los documentos que se escanean y se pasan por OCR son, casi por definición, los más sensibles: historiales médicos, escrituras, expedientes, contratos firmados. Aquí el reconocimiento se ejecuta localmente en tu dispositivo y el PDF resultante se escribe directamente en tu carpeta de descargas, sin pasar por ningún servidor ni quedar en ninguna cola de borrado.

Preguntas frecuentes

¿Qué le hace el OCR a mi PDF?

Lee las imágenes de un PDF escaneado y añade encima una capa de texto invisible, de modo que puedes buscar, seleccionar y copiar el texto mientras las páginas siguen viéndose exactamente igual.

¿Cómo sé si mi PDF necesita OCR?

Ábrelo y prueba a seleccionar una frase o a buscar una palabra que veas en la página. Si el cursor no selecciona nada o la búsqueda no encuentra un término que está a la vista, el PDF es solo imagen y necesita OCR.

¿Qué idiomas admite el OCR de PDF?

Los principales idiomas de alfabeto latino, entre ellos español, inglés, francés y alemán, y se van añadiendo más. Elige el idioma correcto: es lo que permite reconocer bien tildes, eñes y signos de apertura.

¿Pierde calidad el PDF al hacerle OCR?

No. Las páginas no se recomprimen ni se retocan; solo se añade la capa de texto. El archivo resultante pesa apenas unos kilobytes más que el original.

¿Puedo convertir después el PDF escaneado a Word o Excel?

Sí, y de hecho es el orden correcto: primero OCR para que el PDF tenga texto, y después la herramienta de PDF a Word o PDF a Excel, que solo pueden trabajar con texto real.

¿Se hace el OCR en el navegador?

Sí. El reconocimiento corre localmente en tu dispositivo; el PDF escaneado nunca se sube a un servidor.

Herramientas relacionadas

Seguir leyendo

  • Cómo editar un PDF escaneado

    Tu PDF no contiene texto: las páginas son fotografías. Estas son las tres formas de resolverlo y cómo saber cuál necesita tu documento.

¿Buscas otra cosa? Explora todas las herramientas pdf.