Ir al contenido

Cómo extraer texto de un PDF escaneado, gratis

12 de agosto de 2026 · actualizado el 15 de agosto de 2026

Algunos PDF te dejan seleccionar y copiar texto; otros se resisten. La diferencia está en lo que llevan dentro: un PDF digital contiene datos de texto reales, mientras que un PDF escaneado contiene fotografías de páginas; para el ordenador, cada página es una única imagen grande.

Primero: ¿cuál de los dos tienes?

Abre el PDF e intenta seleccionar una frase con el ratón.

  • El texto se resalta línea a línea → PDF digital. La extracción es trivial e instantánea.
  • Obtienes un recuadro de selección rectangular, o nada → PDF escaneado. Necesitas OCR.
  • Algunas páginas se seleccionan y otras no → documento mixto, habitual en contratos donde se volvió a escanear una página firmada.
  • Puedes seleccionar, pero lo copiado es basura (□□□, una sopa de signos de puntuación o letras en el sitio equivocado) → la capa de texto está rota. Trátalo como un escaneo.

No hace falta comprobarlo a mano. La herramienta para extraer texto de un PDF inspecciona cada página y elige automáticamente entre leer la capa de texto o aplicar OCR. Si la pasada automática sigue saliendo mal codificada, usa Volver a extraer con OCR para forzar la vía visual en todas las páginas.

Extraer el texto de un PDF escaneado

  1. Abre la herramienta para extraer texto de un PDF.
  2. Arrastra tu PDF sobre la página.
  3. Observa el progreso página a página. Las que tienen una capa de texto utilizable se leen directamente (rápido); las escaneadas o defectuosas se dibujan y pasan por OCR (unos segundos cada una).
  4. Copia o descarga el texto combinado.

¿Necesitas un párrafo y no el archivo entero? En la vista previa, dibuja un recuadro o haz clic en un bloque y extrae esa zona. El resto del documento se queda en la vista del resultado completo.

Todo ocurre en tu navegador: pdf.js analiza el archivo y las páginas escaneadas las procesa un motor neuronal ejecutándose como WebAssembly. El archivo nunca se sube, y eso importa, porque los PDF escaneados son muy a menudo contratos, facturas y expedientes.

El OCR de esas páginas lee texto impreso en español, inglés, alemán, francés, japonés y coreano, además de chino. Las páginas con capa de texto digital no están limitadas por esa lista: se puede copiar cualquier glifo que el PDF guarde realmente.

Lo que la herramienta limpia por ti

La extracción en bruto de un PDF tiene algunas molestias clásicas:

  • Encabezados, pies y números de página se repiten en todas las páginas. Las líneas que reaparecen en la mayoría de páginas se eliminan automáticamente.
  • Saltos de línea rígidos: un PDF guarda el texto como fragmentos colocados, así que los párrafos llegan cortados en líneas de maquetación. Activa Limpiar el texto para unir esas líneas y quitar la partición de palabras al final de cada una.
  • Puntuación suelta: las comillas, los paréntesis y los 【】 del chino y el japonés suelen apoyarse en una línea base distinta a la de las letras. Una ordenación ingenua deja los “ ” o los ( ) al principio de la línea. El extractor devuelve esos signos alrededor de la frase.
  • Tablas: el texto alineado por columnas en una página digital se reconstruye como tabla; las páginas escaneadas con forma de rejilla pasan por un modelo de estructura local.

Sacar mejor resultado de escaneos malos

La calidad del OCR sigue a la calidad del escaneo. Si controlas ese paso:

  • Escanea a 300 ppp o más: los tickets a 150 ppp son donde el OCR va a morir.
  • Mantén las páginas rectas; una inclinación fuerte perjudica el reconocimiento.
  • Prefiere blanco y negro o escala de grises al color en documentos de texto; mejora el contraste.
  • Si un escaneo es muy pobre, volver a fotografiar el papel con el móvil y buena luz a veces gana al escaneo original.

Hay más sobre calidad de captura en la guía de resultados de OCR, y sobre cómo distinguir las páginas que son solo imagen de las digitales en cómo convertir una imagen de PDF a texto.

Una nota sobre el tamaño del archivo

Como el procesamiento es local, los documentos grandes cuestan tiempo a tu dispositivo, no al de un servidor. Las páginas digitales se leen a cientos de páginas por minuto; las escaneadas tardan unos segundos cada una. Un informe digital de 300 páginas es rápido; un escaneo puro de 300 páginas llevará un rato: deja la pestaña abierta y que trabaje.