Cómo extraer texto de un PDF escaneado, gratis
12 de agosto de 2026 · actualizado el 15 de agosto de 2026
Algunos PDF te dejan seleccionar y copiar texto; otros se resisten. La diferencia está en lo que llevan dentro: un PDF digital contiene datos de texto reales, mientras que un PDF escaneado contiene fotografías de páginas; para el ordenador, cada página es una única imagen grande.
Primero: ¿cuál de los dos tienes?
Abre el PDF e intenta seleccionar una frase con el ratón.
- El texto se resalta línea a línea → PDF digital. La extracción es trivial e instantánea.
- Obtienes un recuadro de selección rectangular, o nada → PDF escaneado. Necesitas OCR.
- Algunas páginas se seleccionan y otras no → documento mixto, habitual en contratos donde se volvió a escanear una página firmada.
- Puedes seleccionar, pero lo copiado es basura (
□□□, una sopa de signos de puntuación o letras en el sitio equivocado) → la capa de texto está rota. Trátalo como un escaneo.
No hace falta comprobarlo a mano. La herramienta para extraer texto de un PDF inspecciona cada página y elige automáticamente entre leer la capa de texto o aplicar OCR. Si la pasada automática sigue saliendo mal codificada, usa Volver a extraer con OCR para forzar la vía visual en todas las páginas.
Extraer el texto de un PDF escaneado
- Abre la herramienta para extraer texto de un PDF.
- Arrastra tu PDF sobre la página.
- Observa el progreso página a página. Las que tienen una capa de texto utilizable se leen directamente (rápido); las escaneadas o defectuosas se dibujan y pasan por OCR (unos segundos cada una).
- Copia o descarga el texto combinado.
¿Necesitas un párrafo y no el archivo entero? En la vista previa, dibuja un recuadro o haz clic en un bloque y extrae esa zona. El resto del documento se queda en la vista del resultado completo.
Todo ocurre en tu navegador: pdf.js analiza el archivo y las páginas escaneadas las procesa un motor neuronal ejecutándose como WebAssembly. El archivo nunca se sube, y eso importa, porque los PDF escaneados son muy a menudo contratos, facturas y expedientes.
El OCR de esas páginas lee texto impreso en español, inglés, alemán, francés, japonés y coreano, además de chino. Las páginas con capa de texto digital no están limitadas por esa lista: se puede copiar cualquier glifo que el PDF guarde realmente.
Lo que la herramienta limpia por ti
La extracción en bruto de un PDF tiene algunas molestias clásicas:
- Encabezados, pies y números de página se repiten en todas las páginas. Las líneas que reaparecen en la mayoría de páginas se eliminan automáticamente.
- Saltos de línea rígidos: un PDF guarda el texto como fragmentos colocados, así que los párrafos llegan cortados en líneas de maquetación. Activa Limpiar el texto para unir esas líneas y quitar la partición de palabras al final de cada una.
- Puntuación suelta: las comillas, los paréntesis y los
【】del chino y el japonés suelen apoyarse en una línea base distinta a la de las letras. Una ordenación ingenua deja los“ ”o los( )al principio de la línea. El extractor devuelve esos signos alrededor de la frase. - Tablas: el texto alineado por columnas en una página digital se reconstruye como tabla; las páginas escaneadas con forma de rejilla pasan por un modelo de estructura local.
Sacar mejor resultado de escaneos malos
La calidad del OCR sigue a la calidad del escaneo. Si controlas ese paso:
- Escanea a 300 ppp o más: los tickets a 150 ppp son donde el OCR va a morir.
- Mantén las páginas rectas; una inclinación fuerte perjudica el reconocimiento.
- Prefiere blanco y negro o escala de grises al color en documentos de texto; mejora el contraste.
- Si un escaneo es muy pobre, volver a fotografiar el papel con el móvil y buena luz a veces gana al escaneo original.
Hay más sobre calidad de captura en la guía de resultados de OCR, y sobre cómo distinguir las páginas que son solo imagen de las digitales en cómo convertir una imagen de PDF a texto.
Una nota sobre el tamaño del archivo
Como el procesamiento es local, los documentos grandes cuestan tiempo a tu dispositivo, no al de un servidor. Las páginas digitales se leen a cientos de páginas por minuto; las escaneadas tardan unos segundos cada una. Un informe digital de 300 páginas es rápido; un escaneo puro de 300 páginas llevará un rato: deja la pestaña abierta y que trabaje.