Ir al contenido

Extraer texto de un PDF

¿Necesitas extraer texto de un PDF que no te deja seleccionar, o cuya copia sale ilegible? Arrástralo aquí. Las páginas digitales se leen de la capa de texto y las escaneadas se convierten con OCR local. Los encabezados y pies se eliminan.

Arrastra un PDF para copiar su texto

Selección bloqueada, páginas escaneadas o una capa de texto rota: las páginas digitales se leen directamente y los escaneos pasan por OCR aquí mismo.

…o pulsa Ctrl+V / +V para pegar

100 % local: los archivos no salen de tu navegador

Cómo extraer texto de un PDF

01

Arrastra el PDF

Un informe, un artículo, una factura, un libro electrónico o el escaneo de unos papeles. No hay subida: el archivo se abre en esta pestaña.

02

Capa de texto o escaneo, automáticamente

Las páginas con una capa de texto utilizable se extraen directamente. Las escaneadas o defectuosas se renderizan y pasan por OCR en local, página a página, que es lo que realmente exige convertir una imagen de PDF a texto. Puedes forzar el OCR si la capa de texto está mal codificada.

03

Copia un documento limpio

Se eliminan los encabezados, pies y números de página repetidos. Activa la limpieza para unir las líneas cortadas. Las tablas pueden salir como Excel, Markdown o CSV.

Cuando un PDF no te deja copiar

Páginas escaneadas, sin pasos extra

Un «PDF» que en realidad son fotografías de papel no tiene nada que seleccionar: cada página es una imagen. Cada una se comprueba y los escaneos recurren al OCR local por su cuenta, así que convertir una imagen de PDF a texto no es otra herramienta ni otra subida.

Copia sin la basura repetida

Los encabezados, pies y números de página que se repiten se detectan a lo largo del documento y se eliminan del texto combinado.

Copia sin saltos de línea partidos

Un PDF guarda el texto como fragmentos colocados, así que al copiar suele salir una palabra por línea. La limpieza une esas líneas y los guiones sueltos sin reescribir la redacción.

El PDF no sale de esta pestaña

Los contratos y las facturas se quedan en tu dispositivo. pdf.js y el OCR se ejecutan en el navegador. Ni los bytes del archivo ni el texto extraído se suben o registran.

Preguntas frecuentes

¿Por qué no puedo copiar el texto de este PDF?

Suele ser una de tres cosas: las páginas son escaneos (píxeles, sin capa de texto), el archivo bloquea la copia, o la capa de texto está tan mal codificada que copiar da basura. Esta página resuelve las dos primeras automáticamente y «Volver a extraer con OCR» cubre la tercera.

¿Cómo convierto una imagen de PDF a texto?

Arrastra el archivo. Cualquier página sin una capa de texto utilizable se renderiza como mapa de bits y pasa por OCR en local, de modo que las páginas que son solo imagen salen como texto real junto a las digitales. Cuenta con unos segundos por página escaneada.

¿Puedo extraer texto de un PDF escaneado?

Sí. Cada página se comprueba por separado, así que un archivo mixto —un informe digital con un anexo escaneado— se convierte bien sin que tengas que separar las páginas antes.

¿Este conversor de PDF a texto es gratis?

Sí, sin tope de páginas y sin cuenta. Como la conversión corre en tu máquina y no en nuestros servidores, no hay un coste por archivo que repercutir.

¿Cómo copio un PDF sin saltos de línea partidos?

Activa «Limpiar el texto» después de la extracción. Une las líneas cortadas y quita los guiones que dejó la maquetación. Si lo desactivas, la copia original sigue disponible.

¿Puedo pasar una tabla de un PDF a Excel?

Las zonas con forma de rejilla se reconstruyen como tablas que puedes copiar para Excel, Markdown o CSV. Los PDF digitales usan las posiciones del texto; los escaneos pasan por los mismos modelos de tablas locales que las imágenes.

¿Se sube o se guarda el PDF?

No. Se analiza en tu navegador con pdf.js y OCR local. Nunca recibimos el archivo ni el texto extraído.

¿Necesitas copiar de una imagen o de una captura?