Sobre copyfrom.net
copyfrom.net hace una sola cosa: sacar el texto de dentro de lo que no te deja seleccionarlo —fotos, capturas y PDF— y dejarte un resultado limpio y copiable en el portapapeles.
Lo importante es dónde ocurre eso. Las webs típicas de «OCR gratis» suben tu archivo a un servidor, lo procesan allí y te piden que confíes en su política de borrado. A los nuestros no se sube nada. El motor de OCR (PaddleOCR compilado a WebAssembly) y el lector de PDF (pdf.js) se ejecutan dentro de tu navegador. El archivo no sale del dispositivo.
Qué puedes hacer
- El archivo completo. Arrastra o pega una imagen, o abre un PDF. Los PDF digitales se leen de la capa de texto; las páginas escaneadas recurren al OCR automáticamente.
- Una zona. Tras la carga, la vista previa se queda en pantalla. Dibuja un recuadro, o haz clic en un bloque para detectarlo automáticamente, y extrae solo esa área.
- Tablas. Las zonas con forma de rejilla se reconstruyen como tablas reales que puedes copiar a una hoja de cálculo, a Markdown o a CSV.
- Limpieza. Una pasada opcional une las líneas cortadas y los guiones sueltos sin reescribir tu redacción. Si la desactivas, el resultado original sigue ahí.
Hay páginas dedicadas para extraer texto de una imagen, extraer texto de una captura de pantalla y extraer texto de un PDF. Comparten el mismo motor; solo cambian los textos y los tipos de archivo admitidos.
Por qué es gratis
El procesamiento corre en tu máquina, así que no pagamos por tu CPU. Una vez cargados los modelos no hay cola de subidas ni motivo para limitar páginas. Sin cuenta, sin marca de agua, sin «3 archivos al día».
La pila, en breve
Páginas estáticas en Astro y las partes interactivas en React. El OCR usa modelos PP-OCRv6 a través de ONNX Runtime Web. La estructura de tablas y la selección inteligente usan modelos adicionales que alojamos nosotros mismos. Los PDF pasan por pdf.js, con los CMaps y las fuentes estándar servidos desde este dominio para que las páginas en chino, japonés y coreano se rendericen. El sitio está en Cloudflare Pages.
Los archivos de modelo y el runtime de WebAssembly se descargan desde copyfrom.net, no desde una CDN cualquiera. El único tercero opcional es Google Analytics, y solo cuando está configurado: consulta Privacidad. Bloquéalo y las herramientas seguirán funcionando.
Contacto
Errores, PDF extraños o una función que debería existir: [email protected]. Tampoco tienes que creerte la promesa de privacidad sin más: abre la pestaña Red del navegador mientras extraes, o desconéctate después de cargar la página, y comprueba que no sale nada.