Para traducir un PDF escaneado, primero comprueba si el texto se puede seleccionar. Si es una imagen, necesitarás un flujo capaz de reconocer las letras antes o durante la traducción. Después compara nombres, cifras y tablas con el original. Si el texto ya es seleccionable, sigue la guía para traducir un PDF con texto. Si necesitas presentar una traducción ante una institución, consulta sus requisitos concretos; una salida automática puede no cumplirlos.
El objetivo principal al traducir pdf escaneado es transformar píxeles estáticos en caracteres editables que un modelo lingüístico pueda interpretar sin alterar la estructura básica del contenido original.
Diagnóstico previo: cómo saber si tu PDF contiene texto o solo imágenes
Antes de intentar cualquier traducción automática directa, es fundamental comprobar la estructura interna del documento. Muchos usuarios asumen que todo archivo con extensión PDF contiene texto digital, pero un escaneo suele comportarse como una fotografía guardada dentro de un contenedor.
Para verificar el estado de su archivo, realice esta prueba elemental en cualquier visor de PDF en su ordenador:
- Abra el documento con su lector habitual o navegador web.
- Intente seleccionar una frase o palabra con el puntero del ratón.
- Presione el atajo de búsqueda del teclado (
Ctrl + Fen Windows oCmd + Fen Mac) y escriba una palabra visible en la página.
Si el cursor no resalta letras individuales sino que arrastra un recuadro azul sobre toda la página, o si la herramienta de búsqueda indica cero coincidencias para palabras claramente legibles, el documento no tiene capa de texto. Se trata de un archivo compuesto por imágenes rasterizadas, lo que hace inviable una traducción basada en texto plano sin una fase de reconocimiento óptico previa.
Herramientas con OCR integrado y límites técnicos documentados
El reconocimiento óptico de caracteres (OCR) es la tecnología encargada de analizar los patrones de luz y sombra de una imagen para identificar letras del alfabeto y signos de puntuación. Hoy en día, algunos de los principales servicios de traducción documental integran esta capacidad de forma directa o complementaria.
La ayuda de DeepL sobre PDF indica que admite documentos escaneados y que la calidad del escaneo afecta a la traducción. Prueba primero una página representativa y comprueba si la salida conserva el texto necesario; la documentación consultada no permite prometer que cualquier escaneo se procesará bien.
La ayuda de Google Traductor para documentos admite PDF de hasta 10 MB y 300 páginas, pero advierte expresamente que el texto de imágenes y páginas escaneadas no se traduce en el documento resultante. Para una imagen concreta, su función de traducción de imágenes permite subirla y copiar o descargar la traducción; revisa cada página si recurres a esa vía.
Es relevante subrayar un hecho técnico: los límites de tamaño (como los 10 MB de Google) aplican a la carga de datos. Si su escaneo tiene una resolución muy alta y excede ese límite, el sistema rechazará la subida antes de iniciar el OCR.
Procedimiento paso a paso para traducir pdf escaneado
Una vez identificada la herramienta a utilizar, el flujo de trabajo recomendado para minimizar fallos técnicos consta de los siguientes pasos:
- Preparación del archivo: verifica el tamaño máximo permitido por el servicio elegido. Si supera el límite, reduce el archivo con una herramienta que controles sin destruir la legibilidad; conserva el original.
- Orientación de página: Asegúrese de que todas las páginas estén orientadas verticalmente hacia arriba. Los sistemas OCR pueden fallar de forma notable si el texto está rotado en 90 o 180 grados.
- Carga en la plataforma: Acceda a la sección de traducción de documentos de la herramienta seleccionada, elija el idioma de origen (o active la detección automática) y el idioma de destino.
- Procesamiento y descarga: Suba el archivo y espere a que el motor complete tanto el reconocimiento visual como la traducción. Descargue el archivo resultante, que habitualmente conservará la estructura básica del original.
Recomendación editorial: conserve siempre una copia de seguridad intacta del PDF escaneado original antes de iniciar cualquier manipulación o compresión.
Verificación manual de tablas, cifras y nombres propios
Ningún sistema de OCR automático es infalible. Los defectos visuales comunes en documentos escaneados —como manchas de tinta, pliegues del papel, fuentes desgastadas o baja resolución— inducen errores sistemáticos que requieren supervisión humana.
Preste especial atención a las siguientes áreas críticas del documento traducido:
- Tablas y celdas numéricas: El OCR a veces confunde líneas de cuadrícula con letras o divide una fila en varias líneas artificiales. Compruebe que los encabezados correspondan con sus respectivas columnas y que las cifras monetarias o decimales coincidan con el original.
- Caracteres visualmente ambiguos: Es frecuente que los motores confundan la letra «l» minúscula con el número «1» o la «I» mayúscula, así como la secuencia «rn» con la letra «m». Esto puede alterar gravemente códigos de referencia, fechas o números de serie.
- Nombres propios y denominaciones legales: Las herramientas de traducción pueden forzar la traducción de apellidos o nombres corporativos si coinciden con sustantivos comunes del vocabulario general.
Si el documento se presentará ante una administración, juzgado u otra entidad, consulta sus requisitos de traducción y certificación antes de usar el resultado.