Cookies de estadística y publicidad
Usamos cookies de estadística y de publicidad, y ambas van a Google. Si rechazas, para ti no cambia nada visible.Ir a la página de privacidad
Aquí puedes convertir JXL a TXT gratis y sin cuenta: suelta el archivo arriba y en un par de segundos tienes el resultado listo para descargar. La conversión ocurre en tu propio navegador, así que el archivo no se sube nunca. Funciona igual en Windows, macOS y Linux que en iPhone y Android, y sigue funcionando aunque cortes la conexión.
Hasta 100 archivos a la vez. Mezclar formatos no es problema.
Se convierten uno tras otro y vuelven juntos en un ZIP.
JXL a TXT
Cualquier otro par de este sitio coge un archivo y lo vuelve a escribir de otra forma. Este hace algo categóricamente distinto: mira una imagen y anota lo que le parece que dice. No existe una correspondencia entre un JPEG XL y un archivo de texto, porque un texto no puede contener una imagen y una imagen no contiene caracteres, solo formas que se les parecen.
Por eso el resultado se etiqueta como una conjetura y no como un resultado. Un conversor funciona o da error; un reconocedor devuelve algo con aspecto de texto tanto si coincide con la página como si no. Todo lo que sigue trata de estrechar esa distancia, y la costumbre más útil es leer la salida contra el original antes de fiarse de ella.
Todos los demás caminos de imagen de este sitio descodifican a píxeles primero. Este no: el archivo llega al motor de reconocimiento tal como está, porque ese motor trae su propio cargador y forzar la imagen a través de un lienzo aplanaría la transparencia a negro, que sobre el escaneo de un papel blanco es la diferencia entre legible e ilegible.
La consecuencia es que tu navegador no participa en esto. Los bytes se leen y se entregan directamente al reconocedor, así que los únicos descodificadores que pueden actuar sobre ellos son los que la propia biblioteca declara: BMP, JPEG, PNG, PBM, WebP y GIF no animado. JPEG XL no está en esa lista.
Como el formato de partida no está entre los que el reconocedor descodifica, soltar el .jxl aquí no puede devolver nada. La solución es una conversión de más, y no depende del navegador que uses: pasa el JXL a PNG en este sitio y lee el texto de ese PNG.
Ese primer paso lleva su propio descodificador de JPEG XL compilado a WebAssembly en vez de pedírselo al navegador, así que se comporta igual en Chrome que en Safari, aunque Safari sea el único que muestra JPEG XL de forma nativa. PNG es el formato correcto para el archivo intermedio: es sin pérdida, así que sobrevive cada trazo que el reconocedor necesita, mientras que un JPG recomprimiría las letras sin ninguna ventaja. El PNG es provisional; bórralo cuando tengas el texto.
JPEG XL perdió la batalla del navegador pero no la perdió en todas partes, y donde sobrevivió es precisamente donde viven los documentos. El registro le atribuye usos de archivo y de fotografía, y el de archivo es el sincero: los proyectos de digitalización lo eligieron porque hace bien el modo sin pérdida, admite profundidades altas y guarda una página escaneada en menos bytes que nada de la generación de PNG.
La otra vía habitual es Apple. Safari muestra JPEG XL, así que un archivo guardado desde la web en un Mac o en un iPhone puede aterrizar como .jxl sin que nadie lo haya elegido. En cualquiera de los dos casos, quien acaba aquí no escogió el formato: le entregaron una página de palabras envuelta en un formato de imagen, y lo que quiere son las palabras.
Los idiomas con modelo disponible son cuatro: español, inglés, alemán y francés. El ajuste no es opcional en la práctica. El reconocedor compara formas contra las letras y el vocabulario de un idioma cada vez, así que una página en español leída como inglés no produce un error: produce basura de aspecto fluido, porque cada forma se emparejó con lo más cercano dentro del diccionario equivocado.
Se nota sobre todo en los caracteres acentuados y en la eñe, que son justo los que el modelo inglés no espera encontrar, y en el contenido mezclado: un documento en español con términos técnicos en inglés se lee mejor con español seleccionado que dejándolo al azar, porque el modelo está eligiendo entre palabras candidatas tanto como entre letras. Ponlo antes de convertir; después, mirando solo la salida, no hay forma de saber que estaba mal.
El reconocimiento necesita suficientes píxeles por carácter, y esa es la variable que separa un resultado casi perfecto de uno inservible. Una página escaneada a 300 puntos por pulgada va sobrada. Una fotografía de una hoja hecha desde el otro lado de la mesa, una captura reducida para que quepa en un documento o una imagen que una aplicación de mensajería recomprimió por el camino, puede que no.
Ampliar la imagen después no ayuda: escalar añade píxeles sin añadir información y normalmente empeora el resultado al ablandar las formas que el reconocedor intenta identificar. Si sale mal, el arreglo está aguas arriba: reescanear con más resolución, fotografiar más cerca y de frente, o buscar el archivo original en lugar de la copia que ha ido pasando de mano en mano. El ángulo es la otra mitad del mismo problema: una hoja fotografiada de través da a cada línea una curvatura y a cada carácter una inclinación, y el reconocedor no tiene ningún modelo de perspectiva con el que deshacerlas.
Un archivo de texto no tiene columnas, ni celdas, ni tipografía, ni posición. Lo que recibes son los caracteres que el reconocedor encontró en el orden en que los leyó, y eso es una pérdida real de estructura y no una preferencia de formato. Una tabla vuelve como una ristra de valores sin sus columnas, una página a dos columnas puede entrelazar sus líneas y un titular llega como una línea más.
Los saltos de línea se dejan exactamente como se vieron, sin unir las líneas partidas ni colapsar las vacías. Parece descuidado y es deliberado: un poema, un bloque de dirección y una tabla pierden significado cuando se les ordenan los saltos, y el programa no tiene manera de saber cuál de las tres está mirando. Lo que vio el reconocedor es lo que se entrega.
El fallo característico no es una maraña ilegible, que se notaría. Es una sustitución plausible dentro de un párrafo por lo demás perfecto: un 5 leído como S, un 1 como ele minúscula, un cero como O mayúscula. En un documento administrativo eso hace daño de verdad, porque las cadenas donde ocurre son las que no tienen contexto que las corrija: un número de expediente, un DNI, un IBAN, un número de registro, una fecha, un importe.
La regla de trabajo, entonces, es corregir a mano todo lo que vaya a ejecutarse en lugar de leerse. Repasar un párrafo recuperado buscando sentido detecta los fallos evidentes; comprobar un número de cuenta carácter a carácter es lo único que detecta el peligroso. El reconocedor no devuelve ninguna medida de confianza, y esa limitación pertenece a esta página y no a una nota al pie.
El reconocimiento de texto es con diferencia el motor más lento de este producto. La primera conversión tiene además que traer el núcleo WebAssembly y el modelo de idioma antes de empezar, así que se siente bastante peor que las siguientes; el modelo queda cargado el resto de la sesión y se guarda en el almacenamiento local del navegador, de modo que un segundo documento otro día tampoco lo descarga otra vez.
La barra de progreso sigue a propósito solo la fase de reconocimiento y no la descarga ni la inicialización, porque una barra que se llena mientras no se ha leído nada y luego se queda quieta es peor que una que empieza tarde y significa algo. Una página tarda segundos. Una carpeta tarda segundos por archivo, en fila, sobre tu procesador.
El motor de reconocimiento, su núcleo WebAssembly y los cuatro modelos de idioma se sirven desde el propio origen de este sitio. Eso fue trabajo y no un valor por omisión: la biblioteca trae los tres desde una red de distribución pública salvo que se sobrescriba cada ruta, lo que habrían sido tres peticiones a un tercero llevando tu dirección y la URL de la página que estás leyendo.
La imagen no se habría enviado en ningún caso, y ese no es el punto. El punto es que quien está leyendo una nómina no debería anunciarle el hecho a una red de terceros. Hay una prueba en el repositorio que falla si alguna vez reaparece una URL de ese CDN, porque un valor por omisión tan cómodo vuelve en la siguiente actualización. El resultado es que el escaneo de algo privado se procesa entero en tu propia máquina y no queda nada que borrar después.
Si el documento nació como PDF con capa de texto, no lo exportes a imagen para reconocerlo: saca el texto directamente del PDF, que es una extracción exacta y no una conjetura y conserva cada carácter que escribió su autor. El reconocimiento es para el caso en que no hay capa de texto, es decir, cualquier escaneo y cualquier fotografía. Conviene añadir que aquí el reconocimiento tampoco está conectado al PDF: acepta formatos de imagen y no páginas de un documento.
Y si lo que necesitas es la imagen y no las palabras —para archivarla, imprimirla o mandársela a alguien—, esta es la página equivocada. El reconocimiento tira todo lo que no sea un carácter: la maquetación, las firmas, los sellos, los cuadros y las fotografías. Convierte la imagen como imagen, y usa esto solo cuando lo que quieres de verdad es algo que pegar.
| JXL | TXT | |
|---|---|---|
| Nombre completo | JPEG XL | Texto plano |
| Extensión de archivo | .jxl | .txt, .text, .log |
| Tipo de medio | image/jxl | text/plain |
| Compresión | Ambas, según el ajuste | — |
| Publicado por primera vez | 2021 | 1963 |
| Publicado por | Joint Photographic Experts Group | — |
| Especificación | ISO/IEC 18181 | Unicode |
| Licencia | Estándar abierto | Estándar abierto |
| Situación actual | De nicho | Vigente |
| Profundidad de bits | 32 | — |
| Color que puede describir | RGB, escala de grises, gama amplia | — |
| Se abre en el navegador | Algunos navegadores | Todos los navegadores |
| Considerado en su lugar | AVIF, WebP, PNG | MD, RTF |
TXT es un formato de trabajo y JXL uno terminado. Vuelve texto editable en lugar de una imagen de la página, que suele ser el motivo de la conversión y también su límite.
TXT se abre en cualquier navegador actual. JXL llega a menos navegadores todavía. Si el archivo va a una página web o a un formulario, ese suele ser todo el motivo de la conversión.
Los programas de siempre no coinciden: JXL se abre en GIMP y ImageMagick, y TXT en Notepad, TextEdit y Visual Studio Code, así que quien reciba el resultado necesita alguno del segundo grupo.
JXL es el formato de Joint Photographic Experts Group, publicado en 2021. Registra 32 bits por canal.
TXT es de 1963, recogido en Unicode. Notepad, TextEdit y Visual Studio Code lo leen.
TXT se publicó en 1963 y JXL en 2021. El más antiguo suele ser el archivo más seguro para entregar; el más reciente hace lo mismo con menos bytes.
No. Esta conversión ocurre por completo en tu navegador, así que el archivo no sale de tu dispositivo. Puedes comprobarlo tú: abre la pestaña de red de las herramientas de desarrollo y convierte algo. Verás la propia página y las peticiones de estadística y publicidad con las que se paga este servicio, y ni una sola que lleve tu archivo. El motor de este par concreto es Tesseract, el motor libre de reconocimiento de texto; tu navegador lo descarga una vez y lo guarda.
Sí. Sin cuenta, sin marca de agua y sin cupo diario que se gaste: se ejecuta en tu propio equipo, así que puedes volver tantas veces como quieras. El navegador procesa archivos de hasta 100 MB, 100 a la vez. Tesseract se descarga en tu equipo y se ejecuta allí, y por eso no hay contador.
JXL y TXT describen el contenido de maneras radicalmente distintas. La conversión es por tanto una reconstrucción y no una copia: fiel, pero no idéntica byte a byte. El texto se lee por reconocimiento de patrones, así que es una conjetura fundada y no una transcripción. Una tipografía limpia, recta y bien iluminada a resolución decente sale casi perfecta; una foto tomada en ángulo, un fax desvaído, una letra poco común o algo manuscrito darán errores. Contrasta siempre el resultado con el original antes de fiarte. El ajuste de idioma importa: con el equivocado vuelven disparates de muy buena presencia en vez de un mensaje de error.
TXT es un formato de trabajo y JXL uno terminado. Vuelve texto editable en lugar de una imagen de la página, que suele ser el motivo de la conversión y también su límite.