Detector de Codificación de Archivos
Cuando un archivo aparece con mojibake (괆쒋쀎), el primer paso es averiguar qué codificación realmente es. Este detector lee los bytes del archivo en tu navegador (nunca se sube) y corre las heurísticas estándar: secuencias de bytes BOM primero (FF FE para UTF-16 LE, EF BB BF para UTF-8 BOM, etc.), luego densidad de bytes null (UTF-16 tiene nulls en cada otro byte para contenido ASCII), luego verificación de validez UTF-8 (la mayoría de secuencias multi-byte son inválidas en Latin-1, así que UTF-8 válido = muy probablemente UTF-8). Devuelve la codificación detectada, porcentaje de confianza, bytes BOM si están presentes, y una vista lado a lado hex/texto para verificación visual del decode.
Cómo usar
- Suelta o elige cualquier archivo de texto. La detección corre en tu navegador — el archivo nunca deja la página.
- Revisa el panel BOM primero: un BOM significa que la codificación es esencialmente certera. Sin BOM significa detección heurística.
- Compara la vista hex con la vista previa de texto decodificado. Si caracteres no-ASCII se ven bien, la detección es correcta.
Preguntas frecuentes
- ¿Por qué no hay una librería 'detect' como chardet?
- Los navegadores no traen chardet, e importar una librería grande de detección de codificación (el port JS de `CharsetDetector` de ICU es ~200KB) para unos pocos casos comunes es excesivo. Esta herramienta cubre el caso 95%: BOMs, solo-ASCII, UTF-8 válido, y UTF-16 por patrón de bytes null. Para codificaciones asiáticas exóticas (Shift_JIS, GB2312, EUC-KR) sin BOM, necesitarás chardet — pero esta herramienta te dirá 'no es UTF-8' para que sepas buscar en otro lado.
- ¿Qué es el asunto con los BOMs?
- Byte Order Marks son prefijos de 2-4 bytes que marcan explícitamente la codificación. UTF-8 BOM es `EF BB BF` (técnicamente innecesario, controvertido — Microsoft los añade, herramientas Unix usualmente los quitan). BOMs UTF-16/32 (`FF FE` etc.) son útiles porque también señalan endianness. Si un archivo tiene un BOM, confía en él absolutamente.
Guías sobre este tema
- Por qué Excel estropea tu CSV y cómo impedirlo Los ceros iniciales desaparecen, los números de pedido largos pierden el último dígito y los códigos de producto se vuelven fechas. No es un fallo: es Excel adivinando un tipo para cada campo al abrir el archivo.
- Por qué tu texto se convierte en caracteres extraños Un nombre sale como é, un archivo coreano se vuelve un muro de disparates, o cada acento es un rombo negro. El texto se guarda como bytes y una codificación es solo un acuerdo sobre qué significan esos bytes, así que la forma del destrozo dice qué acuerdo se rompió.
Herramientas relacionadas
Conversor de Finales de Línea y BOM
Convierte entre finales de línea LF, CRLF y CR y añade o quita un BOM UTF-8 — con conteos por estilo para que veas qué tan mezclada estaba la entrada.
Conversor de Codificación de Texto
Abre archivos en codificaciones heredadas (EUC-KR, Shift_JIS, Windows-1252…) como UTF-8 legible.
Reparador de Mojibake (UTF-8 corrupto)
Repara texto estropeado por un ida-y-vuelta de codificación errónea — convierte café, don’t y 😀 de nuevo en café, don't y 😀 — automática y seguramente, todo en tu navegador.
Detector de Tipo de Archivo (Magic Bytes)
Suelta un archivo para identificar su formato real desde sus magic bytes — y capturar archivos cuya extensión o MIME declarado miente.
Inspector de ZIP
Suelta un ZIP y mira cada archivo dentro — tamaños, contenido y descarga individual — sin desempaquetar localmente.
Recortar audio
Corta un fragmento de un archivo de audio arrastrando sobre su onda, añade fundidos y descárgalo en WAV. No se sube nada.