Detector de Codificação de Arquivos
Quando um arquivo aparece com mojibake (괆쒋쀎), o primeiro passo é descobrir qual codificação realmente é. Este detector lê os bytes do arquivo no seu navegador (nunca enviado) e roda as heurísticas padrão: sequências de bytes BOM primeiro (FF FE para UTF-16 LE, EF BB BF para UTF-8 BOM, etc.), depois densidade de bytes null (UTF-16 tem nulls a cada outro byte para conteúdo ASCII), depois verificação de validade UTF-8 (a maioria das sequências multi-byte são inválidas em Latin-1, então UTF-8 válido = muito provavelmente UTF-8). Retorna a codificação detectada, porcentagem de confiança, bytes BOM se presentes, e visão lado a lado hex/texto para verificação visual do decode.
Como usar
- Solte ou escolha qualquer arquivo de texto. A detecção roda no seu navegador — o arquivo nunca deixa a página.
- Verifique o painel BOM primeiro: um BOM significa que a codificação é essencialmente certa. Sem BOM significa detecção heurística.
- Compare a visão hex com a pré-visualização de texto decodificado. Se caracteres não-ASCII parecem corretos, a detecção está correta.
Perguntas frequentes
- Por que não há uma biblioteca 'detect' como chardet?
- Navegadores não vêm com chardet, e importar uma biblioteca grande de detecção de codificação (o port JS do `CharsetDetector` da ICU é ~200KB) para alguns casos comuns é exagero. Esta ferramenta cobre o caso 95%: BOMs, só-ASCII, UTF-8 válido, e UTF-16 por padrão de bytes null. Para codificações asiáticas exóticas (Shift_JIS, GB2312, EUC-KR) sem BOM, você precisará de chardet — mas esta ferramenta dirá 'não é UTF-8' para você saber procurar em outro lugar.
- Qual o lance dos BOMs?
- Byte Order Marks são prefixos de 2-4 bytes que marcam explicitamente a codificação. UTF-8 BOM é `EF BB BF` (tecnicamente desnecessário, controverso — Microsoft adiciona, ferramentas Unix geralmente removem). BOMs UTF-16/32 (`FF FE` etc.) são úteis porque também sinalizam endianness. Se um arquivo tem um BOM, confie nele absolutamente.
Guias sobre este tema
- Porque é que o Excel estraga o seu CSV e como impedi-lo Os zeros à esquerda desaparecem, os números de encomenda longos perdem o último dígito e os códigos de produto tornam-se datas. Não é um erro: é o Excel a adivinhar um tipo para cada campo ao abrir o ficheiro.
- Por que seu texto vira caracteres estranhos Um nome sai como é, um arquivo coreano vira um muro de rabiscos, ou todo acento é um losango preto. Texto é guardado como bytes e uma codificação é apenas um acordo sobre o que esses bytes significam, então o formato do estrago diz qual acordo foi quebrado.
Ferramentas relacionadas
Conversor de Quebras de Linha e BOM
Converte entre quebras de linha LF, CRLF e CR e adiciona ou remove um BOM UTF-8 — com contagens por estilo pra você ver o quanto a entrada estava misturada.
Conversor de Codificação de Texto
Abra arquivos em codificações antigas (EUC-KR, Shift_JIS, Windows-1252…) como UTF-8 legível.
Reparador de Mojibake (UTF-8 corrompido)
Repare texto estragado por um ida-e-volta de codificação errada — transforme café, don’t e 😀 de volta em café, don't e 😀 — automática e seguramente, tudo no seu navegador.
Detector de Tipo de Arquivo (Magic Bytes)
Solte um arquivo pra identificar seu formato real a partir dos magic bytes — e pegue arquivos cuja extensão ou MIME declarado mente.
Inspetor de ZIP
Solte um ZIP e veja cada arquivo dentro — tamanhos, conteúdo e download individual — sem desempacotar localmente.
Cortar áudio
Corte um trecho de um arquivo de áudio arrastando sobre a onda, adicione fades e baixe em WAV. Nada é enviado.