Extrair texto de PDF
Copiar direto de um leitor de PDF costuma dar errado: vem o cabeçalho e o rodapé de cada página, as colunas embaralhadas e quebras de linha no meio das frases. Esta ferramenta lê a camada de texto do documento diretamente e entrega tudo em uma caixa editável, pronta para colar numa nota, num tradutor ou numa planilha. Com o refluxo de parágrafos ligado, as quebras que a diagramação gravou são desfeitas: as linhas cortadas voltam a se juntar, as palavras partidas por hífen são remontadas, e marcadores e listas numeradas ficam onde estão. Você pode manter as marcas de página para saber onde cada uma começava, ou removê-las para ter texto limpo. Se o PDF for uma digitalização não há texto a encontrar, e a ferramenta avisa em vez de devolver uma caixa vazia. Tudo é lido dentro do seu navegador, então um contrato ou um holerite nunca sai da máquina.
Como usar
- Arraste um PDF para a caixa, ou clique nela para escolher um arquivo.
- Deixe o alcance em «Todas as páginas», ou mude para «Intervalo de páginas» e digite algo como `1-3, 5`.
- Decida se mantém as marcas `--- Página n ---` e se quer refluxo de parágrafos.
- Pressione Extrair e copie o texto ou baixe como .txt.
Perguntas frequentes
- Meu PDF é enviado para algum lugar?
- Não. O documento é aberto e lido inteiramente dentro da aba do navegador. Nada é enviado a um servidor, e fechar a aba não deixa nenhuma cópia.
- Não saiu nada, e o PDF claramente tem texto.
- Então é quase certamente uma digitalização: uma imagem da página, sem camada de texto selecionável. Tirar palavras dali exige OCR, que esta ferramenta não faz. Você ainda pode converter as páginas em imagens e passá-las por uma ferramenta de OCR.
- O que o «refluxo de parágrafos» muda exatamente?
- Um PDF guarda cada linha visual separadamente, então um parágrafo chega quebrado a cada 80 caracteres mais ou menos. O refluxo junta de novo as linhas que não terminam em fim de frase, conserta palavras partidas por hífen e não mexe em linhas em branco, marcadores e listas numeradas.
- Por que o texto de um documento em duas colunas vem embaralhado?
- O texto sai na ordem em que o documento o guarda, que na maioria das diagramações em colunas é coluna a coluna, mas nem sempre. Extrair uma página por vez facilita ver o que aconteceu e corrigir.
- Tabelas, espaçamento e negrito sobrevivem?
- Não. Isto produz texto puro: as palavras na ordem de leitura, com quebras de linha e de página. Células de tabela viram trechos de texto comuns e todo o estilo de fonte é descartado.
Guias sobre este tema
Ferramentas relacionadas
Converter PDF em imagem
Transforme cada página de um PDF em imagem PNG, JPEG ou WebP na resolução que escolher e baixe uma a uma ou em ZIP. Nada é enviado.
Número para Palavras
Escreva qualquer número em inglês, coreano ou japonês — para cheques, contratos ou só clareza.
Gerador de CSS Text-Shadow (Multi-Camada)
Empilhe quantas camadas de text-shadow quiser — neon, 3D, contorno, long-shadow — preview ao vivo e CSS pronto para copiar.
Comprimir PDF
Reduza um PDF reencodificando as imagens que ele carrega. O texto continua selecionável e pesquisável. Nada é enviado.
Extrator de Páginas PDF
Solte um PDF e extraia só as páginas que você quer — `1-3, 5, 7-10` — pra um PDF novo. Tudo no navegador, sem upload.
Markdown → Texto Puro
Remove toda formatação Markdown e deixa texto puro legível — útil para previews, resumos, email e contagem de caracteres.