Metodologia

Coleta

Crawler em Python (código-fonte) com fallback de navegador para páginas que exigem JavaScript. O crawler identifica a origem de cada URL, aplica limites de requisição e registra cada tentativa em um manifest.

Páginas de catálogo e sementes são revalidadas, em vez de serem consideradas imutáveis. Downloads usam validadores HTTP quando a fonte os fornece e só substituem a cópia preservada depois que a nova resposta é validada.

OCR e classificação

Cada página de PDF passa por:

  1. Contagem independente das páginas do PDF.
  2. OCR primário do documento e, quando configurado, OCR visual secundário.
  3. Reconciliação das versões, usando distância de caracteres e arbitragem apenas nas páginas divergentes.
  4. Classificação por página: typed, handwritten, mixed, photo, blank ou redacted_heavy.
  5. Extração de entidades: pessoas, agências, plataformas, sensores e locais.
  6. Extração de fotos: figuras selecionadas passam a ser itens navegáveis.
  7. Gate de completude: o resultado só é final quando contém exatamente as páginas 1..N. Resultados incompletos ficam marcados como parciais e não devem ser publicados como concluídos.

Os percentuais de confiança são estimativas do classificador, não uma medição humana de acurácia. Trechos importantes devem ser conferidos no PDF original.

Tradução

UI em inglês, português do Brasil e espanhol. Títulos, resumos e legendas podem ser traduzidos automaticamente e reutilizados por cache. O OCR completo permanece, em geral, no idioma do documento. Traduções automáticas não substituem o original.

Busca

Pagefind — índice gerado durante o build e consultado no navegador. Ele cobre páginas publicadas, títulos, metadados e o texto OCR incluído no índice.

Hospedagem

O site é pré-renderizado e distribuído como arquivos estáticos. Documentos e mídia são publicados separadamente do HTML. Releases devem passar pelas validações de corpus, rotas, links e completude antes da promoção.

Reprodutibilidade

  • Código do pipeline versionado em Git.
  • Manifest de coleta preservado.
  • SHA-256 por arquivo baixado.
  • Artefatos intermediários do OCR mantidos para auditoria quando disponíveis.

Ainda não existe uma garantia pública de timestamp independente, dump mensal ou histórico completo de todas as versões da fonte. Essas capacidades são tratadas como trabalho futuro, não como funcionalidades já entregues.