Limitações
Transparência radical sobre o que falta:
Cobertura
- Só war.gov/UFO/: AARO (
aaro.mil) e ODNI (dni.gov/uap) ainda não estão incluídos. - Antes de 1947: cobertura esparsa. Foo Fighters, Ghost Rockets e Battle of Los Angeles têm página, mas o material primário existe principalmente em arquivos militares ainda não desclassificados.
- Incidentes fora do corpus: páginas sem documento primário suficiente não são promovidas para indexação. A existência de uma página de tópico não significa que o acervo possua evidência oficial sobre ela.
Qualidade do OCR
- Manuscrito: pode haver letras trocadas, palavras omitidas e erros em abreviações ou nomes próprios.
- Documentos muito redigidos: páginas com >50% de pixels pretos têm OCR pobre por design.
- Datas inferidas: quando o documento não tem data explícita, podem ser usados metadados do catálogo ou inferência automatizada. Confira o PDF antes de citar.
- Confiança automática: é um sinal técnico, não uma revisão humana nem uma garantia de exatidão.
Vídeos
- Transcrição de áudio: ainda não implementada na v1. Player funciona, mas legendas sincronizadas virão na v1.1.
- Frames-chave: vídeos ainda não têm extração de frames como itens visuais.
Tradução
- Idiomas suportados: inglês (padrão), PT-BR e espanhol.
- Tradução de OCR completo: só títulos, resumos e captions são traduzidos. Texto OCR fica no idioma original (predominantemente EN).
- Tradução automática: pode alterar nuances, siglas e nomes. A versão em inglês também pode conter síntese automática; nenhuma tradução substitui a fonte.
Busca
- Sem busca semântica: full-text com BM25, sem embeddings. "platillo volador" não acha "flying saucer" sem digitar uma das duas formas exatamente.
- Latência de re-index: novo conteúdo aparece após o próximo build (~minutos), não em tempo real.
Mudanças no site oficial
- Diff automático: ainda em desenvolvimento. Por enquanto, snapshots manuais do manifest.
- Itens removidos do war.gov: mantemos o arquivo localmente, mas pode haver atraso até detectarmos a remoção.
- Histórico público: ainda não há página pública com todas as versões, timestamps independentes, dumps mensais ou ancoragem externa de hashes.
Atribuição
- Em alguns documentos, agência primária e secundária ficam ambíguas — usamos a primeira agência mencionada no
entities.agenciesda extração. Pode não refletir a fonte real.
Resumos, entidades e conteúdo editorial
- Títulos, resumos, entidades e relações podem ser gerados ou ampliados por IA.
- Artigos do blog são análise editorial baseada nas fontes citadas; não fazem parte do documento oficial.
- Uma afirmação no OCR ou em um relatório registra o que a fonte diz, não que a afirmação foi comprovada.
Privacidade e correções
- Documentos oficiais podem conter nomes ou dados de civis. Detectores automáticos de e-mail e telefone têm falsos positivos e falsos negativos.
- Candidatos a dados pessoais devem passar por revisão antes da publicação de novos lotes.
- Para relatar dado pessoal, erro material ou link quebrado, abra uma issue no repositório indicando a URL e a página. Correções precisam ser propagadas para o site, busca, API e cópias distribuídas.
Se você encontrar um erro material, abra uma issue no GitHub. Inclua o link do documento, a página e, quando possível, a imagem ou trecho da fonte original.