Bag of Words e TF–IDF: Como os Computadores Transformam Texto em Matemática
Este artigo explica Bag of Words e TF–IDF, dois métodos fundamentais de representação de texto. Aborda como funcionam matematicamente, suas origens históricas e fornece uma implementação completa em PHP puro para pesquisa de documentos.
O artigo descreve como os computadores convertem texto em representações numéricas, com foco em Bag of Words (BoW) e TF-IDF. BoW representa o texto como um vetor de contagens de palavras, ignorando a ordem das palavras, enquanto TF-IDF pondera as palavras por sua frequência dentro de um documento e raridade em um corpus. O autor fornece um contexto histórico, observando que BoW se originou nas décadas de 1950-60 e TF-IDF foi desenvolvido por Karen Spärck Jones em 1972, mais tarde popularizado por Gerard Salton. As limitações incluem ignorar a ordem das palavras e a semântica. O artigo inclui uma implementação passo a passo em PHP puro, demonstrando tokenização, cálculo de frequência de termo, frequência inversa de documento, vetores TF-IDF e similaridade de cosseno para busca de similaridade entre documentos.
Fonte: Хабр — Data Mining —
original
