InvestigaciónAplicaciones 🇷🇺 28.07.2026 23:03

Bolsa de Palabras y TF–IDF: cómo las computadoras convierten el texto en matemáticas

Este artículo explica la Bolsa de Palabras y TF–IDF, dos métodos fundamentales de representación de texto. Cubre cómo funcionan matemáticamente, sus orígenes históricos y proporciona una implementación completa en PHP puro para la búsqueda de documentos.
El artículo describe cómo las computadoras convierten texto en representaciones numéricas, centrándose en Bolsa de Palabras (BoW) y TF-IDF. BoW representa el texto como un vector de recuentos de palabras, ignorando el orden de las palabras, mientras que TF-IDF pondera las palabras por su frecuencia dentro de un documento y su rareza en un corpus. El autor proporciona un contexto histórico, señalando que BoW se originó en las décadas de 1950-60 y que TF-IDF fue desarrollado por Karen Spärck Jones en 1972, popularizado más tarde por Gerard Salton. Las limitaciones incluyen ignorar el orden de las palabras y la semántica. El artículo incluye una implementación paso a paso en PHP puro, demostrando la tokenización, el cálculo de la frecuencia de términos, la frecuencia inversa de documento, los vectores TF-IDF y la similitud coseno para la búsqueda de similitud entre documentos.
Fuente: Хабр — Data Mining — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas