연구애플리케이션 🇷🇺 28.07.2026 23:03

단어 가방(Bag of Words)과 TF–IDF: 컴퓨터가 텍스트를 수학으로 바꾸는 방법

이 기사는 문서 검색을 위한 두 가지 기본 텍스트 표현 방법인 단어 가방(Bag of Words)과 TF–IDF에 대해 설명합니다. 이들이 수학적으로 어떻게 작동하는지, 역사적 기원, 그리고 순수 PHP로 구현하는 완전한 예제를 다룹니다.
이 기사는 컴퓨터가 텍스트를 숫자 표현으로 변환하는 방법을 설명하며, 특히 Bag of Words(BoW)와 TF-IDF에 초점을 맞춥니다. BoW는 단어 순서를 무시하고 단어 개수의 벡터로 텍스트를 표현하며, TF-IDF는 문서 내 빈도와 말뭉치 전체에서의 희소성에 따라 단어에 가중치를 부여합니다. 저자는 역사적 배경을 제공하며, BoW가 1950~60년대에 시작되었고 TF-IDF는 1972년 Karen Spärck Jones에 의해 개발되었으며, 이후 Gerard Salton에 의해 대중화되었다고 언급합니다. 한계점으로는 단어 순서와 의미를 무시한다는 점이 있습니다. 이 기사는 순수 PHP로 구현한 단계별 절차를 포함하며, 토큰화, 문서 빈도 계산, 역문서 빈도, TF-IDF 벡터, 그리고 문서 유사도 검색을 위한 코사인 유사도를 보여줍니다.
출처: Хабр — Data Mining — 원문
관련 게시물 ↓
새로운 뉴스