Терм-документная матрица представляет собой математическую матрицу, описывающую частоту терминов, которые встречаются в коллекции документов. В терм-документной матрице строки соответствуют документам в коллекции, а столбцы соответствуют терминам. Существуют различные схемы для определения значения каждого элемента матрицы. Одной из таких является схема TF-IDF. Они полезны в области обработки естественного языка, особенно в методах латентно-семантического анализа.
При создании базы данных терминов, используемых в наборе документов, матрица терминов формируется как матрица инцидентности, строки которой соответствуют документам, а элементы строк - наличию соответствующих терминов в этих документах. Например, если есть два коротких документа:
то соответствующая матрица терминов будет иметь вид:
Мне | нравятся | не нравятся | данные | |
---|---|---|---|---|
D1 | 1 | 1 | 0 | 1 |
D2 | 1 | 0 | 1 | 1 |
который показывает, какие термины содержатся в тех или иных документах, и сколько раз они встречаются. Такой подход аналогичен использованию матрицы инцидентности при анализе предложений, образующих корпус слов[1].
Это заготовка статьи об искусственном интеллекте. Помогите Википедии, дополнив её. |