Терм-документна матриця (англ. document-term matrix, term-document matrix) — матриця, що описує частоту появи термінів у колекції документів. В терм-документній матриці рядки відповідають документам з колекції, що аналізується, а стовпці асоційовані з термінами. Існують різноманітні схеми для визначення елементів матриці. Одною з них є схема TF-IDF. Такі матриці використовуються при обробці природної мови, зокрема в методах латентно-семантичного аналізу.
При створенні бази даних термінів, що задіяні у множині документів, матриця термінів формується як матриця інцидентності, рядки якої описують документи, а елементи рядків свідчать про наявність термінів в цих документах. Наприклад, якщо є два коротких документи:
Мені | подобаються | не подобаються | дані | |
---|---|---|---|---|
D1 | 1 | 1 | 0 | 1 |
D2 | 1 | 0 | 1 | 1 |
який показує, що за терміни містяться в тому чи іншому документі, та скільки разів вони зустрічаються. Такий підхід подібний до застосування матриці інцидентності при аналізі речень у корпусі слів одного документу[1].
В іншому мовному розділі є повніша стаття Document-term matrix(англ.). Ви можете допомогти, розширивши поточну статтю за допомогою перекладу з англійської.
|