Выводы по 3-й главе
В третьей главе говорится о том, как система смыслового анализа текстов работает по запросу читателя и как производится оценка близости текстов (релевантность).
Приводятся подробные описания:
• алгоритма отбора слов в естественно-тематический словарь;
• алгоритма создания естественно-тематического классификатора;
• алгоритма сравнения текстов и расчета близости текстов заданному тексту-образцу.
На основе эмпирического закона Ципфа в главе дано научное обоснование алгоритма отбора слов в естественно-тематический словарь, определяющий основной тематический контекст базы данных, и на практических примерах демонстрируется достоверность его работы.
Далее в главе подробно описывается алгоритм создания естественнотематического классификатора полнотекстовой базы данных, который основан на разбиении основного естественно-тематического словаря на ряд предметно-ориентированных словарей. На конкретных примерах продемонстрирована методика работы и показано, как получить наиболее достоверную тематическую классификацию массива текстов.
В следующем разделе главы приводится алгоритм сравнения текстов и числовой оценки их близости, заключающийся в подборе такой тематической группы в классификаторе базы данных, предметно
ориентированный словарь которой наиболее широко представлен в данном тексте.
В главе показано, что среднее значение числа слов из предметноориентированного словаря, присутствующих в текстах из данной тематической группы, колеблется в широких пределах. Набор таких слов данного текста с номером i из предметно-ориентированного словаря с номером j как ПОСц. Конкретное значение ПОСц сильно зависит от объема предметно-ориентированного словаря. Фактически ПОСц - это словарь, описывающий данный текст i в контексте тематической группы с индексом j. Такие словари принято называть поисковым образом текста. Число слов в ПОСц зависит от суммарного числа слов в тексте, и если для каждого текста ввести коэффициент отклонения от максимального числа слов Wi,
Wi = Ni/Nmax
где: Ni - число слов в тексте с номером i;
Nmax - максимальное число слов.
то абсолютный коэффициент отношения данного текста i к тематической группе с индексом j с учетом размера текста будет равен Kij.
Kij = ПОСij*Wi
При естественно-тематической классификации текста c номером i для каждого тематического индекса j рассчитываются значения: ROij, которое в работе предлагается называть релевантностью текста с номером i тематической группе с индексом j, и значение Rij - релевантность c учетом размера текста.
Rij = Kij / NNj
R0ij = ΠOCij / NNj
где: ΠOCij - число слов из предметно-ориентированного словаря с индексом j, присутствующих в тексте i;
NNj - общее число слов в предметно-ориентированном словаре с номером j.
При поиске близких текстов пользователь системы (читатель) получает отсортированный по значению релевантности список текстов. В диссертационной работе показано, что учет размера текста делает релевантность более устойчивой величиной при переходе от текста к тексту внутри тематической группы. На практических примерах показано, как изменяются значения релевантности в зависимости от тематической принадлежности текста.
Еще по теме Выводы по 3-й главе:
- Выводы по главе
- Выводы по 1-й главе
- Выводы по главе
- Выводы по 2-й главе
- Выводы по 4-й главе
- Выводы по главе
- ОГЛАВЛЕНИЕ
- § 4.6. МОМЕНТ, МОЩНОСТЬ И К. П. Д. ТУРБИНЫ.
- § 7. Мы делили апельсин...
- Глава 2. Система визуального эвристического кластерного анализа
- 22. Понятие и система субъектов, участвующих в производстве по делу об административном правонарушении.
- ДОКАЗАТЕЛЬСТВА В АРБИТРАЖНОМ ПРОЦЕССЕ
- 1. Значение органов выделения
- 32 Структура процесса доказывания по делу об адм правонарушении
- Реформы Екатерины II
- РАЗЪЯСНЕНИЕ № 02/16 КОМИССИИ ПО ЭТИКЕ И СТАНДАРТАМ ПО ВОПРОСУ ПРИМЕНЕНИЯ ПУНКТА 3 СТАТЬИ 21 КОДЕКСА ПРОФЕССИОНАЛЬНОЙ ЭТИКИ АДВОКАТА
- Описание работы системы автоматизированного смыслового анализа текстов