<<
>>

Выводы по 3-й главе

В третьей главе говорится о том, как система смыслового анализа текстов работает по запросу читателя и как производится оценка близости текстов (релевантность).

Приводятся подробные описания:

• алгоритма отбора слов в естественно-тематический словарь;

• алгоритма создания естественно-тематического классификатора;

• алгоритма сравнения текстов и расчета близости текстов заданному тексту-образцу.

На основе эмпирического закона Ципфа в главе дано научное обоснование алгоритма отбора слов в естественно-тематический словарь, определяющий основной тематический контекст базы данных, и на практических примерах демонстрируется достоверность его работы.

Далее в главе подробно описывается алгоритм создания естественно­тематического классификатора полнотекстовой базы данных, который основан на разбиении основного естественно-тематического словаря на ряд предметно-ориентированных словарей. На конкретных примерах продемонстрирована методика работы и показано, как получить наиболее достоверную тематическую классификацию массива текстов.

В следующем разделе главы приводится алгоритм сравнения текстов и числовой оценки их близости, заключающийся в подборе такой тематической группы в классификаторе базы данных, предметно­

ориентированный словарь которой наиболее широко представлен в данном тексте.

В главе показано, что среднее значение числа слов из предметно­ориентированного словаря, присутствующих в текстах из данной тематической группы, колеблется в широких пределах. Набор таких слов данного текста с номером i из предметно-ориентированного словаря с номером j как ПОСц. Конкретное значение ПОСц сильно зависит от объема предметно-ориентированного словаря. Фактически ПОСц - это словарь, описывающий данный текст i в контексте тематической группы с индексом j. Такие словари принято называть поисковым образом текста. Число слов в ПОСц зависит от суммарного числа слов в тексте, и если для каждого текста ввести коэффициент отклонения от максимального числа слов Wi,

Wi = Ni/Nmax

где: Ni - число слов в тексте с номером i;

Nmax - максимальное число слов.

то абсолютный коэффициент отношения данного текста i к тематической группе с индексом j с учетом размера текста будет равен Kij.

Kij = ПОСij*Wi

При естественно-тематической классификации текста c номером i для каждого тематического индекса j рассчитываются значения: ROij, которое в работе предлагается называть релевантностью текста с номером i тематической группе с индексом j, и значение Rij - релевантность c учетом размера текста.

Rij = Kij / NNj

R0ij = ΠOCij / NNj

где: ΠOCij - число слов из предметно-ориентированного словаря с индексом j, присутствующих в тексте i;

NNj - общее число слов в предметно-ориентированном словаре с номером j.

При поиске близких текстов пользователь системы (читатель) получает отсортированный по значению релевантности список текстов. В диссертационной работе показано, что учет размера текста делает релевантность более устойчивой величиной при переходе от текста к тексту внутри тематической группы. На практических примерах показано, как изменяются значения релевантности в зависимости от тематической принадлежности текста.

<< | >>
Источник: СБОЙЧАКОВ КОНСТАНТИН ОЛЕГОВИЧ. АВТОМАТИЗИРОВАННАЯ СИСТЕМА СМЫСЛОВОЙ ОБРАБОТКИ ТЕКСТОВ ПРИ СОЗДАНИИ ЭЛЕКТРОННЫХ ФОНДОВ БИБЛИОТЕКИ. Диссертация на соискание ученой степени кандидата технических наук. Москва - 2003. 2003

Еще по теме Выводы по 3-й главе:

  1. Выводы по главе
  2. Выводы по 1-й главе
  3. Выводы по главе
  4. Выводы по 2-й главе
  5. Выводы по 4-й главе
  6. Выводы по главе
  7. ОГЛАВЛЕНИЕ
  8. § 4.6. МОМЕНТ, МОЩНОСТЬ И К. П. Д. ТУРБИНЫ.
  9. § 7. Мы делили апельсин...
  10. Глава 2. Система визуального эвристического кластерного анализа
  11. 22. Понятие и система субъектов, участвующих в производстве по делу об административном правонарушении.
  12. ДОКАЗАТЕЛЬСТВА В АРБИТРАЖНОМ ПРОЦЕССЕ
  13. 1. Значение органов выделения
  14. 32 Структура процесса доказывания по делу об адм правонарушении
  15. Реформы Екатерины II
  16. РАЗЪЯСНЕНИЕ № 02/16 КОМИССИИ ПО ЭТИКЕ И СТАНДАРТАМ ПО ВОПРОСУ ПРИМЕНЕНИЯ ПУНКТА 3 СТАТЬИ 21 КОДЕКСА ПРОФЕССИОНАЛЬНОЙ ЭТИКИ АДВОКАТА
  17. Описание работы системы автоматизированного смыслового анализа текстов