<<
>>

Алгоритм создания естественно-тематического классификатора

Словари, в пространстве которых тексты четко разделяются на группы, определяются при анализе матрицы слово/слово при различных критериях отбора слов. Таких словарей может быть больше, чем число тематических групп текстов.

Сложность возникает в случае структурирования большой базы данных, в которой число текстов много больше среднего объема ПОС. Если для расчета матрицы слово/слово применяются битовые шкалы, то одновременно определить тематический индекс для всех текстов базы данных, если их больше 1000 представляется затруднительным из-за требований по выделению больших объемов памяти. Поэтому так важно на первом этапе правильно выбрать базовый набор словарей ПОС, в пространстве которых значительное большинство текстов разделяются на тематические группы. Рассчитав факторы для базового набора ПОС можно последовательно определить тематический индекс для всех текстов базы данных, пользуясь эллипсами рассеяния. Далее для каждого индекса определяется свой ПОС, критерии выбора слов в который существенно отличаются от критериев выбора слов в основной ПОС. Резко увеличивается критерий минимального числа значимых текстов с тем, чтобы выбрать слова встречающиеся как можно шире по данной теме.

Критерий максимального количества значимых слов надо взять 80-90%, чтобы отсечь общеупотребительные слова, которые встречаются во всех текстах как шаблоны. Граничная частота может быть значительно увеличена, так как уменьшение числа слов в группе по сравнению с общим объемом выборки приведет к увеличению статистической ошибки определения частоты словоупотреблений.

После того, как система изготовит тематические словари ПОС, эксперт должен внимательно изучить полученные списки слов, исключив из них несущественные по его мнению слова. Дополнить список эксперт может по своему усмотрению, эта операция требует особой осторожности, так как зависит от личных предпочтений эксперта и может сместить естественную оценку, что приведет к неверной работе алгоритмов по извлечению знаний из накопленной информации. Лучше всего, изменяя критерии отбора проследить за тем, какие термины удаляются из словаря ПОС и оставить те из них, которые представляются необходимыми.

Рис. 24. Выбор тематического индекса (здесь рубрика) при создании ПОС

Добавлять самому синонимы и связные термины не рекомендуется, так как если использование синонима действительно принято в научной среде, он неизбежно попадет в ПОС, если же нет - использование его ничего не даст алгоритму сравнения, который опирается не на результат поиска по

словам (поиск по синонимам будет идти если они есть в текстах), а опирается на группы слов, оптимальным образом поставленные в соответствие темам базы данных.

В базе данных электронного каталога ИРБИС естественно-тематический классификатор выглядит аналогично многоуровневому рубрикатору ГРНТИ [19]. Верхнему индексу 0 соответствует словарь ПОС “нулевой рубрики”, который создается с использованием всех файлов базы данных на начальном этапе структуризации. Каждый словарь ПОС - это текстовый файл в виде списка слов в директории базы данных с именем базы данных и индексом темы и с расширением DCT.

Каждый ПОС представляет для пользователя тематический контекст, в рамках которого работают алгоритмы смыслового анализа текстов. Как следует из вышеприведенных описаний для выделения текстов в группы, а значит и для определения темы для данного текста, необходимо выделить значимые слова. Алгоритм сравнения текстов работает, в принципе, на основе любого предложенного списка слов, но достоверность анализа существенно зависит о правильности определения контекста.

Система не определяет смысл текста как таковой, система находит в базе данных тексты, тематически близкие данному. Как использовать полученную информацию зависит уже от уровня подготовленности пользователя.

3.4.

<< | >>
Источник: СБОЙЧАКОВ КОНСТАНТИН ОЛЕГОВИЧ. АВТОМАТИЗИРОВАННАЯ СИСТЕМА СМЫСЛОВОЙ ОБРАБОТКИ ТЕКСТОВ ПРИ СОЗДАНИИ ЭЛЕКТРОННЫХ ФОНДОВ БИБЛИОТЕКИ. Диссертация на соискание ученой степени кандидата технических наук. Москва - 2003. 2003

Еще по теме Алгоритм создания естественно-тематического классификатора:

  1. Алгоритм отбора слов в естественно тематический словарь
  2. Алгоритм разбиения основного естественно-тематического словаря на ряд предметно-ориентированных словарей
  3. 3. Общероссийские классификаторы технико-экономической и социальной информации
  4. Сравнение текстов в алгоритме смыслового анализа
  5. Алгоритм расчета близости текстов заданному тексту-образцу
  6. Глава 3. Описание работы алгоритмов смысловой обработки текстов
  7. Последовательность операций при создании и ведении базы данных ИРБИС при использовании системы смыслового анализа текстов
  8. 67) Создание ВЧК
  9. 66) Создание Красной Армии
  10. Бухгалтерское дело при создании организации
  11. Классификация и стадии создания АСУ ТП
  12. Основные этапы методики создания системной модели
  13. 65) Создание советской милиции.
  14. 70) Создание основ советского права.
  15. 64) Создание советских судебных органов
  16. Создание новых судебных органов. Борьба с контрреволюцией
  17. ПРАВОВАЯ ПРИРОДА ДОГОВОРА О СОЗДАНИИ КОНСОЛИДИРОВАННОЙ ГРУППЫ НАЛОГОПЛАТЕЛЬЩИКОВ
  18. Разработка и утверждение технического задания на создание (ведение) автоматизированной системы учета
  19. Основные продукты информационных агентств и подходы к их созданию
  20. Задача создания диагностических моделей свойств системы