Алгоритм разбиения основного естественно-тематического словаря на ряд предметно-ориентированных словарей
После выбора надлежащих критериев отбора для каждого слова подсчитывается число словоупотреблений в каждом тексте. Эти данные организуют матрицу текст/слово. Для того, чтобы подчеркнуть информативность наличия хотя бы одного слова в тексте от величины числа словоупотреблений переходим к ее двоичному логарифму.
В программе можно выбрать различные способы нормировки числа словоупотреблений - двоичный логарифм, десятичный логарифм и саму величину числа словоупотреблений. Эмпирический опыт показывает, что наиболее эффективным является двоичный логарифм, причем при отсутствии данного слова в тексте принимается значение равное -1.Так как в базе данных может быть значительное число текстов, работать с матрицей текст/слово может быть затруднительно. Поэтому матрица текст/слово служит только для расчета матрицы слово/слово. Группы слов, организованные темами в матрице текст/слово, проявятся в матрице слово/слово как блоки, симметричные относительно главной диагонали. Специально для работы с такими матрицами разработан алгоритм поиска устойчивых кластеров. Этот алгоритм чрезвычайно эффективно выделяет в условиях большого числа связных объектов наиболее устойчивые группы, алгоритм описан в 3-й главе.
Матрица слово/слово положительная, симметричная и имеет по диагонали 1. Смысл недиагональных элементов заключается в том, сколько раз встретилась данная пара слов во всех текстах. Не смотря на то, что слова
уже прошли предварительный отбор по выше описанным критериям, есть возможность дополнительно выделить пары слов, которые неравномерно распределены по матрице и могут организовывать непересекающиеся группы. Для этого в программе Visual HCA используется критерий максимального значения числа векторов матрицы, не включающих минимальное значение. В случае матрицы слово/слово этот критерий ограничивает для каждого слова число других слов, вместе с которыми данное слово встречается в текстах.
Эта операция существенно “прореживает” матрицу, однако не совсем корректна, так как при больших значениях данного критерия отбрасываются слова, прошедшие предварительный отбор. Применять этот критерий следует очень осторожно и на основании опыта эксперта.После того как эксперт выделит цветом группы слов производится сортировка матрицы слово/слово по цвету объектов так что объекты с одинаковыми цветами располагаются рядом с друг другом. Сохранив отдельные текстовые файлы слова из различных групп, эксперт анализирует полученные словари с целью возможного внесения исправлений и дополнений в них. Для проверки правильности и работоспособности в алгоритмах смыслового анализа данные словари проверяются как основа для разбиения на группы всех текстов базы данных. Для этого в программе Администратор рассчитывается матрица текст/словарь, элементом которой служит процент слов из данного словаря в данном тексте. Эта матрица не симметричная и имеет существенно меньшую размерность, чем матрица текст/слово. Группы текстов в данной матрице должны совпадать с группами текстов в матрице текст/слово. В случае мало информативности словаря он должен быть исключен из процесса. Если число текстов в базе данных очень велико можно взять случайную выборку и провести кластерный анализ на ней. Основной задачей на этом этапе является доказательство верности выбранного числа тематических словарей и их
значимости, то есть не должно быть много текстов с низким процентным содержанием слов из построенных словарей.
Рис. 21. Матрицы слово/слово
Для каждого индекса ПОС может быть построен заново путем отбора слов в него только из текстов данной группы. Эта процедура аналогична построению ПОС для всей базы данных, как часть текстов будто рассматривается как независимо. Общее число слов в данной группе текстов уменьшится и, следовательно, статистическая ошибка определения частоты увеличится.
По окончании процедуры для каждого текста базы данных определяется свой ПОС, индекс которого сохраняется в записи.Полученный для каждого индекса ПОС будут более полными, но и
будут иметь пересечения общие слова. Набор таких ПОС составит одноуровневый естественно-тематический классификатор базы данных.
На верхней картинке (Рис.21) приведен пример изменения матрицы слово/слово при уменьшении критерия максимально значимое число текстов для отбора слов. Критерий составил последовательно 20,50,100%, число слов, отобранных в ПОС соответственно равнялось 172,263,354.
На картинках видно, как при увеличении критерия расширяется общая часть матрицы слово/слово, то есть общие слова, выделенные статистически из всех текстов, являются фоном, амплитуда которого существенно превышает амплитуду тематических слов. Если рассмотреть содержание словарей построенных из общей части, то в них обнаруживаются часто употребляемые слова из общеупотребительной лексики, которые в данных текстах послужили словами окружения при употреблении естественнотематических слов. Отсечь такие слова путем увеличения границы превышения частоты можно, но это приведет к потере части нужных терминов, поэтому необходимо воспользоваться тем фактом, что слова окружения для различных терминов часто совпадают, так как являются частью привычного шаблона принятого в научной среде при написании статей и, следовательно, присутствуют в большинстве текстов.
Число слов в ПОС уменьшается пропорционально уменьшению критерия максимального числа значимых текстов. Общая тенденция к разделению на две основные группы слов при этом сохраняется. Однако, выявляются более мелкие группы слов на основном фоне, которые описывают частные группы текстов. При использовании этих мелких групп для создания словарей, теряется существенная часть значимых слов, которые описывают основные темы базы данных. Поэтому попытка использовать эти мелки словари в процедуре разделения всех текстов базы данных на группы делается неудачной.
Очевидно, недостаток информациидля этого разделения приводит к тому, что многие тексты, оказывается, содержат слова из этих словарей в очень слабой степени.
На следующих картинках показаны группы файлов, полученные при анализе матрицы текст/ПОС, созданной для всех ПОС выделенных при различных выше приведенных критериях. В принципе наилучший результат показывает критерий максимального числа значимых текстов в 50%, так как число тематических групп в тестовой базе данных 2. Если заранее неизвестно число тематических групп, следует применять различные критерии максимального числа значимых текстов и после определить, при котором из них достигаются наилучшие результаты. Этот критерий должен быть близок к 100% деленному на число тематических групп в случае если число тематических групп не слишком велико.
Нижний рисунок 22 иллюстрирует группы текстов, найденные с использованием словарей, полученных в результате анализа матрицы слово/слово. На вернем рисунке - устойчивые группы на графе, на среднем - в факторном пространстве, на нижнем - блочная структура матрицы текст/ПОС. Из всех трех картинок хорошо видно, что тексты разбиваются на две основные группы, одна из которых структурируется далее на три взаимно пересекающиеся группы. Тенденция к сходимости к данному результату наблюдается при всех критериях максимального количества текстов, и наилучший результат достигается вблизи 50-70%. Таким образом, словари ПОС могут быть использованы как базис для предварительного определения естественно-тематических групп даже если число этих групп заранее неизвестно. Требуется, меняя критерии отбора слов в ПОС, получить наиболее четкое, если возможно, разделение текстов на группы. Причем, лучше всего одновременно использовать словари ПОС, полученные при разных критериях отбора, при создании матрицы текст/ПОС.
Рис. 22. Группы текстов в разных окнах Visual HCA
Работа с матрицей текст/текст
Матрица текст/текст симметричная положительная и имеет по диагонали 1 и недиагональные элементы меньше 1, смысл которых в том, какой процент из слов одного текста встретился в другом тексте.
Анализируемые слова взяты из общего ПОС системы.На рисунке 23 показано изменение матрицы текст/текст при увеличении критерия максимального количества значимых текстов 20,50,70,100%. Так как матрицы текст/текст и слово/слово являются
Рис. 23. Матрицы текст/текст
производными от матрицы текст/слово их поведение в целом совпадают. Так как число текстов в тестовой базе данных 85 меньше, чем объем словарей ПОС во всех случаях для данного критерия, при больших значения числа слов в ПОС (100%) границы между группами текстов существенно
размываются. Из картинок видно, что две основные группы текстов, отвечающие разным тематикам, успешно выделяются при средних значениях критерия максимального количества значимых текстов.
Основной целью на первом предварительном этапе подготовки базы данных к применению алгоритмов смыслового анализа текстов будет получение набора словарей ПОС, в пространстве которых группы текстов будут совпадать с группами текстов, полученными при анализе матрицы текст/текст. Количество ПОС при этом может быть существенно больше, чем число групп, хотя количество тематических словарей, естественно, будет совпадать с числом выделенных групп текстов (тем). Этот факт есть следствие потери части информации при применении вышеописанных критериев в процессе выделения значимых слов, а также следствие того факта, что все слова в текстах являются взаимосвязанными тематическим смыслом и не могут рассматриваться отдельно друг от друга.
Задача выделения группы текстов из некой совокупности текстов и задача выделения группы слов несколько различаются между собой. Тексты представляют для нас единицы смысла, поэтому взаимоотношения текстов могут быть описаны и поняты экспертом в рамках исследуемой модели. Слова представляют для нас только средство для выделения групп текстов и сами по себе не несут прямой смысловой нагрузки. Единицей смысла в пространстве слов является словарь ПОС - набор слов.
Так как набор слов может быть по разному переведен на естественный язык экспертом в силу многозначности слова как такового и из-за личных предпочтений эксперта, набор слов ПОС может быть поставлен в соответствие какому-либо тексту только в рамках неформальной логики. То есть еще раз приходим к выводу о том, что задача выделения групп текстов - слабоформализована. Это значит, что факт принадлежности текста к какой-либо группе зависит от личных предпочтений эксперта, использующего эвристический алгоритм смыслового анализа. И даже на уровне пользователя система должнаоставить и ему некую свободу выбора при использовании данного алгоритма, следую общей логике поведения. Подробнее об этом будет сказано ниже.
После того, как определены группы текстов, каждому тексту из заданной группы ставится в соответствие числовой код, по которому система определяет какой словарь ПОС определен для данного текста. Набор этих словарей будем далее называть естественно-тематическим классификатором базы данных.
3.3.
Еще по теме Алгоритм разбиения основного естественно-тематического словаря на ряд предметно-ориентированных словарей:
- Алгоритм отбора слов в естественно тематический словарь
- Алгоритм создания естественно-тематического классификатора
- СЛОВАРЬ ОСНОВНЫХ ТЕРМИНОВ
- Методы, ориентированные на данные
- Сравнение текстов в алгоритме смыслового анализа
- Алгоритм расчета близости текстов заданному тексту-образцу
- Глава 3. Описание работы алгоритмов смысловой обработки текстов
- Основные виды свойств систем
- 6.2. Основные субъекты правоотношений
- Основные законы Российской империи
- Лекция №13 Общая характеристика и основные факторы метаморфизма
- 2. Основное содержание изучаемого курса
- § 1.6. ОСНОВНЫЕ ТЕХНИЧЕСКИЕ ПОКАЗАТЕЛИ ГИДРОМАШИН
- 2. Основные современные классификации соматотипов
- Лекция №4 Характеристика основных породообразующих минералов.
- Вопрос 1. Оформление приказов по основной деятельности