<<
>>

Выводы по 2-й главе

Во второй главе приводится описание методики работы с системой визуального эвристического кластерного анализа (Visual Heuristic Cluster Analysis), разработанной автором совместно с П.П.

Макагоновым [114]. Visual HCA применяется в системе смыслового анализа текстов для тематической классификации текстов.

Используя программу эвристического кластерного анализа, эксперт определяет естественно-тематические группы путем структуризации числовых матриц, отражающих распределение слов по текстам. Такая структуризация носит название кластеризации; кластер - это группа

объектов, которая может быть выделена из общей массы на основании каких-либо критериев. В нашем случае объектами служат тексты базы данных или слова из текстов. Группы текстов в кластере дают информацию о том, какие темы, пока еще не сформулированные на естественном языке, представлены в полнотекстовой базе данных. Группы слов в кластере составляют предметно-ориентированные словари для описания этих тем.

В главе показано, что в силу неоднозначности и контекстной зависимости естественного языка задача смысловой обработки текстов относится к разряду слабоформализованных. Такие задачи отличаются неопределенностью постановки и отсутствием формализованных математических (аналитических) или технологических (алгоритмических) процедур обработки данных; связаны с нечеткой, неоднозначной формулировкой цели и отсутствием устойчивой системы понятий и моделей. Такие задачи, не допускающие полной формализации, решаются с применением эвристик. Иными словами, для решения задачи смысловой обработки текстов необходимо участие человека (экспертная оценка).

Система Visual HCA представляет собой инструмент, который помогает эксперту в выработке понятий и концепций при решении таких слабоформализованных задач. Система позволяет обрабатывать матрицы, содержащие сотни объектов и атрибутов. Последние могут быть количественными и качественными. Особенностью системы является графический диалог с экспертом, обеспечивающий наглядность работы.

Приведенные в главе примеры демонстрируют возможности Visual HCA как средства решения слабоформализованных задач. В Приложении в описаны основные принципы, заложенные в систему, что позволяет экспертам, не знакомым со специальными разделами математической статистики, ознакомиться с работой системы, не вникая в частные детали. В главе показано, что программа визуального эвристического анализа позволяет эксперту в визуальном диалоговом режиме определить группы

слов, как ряд предметно-ориентированных словарей. В итоге каждому тексту соответствует один или более предметно-ориентированный словарь, что сохраняется в базе данных в виде числового кода - тематического индекса. Набор предметно-ориентированных словарей составляет естественно-тематический классификатор базы данных.

<< | >>
Источник: СБОЙЧАКОВ КОНСТАНТИН ОЛЕГОВИЧ. АВТОМАТИЗИРОВАННАЯ СИСТЕМА СМЫСЛОВОЙ ОБРАБОТКИ ТЕКСТОВ ПРИ СОЗДАНИИ ЭЛЕКТРОННЫХ ФОНДОВ БИБЛИОТЕКИ. Диссертация на соискание ученой степени кандидата технических наук. Москва - 2003. 2003

Еще по теме Выводы по 2-й главе:

  1. Выводы по 3-й главе
  2. Выводы по главе
  3. Выводы по 1-й главе
  4. Выводы по главе
  5. Выводы по 4-й главе
  6. Выводы по главе
  7. ОГЛАВЛЕНИЕ
  8. § 4.6. МОМЕНТ, МОЩНОСТЬ И К. П. Д. ТУРБИНЫ.
  9. § 7. Мы делили апельсин...
  10. Глава 2. Система визуального эвристического кластерного анализа
  11. 22. Понятие и система субъектов, участвующих в производстве по делу об административном правонарушении.
  12. ДОКАЗАТЕЛЬСТВА В АРБИТРАЖНОМ ПРОЦЕССЕ
  13. 1. Значение органов выделения
  14. 32 Структура процесса доказывания по делу об адм правонарушении
  15. Реформы Екатерины II
  16. РАЗЪЯСНЕНИЕ № 02/16 КОМИССИИ ПО ЭТИКЕ И СТАНДАРТАМ ПО ВОПРОСУ ПРИМЕНЕНИЯ ПУНКТА 3 СТАТЬИ 21 КОДЕКСА ПРОФЕССИОНАЛЬНОЙ ЭТИКИ АДВОКАТА