<<
>>

Последовательность операций при создании и ведении базы данных ИРБИС при использовании системы смыслового анализа текстов

1. Определить тематическое наполнение базы данных. Необходимо обучить специалиста в области лингвистики данной библиотеки работе с программами системы, так как кроме администратора системы будет необходим эксперт для настройки баз данных.

Если используется уже существующий электронный каталог, в котором есть режим показа полных текстов, необходимо перевести текстовые файлы в формат WINDOWS PLAIN TEXT.

2. Набрать достаточное количество текстов для первичной структуризации базы данных и подготовки естественно-тематического классификатора. Для начала работы необходимо иметь в базе данных как минимум несколько сотен текстов, общим объемом не менее 10 Mb. Число тем на первом этапе необходимо ограничить, так как это позволит уменьшить статистическую ошибку и более достоверно определить словари ПОС.

3. Произвести по описанной выше методике создание словарей ПОС и по результатам работы создать классификатор базы данных. Определить для каждого текста базы данных индекс классификатора, этот режим при большом числе документов в базе данных производится последовательно.

4. Проверить работоспособность классификатора для достоверной работы алгоритмов, рассчитав релевантности текстов для различных ПОС. Удостоверится в том, что в пространстве ПОС тексты из различных тематических групп могут быть значимо разделены между собой.

5. При дальнейшем наращивании базы данных текстами необходимо для новых текстов определять тематический индекс. Тексты, не имеющие

тематического индекса, имеют в системе условный индекс 00, поэтому их легко найти и отобрать поиском. Для определения тематического индекса используется инструментарий системы. При накоплении значительного количества новых текстов из существующих тематических групп, или при введении в базу данных текстов из новой тематической группы, необходимо проделать всю процедуру создания классификатора заново.

4.5.

<< | >>
Источник: СБОЙЧАКОВ КОНСТАНТИН ОЛЕГОВИЧ. АВТОМАТИЗИРОВАННАЯ СИСТЕМА СМЫСЛОВОЙ ОБРАБОТКИ ТЕКСТОВ ПРИ СОЗДАНИИ ЭЛЕКТРОННЫХ ФОНДОВ БИБЛИОТЕКИ. Диссертация на соискание ученой степени кандидата технических наук. Москва - 2003. 2003

Еще по теме Последовательность операций при создании и ведении базы данных ИРБИС при использовании системы смыслового анализа текстов:

  1. Глава 4. Перспективы развития ИРБИС в плане применения системы смыслового анализа текстов для создания полнотекстовых баз данных в современной библиотеке
  2. СБОЙЧАКОВ КОНСТАНТИН ОЛЕГОВИЧ. АВТОМАТИЗИРОВАННАЯ СИСТЕМА СМЫСЛОВОЙ ОБРАБОТКИ ТЕКСТОВ ПРИ СОЗДАНИИ ЭЛЕКТРОННЫХ ФОНДОВ БИБЛИОТЕКИ. Диссертация на соискание ученой степени кандидата технических наук. Москва - 2003, 2003
  3. Система смыслового анализа текстов в ИНТЕРНЕТ
  4. Описание работы системы автоматизированного смыслового анализа текстов
  5. Смысловая обработка текстов в полнотекстовых базах данных
  6. Сравнение текстов в алгоритме смыслового анализа
  7. Методы классификации при анализе свойств сложных систем
  8. § 2.18. ХАРАКТЕРИСТИКИ НАСОСОВ ПРИ ПАРАЛЛЕЛЬНОМ И ПОСЛЕДОВАТЕЛЬНОМ СОЕДИНЕНИИ
  9. Применение обобщенной методики при анализе свойств системы
  10. Разница между системой смыслового анализа для ИРБИС32 и ИРБИС64
  11. 4.3.3. Информационные правоотношения, возникающие при создании и применении информационных систем, их сетей, средств обеспечения
  12. Глава 1. Автоматизированная система смысловой обработки текстов
  13. 12.2.2. Правовое регулирование информационных отношений при производстве и распространении программ для ЭВМ и баз данных