Обзор существующих программных продуктов анализа текстов
В настоящее время на коммерческом рынке разработка отдельных продуктов для полнотекстового анализа признана невыгодным шагом. Поэтому фирмы стараются развивать алгоритмы текстового анализа как расширения для серверов баз данных.
В России существует ряд систем текстового анализа для поддержки работы специалистов с большими объемами текстовой информации. Принципы работы этих систем в основном статистические с дополнительной лингвистической поддержкой. Кроме известных поисковых серверов можно назвать системы “ТекстАналист” [170] и “Следопыт “(Media Lingva) [166].В данном обзоре приводятся описания наиболее продвинутых систем, представленных сегодня на IT рынке России. Существует большое количество систем, разработанных в основном специалистами университетских центров и используемых для своих нужд. В данном обзоре они не описываются, так как принципы работы системы смыслового анализа текстов сходны и опираются на научный потенциал разработчиков, накопленный ранее.
В список не включены системы анализа текстов, разработанные для больших поисковых серверов, таких как Яндекс, OZON, Rambler и т.д. В основном это комплексы, настроенные на работу в Интернете.
Исключение в списке программных продуктов представляет система “Ключи от текста”[78], не являющаяся в строгом смысле слова конкурентно способным IT товаром, но по принципу работы наиболее близко подходящей к системе смыслового анализа.
• Адаптацией технологий Oracle к русскоязычным полнотекстовым базам данных занимаются специалисты компании «Гарант-Парк- Интернет». Продукт этой компании под названием Russian Context Optimizer (RCO) предназначен для совместного использования с картриджем interMedia Text [72].
Лидер мирового рынка СУБД Oracle уже снабдил разработчиков информационных систем рядом передовых технологий. Речь идет о картридже interMedia Text, входящем в состав СУБД ORACLE8i, при использовании которого обработка текста сочетается со всеми возможностями, предоставленными пользователю Oracle для работы с реляционными базами данных.
В частности, при написании приложений стало возможно использовать SQL с развитым языком запросов к полнотекстовой информации.Продукт позволяет расширить возможности Microsoft BackOffice (MS SharePoint Portal, MS Indexing Service, MS Exchange Server и MS SQL Server) при работе с текстами на русском языке, обеспечивая поиск с учетом всех грамматических форм слов на основе морфологического анализа.
Серия продуктов, выпускаемых под маркой RCO™, предназначена для поддержки широкого класса систем, использующих средства поиска и анализа текстовой информации, таких, как информационнопоисковые и аналитические системы, электронные архивы и системы управления документооборотом. Продукты серии RCO задействуют передовые технологии обработки текста, лингвистические и математические алгоритмы, которые могут быть использованы для решения широкого класса задач: от контекстного поиска текстов с учетом всех словоформ, синонимов и опечаток до создания систем
поддержки принятия экспертных решений на основе анализа информационных массивов.
• Персональная система автоматического анализа текста TextAnalyst [170] разработана в качестве инструмента для анализа содержания текстов, смыслового поиска информации, формирования электронных архивов, и предоставляет пользователю следующие основные возможности:
анализа содержания текста с автоматическим формированием семантической сети с гиперссылками - получения смыслового портрета текста в терминах основных понятий и их смысловых связей;
анализа содержания текста с автоматическим формированием тематического древа с гиперссылками - выявления семантической структуры текста в виде иерархии тем и подтем;
смыслового поиска с учетом скрытых смысловых связей слов запроса со словами текста;
автоматического реферирования текста - формирования его смыслового портрета в терминах наиболее информативных фраз;
кластеризации информации - анализа распределения материала текстов по тематическим классам;
автоматической индексации текста с преобразованием в гипертекст;
ранжирования всех видов информации о семантике текста по «степени значимости» с возможностью варьирования детальности ее исследования;
• Система “Ключи от Текста” [78] - смысловой поиск и индексирование текстовой информации в электронных библиотеках.
Московский специализированный (по медицинским специальностям) Центр новых информационных технологий на базе Московской медицинской академии им. И.М. Сеченова.
Предлагаемые алгоритмы в ходе формальной процедуры выделяют своеобразное "семиотико--семантическое поле" - множество слов, наиболее сильно связанных по смыслу в конкретном анализируемом тексте, на основании сопоставления анализируемого текста с представительной для предметной области совокупностью текстов. В результате внедрения созданных нами методов в работу электронных библиотек и телекоммуникационных сетей реализуется информационная технология интеллектуального смыслового поиска в информационных ресурсах на естественных языках без обязательного предварительного индексирования, а также, автоматическая смысловая индексация, классификация и аннотирование текстовой информации, как средства анализа и создания информационных ресурсов для глобальных телекоммуникационных сетей.
• Система ВААЛ [132] автор В. А. Шалак, работа над которой ведется с 1992 года, позволяет прогнозировать эффект неосознаваемого воздействия текстов на массовую аудиторию, анализировать тексты с точки зрения такого воздействия, составлять тексты с заданным вектором воздействия, выявлять личностно-психологические качества авторов текста и делать многое другое.
Области возможного применения
Составление текстов выступлений с заранее заданными характеристиками воздействия на потенциальную аудиторию.
Активное формирование эмоционального отношения к политическому деятелю со стороны различных социальных групп.
Составление эмоционально окрашенных рекламных статей.
Поиск наиболее удачных названий и торговых марок.
Психо- и гипнотерапия.
Неявное психологическое тестирование и экспресс-диагностика.
Создание легких в усвоении учебных материалов.
Научные исследования в области психолингвистики и смежных с нею дисциплинах.
Журналистика и другие сферы деятельности, использующие в качестве инструмента СЛОВО.
Социологические и социолингвистические исследования.
Информационные войны.
Контент-анализ текстов.
Мониторинг СМИ.
Система позволяет:
Оценивать неосознаваемое эмоциональное воздействие фонетической структуры текстов и отдельных слов на подсознание человека.
Генерировать слова с заданными фоносемантическими характеристиками.
Задавать характеристики желаемого воздействия и целенаправленно редактировать тексты для достижения указанных характеристик.
Корректировать текст по выбранным параметрам с использованием словаря синонимов на 5 тыс. синонимических рядов из 25 тыс. слов.
Настраиваться на различные социальные и профессиональные группы людей, которые могут быть выделены по используемой ими лексике.
Оценивать звуко-цветовые характеристики текстов.
Самому пользователю задавать дополнительные фоносемантические шкалы, расширяя систему в нужном для него направлении.
Производить факторный анализ данных с последующей визуализацией результатов.
Осуществлять полноценный анализ текста по большому числу специально составленных встроенных категорий и категорий, задаваемых самим пользователем.
Производить эмоционально-лексический анализ текстов.
Осуществлять контекстный анализ текстов.
Производить автоматическую категоризацию текстов.
• Интеллектуальная система “СЛЕДОПЫТ” [166] помогает быстро находить текстовые фрагменты документов, и предназначена для тех, кто в результате своей деятельности имеет дело с большим объемом информации.
”СЛЕДОПЫТ” позволяет оперативно находить необходимые документы, и представляет полученную информацию в удобном для
пользователя виде. Следопыт ищет информацию на русском и английском языках. “СЛЕДОПЫТ” позволяет в качестве запроса использовать фразы на естественном языке. Допускаются комбинированные запросы на смешанном русско-английском языке.
• В корпорации “Галактика” [74] создан новый продукт -
автоматизированная система поиска и аналитической обработки информации. Обеспечение руководителей высшего звена важной и актуальной для принятия решения аналитической информацией, выделенной из массива текстовых данных.
Поиск и формирование информационных массивов по конкретным аспектам исследуемой проблематики. Поиск информации осуществляется по ключевым словам с учетом их морфологии. Объемы исходных массивов данных - до сотен гигабайт. Доступные массивы данных: сообщения и статьи СМИ, отраслевая печать, нормативная документация, деловая переписка и материалы внутреннего документооборота предприятия, информация сети Интернет и т.д. Анализ объективных смысловых связей отобранных данныхПолучение "образа" проблемы - моментальной многомерной фотографии в информационном потоке в форме ранжированного списка значимых слов, употребляемых совместно с темой проблемы. Вскрытие и анализ закономерностей повторений словосочетаний в текстовых массивах данных и последующее их ранжирование. Сравнение нескольких состояний проблемы, выявление
закономерностей и тенденций (или частностей и случайностей) динамики развития изучаемой проблемы
Отслеживание "образа" проблемы с определенной периодичностью и анализ причин его изменения, включая выявление фактов и событий, которые обусловили эти изменения.
Сферы применения:
• развитие предвыборных технологий и социологических исследований в целях позиционирования и продвижения интересов политических партий и движений;
• поддержка информационных подразделений, службы маркетинга и службы безопасности крупных предприятий и банков;
• поддержка средств массовой информации.
Тенденцией развития рынка является разработка модулей лингвистического прикладного обеспечения для разработчиков систем автоматизации. Так как цены на данные программные продукты сопоставимы с ценами на отечественные системы автоматизации библиотек, необходимо расширять возможности существующих систем. В настоящее время в нашей стране сложилась ситуация, что системы автоматизации библиотек [26,28] не поддерживают технологии автоматизированного смыслового анализа текстов, а современные системы анализа текстов не адаптированы к работе с электронными фондами библиотеки. Необходима разработка алгоритмов и методики автоматизированной смысловой обработки текстов и реализация программно-технического комплекса для внедрения смыслового полнотекстового анализа в технологию обработки электронных фондов библиотеки.
1.2.
Еще по теме Обзор существующих программных продуктов анализа текстов:
- Описание работы системы автоматизированного смыслового анализа текстов
- Система смыслового анализа текстов в ИНТЕРНЕТ
- Сравнение текстов в алгоритме смыслового анализа
- Последовательность операций при создании и ведении базы данных ИРБИС при использовании системы смыслового анализа текстов
- Алгоритм расчета близости текстов заданному тексту-образцу
- Глава 4. Перспективы развития ИРБИС в плане применения системы смыслового анализа текстов для создания полнотекстовых баз данных в современной библиотеке
- 2.4. Локальное программное управление и регулирование
- ИНСТИТУТ НЕДОСТОЙНЫХ НАСЛЕДНИКОВ В РОССИЙСКОМ ПРАВЕ: ТЕОРИЯ И ОБЗОР ПРАКТИКИ ВЕРХОВНОГО СУДА РФ
- Основные продукты информационных агентств и подходы к их созданию
- ПРОДУКТЫ ВУЛКАНИЧЕСКИХ ИЗВЕРЖЕНИЙ
- Смысловая обработка текстов в полнотекстовых базах данных
- 3.1. Процесс создания текста в информационном агентстве: технологии, методы, профессионально-этические регуляторы
- 11.2.2. Области создания и распространения исходных документов, формирования информационных ресурсов и предоставления информационных продуктов и информационных услуг в Интернет
- Глава 1. Автоматизированная система смысловой обработки текстов
- Глава 3. Описание работы алгоритмов смысловой обработки текстов
- 4.3.1. Информационные правоотношения, возникающие при осуществлении поиска, получения и потребления информации, информационных ресурсов, информационных продуктов, информационных услуг