Приложение. Эвристика образного анализа
1. Пояснения работы системы визуального эвристического анализа Visual HCA
Пусть заданы объекты, которые являются предметом начальной стадии анализа для решения какой либо конкретной проблемы в одной из отраслей научной, административной, социальной или
производственной деятельности.
Изучение объектов обычно начинается с их типизации в соответствии с различием или общностью свойств для различных подмножеств исходного множества объектов.Термин объект трактуется здесь в самом широком смысле слова - любой предмет или явление из множества элементов, для каждого из которых либо известен набор одних и тех же характеристик, выраженных численно, либо известно о наличии или отсутствии фиксированного набора атрибутов. Сведения о наличии конкретного атрибута, признака или свойства должны быть выражены в числовом коде. Термины атрибут, признак и свойство здесь воспринимаются как синонимы.
Программа Visual HCA работает с данными, представляющими собой двумерный массив чисел из m-строк и n-столбцов. В каждом столбце расположен один атрибут для всех m объектов. В каждой строке расположены все n атрибутов одного объекта.
Программа позволяет расклассифицировать объекты по степени их близости между собой в пространстве атрибутов - рассортировать объекты по кластерам. Каждый кластер - это группа наиболее тесно связанных между собой объектов, таких, что расстояние между объектами внутри кластера в каком-то смысле меньше расстояния между объектами, находящимися в разных кластерах.
В качестве двух основных алгоритмов использованных в программе выбраны алгоритм построения дендрита на объектах и алгоритм факторного анализа или метод естественных ортогональных функций.
Ограничения на число объектов и их атрибутов (1000) связано в первую очередь с удобством пользования системой. К удобствам пользования мы относим, в первую очередь возможность визуального (образного) анализа на одном экране всего материала, относящегося к множеству объектов, воспринимаемых пользователем как единая совокупность, требующая структуризации.
Опыт разработчиковпоказывает, что активное, но не слишком изощренное использование всего экрана позволяет манипулировать в полной мере не более чем с 300 - 400 объектами при таком же количестве атрибутов.
Кластеризация на основе построения дендрита
Связи между объектами по степени их сходства можно представить в виде специального типа графа - дерева, в котором вершины - это объекты, а ребра (или дуги), соединяющие вершины, способ наглядного изображения структурных взаимоотношений между объектами в пространстве свойств.
Для построения дендрита вычисляется матрица расстояний между всеми объектами и затем для каждого из объектов ищется ближайший к нему. Способ вычисления расстояний, меры близости объектов между собой - произволен. В программе реализовано вычисление расстояний в манхеттенской метрике: расстояние равно сумме абсолютных величин разностей соответствующих координат - численных характеристик свойств объектов.
Начиная с минимальных расстояний все объекты
последовательно соединяются ребрами (или дугами) в цепочки - фрагменты графа. Объекты, попавшие в цепочку, рассматриваются при
дальнейшем построении дендрита только в ее составе, т.е. они могут войти в новую цепочку только вместе с остальными объектами из своей исходной цепочки. После того как каждый из объектов попал в одну из цепочек, ищется минимальное расстояние между цепочками, и последовательно все цепочки соединяются в дендрит, пока все объекты не окажутся связанными между собой. Прототип алгоритма описан в книге Плюта [102].
Последовательно удаляя ребра большей длины, можно добиться того, что дендрит распадется на ряд деревьев и изолированных вершин. Вершины, входящие в отделившееся новое дерево, соответствуют отдельному изолированному кластеру.
Кластеризация на основе факторного анализа
Относительно методов факторного анализа имеется
многочисленная литература, описывающая алгоритм и
математическую суть метода [160]. Поэтому в строгом смысле суть метода мы здесь рассматривать не будем, но элементарные представления о нем и наводящие соображения для тех, кто не хочет влезать в математические монографии и учебники, изложим на бытовом, разговорном языке с помощью серии иллюстраций в двух следующих параграфах.
Выделение доминирующих сочетаний свойств- факторов. Переход от описания объектов в пространстве свойств к описанию в пространстве факторов.
Пусть имеется четыре объекта, каждый из которых описывается тремя свойствами. О каждом свойстве известно лишь, что оно есть или отсутствует у данного объекта и этот факт изображается соответственно
единицей 1 или нулем 0. Допустим, эти данные имеют вид, представленный в таблице.
Таблица 1.
| Номер объекта | Номер атрибута | ||
| 1 | 2 | 3 | |
| 1 | 1 | 1 | 0 |
| 2 | 1 | 1 | 1 |
| 3 | 0 | 0 | 1 |
| 4 | 1 | 0 | 0 |
В трехмерном пространстве их можно изобразить как точки, расстояние до которых от начала координат по каждой из осей определяется числовой характеристикой атрибута с соответствующим номером.
Объекты можно также отождествлять не с точками, а с векторами. направленными из начала координат O в эти точки. Будем называть их далее векторами объектов. Расстояние от начала координат до точек, изображающих объекты в пространстве признаков, называется длиной вектора. Наибольшую длину имеет вектор объекта O2.
Объекты расположены не во всех вершинах куба. Заметим, что для изображения первых трех объектов достаточно иметь не трехмерное пространство исходных признаков, а двумерное пространство комбинаций признаков, называемых факторами. Это пространство - плоскость, проходящая через точки O1 O2 O3 O. В этом пространстве координатами служит новый набор свойств - факторов. Первый фактор: соответствует наличию набора из 1 и 2 атрибутов исходной таблицы.
Наличие фактора отображается в плоскости O1 O2 O3 O горизонтальной составляющей длиной sqrt(2) или приближенно 1.414.
Второй фактор совпадает с прежним третьим свойством. Вернемся к объекту O4. Для определения его положения введем новый третий фактор, ортогональный к первым двум факторам, и заданный как линейная комбинация 1 и 2 исходных признаков. Координаты четвертого объекта в пространстве новых факторов равны соответственно: 0.707, 0, 0.707. Новые координаты - факторы представляют собой такие комбинации прежних координат - атрибутов, что первый фактор вобрал в себя компоненты векторов, суммарная длина которых равна 2.5 * sqrt(2) = 3.535, суммарная длина компонентов по оси второго фактора равна 2, а третьего фактора 1∕sqrt(2) = 0.707.
Таблица 2.
| Номер объекта | Номер атрибута | ||
| 1 | 2 | 3 | |
| 1 | 1.414 | 0 | 0 |
| 2 | 1.414 | 1 | 0 |
| 3 | 0 | 1 | 0 |
| 4 | 0.707 | 0 | 0.707 |
Тогда таблица 1 в новых координатах станет таблицей 2.
Из таблицы 2 видно:
1- ый фактор имеет большую амплитуду, чем другие. Ее называют доминирующим фактором, или доминантой.
2- ой фактор имеет средние составляющие в характеристике объектов.
3- й фактор имеет меньшее максимальное значение, чем
другие.
Несколько огрубляя результаты, можно пренебречь этим фактором и описывать все объекты в пространстве меньшей размерности, в
пространстве главных доминирующих факторов. Тем самым можно сократить число свойств - факторов за счет их комбинирования и выявления скрытых, но более важных факторов, чем исходные признаки.
Новые характеристики оказываются более компактными, более удачными для описаний объектов. Это замечание станет еще более важным, если объектов в этой плоскости O1,O2,O3,O (совпадающих с заданными объектами) будет много больше, а вне этой плоскости число объектов резко не возрастет и будет пренебрежимо мало по сравнению с числом объектов в плоскости.Трехмерный случай может быть не очень интересен, но только он геометрически наглядно позволяет продемонстрировать возможности и преимущества снижения размерности пространства почти без потери информации.
В общем случае многомерного (n-мерного) пространства признаков факторный анализ позволяет перейти к рассмотрению объектов в пространстве той же размерности, заданном новой системой взаимно ортогональных единичных векторов, Векторы, составляющие базис нового пространства, это факторы, которые представляют собой линейные комбинации из исходных признаков.
Факторы компактнее описывают объекты, чем исходные признаки.
Несколько первых векторов нового базиса дают основной вклад в разложении характеристик объектов, а проекции векторов - характеристик объектов на остальные координаты для подавляющего большинства объектов пренебрежимо малы, по сравнению с проекциями на первые, доминирующие базисные векторы.
Итак, первое, (но не обязательно самое главное) для чего можно применять факторный анализ это снижение размерности задачи. Исходные признаки объектов, удобные для измерения, но многочисленные и потому неудобные для анализа можно свернуть в меньшее число
доминирующих факторов, наиболее ярко характеризующих объекты, и во второстепенные факторы, которыми в анализе можно пренебречь.
Элементарные представления о сути метода
Рассмотрим применение факторного анализа к двумерным массивам объектов и свойств.
Разложение исходной матрицы по двум системам ортогональных векторов Пусть двумерный массив - матрица A m,n - имеет вид таблицы 3.
Таблица 3.
| 1 | 0 | 0 | 0 | 0 | 0 |
| 0 | 1 | 1 | 0 | 0 | 0 |
| 0 | 1 | 1 | 0 | 0 | 0 |
| 0 | 0 | 0 | 1 | 1 | 1 |
| 0 | 0 | 0 | 1 | 1 | 1 |
| 0 | 0 | 0 | 1 | 1 | 1 |
Ее можно представить в виде суммы трех матриц A1+A2+A3, каждая из которых может быть представлена произведением вектора-столбца G1, G2 или G3 на вектор-строку F1, F2 или F3 соответственно.
Каждый элемент матрицы ak(ij) вычисляется как произведение i-ой составляющей вектора Gk на j-ю составляющую вектора Fk.
ak(ij)=Gk(i) x Fk(j)
Замечательным свойством векторов Fk и векторов Gk является их ортогональность. Это значит, что скалярные произведения (Fk,Fl) и (Gk,Gl) равны нулю, когда k не равно 1. Например, можно проверить, что:
(F1,F3) = 0 * 1 + 0 * 0 + 0 * 0 + 0 * 1 + 0 * 1 + 0 * 1 = 0.
Если бы мы имели только 6 свойств, распределенных таким образом между 6 объектами, как это имеет место в таблице 3, то каждая группа объектов однозначно бы характеризовалась своими свойствами, и
существовали бы простые правила разделения объектов на группы или классы.
Но такой идеальной картины обычно не бывает, а математическое представление, показанное здесь на тривиальном примере, с ростом размерности задачи и неоднозначности связи конкретных свойств с конкретными объектами становится все более полезным для анализа обобщенных свойств объектов.
Для тех, кто не имел удовольствия почувствовать в своей работе, что такое проклятие размерности, пусть приведет таблицу 4 перестановкой строк и столбцов к ее исходному виду.
Попробуйте вообразить, что перед вами матрица размером не 6x6, где всего на всего по три строки и три столбца, различающихся по своему содержанию, а матрица, размером 100 x 100. В ней заметить сходство различных объектов будет труднее.
Таблица 4.
| 0 | 1 | 0 | 0 | 1 | 0 |
| 1 | 0 | 1 | 0 | 0 | 1 |
| 0 | 1 | 0 | 0 | 1 | 0 |
| 0 | 1 | 0 | 0 | 1 | 0 |
| 1 | 0 | 1 | 0 | 0 | 1 |
| 0 | 1 | 0 | 0 | 1 | 0 |
В то же время, программа работает одинаково хорошо как с матрицей, представленной в таблице 4, так и с матрицей, записанной в таблице 3. Разницу чувствует лишь пользователь, так как вид матрицы из таблицы 3 более удобен для визуального анализа
Содержательная интерпретация структуры данных, представленных компонентами разложения в факторном пространстве
В программе имеется окно, в котором объекты могут быть выведены и расположены в соответствии со своими координатами G с индексами 1,2,...,m. В окне выводятся объекты в подпространстве двух любых координат Gi, Gj (ij= 1,2,3,...m), отображающих вклад в характеристику объекта векторов Fi, Fj с теми же индексами. Векторы F имеют n - компонент по числу свойств у объектов (часть компонент могут быть нулевыми). Векторы G перенумерованы в порядке убывания их длины. Поэтому первые векторы, связанные со слагаемыми - доминантами, а последние - в основном отображают ошибки наблюдений и вычислений.
Выявление содержательной стороны факторов, как новых обобщенных свойств в предметной области
Как мы отметили ранее, доминирующие составляющие должны дать возможность представить объекты в новом пространстве меньшей размерности. Таким образом, первые доминирующие факторы - это характеристики, которые дают нам обобщенные свойства объектов, и
которые первоначально могли быть не видны исследователю, и даже могло не существовать соответствующих понятий для выражения этих новых обобщенных свойств.
Для того, чтобы пытаться выявить эти новые обобщенные свойства, необходимо выделить крайние объекты, имеющие вклады соответствующего фактора Fk, близкие или равные максимальному и минимальному maxGk и minGk, но одновременно имеющие близкие к нулевым вклады других факторов. Тогда эти объекты будут в чистом виде носителями влияния только одного фактора, расположенного вдоль k-ой оси.
Исследователь - специалист в своей предметной области может изучив основное отличие этих крайних объектов между собой, выявив, в чем они противоположны, попытаться это отличие выразить в качестве нового свойства. Для этого, возможно, придется ввести новое понятие.
Аналогичную операцию по определению новых комплексных свойств - факторов можно проделать на каждой из осей разложения матрицы свойств объектов.
Удаление неинформативных свойств
Характеристики объектов страдают иногда недостатком информации при избыточности числа свойств, с помощью которых описывается объект.
Если эти свойства носят качественный характер, то их наличие отображается единицей, а отсутствие нулем.
Низкая информативность качественных характеристик может трактоваться в зависимости от целей исследования. Если какое-то свойство:
- встречается крайне редко;
- статистически равномерно распределено в объектах из разных классов;
- присутствует практически во всех изучаемых объектах, тогда это свойство неинформативно с точки зрения разделения объектов из заданной совокупности на значительные по количественному составу классы.
Замечание. С точки зрения выявления уникальных объектов такая трактовка понятия информативности не подходит. Редко встречаемые свойства для этой цели становятся информативными.
При выявления классификационных свойств, редкие события могут быть полезны только в случае высокой степени вероятности того, что они связаны с конкретным, интересующим исследователя кластерами. В случае если свойства выражены количественно, то низкая информативность какого либо свойства (для целей разделения объектов из заданной совокупности на значительные по количественному составу классы) выражается в том, что ненулевые значения:
- встречается крайне редко и не привязаны к одному классу;
- статистически равномерно по частоте встречаемости и однотипно по уровням распределены в объектах из разных классов;
- присутствует практически во всех изучаемых объектах с одинаковым законом распределения по всем выделяемым классам.
При значительном количестве свойств и объектов исследования может возникнуть задача удаления неинформативных свойств из характеристик объектов.
Эту задачу лучше решить на начальных стадиях решения проблемы разделения объектов на классы, поскольку обилие неинформативных характеристик делает объекты похожими между собой. Различия на этом фоне теряются, затушевываются и разделение на кластеры затрудняется.
Полезно перед разделением объектов на кластеры провести с помощью того же алгоритма факторного анализа :
- анализ самих свойств, их объединения в группы подобных, коррелируемых между собой свойств на всех объектах;
- провести анализ информативности различных свойств с точки зрения их избыточности, взаимного перекрытия и дополняемости для разбиения объектов на группы.
Те свойства, которые были введены в описание объектов до начала сбора информации, или на этапе сбора информации, но не обнаружены в достаточном количестве (или с отличной от фонового уровня амплитудой количественно измеряемых свойств) в изученных объектах, дадут практически нулевые столбцы исходной матрицы.
Это будут хорошо коррелируемые между собой векторы - столбцы и они войдут в один класс свойств, поскольку расстояние между ними будет малым. Тоже самое можно сказать о столбцах, практически полностью состоящих из единиц (или близких по амплитуде количественных характеристик). Они также будут хорошо коррелировать между собой, но их наличие не позволит различать объекты между собой так, как если бы это были нули.
Наша задача выделить оба этих класса свойств и удалить их из исходной матрицы. Положительным результатом такой операции будет:
- понижение размерности задачи (легко убедиться, что время работы программы существенным образом зависит от числа строк и столбцов исходной матрицы);
- более четкое разделение объектов на классы в оставшимся
подпространстве информативных свойств.
Конечно, говорить о более высокой информативности оставшихся свойств можно лишь условно, поскольку часть свойств может быть хотя и
случайным образом, но более или менее равномерно распределена между всеми объективно существующими различными классами.
Если таких свойств в оставшемся материале больше, чем свойств, связанных с конкретными группами объектов, то их маскирующее влияние также будет заметным. Но и с этим явлением можно бороться с помощью все того же программного элемента.
В качестве неинформативных свойств могут выступать редко встречающиеся варианты ответов на вопросы социологической анкеты или стандартно заполняемой формы в истории болезни, нормальная температура при рассмотрении болезней, протекающих без ее изменения.
Выделение кластеров в режиме диалога
Допустим с этой задачей - удаление неинформативных признаков - эксперт справился. В этом случае если объекты реально разделяются на классы по оставшимся свойствам, то мы увидим хотя бы на одном из наборов характеристик в окне “Факторный Анализ” как объекты группируются в некоторые скопления, расстояние внутри которых между объектами значительно меньше расстояния между центрами этих скоплений.
Замечание: Относительно расстояний внутри скоплений и между ними следует говорить с некоторой осторожностью, если взять два скопления вытянутых в каком либо направлении, но разделенных очевидным образом между собой промежутком, то мы все равно каждый из них видим как отдельное образование только расстояние внутри класса вдоль направления вытянутости будем измерять в другом масштабе по сравнению с расстоянием поперек направления вытянутости скопления.
Мысленные изменения масштаба в принципе может быть реализовано физически, но поскольку исследователь выполняет
разделение на классы "для себя", то важно только его собственная уверенность в правильности этого разделения.
В качестве инструментов разделения на кластеры в пространстве вкладов программа дает возможность применить окрашивание сближенных объектов в один цвет.
Для дальнейшей демонстрации технологии работы кластерного анализа разделение объектов по их свойствам на классы, число которых заранее неизвестно, предлагается смоделировать ситуацию, которая была бы прозрачной, наглядной и понятной будущему пользователю
классификатора Visual HCA.
Эта наглядность выразится в такой упорядоченности данных в матрице, которая в значительной степени должна быть предметом работы программы. Эта наглядность, впрочем, не будет замечена программой. Программа не отслеживает те моменты в организации данных, которые основаны на возможностях образного анализа и параллельного восприятия матрицы данных, любого табличного материала человеком.
Рассмотрим для примера двенадцать объектов с тридцатью свойствами.
Конструирование модели. Идеальная часть
Допустим, объекты составляют три группы. В первую входят первые три объекта, во вторую - четыре, в третью - пять.
Информация о свойствах представляется единицей при их наличии или нулем при их отсутствии. Пусть первые три объекта характеризуются наличием первых восьми свойств, при отсутствии их у других объектов.
Вторая группа объектов характеризуется наличием свойств с девятого по четырнадцатое при отсутствии их у других объектов, а третья группа
характеризуется наличием свойств с 15 по 20 при отсутствии их в объектах первой и второй групп как показано в следующей таблице:
Таблица 5.
| 1 группа | 2 группа | 3 группа | ||||||||||
| 1 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 2 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 3 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 4 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 5 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 6 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 7 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 8 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 9 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 |
| 10 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 |
| 11 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 |
| 12 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 |
| 13 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 |
| 14 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 |
| 15 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 1 |
| 16 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 1 |
| 17 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 1 |
| 18 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 1 |
| 19 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 1 |
| 20 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 1 |
Здесь мы намеренно сохранили порядок следования свойств и объектов (столбцов и строк), более удобный для визуального анализа. На практике порядок следования объектов и свойств будет выглядеть произвольным.
Если бы мы имели только 20 свойств распределенных таким образом между 12-ю объектами, то каждая группа объектов однозначно бы характеризовалась своими свойствами, и существовали бы простые правила разделения объектов на группы или классы.
Более того, если бы у каждого объекта в группе были бы зафиксированы только некоторые из свойств, характерных только для этой группы, то правила разделения на классы практически не усложнились бы.
Введение в модель случайных усложняющих составляющих
Для того, чтобы приблизиться к реальной практике, мы должны бы были в первую очередь добавить в нашу модель характеристики объектов, встречающиеся в различных группах. Пусть, например, свойства 21,22,23 распределены статистически равномерно (в нашем примере просто равномерно) между объектами каждой из трех групп, как показано в следующей таблице.
Таблица 6.
| 21 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 |
| 22 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 |
| 23 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 |
По этим признакам объекты разделятся на другие группы: все нечетные попадут в одну группу со свойствами 21 и 23, все четные - в другую со свойством 22. Ясно, что добавление трех этих свойств к исходной таблице "объекты-свойства" уже затрудняет разбиение объектов на описанные три идеальные группы.
Альтернативной к предложенной модели является
нижеприведенная таблица, в которой единицы и нули распределены в свойстве 23 в том же количестве по каждой из групп, что и для свойства 21, однако объекты ( только по этим свойствам) делятся на большее число групп: 1-я:(1,5,9), 2-я:(2,6,10), 3-я:(3,7,11), 4-я:(4,8,12).
Таблица 7.
| 21 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 |
| 22 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 |
| 23 | 1 | 1 | 0 | 0 | 1 | 1 | 0 | 0 | 1 | 0 | 1 | 0 |
На практике все еще сложнее. А именно, обычно существуют признаки, характерные для части групп объектов, а также признаки не характерные ни для одной из групп или характерные для всех объектов в выборке.
Таблица 8.
| 23 | 1 | 1 | 0 | 0 | 1 | 1 | 0 | 0 | 1 | 1 | 0 | 0 |
Введение в модель регулярных усложняющих составляющих
Добавим в модель признаки, характерные для части групп объектов (например, для любых двух групп из трех) и нехарактерные для остальных групп. Например, наличие признака указывается для всех групп объектов, кроме одной, и мы получаем наборы признаков, аналогичные тем, которые представлены в следующей таблице:
Таблица 9.
| 24 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 0 |
| 25 | 1 | 1 | 1 | 0 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 1 |
| 26 | 0 | 0 | 0 | 0 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 |
В первом случае отсутствие признака можно было бы назвать отдельным признаком, и тогда единицы и нули в строке характеризующей все объекты поменялись бы местами, и мы получили бы характеристику аналогичную той, которая соответствует первым десяти признакам.
Последняя группа признаков, которую следует упомянуть, это признаки, полностью отсутствующие во всех трех группах объектов, и признаки, присутствующие во всех трех группах. Для большего соответствия практике здесь было бы уместно говорить не о полном, а о почти полном отсутствии или присутствии свойств.
Таблица 10.
| 27 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 28 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| 29 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 |
| 30 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 |
Конечно, если соответствующие признаки полностью отсутствуют только в указанных трех группах, а в других возможных группах объектов они есть, то эти признаки являются классификационными для всех трех группах описываемых групп.
Но как только мы ограничиваемся указанными тремя группами объектов, свойства присутствующие во всех этих группах или свойства отсутствующие во всех группах перестают носить классификационный характер.
Роль различных групп свойств в синтезированной модели исходного материала
Фактически задача эксперта, который хочет выявить неизвестные ему, (но известные нам - авторам и читателям, на чьих глазах синтезировался модельный материал,) указанные три группы объектов, включает в себя отыскание и удаление неинформативных признаков и выявление классов по информативным признакам.
Мы могли бы считать, что признаки с 21 по 23, указанные в таблице 3, также претендуют на информационную значимость. В отсутствии первых 20 признаков они позволяют разбить объекты на 4 группы: (1,5,9), (2,6,10), (3,7,11) и (4,8,12) .
Однако, в нашем случае число признаков, объединяющих объекты в три группы, указанные в таблице 1, должны пересилить своей массовостью (для математиков надо сказать: "пересилить
энергетически") и мы увидим эти три группы, разделение которых будет просто слегка осложнено признаками с двадцать первого по двадцать третий. Остальные признаки с двадцать четвертого по тридцатый также будут усложнять картину. Однако, 24, 25 и 26 признаки могут быть информационно значимы, поскольку нули этих свойств будут коррелировать с единицами первых двадцати свойств. А признаки типа 27-30, особенно встреченное в большем количестве, чем в данной таблице, могут массовостью ("энергетически") подавить остальные признаки и сделать объекты неразличимыми между собой с точки зрения принадлежности различным классам (группам).
Выводы и рекомендации
Таким образом, задача эксперта при работе с классификатором отличается от задачи первичного накопления материалов.
Если на первом этапе эксперт обязан привлечь для анализа объектов как можно больше свойств, а практически взять все, что доступно для анализа, то на этапе классификации он должен решить задачу выделения тех признаков, которые помогают разделить объекты по групповым свойствам и удалить те, которые затрудняют решение задач классификации, делая объекты неразличимыми между собой.
Признаки, которые приходится удалить для разграничения объектов по классам, могут оказаться важными в случае присоединения новой совокупности объектов. Но без присоединения новой совокупности объектов и после удаления неинформативных на данной выборке признаков, мы, фактически, получаем возможность изучать тонкую структуру исходной выборки объектов.
Присоединение новой совокупности может заставить нас сохранить прежде выбрасываемые свойства, и тонкая структура исходной группы может быть утрачена.
Назовем файл с синтезированными данными этими данными mode1005.txt. (По крайней мере, в дальнейших иллюстрациях его можно распознать под этим именем.)
Рекомендуем для лучшего осмысления дальнейшего создать на своем компьютере такой же файл и проделать вместе с нами все дальнейшие действия над ним.
2. Иллюстрации возможностей программы на сформированных модельных данных
Не отвлекаясь на технику манипулирования с данными на экране, рассмотрим только методические приемы и результаты применения классификатора в задачах с известным для нас ответом.
1. Далее описание ведется так, как если бы мы составляли отчет по результатам компьютерного анализа данных: описываются особенности, наблюдаемые на копии экрана, полученной с помощью функциональной клавиши Print Screen и графических средств Windows. Затем по результатам анализа экрана, или совместного анализа нескольких экранов делаются выводы.
2. В факторном пространстве обычно все факторы, начиная со второго, имеют близкие значения в точке минимума и максимума, отличающиеся между собой знаком, поэтому координаты в факторном пространстве, рассматриваемые на базе от 0 до 1 следует воспринимать как относительные. Точная градуировка шкалы по каждому из факторов выясняется только в окне текущего вектора, где указаны максимальное и минимальное значения Gk.
Демонстрация приемов работы. Выделение эталонных объектов и/или эталонных распределений свойств
Выше для выявления содержательного описания факторов как новых обобщенных свойств в предметной области пользователя программного продукта предлагалось выделить объекты, имеющие вклады
соответствующего фактора Fk, близкие или равные максимальному вкладу и
минимальному maxGk и minGk, но одновременно имеющие близкие к нулевому вклады других факторов.
Тогда эти объекты должны быть носителями влияния только одного
фактора, расположенного вдоль k-ой оси. Назовем эти объекты
эталонными. Они не должны быть (а в случае использования номинальных шкал и не могут быть) точной копией фактора Fk. Но они должны в рафинированном виде отражать основные черты этого фактора. Кластеризация объектов в иллюстрациях
На рисунке 28 представлены перемешанные данные.
Рис. 28. Исходные данные
На рисунке 29 показаны кластеры, выделенные автоматически в окне
“Граф”.
Рис. 29. Кластеры на графе
На рисунке 30 показаны кластеры в факторном пространстве 2 и 3 факторов.
Рис. 30. Кластеры факторном пространстве
На рисунке 31 показаны графики факторов.
2-й фактор вверху красный с ним антикоррелирует зеленый объект.
3- й фактор внизу красный с ним коррелирует красный объект.
На рисунке 32 показана матрица данных после пересортировки объектов по
цвету.
Рис. 32. Данные после пересортировки только объектов
Рис. 33. Данные после пересортировки атрибутов и объектов
атрибутов и пересортировки их по цвету.
Замечания о роли первой доминанты в кластерном анализе
На примере модельных данных проиллюстрирован тот факт, что первая доминирующая составляющая на ненормированных данных, не меняющих знака, (только положительных, или только отрицательных) чаще всего отражает характеристику суммы амплитуд значений всех свойств для каждого из объектов или сумму значений каждого свойства для всех объектов.
На рисунке 46 показан график 1-го фактора. Фактор принимает только положительные значения.
Рис. 34. График 1-го фактора
До сих пор мы рассматривали модель исходных данных, в которых наличие свойства фиксировалось единицей, а отсутствие - нулем. Можно
показать, что в ряде случаев существенный эффект для работы классификатора дает сдвиг всех данных на постоянную составляющую. Например, если мы все единицы в таблице кодов признаков заменим на девятки, а нули - на восьмерки, то мы получим новую последовательность векторов свойств и векторов коэффициентов - вкладов комбинаций свойств в последовательность характеризуемых ими объектов.
В ситуации с количественными характеристиками свойств эффект, связанный с введением в каждое из численных значений свойств аддитивной постоянной составляющей может представлять еще больший интерес. Если, например, мы вычтем из всей матрицы "объекты - свойства" среднее значение, то тем самым мы повысим частоту перехода через нуль по всем собственным векторам исходной матрицы.
Не математики могут пропустить это замечание, но для эксперта, не знакомого с математическим алгоритмом программы, заметим, что эта операция увеличивает число главных компонент, а значит увеличивает и число вариантов подпространств, в которых вклады различных факторов будут иметь все еще значительный вес.
Различия (особенности) работы с качественными и
количественными признаками
В случае, если свойства объектов описываются на количественном уровне (не наличие или отсутствие свойства, а интенсивность этого свойства для данного объекта) (например, количество жалоб по данной тематике в данном муниципальном округе), то с этими количественными характеристиками нужно работать двумя способами.
Первый способ - переход к слабым шкалам
Если данные содержат как количественные, так и качественные характеристики, и мы вынуждены их анализировать их одновременно, то целесообразно перевести количественную характеристику в ряд характеристик - классов, каждый из которых отвечает определенной степени интенсивности описанного количественного свойства.
В этом случае эксперт до применения программы классификатора сам должен выделить критические значения количественной характеристики, переход за которой в ту или иную сторону позволяет отнести эту характеристику к тому или иному разряду интенсивности этого свойства.
Приведем пример.
Пусть в качестве признака выступает температура человеческого тела. Если мы измеряем ее по шкале Цельсия, то 36.6 с точки зрения врача это норма или нуль, 37.4 - повышенная, а 42.2 это слишком высокая.
Такого рода признаки позволяют установить количественные соотношения между объектами. Говорят, что они измерены в количественных шкалах. В частности, температура по Цельсию измерена в интервальной шкале. Ее можно перевести в другую интервальную шкалу, например, в шкалу Фаренгейта линейным преобразованием:
Однако, если для врача интересен только диапазон температур от 35C до 42C, то для анатома этот диапазон оказывается укороченным снизу. Для врача, в принципе 36.7 мало чем отличается от 36.5 или 38.2 от
38.4. Его представления о температуре без потери информативности можно представить в так называемых слабых шкалах.
Ему можно было бы использовать, например, шкалу, называемую порядковой и состоящей из семи классов:
1. очень низкая температура - ниже 35.4;
2. 2 низкая - 35.4 - 35.9;
3. 3 пониженная - 36.0 - 36.4;
4. 4 нормальная - 36.5 - 36.9;
5. 5 повышенная - 37.0 - 37.9;
6. 6 высокая - 38.0 - 39.0;
7. 7 очень высокая - выше 39.
Границы классов здесь введены субъективно и определяются целями анализа, проводимого экспертами.
Порядковую шкалу можно перевести в признаки, описываемые в номинальных шкалах, в которых каждая позиция порядковой шкалы заменяется одним признаком, который представляется своей номинальной шкалой.
Однако, теперь мы вместо одного свойства описанного в "сильной" интервальной шкале, имеем как бы семь свойств, из которых только одно из свойств отличается от нуля для данного объекта. Например, для пациента с нормальной температурой в номинальной шкале мы обозначаем этот факт вектором 0,0,0,1,0,0,0.
Аналогичная ситуация возникает при анализе результатов анкетирования, где вместо номера ответа на данный вопрос приходится вводить нули столько раз, сколько предлагалось ответов на выбор и только один из нулей, соответствующий номеру выбранного ответа, заменить единицей.
Второй способ - классический
Если все характеристики свойств количественные, то переход к слабым шкалам не требуется. Он может быть даже нежелателен. Например, переход к номинальной шкале порождает увеличение размерности задачи.
Необходимо только внимательно рассмотреть количественные характеристики свойств с точки зрения сопоставимости их между собой разных свойств (атрибутов). Ясно, что для сравнения между собой разных признаков количественные характеристики по всем свойствам должны стать одной размерности (например, безразмерные) и/или нормированы одним и тем же способом, например, так чтобы вектор свойств на всех объектах по модулю был равен единице.
Если диапазон изменения признаков неизвестен заранее, то нормирование следует выполнить, например, делением каждого значения признака на его норму. Нормой может быть - длина вектора данного свойства для всех объектов выборки: квадратный корень из суммы квадратов значений признака для всех объектов или сумма абсолютных величин значений признака для всех объектов.
Но этого может быть мало. Вернемся к примеру с температурой человеческого тела. Для сопоставления ее с другим свойством, например с количеством сахара в крови лучше выбрать новую точку отсчета для каждого из свойств и новую единицу шкалы отсчета. Это можно сделать так, чтобы минимальное и максимальное возможные значения оказались в пределах от -1 до +1 или от 0 до 1. Если это сделать только для данной выборки объектов, то при увеличении объема выборки новые значения могут уйти за пределы (-1,+1).
Если диапазон изменения признаков известен для генеральной совокупности, например, для всех людей, или для всех людей данного
возраста, если людей другого возрастного диапазона исследователь рассматривать не будет никогда, то трудностей с нормированием возникнуть не должно.
Лениться и отказываться от нормирования не стоит.
Замечания относительно нормирования исходных данных
Мы уже говорили о том, что первая компонента факторного анализа фактически может отражать распределения объектов по величине суммы вкладов всех факторов в характеристику объектов. В случае количественных характеристик это может исказить группирование объектов кластера.
Когда мы говорим о нормировании количественных характеристик, это не означает в обязательном порядке деление каждой характеристики на норму, которая вычисляется как корень квадратный из суммы квадратов характеристик всех объектов по данному признаку. Нормирование может заключаться, прежде всего, в делении характеристики на другую количественную характеристику объекта. Например, некоторые количественные фенотипические показатели индивидов существенно зависят от их возраста, особенно, в первые дни, месяцы и годы после рождения.
Избавиться от этой зависимости необходимо для сравнения разновозрастных индивидов (особей). Это можно сделать, нормируя показатель, связанный с возрастом, например, путем деления его на вес, или рост, или на другой, более уместный с точки зрения пользователя программного продукта, весовой коэффициент.
Если имеется какое-либо свойство, выраженное количественно, и зависящее от других количественных параметров этого же объекта, или среды, окружающей объект, а нам нужно сопоставить объекты по
относительному проявлению этого свойства, то без нормирования абсолютные показатели будут маскировать различия, являющиеся предметом анализа.
Работа с цветом для выделения кластеров разных функциональных окнах
Получив окрашенные кластеры в одной паре координат G(i), G(j), можно проследить перегруппировку кластеров перемешивание объектов разного цвета в других системах координат. Если разделение объектов на кластеры сохраняется, цвета не перемешиваются, то мы имеем устойчивую характеристику объектов, устойчивое их разделение на группы каждая из которых обладает свойствами, отличными от свойств объектов других групп.
Однако, как правило, природа не дает исследователю такого подарка. В этом случае необходимо проследить, нет ли устойчивого разделения на классы в окне “Граф”, если классы эти получены в окне “Факторный Анализ” и наоборот, нет ли такой пары координат - факторов, в которых классы, выделенные на дендрите, сохраняются в пространстве факторов.
Если это обнаружилось хотя бы в одном окне, то такой факт весьма ценен поскольку мы имеем выделение одних и тех же кластеров в алгоритмах разной природы. Нормальной является ситуация, когда кластеры, выделенные в окне “Граф”, и кластеры, выделенные в окне “Факторный Анализ” не совпадают, а дополняют друг друга по характеристикам, обращают внимание исследователя на особенности группирования объектов.
В окне “Граф” мы имеем как бы обобщенное, свернутое расстояние между объектами в пространстве признаков, а в окне “Факторный Анализ” нам предъявляется взаиморасположение объектов
только в подпространстве хотя и максимально сгруппированных, но частных наборов признаков.
Написание отчета по анализу материала из двумерной матрицы, снятие информации из окон
Кроме оперативного анализа, пользователю полезно бывает обдумать результаты работы программы за письменным столом или сидя перед экраном дисплея, но не в процессе работы программы, а после накопления результатов ее работы в виде экранных файлов, сохраненных одним из способов, доступных в среде Windows.
Для этого полезно иметь либо набор файлов с сохраненными экранами, на которых видны окна пользователя. Окна можно расположить удобным для совместного анализа образом. Наиболее удачные, продуктивные для анализа взаимные расположения окон продемонстрированы на примерах, рассеянных по тексту.
Часть окон полезно иметь в распечатанном виде. Описание их содержимого полезно для осознания самому исследователю - пользователю программным продуктом. Распечатки являются
свидетельствами объективности последующих утверждений и выводов по анализируемому материалу.
По результатам работы программы полезно составить журнал работы и отчет. В журнале должны быть отображена такая информация, как список признаков и список объектов с порядковыми номерами их в файлах исходных данных. В случае изменения порядка следования признаков и ли объектов, а также в случае сокращения или добавления их, порядковые номера полезно иметь под рукой, а не надеяться на свою память.
Изменение порядка следования признаков или свойств помогает образному анализу данных в различных окнах. С точки зрения упорядочивания по свойствам обычный алфавитный порядок свойств в матрице данных является самым случайным.
Отчет полезен как первичный документ для дальнейшей подготовки материалов к публикации и демонстрации.
В отчете рекомендуется дать формальное описание содержимого каждого из окон, сохраненных в виде экранных файлов или распечаток с выделением интересных для предметной области особенностями.
Однако ресурс Вашего компьютера не безграничен. При большом числе файлов одновременно находящихся в обработке увеличивается время ожидания и затрудняется ориентация в большом числе окон пользователя. Поэтому полезно наиболее ценные результаты сохранить для совместного анализа данных, полученных разновременно, за несколько сеансов работы.
Подготовка исходного материала в соответствии с целью исследования и для улучшения его образного визуального анализа.
Первичное формирование набора свойств и объектов для одновременного их анализа.
Мы уже говорили о выборе свойств для описания объектов выше. Пусть шкалирование данных произведено. Появилась некая исходная выборка. Когда можно приступать к обработке?
Требования к репрезентативности исходного материала минимальны. Лишь бы исследователь сам считал, что целесообразно начать анализ. Допустимо проведение анализа с такой постановкой задачи: нет ли в материале данных, имеющих тенденцию к группированию.
Мы даже рекомендуем чаще проверять накапливаемые данные с помощью системы, когда у исследователя еще не сложилось четкое представление о характере накапливаемого материала.
Результатом может быть подсказка о возможных тенденциях, намечающихся по мере накопления данных, о моделях исследуемых объектов и о гипотетических взаимоотношениях и связях между группами свойств и/или группами объектов.
Пользователь может ставить задачу в форме проверки гипотезы о принадлежности конкретных объектов конкретным кластерам. Сама гипотеза, выдвинутая им, выражена в его эвристических действиях. Он может придать гипотезе вид свойства объекта. Это свойство - гипотетическая принадлежность конкретному кластеру. Чаще всего это принадлежность конкретному классу объектов, имеющих собственное имя в науке, культуре или в быту.
Например, принадлежность индивида (person) конкретному генотипу, конкретному кариотипу, или принадлежность какого-либо
фенотипического свойства конкретному синдрому и т.п.
Это свойство - гипотеза о принадлежности классу может быть спрятана пользователем от программы, исключена из вводимого в ЭВМ материала. Она может использоваться им как дополнительная информация, которую он использует, привлекает и активизирует вне массива данных, запускаемых в анализ.
Например, он может окно Map использовать для присвоения координат, группирующих данные в гипотетические классы пользователя, и устроить, таким образом, проверку гипотезы по остальному материалу.
Лучше, конечно, если целью не является проверка свойств системы Visual HCA, включить всю известную информацию в исходный материал.
Если Вы не удовлетворены результатом первого применения Visual HCA, внимательно познакомьтесь с нижеследующими рекомендациями.
Не дифференцируемость данных
Допустим, что, с одной стороны, пользователь знает, что в материал, запущенный им на обработку, включены объекты, которые он сам может выделить из массы других на эвристическом уровне, как объекты с аномальными особенностями. Но, с другой стороны, допустим, что он не может сформулировать в терминологии свойств и признаков, представленных им в матрице данных, в чем выражаются эти аномальные особенности, а Visual HCA, либо не выделяет эти объекты, либо делает это не слишком ярко.
Не отчаивайтесь. Во-первых, проверьте, нельзя ли все-таки Вашу эвристику оформить в виде свойства.
Во-вторых, если это всего один объект, а свойство выражается в одной номинальной шкале в виде единицы или нуля, то оно действительно может оказаться незамеченным Visual HCA, который отслеживает в первую очередь статистически значимые группировки или отклонения от них.
Выделите в таблице данных все строки и столбцы, на пересечении которых стоят элементы матрицы, ответственные, по Вашему мнению, за идентификацию интересующего вас объекта или свойства и действительно имеющие отличные "на статистическом уровне строгости" от других объектов и/или свойств значения в своих строках и столбцах.
Если выделенное множество составляет долю элементов матрицы, меньшую сотой части, то максимум на что можно надеяться, это выделение особенности в факторах с большими номерами и в виде висячих вершин графа на дендрите.
Редкие, отличающиеся аномальными свойствами объекты выделяются на дендрите, как правило, висячими вершинами с длинными, ребрами (дугами). При первых же устранениях наиболее длинных дуг (движок на цветовой шкале в окне “Граф”) эти вершины становятся изолированными.
Если объекты в окне “Факторный Анализ” равномерно распределены в подпространствах доминирующих факторов (кроме, быть может, первого фактора), а дендрита имеет вид сильно ветвящегося дерева изометричной формы, то это значит, что отобранные Вами объекты и выбранный набор свойств для их описания дали Вам слабо дифференцируемую совокупность.
При этом факторы с большими номерами i,j могут выделять по одному - два объекта, резко отделяющихся в подпространстве Gi,Gj от остальных. Иногда различие столь резко, что все объекты лежат в разных половинах (верхней и нижней, левой и правой) рабочей площади окна “Факторный Анализ”.
Причиной может быть:
- отсутствие реальных значимых различий объектов в данном пространстве свойств; в этом случае, если различия желательно выявить, ищите дополнительные свойства, не включенные ранее в описание объектов;
- недостаточное количество объектов с подлежащими выявлению особенностями; в этом случае необходимо либо (хотя бы временно) резко уменьшить в выборке число объектов, заведомо не имеющих особенностей, интересующих исследователя, либо искать и наращивать в выборке число объектов с замеченными аномальными особенностями.
Ураганные отклонения в данных
В ряде случаев возникает ситуация, кода доминирующие факторы с малыми номерами ij могут выделять по одному - два объекта, резко отделяющихся в подпространстве Gi,Gj от остальных.
Иногда различие столь резко, что все объекты лежат в разных половинах (верхней и нижней, левой и правой) рабочей площади окна “Факторный Анализ”. Можно сказать, что в этом случае Вам все ясно. Это объекты с ураганным отклонением свойств (даже часто одного из количественно задаваемых свойств) от всех остальных. Эти объекты заставляют другие быть неразличимыми между собой по данному свойству или набору свойств.
Если Вам необходимо изучить более тонкую структуру взаиморасположения нерасчлененной части объектов, то обращения к опции Zoom в окне “Факторный Анализ” может оказаться недостаточно.
Без ущерба для дальнейшего анализа объекты с ураганными значениями свойств ("самородки", "вундеркинды", "UFO") могут быть
удалены из матрицы данных. В качестве альтернативы могут быть удалены не объекты, а свойства, резко выделяющие объект из остальных, но не работающие для решения других задач.
Заметим, что ураганные отклонения в главных доминирующих факторах проявятся, только когда они представляют собой:
- количественную характеристику на порядок и больше отличающуюся у одного - двух объектов от остальных;
- значительный по численности набор качественных характеристик, выраженных в номинальных шкалах у одного из объектов отличным образом от остальных объектов.
При малой численности отличий соответствующие ураганные отклонения переместятся в факторные подпространства с большими
номерами (с "энергетически слабыми" факторами) и мы получим случай, описанный в разделе “Не дифференцируемость данных”.
Подмешивание отдельных объектов или кластеров с известными свойствами
Для наглядности изложения в примерах и иллюстрациях, приведенных в нашем описании системы Visual HCA, даны либо задачи с известным для читателя ответом, (если мы синтезировали, смоделировали некий материал), либо практические материалы вместе с гипотезой о характере группирования, отраженной в упорядоченности объектов и/или свойств, и проверяемой у него на глазах.
Если сведений или гипотез об упорядоченности нет, или выдерживается принцип упорядочивания по времени поступления объектов в распоряжение исследователя, а это - поток случайных событий, то данные целесообразно перегруппировать после первого обращения к системе Visual HCA.
Перегруппировка способствует большей наглядности образов, возникающих в различных окнах.
Об этом подробнее сказано в параграфе упорядочение свойств и объектов в исходной матрице по результатам кластеризации или в соответствии с априорной гипотезой о кластерах свойств и кластерах объектов.
Достижению большей наглядности материала во всех окнах может способствовать встраивание в исходную матрицу данных, опирающихся на какую либо априорную информацию пользователя.
Эта информация может быть получена, в том числе, в результате предшествующего анализа данных системой Visual HCA
Предлагаемый прием напоминает работу с "мечеными атомами". Если надо выловить небольшое множество из нового материала, то можно подмешать в данные известный кластер, который является в соответствии с гипотезой кандидатом на увеличение числа членов за счет присоединения новых малочисленных объектов.
Этот известный кластер должен быть многочисленным. Например, признаки, которые четко могут быть использованы для идентификации принадлежности объекта к интересующему нас кластеру, должны составлять долю, не меньшую, чем сотая доля всех элементов исходных данных, поступающих на анализ. Этот эффект можно получить, подмешав один объект в нескольких экземплярах, или размножить все объекты из малочисленных, но интересных кластеров.
Можно подмешать только один "меченый атом". Этого достаточно, если целью его внедрения является идентификация общности новых и известных кластеров. Тогда меченый объект надо будет искать в организовавшихся кластерах, и определять степень включенности его в один из новых кластеров. Но сам он не будет влиять на процесс кластеризации как организующее начало.
Если необходимо изучить связи некоторого свойства или объекта с другими, то для этих целей нужно не только не сокращать коррелирующие между собой свойства, а усиливать их, например, дублированием. Это действие выглядит прямо противоположным тому, за которое мы агитировали для борьбы с проклятием большой размерности задачи.
Подчеркиваем, что мы призывали исключать неинформативные свойства, зашумляющие полезную информацию. Здесь мы рекомендуем вводить данные, помогающие выявить слабые, но интересные пользователю скрытые свойства и связи.
Упорядочение свойств и объектов в исходной матрице по результатам кластеризации или в соответствии с априорной гипотезой о кластерах свойств и кластерах объектов
Мы уже отмечали, что наглядность материалов в различных окнах, кроме двух (наиболее важных по нашему мнению): “Граф” и “Факторный Анализ”, определяется способом организации данных в исходной матрице. В общем случае, если данные не структурированы на этапе препроцессинга, то информация в некоторых окнах трудна для визуального сопоставления. Привлечение визуального анализа данных в процессе анализа результатов работы системы Visual HCA может повысить эффективность работы исследователя и ускорить процесс осознания предоставляемой ему компьютерной информации.
Например, если у пользователя есть относительно какого-либо материала некая гипотеза о группировании и упорядочении объектов и свойств, то эту гипотезу желательно выразить в упорядочении строк и столбцов исходной матрицы в соответствии с этой гипотезой.
Если гипотеза появилась после первого обращения к системе Visual HCA, то полезно структурировать исходную матрицу так, чтобы информация, открывшаяся пользователю в результате анализа, стала более выпукла и наглядна для восприятия остальными заинтересованными лицами.
Например, нетрудно после разбиения на классы или кластеры свойств объектов и самих объектов переупорядочить строки и столбцы исходной матрицы так, чтобы объекты или свойства из одного кластера располагались в соседних строках или столбцах.
В этом случае графики распределений компонент векторов и карты изолиний исходной матрицы или ее составляющих будут менее
изрезанными и лучше приспособленными для образного визуального анализа.
Именно поэтому мы рекомендуем начинать анализ с построения графа и проведения факторного анализа. Затем требуется осуществить выделение кластеров цветом. В случае нетривиального распределения данных в "географическом" пространстве далее необходимо провести топографический анализ окрашенных в цвета своих кластеров. Для используемых в этих этапах анализа порядок следования объектов и свойств в исходной матрице не имеет значения.
Однако, если Вам хочется точнее рассмотреть тонкую структуру Ваших данных и результативнее привлекать для анализа другие окна, перегруппируйте данные в порядке следования кластеров и элементов в них (объектов или свойств).
Порядок следования объектов или свойств внутри своих кластеров не столь принципиален, как перегруппировка их в соответствии с принадлежностью различным кластерам свойств и объектов.
Пропустив затем материал через программы заново, Вы можете с большим успехом сделать "истину для себя""истиной для всех".
Еще по теме Приложение. Эвристика образного анализа:
- ПРИЛОЖЕНИЕ
- ПРИЛОЖЕНИЯ
- ПРИЛОЖЕНИЯ
- Глава 2. Система визуального эвристического кластерного анализа
- Цель анализа свойств системы
- Системный анализ как основа системотехники моделирования
- Этап анализа работоспособности сервера
- Обзор существующих программных продуктов анализа текстов
- Система смыслового анализа текстов в ИНТЕРНЕТ
- Описание работы системы автоматизированного смыслового анализа текстов
- Разница между системой смыслового анализа для ИРБИС32 и ИРБИС64
- Глава 6. Пример построения модели анализа работоспособности сервера
- Применение обобщенной методики моделирования и анализа свойств системы
- 4.4.1. Формальное описание обобщенной методики моделирования в задаче анализа свойств системы
- Сравнение текстов в алгоритме смыслового анализа
- Инструменты анализа финансовых результатов ВОЕННО-СТРОИТЕЛЬНОЙ ОРГАНИЗАЦИИ