Руководство по иерархической кластеризации: AGNES, DIANA и другие

Последнее обновление: 08/13/2026
  • Иерархическая кластеризация организует данные в древовидную структуру, называемую дендрограммой, что избавляет от необходимости предварительно задавать количество кластеров.
  • AGNES формирует кластеры снизу вверх путем итеративного слияния, в то время как DIANA разделяет одну большую группу сверху вниз.
  • Качество кластеризации оценивается с использованием внутренних метрик, таких как индекс Дэвиса-Боулдина, или внешних сравнений с помощью показателей точности и полноты.

Профессиональная 3D-визуализация дендрограммы для кластеризации изображений, создания структуры дерева до того, как точки данных объединяются в группы.

Вам когда-нибудь казалось, что вы смотрите на гору данных и не видите леса за деревьями? Вот тут-то и пригодится кластеризация. По сути, это искусство группировки точек данных на основе их сходства , обеспечивающее тесную взаимосвязь элементов внутри группы и значительное расстояние между ними. Это краеугольный камень машинного обучения без учителя, то есть компьютер находит закономерности, не получая предварительных указаний, что искать.

Хотя существует множество способов анализа данных, иерархическая кластеризация — это нечто особенное. Вместо того чтобы просто выбирать случайное количество групп, она создает вложенную структуру, похожую на генеалогическое древо . Независимо от того, пытаетесь ли вы диверсифицировать портфель акций или сегментировать клиентскую базу, этот подход дает вам визуальную карту взаимосвязи ваших данных, позволяя решить, где нужно обрезать дерево , чтобы получить идеальное количество кластеров.

подготовка данных и инфраструктуры
Связанная статья:
Освоение подготовки данных и инфраструктуры для эпохи искусственного интеллекта.

Основная логика иерархической кластеризации

Абстрактное представление цифровых блоков и красных покровителей, которые символизируют данные о животных и не объединяются перед процессом кластеризации.

По своей сути, иерархическая кластеризация строит иерархию групп. Часто это представляется в виде дендрограммы — древовидной диаграммы, где вертикальная ось отображает расстояние или степень несходства между кластерами. Чем ниже ветвь, тем больше сходство между элементами. Этот метод невероятно гибок, поскольку, в отличие от алгоритмов типа K-средних, он не требует предварительного определения количества кластеров (k) с самого начала.

АГНЕС: Подход «снизу вверх»

Панель визуализации финансовых данных с активами объединенных секторов, иллюстрирующая применение кластеризации и диверсификации карт.

AGNES, или агломеративное вложение, — это наиболее распространенный вариант иерархической кластеризации. Он начинается с принципа «каждый сам за себя», где каждая отдельная точка данных представляет собой свой собственный крошечный кластер . Затем алгоритм итеративно объединяет два ближайших кластера, пока все не будет сгруппировано в одну большую группу.

Анализ графиков и аналитика данных
Связанная статья:
Освоение анализа графов в эпоху больших данных

Процесс обычно проходит следующие этапы: сначала вычисляется матрица близости с использованием метрики расстояния (например, евклидова расстояния). Затем две наиболее похожие точки объединяются. Матрица обновляется, чтобы отразить эту новую группу, и процесс повторяется. Для этого необходим критерий связи , определяющий способ измерения расстояния между группами:

  • Однозвенный механизм: Смотрит на минимальное расстояние Между любыми двумя точками в разных кластерах. Это может привести к «цепочке», когда кластеры растут в длинные, тонкие линии.
  • Полная связь: Основное внимание уделяется максимальное расстояние Между точками, как правило, образуются более компактные сферические группы.
  • Средний уровень связи: Вычисляет среднее расстояние между всеми парами точек в двух кластерах, обеспечивая сбалансированный компромисс.
  • Центроидная связь: Измеряет расстояние между геометрические центры (центроиды) кластеров, которые зачастую более устойчивы к выбросам.
  • Метод Уорда: Вместо измерения расстояния, он стремится к... минимизировать общую внутрикластерную дисперсиюэффективно поддерживая компактность и сплоченность кластеров.

ДИАНА: Стратегия сверху вниз

Профессионалы анализируют графики данных в белой картинке, представляют валидацию кластеров и тома базовых решений в данных.

С другой стороны, у нас есть DIANA (Divisive Analysis). Если AGNES — это о строительстве башни, то DIANA — это о создании скульптуры . Она начинается с одного огромного кластера, содержащего все точки данных, и рекурсивно разбивает его на более мелкие.

análisis de datos con SQL
Связанная статья:
Анализ данных с помощью SQL: экспертный анализ результатов и техники

Алгоритм определяет кластер с наибольшим диаметром (наиболее непохожие точки) и находит наиболее «отдельное» наблюдение — то, которое наиболее отличается от остальных. Это наблюдение образует новую группу, а другие точки переназначаются в зависимости от того, к какой группе они ближе . Это продолжается до тех пор, пока каждая точка не будет изолирована. В отличие от AGNES, здесь достаточно выбрать метрику расстояния; метод связывания не требуется.

Измерение успеха и качества

Поскольку в обучении без учителя нет «правильного» ответа, мы используем определенные метрики, чтобы проверить, действительно ли наши кластеры имеют смысл. Обычно мы разделяем их на внутреннюю и внешнюю валидацию.

Внутренняя валидация не требует внешних меток. Например, индекс Дэвиса-Боулдина оценивает соотношение внутрикластерной сплоченности и межкластерной разобщенности; чем ниже значение, тем лучше. Потенциал стресса измеряет сумму квадратов расстояний до центроидов, хотя этот показатель, естественно, снижается по мере добавления большего количества кластеров. Другие популярные инструменты включают метод «локтя » и анализ силуэтов для поиска оптимального количества групп.

Функции окна SQL
Связанная статья:
Освоение оконных функций SQL для расширенного анализа данных

Внешняя валидация вступает в действие, когда у вас есть эталонный результат или экспертные метки для сравнения. Такие метрики, как точность, полнота и F-мера, рассматривают результат кластеризации как задачу классификации. Вы также можете использовать теорию информации , применяя энтропию и взаимную информацию, чтобы увидеть, насколько снижается неопределенность при сравнении выходных данных алгоритма с известными категориями.

Практическое применение: от финансов до анализа данных

Это не просто академическая теория. В финансах, например, кластеризация является мощным инструментом диверсификации портфеля . Используя корреляционную матрицу доходности активов в качестве меры расстояния, инвесторы могут построить дендрограмму, чтобы увидеть, какие акции движутся синхронно. Для настоящей диверсификации следует выбирать активы из разных ветвей дерева, гарантируя, что портфель не будет чрезмерно подвержен одному фактору риска.

Помимо финансовых аспектов, кластеризация помогает в сегментации рынка , группируя клиентов со схожими покупательскими привычками, что позволяет компаниям адаптировать свой маркетинг. Ключевым моментом является экспериментирование с различными метриками расстояния — такими как Манхэттен или Махаланобис — и различными методами связывания, чтобы определить, какой из них выявляет наиболее правдоподобные закономерности в конкретном анализируемом наборе данных.

Овладение этими иерархическими методами позволяет глубоко структурно понимать данные, переходя от детального анализа отдельных точек к общей картине глобальных категорий. Балансируя между стратегиями объединения и разделения данных и подтверждая результаты с помощью внутренних и внешних метрик, можно преобразовать необработанный, немаркированный шум в действенную, систематизированную информацию.

анализ данных в реальном времени
Связанная статья:
Анализ данных в реальном времени: полное руководство для предприятий
Похожие посты: