Встречается на собеседованиях • сегодня

Что ищут в данных при кластеризации

При кластеризации ищут естественные группы объектов (кластеры) внутри данных, где объекты внутри одного кластера похожи между собой, а между разными кластерами — отличаются. Основные цели:

  1. Сходство внутри кластера — минимизация расстояния между точками внутри группы (например, евклидово расстояние для K-means).
  2. Различие между кластерами — максимизация расстояния между центрами кластеров или другими метриками различия.
  3. Интерпретируемость — осмысленность групп для бизнеса (например, сегменты клиентов).

Пример с K-means:

python
from sklearn.cluster import KMeans
import numpy as np

# Пример данных
X = np.array([[1, 2], [1, 4], [1, 0], [4, 2], [4, 4], [4, 0]])

# Кластеризация
kmeans = KMeans(n_clusters=2).fit(X)
print(kmeans.labels_)  # Метки кластеров: [0, 0, 0, 1, 1, 1]

Популярные метрики оценки: силуэт, индекс Дэвиса-Боулдина, elbow-метод для выбора числа кластеров.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы