비지도 머신러닝: Algorithms유형 및 예시

⚡ 스마트 요약

비감독 학습은 레이블이 지정되지 않은 데이터를 사용하는 머신 러닝 기법으로, 모델이 사전에 제공된 답변에 의존하는 대신 클러스터링, 연관 규칙 및 차원 축소를 통해 스스로 구조를 발견하도록 합니다.

  • 🔘 별도의 라벨이 필요 없습니다. 이 알고리즘은 알려진 답변과 비교하는 대신 구조를 찾습니다.
  • ☑️ 세 가지 작업 유형: Cluster연관 규칙 마이닝 및 차원 축소.
  • 네 가지 클러스터링 스타일: 배타적, 집적적, 중복ping 그리고 확률적입니다.
  • 🧪 명명된 알고리즘: K-평균, 계층적 클러스터링, 퍼지 C-평균, PCA, SVD 및 ICA.
  • 🛠️ 생계를 유지하는 곳: 고객 세분화, 사기 및 이상 탐지, 시장 바스켓 분석, 데이터 전처리.
  • ⚙️ 상충 관계: 정답 데이터가 없다는 것은 결과를 사람이 해석하고 검증하고 명명해야 한다는 것을 의미합니다.

비지도 머신러닝: 알고리즘, 유형 및 예시

비지도 학습이란 무엇입니까?

비감독 학습은 사용자가 모델을 감독할 필요가 없는 머신 러닝 기법입니다. 모델이 스스로 작동하여 이전에 발견되지 않았던 패턴과 정보를 발견하도록 합니다. 주로 레이블이 지정되지 않은 데이터를 다룹니다.

비지도 학습 Algorithms

비지도 학습 Algorithms 사용자가 기존 방식보다 더 복잡한 처리 작업을 수행할 수 있도록 합니다. 지도 학습하지만 비지도 학습은 알려진 답을 기반으로 학습된 방법보다 예측하기 어려울 수 있습니다. 비지도 학습 알고리즘에는 클러스터링, 이상 탐지, 차원 축소 및 자기 조직화 신경망 등이 있습니다.

비지도 머신러닝의 예

아기와 가족 반려견을 대상으로 비지도 학습의 예를 들어 보겠습니다. 첫 번째 그림은 아기가 이미 알아보는 반려견입니다.

아기가 가족 반려견과 함께 있는 모습. 아기는 이미 그 동물을 알아보고 있다.

그녀는 이 개를 알고 알아봅니다. 몇 주 후, 가족 친구가 개를 데리고 와서 아기와 놀아주려고 합니다. 아래 사진은 그 두 번째, 낯선 개입니다.

아기가 전에 본 적 없는 낯선 개

아기는 이 개를 이전에 본 적이 없습니다. 하지만 두 귀, 눈, 네 발로 걷는 모습 등 여러 특징이 자신의 반려견과 비슷하다는 것을 알아챕니다. 그래서 아기는 이 새로운 동물을 개라고 인식합니다. 이것이 바로 비지도 학습입니다. 비지도 학습은 학습자가 직접 가르치는 것이 아니라, 데이터(이 경우에는 개에 대한 데이터)를 통해 스스로 학습하는 방식입니다. 만약 이것이 지도 학습이었다면, 위의 비지도 학습 예시에서처럼 가족 친구가 아기에게 이 동물이 개라고 알려줬을 것입니다.

왜 비지도 학습인가?

다음은 비감독 학습을 사용하는 주요 이유입니다. 머신 러닝:

  • 비감독형 머신러닝은 데이터에서 알려지지 않은 온갖 종류의 패턴을 찾아냅니다.
  • 비지도 방법은 분류에 유용할 수 있는 특징을 찾는 데 도움이 됩니다.
  • 이 시스템은 데이터가 도착하는 즉시 실행되므로, 사람이 먼저 레이블을 지정할 필요 없이 들어오는 레코드를 분석하고 그룹화할 수 있습니다.
  • 수동 개입이 필요한 레이블이 있는 데이터보다 컴퓨터에서 레이블이 없는 데이터를 얻는 것이 더 쉽습니다.

Cluster비지도 학습의 유형 Algorithms

비지도 학습 문제는 클러스터링, 연관 규칙 도출, 차원 축소 문제로 further 분류됩니다. Cluster그룹화는 유사한 레코드를 그룹화하고, 연관 분석은 함께 나타나는 항목을 찾고, 차원 축소는 많은 특징을 몇 개로 압축합니다.

ClusterING

Clustering은 비지도 학습에 있어서 중요한 개념입니다. 주로 분류되지 않은 데이터 모음에서 구조나 패턴을 찾는 것을 다룹니다. 비지도 학습 Cluster알고리즘은 데이터를 처리하여 데이터에 존재하는 자연스러운 클러스터(그룹)를 찾아냅니다. 알고리즘이 식별할 클러스터의 개수도 수정할 수 있으며, 이를 통해 그룹의 세분화 정도를 조정할 수 있습니다. 아래 다이어그램은 흩어져 있던 레코드들이 명확한 그룹으로 분류된 것을 보여줍니다.

Cluster레이블이 지정되지 않은 데이터 포인트들이 별도의 클러스터로 그룹화된 것을 보여주는 다이어그램

활용할 수 있는 클러스터링 유형은 다음과 같습니다.

배타적(파티셔닝)

이 클러스터링 방법에서는 데이터가 하나의 레코드가 하나의 클러스터에만 속하도록 그룹화됩니다.

예: K- 평균

응집

이 클러스터링 기법에서는 모든 레코드가 처음에는 하나의 클러스터로 시작됩니다. 가장 가까운 두 클러스터를 반복적으로 합치면서 클러스터의 수가 줄어듭니다.

예: 계층적 클러스터링

중복ping

이 기술에서는, 퍼지 세트 클러스터링은 데이터를 분류하는 데 사용됩니다. 각 데이터 포인트는 서로 다른 소속 정도를 가지며 둘 이상의 클러스터에 속할 수 있습니다.

여기에서 데이터는 적절한 멤버십 값과 연결됩니다. 예: 퍼지 C-평균

확률 적

이 기법은 확률 분포를 사용하여 클러스터를 생성합니다.

예시: 다음 키워드

  • “남자 신발.”
  • “여성 신발.”
  • “여성용 장갑.”
  • “남자 장갑.”

신발과 장갑, 또는 남성용과 여성용처럼 두 가지 범주로 분류할 수 있습니다.

Cluster유형

다음은 비지도 머신러닝에서 가장 자주 접하는 알고리즘들입니다. 처음 두 개는 레코드를 그룹화하고, 마지막 세 개는 클러스터를 형성하기보다는 차원을 축소하며, K-NN은 K-means와 혼동되는 경우가 많아 목록에 포함시켰습니다.

  • 계층적 클러스터링 — 클러스터링
  • K-평균 클러스터링 — 클러스터링
  • K-NN(k 최근접 이웃)은 지도 학습 분류기이지 클러스터링 방법이 아닙니다.
  • 주성분 분석 — 차원 축소
  • 특이값 분해 — 차원 축소
  • 독립 성분 분석 — 차원 축소

계층 적 ClusterING

계층적 클러스터링은 클러스터의 계층 구조를 구축하는 알고리즘입니다. 모든 데이터를 하나의 클러스터에 할당하는 것으로 시작합니다. 이때, 서로 가까운 두 클러스터는 하나의 클러스터로 병합됩니다. 이 알고리즘은 하나의 클러스터만 남을 때까지 진행됩니다. 이 알고리즘은 별도로 언급할 가치가 있는 두 가지 개념을 정의합니다.

응집 클러스터링

이러한 상향식 계층적 클러스터링 방식은 클러스터 개수 K를 입력값으로 요구하지 않습니다. 병합 과정은 각 레코드를 하나의 클러스터로 형성하는 것부터 시작합니다.

이 방법은 거리 측정 방식을 사용하고 병합 과정을 통해 클러스터 수를 (반복마다 하나씩) 줄입니다. 최종적으로 모든 객체를 포함하는 하나의 큰 클러스터가 생성되며, 분석가는 적절한 그룹 수를 나타내는 높이에서 트리를 잘라냅니다.

덴드로그램

덴드로그램 클러스터링 방법에서 각 레벨은 가능한 클러스터를 나타냅니다. 덴드로그램의 높이는 결합된 두 클러스터 간의 유사성 수준을 보여줍니다. 높이가 덴드로그램 하단에 가까울수록 클러스터 간의 유사성이 높습니다. 최종 그룹을 정의하는 기준점을 선택하는 것은 자동화된 것이 아니라 대부분 주관적입니다.

K- 평균 ClusterING

K-평균은 반복적인 클러스터링 알고리즘으로, 그룹을 세분화합니다.ping 매 반복마다 클러스터링이 수행됩니다. 초기에는 원하는 클러스터 개수를 선택합니다. 이 클러스터링 방법에서는 데이터 포인트를 k개의 그룹으로 클러스터링해야 합니다. k 값이 클수록 더 세분화된 작은 그룹이 생성되고, k 값이 작을수록 덜 세분화된 큰 그룹이 생성됩니다.

알고리즘의 출력은 "레이블" 그룹입니다. 이 레이블은 각 데이터 포인트를 k개의 그룹 중 하나에 할당합니다. k-평균 클러스터링에서 각 그룹은 해당 그룹의 중심점을 생성함으로써 정의됩니다. 중심점은 클러스터의 심장과 같으며, 중심점에 가장 가까운 데이터 포인트들을 포착하여 클러스터에 추가합니다.

K- 가장 가까운 이웃

K-최근접 이웃(K-NN)은 모든 머신러닝 분류기 중에서 가장 간단합니다. 다른 머신러닝 기법과 달리 모델을 생성하지 않는다는 특징이 있습니다. K-NN은 사용 가능한 모든 사례를 저장하고 유사도 측정을 기반으로 새로운 인스턴스를 분류하는 간단한 알고리즘입니다. 레이블이 지정된 사례를 기준으로 분류해야 하므로 지도 학습 방식입니다. 여기서는 거리 기반 논리가 클러스터링과 유사하기 때문에 언급하는 것입니다.

이 방법은 예제들 사이에 의미 있는 거리가 있을 때 매우 효과적입니다. 하지만 훈련 데이터셋이 크고 거리 계산이 복잡할 경우에는 학습 속도가 느립니다.

주성분 분석

주성분 분석은 고차원 공간에서 새로운 기저를 선택합니다.ping 가장 중요한 점수만 추출합니다. 이 기준의 각 방향은 주성분이라고 합니다. 이렇게 추출한 부분 집합은 원래 공간에 비해 크기가 작은 새로운 공간을 구성합니다. 이를 통해 데이터의 복잡성을 최대한 유지할 수 있습니다.

협회

연관 규칙을 사용하면 대규모 데이터베이스 내의 데이터 객체 간의 연관성을 설정할 수 있습니다. 이 비지도 학습 기법은 대규모 데이터베이스에서 변수 간의 흥미로운 관계를 발견하는 데 중점을 두며, 핵심적인 학습 방법입니다. 데이터 마이닝예를 들어, 새 집을 사는 사람들은 새 가구를 살 가능성이 가장 높습니다.

다른 예 :

  • 유전자 발현 측정값을 기준으로 분류된 암 환자 하위 그룹
  • 쇼핑객들을 검색 및 구매 이력에 따라 그룹화합니다.
  • 시청자들이 부여한 평점에 따라 영화들을 분류했습니다.

감독 및 비지도 기계 학습

다음은 주요 차이점입니다. 지도 학습과 비지도 학습:

파라미터 감독된 기계 학습 기술 비지도 머신러닝 기술
입력 데이터 Algorithms 레이블이 지정된 데이터를 사용하여 훈련됩니다. Algorithms 레이블이 지정되지 않은 데이터에 대해 사용됩니다.
계산 복잡성 지도 학습은 더 간단한 방법입니다. 비지도 학습은 계산적으로 복잡합니다
정확성 정확도는 알려진 라벨과 직접 비교하여 측정할 수 있습니다. 정확도는 직접 측정할 수 없으며, 결과는 해석이 필요합니다.
일반적인 출력 새로운 기록 각각에 대한 예측 그룹, 규칙 또는 압축된 기능

비지도 기계 학습의 응용

비지도 학습 기법의 몇 가지 응용 분야는 다음과 같습니다.

  • Clustering는 유사성을 기준으로 데이터 세트를 자동으로 그룹으로 분할합니다.
  • 이상 탐지는 데이터 세트에서 비정상적인 데이터 포인트를 발견할 수 있습니다. 사기 거래를 찾는 데 유용합니다.
  • 연관 마이닝은 데이터 세트에서 자주 함께 나타나는 항목 세트를 식별합니다.
  • 잠재변수 모델은 데이터셋의 특징 개수를 줄이거나 데이터셋을 여러 구성 요소로 분해하는 등 데이터 전처리 과정에 널리 사용됩니다.

비지도 학습의 단점

  • 비지도 학습에 사용되는 데이터는 레이블이 지정되지 않았고 실제 그룹이 없기 때문에 데이터 정렬에 대한 정확한 정보를 얻을 수 없습니다.ping 알려지지 않았다
  • Less 입력 데이터가 알려지지 않았고 사람이 사전에 라벨을 붙이지 않았기 때문에 결과의 정확도가 떨어집니다. 즉, 기계가 이 작업을 스스로 수행해야 합니다.
  • 스펙트럼 클래스가 항상 정보 클래스와 일치하는 것은 아닙니다.
  • 사용자는 분류 결과에 따라 나오는 클래스들을 해석하고 레이블을 지정하는 데 시간을 할애해야 합니다.
  • 클래스의 스펙트럼 특성은 시간이 지남에 따라 변할 수 있으므로 한 이미지에서 다른 이미지로 이동하는 동안 동일한 클래스 정보를 유지할 수 없습니다.

자주 묻는 질문

엘보우 방법은 클러스터 내 오차를 k에 대해 그래프로 나타내고 꺾이는 지점을 찾습니다. 실루엣 점수는 -1에서 1 사이의 값을 가지며 각 점이 해당 클러스터에 얼마나 잘 맞는지를 평가합니다. 두 결과를 함께 읽어보세요.

거리 기반 알고리즘은 모든 단위를 동등하게 취급하므로, 수천 단위의 급여 열이 년 단위의 나이 열보다 훨씬 더 큰 비중을 차지하게 됩니다. 각 특징을 먼저 표준화하면 모든 변수가 거리 계산에서 공정한 역할을 하게 됩니다.

Apriori는 시장 바스켓 분석의 기반이 되는 고전적인 연관 규칙 마이너입니다. 빈번하게 나타나는 품목 집합을 찾아낸 다음, 이를 지지도, 신뢰도, 상승폭을 기준으로 순위를 매긴 규칙으로 변환합니다. FP-growth와 Eclat는 동일한 작업을 더 빠르게 수행합니다.

준지도 학습은 레이블이 지정된 소규모 데이터 세트와 레이블이 지정되지 않은 대규모 데이터 세트를 함께 사용합니다. 레이블이 지정되지 않은 데이터에서 발견되는 구조가 모델을 안내하므로 레이블링 비용을 훨씬 줄이면서 정확도는 지도 학습 결과에 근접합니다.

PCA는 전역 분산을 보존하는 선형 변환으로 새로운 레코드에 적용됩니다. t-SNE는 비선형 변환으로 2차원 공간에서 인접 영역을 시각화하기 위해 개발되었으며, 분리된 그룹 간의 거리는 문자 그대로 해석해서는 안 됩니다.

일반적으로는 Isolation Forest, One-Class SVM, DBSCAN, 오토인코더 재구성 오류 등이 사용됩니다. 각 알고리즘은 특정 레코드가 데이터의 대부분과 얼마나 떨어져 있는지를 평가하므로, 임계값을 설정하여 이상치로 간주합니다.

자동화된 파이프라인은 알고리즘, 거리 측정 방법 및 k 값을 검토한 다음 내부 유효성 점수에 따라 실행 결과를 순위 매깁니다. 언어 모델은 결과로 생성된 세그먼트에 대해 점점 더 평이한 영어 이름을 생성하여 해석 단계를 단축합니다.

GitHub 부조종사 scikit-learn 파이프라인, 엘보 플롯 및 실루엣 차트를 한 줄 명령으로 생성합니다. 생성된 코드 조각에서 종종 누락되는 기능 크기 조정 및 난수 시드 설정 여부를 확인하세요.

이 게시물을 요약하면 다음과 같습니다.