教師なし機械学習: Algorithms種類と例

⚡ スマートサマリー

教師なし学習は、ラベル付けされていないデータに対して機能する機械学習手法であり、事前に与えられた回答からではなく、クラスタリング、関連ルール、次元削減などを通じてモデルが自ら構造を発見することを可能にする。

  • 🔘 ラベルは不要です。 このアルゴリズムは、既知の答えと照合するのではなく、構造を探索する。
  • ☑️ 3つのタスクファミリー: Clusterアルゴリズム、アソシエーションルールマイニング、次元削減。
  • 4つのクラスタリングスタイル: 排他的、凝集的、重複ping そして確率的である。
  • 🧪 名前付きアルゴリズム: K平均法、階層的クラスタリング、ファジーC平均法、PCA、SVD、ICA。
  • 🛠️ その価値を発揮する場所: 顧客セグメンテーション、不正・異常検知、マーケットバスケット分析、データ前処理。
  • ⚙️ トレードオフ: 正解データがないということは、結果を人間が解釈、検証、命名する必要があるということだ。

教師なし機械学習:アルゴリズム、種類、例

教師なし学習とは

教師なし学習とは、ユーザーがモデルを監視する必要のない機械学習手法です。代わりに、モデルが自律的に動作し、これまで検出されなかったパターンや情報を発見することを可能にします。主にラベル付けされていないデータを扱います。

教師なし学習 Algorithms

教師なし学習 Algorithms ユーザーがより複雑な処理タスクを実行できるようにする 教師あり学習しかし、教師なし学習は、既知の回答に基づいて学習された手法よりも予測が困難な場合があります。教師なし学習アルゴリズムには、クラスタリング、異常検知、次元削減、自己組織化ニューラルネットワークなどがあります。

教師なし機械学習の例

赤ちゃんと家族の犬を例に、教師なし学習を例にとってみましょう。最初の写真は、赤ちゃんがすでに認識しているペットです。

家族の犬と一緒にいる赤ちゃん。赤ちゃんはすでにその動物を認識している。

彼女はこの犬を知っていて、識別できる。数週間後、家族の友人が犬を連れてきて、赤ちゃんと遊ぼうとする。その2匹目の、見慣れない犬が下の写真に写っている。

赤ちゃんが今まで見たことのない見知らぬ犬

赤ちゃんはこれまでこの犬を見たことがありませんでした。しかし、耳が2つ、目が2つ、4本足で歩くなど、多くの特徴が自分の飼い犬に似ていることに気づきます。そして、この新しい動物を犬だと認識します。これは教師なし学習であり、教えられるのではなく、データ(この場合は犬に関するデータ)から学習するものです。もしこれが教師あり学習であれば、上記の教師なし学習の例のように、家族の友人が赤ちゃんに「これは犬だよ」と教えていたでしょう。

なぜ教師なし学習なのか?

教師なし学習を使用する主な理由は以下のとおりです。 機械学習:

  • 教師なし機械学習は、データの中に存在するあらゆる種類の未知のパターンを発見する。
  • 教師なしメソッドは、分類に役立つ特徴を見つけるのに役立ちます。
  • データが到着次第処理を実行できるため、受信したレコードは人間が最初にラベル付けするのを待つことなく、分析およびグループ化されます。
  • 手動介入が必要なラベル付きデータよりも、ラベルなしデータをコンピューターから取得する方が簡単です。

Cluster教師なし学習の種類 Algorithms

教師なし学習の問題は、さらにクラスタリング問題、関連付け問題、次元削減問題に分類される。 Cluster類似するレコードをグループ化し、関連付けによって一緒に現れるアイテムを見つけ、次元削減によって多くの特徴を少数の特徴に圧縮します。

Clusterる

Cluster教師なし学習に関しては、「ing」は重要な概念です。これは主に、分類されていないデータの集合から構造やパターンを見つけることを扱います。教師なし学習 Clusterアルゴリズムはデータを処理し、データ内に自然なクラスター(グループ)が存在する場合はそれらを検出します。アルゴリズムが識別するクラスターの数を変更することもできます。これにより、これらのグループの粒度を調整できます。下の図は、散在するレコードが明確なグループに解決された様子を示しています。

Clusterラベルのないデータポイントを別々のクラスターにグループ化した図

利用できるクラスタリングにはさまざまな種類があります。

排他的(パーティショニング)

このクラスタリング手法では、データはグループ化され、1つのレコードは1つのクラスターにのみ属するように分類されます。

例: K平均

凝集

このクラスタリング手法では、各レコードはそれぞれ独立したクラスターとして開始されます。最も近い2つのクラスターを反復的に結合することで、クラスターの数を減らしていきます。

例: 階層的クラスタリング

重複ping

この技術では、 ファジー集合 クラスタリングには、データのクラスタリング手法が用いられます。各データは、それぞれ異なるメンバーシップ度合いを持つ2つ以上のクラスタに属する可能性があります。

ここで、データは適切なメンバーシップ値に関連付けられます。 例: ファジー C 平均法

確率論的

この手法は、確率分布を用いてクラスターを作成する。

例:次のキーワード

  • 「男の靴」。
  • 「婦人靴」。
  • 「女性用手袋」。
  • 「男の手袋」。

大きく「靴」と「手袋」、あるいは「男性用」と「女性用」の2つのカテゴリーに分類できる。

Clusterタイプの種類

以下は、教師なし機械学習で最もよく用いられるアルゴリズムです。最初の2つはレコードをグループ化し、最後の3つはクラスタリングではなく次元削減を行います。K-NNはK-meansと混同されやすいため、ここに記載しています。

  • 階層的クラスタリング — クラスタリング
  • K平均クラスタリング — クラスタリング
  • K-NN(k近傍法)は、クラスタリング手法ではなく、教師あり分類器である。
  • 主成分分析 ― 次元削減
  • 特異値分解 ― 次元削減
  • 独立成分分析 ― 次元削減

階層的 Clusterる

階層的クラスタリングは、クラスタの階層構造を構築するアルゴリズムです。まず、すべてのデータがそれぞれ独自のクラスタに割り当てられます。ここでは、互いに近い2つのクラスタが同じクラスタに統合されます。このアルゴリズムは、最終的に1つのクラスタだけが残った時点で終了します。このアルゴリズムは、それぞれに言及する価値のある2つの概念を定義しています。

凝集型クラスタリング

このボトムアップ型の階層的クラスタリングでは、入力としてクラスタ数Kを必要としません。クラスタリング処理は、各レコードを単一のクラスタとして形成することから始まります。

この手法では、何らかの距離尺度を用いて、マージ処理によってクラスターの数(各反復で1つずつ)を削減します。最終的に、すべてのオブジェクトを含む大きなクラスターが1つ得られ、アナリストは適切な数のグループが得られる高さでツリーを切断します。

樹状図

デンドログラムクラスタリング法では、各レベルが可能なクラスターを表します。デンドログラムの高さは、結合された2つのクラスター間の類似度を示します。プロセスの下の方に近いほど、クラスターの類似性は高くなります。最終的なグループを定義するカットオフの選択は自動ではなく、ほとんどが主観的な判断となります。

K平均 Clusterる

K平均法は、グループを洗練する反復クラスタリングアルゴリズムです。ping 各反復処理において、まず必要なクラスタ数を選択します。このクラスタリング手法では、データポイントをk個のグループにクラスタリングする必要があります。kの値が大きいほど、より細かい粒度の小さなグループになり、kの値が小さいほど、より細かい粒度の大きなグループになります。

このアルゴリズムの出力は「ラベル」のグループです。各データポイントをk個のグループのいずれかに割り当てます。k平均クラスタリングでは、各グループはそのグループの重心を作成することで定義されます。重心はクラスタの中心のようなもので、最も近いポイントを捕捉し、クラスタに追加します。

K- 最も近い隣人

K近傍法は、機械学習分類器の中で最も単純なものです。他の機械学習手法とは異なり、モデルを生成しません。これは、利用可能なすべての事例を保存し、類似度に基づいて新しい事例を分類するシンプルなアルゴリズムです。分類対象としてラベル付き事例を必要とするため、K近傍法は教師あり学習手法です。ここで紹介するのは、その距離ベースのロジックがクラスタリングに似ているためです。

サンプル間の距離が十分に離れている場合は、非常にうまく機能します。ただし、訓練データセットが大きい場合や、距離計算が複雑な場合は、学習速度が遅くなります。

主成分分析

主成分分析は高次元空間を取り上げ、新しい基底を選択し、ping 最も重要なスコアのみを取得します。この基底における各方向は主成分と呼ばれます。保持するサブセットは、元の空間に比べてサイズの小さい新しい空間を構成します。このサブセットは、データの複雑さを可能な限り維持します。

協会

アソシエーションルールを使用すると、大規模データベース内のデータオブジェクト間の関連付けを確立できます。この教師なし手法は、大規模データベース内の変数間の興味深い関係を発見することを目的としており、 データマイニング例えば、新築住宅を購入する人は、新しい家具を購入する可能性が最も高い。

その他の例:

  • 遺伝子発現測定値に基づいて分類されたがん患者のサブグループ
  • 閲覧履歴と購入履歴に基づいた買い物客のグループ分け
  • 視聴者による評価に基づいて分類された映画

教師あり機械学習と教師なし機械学習

主な違いは次のとおりです 教師あり学習と教師なし学習:

技術パラメータ 教師あり機械学習手法 教師なし機械学習手法
入力データ Algorithms ラベル付きデータを使用してトレーニングされます。 Algorithms ラベルの付いていないデータに対して使用される
計算の複雑さ 教師あり学習はより簡単な方法です。 教師なし学習は計算が複雑である
精度 精度は既知のラベルと直接比較して測定できる。 精度は直接測定できない。結果には解釈が必要である。
典型的な出力 新記録の予測 グループ、ルール、または圧縮機能

教師なし機械学習の応用

教師なし学習手法の応用例としては、以下のようなものがあります。

  • Clusteringは、類似性に基づいてデータセットをグループに自動的に分割します。
  • 異常検出により、データセット内の異常なデータ ポイントを検出できます。 不正取引の発見に役立ちます
  • アソシエーションマイニングは、データセット内で頻繁に同時に発生するアイテムのセットを特定します
  • 潜在変数モデルは、データセットの特徴量を削減したり、データセットを複数のコンポーネントに分解したりするなど、データの前処理に広く用いられています。

教師なし学習の欠点

  • 教師なし学習で使用されるデータはラベル付けされておらず、その真のグループが不明なため、データのソートに関する正確な情報を得ることはできません。ping 知られていない
  • Less 入力データが事前に人間によって知られておらず、ラベル付けもされていないため、結果の精度が保証されません。つまり、機械自身がこの作業を行う必要があるということです。
  • スペクトル クラスは常に情報クラスに対応するとは限りません。
  • ユーザーは、分類結果から導き出されるクラスを解釈し、ラベル付けするために時間を費やす必要がある。
  • クラスのスペクトル特性は時間とともに変化する可能性があるため、ある画像から別の画像に移動する際に同じクラス情報を維持することはできません。

よくあるご質問

エルボー法は、クラスター内誤差をkに対してプロットし、屈曲点を探します。シルエットスコアは-1から1までの範囲で、各点がクラスターにどれだけ適合しているかを評価します。両方を合わせて読んでください。

距離ベースのアルゴリズムはすべての単位を平等に扱うため、千単位の給与列は年単位の年齢列よりも圧倒的に優位になります。各特徴量を最初に標準化することで、すべての変数が距離の算出において公平な役割を果たすようになります。

Aprioriは、マーケットバスケット分析の基盤となる古典的なアソシエーションルールマイニングツールです。頻繁に出現するアイテムセットを見つけ出し、それをサポート度、信頼度、リフト値に基づいてランク付けされたルールに変換します。FP-growthとEclatは、同じ処理をより高速に行います。

半教師あり学習では、少量のラベル付きデータセットと大量のラベルなしデータセットを使用します。ラベルなしデータに含まれる構造がモデルの学習を導くため、精度は教師あり学習の結果に近づき、ラベル付けコストははるかに低くなります。

PCAは、全体的な分散を保持する線形変換であり、新しいレコードにも適用されます。t-SNEは非線形であり、2次元空間における局所的な近傍を視覚化するために構築されています。分離されたグループ間の距離は、文字通りに解釈すべきではありません。

一般的に用いられる手法としては、Isolation Forest、One-Class SVM、DBSCAN、オートエンコーダー再構成誤差などが挙げられる。これらの手法はそれぞれ、レコードがデータの大部分からどれだけ離れているかをスコアリングし、閾値によって異常値とみなされるものを決定する。

自動化されたパイプラインは、アルゴリズム、距離尺度、kの値を網羅的に検討し、内部妥当性スコアに基づいて実行結果をランク付けします。言語モデルは、結果として得られるセグメントに対して平易な英語名を生成することが増えており、解釈のステップが短縮されています。

GitHubコパイロット 1行のプロンプトからscikit-learnパイプライン、エルボープロット、シルエットチャートをスキャフォールディングします。特徴量がスケーリングされ、生成されたスニペットでよく省略される乱数シードが設定されていることを確認してください。