教師なし機械学習: Algorithms種類と例
⚡ スマートサマリー
教師なし学習は、ラベル付けされていないデータに対して機能する機械学習手法であり、事前に与えられた回答からではなく、クラスタリング、関連ルール、次元削減などを通じてモデルが自ら構造を発見することを可能にする。
教師なし学習とは
教師なし学習とは、ユーザーがモデルを監視する必要のない機械学習手法です。代わりに、モデルが自律的に動作し、これまで検出されなかったパターンや情報を発見することを可能にします。主にラベル付けされていないデータを扱います。
教師なし学習 Algorithms
教師なし学習 Algorithms ユーザーがより複雑な処理タスクを実行できるようにする 教師あり学習しかし、教師なし学習は、既知の回答に基づいて学習された手法よりも予測が困難な場合があります。教師なし学習アルゴリズムには、クラスタリング、異常検知、次元削減、自己組織化ニューラルネットワークなどがあります。
教師なし機械学習の例
赤ちゃんと家族の犬を例に、教師なし学習を例にとってみましょう。最初の写真は、赤ちゃんがすでに認識しているペットです。
彼女はこの犬を知っていて、識別できる。数週間後、家族の友人が犬を連れてきて、赤ちゃんと遊ぼうとする。その2匹目の、見慣れない犬が下の写真に写っている。
赤ちゃんはこれまでこの犬を見たことがありませんでした。しかし、耳が2つ、目が2つ、4本足で歩くなど、多くの特徴が自分の飼い犬に似ていることに気づきます。そして、この新しい動物を犬だと認識します。これは教師なし学習であり、教えられるのではなく、データ(この場合は犬に関するデータ)から学習するものです。もしこれが教師あり学習であれば、上記の教師なし学習の例のように、家族の友人が赤ちゃんに「これは犬だよ」と教えていたでしょう。
なぜ教師なし学習なのか?
教師なし学習を使用する主な理由は以下のとおりです。 機械学習:
- 教師なし機械学習は、データの中に存在するあらゆる種類の未知のパターンを発見する。
- 教師なしメソッドは、分類に役立つ特徴を見つけるのに役立ちます。
- データが到着次第処理を実行できるため、受信したレコードは人間が最初にラベル付けするのを待つことなく、分析およびグループ化されます。
- 手動介入が必要なラベル付きデータよりも、ラベルなしデータをコンピューターから取得する方が簡単です。
Cluster教師なし学習の種類 Algorithms
教師なし学習の問題は、さらにクラスタリング問題、関連付け問題、次元削減問題に分類される。 Cluster類似するレコードをグループ化し、関連付けによって一緒に現れるアイテムを見つけ、次元削減によって多くの特徴を少数の特徴に圧縮します。
Clusterる
Cluster教師なし学習に関しては、「ing」は重要な概念です。これは主に、分類されていないデータの集合から構造やパターンを見つけることを扱います。教師なし学習 Clusterアルゴリズムはデータを処理し、データ内に自然なクラスター(グループ)が存在する場合はそれらを検出します。アルゴリズムが識別するクラスターの数を変更することもできます。これにより、これらのグループの粒度を調整できます。下の図は、散在するレコードが明確なグループに解決された様子を示しています。
利用できるクラスタリングにはさまざまな種類があります。
排他的(パーティショニング)
このクラスタリング手法では、データはグループ化され、1つのレコードは1つのクラスターにのみ属するように分類されます。
例: K平均
凝集
このクラスタリング手法では、各レコードはそれぞれ独立したクラスターとして開始されます。最も近い2つのクラスターを反復的に結合することで、クラスターの数を減らしていきます。
例: 階層的クラスタリング
重複ping
この技術では、 ファジー集合 クラスタリングには、データのクラスタリング手法が用いられます。各データは、それぞれ異なるメンバーシップ度合いを持つ2つ以上のクラスタに属する可能性があります。
ここで、データは適切なメンバーシップ値に関連付けられます。 例: ファジー C 平均法
確率論的
この手法は、確率分布を用いてクラスターを作成する。
例:次のキーワード
- 「男の靴」。
- 「婦人靴」。
- 「女性用手袋」。
- 「男の手袋」。
大きく「靴」と「手袋」、あるいは「男性用」と「女性用」の2つのカテゴリーに分類できる。
Clusterタイプの種類
以下は、教師なし機械学習で最もよく用いられるアルゴリズムです。最初の2つはレコードをグループ化し、最後の3つはクラスタリングではなく次元削減を行います。K-NNはK-meansと混同されやすいため、ここに記載しています。
- 階層的クラスタリング — クラスタリング
- K平均クラスタリング — クラスタリング
- K-NN(k近傍法)は、クラスタリング手法ではなく、教師あり分類器である。
- 主成分分析 ― 次元削減
- 特異値分解 ― 次元削減
- 独立成分分析 ― 次元削減
階層的 Clusterる
階層的クラスタリングは、クラスタの階層構造を構築するアルゴリズムです。まず、すべてのデータがそれぞれ独自のクラスタに割り当てられます。ここでは、互いに近い2つのクラスタが同じクラスタに統合されます。このアルゴリズムは、最終的に1つのクラスタだけが残った時点で終了します。このアルゴリズムは、それぞれに言及する価値のある2つの概念を定義しています。
凝集型クラスタリング
このボトムアップ型の階層的クラスタリングでは、入力としてクラスタ数Kを必要としません。クラスタリング処理は、各レコードを単一のクラスタとして形成することから始まります。
この手法では、何らかの距離尺度を用いて、マージ処理によってクラスターの数(各反復で1つずつ)を削減します。最終的に、すべてのオブジェクトを含む大きなクラスターが1つ得られ、アナリストは適切な数のグループが得られる高さでツリーを切断します。
樹状図
デンドログラムクラスタリング法では、各レベルが可能なクラスターを表します。デンドログラムの高さは、結合された2つのクラスター間の類似度を示します。プロセスの下の方に近いほど、クラスターの類似性は高くなります。最終的なグループを定義するカットオフの選択は自動ではなく、ほとんどが主観的な判断となります。
K平均 Clusterる
K平均法は、グループを洗練する反復クラスタリングアルゴリズムです。ping 各反復処理において、まず必要なクラスタ数を選択します。このクラスタリング手法では、データポイントをk個のグループにクラスタリングする必要があります。kの値が大きいほど、より細かい粒度の小さなグループになり、kの値が小さいほど、より細かい粒度の大きなグループになります。
このアルゴリズムの出力は「ラベル」のグループです。各データポイントをk個のグループのいずれかに割り当てます。k平均クラスタリングでは、各グループはそのグループの重心を作成することで定義されます。重心はクラスタの中心のようなもので、最も近いポイントを捕捉し、クラスタに追加します。
K- 最も近い隣人
K近傍法は、機械学習分類器の中で最も単純なものです。他の機械学習手法とは異なり、モデルを生成しません。これは、利用可能なすべての事例を保存し、類似度に基づいて新しい事例を分類するシンプルなアルゴリズムです。分類対象としてラベル付き事例を必要とするため、K近傍法は教師あり学習手法です。ここで紹介するのは、その距離ベースのロジックがクラスタリングに似ているためです。
サンプル間の距離が十分に離れている場合は、非常にうまく機能します。ただし、訓練データセットが大きい場合や、距離計算が複雑な場合は、学習速度が遅くなります。
主成分分析
主成分分析は高次元空間を取り上げ、新しい基底を選択し、ping 最も重要なスコアのみを取得します。この基底における各方向は主成分と呼ばれます。保持するサブセットは、元の空間に比べてサイズの小さい新しい空間を構成します。このサブセットは、データの複雑さを可能な限り維持します。
協会
アソシエーションルールを使用すると、大規模データベース内のデータオブジェクト間の関連付けを確立できます。この教師なし手法は、大規模データベース内の変数間の興味深い関係を発見することを目的としており、 データマイニング例えば、新築住宅を購入する人は、新しい家具を購入する可能性が最も高い。
その他の例:
- 遺伝子発現測定値に基づいて分類されたがん患者のサブグループ
- 閲覧履歴と購入履歴に基づいた買い物客のグループ分け
- 視聴者による評価に基づいて分類された映画
教師あり機械学習と教師なし機械学習
主な違いは次のとおりです 教師あり学習と教師なし学習:
| 技術パラメータ | 教師あり機械学習手法 | 教師なし機械学習手法 |
| 入力データ | Algorithms ラベル付きデータを使用してトレーニングされます。 | Algorithms ラベルの付いていないデータに対して使用される |
| 計算の複雑さ | 教師あり学習はより簡単な方法です。 | 教師なし学習は計算が複雑である |
| 精度 | 精度は既知のラベルと直接比較して測定できる。 | 精度は直接測定できない。結果には解釈が必要である。 |
| 典型的な出力 | 新記録の予測 | グループ、ルール、または圧縮機能 |
教師なし機械学習の応用
教師なし学習手法の応用例としては、以下のようなものがあります。
- Clusteringは、類似性に基づいてデータセットをグループに自動的に分割します。
- 異常検出により、データセット内の異常なデータ ポイントを検出できます。 不正取引の発見に役立ちます
- アソシエーションマイニングは、データセット内で頻繁に同時に発生するアイテムのセットを特定します
- 潜在変数モデルは、データセットの特徴量を削減したり、データセットを複数のコンポーネントに分解したりするなど、データの前処理に広く用いられています。
教師なし学習の欠点
- 教師なし学習で使用されるデータはラベル付けされておらず、その真のグループが不明なため、データのソートに関する正確な情報を得ることはできません。ping 知られていない
- Less 入力データが事前に人間によって知られておらず、ラベル付けもされていないため、結果の精度が保証されません。つまり、機械自身がこの作業を行う必要があるということです。
- スペクトル クラスは常に情報クラスに対応するとは限りません。
- ユーザーは、分類結果から導き出されるクラスを解釈し、ラベル付けするために時間を費やす必要がある。
- クラスのスペクトル特性は時間とともに変化する可能性があるため、ある画像から別の画像に移動する際に同じクラス情報を維持することはできません。



