教師あり機械学習: Algorithms、種類と例

⚡ スマートサマリー

教師あり機械学習は、ラベル付けされたサンプルを用いてアルゴリズムを訓練し、これまで見たことのないデータに対しても結果を予測できるようにします。数値的な対象には回帰分析を、スパムや詐欺などのカテゴリ的な対象には分類分析を用います。

  • 🔘 回答から学ぶ: 各トレーニング行には正しい出力が含まれているため、モデルは入力から出力への直接的なマッピングを学習します。ping.
  • ☑️ 2つのタスクファミリー: 回帰分析は数値を予測するのに対し、分類は2つ以上のクラスのうちの1つにラベルを割り当てる。
  • 名前付きアルゴリズム: 線形回帰、ロジスティック回帰、ナイーブベイズ、決定木、ランダムフォレスト、サポートベクターマシン。
  • 🧪 実例: 天候、時間帯、祝日、選択したルートに基づいて予測される通勤時間。
  • 🛠️ 設計段階から測定可能: 正解データが存在するため、精度、適合率、再現率、RMSEによってモデルを客観的に評価できる。
  • ⚙️ トレードオフ: ラベリングは費用がかさむ上、トレーニングデータに含まれていないクラスは正確に予測することができない。

教師あり機械学習:アルゴリズム、種類、例

教師あり機械学習とは?

教師あり機械学習とは、ラベル付けされた訓練データから学習し、未知のデータの予測に役立つアルゴリズムです。教師あり学習では、適切に「ラベル付け」されたデータを使用して機械を訓練します。つまり、一部のデータにはすでに正解がタグ付けされているということです。これは、監督者や教師の存在下での学習に例えることができます。

精度の高い教師あり機械学習モデルを構築、拡張、展開するには、高度なスキルを持つデータサイエンティストのチームによる時間と技術的な専門知識が必要です。また、データサイエンティストは、基となるデータが変化しても、モデルから得られる知見が常に正しい状態を保つよう、定期的にモデルを再構築する必要があります。

教師あり学習の仕組み

教師あり機械学習では、トレーニング データ セットを使用して、望ましい結果を達成します。 これらのデータ セットには、モデルの学習を高速化するのに役立つ入力と正しい出力が含まれています。 たとえば、職場から車で帰宅するまでにかかる時間を予測できるようにマシンをトレーニングしたいとします。

ここでは、ラベル付きデータのセットを作成することから始めます。 このデータには次のものが含まれます。

  • 気象条件
  • 時刻
  • クリスマス・その他
  • 選択されたルート

これらの詳細はすべて、この教師あり学習の例における入力値です。出力値は、下の画像に示すように、その特定の日に自宅まで車で帰るのにかかった時間です。

通勤時間予測の入力項目:天気、時間帯、祝日、選択したルート

外が雨なら、家に帰るのに時間がかかることは、本能的にわかる。しかし、機械にはデータと統計が必要なのだ。

まず最初に作成する必要があるのは、トレーニングセットです。これには、通勤時間の合計と、天候や時間帯などの関連要因が含まれます。このトレーニングセットに基づいて、機械学習システムは、降雨量と帰宅時間の間に直接的な関係があることを認識する可能性があります。

つまり、雨が降れば降るほど、家に帰るまでの運転時間が長くなるということです。また、仕事が終わる時間と運転時間の関係も把握できるかもしれません。午後6時が近づくほど、家に帰るのに時間がかかるということです。

お使いのマシンは、ラベル付けされたデータとの関連性の一部を発見する可能性があります。その学習段階を以下に示します。

学習フェーズのパイプライン:トレーニングデータから特徴ベクトル、アルゴリズム、そして学習済みモデルへ
学習フェーズ:トレーニングデータ → 特徴ベクトル → アルゴリズム → モデル

これがデータモデルの始まりです。雨が人々の運転行動にどのような影響を与えるか、また特定の時間帯に多くの人が移動するといった情報を記録し始めます。

教師あり機械学習の種類 Algorithms

教師あり機械学習アルゴリズムの種類は次のとおりです。

不具合

回帰分析手法は、訓練データを用いて単一の連続的な出力値を予測する。

例: 回帰を使用して、トレーニング データから住宅価格を予測できます。 入力変数は、地域、家のサイズなどになります。

長所:出力結果が解釈しやすく、アルゴリズムを正則化することで過学習を回避できる。

弱点:線形モデルは柔軟性に欠けるため、追加機能なしでは複雑な関係性を捉えることができない。

ここではいくつかのタイプの回帰を示します Algorithms:

  • 線形回帰
  • 多項式回帰
  • リッジ回帰とラッソ回帰
  • ロジスティック回帰(分類用)
  • 決定木とランダムフォレスト回帰
  • サポートベクター回帰

ロジスティック回帰:

ロジスティック回帰は、与えられた独立変数に基づいて離散値を推定するために使用されます。データをロジット関数に当てはめることで、事象の発生確率を予測するのに役立ちます。そのため、ロジット回帰とも呼ばれます。確率を予測するため、出力値は0から1の間になりますが、複数の決定境界や非線形の決定境界が存在する場合には、性能が低下する可能性があります。

欠陥種類の識別

分類とは、出力をクラス内にグループ化することです。アルゴリズムが入力を2つの異なるクラスに分類しようとする場合、それは二値分類と呼ばれます。3つ以上のクラスから選択する場合は、多クラス分類と呼ばれます。

例:ローンの債務不履行者になるかどうかを判断する。

長所:分類木は実用上非常に優れた性能を発揮する。

弱点:制約のない個々のツリーは過学習を起こしやすい。

ここではいくつかの種類の分類を示します Algorithms:

  • 単純ベイズ分類器
  • 決定木
  • サポートベクターマシン
  • K最近傍法
  • ランダムフォレストと勾配ブースティング

単純ベイズ分類器

その ナイーブベイズ このモデルは構築が容易で、大規模なデータセットに非常に有効です。この手法は、1つの親ノードと複数の子ノードを持つ有向非巡回グラフで構成されています。子ノードは親ノードから独立していると仮定しています。

決定木

決定木は、特徴値に基づいてインスタンスを分類します。この手法では、各ノードは分類対象となるインスタンスの特徴を表し、各枝はノードが取り得る値を表します。これは分類において広く用いられている手法です。

回帰分析にも同じ構造が当てはまります。回帰ツリーは、実際の値(車の購入費用、通話回数、月間総売上高など)を推定するのに役立ちます。

サポートベクターマシン

サポートベクターマシン(SVM)は、1990年代に登場した学習アルゴリズムの一種です。この手法は、ウラジミール・ヴァプニクとその同僚によって開発された統計的学習理論に基づいています。

SVMはカーネル関数とも密接に関連しており、カーネル関数はほとんどの学習タスクの中心概念です。カーネルフレームワークとSVMはさまざまな分野で使用されています。これには、マルチメディア情報検索、バイオインフォマティクス、パターン認識などが含まれます。上記の各推定器は、チューニングパラメータとともにドキュメント化されています。 scikit-学ぶ 参照。

教師あり学習と教師なし学習の機械学習手法

メソッドを横に配置する 教師なし学習 その境界を明確にする。

に基づく 教師あり機械学習手法 教師なし機械学習手法
入力データ Algorithms ラベル付きデータを使用してトレーニングされます。 Algorithms ラベルの付いていないデータに対して使用される
計算の複雑さ 教師あり学習はより簡単な方法です。 教師なし学習は計算が複雑である
精度 精度が高く信頼できる手法です。 Less 正確かつ信頼できる方法。
典型的なアルゴリズム ロジスティック回帰、決定木、SVM、ナイーブベイズ K平均法、階層的クラスタリング、PCA
結果の評価方法 既知の解答との比較によるスコア(正答率、RMSE) 内部基準と人的評価に基づいて判断

教師あり機械学習における課題

教師あり機械学習で直面する課題は次のとおりです。

  • トレーニングデータ内の無関係な入力特徴は、不正確な結果を生み出す可能性がある。
  • データの準備と前処理は常に課題です。
  • 不可能な値、あり得ない値、不完全な値がトレーニングデータとして入力されると、精度が低下する。
  • 該当する専門家が見つからない場合は、別の方法として「総当たり」方式が用いられます。これは、機械学習にどの特徴量(入力変数)を用いるべきかを推測する必要があり、その推測は不正確である可能性があります。

教師あり学習の利点

こうした課題を踏まえると、教師あり機械学習の利点は以下のとおりです。

  • 教師あり学習 機械学習 過去の経験からデータを収集したり、データ出力を作成したりすることができます
  • 経験を活用してパフォーマンス基準を最適化するのに役立ちます
  • 教師あり機械学習は、現実世界のさまざまな種類の計算問題を解決するのに役立ちます。

教師あり学習の欠点

教師あり機械学習の欠点は以下のとおりです。

  • トレーニングセットにクラスに含めたい例が含まれていない場合、決定境界が過学習している可能性があります。
  • 分類器をトレーニングする際には、各クラスから多くの良い例を選択する必要があります。
  • ビッグデータの分類は、非常に困難な作業となる可能性がある。
  • 教師あり学習のトレーニングには多くの計算時間が必要です。

指導付き学習のベストプラクティス

次のシーケンスはプロジェクトを維持します track:

  • 何よりもまず、トレーニングセットとして使用するデータの種類を決定してください。
  • 学習する関数の構造と学習アルゴリズムを決定する。
  • 人間の専門家または測定値から対応する出力を収集する。
  • モデルが決して見ないテストセットを保留し、そのスコアを報告する。

よくあるご質問

分類器は精度、適合率、再現率、F1で評価され、 混同行列回帰分析では、RMSE、MAE、またはR²を使用します。必ず未知のデータに対するスコアを報告してください。

ラベル付けされたデータは分割され、一般的に70~80%がトレーニング用、残りがテスト用となる。テスト用の行は最後まで変更されないため、スコアは未知のデータに対する評価となる。

過学習したモデルはノイズを記憶してしまうため、訓練スコアは高くなるが、テストスコアは低くなる。一方、過小学習したモデルは単純すぎるため、訓練スコアもテストスコアも低くなる。正則化と枝刈りによってバランスが回復する。

決まった数はありません。特徴量とクラスの数に応じて増加します。ラベルの品質は、量よりも重要です。ラベルに一貫性がないと、精度が永久的に低下します。

スパムフィルタリング、信用スコアリング、不正検出、医療トリアージ、需要予測、住宅価格推定、音声認識。それぞれが過去の入力データと記録された結果を組み合わせ、教師あり学習のニーズを形成します。

半教師あり学習は、少量のラベル付きデータセットと大量のラベルなしデータセットを組み合わせた学習方法です。ラベルなしデータの構造がモデルの学習を導くため、ラベル付けコストを抑えつつ、教師あり学習に近い精度を実現できます。

AutoMLツールは、アルゴリズム、特徴変換、ハイパーパラメータを検索し、交差検証スコアに基づいて候補をランク付けします。これにより、手作業による試行錯誤のほとんどが不要になりますが、評価指標の選択とリークチェックは依然として人間が行います。

GitHubコパイロット 短いプロンプトからscikit-learnパイプライン、訓練データとテストデータの分割、評価レポートを作成します。分割が正しく行われ、乱数シードが固定されていることを確認してください。