ما هو التعلم المعزز؟ أنواعه، Algorithms & مثال

⚡ ملخص ذكي

التعلم المعزز هو أسلوب من أساليب التعلم الآلي حيث يتعلم وكيل البرمجيات من خلال العمل داخل بيئة معينة، وجمع المكافآت أو العقوبات، وتعديل سلوكه لزيادة المكافأة التراكمية إلى أقصى حد على مدى خطوات عديدة.

  • 🔘 الحلقة الأساسية: يراقب الفاعل حالة ما، ويتخذ إجراءً، ويتلقى مكافأة، ثم ينتقل إلى حالة جديدة.
  • ☑️ ثلاثة مناهج: تختلف الأساليب القائمة على القيم، والأساليب القائمة على السياسات، والأساليب القائمة على النماذج في ما يتعلمه العامل فعلياً.
  • نموذجان للتعلم: تقوم عمليات اتخاذ القرار ماركوف بتحديد المشكلة؛ ويقوم التعلم المعزز (Q-learning) بحلها من خلال التجربة.
  • 🧪 غير خاضع للإشراف: لا توجد إجابات محددة، بل إشارة مكافأة متأخرة يجب على الفاعل أن ينسبها إلى الإجراءات السابقة.
  • 🛠️ أين يناسب: الروبوتات، ولعب الألعاب، والتحكم في الطائرات، والتدريس التكيفي، وتخطيط استراتيجية الأعمال.
  • ⚙️ التكاليف المعروفة: التدريب يتطلب قدرة حاسوبية عالية، وتصميم المكافآت دقيق، والبيئات الحقيقية صاخبة وغير مستقرة.

التعلم المعزز: الخوارزميات والأنواع والأمثلة

ما هو التعلم المعزز؟

تعزيز التعلم هو تعلم آلة أسلوب يهتم بكيفية اتخاذ البرامج الذكية للقرارات في بيئة معينة. لا تُعرض على البرنامج إجابات صحيحة، بل يتعلم من المكافأة التي يتلقاها ويُعدّل سلوكه لزيادة المكافأة التراكمية إلى أقصى حد.

يُعدّ التعلّم المعزز فرعاً مستقلاً من فروع التعلّم الآلي، إلى جانب أشرف و غير خاضعة للرقابة التعلم. عندما يتم تمثيل سياسة الوكيل أو دالة قيمته بواسطة شبكة عصبية، يُطلق على هذا المزيج اسم التعلم. التعلم المعزز العميق — هذا الاقتران هو ما يسمح للوكيل بتحقيق هدف معقد أو زيادة بُعد معين إلى أقصى حد على مدى خطوات عديدة.

المكونات المهمة لأسلوب التعلم المعزز

قبل أن تصبح الخوارزميات مفهومة، من المفيد تسمية أجزائها. يوضح الرسم البياني أدناه كيف تتكامل عناصر الوكيل والبيئة والفعل وإشارة المكافأة في حلقة واحدة.

حلقة التعلم المعزز التي تربط بين العامل، والفعل، والبيئة، والحالة، والمكافأة

فيما يلي بعض المصطلحات المهمة المستخدمة في التعلم المعزز:

  • وكيل: الكيان الذي يقوم بأفعال في بيئة ما للحصول على مكافأة ما.
  • البيئة (هـ): السيناريو الذي يجب على الوكيل مواجهته.
  • المكافأة (ص): عائد فوري يُمنح للوكيل عند قيامه بعمل أو مهمة محددة.
  • تنص على): تشير الحالة إلى الوضع الحالي الذي أعادته البيئة.
  • السياسة (π): الاستراتيجية التي يطبقها الوكيل لتحديد الإجراء التالي بناءً على الحالة الحالية.
  • القيمة (الخامس): العائد المتوقع على المدى الطويل مع الخصم، مقارنة بالمكافأة قصيرة الأجل.
  • وظيفة القيمة: يحدد قيمة الحالة، أي إجمالي مقدار المكافأة التي يمكن أن يتوقعها الوكيل بدءًا من تلك الحالة.
  • نموذج البيئة: يحاكي هذا سلوك البيئة، مما يسمح لك باستخلاص النتائج وتحديد كيفية تصرف البيئة.
  • الأساليب القائمة على النماذج: الأساليب التي تحل مشاكل التعلم المعزز عن طريق تعلم أو استخدام نموذج للبيئة أولاً، ثم التخطيط بناءً عليه.
  • قيمة Q أو قيمة الإجراء (Q): قيمة Q مشابهة تمامًا لقيمة . الفرق الوحيد بينهما هو أن قيمة Q تأخذ مُعاملًا إضافيًا، وهو الإجراء الحالي.

كيف يعمل التعلم المعزز؟

إن استخدام تشبيه من الحياة اليومية يوضح الآلية قبل ظهور أي رموز.

تخيل سيناريو تعليم قطتك حيلًا جديدة.

  • بما أن القطة لا تفهم الإنجليزية أو أي لغة بشرية أخرى، فلا يمكننا إخبارها مباشرة بما يجب عليها فعله. بدلاً من ذلك، نتبع استراتيجية مختلفة.
  • نقوم بمحاكاة موقف معين، وتحاول القطة الاستجابة بطرق مختلفة. إذا كانت استجابة القطة هي الاستجابة المرغوبة، فإننا نقدم لها السمك.
  • والآن كلما تعرضت القطة لنفس الموقف، فإنها تقوم بعمل مماثل بحماس أكبر، على أمل الحصول على المزيد من المكافأة (الطعام).
  • هذا هو التعلم الذي تحصل عليه القطة حول "ما يجب فعله" من التجارب الإيجابية.
  • وفي الوقت نفسه، يتعلم القط أيضاً ما لا يجب فعله عند مواجهة التجارب السلبية.

مثال على التعلم المعزز

يوضح الشكل أدناه قصة القطة تلك على الحلقة الرسمية، حيث يمثل المنزل البيئة والسمكة المكافأة.

مثال القط ومالكه مُطبّق على حلقة التعلم المعزز بين العامل والبيئة
كيف يعمل التعلم المعزز

في هذه الحالة،

  • قطتك كائن حيّ يتأثر بالبيئة المحيطة، وفي هذه الحالة، بمنزلك. مثال على ذلك: قطتك جالسة، وأنت تستخدم كلمة معينة لتجعلها تمشي.
  • يتفاعل وكيلنا من خلال إجراء انتقال من "حالة" إلى "حالة" أخرى.
  • على سبيل المثال، تنتقل قطتك من الجلوس إلى المشي.
  • رد فعل العامل هو إجراء، والسياسة هي طريقة لاختيار إجراء معين في حالة توقع نتائج أفضل.
  • بعد عملية الانتقال، قد يحصل الوكيل على مكافأة أو عقوبة في المقابل.

تعزيز التعلم Algorithms

هناك ثلاثة مناهج لتطبيق خوارزمية التعلم المعزز، وتختلف بشكل أساسي في ما يخزنه العامل ويتعلمه.

على أساس القيمة

في أسلوب التعلم المعزز القائم على القيمة، تسعى إلى تعظيم دالة القيمة V(s). في هذا الأسلوب، يتوقع العامل عائدًا طويل الأجل للحالات الحالية في ظل السياسة π.

على أساس السياسة

في طريقة التعلم المعزز القائمة على السياسات، تحاول التوصل إلى سياسة بحيث يساعدك الإجراء الذي يتم تنفيذه في كل حالة على تحقيق أقصى قدر من المكافأة في المستقبل.

هناك نوعان من الأساليب القائمة على السياسات هما:

  • حتمية: بالنسبة لأي حالة، يتم إنتاج نفس الإجراء بواسطة السياسة π.
  • العشوائية: لكل فعل احتمال معين، يُعطى بالمعادلة التالية.

السياسة العشوائية:

π(a|s) = P[At = a | St = s]

على أساس النموذج

في طريقة التعلم المعزز هذه، تقوم بإنشاء نموذج افتراضي لكل بيئة. ويتعلم العامل كيفية الأداء في تلك البيئة المحددة.

خصائص التعلم المعزز

فيما يلي بعض الخصائص المهمة للتعلم المعزز:

  • لا يوجد مشرف، فقط رقم حقيقي أو إشارة مكافأة
  • اتخاذ القرار بشكل تسلسلي
  • يلعب الوقت دورًا حاسمًا في مشاكل التعزيز
  • غالباً ما تكون ردود الفعل متأخرة وليست فورية.
  • تحدد إجراءات الوكيل البيانات اللاحقة التي يتلقاها

أنواع التعلم المعزز

كلمة "التعزيز" مستعارة من علم النفس السلوكي، وتأتي في شكلين:

الإيجابية:

يُعرَّف بأنه حدث يقع نتيجة سلوك معين. وهو يزيد من قوة السلوك وتكراره، ويؤثر إيجاباً على الفعل الذي يقوم به الفاعل.

يساعدك هذا النوع من التعزيز على تحقيق أقصى قدر من الأداء والحفاظ على التغيير لفترة أطول. مع ذلك، قد يؤدي الإفراط في التعزيز إلى تحسين مفرط للحالة، مما قد يؤثر على النتائج.

نفي:

يُعرَّف التعزيز السلبي بأنه تقوية السلوك الناتج عن حالة سلبية كان ينبغي إيقافها أو تجنبها. ويساعدك هذا الأسلوب على تحديد الحد الأدنى من معايير الأداء. إلا أن عيبه يكمن في أنه يوفر فقط ما يكفي لتلبية الحد الأدنى من السلوك المطلوب.

نماذج التعلم من التعزيز

هناك نموذجان تعليميان مهمان في التعلم المعزز:

  • عملية اتخاذ القرار ماركوف
  • س التعلم

عملية اتخاذ القرار ماركوف

يتم استخدام المعلمات التالية للحصول على الحل:

  • مجموعة من الإجراءات – أ
  • مجموعة من الحالات – S
  • المكافأة – R
  • السياسة – π
  • القيمة – V

النهج الرياضي للخريطةping يُصاغ الحل في التعلم المعزز على شكل عملية قرار ماركوف، أو MDP. يوضح المخطط أدناه تلك المعلمات الخمس المتصلة في نفس دورة العامل والبيئة.

مخطط عملية اتخاذ القرار ماركوف مع الحالات والإجراءات والمكافأة والسياسة

Q- التعلم

التعلم Q هو أسلوب قائم على القيمة لتوفير المعلومات التي تخبر الوكيل بالإجراء الذي يجب اتخاذه.

دعونا نفهم هذه الطريقة من خلال المثال التالي:

  • توجد خمس غرف في المبنى متصلة بأبواب.
  • كل غرفة مرقمة من 0 إلى 4
  • يمكن اعتبار الجزء الخارجي من المبنى منطقة خارجية كبيرة واحدة (5)
  • يؤدي البابان رقم 1 و4 إلى المبنى من الغرفة رقم 5

يوضح مخطط الطابق أدناه أرقام تلك الغرف والأبواب التي تربطها.

مخطط طابق مبنى مكون من خمس غرف مع غرف مرقمة والمنطقة الخارجية 5

بعد ذلك، عليك ربط قيمة مكافأة بكل باب:

  • الأبواب التي تؤدي مباشرة إلى الهدف لها مكافأة قدرها 100
  • الأبواب التي لا تتصل مباشرة بالغرفة المستهدفة لا تُعطي أي مكافأة
  • بما أن الأبواب ثنائية الاتجاه، يتم تخصيص سهمين لكل غرفة
  • كل سهم في الصورة أعلاه يحمل قيمة مكافأة فورية

التفسير: في هذه الصورة، تمثل كل غرفة حالة، وتمثل حركة العامل من غرفة إلى أخرى فعلًا.

في الرسم البياني أدناه، يتم رسم الحالة كعقدة بينما تُظهر الأسهم الإجراءات المتاحة والمكافأة المرتبطة بكل منها.

رسم بياني لحالة الغرف الخمس بقيم مكافأة 0 و100 في كل انتقال

على سبيل المثال، ينتقل أحد العملاء من الغرفة رقم 2 إلى الغرفة رقم 5:

  • الحالة الأولية = الحالة 2
  • الحالة 2-> الحالة 3
  • الحالة 3 -> الحالة (2,1,4،XNUMX،XNUMX)
  • الحالة 4-> الحالة (0,5,3)
  • الحالة 1-> الحالة (5,3)
  • الحالة 0-> الحالة 4

التعلم المعزز مقابل التعلم الخاضع للإشراف

إن أوضح طريقة لوضع التعلم المعزز هي وضعه بجانب النموذج الذي يعرفه معظم القراء بالفعل.

المعاملات تعزيز التعلم التعلم تحت الإشراف
أسلوب القرار يساعدك التعلم المعزز على اتخاذ قراراتك بشكل متسلسل. في هذه الطريقة، يتم اتخاذ قرار بشأن المدخلات المقدمة في البداية.
يعمل على يعمل من خلال التفاعل مع البيئة. يعمل على أمثلة أو بيانات عينة معينة.
التبعية للقرار في طريقة التعلم المعزز، يعتمد كل قرار تعلم على القرارات التي تسبقه، لذا فإن التسلسل الكامل للقرارات هو ما يتم تقييمه. In التعلم تحت إشراف القرارات مستقلة عن بعضها البعض، لذلك يتم إعطاء تسمية لكل قرار.
افضل مناسب يدعم ويعمل بشكل أفضل في مجال الذكاء الاصطناعي، حيث يكون التفاعل البشري سائداً. يتم تشغيله في الغالب باستخدام نظام برمجي أو تطبيقات تفاعلية.
مثال لعبة الشطرنج التعرف على الأشياء

تطبيقات التعلم المعزز

فيما يلي تطبيقات التعلم المعزز:

  • الروبوتات للأتمتة الصناعية.
  • تخطيط استراتيجية الأعمال
  • التعلم الآلي ومعالجة البيانات
  • يساعدك ذلك في إنشاء أنظمة تدريب توفر تعليمات ومواد مخصصة وفقًا لمتطلبات الطلاب.
  • التحكم في الطائرات والتحكم في حركة الروبوت

لماذا نستخدم التعلم المعزز؟

فيما يلي الأسباب الرئيسية لاستخدام التعلم المعزز:

  • يساعدك ذلك في تحديد الموقف الذي يتطلب إجراءً ما.
  • يساعدك على اكتشاف الإجراء الذي يحقق أعلى مكافأة على المدى الطويل
  • كما يوفر التعلم المعزز للوكيل المتعلم وظيفة مكافأة
  • كما يسمح ذلك للوكيل بتحديد أفضل طريقة للحصول على مكافآت كبيرة

متى لا تستخدم التعلم المعزز؟

لا يمكنك تطبيق نموذج التعلم المعزز في كل الحالات. إليك بعض الحالات التي لا يُنصح فيها باستخدامه.

  • عندما يكون لديك ما يكفي من البيانات المصنفة لحل المشكلة باستخدام أسلوب التعلم الخاضع للإشراف
  • يُعدّ التعلّم المعزز عملية حسابية كثيفة وتستغرق وقتًا طويلاً، لا سيما عندما تكون مساحة الإجراءات كبيرة.

تحديات التعلم المعزز

فيما يلي التحديات الرئيسية التي ستواجهها أثناء تطبيق التعلم المعزز:

  • تصميم الميزات والمكافآت، والذي قد يكون معقدًا للغاية
  • قد تؤثر المعلمات على سرعة التعلم.
  • يمكن أن تتمتع البيئات الواقعية بقابلية ملاحظة جزئية.
  • قد يؤدي الإفراط في التعزيز إلى زيادة الحمل على الحالات، مما قد يقلل من النتائج.
  • البيئات الواقعية يمكن أن تكون غير ثابتة.

الأسئلة الشائعة

الاستغلال يكرر الفعل الذي يُعتقد حاليًا أنه الأفضل؛ أما الاستكشاف فيجرب شيئًا آخر لاكتشاف فعل أفضل. تتعامل خوارزمية إبسيلون-جريئة مع هذا الأمر من خلال التصرف عشوائيًا باحتمالية ε، وبجشع فيما عدا ذلك، ثم تتناقص قيمة ε مع تراكم الخبرة.

تُوازن قيمة جاما بين المكافآت المستقبلية والمكافآت الفورية. فقيمة قريبة من الصفر تجعل العامل قصير النظر وجشعًا للحصول على مكافأة فورية؛ بينما قيمة قريبة من الواحد تجعله صبورًا بما يكفي لقبول خسارة صغيرة الآن مقابل عائد أكبر لاحقًا.

تعتمد خوارزمية Q-learning على نهج خارج السياسة: فهي تُحدّث مسارها نحو أفضل إجراء ممكن بغض النظر عما فعله العامل فعليًا. أما خوارزمية SARSA فتعتمد على نهج ضمن السياسة وتُحدّث مسارها نحو الإجراء الذي اتخذته بالفعل، مما يجعلها أكثر حذرًا في الحالات الخطرة.

تستبدل شبكة Q العميقة جدول Q بشبكة عصبية، مما يسمح بتقييم الحالات التي لم تُشاهد أثناء التدريب. كما تُضاف خاصية إعادة تجربة التدريب وشبكة هدف منفصلة للحفاظ على استقرار إشارة التدريب.

تتعلم العوامل غير المعتمدة على النماذج، مثل خوارزمية Q-learning، من التجارب المأخوذة بعينات فقط. أما العوامل المعتمدة على النماذج، فتبني أولاً نموذجاً لديناميكيات البيئة وتخطط بناءً عليه، وهو ما يتطلب تفاعلات حقيقية أقل بكثير، ولكنه يعاني عندما يكون النموذج خاطئاً.

يعتمد التعلم المعزز من خلال التغذية الراجعة البشرية على تدريب نموذج المكافأة بناءً على تصنيفات التفضيلات البشرية، ثم يقوم بضبط نموذج اللغة وفقًا لتلك المكافأة. وهذا هو السبب في أن المساعدين المبنيين على التعلم العميق اتبع التعليمات بدلاً من مجرد توقع النص.

مساعد الطيار جيثب يجيد التعامل مع القوالب الجاهزة: أغلفة البيئة، ومخازن إعادة التشغيل، وحلقات التدريب، والرسوم البيانية. مكافأة شاping ولا تزال خيارات المعلمات الفائقة بحاجة إلى تقدير، لأن المكافأة الخاطئة الصامتة تنتج وكيلاً يتدرب بسعادة ويتصرف بشكل سيئ.

يوفر برنامج Gymnasium بيئات التدريب القياسية، بينما يوفر برنامج Stable-Baselines3 تطبيقات الخوارزميات المختبرة، TensorFlow أو بايTorقم بتوفير الشبكات. ابدأ بعالم شبكي جدولي قبل اللجوء إلى أي منها.

تلخيص هذه التدوينة بـ: