آموزش مساله Multi-Armed Bandit در یادگیری تقویتی با متلب (رایگان)

آموزش مساله Multi-Armed Bandit در یادگیری تقویتی با متلب (رایگان)

ایده یادگیری از طریق تعامل با محیط، احتمالا اولین تفکری باشد که در ذهن همه ما خطور می‌کند. اگر به طریقه یادگیری راه‌ رفتن در یک نوزاد نگاه کنیم، می‌بینیم که نوزاد از طریق تعامل با محیط خودش راه ‌رفتن را یاد می‌گیرد، چندین و چندین بار بلند می‌شود و می‌افتد تا اینکه در نهایت یاد می‌گیرد که چگونه بر روی دو پای خودش بایستد. موضوع یادگیری تقویتی (Reinforcement Learning) نیز به طور دقیق به همین موضوع اشاره دارد. عامل (Agent) که می‌تواند یاد بگیرد، همانند نوزاد از طریق تعامل با محیط اطراف خودش یک شناخت کافی از آن پیدا می‌کند و سپس عمل‌هایی را انجام خواهد داد که منجر به رسیدن به هدف می‌شود. سه روش اساسی برای یادگیری در هوش مصنوعی، یادگیری نظارت‌‌‌شده (Supervised)، نظارت‌‌‌نشده (Unsupervised) و تقویتی (Reinforcement) است. در یادگیری نظارت‌‌شده یک سری سیگنال‌های لیبل‌دار وجود دارند و آن‌ها را به عامل نشان می‌دهیم. در یادگیری تقویتی نیز داده لیبل‌دار وجود ندارد ولی عامل از طریق تعامل با محیط تجربه کسب می‌کند و یاد می‌گیرد کارهایی را انجام دهد که منجر به دریافتین پاداش در آینده شود. یادگیری تقویتی در حقیقت روش محاسباتی برای یادگیری از طریق تجربه و تعامل با محیط و همواره در تلاش برای ماکزیمم‌ کردن پاداش‌ها در بلندمدت است. به بیان دیگر، یادگیری تقویتی یک نگاشت از موقعیت به عمل است، یعنی نشان می‌دهد در هر موقعیت یا حالتی چه عملی باید انجام شود تا به هدف برسیم.در این فرادرس به بررسی آموزش مسأله Multi-Armed Bandit در یادگیری تقویتی با متلب می‌پردازیم که شامل مسائل غیر ایستا، الگوریتم Constant-Alpha و مقادیر اولیه خوشبینانه می‌شود.

توضیحات کامل دوره

...

سرفصل‌های دوره

این دوره سرفصلی ندارد

ارسال نظر شما

نظرات کاربران

نظرات کاربران

هنوز نظری ثبت نشده است.

رایگان

این دوره شامل:
0 ساعت ساعت آموزش
دسترسی مادام‌العمر
سطح: مبتدی
گواهی پایان دوره: ندارد
تاریخ انتشار: 1403/12/09
آخرین به‌روزرسانی:
تعداد امتیازها: 0
تعداد دانشجو:
خرید اقساطی: ندارد
ضمانت بازگشت وجه: ندارد
برچسب‌ها: