آموزش مساله Multi-Armed Bandit در یادگیری تقویتی با متلب (رایگان)
0 ساعت
0.0
ایده یادگیری از طریق تعامل با محیط، احتمالا اولین تفکری باشد که در ذهن همه ما خطور میکند. اگر به طریقه یادگیری راه رفتن در یک نوزاد نگاه کنیم، میبینیم که نوزاد از طریق تعامل با محیط خودش راه رفتن را یاد میگیرد، چندین و چندین بار بلند میشود و میافتد تا اینکه در نهایت یاد میگیرد که چگونه بر روی دو پای خودش بایستد. موضوع یادگیری تقویتی (Reinforcement Learning) نیز به طور دقیق به همین موضوع اشاره دارد. عامل (Agent) که میتواند یاد بگیرد، همانند نوزاد از طریق تعامل با محیط اطراف خودش یک شناخت کافی از آن پیدا میکند و سپس عملهایی را انجام خواهد داد که منجر به رسیدن به هدف میشود. سه روش اساسی برای یادگیری در هوش مصنوعی، یادگیری نظارتشده (Supervised)، نظارتنشده (Unsupervised) و تقویتی (Reinforcement) است. در یادگیری نظارتشده یک سری سیگنالهای لیبلدار وجود دارند و آنها را به عامل نشان میدهیم. در یادگیری تقویتی نیز داده لیبلدار وجود ندارد ولی عامل از طریق تعامل با محیط تجربه کسب میکند و یاد میگیرد کارهایی را انجام دهد که منجر به دریافتین پاداش در آینده شود. یادگیری تقویتی در حقیقت روش محاسباتی برای یادگیری از طریق تجربه و تعامل با محیط و همواره در تلاش برای ماکزیمم کردن پاداشها در بلندمدت است. به بیان دیگر، یادگیری تقویتی یک نگاشت از موقعیت به عمل است، یعنی نشان میدهد در هر موقعیت یا حالتی چه عملی باید انجام شود تا به هدف برسیم.در این فرادرس به بررسی آموزش مسأله Multi-Armed Bandit در یادگیری تقویتی با متلب میپردازیم که شامل مسائل غیر ایستا، الگوریتم Constant-Alpha و مقادیر اولیه خوشبینانه میشود.