آموزش ارزیابی سیاست در یادگیری تقویتی با متلب MATLAB (رایگان)
0 ساعت
0.0
ایده یادگیری از طریق تعامل با محیط، احتمالا اولین تفکری باشد که در ذهن همه ما خطور میکند. اگر به طریقه یادگیری راه رفتن در یک نوزاد نگاه کنیم، میبینیم که نوزاد از طریق تعامل با محیط خودش راه رفتن را یاد میگیرد، چندین و چندین بار بلند میشود و میافتد تا اینکه در نهایت یاد میگیرد که چگونه بر روی دو پای خودش بایستد. موضوع یادگیری تقویتی (Reinforcement Learning) نیز به طور دقیق به همین موضوع اشاره دارد. عامل (Agent) که میتواند یاد بگیرد، همانند نوزاد از طریق تعامل با محیط اطراف خودش یک شناخت کافی از آن پیدا میکند و سپس عملهایی را انجام خواهد داد که منجر به رسیدن به هدف میشود. سه روش اساسی برای یادگیری در هوش مصنوعی، یادگیری نظارتشده (Supervised)، نظارتنشده (Unsupervised) و تقویتی (Reinforcement) است.در یادگیری نظارتشده شده یک سری سیگنالهای لیبلدار وجود دارند و آنها را به عامل نشان میدهیم. دستهبندی اشیا و پیشبینی شاخص بورس دو مورد از کاربردهای یادگیری نظارتشده است اما در یادگیری نظارتنشده (غیر نظارتی)، داده لیبلدار وجود ندارد و خود عامل باید الگوهای موجود در داخل دادهها را پیدا کند. خوشهبندی جزو یکی از مثالهای مهم این حوزه است. در یادگیری تقویتی نیز داده لیبلدار وجود ندارد ولی عامل از طریق تعامل با محیط تجربه کسب میکند و یاد میگیرد کارهایی را انجام دهد که منجر به دریافتین پاداش در آینده شود. یادگیری تقویتی در حقیقت روش محاسباتی برای یادگیری از طریق تجربه و تعامل با محیط و همواره در تلاش برای ماکزیمم کردن پاداشها در بلندمدت است. به بیان دیگر، یادگیری تقویتی یک نگاشت از موقعیت به عمل است، یعنی نشان میدهد در هر موقعیت یا حالتی چه عملی باید انجام شود تا به هدف برسیم.در این فرادرس به بررسی آموزش ارزیابی سیاست در یادگیری تقویتی با متلب Matlab میپردازیم که شامل بهبود سیاست (Policy Improvement)، کدنویسی بهبود سیاست در متلب، کدنویسی تولید یک Episode از بازی با سیاست مشخص و تکرار سیاست (Policy Iteration) میشود.