منظور از خزش یا کرال در وب چیست؟ این جمله که ما در حال زندگی در عصر اطلاعات هستیم، برای همه ما آشنا است. اما این اطلاعات کجاست؟ این اطلاعات میتواند در روزنامهها، رادیو، تلویزیون و به خصوص درفضای وب باشد. فضای وب روزانه در حال بزرگ و بزرگتر شدن است. در هر لحظه میلیونها کاربر اینترنت در سراسر دنیا با ایجاد صفحات جدید یا حذف و ویرایش صفحات و تولید محتوا در سایتهای مختلف در حال تولید داده هستند که این دادهها، اطلاعات موجود در شبکههای اجتماعی، آمارهای منتشر شده در سایت ها، اطلاعات محصولات فروشگاههای اینترنتی و نتایج نظرسنجیهای اینترنتی را در بر میگیرد. با رشد انفجاری حجم دادهها در فضای وب، نظر پژوهشگران حوزه علوم داده (Data Science) به این دادهها جلب شده است، اما چگونه می توان به این داده ها دسترسی پیدا کرد؟ با پیشرفت هوش مصنوعی در دهه های اخیر، الگوریتم های قدرتمند یادگیری ماشین برای تحلیل دادههای حجیم و کشف اطلاعات ارزشمند از آنها، توسعه داده شدهاند که این الگوریتم ها برای بررسی سئو (SEO) سایت، رقابت بین شرکتها، تبلیغات، یافتن باگهای امنیتی سایت (تست نفوذ) و یا سایر نیازمندیهای تحت وب مورد استفاده قرار میگیرند. بالا رفتن قدرت محاسباتی سیستمها، افزایش حافظهها و همچنین دسترسی آسان به دادههای موجود در وب، باعث شده است تا پژوهشگران حوزه علوم داده به استفاده از دادههای حجیم تحت وب، علاقهمند شوند. با توجه به این که سایت ها، شرکتها و بنگاههای تجاری اینترنتی، دادههای خود را به سادگی در اختیار دیگران نمیگذارند، پژوهشگران و برنامهنویسان، روشها و ابزارهای قدرتمندی را برای جمعآوری و ذخیرهسازی دادههای وب توسعه دادهاند که به آن خزش یا کرال در وب (Web Crawling) میگویند. اهمیت یادگیری طراحی خزشگر وب با پایتون چیست؟ ، پژوهشگران و برنامهنویسان، با استفاده از ابزارهای خزشگر وب، دادهها و اطلاعات داخل وب سایتها را کرال کرده و در قالبهای معمول و قابل استفاده برای تحلیلهای خود ذخیره میکنند و پس از آن میتوانند به شکل یک فایل از آن استفاده کرده و یا برای پژوهشهای حوزه داده کاوی از طریق وب، در اختیار عموم قرار دهند. موتورهای جستجو نیز برای ایندکس کردن (Indexing) صفحات وب از کرال و خزش در بین این صفحات استفاده میکنند. زبان برنامهنویسی پایتون (Python) به دلایلی همچون سرعت در کدنویسی، یادگیری آسان و بستههای قدرتمند در حوزه تحلیل داده، مورد توجه پژوهشگران حوزه علوم داده قرار گرفته است، به طوری که توسعهدهندگان بزرگ از جمله Google و Facebook، توسط این زبان برنامهنویسی قدرتمند، اپلیکیشنها و الگوریتمهای مهمی برای هوش مصنوعی توسعه دادهاند. همچنین در این زبان، به منظور کرال (Crawl) دادههای مورد نیاز مانند متن وبسایتها، فایلهای متنی و چندرسانهای توسط تحلیلگران داده از محیط وب، بستههای پرقدرتی از جمله: Request, BeautifulSoup و Selenium، توسعه داده شده است. در این فرادرس چه چیزی یاد میگیریم؟ در این فرادرس به شما آموزش می دهیم که چگونه داده های مورد نظر خود را با استفاده از زبان برنامهنویسی پایتون از هر سایتی کرال و به شیوههای درست ذخیره کنید و در نهایت یک کرالر کاربردی را پیادهسازی خواهیم کرد.