انواع الگوریتمهای یادگیری ماشین | معرفی، کاربردها و نکات کاربردی

یادگیری ماشین امروز بهعنوان یکی از مهمترین فناوریهای تحولآفرین، در بخشهای مختلف زندگی ما نقش دارد و از موتورهای جستوجو تا تحلیل تصاویر پزشکی و سیستمهای پیشنهاددهنده را دربر میگیرد! بهطوریکه طبق پیشبینیها، بازار جهانی آن تا سال ۲۰۲۹ رشد چشمگیر خواهد داشت.
با گسترش اتوماسیون و هوشمندسازی، الگوریتمهای متنوع یادگیری ماشین امکان انجام وظایف پیچیدهای مانند بازی شطرنج، جراحی و شخصیسازی خدمات را فراهم کردهاند. ازاینرو شناخت انواع الگوریتم های یادگیری ماشین و درک کاربرد هرکدام، برای مهندسان و دانشمندان داده در این حوزه پویـا و روبهرشد، امری ضروری است. ما در این مقاله از مجله سبزلرن بخشی از این الگوریتمها را معرفی میکنیم تا اهل فن بتوانند با کاربرد بهترین الگورتیمهای یادگیری ماشین آشنا شوند.
دستهبندی اصلی الگوریتم های یادگیری ماشین
انواع الگوریتم های یادگیری ماشین به کامپیوترها اجازه میدهند تا از دادهها یاد بگیرند، الگوها را شناسایی و بدون اینکه بهصورت صریح برنامهنویسی شده باشند، پیشبینی انجام دهند. این الگوریتمها بهجای دنبال کردن دستورالعملهای ثابت، با قرار گرفتن در معرض دادههای بیشتر، عملکرد خود را بهبود میدهند. جالب است بدانید که الگوریتمهای یادگیری ماشین بهطور کلی به چند دسته زیر تقسیم میشوند:
یادگیری نظارتشده (Supervised Learning)
الگوریتمهای یادگیری نظارتشده با استفاده از مجموعه دادههایی آموزش داده میشوند که در آن، هر نمونه همراه با یک متغیر هدف یا پاسخ است که «برچسب» نامیده میشود. هدف، یادگیری یک تابع نگاشت از دادههای ورودی به برچسبهای خروجی مربوطه است که مدل را قادر میسازد پیشبینیهای دقیقی روی دادههای دیده نشده انجام دهد.
یادگیری بدون نظارت (Unsupervised Learning)
الگوریتیمهای یادگیری بدون نظارت با دادههای بدون برچسب کار میکند تا الگوها یا ساختارهای پنهان بدون خروجیهای از پیش تعریف شده را کشف کنند. این الگوریتمها نیز بر اساس هدفشان به سه دسته اصلی زیر تقسیم میشوند:
خوشهبندی: نقاط داده را بر اساس شباهتها یا تفاوتهایشان در خوشهها گروهبندی میکند.
کاوش قوانین وابستگی: یافتن الگوهای بین اقلام در مجموعه دادههای بزرگ، معمولا در تحلیل سبد بازار (بهعنوان مثال، یافتن اینکه افرادی که نان میخرند اغلب کره هم میخرند).
کاهش ابعاد: تعداد ویژگیها را کاهش میدهد و در عین حال اطلاعات مهم را حفظ میکند.
یادگیری نیمهنظارتی (Semi-Supervised Learning)
انواع الگوریتم های یادگیری ماشین نیمهنظارتی از دادههای برچسبدار و بدون برچسب برای آموزش استفاده میکنند. این الگوریتمها زمانی مفید هستند که برچسبگذاری دادهها گران باشد، اما دادههای بدون برچسب به راحتی در دسترس باشند. الگوریتمهای رایج نیمهنظارتی عبارتند از:
خودآموزی
همآموزی
انتشار برچسب
گسترش برچسب
یادگیری تقویتی (Reinforcement Learning)
یادگیری تقویتی نیز یکی از انواع الگوریتم های یادگیری ماشین است که بر فرآیندهای یادگیری منظم تمرکز دارد. با تعریف قوانین الگوریتم یادگیری ماشین تقویتی سعی میکند گزینهها و احتمالات مختلف را بررسی ، هر نتیجه را نظارت و ارزیابی نماید تا مشخص شود کدام یک بهینهتر است! یادگیری تقویتی در واقع به ماشین روش آزمون و خطا را آموزش میدهد. ماشین از تجربیات گذشته درس میگیرد و شروع به تطبیق رویکرد خود در پاسخ به موقعیت میکند تا به بهترین نتیجه ممکن برسد.
الگوریتمهای پرکاربرد یادگیری ماشین
در هسته یادگیری ماشین، الگوریتمهایی قرار دارند که با مجموعه دادهها آموزش داده میشوند تا به مدلهای خاص "Machine learning" تبدیل شوند؛ مدلهایی که قدرتبخش برخی از تاثیرگذارترین نوآوریهای جهان هستند. از اپلیکیشنهایی که پیشنهادهای شخصیسازیشده محصولات ارائه میدهند تا سیستمهایی که تحلیل تصاویر تشخیصی را با دقتی روزافزون انجام میدهند، یادگیری ماشین به روشهای بیشماری در کاربردهای دنیای واقعی مورد استفاده قرار میگیرد. اما پرکاربردترین انواع الگوریتم های یادگیری ماشین که باید بشناسید عبارتاند از:
الگوریتمهای رگرسیون (Linear & Logistic Regression)
رگرسیون خطی (Linear Regression) برای تخمین مقادیر واقعی (هزینه خانهها، تعداد تماسها، کل فروش و غیره) بر اساس متغیر(های) پیوسته استفاده میشود. بهترین راه برای درک رگرسیون خطی، زنده کردن یک تجربه دوران کودکی است.

برای درک این نمونه از انواع الگوریتم های یادگیری ماشین، فرض کنید از یک کودک کلاس پنجمی میخواهید که افراد کلاس خود را با افزایش ترتیب وزن، بدون پرسیدن وزنشان، مرتب کند. فکر میکنید کودک چه خواهد کرد؟ او احتمالا به قد و هیکل افراد نگاه میکند (به صورت بصری تجزیه و تحلیل کرده) و آنها را با استفاده از ترکیبی از این پارامترهای قابل مشاهده، مرتب خواهد کرد. این رگرسیون خطی در زندگی واقعی است. کودک در واقع فهمیده که قد و هیکل با وزن از طریق رابطهای که شبیه معادله بالا است، مرتبط هستند.
در مقابل، رگرسیون لجستیک (Logistic Regression) یک الگوریتم طبقهبندی است و از آن برای تخمین مقادیر گسسته (مقادیر دودویی مانند ۰/۱، بله/خیر، درست/غلط) بر اساس مجموعهای از متغیرهای مستقل استفاده میشود. فرض کنید دوست شما یک معما برای حل کردن به شما میدهد. فقط دو سناریوی نتیجه وجود دارد:
یا آن را حل میکنید.
یا از پس حل کردن آن بر نمیآیید.

حالا تصور کنید که طیف گستردهای از معماها/آزمونها به شما داده میشود تا بفهمید در کدام دروس مهارت بیشتری دارید. نتیجه این مطالعه چیزی شبیه به این خواهد بود که اگر یک مسئله کلاس دهم مبتنی بر مثلثات به شما داده شود، ۷۰ درصد احتمال دارد آن را حل کنید. از طرف دیگر، اگر یک سوال تاریخ کلاس پنجم باشد، احتمال دریافت پاسخ تنها ۳۰ درصد است. این چیزی است که رگرسیون لجستیک در اختیار شما قرار میدهد.
درخت تصمیم و جنگل تصادفی (Decision Tree & Random Forest)
درخت تصمیم (Decision Tree) هم نوعی الگوریتم یادگیری نظارت شده است که بیشتر برای مسائل طبقهبندی استفاده میشود. بهطور شگفتانگیزی، این الگوریتم برای هر دو متغیر وابسته طبقهبندیشده و پیوسته کار میکند. در این نمونه از انواع الگوریتم های یادگیری ماشین ما جمعیت را به دو یا چند مجموعه همگن تقسیم میکنیم. این کار بر اساس مهمترین ویژگیها/متغیرهای مستقل انجام میشود تا گروههای تا حد امکان متمایزی ایجاد شوند.

بهترین راه برای درک نحوه عملکرد درخت تصمیم، بازی "Jezzball" است. یک بازی کلاسیک از مایکروسافت که در آن، شما یک اتاق با دیوارهای متحرک دارید و باید دیوارهایی ایجاد کنید که حداکثر مساحت بدون توپها پاک شود.
الگوریتم جنگل تصادفی (Random forest) مجموعهای از درختهای تصمیمگیری است که برای طبقهبندی و مدلسازی پیشبینی استفاده میشود. به جای تکیه بر یک درخت تصمیمگیری واحد، یک جنگل تصادفی پیشبینیهای چندین درخت تصمیمگیری را برای پیشبینیهای دقیقتر ترکیب میکند.

K-نزدیکترین همسایه (K-Nearest Neighbors)
یکی از انواع الگوریتم های یادگیری ماشین که کاربردی زیادی دارد، الگوریتم KNN است که میتواند هم برای مسائل دستهبندی و هم برای رگرسیون استفاده شود، اما در یادگیری ماشین بیشتر بعنوان یک الگوریتم دستهبندی کاربردی است. نزدیکترین همسایهها یک الگوریتم ساده و شهودی محسوب میشود که تمام نمونههای موجود را ذخیره میکند و نمونههای جدید را بر اساس رای اکثریت k همسایه نزدیک خود دسته بندی مینماید. کلاس اختصاص داده شده به یک مورد جدید، رایجترین کلاس در بین "k- Nearest Neighbors" آن است که توسط یک تابع فاصله اندازهگیری میشود.

در سناریوهای واقعی، KNN را میتوان به کشف اطلاعات بیشتر در مورد یک فرد بر اساس دوستان نزدیک یا حلقههای اجتماعی او تشبیه کرد.اگر چیزی در مورد کسی نمیدانید، ویژگیهای همسایگان او میتواند بینشهایی در مورد فرد مورد نظر به شما ارائه دهد.
شبکههای عصبی و Deep Learning
شبکههای عصبی در یادگیری ماشین به مجموعهای از الگوریتمها اشاره دارند که برای کمک به ماشینها در تشخیص الگوها بدون برنامهنویسی صریح طراحی شدهاند. آنها از گروهی از گرههای به هم پیوسته تشکیل شدهاند که این گرهها نمایانگر نورونهای مغز بیولوژیکی هستند. کاربرد این نمونه از انواع الگوریتم های یادگیری ماشین معمولا یکی از این سه دسته کلی را شامل میشود:
طبقهبندی که به موجب آن یک شبکه عصبی میتواند الگوها و توالیها را تشخیص دهد.
تقریب تابعی و تحلیل رگرسیون
پردازش دادهها شامل خوشهبندی و فیلتر کردن دادهها

یادگیری عمیق (Deep Learning) زیرشاخهای از یادگیری ماشین است و احتمالا شناخته شدهترین نمونه از موارد کاربرد یادگیری ماشین در نگاه عامه افراد به شمار میرود. الگوریتمهای یادگیری عمیق از ساختار مغز انسان الهام گرفته شدهاند و برای آموزش به حجم باورنکردنی از دادهها نیاز دارند. آنها اغلب برای پیچیدهترین مسائل «شناختی» مانند تشخیص گفتار، ترجمه زبان، خودروهای خودران و موارد دیگر استفاده میشوند.

معیار انتخاب الگوریتم مناسب
هریک از انواع الگوریتم های یادگیری ماشین برای حل یک مسئله خاص طراحی شدهاند، بنابراین اول از همه باید نوع پروژهای را که با آن سروکار دارید را در نظر بگیرید! پس از آن از خودتان بپرسید که چه ورودی دارید؟ دادههای شما چگونه هستند؟ آیا دادههای کافی دارید یا جمعآوری اضافی (یا حتی جمعآوری از ابتدا) مورد نیاز است؟ با این سوالها میتوانید خطی بودن دادههای خود را دریابید و به این مسئله توجه کنید که سرعت و زمان آموزش چقدر برای شما مهم است.

معایب | مزایا | الگوریتم |
دادههای پرت میتوانند تاثیرات زیادی بر رگرسیون داشته باشند. مرزها در این تکنیک خطی هستند. |
پیادهسازی سادهای دارد و تفسیر ضرایب خروجی آن آسانتر است. |
Linear Regression |
روی دادههای غیرخطی عملکرد ضعیفی دارد. |
تنظیم ابرپارامترها لازم نیست. |
Logistic Regression |
اگر دادهها کمی تغییر کنند، نتایج میتوانند تا حد زیادی تغییر کنند. |
توضیح آن برای اعضای غیر فنی تیم آسان است. |
Decision Trees |
آموزش و پیشبینی آن نسبت به یک درخت تصمیم ساده به منابع محاسباتی بیشتری نیاز دارد و تفسیر نتایج آن دشوارتر است. |
این نمونه از انواع الگوریتم های یادگیری ماشین، عملکرد خوبی در مجموعه دادههای نامتوازن دارد. |
Random Forest |
در مجموعه دادههایی با تعداد زیادی ویژگی، خیلی خوب کار نمیکند. |
وقتی در معرض دادههای جدید قرار میگیرد، برای تطبیق با نقاط داده جدید تغییر میکند. |
K-Nearest Neighbors |
برای آموزش به داده و منابع محاسباتی زیادی نیاز دارند و تفسیر تصمیمهای آنها معمولاً دشوار است. |
قادر به پردازش دادههای سازمان نیافته است. |
Neural networks |
آموزش آن نیازمند منابع محاسباتی قابل توجهی است که میتواند برای بسیاری از سازمانها غیرعملی باشد. |
میتواند به طور همزمان دادههای ساختاریافته و بدون ساختار را در سیستمهای سرتاسری پردازش کند. |
Deep Learning |
کاربردهای عملی انواع الگوریتمها
طبق گزارش فوربس، تیمهای بازاریابی و فروش، الگوریتمهای یادگیری ماشین را بیش از هر بخش سازمانی دیگری در اولویت قرار میدهند. بهعنوان مثال بسیاری از آنها برای تماس با کاربرانی که محصولات را در سبد خرید خود رها میکنند یا از وبسایت آنها خارج میشوند، از این الگوریتمها استفاده میکنند.
همچنین الگوریتمهای یادگیری ماشین و علم داده، نحوه ارائه توصیهها در سایتهایی مانند آمازون، نتفلیکس و "StitchFix" را بر اساس سلیقه، مرور و سابقه سبد خرید کاربر آسان میکنند. سایر کاربردهای مهم این الگوریتمها هم عبارتند از:
فیلتر کردن ایمیل
الگوریتمهای یادگیری ماشین در "Gmail"، پیامهای مشتریان را به دستههای اصلی، اجتماعی و تبلیغاتی فیلتر کرده و در عین حال هرزنامهها را شناسایی و به پوشه هرزنامه هدایت میکنند. این به شما امکان میدهد پاسخهای شخصیسازی شده را بر اساس دسته ایجاد کنید که باعث صرفهجویی در زمان میشود و چنین سفارشیسازی میتواند به بهبود نرخ تبدیل شما کمک کند.
تراکنشهای مالی
انواع الگوریتم های یادگیری ماشین بهخصوص "deep learning" بهطور گسترده در بانکداری بهعنوان مثال در تشخیص کلاهبرداری مورد استفاده قرار میگیرند. بانکها و سایر موسسات مالی، مدلهای یادگیری ماشینی را برای تشخیص تراکنشهای آنلاین مشکوک و سایر تراکنشهای غیرمعمول که نیاز به بررسی بیشتر دارند، آموزش میدهند.
مراقبتهای بهداشتی
پیشرفتهای یادگیری ماشینی منجر به آموزش ماشینها در تشخیص الگو شد که اکنون گاهی اوقات در تصویربرداری رادیولوژی استفاده میشود. برای نمونه پزشکانی که ماموگرافیهای سرطان سینه را ارزیابی میکنند، گفتهاند این روش ۴۰ درصد سرطانها را تشخیص نمیدهند. اما یادگیری ماشینی میتواند این رقم را بهبود بخشد.
حوزه حمل و نقل
این روزها یادگیری ماشینی اطلاعات زیادی در مورد حمل و نقل ما ارائه میدهد. بهعنوان مثال نقشههای گوگل از الگوریتمهای یادگیری ماشینی برای بررسی شرایط فعلی ترافیک، تعیین سریعترین مسیر، پیشنهاد مکانهایی برای «پیدا کردن نزدیکترین ...» و تخمین زمان رسیدن استفاده میکنند.
یادگیری ماشین در گوشیهای هوشمند
انواع الگوریتم های یادگیری ماشین همچنین در تشخیص چهره برای روشن کردن گوشیهای موبایل نیز کاربرد دارند. آنها دستیارهای صوتی را که آلارم تنظیم میکنند و پیامها را مینویسند، پشتیبانی خواهند کرد. این موارد شامل سیری اپل، الکسا آمازون، دستیار گوگل و کورتانا مایکروسافت است که از NLP برای تشخیص آنچه میگوییم و پاسخ مناسب به آن استفاده میکنند.

نکات مهم برای شروع یادگیری الگوریتمها
از آنجایی که یادگیری ماشین یک حوزه غنی بوده که هر ساله در حال گسترش است، ممکن است وسوسه شوید که به برخی از جدیدترین و پیشرفتهترین زیرشاخههای یادگیری ماشین مانند یادگیری عمیق یا "NLP" بپردازید. اما پیشنهاد میکنیم:
اهداف یا مهلتهای مشخصی برای آموزش انواع الگوریتم های یادگیری ماشین تعیین کنید.
بین تمرین و تئوری ارتباط ایجاد کنید.
آموزش هر الگوریتم را به ارزش آن گره بزنید.
به «ورودیها/خروجیها» فکر کنید و بپرسید «چرا».
در نهایت فراموش نکنید که صبر رکن اصلی یادگیری است و مهارتهای یادگیری ماشین در مدت کوتاه بهدست نمیآیند! بنابراین بهتر است موضوعاتی را انتخاب کنید که به آنها علاقه دارید، برای یادگیری عمیق زمان بگذارید و از مسیر پیشرفت لذت ببرید. در این مسیر استفاده از دورههای تخصصی آکادمی سبزلرن میتواند با آموزش اصولی و پروژهمحور روند یادگیری شما را هدفمندتر و موثرتر کند.
سوالات متداول
مقالات مرتبط
نظرات
اولین نفری باش که برای این مقاله نظر میدی.