چگونه داده‌ها را برای یادگیری ماشین آماده کنیم

خلاصه
1405/06/23

پیش‌پردازش داده شامل مراحل زیر است: ۱. **پاکسازی داده‌ها:** حذف مقادیر گمشده (NaN)، تصحیح داده‌های پرت و رسیدگی به ناهنجی‌ها. ۲. **تبدیل داده‌ها:** تبدیل متغیرهای 범جری (Categ

چگونه داده‌ها را برای یادگیری ماشین آماده کنیم


پیش‌پردازش داده شامل مراحل زیر است:

۱. **پاکسازی داده‌ها:** حذف مقادیر گمشده (NaN)، تصحیح داده‌های پرت و رسیدگی به ناهنجی‌ها.
۲. **تبدیل داده‌ها:** تبدیل متغیرهای 범جری (Categorical) مانند متن یا دسته‌بندی به فرمت عددی با استفاده از One-Hot Encoding، Label Encoding و غیره.
۳. **مقیاس‌بندی/نرمال‌سازی:** تطبیق مقیاس ویژگی‌های مختلف با استفاده از Standard Scaling (استانداردسازی) یا Min-Max Scaling (نرمال‌سازی).
۴. **مهندسی ویژگی (Feature Engineering):** ایجاد ویژگی‌های جدید و مرتبط از ویژگی‌های موجود برای بهبود عملکرد مدل.
۵. **تقسیم داده‌ها:** تفکیک مجموعه داده به مجموعه‌های آموزش ($\text{Train}$)، اعتبارسنجی ($\text{Validation}$) و آزمون ($\text{Test}$).