آموزش رگرسیون در محیط R 

موسسه پایا پروژه به عنوان متصدی انجام پروژه های R   وظیفه ی خود می داند که در راستای آموزش نرم افزار R  گام های موثری را بردارد. با توجه به اینکه یک دوره آموزشی R  مستلزم تمرین و تلاش بسیار است. اما این موسسه تلاش می کند سهم کوچکی در جهت یادگیری شما داشته باشد.

1‏-‏6 مقدمه

در بخش آموزش رگرسیون در SPSS به توضیحاتی در مورد مبحث رگرسیون و روابط آن پرداخته ­ایم. البته لازم به ذکر است که نیازی به حفظ کردن روابط نبوده، زیرا تمامی خروجی­ ها توسط برنامه­ ها چاپ می­شود. برای شروع کار ابتدا فایل داده( که غالباً به فرمت .txt) هستند را در محیط برنامه فراخوانی می­ کنیم.

1‏-‏6‏-‏1 فراخوانی داده در محیط R

فراخوانی داده در برنامه ­های آماری اولین گام اساسی برای آغاز هر تحلیل می­ باشد، زیرا وارد کردن داده به صورت دستی در بسیاری از موارد طولانی و طاقJ ­فرسا می­باشد. برای این منظور به­ صورت زیر عمل کرده و آن را در متغیر data ذخیره می­کنیم:

 

 بخش هایلایت شده مربوط به اسم فایل با فرمت .txt و بخش header که مربوط به خواندن سرستون داد می ­باشد که به­صورت منطقی با عملگر T,F شناخته می­ شود. که منظور از آن True(صحیح) و Flase(غلط) می­باشد. در صورت عدم تمایل به خواندن سرستون کافیست که این بخش را یا وارد دستور نکرده و یا آن را برابر با F قرار دهیم.

نکته:

  • آدرس فایل باید به 2 کوتیشن) ’ (قرار بگیرد.
  • دستور attach باعث ذخیره شدن نام سرستون­ ها به عنوان یک متغیر جدید در محیط برنامه و باعث افزایش سرعت در کدنویسی می­ گردد.

1‏-‏5 رسم نمودار پراکندگی

همانطور که در بخش­ های گذشته اشاره شد، رسم نمودار پراکنش(پراکندگی) ایده اولیه برای تشکیل مدل رگرسیونی را به ما می­ دهد. برای این منظور به­ صورت زیر عمل می ­کنیم:

دستور plot امکان رسم نمودار پراکندگی را به ما می­ دهد. اولین متغیر نام متغیری است که می­خواهیم مقادیر آن بر روی محور x و متغیر دیگر، متغیری است که می­خواهیم مقادیر آن بر روی محور y قرار بگیرد. توجه شود که دستور pch=20 باعث توپر شدن نقاط نمودار، و دستور بعد مربوط به رنگ پرکننده آن می­ باشد که ما رنگ آبی روشن را انتخاب کرده­ ایم.

 

با توجه به نمودار فوق، با عبور دادن یک خط از بین نقاط، می­توان مدل رگرسیون خطی را بر داده­ ها برازش داد. در گام بعد اقدام به بررسی فرض نرمال بودن متغیر پاسخ Y کرده و پس از اطمینان، اقدام به تشکیل رگرسیون مربوطه می ­کنیم.

1‏-‏5 بررسی فرض نرمالیتی در برنامه R

همانطور که در بخش (1-3) به آن اشاره شد، اغلب تحلیل­های آماری مبنی بر برقراری فرض نرمالیتی می­ باشد. در بخش مربوط به SPSS، از آزمون کلوموگروف-اسمیرنوف که در بخش آموزش آمار در SPSS (1-2) به آن اشاره شد، استفاده کردیم. در اینجا قصد استفاده از آزمون شاپیرو را داریم. آزمون شاپیرو که با نام شاپیرو-ویلک نیز از آن یاد می­شود فقط به بررسی فرض نرمالیتی پرداخته، در صورتی­که به کمک آزمون کلوموگروف-اسمیرنوف می­توان فرض برقراری سایر توزیع­های آماری را مورد بررسی قرار داد که از جمله تفاوت این 2 آزمون می­باشد. برای این منظور به صورت زیر عمل می­ کنیم:

آزمون فرض زیر(برا آزمون نیکویی) برقرار است:

 

با توجه به P-Value  و مقایسه آن با سطح معنی داری 0.05=α فرض H0 مبنی بر برقراری فرض نرمالیتی، پذیرفته می­شود. ضمناً اگر قصد رسم هیستوگرام ­ها را داشته باشیم به­ صورت زیر عمل می­کنیم:

 

که دستور اول امکان رسم دو نمودار کنار یکدیگر را فراهم کرده و برای رسم نمودارها هیستوگرام از تابع hist و برای برازش منحنی نرمال از دستور lines(density) استفاده می­شود. توجه شود که آرگومان lwd برای تنظیم ضخامت خط رسم شده می ­باشد. دقت شود که رسم هیستوگرام یک تشخیص چشمی می­ باشد و معمولاً زمانی­که فرض نرمالیتی مانده ­ها بررسی می­ شود. و از خروجی آزمون فرض صرف­ نظر می­ شود.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

این زمینه را پر کنید
این زمینه را پر کنید
لطفاً یک نشانی ایمیل معتبر بنویسید.
شما برای ادامه باید با شرایط موافقت کنید

هشت + 2 =

سفارش پروژه