آموزش رگرسیون در محیط R
موسسه پایا پروژه به عنوان متصدی انجام پروژه های R وظیفه ی خود می داند که در راستای آموزش نرم افزار R گام های موثری را بردارد. با توجه به اینکه یک دوره آموزشی R مستلزم تمرین و تلاش بسیار است. اما این موسسه تلاش می کند سهم کوچکی در جهت یادگیری شما داشته باشد.
1-6 مقدمه
در بخش آموزش رگرسیون در SPSS به توضیحاتی در مورد مبحث رگرسیون و روابط آن پرداخته ایم. البته لازم به ذکر است که نیازی به حفظ کردن روابط نبوده، زیرا تمامی خروجی ها توسط برنامه ها چاپ میشود. برای شروع کار ابتدا فایل داده( که غالباً به فرمت .txt) هستند را در محیط برنامه فراخوانی می کنیم.
1-6-1 فراخوانی داده در محیط R
فراخوانی داده در برنامه های آماری اولین گام اساسی برای آغاز هر تحلیل می باشد، زیرا وارد کردن داده به صورت دستی در بسیاری از موارد طولانی و طاقJ فرسا میباشد. برای این منظور به صورت زیر عمل کرده و آن را در متغیر data ذخیره میکنیم:

بخش هایلایت شده مربوط به اسم فایل با فرمت .txt و بخش header که مربوط به خواندن سرستون داد می باشد که بهصورت منطقی با عملگر T,F شناخته می شود. که منظور از آن True(صحیح) و Flase(غلط) میباشد. در صورت عدم تمایل به خواندن سرستون کافیست که این بخش را یا وارد دستور نکرده و یا آن را برابر با F قرار دهیم.
نکته:
- آدرس فایل باید به 2 کوتیشن) ’ (قرار بگیرد.
- دستور attach باعث ذخیره شدن نام سرستون ها به عنوان یک متغیر جدید در محیط برنامه و باعث افزایش سرعت در کدنویسی می گردد.
1-5 رسم نمودار پراکندگی
همانطور که در بخش های گذشته اشاره شد، رسم نمودار پراکنش(پراکندگی) ایده اولیه برای تشکیل مدل رگرسیونی را به ما می دهد. برای این منظور به صورت زیر عمل می کنیم:
![]()
دستور plot امکان رسم نمودار پراکندگی را به ما می دهد. اولین متغیر نام متغیری است که میخواهیم مقادیر آن بر روی محور x و متغیر دیگر، متغیری است که میخواهیم مقادیر آن بر روی محور y قرار بگیرد. توجه شود که دستور pch=20 باعث توپر شدن نقاط نمودار، و دستور بعد مربوط به رنگ پرکننده آن می باشد که ما رنگ آبی روشن را انتخاب کرده ایم.

با توجه به نمودار فوق، با عبور دادن یک خط از بین نقاط، میتوان مدل رگرسیون خطی را بر داده ها برازش داد. در گام بعد اقدام به بررسی فرض نرمال بودن متغیر پاسخ Y کرده و پس از اطمینان، اقدام به تشکیل رگرسیون مربوطه می کنیم.
1-5 بررسی فرض نرمالیتی در برنامه R
همانطور که در بخش (1-3) به آن اشاره شد، اغلب تحلیلهای آماری مبنی بر برقراری فرض نرمالیتی می باشد. در بخش مربوط به SPSS، از آزمون کلوموگروف-اسمیرنوف که در بخش آموزش آمار در SPSS (1-2) به آن اشاره شد، استفاده کردیم. در اینجا قصد استفاده از آزمون شاپیرو را داریم. آزمون شاپیرو که با نام شاپیرو-ویلک نیز از آن یاد میشود فقط به بررسی فرض نرمالیتی پرداخته، در صورتیکه به کمک آزمون کلوموگروف-اسمیرنوف میتوان فرض برقراری سایر توزیعهای آماری را مورد بررسی قرار داد که از جمله تفاوت این 2 آزمون میباشد. برای این منظور به صورت زیر عمل می کنیم:


آزمون فرض زیر(برا آزمون نیکویی) برقرار است:

با توجه به P-Value و مقایسه آن با سطح معنی داری 0.05=α فرض H0 مبنی بر برقراری فرض نرمالیتی، پذیرفته میشود. ضمناً اگر قصد رسم هیستوگرام ها را داشته باشیم به صورت زیر عمل میکنیم:

که دستور اول امکان رسم دو نمودار کنار یکدیگر را فراهم کرده و برای رسم نمودارها هیستوگرام از تابع hist و برای برازش منحنی نرمال از دستور lines(density) استفاده میشود. توجه شود که آرگومان lwd برای تنظیم ضخامت خط رسم شده می باشد. دقت شود که رسم هیستوگرام یک تشخیص چشمی می باشد و معمولاً زمانیکه فرض نرمالیتی مانده ها بررسی می شود. و از خروجی آزمون فرض صرف نظر می شود.

