آموزش spss مبحث رگرسیون
موسسه پایا پروژه به عنوان متصدی انجام پروژه های آمار و spss وظیفه ی خود می داند که در راستای آموزش نرم افزار spss گام های موثری را بردارد. با توجه به اینکه یک دوره آموزشی spss مستلزم تمرین و تلاش بسیار است. اما این موسسه تلاش می کند سهم کوچکی در جهت یادگیری شما داشته باشد.
1-4 رگرسیون خطی ساده و چندگانه[1]
یکی از مباحث مهم پژوهش علمی، پیشبینی و بررسی ارتباط (خطی) متغیر تصادفی وابسته (نرمال) Y به عنوان تابعی از یک یا چند متغیر مستقل X است که به آن مدل رگرسیون میگویند. مثلا بهترین خط رگرسیون گذرنده از میان نقاط به روش کمترین مربع خطا (ضرایب لاگرانژ[2]) بدین فرم است:

توجه شود که مقادیر و به عنوان پارامترهای شیب خط و عرض از مبدأ شناخته شده و توسط نرم افزار محاسبه میشوند.

1-4-1 مفروضات رگرسیون:
مفروضات زیر را برای خط رگرسیون در نظر گرفته یا تعریف میکنند.
- میانگین (امید ریاضی) خطاها صفر باشد.
- واریانس خطاها ثابت[1] باشد.
- خطاها دارای توزیع نرمال باشند. (با استفاده از تبدیلات نرمال ساز، و یا رگرسیون موزون)
- بین خطاها (ماندهها) همبستگی وجود نداشته باشد.
- بین متغیرهای مستقل وابستگی خطی وجود نداشته باشد. (عامل تورم واریانس)
2-مثال
میزان سدیم و کالری برای 54 سوسیس هاتداگ بدست آمده است. قصد داریم به کمک رگرسیون خطی، میزان کالری را به ازای مقادیر مختلف سدیم پیشبینی کنیم. ابتدا با توجه به بخش 1-2، فرض نرمالیتی متغیرها را آزمون کرده و سپس خروجی مربوطه را ذکر میکنیم.

2 آزمون فرض زیر(برا آزمون نیکویی) برقرار است:

با توجه به P-Value و مقایسه آن با سطح معنی داری 0.05=α فرض H0 پذیرفته میشود. ضمناً با برازش منحنی نرمال بر روی هیستوگرامها نیز فرض صفر بار دیگر تأیید میشود. (تأیید فرض نرمال بودن 2 متغیر).
به طور مرسوم سطح معنی داری (α) را 0.05 فرض میکنند در این صورت با اطمینان ( )% در اینجا (95%) فرض صفر را تأیید کرده و رگرسیون را تشکل میدهیم.

پس از تعیین متغیرهای وابسته و مستقل در برنامه، خروجیها نمایش داده میشوند. اولین بخش مورد بررسی خروجی مربوط به Model summary است که مهمترین بخش آن مقادیر ضریب تعیین و ضریب تعیین تعدیل یافته است. این ضرب هرچه به 1 نزدیکتر باشد مدل کاراتر میباشد. از جمله راههای افزایش آن، افزایش تعداد متغیر و یا انتخاب سایر مدلهای رگرسیونی است. خروجی بعدی مربوط به جدول ANOVA میباشد که خروجیها آن به ترتیب مجموع مربعات، درجه آزادی، میانگین مربعات، آماره F و p_value میباشد. توجه شود که در این بخش مقدار p_value، باید کوچکتر از سطح معنیداری(α) که در اینجا 0.05 است، باشد. در غیر اینصورت مدل غلط بوده و از بررسی خروجیهای بعد خودداری میشود. خروجی بعدی مربوط به جدول coefficients میباشد که ضرایب استاندارد نشده، ضرایب استاندارد شده و p_value مهمترین بخش آن است. منظور از مقدار constant و sodium به ترتیب مقادیر شیب خط و عرض از مبدأ مدل میباشند. که با توجه به کوچکتر بودن مقدار p_value از سطح معنیداری، فرض صفر مبنی بر وجود آنها تأیید شده و مدل به صورت زیر است:

[1] Simple and Multiple Linear Regression
[2] Lagrange Multiplier
[3] Stationary
