آموزش تحلیل خوشهای در SPSS: راهنمای گامبهگام و کاربردی برای پژوهشگران
اگر در انتخاب روش مناسب دستهبندی دادهها، تعیین تعداد بهینه خوشهها یا تحلیل خروجیهای SPSS در پایاننامه خود دچار مشکل شدهاید، این مقاله دقیقاً برای شما نوشته شده است. در این راهنمای جامع، بدون درگیر شدن در محاسبات پیچیده ریاضی، یاد میگیرید که چگونه متغیرهای پژوهش خود را در SPSS استانداردسازی کنید، الگوریتم مناسب را انتخاب نمایید و نتایج را بر اساس استانداردهای آکادمیک در فصل چهارم پایاننامه گزارش کنید.
فهرست مطالب

- ۱. تحلیل خوشهای چیست و چه زمانی استفاده میشود؟
- ۲. مقایسه انواع روشهای تحلیل خوشهای در SPSS
- ۳. پیشفرضهای ضروری پیش از اجرای تحلیل
- ۴. آموزش گامبهگام اجرای تحلیل خوشهای (سناریوی عملی)
- ۵. راهنمای تفسیر خروجیها و نمودار دندروگرام
- ۶. الگوی گزارش نتایج در فصل چهارم پایاننامه
- ۷. اشتباهات رایج و راهحل سریع آنها
- ۸. پرسشهای متداول
📌 خلاصه مدیریتی (نگاه سریع)
- برای نمونههای زیر ۳۰۰ نفر از روش سلسلهمراتبی (Hierarchical) و برای نمونههای بالای ۱۰۰۰ نفر از روش K-Means استفاده کنید.
- همیشه قبل از تحلیل، تمام متغیرها را با تبدیل به Z-Score استانداردسازی کنید.
- برای تعیین تعداد خوشهها در روش سلسلهمراتبی، به نمودار Dendrogram یا جدول Agglomeration Schedule توجه کنید.
تحلیل خوشهای چیست و چه زمانی استفاده میشود؟

پاسخ کوتاه: تحلیل خوشهای (Cluster Analysis) یک تکنیک آماری اکتشافی است که مشاهدهها یا پاسخدهندگان را بر اساس میزان شباهت متغیرهایشان در گروههای همگن (خوشهها) دستهبندی میکند، بهطوری که شباهت اعضای داخل یک خوشه حداکثر و شباهت بین خوشههای مختلف حداقل باشد.
در بسیاری از پژوهشهای علوم انسانی، مدیریت، بازاریابی و پزشکی، هدف پژوهشگر پیشبینی یک متغیر وابسته نیست؛ بلکه کشف ساختارهای پنهان در میان دادههاست. برای مثال، یک محقق بازاریابی میخواهد مشتریان یک فروشگاه را بر اساس الگوی خرید دستهبندی کند، یا یک روانشناس قصد دارد بیماران را بر اساس شدت نشانههای بالینی در گروههای مجزا قرار دهد.
تفاوت اصلی تحلیل خوشهای با روشهایی مانند تحلیل ممیزی (Discriminant Analysis) در این است که در تحلیل خوشهای، گروهها از قبل مشخص نیستند و هیچ متغیر وابستهای (Target Variable) وجود ندارد. الگوریتم بر اساس معیارهای فاصله (مانند فاصله اقلیدسی)، خود گروهها را شکل میدهد.
مقایسه انواع روشهای تحلیل خوشهای در SPSS

نرمافزار SPSS سه روش اصلی برای اجرای تحلیل خوشهای ارائه میدهد. انتخاب روش نادرست میتواند منجر به دستهبندی نادرست و نتایج غیرقابل اتکا شود.
۱. روش سلسلهمراتبی (Hierarchical Clustering)
این روش برای دادههای با حجم کوچک تا متوسط (معمولاً کمتر از ۳۰۰ نمونه) مناسب است. نیازی به تعیین تعداد خوشهها از قبل ندارد و تمام مسیر تشکیل خوشهها را از تکتک مشاهدات تا یک خوشه واحد نمایش میدهد.
۲. روش کی-میانگین (K-Means Clustering)
این روش برای نمونههای بزرگ (بیش از ۵۰۰ یا ۱۰۰۰ نمونه) بسیار سریع و بهینه است. شرط اصلی استفاده از آن این است که پژوهشگر باید تعداد خوشهها (K) را از قبل بداند یا آن را از طریق روش سلسلهمراتبی مشخص کرده باشد.
۳. روش دو مرحلهای (TwoStep Clustering)
این روش توانایی پردازش همزمان متغیرهای کمی (فاصلهای/نسبی) و کیفی (اسمی/رتبهای) را دارد و میتواند تعداد بهینه خوشهها را بهطور خودکار تعیین کند.
| روش سلسلهمراتبی (Hierarchical) | روش کی-میانگین (K-Means) |
|---|---|
| مناسب برای نمونههای کوچک (زیر ۳۰۰ نمونه) | مناسب برای نمونههای بزرگ (بیش از ۵۰۰ نمونه) |
| عدم نیاز به تعیین تعداد خوشهها از قبل | الزام به تعیین دقیق تعداد خوشهها پیش از اجرا |
| ارائه نمودار درختواره (Dendrogram) | بدون خروجی نمودار دندروگرام |
| سرعت پردازش پایین در دادههای حجیم | سرعت پردازش بسیار بالا و مقیاسپذیر |
| حسایت بالا به دادههای پرت (Outliers) | حساسیت کمتر نسبت به روش سلسلهمراتبی |
پیشفرضهای ضروری پیش از اجرای تحلیل
قبل از کلیک روی دکمه OK در SPSS، حتماً چکلیست زیر را بررسی کنید تا از معتبر بودن خروجیها مطمئن شوید:
- مقیاس سنجش متغیرها: تمام متغیرها در روشهای Hierarchical و K-Means باید کمی (Continuous) باشند.
- حذف دادههای پرت (Outliers): دادههای پرت ماتریس فاصلهها را مخدوش میکنند. با استفاده از Boxplot یا نمرات Z، دادههای خارج از محدوده (Z > 3 یا Z < -3) را شناسایی و مدیریت کنید.
- استانداردسازی متغیرها (Z-Score): اگر متغیرهای شما مقیاسهای متفاوتی دارند (مثلاً سن بر حسب سال و درآمد بر حسب میلیون تومان)، متغیر با مقیاس بزرگتر بر نتیجه خوشهبندی مسلط خواهد شد. حتماً دادهها را استاندارد کنید.
- عدم وجود همخطی چندگانه شدید: متغیرهایی که همبستگی بسیار بالایی (بالای ۰.۸۰) دارند، وزن بیشتری به آن بعد در خوشهبندی میدهند. متغیرهای موازی را حذف کنید.
آموزش گامبهگام اجرای تحلیل خوشهای (با سناریوی عملی)
سناریو: فرض کنید میخواهیم ۲۰۰ مشتری یک شرکت را بر اساس سه متغیر «وفاداری به برند»، «حساسیت به قیمت» و «میزان خرید سالانه» دستهبندی کنیم.
گام اول: استانداردسازی متغیرها در SPSS
- مسیر زیر را دنبال کنید:
Analyze > Descriptive Statistics > Descriptives - متغیرهای مورد نظر را به باکس Variable(s) منتقل کنید.
- تیک گزینه Save standardized values as variables را در پایین پنجره بزنید.
- روی OK کلیک کنید. متغیرهای جدیدی با پیشوند
Zدر فایل شما ساخته میشوند.
گام دوم: اجرای تحلیل سلسلهمراتبی برای تعیین تعداد خوشهها
- به مسیر
Analyze > Classify > Hierarchical Clusterبروید. - متغیرهای استاندارد شده (با پیشوند Z) را وارد باکس Variable(s) کنید.
- روی دکمه Plots کلیک کرده، تیک Dendrogram را بزنید و
Continueرا فشار دهید. - روی دکمه Method کلیک کنید:
- در بخش Cluster Method گزینه Ward’s method را انتخاب کنید (معتبرترین روش در پژوهشهای آکادمیک).
- در بخش Measure گزینه Squared Euclidean distance را انتخاب کنید.
- روی
Continueو سپس OK کلیک کنید.
گام سوم: اجرای تحلیل K-Means پس از تعیین تعداد خوشهها
- به مسیر
Analyze > Classify > K-Means Clusterبروید. - متغیرهای استاندارد شده را وارد کنید.
- در بخش Number of Clusters، عددی را که از تحلیل سلسلهمراتبی (مثلاً ۳) بهدست آوردهاید وارد کنید.
- روی دکمه Save کلیک کرده و تیک Cluster membership را بزنید تا شماره خوشه هر فرد در یک متغیر جدید ذخیره شود.
- روی OK کلیک کنید.
راهنمای تفسیر خروجیها و نمودار دندروگرام
پاسخ کوتاه: برای تعیین تعداد خوشهها در نمودار Dendrogram، بلندترین خطوط عمودی را که توسط خطوط افقی قطع نشدهاند پیدا کنید؛ با رسم یک خط افقی در آن فاصله، تعداد خطوط عمودی قطعشده نشاندهنده تعداد بهینه خوشهها است.
در خروجی روش K-Means، جدول Final Cluster Centers مهمترین بخش است. این جدول میانگین نمرات استاندارد هر متغیر را در هر خوشه نشان میدهد:
- نمرات مثبت بزرگ (مثلاً ۰.۸+): نشاندهنده بالا بودن آن ویژگی در خوشه مربوطه است.
- نمرات منفی (مثلاً ۰.۷-): نشاندهنده پایین بودن آن ویژگی نسبت به میانگین کل جامعه است.
همچنین جدول ANOVA در خروجی K-Means نشان میدهد که آیا متغیرهای استفادهشده توانستهاند تمایز معنیداری (Sig < 0.05) بین خوشهها ایجاد کنند یا خیر.
الگوی گزارش نتایج در فصل چهارم پایاننامه
برای نگارش این بخش در پایاننامه، میتوانید از متون و جدولهای استاندارد زیر الگوبرداری کنید:
نمونه متن برای فصل چهارم:
«به منظور دستهبندی پاسخدهندگان بر اساس متغیرهای پژوهش، ابتدا دادهها با استفاده از نمرهگذاری Z استانداردسازی شدند. سپس با استفاده از روش تحلیل خوشهای سلسلهمراتبی (الگوریتم Ward و معیار فاصله اقلیدسی مربعی) و بررسی نمودار درختواره (Dendrogram)، ساختار ۳ خوشهای به عنوان مناسبترین دستهبندی تشخیص داده شد. در گام بعد، جهت دستهبندی نهایی از روش K-Means استفاده گردید که نتایج آن در جدول زیر ارائه شده است.»
| متغیرها | خوشه ۱ (مشتریان وفادار) | خوشه ۲ (مشتریان حساس به قیمت) | خوشه ۳ (مشتریان کممصرف) | آماره F | سطح معنیداری (Sig) |
|---|---|---|---|---|---|
| وفاداری به برند | ۰.۸۵ | ۰.۱۲- | ۰.۷۳- | ۴۵.۲۱ | ۰.۰۰۱ |
| حساسیت به قیمت | ۰.۳۴- | ۰.۹۱+ | ۰.۱۵+ | ۶۲.۱۸ | ۰.۰۰۱ |
| حجم خرید سالانه | ۰.۷۸+ | ۰.۰۵+ | ۰.۸۲- | ۳۸.۹۴ | ۰.۰۰۱ |
اشتباهات رایج و راهحل سریع آنها
-
خطای ۱: فراموش کردن استانداردسازی دادهها
نتیجه: متغیری که اعداد بزرگتری دارد، تمام روند خوشهبندی را کنترل میکند.
راهحل سریع: قبل از تحلیل، از مسیر Descriptives تیک گزینه Save standardized values را بزنید و فقط از متغیرهای Z استفاده کنید. -
خطای ۲: حدس زدن غیرعلمی تعداد خوشهها در K-Means
نتیجه: ایجاد خوشههای ساختگی و غیرواقعی در دادهها.
راهحل سریع: ابتدا الگوریتم Hierarchical را اجرا کنید، بر اساس Dendrogram تعداد خوشهها را کشف کنید، سپس آن عدد را وارد K-Means کنید ترکیبی (Two-Step). -
خطای ۳: ورود متغیرهای کاملاً همخط (Multicollinear)
نتیجه: وزندهی مضاعف به یک مفهوم خاص و مخدوش شدن فاصلهها.
راهحل سریع: قبل از تحلیل خوشهای، ماتریس همبستگی را چک کنید و متغیرهای با همبستگی بالاتر از ۰.۸۵ را وارد تحلیل نکنید.
پرسشهای متداول (FAQ)
تفاوت اصلی تحلیل خوشهای با تحلیل عاملی (Factor Analysis) چیست؟
تحلیل عاملی «متغیرها» را بر اساس همبستگی خلاصه میکند، اما تحلیل خوشهای «مشاهدهها و افراد» را بر اساس تشابه در گروهها قرار میدهد.
چگونه مطمئن شویم تعداد خوشههای انتخابی درست است؟
با بررسی جهش ناگهانی در مقادیر Coefficients در جدول Agglomeration Schedule یا برش مناسب نمودار Dendrogram در جایی که بیشترین فاصله افقی وجود دارد.
اگر متغیرهای ما رتبهای (Likert) باشند، میتوان از روش K-Means استفاده کرد؟
اگر طیف لیکرت ۵ یا ۷ گزینهای باشد و به عنوان متغیر فاصلهای تلقی شود بله؛ اما در غیر این صورت بهتر است از روش TwoStep Clustering استفاده کنید.
حداقل حجم نمونه برای تحلیل خوشهای چقدر است؟
قاعده مطلقی وجود ندارد، اما توصیه میشود حداقل ۱۰ تا ۲ scale برای هر متغیر داشته باشید و تعداد نمونهها کمتر از ۵۰ نفر نباشد.
نیازمند مشاوره تخصصی در تحلیل آماری پایاننامه خود هستید؟
اگر در انتخاب مدل آماری، پیادهسازی در SPSS یا تفسیر خروجیهای فصل چهارم به مشکل خوردهاید، با کارشناسان ما تماس بگیرید.
سوالات متداول
تفاوت روش سلسلهمراتبی و K-Means در SPSS چیست؟
روش سلسلهمراتبی برای حجم نمونههای کوچک (کمتر از ۳۰۰) و زمانی که تعداد خوشهها مشخص نیست مناسب است. در مقابل، روش K-Means برای دادههای حجیم (بالای ۵۰۰) کاربرد دارد و نیازمند تعیین اولیه تعداد خوشههاست.
چرا پیش از تحلیل خوشهای باید دادهها را استانداردسازی (Z-Score) کرد؟
اگر متغیرها دارای مقیاسهای متفاوتی باشند، متغیر با مقیاس بزرگتر وزن بیشتری پیدا کرده و دستهبندی را مخدوش میکند. استانداردسازی باعث میشود تمام متغیرها وزن یکسانی در محاسبه فاصلهها داشته باشند.
بهترین روش برای تعیین تعداد بهینه خوشهها چیست؟
در روش سلسلهمراتبی با استفاده از نمودار درختواره (Dendrogram) یا بررسی جدول Agglomeration Schedule میتوان تعداد بهینه خوشهها را به شکل دقیق مشخص کرد.
روش Ward's Method در تحلیل خوشهای چیست؟
روشی در الگوریتم سلسلهمراتبی است که بر اساس حداقلسازی واریانس داخل خوشهها عمل میکند و معتبرترین و پرکاربردترین روش در پژوهشهای آکادمیک محسوب میشود.