پژوهشگران در یک مطالعه مقایسه‌ای با بررسی عملکرد هشت الگوریتم خوشه‌بندی در پنج مجموعه‌داده پزشکی دریافتند که هیچ الگوریتم واحدی در تمام داده‌ها عملکرد برتر ندارد. نتایج این پژوهش همچنین نشان داد ارزیابی کیفیت خوشه‌ها تنها با تکیه بر معیارهای درونی و پایداری نمی‌تواند میزان انطباق گروه‌های ایجادشده با طبقه‌بندی‌های بالینی را مشخص کند و استفاده از اعتبارسنجی خارجی در کنار این معیارها ضروری است.

به گزارش پایگاه خبری حکمرانی هوشمند، با افزایش حجم، تنوع و پیچیدگی داده‌های پزشکی، روش‌های داده‌کاوی و یادگیری ماشین به ابزارهایی مهم برای شناسایی الگوهای پنهان در این داده‌ها تبدیل شده‌اند. خوشه‌بندی یکی از روش‌های یادگیری بدون نظارت است که بدون نیاز به برچسب‌گذاری اولیه، تلاش می‌کند نمونه‌های مشابه را در گروه‌های مختلف قرار دهد و ساختارهای نهفته در مجموعه‌داده‌های پیچیده را شناسایی کند.

این روش در حوزه‌های مختلف زیست‌پزشکی از جمله تحلیل بیان ژن، پردازش تصاویر پزشکی و داده‌کاوی متون زیست‌پزشکی کاربرد دارد. با این حال، تنوع الگوریتم‌های خوشه‌بندی و تفاوت ساختار و ویژگی‌های مجموعه‌داده‌های پزشکی باعث شده است انتخاب روش مناسب به یکی از چالش‌های مهم در این حوزه تبدیل شود.

در این مطالعه که توسط پژوهشگران دانشگاه علوم پزشکی تهران و مؤسسات همکار انجام و نتایج آن در مجله Digital Health منتشر شده است، عملکرد الگوریتم‌های مختلف خوشه‌بندی و معیارهای مورد استفاده برای سنجش کیفیت آنها در پنج مجموعه‌داده عمومی و ناشناس پزشکی بررسی شد.

این مجموعه‌داده‌ها شامل داده‌های بیماران مبتلا به بیماری کبدی هند (ILPD)، سرطان پستان، دیابت سرخپوستان پیما، بیماری قلبی Statlog و سندرم تخمدان پلی‌کیستیک (PCOS) بود.

پژوهشگران پس از انجام مراحل پیش‌پردازش، از جمله مدیریت مقادیر گمشده، نرمال‌سازی داده‌ها و کدگذاری متغیرها، هشت الگوریتم خوشه‌بندی شامل خوشه‌بندی سلسله‌مراتبی (HC)، k-means، FANNY، الگوریتم درخت خودسازمان‌ده (SOTA)، تحلیل تقسیم‌کننده (DIANA)، الگوریتم PAM، روش CLARA و الگوریتم AGNES را روی این مجموعه‌داده‌ها اجرا کردند.

برای ارزیابی عملکرد الگوریتم‌ها نیز سه دسته معیار مورد استفاده قرار گرفت. در بخش معیارهای درونی، شاخص‌هایی مانند اتصال‌پذیری (Connectivity)، عرض سیلوئت (Silhouette Width) و شاخص Dunn به کار گرفته شد. همچنین برای بررسی پایداری خوشه‌های ایجادشده، معیارهایی از جمله نسبت متوسط عدم‌همپوشانی (APN)، فاصله متوسط (AD)، فاصله متوسط بین میانگین‌ها (ADM) و شکل شایستگی (FOM) مورد بررسی قرار گرفت.

در مرحله اعتبارسنجی خارجی نیز دقت و شاخص Adjusted Rand یا ARI به‌منظور مقایسه نتایج خوشه‌بندی با برچسب‌های موجود مورد استفاده قرار گرفت.

نتایج نشان داد الگوریتم‌های خوشه‌بندی سلسله‌مراتبی و AGNES در مجموعه‌داده‌های مربوط به بیماری کبدی هند، دیابت پیما و Statlog، در معیارهای درونی و پایداری عملکرد مستمر و مناسبی داشتند. در مجموعه‌داده سرطان پستان، الگوریتم k-means عملکرد بهتری از خود نشان داد.

در داده‌های مربوط به سندرم تخمدان پلی‌کیستیک نیز عملکرد روش‌های HC، AGNES، k-means و DIANA به یکدیگر نزدیک بود و برتری مشخصی برای یک الگوریتم نسبت به سایر روش‌ها مشاهده نشد.

با این حال، بررسی نتایج اعتبارسنجی خارجی تصویر متفاوتی را نشان داد. یافته‌های پژوهشگران بیانگر آن بود که عملکرد مطلوب یک الگوریتم در معیارهای درونی و پایداری، الزاماً به معنای انطباق بیشتر خوشه‌های ایجادشده با طبقه‌بندی‌های بالینی نیست.

به عبارت دیگر، ممکن است یک الگوریتم بتواند گروه‌هایی منسجم و پایدار ایجاد کند، اما این گروه‌بندی‌ها لزوماً بیشترین شباهت را به طبقه‌بندی‌های بالینی شناخته‌شده نداشته باشند. همین موضوع نشان می‌دهد ارزیابی کیفیت خوشه‌ها با یک دسته معیار واحد نمی‌تواند تصویر کاملی از عملکرد الگوریتم ارائه دهد.

پژوهشگران بر اساس این یافته‌ها تأکید کردند که نمی‌توان یک الگوریتم خوشه‌بندی را به‌عنوان بهترین روش برای تمام مجموعه‌داده‌های پزشکی معرفی کرد. اگرچه الگوریتم‌های سلسله‌مراتبی در بخش قابل توجهی از داده‌های مورد بررسی از نظر معیارهای درونی و پایداری عملکرد مناسبی داشتند، این معیارها به‌تنهایی برای تعیین میزان تطابق خوشه‌ها با واقعیت‌های بالینی کافی نیستند.

بر اساس نتایج این مطالعه، ترکیب معیارهای درونی، شاخص‌های پایداری و اعتبارسنجی خارجی می‌تواند ارزیابی جامع‌تری از کیفیت الگوریتم‌های خوشه‌بندی در تحلیل داده‌های پزشکی ارائه دهد. چنین رویکردی به پژوهشگران حوزه انفورماتیک سلامت کمک می‌کند روش‌های مناسب‌تری را متناسب با ویژگی‌های هر مجموعه‌داده انتخاب کرده و به نتایجی قابل اعتمادتر و بازتولیدپذیرتر دست یابند.

انتهای پیام