پژوهشگران در یک مطالعه مقایسهای با بررسی عملکرد هشت الگوریتم خوشهبندی در پنج مجموعهداده پزشکی دریافتند که هیچ الگوریتم واحدی در تمام دادهها عملکرد برتر ندارد. نتایج این پژوهش همچنین نشان داد ارزیابی کیفیت خوشهها تنها با تکیه بر معیارهای درونی و پایداری نمیتواند میزان انطباق گروههای ایجادشده با طبقهبندیهای بالینی را مشخص کند و استفاده از اعتبارسنجی خارجی در کنار این معیارها ضروری است.
به گزارش پایگاه خبری حکمرانی هوشمند، با افزایش حجم، تنوع و پیچیدگی دادههای پزشکی، روشهای دادهکاوی و یادگیری ماشین به ابزارهایی مهم برای شناسایی الگوهای پنهان در این دادهها تبدیل شدهاند. خوشهبندی یکی از روشهای یادگیری بدون نظارت است که بدون نیاز به برچسبگذاری اولیه، تلاش میکند نمونههای مشابه را در گروههای مختلف قرار دهد و ساختارهای نهفته در مجموعهدادههای پیچیده را شناسایی کند.
این روش در حوزههای مختلف زیستپزشکی از جمله تحلیل بیان ژن، پردازش تصاویر پزشکی و دادهکاوی متون زیستپزشکی کاربرد دارد. با این حال، تنوع الگوریتمهای خوشهبندی و تفاوت ساختار و ویژگیهای مجموعهدادههای پزشکی باعث شده است انتخاب روش مناسب به یکی از چالشهای مهم در این حوزه تبدیل شود.
در این مطالعه که توسط پژوهشگران دانشگاه علوم پزشکی تهران و مؤسسات همکار انجام و نتایج آن در مجله Digital Health منتشر شده است، عملکرد الگوریتمهای مختلف خوشهبندی و معیارهای مورد استفاده برای سنجش کیفیت آنها در پنج مجموعهداده عمومی و ناشناس پزشکی بررسی شد.
این مجموعهدادهها شامل دادههای بیماران مبتلا به بیماری کبدی هند (ILPD)، سرطان پستان، دیابت سرخپوستان پیما، بیماری قلبی Statlog و سندرم تخمدان پلیکیستیک (PCOS) بود.
پژوهشگران پس از انجام مراحل پیشپردازش، از جمله مدیریت مقادیر گمشده، نرمالسازی دادهها و کدگذاری متغیرها، هشت الگوریتم خوشهبندی شامل خوشهبندی سلسلهمراتبی (HC)، k-means، FANNY، الگوریتم درخت خودسازمانده (SOTA)، تحلیل تقسیمکننده (DIANA)، الگوریتم PAM، روش CLARA و الگوریتم AGNES را روی این مجموعهدادهها اجرا کردند.
برای ارزیابی عملکرد الگوریتمها نیز سه دسته معیار مورد استفاده قرار گرفت. در بخش معیارهای درونی، شاخصهایی مانند اتصالپذیری (Connectivity)، عرض سیلوئت (Silhouette Width) و شاخص Dunn به کار گرفته شد. همچنین برای بررسی پایداری خوشههای ایجادشده، معیارهایی از جمله نسبت متوسط عدمهمپوشانی (APN)، فاصله متوسط (AD)، فاصله متوسط بین میانگینها (ADM) و شکل شایستگی (FOM) مورد بررسی قرار گرفت.
در مرحله اعتبارسنجی خارجی نیز دقت و شاخص Adjusted Rand یا ARI بهمنظور مقایسه نتایج خوشهبندی با برچسبهای موجود مورد استفاده قرار گرفت.
نتایج نشان داد الگوریتمهای خوشهبندی سلسلهمراتبی و AGNES در مجموعهدادههای مربوط به بیماری کبدی هند، دیابت پیما و Statlog، در معیارهای درونی و پایداری عملکرد مستمر و مناسبی داشتند. در مجموعهداده سرطان پستان، الگوریتم k-means عملکرد بهتری از خود نشان داد.
در دادههای مربوط به سندرم تخمدان پلیکیستیک نیز عملکرد روشهای HC، AGNES، k-means و DIANA به یکدیگر نزدیک بود و برتری مشخصی برای یک الگوریتم نسبت به سایر روشها مشاهده نشد.
با این حال، بررسی نتایج اعتبارسنجی خارجی تصویر متفاوتی را نشان داد. یافتههای پژوهشگران بیانگر آن بود که عملکرد مطلوب یک الگوریتم در معیارهای درونی و پایداری، الزاماً به معنای انطباق بیشتر خوشههای ایجادشده با طبقهبندیهای بالینی نیست.
به عبارت دیگر، ممکن است یک الگوریتم بتواند گروههایی منسجم و پایدار ایجاد کند، اما این گروهبندیها لزوماً بیشترین شباهت را به طبقهبندیهای بالینی شناختهشده نداشته باشند. همین موضوع نشان میدهد ارزیابی کیفیت خوشهها با یک دسته معیار واحد نمیتواند تصویر کاملی از عملکرد الگوریتم ارائه دهد.
پژوهشگران بر اساس این یافتهها تأکید کردند که نمیتوان یک الگوریتم خوشهبندی را بهعنوان بهترین روش برای تمام مجموعهدادههای پزشکی معرفی کرد. اگرچه الگوریتمهای سلسلهمراتبی در بخش قابل توجهی از دادههای مورد بررسی از نظر معیارهای درونی و پایداری عملکرد مناسبی داشتند، این معیارها بهتنهایی برای تعیین میزان تطابق خوشهها با واقعیتهای بالینی کافی نیستند.
بر اساس نتایج این مطالعه، ترکیب معیارهای درونی، شاخصهای پایداری و اعتبارسنجی خارجی میتواند ارزیابی جامعتری از کیفیت الگوریتمهای خوشهبندی در تحلیل دادههای پزشکی ارائه دهد. چنین رویکردی به پژوهشگران حوزه انفورماتیک سلامت کمک میکند روشهای مناسبتری را متناسب با ویژگیهای هر مجموعهداده انتخاب کرده و به نتایجی قابل اعتمادتر و بازتولیدپذیرتر دست یابند.
انتهای پیام
