استفاده از دادههای اختصاصی شرکتهای داروسازی میتواند عملکرد مدلهای هوش مصنوعی در پیشبینی ساختار پروتئینها را به شکل محسوسی افزایش دهد؛ یافتهای که میتواند مسیر توسعه ابزارهای مبتنی بر هوش مصنوعی برای کشف دارو را تحت تأثیر قرار دهد.
به گزارش پایگاه خبری حکمرانی هوشمند، به نقل از نیچر، گروهی از شرکتهای داروسازی در یک پروژه مشترک، مدلی مبتنی بر OpenFold ۳ را با بیش از ۲۰ هزار ساختار پروتئینی اختصاصی آموزش دادهاند. نتایج این بررسی نشان میدهد استفاده از این دادهها میتواند دقت مدل را در مقایسه با سامانههایی که صرفاً به اطلاعات عمومی دسترسی دارند، افزایش دهد.
مدلهایی مانند AlphaFold در سالهای اخیر تحول قابل توجهی در پیشبینی ساختار پروتئین ایجاد کردهاند، اما محدودیت دادههای موجود در منابع عمومی همچنان یکی از چالشهای اصلی برای توسعه این فناوری، بهویژه در حوزه کشف دارو، محسوب میشود.
دلیل اهمیت این موضوع آن است که مدلهای هوش مصنوعی برای پیشبینی نحوه تعامل پروتئینها با داروها به نمونههای متنوعی نیاز دارند. هرچه دادههای آموزشی بتوانند طیف بیشتری از این تعاملات را پوشش دهند، امکان آموزش مدلهایی با قابلیت پیشبینی گستردهتر نیز افزایش پیدا میکند.
گنجینهای از دادههای اختصاصی شرکتهای دارویی
بخش قابل توجهی از اطلاعات مربوط به ساختار پروتئینها در جریان پروژههای تحقیق و توسعه شرکتهای داروسازی تولید میشود. این اطلاعات با استفاده از روشهایی مانند بلورنگاری پرتو ایکس و میکروسکوپی الکترونی کرایوژنیک یا cryo-EM به دست میآیند.
با وجود ارزش علمی این دادهها، بسیاری از آنها به دلیل ارتباط با پروژههای اختصاصی توسعه دارو، هیچگاه وارد پایگاههای داده عمومی نشدهاند. همین مسئله باعث شده مخازن اطلاعاتی شرکتهای داروسازی به عنوان منبعی ارزشمند اما کمتر استفادهشده برای توسعه مدلهای هوش مصنوعی مطرح شوند.
پایگاه داده پروتئین یا PDB در حال حاضر یکی از مهمترین منابع عمومی در این زمینه محسوب میشود و بیش از ۲۰۰ هزار ساختار پروتئینی تعیینشده به روش تجربی را در خود جای داده است. همین مجموعه داده نقش مهمی در آموزش AlphaFold ۲ داشت؛ مدلی که توانست پیشبینی ساختار پروتئینها را با دقت قابل توجهی انجام دهد و دستاوردهای آن در نهایت با جایزه نوبل شیمی ۲۰۲۴ مورد تقدیر قرار گرفت.
با این حال، نسخههای جدیدتر مدلهای هوش مصنوعی از جمله AlphaFold ۳ علاوه بر ساختار پروتئین، توانایی پیشبینی نحوه تعامل آن با مولکولهای دیگر از جمله گزینههای دارویی را نیز دارند. این در حالی است که دادههای عمومی موجود درباره ساختار پروتئینها در تعامل با مولکولهای شبیه دارو، همچنان محدود است.
پل مورتنسون، معاون شیمی محاسباتی و انفورماتیک در شرکت داروسازی Astex Pharmaceuticals، تعداد چنین نمونههایی را احتمالاً حدود ۱۰ هزار مورد اعلام کرده است.
آموزش مدل با بیش از ۲۰ هزار ساختار اختصاصی
برای بررسی تأثیر دادههای خصوصی بر عملکرد مدلهای هوش مصنوعی، شرکت AbbVie، شرکت Astex و چند شرکت دارویی دیگر شبکهای با عنوان «شبکه زیستشناسی ساختاری هوش مصنوعی» ایجاد کردند.
پژوهشگران در این طرح، AlphaFold ۳ را با استفاده از ۲۰ هزار و ۱۶۷ ساختار اضافی که مربوط به پروتئینهای متصل به داروهای احتمالی بودند، ریزتنظیم کردند. این اطلاعات از پنج شرکت دارویی به دست آمد و به گونهای در اختیار مدل قرار گرفت که دادههای اختصاصی هر شرکت همچنان محرمانه باقی بماند.
نتایج این آزمایش نشان داد افزودن دادههای اختصاصی توانسته عملکرد مدل را در پیشبینی ساختارها بهبود دهد. در مقابل، نسخه عمومی OpenFold ۳ که به این حجم از دادههای اختصاصی دسترسی نداشت، تنها برای حدود یکسوم این ساختارها به سطح مشابهی از عملکرد رسید. مدل متنباز رقیب، یعنی Boltz-۲، نیز عملکردی در حدود ۴۰ درصد داشت.
محمد القریشی، زیستشناس محاسباتی دانشگاه کلمبیا و یکی از مشارکتکنندگان این پروژه، درباره تأثیر دادههای اضافی میگوید: «وقتی همه این دادهها را اضافه میکنید، عملکرد مدل به شکل قابلتوجهی بهتر میشود.»
او در عین حال معتقد است نتایج این پروژه ضرورت ایجاد مجموعههای داده مشابه اما عمومی را افزایش میدهد؛ مجموعههایی که بتوانند دسترسی پژوهشگران به اطلاعات مورد نیاز برای تقویت مدلهای پیشبینی ساختار پروتئین را افزایش دهند.
داده بیشتر، اما نه تنها راهحل
با وجود نتایج مثبت این آزمایش، پژوهشگران تأکید دارند که افزایش حجم داده همیشه به معنای حل تمام مشکلات مدلهای هوش مصنوعی نیست. در اهداف بسیار دشوار، دادههای اضافی ممکن است تأثیر محدودی داشته باشند.
القریشی استفاده مجدد از ساختارهای پروتئینی خصوصی شرکتهای دارویی را که در بسیاری از موارد حاصل پروژههای قدیمی کشف دارو هستند، یک راهکار موقتی میداند.
به گفته او، «جهشهای بزرگتر در عملکرد مدلهای هوش مصنوعی از طریق تولید دادههای آزمایشگاهی کاملاً جدید حاصل خواهد شد.»
هدف نهایی این پژوهشها، ساخت مدلهایی است که تنها به پیشبینی تعاملات مشابه نمونههای موجود در دادههای آموزشی محدود نباشند، بلکه بتوانند نحوه تعامل داروها با پروتئینهایی کاملاً متفاوت از نمونههای قبلی را نیز پیشبینی کنند.
بر این اساس، دادههای اختصاصی شرکتهای دارویی میتوانند شکاف موجود در منابع عمومی را تا حدی جبران کنند، اما برای رسیدن به مدلهای هوش مصنوعی قابل تعمیمتر، تولید دادههای آزمایشگاهی جدید و متنوع نیز همچنان اهمیت اساسی خواهد داشت.
انتهای پیام
مطالب مرتبط
منتخب اخیر
گفتگو داغ
وبسایتهای رسمی
درباره اندیشکده حکمرانی هوشمند
اندیشکده حکمرانی هوشمند (Smart Governance Think Tank) یک مرکز پژوهشی پیشرو در ایران است که با تمرکز بر حکمرانی دادهمحور، سیاستپژوهی، و توسعه ابزارهای هوشمند نظیر اطلس تجارت ایران فعالیت میکند. این اندیشکده با همکاری نخبگان دانشگاهی و فعالان اقتصادی، مسیر تحول در نظام تصمیمسازی کشور را هموار میسازد.
درباره رئیس اندیشکده حکمرانی هوشمند
سید طه حسین مدنی، رئیس اندیشکده حکمرانی هوشمند، از پژوهشگران برجسته در حوزه حکمرانی دادهمحور، سیاستگذاری هوشمند و اقتصاد دیجیتال است. ایشان با مقالات متعدد و حضور فعال در رسانهها، نقش مهمی در ترویج گفتمان حکمرانی هوشمند در ایران دارند. صفحه رسمی ایشان شامل مجموعهای از مقالات، مصاحبهها و یادداشتهای منتشر شده در رسانههای معتبر است.
کلمات کلیدی مرتبط: اندیشکده، حکمرانی هوشمند، صفحه رسمی اندیشکده حکمرانی هوشمند، اطلس تجارت ایران، سید طه حسین مدنی، رئیس اندیشکده حکمرانی هوشمند، صفحه رئیس اندیشکده، طه مدنی، taha madani، حکمرانی دیجیتال، هوش مصنوعی در سیاستگذاری، تجارت هوشمند، دادههای باز، حکمرانی مشارکتی، اقتصاد دانشبنیان، تحول دیجیتال در حکمرانی، مقالات رئیس اندیشکده، مصاحبههای طه مدنی، published in media، یادداشتهای تخصصی حکمرانی.
- اندیشکده حکمرانی هوشمند
- صفحه رسمی اندیشکده
- حکمرانی دادهمحور
- اطلس تجارت ایران
- رئیس اندیشکده حکمرانی هوشمند
- سید طه حسین مدنی
- صفحه رسمی رئیس اندیشکده
- مقالات رئیس اندیشکده حکمرانی هوشمند
- taha madani
- published in media طه مدنی
- گزارشهای تخصصی حکمرانی
- نشستهای علمی اندیشکده
- همکاری با اندیشکده حکمرانی هوشمند
- مصاحبههای سید طه حسین مدنی