یک معیار جدید ارزیابی توانایی هوش مصنوعی در حل مسائل ریاضی نشان داده است که این سامانهها هنوز فاصله قابل توجهی با برترین ریاضیدانان انسانی دارند.
به گزارش پایگاه خبری حکمرانی هوشمند، این آزمون که با نام «First Proof» یا «اثبات اول» شناخته میشود، با هدف سنجش توانایی مدلهای هوش مصنوعی در حل مسائل تحقیقاتی و ناشناخته طراحی شده است. در این ارزیابی، ۱۰ مسئله ریاضی در سطح پژوهشی به چهار سیستم هوش مصنوعی ارائه شد و سپس گروهی از متخصصان انسانی پاسخها را بررسی کردند.
بر اساس گزارش، این آزمون سه ویژگی کلیدی داشت: استفاده از مسائل سطح تحقیق، عدم حضور سوالات در دادههای آموزشی و ارزیابی رسمی توسط ریاضیدانان متخصص. همین ویژگیها باعث شده است این آزمایش یکی از دقیقترین سنجشهای انجامشده در حوزه هوش مصنوعی محسوب شود.
در توضیح این پروژه آمده است که هدف آن بررسی توان واقعی مدلها در حل مسائل جدید بوده است؛ مسائلی که پیشتر در هیچ مقاله یا منبع اینترنتی منتشر نشدهاند. به همین منظور، ۱۰ محقق از حوزههای مختلف ریاضیات سوالاتی را ارائه کردند که قبلاً حل شده بودند اما هنوز منتشر نشده بودند.
در بخشی از گزارش، یکی از نکات مهم مربوط به نحوه طراحی آزمون است: یکی از نوآوریهای مهم آزمون فرست پروف این بود که سوالات قبلا در هیچ کجای مقالات منتشر شده یا در اینترنت ذکر نشده بودند و این خطر را که مدلها به سادگی اطلاعاتی را که در طول آموزش خود آموختهاند، تکرار کنند، از بین میبرد.
در نسخه جدید این آزمون، برخلاف مرحله آزمایشی، فرآیند بهصورت کاملاً کنترلشده و بدون دخالت انسانی در پاسخدهی اجرا شد. همچنین یک تیم ۳۰ نفره از ریاضیدانان وظیفه ارزیابی پاسخها را بر عهده داشتند.
در همین زمینه، یکی از پژوهشگران حوزه ریاضی اشاره کرده است: برگزارکنندگان به وضوح با دقت بیشتری به دسته دوم فکر کردهاند تا آن را کنترلشدهتر و سیستماتیکتر کنند.
نتایج نشان داد که مدلهای هوش مصنوعی در حل مسائل پیچیده هنوز با محدودیتهایی جدی مواجه هستند. بهترین عملکرد مربوط به تیمی از موسسه فناوری فدرال سوئیس بود که توانست ۶ مسئله از ۱۰ مسئله را حل کند. سایر تیمها از جمله مدلهای بدون مهار و نسخههای مختلف چتباتها عملکرد پایینتری داشتند.
این نتایج در حالی منتشر شده که در ماههای اخیر برخی مدلهای هوش مصنوعی توانسته بودند مسائل مشهور ریاضی را حل کنند؛ از جمله چالشهای قدیمی مطرحشده توسط ریاضیدانانی مانند پاول اردوش.
با وجود این پیشرفتها، پژوهشگران تأکید میکنند که مدلهای زبانی همچنان دچار خطاهای مفهومی و «توهم» در پاسخدهی هستند و در بسیاری از موارد حتی هنگام هشدار نیز پاسخهای نادرست تولید میکنند. همچنین ضعف در ارجاعدهی علمی یکی دیگر از مشکلات مهم این سیستمها عنوان شده است.
انتهای پیام
