یک معیار جدید ارزیابی توانایی هوش مصنوعی در حل مسائل ریاضی نشان داده است که این سامانهها هنوز فاصله قابل توجهی با برترین ریاضیدانان انسانی دارند.
به گزارش پایگاه خبری حکمرانی هوشمند، این آزمون که با نام «First Proof» یا «اثبات اول» شناخته میشود، با هدف سنجش توانایی مدلهای هوش مصنوعی در حل مسائل تحقیقاتی و ناشناخته طراحی شده است. در این ارزیابی، ۱۰ مسئله ریاضی در سطح پژوهشی به چهار سیستم هوش مصنوعی ارائه شد و سپس گروهی از متخصصان انسانی پاسخها را بررسی کردند.
بر اساس گزارش، این آزمون سه ویژگی کلیدی داشت: استفاده از مسائل سطح تحقیق، عدم حضور سوالات در دادههای آموزشی و ارزیابی رسمی توسط ریاضیدانان متخصص. همین ویژگیها باعث شده است این آزمایش یکی از دقیقترین سنجشهای انجامشده در حوزه هوش مصنوعی محسوب شود.
در توضیح این پروژه آمده است که هدف آن بررسی توان واقعی مدلها در حل مسائل جدید بوده است؛ مسائلی که پیشتر در هیچ مقاله یا منبع اینترنتی منتشر نشدهاند. به همین منظور، ۱۰ محقق از حوزههای مختلف ریاضیات سوالاتی را ارائه کردند که قبلاً حل شده بودند اما هنوز منتشر نشده بودند.
در بخشی از گزارش، یکی از نکات مهم مربوط به نحوه طراحی آزمون است: یکی از نوآوریهای مهم آزمون فرست پروف این بود که سوالات قبلا در هیچ کجای مقالات منتشر شده یا در اینترنت ذکر نشده بودند و این خطر را که مدلها به سادگی اطلاعاتی را که در طول آموزش خود آموختهاند، تکرار کنند، از بین میبرد.
در نسخه جدید این آزمون، برخلاف مرحله آزمایشی، فرآیند بهصورت کاملاً کنترلشده و بدون دخالت انسانی در پاسخدهی اجرا شد. همچنین یک تیم ۳۰ نفره از ریاضیدانان وظیفه ارزیابی پاسخها را بر عهده داشتند.
در همین زمینه، یکی از پژوهشگران حوزه ریاضی اشاره کرده است: برگزارکنندگان به وضوح با دقت بیشتری به دسته دوم فکر کردهاند تا آن را کنترلشدهتر و سیستماتیکتر کنند.
نتایج نشان داد که مدلهای هوش مصنوعی در حل مسائل پیچیده هنوز با محدودیتهایی جدی مواجه هستند. بهترین عملکرد مربوط به تیمی از موسسه فناوری فدرال سوئیس بود که توانست ۶ مسئله از ۱۰ مسئله را حل کند. سایر تیمها از جمله مدلهای بدون مهار و نسخههای مختلف چتباتها عملکرد پایینتری داشتند.
این نتایج در حالی منتشر شده که در ماههای اخیر برخی مدلهای هوش مصنوعی توانسته بودند مسائل مشهور ریاضی را حل کنند؛ از جمله چالشهای قدیمی مطرحشده توسط ریاضیدانانی مانند پاول اردوش.
با وجود این پیشرفتها، پژوهشگران تأکید میکنند که مدلهای زبانی همچنان دچار خطاهای مفهومی و «توهم» در پاسخدهی هستند و در بسیاری از موارد حتی هنگام هشدار نیز پاسخهای نادرست تولید میکنند. همچنین ضعف در ارجاعدهی علمی یکی دیگر از مشکلات مهم این سیستمها عنوان شده است.
انتهای پیام
مطالب مرتبط
منتخب اخیر
گفتگو داغ
وبسایتهای رسمی
درباره اندیشکده حکمرانی هوشمند
اندیشکده حکمرانی هوشمند (Smart Governance Think Tank) یک مرکز پژوهشی پیشرو در ایران است که با تمرکز بر حکمرانی دادهمحور، سیاستپژوهی، و توسعه ابزارهای هوشمند نظیر اطلس تجارت ایران فعالیت میکند. این اندیشکده با همکاری نخبگان دانشگاهی و فعالان اقتصادی، مسیر تحول در نظام تصمیمسازی کشور را هموار میسازد.
درباره رئیس اندیشکده حکمرانی هوشمند
سید طه حسین مدنی، رئیس اندیشکده حکمرانی هوشمند، از پژوهشگران برجسته در حوزه حکمرانی دادهمحور، سیاستگذاری هوشمند و اقتصاد دیجیتال است. ایشان با مقالات متعدد و حضور فعال در رسانهها، نقش مهمی در ترویج گفتمان حکمرانی هوشمند در ایران دارند. صفحه رسمی ایشان شامل مجموعهای از مقالات، مصاحبهها و یادداشتهای منتشر شده در رسانههای معتبر است.
کلمات کلیدی مرتبط: اندیشکده، حکمرانی هوشمند، صفحه رسمی اندیشکده حکمرانی هوشمند، اطلس تجارت ایران، سید طه حسین مدنی، رئیس اندیشکده حکمرانی هوشمند، صفحه رئیس اندیشکده، طه مدنی، taha madani، حکمرانی دیجیتال، هوش مصنوعی در سیاستگذاری، تجارت هوشمند، دادههای باز، حکمرانی مشارکتی، اقتصاد دانشبنیان، تحول دیجیتال در حکمرانی، مقالات رئیس اندیشکده، مصاحبههای طه مدنی، published in media، یادداشتهای تخصصی حکمرانی.
- اندیشکده حکمرانی هوشمند
- صفحه رسمی اندیشکده
- حکمرانی دادهمحور
- اطلس تجارت ایران
- رئیس اندیشکده حکمرانی هوشمند
- سید طه حسین مدنی
- صفحه رسمی رئیس اندیشکده
- مقالات رئیس اندیشکده حکمرانی هوشمند
- taha madani
- published in media طه مدنی
- گزارشهای تخصصی حکمرانی
- نشستهای علمی اندیشکده
- همکاری با اندیشکده حکمرانی هوشمند
- مصاحبههای سید طه حسین مدنی