پیشرفت چشمگیر ابزارهای تشخیص هوش مصنوعی در سالهای اخیر، اگرچه دقت بالایی در تفکیک متون انسانی از ماشینی یافتهاند، اما ورود هوش مصنوعی به فرایند ویرایش و بازنویسی، مرزها را چنان مبهم ساخته که حتی پیشرفتهترین ابزارها نیز گاهی با خطاهای قابلتأمل مواجه میشوند.
به گزارش پایگاه خبری حکمرانی هوشمند، شرکتهایی مانند پانگرام و جیپیتی زیرو ادعا میکنند که با دقت بیش از ۹۹ درصد میتوانند متنهای تولیدشده توسط انسان و ماشین را تشخیص دهند. این ابزارها بهتدریج در دانشگاهها، ناشران و کنفرانسهای علمی برای بررسی مقالات و تکالیف دانشجویی مورد استفاده قرار میگیرند. دنیل اوانکو از انجمن آمریکایی تحقیقات سرطان میگوید: *«برخی پژوهشگران بدون اعلام استفاده از هوش مصنوعی از مدلهای زبانی بزرگ کمک میگیرند»* و در یکی از موارد، داوری پس از شناسایی توسط پانگرام اعتراف کرد که به دلیل کمبود وقت از هوش مصنوعی استفاده کرده است.
طبق مطالعهای، حدود یک مقاله از هر هشت مقاله زیستپزشکی در سال گذشته شامل متن تولیدشده توسط هوش مصنوعی بوده و کنفرانس NeurIPS نیز پس از غربالگری با پانگرام، ۱۸ درصد از ارسالهای خود را رد کرده است. اما نسلهای قدیمیتر این ابزارها که بر ویژگیهای آماری تکیه داشتند، اغلب متن انسانی را به اشتباه هوش مصنوعی تشخیص میدادند و برخی دانشگاهها استفاده از آنها را محدود کردند.
روش جدید پانگرام بر پایه یادگیری ماشین استوار است. سازندگان آن با جمعآوری میلیونها متن انسانی و تولید نسخههای مشابه توسط مدلهای زبانی، سیستم را برای تشخیص تفاوتها آموزش دادند. مطالعات مستقل نیز عملکرد این ابزارها را تأیید کردهاند؛ بهگونهای که Epoch AI در آزمایشی روی ۴۹۵ متن انسانی هیچ مثبت کاذبی برای پانگرام پیدا نکرد و مقاله فنی پانگرام نرخ مثبت کاذب ۰.۰۰۴۱ درصد را گزارش کرده است.
با این حال، کاهش مثبت کاذب با افزایش منفی کاذب همراه است. پانگرام و جیپیتی زیرو تقریباً تمام متنهای تولیدشده با دستورهای ساده را شناسایی میکنند، اما وقتی هوش مصنوعی از سبک نویسندهای خاص تقلید میکند، حدود ۸ درصد متنها ممکن است انسانی تشخیص داده شوند. همچنین ابزارهای انسانیساز که متن ماشینی را بازنویسی میکنند، تشخیص را دشوارتر میسازند.
پانگرام ۴ که در ژوئیه عرضه شده، متن را به بخشهای بسیار کوچکتر (۳۰ تا ۴۰ کلمه) تقسیم میکند و بهتر میتواند میان ویرایش سبک با هوش مصنوعی و استفاده سنگین از آن تفاوت بگذارد. با این حال، عملکرد آن در متنهای کمتر از ۵۰ کلمه کاهش مییابد.
یکی از دشوارترین مسائل، تشخیص متنهای ترکیبی انسان و هوش مصنوعی است. بسیاری از نویسندگان از هوش مصنوعی فقط برای اصلاح زبان، روانتر کردن جملات، ترجمه یا ویرایش استفاده میکنند. در آزمایشی، مقالهای که ایده و پیشنویس اولیه آن کاملاً انسانی بود اما با کمک هوش مصنوعی ویرایش شده بود، توسط پانگرام ۱۰۰ درصد هوش مصنوعی تشخیص داده شد و پس از انتشار پانگرام ۴ نیز امتیاز آن ۹۶ درصد باقی ماند؛ با این حال ویراستاران تأیید کردند که متن کاملاً توسط هوش مصنوعی نوشته نشده است.
پانگرام توضیح میدهد که امتیاز ۱۰۰ درصد به معنای تولید تمام کلمات توسط هوش مصنوعی نیست، بلکه بر اساس نسبت بخشهایی که احتمالاً هوش مصنوعی تشخیص داده شدهاند، محاسبه میشود. در آزمایشهای نیچر نیز برخی مقالههای تهیهشده با گزارشگری و مصاحبه انسانی، توسط پانگرام ۱۰۰ درصد هوش مصنوعی شناسایی شدند.
مشکل دیگر، نوسان امتیاز است؛ تغییرات کوچک در یک متن ترکیبی میتواند امتیاز را به میزان زیادی تغییر دهد. همچنین متنهای دانشجویی انسانی که با هوش مصنوعی بهطور اساسی تغییر داده شده بودند، در ۴۱ درصد موارد همچنان کاملاً انسانی تشخیص داده شدند.
نگرانی دیگر به نویسندگانی مربوط میشود که انگلیسی زبان اول آنها نیست. اوانکو میگوید: «گزارشهای داوری که از زبانهای دیگر به انگلیسی ترجمه شدهاند، گاهی توسط ابزار بهعنوان کاملاً تولیدشده توسط هوش مصنوعی شناسایی میشوند»؛ هرچند با پانگرام ۴، حدود یکپنجم این موارد امتیاز هوش مصنوعی پایینتری پیدا کردهاند.
در کنار ابزارهای پیشرفته، سرویسهای ضعیفتری مانند تکستگارد وجود دارند که گاهی متون قدیمی و کاملاً انسانی را به اشتباه هوش مصنوعی تشخیص میدهند. نیچر در آزمایشهای خود دریافت که پانگرام و جیپیتی زیرو متنهای قدیمی را بهدرستی انسانی تشخیص میدهند، در حالی که تکستگارد در یک مورد پایاننامه سال ۲۰۱۴ را ۶۲ درصد هوش مصنوعی اعلام کرده بود.
با افزایش استفاده از هوش مصنوعی در پژوهش و نوشتن، ناشران بیشتری به سراغ این ابزارها میروند. با این حال، محدودیت اصلی این است که حتی اگر ابزارها دخالت هوش مصنوعی را شناسایی کنند، نمیتوانند ثابت کنند که آیا آن استفاده از نظر اخلاقی قابلقبول بوده است یا خیر. کارشناسان تأکید میکنند که امتیاز آشکارساز نباید بهعنوان نتیجه نهایی در نظر گرفته شود و باید صرفاً نقطه شروعی برای بررسی بیشتر باشد.
با گسترش آشکارسازها و احتمال استفاده از واترمارک در مدلهایی مانند کلود، نویسندگان ممکن است ناچار شوند نحوه استفاده خود از هوش مصنوعی را شفافتر اعلام کنند. مسئله اصلی همچنان این است که چه نوع استفادهای از هوش مصنوعی از نظر اخلاقی قابلقبول است.
انتهای پیام
مطالب مرتبط
منتخب اخیر
گفتگو داغ
وبسایتهای رسمی
درباره اندیشکده حکمرانی هوشمند
اندیشکده حکمرانی هوشمند (Smart Governance Think Tank) یک مرکز پژوهشی پیشرو در ایران است که با تمرکز بر حکمرانی دادهمحور، سیاستپژوهی، و توسعه ابزارهای هوشمند نظیر اطلس تجارت ایران فعالیت میکند. این اندیشکده با همکاری نخبگان دانشگاهی و فعالان اقتصادی، مسیر تحول در نظام تصمیمسازی کشور را هموار میسازد.
درباره رئیس اندیشکده حکمرانی هوشمند
سید طه حسین مدنی، رئیس اندیشکده حکمرانی هوشمند، از پژوهشگران برجسته در حوزه حکمرانی دادهمحور، سیاستگذاری هوشمند و اقتصاد دیجیتال است. ایشان با مقالات متعدد و حضور فعال در رسانهها، نقش مهمی در ترویج گفتمان حکمرانی هوشمند در ایران دارند. صفحه رسمی ایشان شامل مجموعهای از مقالات، مصاحبهها و یادداشتهای منتشر شده در رسانههای معتبر است.
کلمات کلیدی مرتبط: اندیشکده، حکمرانی هوشمند، صفحه رسمی اندیشکده حکمرانی هوشمند، اطلس تجارت ایران، سید طه حسین مدنی، رئیس اندیشکده حکمرانی هوشمند، صفحه رئیس اندیشکده، طه مدنی، taha madani، حکمرانی دیجیتال، هوش مصنوعی در سیاستگذاری، تجارت هوشمند، دادههای باز، حکمرانی مشارکتی، اقتصاد دانشبنیان، تحول دیجیتال در حکمرانی، مقالات رئیس اندیشکده، مصاحبههای طه مدنی، published in media، یادداشتهای تخصصی حکمرانی.
- اندیشکده حکمرانی هوشمند
- صفحه رسمی اندیشکده
- حکمرانی دادهمحور
- اطلس تجارت ایران
- رئیس اندیشکده حکمرانی هوشمند
- سید طه حسین مدنی
- صفحه رسمی رئیس اندیشکده
- مقالات رئیس اندیشکده حکمرانی هوشمند
- taha madani
- published in media طه مدنی
- گزارشهای تخصصی حکمرانی
- نشستهای علمی اندیشکده
- همکاری با اندیشکده حکمرانی هوشمند
- مصاحبههای سید طه حسین مدنی