حکمرانی هوشمند
اخبار و تازه‌ها, هوش‌مصنوعی و تکنولوژی

چالش‌های تشخیص نوشتار انسانی از ماشینی در عصر هوش مصنوعی 

پیشرفت چشمگیر ابزارهای تشخیص هوش مصنوعی در سال‌های اخیر، اگرچه دقت بالایی در تفکیک متون انسانی از ماشینی یافته‌اند، اما ورود هوش مصنوعی به فرایند ویرایش و بازنویسی، مرزها را چنان مبهم ساخته که حتی پیشرفته‌ترین ابزارها نیز گاهی با خطاهای قابل‌تأمل مواجه می‌شوند.

به گزارش پایگاه خبری حکمرانی هوشمند، شرکت‌هایی مانند پانگرام و جی‌پی‌تی زیرو ادعا می‌کنند که با دقت بیش از ۹۹ درصد می‌توانند متن‌های تولیدشده توسط انسان و ماشین را تشخیص دهند. این ابزارها به‌تدریج در دانشگاه‌ها، ناشران و کنفرانس‌های علمی برای بررسی مقالات و تکالیف دانشجویی مورد استفاده قرار می‌گیرند. دنیل اوانکو از انجمن آمریکایی تحقیقات سرطان می‌گوید: *«برخی پژوهشگران بدون اعلام استفاده از هوش مصنوعی از مدل‌های زبانی بزرگ کمک می‌گیرند»* و در یکی از موارد، داوری پس از شناسایی توسط پانگرام اعتراف کرد که به دلیل کمبود وقت از هوش مصنوعی استفاده کرده است.

طبق مطالعه‌ای، حدود یک مقاله از هر هشت مقاله زیست‌پزشکی در سال گذشته شامل متن تولیدشده توسط هوش مصنوعی بوده و کنفرانس NeurIPS نیز پس از غربالگری با پانگرام، ۱۸ درصد از ارسال‌های خود را رد کرده است. اما نسل‌های قدیمی‌تر این ابزارها که بر ویژگی‌های آماری تکیه داشتند، اغلب متن انسانی را به اشتباه هوش مصنوعی تشخیص می‌دادند و برخی دانشگاه‌ها استفاده از آنها را محدود کردند.

روش جدید پانگرام بر پایه یادگیری ماشین استوار است. سازندگان آن با جمع‌آوری میلیون‌ها متن انسانی و تولید نسخه‌های مشابه توسط مدل‌های زبانی، سیستم را برای تشخیص تفاوت‌ها آموزش دادند. مطالعات مستقل نیز عملکرد این ابزارها را تأیید کرده‌اند؛ به‌گونه‌ای که Epoch AI در آزمایشی روی ۴۹۵ متن انسانی هیچ مثبت کاذبی برای پانگرام پیدا نکرد و مقاله فنی پانگرام نرخ مثبت کاذب ۰.۰۰۴۱ درصد را گزارش کرده است.

با این حال، کاهش مثبت کاذب با افزایش منفی کاذب همراه است. پانگرام و جی‌پی‌تی زیرو تقریباً تمام متن‌های تولیدشده با دستورهای ساده را شناسایی می‌کنند، اما وقتی هوش مصنوعی از سبک نویسنده‌ای خاص تقلید می‌کند، حدود ۸ درصد متن‌ها ممکن است انسانی تشخیص داده شوند. همچنین ابزارهای انسانی‌ساز که متن ماشینی را بازنویسی می‌کنند، تشخیص را دشوارتر می‌سازند.

پانگرام ۴ که در ژوئیه عرضه شده، متن را به بخش‌های بسیار کوچک‌تر (۳۰ تا ۴۰ کلمه) تقسیم می‌کند و بهتر می‌تواند میان ویرایش سبک با هوش مصنوعی و استفاده سنگین از آن تفاوت بگذارد. با این حال، عملکرد آن در متن‌های کمتر از ۵۰ کلمه کاهش می‌یابد.

یکی از دشوارترین مسائل، تشخیص متن‌های ترکیبی انسان و هوش مصنوعی است. بسیاری از نویسندگان از هوش مصنوعی فقط برای اصلاح زبان، روان‌تر کردن جملات، ترجمه یا ویرایش استفاده می‌کنند. در آزمایشی، مقاله‌ای که ایده‌ و پیش‌نویس اولیه آن کاملاً انسانی بود اما با کمک هوش مصنوعی ویرایش شده بود، توسط پانگرام ۱۰۰ درصد هوش مصنوعی تشخیص داده شد و پس از انتشار پانگرام ۴ نیز امتیاز آن ۹۶ درصد باقی ماند؛ با این حال ویراستاران تأیید کردند که متن کاملاً توسط هوش مصنوعی نوشته نشده است.

پانگرام توضیح می‌دهد که امتیاز ۱۰۰ درصد به معنای تولید تمام کلمات توسط هوش مصنوعی نیست، بلکه بر اساس نسبت بخش‌هایی که احتمالاً هوش مصنوعی تشخیص داده شده‌اند، محاسبه می‌شود. در آزمایش‌های نیچر نیز برخی مقاله‌های تهیه‌شده با گزارش‌گری و مصاحبه انسانی، توسط پانگرام ۱۰۰ درصد هوش مصنوعی شناسایی شدند.

مشکل دیگر، نوسان امتیاز است؛ تغییرات کوچک در یک متن ترکیبی می‌تواند امتیاز را به میزان زیادی تغییر دهد. همچنین متن‌های دانشجویی انسانی که با هوش مصنوعی به‌طور اساسی تغییر داده شده بودند، در ۴۱ درصد موارد همچنان کاملاً انسانی تشخیص داده شدند.

نگرانی دیگر به نویسندگانی مربوط می‌شود که انگلیسی زبان اول آنها نیست. اوانکو می‌گوید: «گزارش‌های داوری که از زبان‌های دیگر به انگلیسی ترجمه شده‌اند، گاهی توسط ابزار به‌عنوان کاملاً تولیدشده توسط هوش مصنوعی شناسایی می‌شوند»؛ هرچند با پانگرام ۴، حدود یک‌پنجم این موارد امتیاز هوش مصنوعی پایین‌تری پیدا کرده‌اند.

در کنار ابزارهای پیشرفته، سرویس‌های ضعیف‌تری مانند تکست‌گارد وجود دارند که گاهی متون قدیمی و کاملاً انسانی را به اشتباه هوش مصنوعی تشخیص می‌دهند. نیچر در آزمایش‌های خود دریافت که پانگرام و جی‌پی‌تی زیرو متن‌های قدیمی را به‌درستی انسانی تشخیص می‌دهند، در حالی که تکست‌گارد در یک مورد پایان‌نامه سال ۲۰۱۴ را ۶۲ درصد هوش مصنوعی اعلام کرده بود.

با افزایش استفاده از هوش مصنوعی در پژوهش و نوشتن، ناشران بیشتری به سراغ این ابزارها می‌روند. با این حال، محدودیت اصلی این است که حتی اگر ابزارها دخالت هوش مصنوعی را شناسایی کنند، نمی‌توانند ثابت کنند که آیا آن استفاده از نظر اخلاقی قابل‌قبول بوده است یا خیر. کارشناسان تأکید می‌کنند که امتیاز آشکارساز نباید به‌عنوان نتیجه نهایی در نظر گرفته شود و باید صرفاً نقطه شروعی برای بررسی بیشتر باشد.

با گسترش آشکارسازها و احتمال استفاده از واترمارک در مدل‌هایی مانند کلود، نویسندگان ممکن است ناچار شوند نحوه استفاده خود از هوش مصنوعی را شفاف‌تر اعلام کنند. مسئله اصلی همچنان این است که چه نوع استفاده‌ای از هوش مصنوعی از نظر اخلاقی قابل‌قبول است.

انتهای پیام

 

 

مطالب مرتبط

عملکرد وزارت فرهنگ و ارشاد اسلامی در دولت چهاردهم؛ از مردمی‌سازی تا حکمرانی هوشمند

سردبیر
3 هفته قبل

 حکمرانی هوشمند و نظارت بر حقوق معلولان

سردبیر
4 ماه قبل

نقش مساجد، هیأت‌ها و حکمرانی هوشمند در بازآفرینی سرمایه اجتماعی

سردبیر
5 ماه قبل
خروج از نسخه موبایل