رقابت میان مدلهای هوش مصنوعی در سال ۲۰۲۶ به نقطهای رسیده که پرسش قدیمی «بهترین مدل کدام است؟» تا حد زیادی بیمعنا شده است. دادههای تازه منتشرشده از وبگاه «Arena.ai» تصویری چندقطبی از این میدان رقابت ارائه میدهد؛ جایی که هر شرکت در حوزهای خاص میدرخشد و دیگر هیچکس بهتنهایی بر تمامی عرصهها تسلط ندارد.
به گزارش پایگاه خبری حکمرانی هوشمند، بر اساس این دادهها، آنتروپیک در حوزههای متن، کدنویسی و عاملهای هوشمند موقعیتی بینظیر دارد. اوپنایآی در تولید و ویرایش تصویر فاصله قابلتوجهی با رقبا ایجاد کرده است. گوگل حوزه تولید ویدئو را در اختیار گرفته و بازیگران چینی نظیر مونشات، علیبابا، Z.ai، بایتدنس و مینیمکس نیز در بخشهایی از مرز عملکرد، مستقیماً با آزمایشگاههای آمریکایی رقابت میکنند.
آنچه به «Arena.ai» اعتبار ویژهای بخشیده، روش منحصربهفرد ارزیابی آن است. رتبهبندیهای اصلی این پلتفرم بر پایه مقایسههای دوبهدوی پاسخ مدلها و ترجیح کاربران واقعی شکل گرفته و امتیازها با مدل آماری بردلی-تری محاسبه میشوند. این وبگاه علاوه بر رتبه خام، «بازه رتبه» را نیز منتشر میکند تا عدمقطعیت آماری برای کاربران شفاف باشد. همچنین در سال ۲۰۲۶، شاخص «واقعگرایی (factuality)» به بخشهای «متن» و «جستوجو» اضافه شده است که صحت پاسخها را در کنار ترجیح انسانی اندازهگیری میکند.
در مهمترین جدول عمومی یعنی «Text Arena» که بر اساس بیش از ۷.۹ میلیون رأی و ۳۹۴ مدل تدوین شده، دادههای ۲۱ اوت ۲۰۲۶ نشاندهنده موقعیت بسیار قدرتمند آنتروپیک است. «Claude Fable ۵» با امتیاز ۱۵۰۸ در صدر ایستاده و «Claude Opus ۴.۶ High» و «Claude Opus ۴.۷ High» بهترتیب با امتیازهای ۱۵۰۴ و ۱۵۰۲ جایگاههای دوم و سوم را در اختیار دارند. در رتبه چهارم، «Muse Spark ۱.۲ xHigh» از متا با امتیاز ۱۴۹۸ قرار گرفته است. نکته قابلتوجه، تراکم خانواده «Claude» در صدر جدول است؛ بهگونهای که چهار مدل آنتروپیک در میان شش رتبه نخست حضور دارند.
این آرایش نشان میدهد که برتری آنتروپیک دیگر به موفقیت یک مدل منفرد محدود نیست و به یک «خانواده توانمندی» تبدیل شده است. این الگو در زبان انگلیسی نیز تکرار میشود و «Claude Fable ۵» با امتیاز ۱۵۱۵ صدرنشین است. در مقابل، بهترین مدل اوپنایآی یعنی «GPT-۵.۶ Sol xHigh» با امتیاز ۱۴۸۲ در رتبه ۱۸ جدول کلی متن قرار گرفته است.
برتری آنتروپیک در حوزه کدنویسی حتی آشکارتر از بخش متن است. در زیرشاخه «Coding»، سه مدل «Claude Opus ۴.۶ High»، «Claude Opus ۴.۷ High» و «Claude Fable ۵» هر سه با امتیاز ۱۵۵۲ رتبههای نخست تا سوم را از آن خود کردهاند. در این بخش، مدل «Kimi K۳ Max» از شرکت مونشات چین با امتیاز ۱۵۴۴ در میان مدعیان اصلی حضور دارد.
در بخش «Code Arena WebDev» نیز تصویر مشابه است، هرچند قدرت بازیگران آسیایی در این بخش پررنگتر میشود. بر اساس دادههای ۲۱ اوت و بیش از ۶۰۳ هزار رأی، «Claude Opus ۵ Max» با امتیاز ۱۶۹۱ در جایگاه نخست، «Kimi K۳ Max» با ۱۶۷۴ در رتبه دوم و «Qwen ۳.۸ Max» از علیبابا با ۱۶۶۹ در رتبه سوم قرار دارند. همچنین «GPT-۵.۶ Sol xHigh» با سازوکار کدنویسی اختصاصی خود، رتبه هفتم و امتیاز ۱۶۱۹ را کسب کرده است.
این بخش یکی از مهمترین نشانههای تغییر ساختار صنعت محسوب میشود. به نظر میرسد مونشات و علیبابا دیگر مدلهای «کمهزینه جایگزین» نیستند و در برخی وظایف توسعه نرمافزار، مستقیماً در مرز عملکرد قرار گرفتهاند. در طراحی مبتنی بر مرجع نیز «Kimi K۳ Max» با امتیاز ۱۷۲۱ حتی از «Claude Opus ۵ Max» پیشی گرفته است.
در بخش «Vision Arena» که توانایی مدلها در تحلیل و استدلال روی ورودیهای بصری را میسنجد، مدل «Claude Fable ۵» با امتیاز ۱۳۱۵ صدرنشین است و «Qwen ۳.۸ Max» و «Claude Opus ۴.۷ High» با امتیاز ۱۳۰۱ در رتبههای بعدی قرار دارند. این جدول بر بیش از ۱.۱۸ میلیون رأی و ۱۴۶ مدل استوار است.
در بخش مدلهای متنباز این حوزه، «Kimi K۲.۶» با امتیاز ۱۲۶۳ بهترین مدل دارای مجوز باز محسوب میشود و پس از آن «Gemma ۴ ۳۱B» گوگل، «Kimi K۲.۵ Thinking» و «Qwen ۳.۵» قرار دارند. فاصله با مدلهای اختصاصی همچنان محسوس است، اما تراکم مدلهای متنباز آسیایی در این رده نشان میدهد که شکاف قابلیت بهتدریج در حال کاهش است.
بزرگترین برتری اختصاصی یک شرکت را باید در حوزه تصویر جستوجو کرد. در بخش «Text-to-Image Arena»، مدل «GPT-Image-۲ Medium» با امتیاز ۱۳۸۱ در رتبه نخست قرار دارد و «Microsoft MAI-Image-۲.۶ Preview» با ۱۳۳۶ و «Grok Imagine Image ۲.۰» با ۱۳۱۶ در رتبههای بعدی ایستادهاند. فاصله ۴۵ امتیازی میان رتبه اول و دوم، همراه با بازه اطمینان محدود، برتری قدرتمند اوپنایآی را تأیید میکند. این رتبهبندی بر نزدیک به ۵.۹۲ میلیون رأی بنا شده است.
در ویرایش تصویر نیز مزیت اوپنایآی برجستهتر میشود. «GPT-Image-۲ Medium» با امتیاز ۱۴۶۳ و حدود ۱۹۹ هزار رأی در صدر جدول ۱۷ اوت قرار دارد. حجم کل رأیهای بخش «Image Edit Arena» از ۲۹ میلیون عبور کرده که این حوزه را به یکی از بزرگترین مجموعههای ترجیح انسانی «Arena.ai» تبدیل کرده است.
به نظر میرسد اوپنایآی در رتبهبندی عمومی متن فعلاً صدر را به آنتروپیک واگذار کرده، اما در لایه تولید و ویرایش تصویر مزیت تخصصی بسیار قدرتمندی ساخته است. معماری رقابت از همین نقطه چندبعدی میشود و جایگاه هر شرکت را دیگر نمیتوان با یک مدل زبانی واحد اندازهگیری کرد.
بررسی دادههای «Arena.ai» نشان میدهد که بازار تولید ویدئو ساختار متفاوتی دارد. در دادههای ۱۴ اوت بخش «Text-to-Video Arena»، مدل «Gemini Omni Flash» گوگل با امتیاز ۱۵۱۲ صدرنشین است و «Flux ۳ Video» از Black Forest Labs با ۱۴۹۴ و «Dreamina Seedance ۲.۰» از بایتدنس با ۱۴۸۲ در رتبههای دوم و سوم قرار دارند. «Sora ۲ Pro» از اوپنایآی با امتیاز ۱۳۶۴ در رتبه هشتم جای گرفته است.
در جدول ویرایش ویدئو، مدل «Dreamina Seedance ۲.۵» از بایتدنس با امتیاز ۱۴۱۱ صدرنشین است و مینیمکس «H۳» با ۱۳۸۸ و «Gemini Omni Flash» با ۱۳۵۸ در تعقیب آن هستند. بنابراین زنجیره ارزش ویدئوی مولد میان چند بازیگر توزیع شده و هیچ آزمایشگاهی بهطور همزمان بر تولید و ویرایش سلطه ندارد.
به عقیده کارشناسان، مهمترین تحول نسل جدید ارزیابی، «Agent Arena» است. در این بخش، «Arena.ai» به جای رأی دوبهدو از روش «causal tracing» استفاده میکند و عملکرد عامل را بر مبنای موفقیت واقعی در انجام وظیفه، قابلیت هدایت و بازیابی پس از خطا میسنجد.
در دادههای ۱۹ اوت و بیش از ۱.۹ میلیون سشن، مدل «Claude Opus ۵ High» با روند اصلاح حدود ۱۲.۴۷ درصد در رتبه نخست قرار دارد و نسخه «Max» و «Claude Fable ۵ High» پس از آن هستند. در سطح آزمایشگاه، آنتروپیک نخست، مونشات با «Kimi K۳ Max» دوم و اوپنایآی با «GPT-۵.۶ Sol xHigh» سوم است. نکته قابلتوجه، هزینه میانه مدل «Kimi» حدود ۰.۶۵ دلار برای هر وظیفه است، در حالی که این رقم برای مدل پرچمدار آنتروپیک بیش از دو دلار گزارش شده است.
در بخش «Search Arena»، مدل «Claude Opus ۴.۶ Search» با امتیاز ۱۲۵۳ رتبه نخست را دارد و «GPT-۵.۵ Search» با ۱۲۴۰ دوم است. این جدول بر حدود ۹۴۰ هزار رأی استوار است و مدلهای دارای جستوجوی وب یکپارچه را ارزیابی میکند.
اهمیت این بخش فراتر از رتبهبندی است. «Arena.ai» گزارش کرده که پاسخهای بخش «Search Arena» بهطور متوسط نزدیک به ۱۰ ادعای واقعی دارند و وجود ادعاهای قابل بررسی در ۸۸ درصد مقایسههای این حوزه مشاهده شده است. بنابراین کیفیت بازیابی، انتخاب منبع و صحت ادعا به مؤلفهای مستقل از توانایی زبانی مدل تبدیل شده است.
مرور دادههای «Arena.ai» در ماه اوت ۲۰۲۶ به یک نتیجه بنیادی میرسد: مرز هوش مصنوعی دیگر یک خط واحد نیست. آنتروپیک قدرتمندترین موقعیت را در متن، کدنویسی، توسعه وب، بینایی و عاملهای هوشمند ساخته است. اوپنایآی در تولید و ویرایش تصویر برتری کمسابقهای دارد و در عاملهای کدنویسی نیز همچنان در میان مدعیان حضور دارد. گوگل صدر تولید ویدئو را در اختیار گرفته است. متا در متن و تصویر دوباره به حلقه مدعیان بازگشته و شرکتهای چینی از مونشات و علیبابا تا بایتدنس، Z.ai، مینیمکس، تنسنت و بایدو، تقریباً در تمام حوزهها حضور رقابتی پیدا کردهاند. عصر تکقطبی در هوش مصنوعی به پایان رسیده و جای خود را به میدانی چندقطبی و پویا داده است که در آن هر بازیگر در حوزهای خاص میدرخشد.
انتهای پیام
مطالب مرتبط
منتخب اخیر
گفتگو داغ
وبسایتهای رسمی
درباره اندیشکده حکمرانی هوشمند
اندیشکده حکمرانی هوشمند (Smart Governance Think Tank) یک مرکز پژوهشی پیشرو در ایران است که با تمرکز بر حکمرانی دادهمحور، سیاستپژوهی، و توسعه ابزارهای هوشمند نظیر اطلس تجارت ایران فعالیت میکند. این اندیشکده با همکاری نخبگان دانشگاهی و فعالان اقتصادی، مسیر تحول در نظام تصمیمسازی کشور را هموار میسازد.
درباره رئیس اندیشکده حکمرانی هوشمند
سید طه حسین مدنی، رئیس اندیشکده حکمرانی هوشمند، از پژوهشگران برجسته در حوزه حکمرانی دادهمحور، سیاستگذاری هوشمند و اقتصاد دیجیتال است. ایشان با مقالات متعدد و حضور فعال در رسانهها، نقش مهمی در ترویج گفتمان حکمرانی هوشمند در ایران دارند. صفحه رسمی ایشان شامل مجموعهای از مقالات، مصاحبهها و یادداشتهای منتشر شده در رسانههای معتبر است.
کلمات کلیدی مرتبط: اندیشکده، حکمرانی هوشمند، صفحه رسمی اندیشکده حکمرانی هوشمند، اطلس تجارت ایران، سید طه حسین مدنی، رئیس اندیشکده حکمرانی هوشمند، صفحه رئیس اندیشکده، طه مدنی، taha madani، حکمرانی دیجیتال، هوش مصنوعی در سیاستگذاری، تجارت هوشمند، دادههای باز، حکمرانی مشارکتی، اقتصاد دانشبنیان، تحول دیجیتال در حکمرانی، مقالات رئیس اندیشکده، مصاحبههای طه مدنی، published in media، یادداشتهای تخصصی حکمرانی.
- اندیشکده حکمرانی هوشمند
- صفحه رسمی اندیشکده
- حکمرانی دادهمحور
- اطلس تجارت ایران
- رئیس اندیشکده حکمرانی هوشمند
- سید طه حسین مدنی
- صفحه رسمی رئیس اندیشکده
- مقالات رئیس اندیشکده حکمرانی هوشمند
- taha madani
- published in media طه مدنی
- گزارشهای تخصصی حکمرانی
- نشستهای علمی اندیشکده
- همکاری با اندیشکده حکمرانی هوشمند
- مصاحبههای سید طه حسین مدنی