رقابت میان مدل‌های هوش مصنوعی در سال ۲۰۲۶ به نقطه‌ای رسیده که پرسش قدیمی «بهترین مدل کدام است؟» تا حد زیادی بی‌معنا شده است. داده‌های تازه منتشرشده از وبگاه «Arena.ai» تصویری چندقطبی از این میدان رقابت ارائه می‌دهد؛ جایی که هر شرکت در حوزه‌ای خاص می‌درخشد و دیگر هیچ‌کس به‌تنهایی بر تمامی عرصه‌ها تسلط ندارد.

به گزارش پایگاه خبری حکمرانی هوشمند، بر اساس این داده‌ها، آنتروپیک در حوزه‌های متن، کدنویسی و عامل‌های هوشمند موقعیتی بی‌نظیر دارد. اوپن‌ای‌آی در تولید و ویرایش تصویر فاصله قابل‌توجهی با رقبا ایجاد کرده است. گوگل حوزه تولید ویدئو را در اختیار گرفته و بازیگران چینی نظیر مون‌شات، علی‌بابا، Z.ai، بایت‌دنس و مینی‌مکس نیز در بخش‌هایی از مرز عملکرد، مستقیماً با آزمایشگاه‌های آمریکایی رقابت می‌کنند.

آنچه به «Arena.ai» اعتبار ویژه‌ای بخشیده، روش منحصربه‌فرد ارزیابی آن است. رتبه‌بندی‌های اصلی این پلتفرم بر پایه مقایسه‌های دوبه‌دوی پاسخ مدل‌ها و ترجیح کاربران واقعی شکل گرفته و امتیازها با مدل آماری بردلی-تری محاسبه می‌شوند. این وبگاه علاوه بر رتبه خام، «بازه رتبه» را نیز منتشر می‌کند تا عدم‌قطعیت آماری برای کاربران شفاف باشد. همچنین در سال ۲۰۲۶، شاخص «واقع‌گرایی (factuality)» به بخش‌های «متن» و «جست‌وجو» اضافه شده است که صحت پاسخ‌ها را در کنار ترجیح انسانی اندازه‌گیری می‌کند.

در مهم‌ترین جدول عمومی یعنی «Text Arena» که بر اساس بیش از ۷.۹ میلیون رأی و ۳۹۴ مدل تدوین شده، داده‌های ۲۱ اوت ۲۰۲۶ نشان‌دهنده موقعیت بسیار قدرتمند آنتروپیک است. «Claude Fable ۵» با امتیاز ۱۵۰۸ در صدر ایستاده و «Claude Opus ۴.۶ High» و «Claude Opus ۴.۷ High» به‌ترتیب با امتیازهای ۱۵۰۴ و ۱۵۰۲ جایگاه‌های دوم و سوم را در اختیار دارند. در رتبه چهارم، «Muse Spark ۱.۲ xHigh» از متا با امتیاز ۱۴۹۸ قرار گرفته است. نکته قابل‌توجه، تراکم خانواده «Claude» در صدر جدول است؛ به‌گونه‌ای که چهار مدل آنتروپیک در میان شش رتبه نخست حضور دارند.

این آرایش نشان می‌دهد که برتری آنتروپیک دیگر به موفقیت یک مدل منفرد محدود نیست و به یک «خانواده توانمندی» تبدیل شده است. این الگو در زبان انگلیسی نیز تکرار می‌شود و «Claude Fable ۵» با امتیاز ۱۵۱۵ صدرنشین است. در مقابل، بهترین مدل اوپن‌ای‌آی یعنی «GPT-۵.۶ Sol xHigh» با امتیاز ۱۴۸۲ در رتبه ۱۸ جدول کلی متن قرار گرفته است.

برتری آنتروپیک در حوزه کدنویسی حتی آشکارتر از بخش متن است. در زیرشاخه «Coding»، سه مدل «Claude Opus ۴.۶ High»، «Claude Opus ۴.۷ High» و «Claude Fable ۵» هر سه با امتیاز ۱۵۵۲ رتبه‌های نخست تا سوم را از آن خود کرده‌اند. در این بخش، مدل «Kimi K۳ Max» از شرکت مون‌شات چین با امتیاز ۱۵۴۴ در میان مدعیان اصلی حضور دارد.

در بخش «Code Arena WebDev» نیز تصویر مشابه است، هرچند قدرت بازیگران آسیایی در این بخش پررنگ‌تر می‌شود. بر اساس داده‌های ۲۱ اوت و بیش از ۶۰۳ هزار رأی، «Claude Opus ۵ Max» با امتیاز ۱۶۹۱ در جایگاه نخست، «Kimi K۳ Max» با ۱۶۷۴ در رتبه دوم و «Qwen ۳.۸ Max» از علی‌بابا با ۱۶۶۹ در رتبه سوم قرار دارند. همچنین «GPT-۵.۶ Sol xHigh» با سازوکار کدنویسی اختصاصی خود، رتبه هفتم و امتیاز ۱۶۱۹ را کسب کرده است.

این بخش یکی از مهم‌ترین نشانه‌های تغییر ساختار صنعت محسوب می‌شود. به نظر می‌رسد مون‌شات و علی‌بابا دیگر مدل‌های «کم‌هزینه جایگزین» نیستند و در برخی وظایف توسعه نرم‌افزار، مستقیماً در مرز عملکرد قرار گرفته‌اند. در طراحی مبتنی بر مرجع نیز «Kimi K۳ Max» با امتیاز ۱۷۲۱ حتی از «Claude Opus ۵ Max» پیشی گرفته است.

در بخش «Vision Arena» که توانایی مدل‌ها در تحلیل و استدلال روی ورودی‌های بصری را می‌سنجد، مدل «Claude Fable ۵» با امتیاز ۱۳۱۵ صدرنشین است و «Qwen ۳.۸ Max» و «Claude Opus ۴.۷ High» با امتیاز ۱۳۰۱ در رتبه‌های بعدی قرار دارند. این جدول بر بیش از ۱.۱۸ میلیون رأی و ۱۴۶ مدل استوار است.

در بخش مدل‌های متن‌باز این حوزه، «Kimi K۲.۶» با امتیاز ۱۲۶۳ بهترین مدل دارای مجوز باز محسوب می‌شود و پس از آن «Gemma ۴ ۳۱B» گوگل، «Kimi K۲.۵ Thinking» و «Qwen ۳.۵» قرار دارند. فاصله با مدل‌های اختصاصی همچنان محسوس است، اما تراکم مدل‌های متن‌باز آسیایی در این رده نشان می‌دهد که شکاف قابلیت به‌تدریج در حال کاهش است.

بزرگ‌ترین برتری اختصاصی یک شرکت را باید در حوزه تصویر جست‌وجو کرد. در بخش «Text-to-Image Arena»، مدل «GPT-Image-۲ Medium» با امتیاز ۱۳۸۱ در رتبه نخست قرار دارد و «Microsoft MAI-Image-۲.۶ Preview» با ۱۳۳۶ و «Grok Imagine Image ۲.۰» با ۱۳۱۶ در رتبه‌های بعدی ایستاده‌اند. فاصله ۴۵ امتیازی میان رتبه اول و دوم، همراه با بازه اطمینان محدود، برتری قدرتمند اوپن‌ای‌آی را تأیید می‌کند. این رتبه‌بندی بر نزدیک به ۵.۹۲ میلیون رأی بنا شده است.

در ویرایش تصویر نیز مزیت اوپن‌ای‌آی برجسته‌تر می‌شود. «GPT-Image-۲ Medium» با امتیاز ۱۴۶۳ و حدود ۱۹۹ هزار رأی در صدر جدول ۱۷ اوت قرار دارد. حجم کل رأی‌های بخش «Image Edit Arena» از ۲۹ میلیون عبور کرده که این حوزه را به یکی از بزرگ‌ترین مجموعه‌های ترجیح انسانی «Arena.ai» تبدیل کرده است.

به نظر می‌رسد اوپن‌ای‌آی در رتبه‌بندی عمومی متن فعلاً صدر را به آنتروپیک واگذار کرده، اما در لایه تولید و ویرایش تصویر مزیت تخصصی بسیار قدرتمندی ساخته است. معماری رقابت از همین نقطه چندبعدی می‌شود و جایگاه هر شرکت را دیگر نمی‌توان با یک مدل زبانی واحد اندازه‌گیری کرد.

بررسی داده‌های «Arena.ai» نشان می‌دهد که بازار تولید ویدئو ساختار متفاوتی دارد. در داده‌های ۱۴ اوت بخش «Text-to-Video Arena»، مدل «Gemini Omni Flash» گوگل با امتیاز ۱۵۱۲ صدرنشین است و «Flux ۳ Video» از Black Forest Labs با ۱۴۹۴ و «Dreamina Seedance ۲.۰» از بایت‌دنس با ۱۴۸۲ در رتبه‌های دوم و سوم قرار دارند. «Sora ۲ Pro» از اوپن‌ای‌آی با امتیاز ۱۳۶۴ در رتبه هشتم جای گرفته است.

در جدول ویرایش ویدئو، مدل «Dreamina Seedance ۲.۵» از بایت‌دنس با امتیاز ۱۴۱۱ صدرنشین است و مینی‌مکس «H۳» با ۱۳۸۸ و «Gemini Omni Flash» با ۱۳۵۸ در تعقیب آن هستند. بنابراین زنجیره ارزش ویدئوی مولد میان چند بازیگر توزیع شده و هیچ آزمایشگاهی به‌طور هم‌زمان بر تولید و ویرایش سلطه ندارد.

به عقیده کارشناسان، مهم‌ترین تحول نسل جدید ارزیابی، «Agent Arena» است. در این بخش، «Arena.ai» به جای رأی دوبه‌دو از روش «causal tracing» استفاده می‌کند و عملکرد عامل را بر مبنای موفقیت واقعی در انجام وظیفه، قابلیت هدایت و بازیابی پس از خطا می‌سنجد.

در داده‌های ۱۹ اوت و بیش از ۱.۹ میلیون سشن، مدل «Claude Opus ۵ High» با روند اصلاح حدود ۱۲.۴۷ درصد در رتبه نخست قرار دارد و نسخه «Max» و «Claude Fable ۵ High» پس از آن هستند. در سطح آزمایشگاه، آنتروپیک نخست، مون‌شات با «Kimi K۳ Max» دوم و اوپن‌ای‌آی با «GPT-۵.۶ Sol xHigh» سوم است. نکته قابل‌توجه، هزینه میانه مدل «Kimi» حدود ۰.۶۵ دلار برای هر وظیفه است، در حالی که این رقم برای مدل پرچم‌دار آنتروپیک بیش از دو دلار گزارش شده است.

در بخش «Search Arena»، مدل «Claude Opus ۴.۶ Search» با امتیاز ۱۲۵۳ رتبه نخست را دارد و «GPT-۵.۵ Search» با ۱۲۴۰ دوم است. این جدول بر حدود ۹۴۰ هزار رأی استوار است و مدل‌های دارای جست‌وجوی وب یکپارچه را ارزیابی می‌کند.

اهمیت این بخش فراتر از رتبه‌بندی است. «Arena.ai» گزارش کرده که پاسخ‌های بخش «Search Arena» به‌طور متوسط نزدیک به ۱۰ ادعای واقعی دارند و وجود ادعاهای قابل بررسی در ۸۸ درصد مقایسه‌های این حوزه مشاهده شده است. بنابراین کیفیت بازیابی، انتخاب منبع و صحت ادعا به مؤلفه‌ای مستقل از توانایی زبانی مدل تبدیل شده است.

مرور داده‌های «Arena.ai» در ماه اوت ۲۰۲۶ به یک نتیجه بنیادی می‌رسد: مرز هوش مصنوعی دیگر یک خط واحد نیست. آنتروپیک قدرتمندترین موقعیت را در متن، کدنویسی، توسعه وب، بینایی و عامل‌های هوشمند ساخته است. اوپن‌ای‌آی در تولید و ویرایش تصویر برتری کم‌سابقه‌ای دارد و در عامل‌های کدنویسی نیز همچنان در میان مدعیان حضور دارد. گوگل صدر تولید ویدئو را در اختیار گرفته است. متا در متن و تصویر دوباره به حلقه مدعیان بازگشته و شرکت‌های چینی از مون‌شات و علی‌بابا تا بایت‌دنس، Z.ai، مینی‌مکس، تنسنت و بایدو، تقریباً در تمام حوزه‌ها حضور رقابتی پیدا کرده‌اند. عصر تک‌قطبی در هوش مصنوعی به پایان رسیده و جای خود را به میدانی چندقطبی و پویا داده است که در آن هر بازیگر در حوزه‌ای خاص می‌درخشد.

انتهای پیام