بازار هوش مصنوعی مولد در تابستان و روزهای ابتدایی سپتامبر ۲۰۲۶ با ورود مجموعهای از مدلهای جدید وارد مرحله تازهای از رقابت شده است؛ رقابتی که در آن دیگر نمیتوان صرفاً بر اساس یک رتبهبندی یا امتیاز بنچمارک، بهترین مدل هوش مصنوعی را انتخاب کرد. تفاوت میان مدلهای جدید بیش از گذشته به نوع مأموریت، هزینه پردازش، توانایی استفاده از ابزارها، طول پنجره زمینه، قابلیت چندوجهی و امکان استقرار آنها وابسته شده است.
به گزارش پایگاه خبری حکمرانی هوشمند، در فاصله چند روز، مدلهای «GPT-۶ Astra»، «Claude Fable ۵.۱» و «Gemini ۳.۸ Flash» به بازار آمدند و پیش از آنها نیز مدلهایی مانند «Grok ۴.۶»، «GLM-۵.۳»، «Qwen3.۸»، «DeepSeek V4» و «Kimi K3» معرفی شده بودند. تراکم این عرضهها باعث شده بازار مدلهای هوش مصنوعی بیش از گذشته تخصصی شود و هر مدل برای مجموعهای از کاربردها مزیت مشخصی پیدا کند.
گزارشهای مقایسهای منتشرشده از سوی وبگاههایی مانند «Teamday» و «MindsHub» نیز نشان میدهد که ارزیابی مدلهای جدید در حال عبور از مقایسه ساده امتیازهای بنچمارک است. در این رویکرد، توانایی برنامهنویسی، پژوهش، استفاده از ابزار، کار با رایانه، طول زمینه، هزینه و قابلیت استقرار همزمان مورد توجه قرار میگیرد.
در واقع، مسئله اصلی برای کاربران حرفهای و سازمانها دیگر صرفاً این نیست که «کدام مدل هوش مصنوعی باهوشتر است»، بلکه این است که کدام مدل میتواند یک مأموریت واقعی را با کیفیت مناسب، هزینه قابل کنترل و کمترین نیاز به دخالت انسان به پایان برساند.
GPT-۶ Astra؛ مدل قدرتمند برای مأموریتهای پیچیده
«GPT-۶ Astra» در میان مدلهای تازهوارد، بر انجام وظایف پیچیده و چندمرحلهای تمرکز دارد. این مدل با پنجره زمینه ۱.۰۵ میلیون توکن و حداکثر خروجی ۱۲۸ هزار توکن، برای مأموریتهای استدلالی، پژوهشی، برنامهنویسی و تعامل با رایانه طراحی شده است.
یکی از مهمترین ویژگیهای این مدل، امکان ترکیب چند محیط در یک فرایند کاری است؛ به این معنا که کاربر میتواند از مدل برای کدنویسی، مرور وب، پژوهش و کار با فایلهای تخصصی در یک زنجیره واحد استفاده کند.
بر اساس شاخص مورد استناد «MindsHub»، مدل «GPT-۶ Astra» امتیاز ۵۳ را به دست آورده و در کنار «Claude Fable ۵.۱» در بالاترین سطح این مقایسه قرار گرفته است.
با این حال، توان پردازشی بالاتر هزینه بیشتری نیز دارد. قیمت API این مدل برای هر یک میلیون توکن ورودی و خروجی به ترتیب ۱۰ و ۵۰ دلار اعلام شده است. همین مسئله باعث میشود استفاده از آن برای تمام فعالیتهای روزمره الزاماً اقتصادی نباشد.
در چنین شرایطی، مدلهای خانواده «GPT-۵.۶» همچنان میتوانند برای بخشهای مختلف یک فرایند کاری مورد استفاده قرار گیرند؛ «Sol» برای کارهای عمومی سنگین، «Terra» برای ایجاد تعادل میان کیفیت و هزینه و «Luna» برای استخراج، خلاصهسازی و پردازش حجم بالای اطلاعات گزینههای مناسبتری محسوب میشوند.
Claude Fable ۵.۱؛ تمرکز بر کیفیت استدلال و خروجی نهایی
«Claude Fable ۵.۱» یکی دیگر از مدلهای ردهبالای بازار است که رقابت مستقیمی با «GPT-۶ Astra» دارد. تمرکز اصلی این مدل بر استدلال دقیق، بازبینی، برنامهنویسی و تولید خروجی نهایی با کیفیت بالا قرار گرفته است.
این مدل نیز از پنجره زمینه یک میلیون توکنی برخوردار است و قیمت پایه آن برای هر یک میلیون توکن ورودی و خروجی به ترتیب ۱۰ و ۵۰ دلار اعلام شده است. در عین حال، هزینه خواندن دادههای ذخیرهشده در حافظه کش نسبت به نسل قبلی «Fable ۵» به یکچهارم کاهش یافته است.
خانواده «Claude» امکان تفکیک وظایف بر اساس هزینه و پیچیدگی را نیز فراهم میکند. مدل «Opus ۵» با قیمت ۵ دلار برای ورودی و ۲۵ دلار برای خروجی برای مأموریتهای طولانی و برنامهنویسی عاملمحور طراحی شده، در حالی که «Sonnet ۵» با قیمت ۲ و ۱۰ دلار میتواند گزینهای اقتصادیتر برای استفادههای روزمره باشد.
دادههای «MindsHub» در عین حال نشان میدهد که مدلهای «Claude» در برخی مأموریتها هزینه بیشتری به ازای هر کار ایجاد میکنند؛ موضوعی که با توانایی آنها برای صرف منابع بیشتر در فرایند استدلال ارتباط دارد. بنابراین استفاده از «Claude Fable ۵.۱» زمانی توجیه اقتصادی بیشتری پیدا میکند که کیفیت استدلال و بازبینی، ارزش قابل توجهی برای خروجی نهایی ایجاد کند.
Gemini ۳.۸ Flash؛ ترکیب سرعت و قابلیت چندوجهی
«Gemini ۳.۸ Flash» مسیر متفاوتی را دنبال میکند و نقطه قوت آن در ترکیب سرعت، پردازش چندوجهی و قابلیت استفاده در گردشکارهای مبتنی بر عاملهاست.
این مدل امکان دریافت متن، تصویر، صوت و ویدئو را دارد و از زمینه طولانی پشتیبانی میکند. چنین قابلیتی آن را برای تحلیل حجم بالایی از اسناد همراه با تصاویر، پردازش فایلهای صوتی و تصویری و همچنین گردشکارهای متصل به سرویسهای «Google Workspace» مناسب میکند.
بر اساس دادههای «MindsHub»، هزینه هر مأموریت آزمایشی این مدل حدود ۱.۲۴ دلار گزارش شده است؛ رقمی که فاصله قابل توجهی با برخی مدلهای ردهبالا دارد.
«Gemini ۳.۸ Flash» با پنجره زمینه یک میلیون توکنی و قیمت ۰.۷۵ دلار برای ورودی و ۳.۷۵ دلار برای خروجی عرضه شده و این قیمت تا پایان سال ۲۰۲۶ اعتبار دارد. همچنین عرضه نسخه محدود «Gemini ۳.۸ Flash Cyber» برای کاربردهای مرتبط با آسیبپذیریهای سایبری، نشاندهنده حرکت این خانواده به سمت کاربردهای تخصصیتر است.
Grok ۴.۶؛ مزیت دادههای لحظهای در تحلیل رویدادها
«Grok ۴.۶» نیز مزیت خود را در دسترسی همزمان به وب و محتوای زنده پلتفرم اجتماعی ایکس تعریف کرده است. چنین قابلیتی برای فعالیتهایی که به اطلاعات تازه، رصد رویدادهای جاری و تحلیل فضای آنلاین وابسته هستند، اهمیت ویژهای دارد.
این مدل پنجره زمینه ۵۰۰ هزار توکنی دارد و قیمت پایه آن ۲ دلار برای ورودی و ۶ دلار برای خروجی اعلام شده است.
با این حال، مقایسه هزینه مدلها نشان میدهد که قیمت پایین هر توکن الزاماً به معنای ارزانتر بودن یک مأموریت نیست. میزان مصرف توکن و تعداد دفعاتی که مدل برای تکمیل یک وظیفه فراخوانی میشود، میتواند هزینه نهایی را به شکل محسوسی تغییر دهد.
مدلهای وزنباز چینی؛ رقابت تازه بر سر هزینه و استقرار
یکی از روندهای مهم بازار هوش مصنوعی در سال ۲۰۲۶، رشد مدلهای دارای وزن باز است؛ مدلهایی که علاوه بر قیمت پایینتر، امکان کنترل و استقرار انعطافپذیرتری را برای کاربران و سازمانها فراهم میکنند.
«GLM-۵.۳ Flash» یکی از نمونههای قابل توجه این روند است. این مدل مجموعاً ۳۲۰ میلیارد پارامتر دارد که ۱۸ میلیارد پارامتر آن فعال است و از ورودیهای متنی، تصویری و ویدئویی و زمینه یک میلیون توکنی پشتیبانی میکند.
قیمت اعلامشده برای این مدل ۰.۱۵ دلار به ازای هر یک میلیون توکن ورودی و ۰.۵۰ دلار برای خروجی است و در تخفیف عرضه پلتفرم «OpenRouter» این رقم به ۰.۰۷۵ و ۰.۲۵ دلار کاهش مییابد. چنین هزینهای میتواند استفاده از مدلهای قدرتمند را در پردازشهای انبوه، استخراج اطلاعات و برخی کاربردهای مسیریابی اقتصادیتر کند.
«DeepSeek V4» نیز بخش دیگری از این رقابت را نمایندگی میکند. نسخه «Pro» این مدل بیشتر بر استدلال و برنامهنویسی تمرکز دارد و نسخه «Flash» برای سرعت بالاتر و پردازش حجم زیاد طراحی شده است. هزینه نسخه «V4 Flash» در ساعات کمتقاضا میتواند به ۰.۲۲ دلار برای ورودی و ۰.۶۶ دلار برای خروجی به ازای هر یک میلیون توکن برسد.
همچنین «Qwen3.۸-Flash» شرکت علیبابا با وزن باز، پشتیبانی از متن، تصویر و ویدئو و پنجره زمینه یک میلیون توکنی وارد بازار شده است. در سوی دیگر، «Kimi K3» با ۲.۸ تریلیون پارامتر کل و زمینه یک میلیون توکنی، تمرکز بیشتری بر استدلال طولانی و مأموریتهای مستمر عاملهای برنامهنویسی دارد.
آینده بازار؛ رقابت میان مدلها یا رقابت میان سبدهای مدل؟
مجموع این تحولات نشان میدهد که بازار هوش مصنوعی مولد به سمت مدلی حرکت میکند که در آن انتخاب یک مدل واحد برای همه وظایف، دیگر الزاماً بهترین راهکار نیست.
برای یک سازمان، ممکن است یک مدل ارزان و سریع برای استخراج داده، دستهبندی اطلاعات و تهیه پیشنویس به کار گرفته شود؛ مدل دیگری برای فعالیتهای روزمره عاملها مورد استفاده قرار گیرد و مدلهای گرانتر و قدرتمندتر تنها در مراحل پیچیده، حساس یا نیازمند استدلال عمیق وارد فرایند شوند.
به همین دلیل، معیار اقتصادی واقعی دیگر صرفاً قیمت هر میلیون توکن نیست. تعداد فراخوانی ابزارها، میزان مصرف توکن، نیاز به تکرار عملیات، هزینه بازبینی انسانی، کیفیت استفاده از ابزارها، قابلیت ذخیرهسازی داده و محل پردازش اطلاعات نیز باید در محاسبه هزینه نهایی یک مدل در نظر گرفته شود.
در نهایت، رقابت نسل جدید مدلهای هوش مصنوعی بیش از آنکه صرفاً بر سر کسب بالاترین امتیاز در یک بنچمارک باشد، به سمت توانایی اجرای یک مأموریت کامل پیش میرود؛ مأموریتی که باید با کیفیت قابل قبول، هزینه منطقی و کمترین میزان دخالت انسانی به نتیجه برسد.
از این منظر، آینده بازار احتمالاً متعلق به سازمانهایی خواهد بود که به جای جستوجوی یک «بهترین مدل»، بتوانند ترکیب مناسبی از مدلهای قدرتمند، سریع و اقتصادی را برای هر مرحله از فرایند کاری خود طراحی کنند.
انتهای پیام
