گزارش
موج عرضه مدلهای جدید هوش مصنوعی
موج عرضه مدلهای جدید در تابستان و اول سپتامبر ۲۰۲۶، بازار هوش مصنوعی مولد را دستخوش تحولی گسترده کرده. مدل GPT-6 Astra در ۳ سپتامبر، Claude Fable 5.1 در 1 سپتامبر و Gemini 3.8 Flash در ۲ سپتامبر عرضه شدند و در هفتههای پیش از آنها Grok 4.6 و GLM-5.3 و Qwen3.8 و DeepSeek V4 و Kimi K3 وارد بازار شده بودند. نتیجه این تراکم عرضه، شکلگیری بازاری است که در آن فاصله میان مدلها بیشازپیش طبق نوع کاربرد آنها و مزیتهای فنی آشکار میشود. بهگزارش مهر؛ مدل مناسب برای پژوهش عمیق و کار چندمرحلهای لزوماً بهترین گزینه پردازش انبوه اسناد، برنامهنویسی روزمره یا تحلیل صوت و ویدئو نیست. گزارش اخیر وبگاه Teamday ارزیابی مدلها را برهمینمبنا، با ترکیب توان برنامهنویسی، پژوهش، استفاده از ابزار، کار با رایانه، طول زمینه، هزینه و قابلیت استقرار صورت میدهد.
مدل GPT-6 Astra؛ گذار از ارائه پاسخ به اجرای کار
اینمدل با پنجره زمینه ۱.۰۵میلیون توکن و خروجی ۱۲۸هزار توکن برای دشوارترین مأموریتهای استدلالی، پژوهشی، برنامهنویسی و کار با رایانه عرضه شده است. مزیت اصلی اینمدل زمانی آشکار میشود که یک کار از چند محیط عبور میکند. مدل میتواند در زنجیرهای واحد با کد، مرورگر، پژوهش و فایلهای حرفهای تعامل کند و وظیفه پیچیده را با راهنمایی انسانی کمتر پیش ببرد. در شاخص مورداستفاده MindsHub مدل GPT-6 Astra امتیاز ۵۳ را کسب کرده و همراه Claude Fable 5.1 در بالاترین سطح مقایسه قرار گرفته. باید بهایننکته توجه داشت هزینه این توانایی بالا است. برهمیناساس، هزینه API برای هر یکمیلیون توکن ورودی و خروجی مدل GPT-6 Astra بهترتیب ۱۰ و ۵۰دلار است. ازاینرو خانواده GPT-5.6 همچنان اهمیت عملیاتی خود را حفظ میکند. مدل Sol برای کار عمومی سنگین، Terra برای تعادل میان کیفیت و هزینه و Luna برای استخراج، خلاصهسازی و پردازش انبوه مناسبتر است. معماری مطلوب برای بسیاری از سازمانها درنتیجه میتواند استفاده گزینشی از مدل GPT-6 Astra در مراحل دشوار و واگذاری عملیات پرتکرار به مدلهای ارزانتر باشد.
مدل Claude Fable 5.1؛ مزیت در استدلال منتهی به خروجی قابلاتکا
رقیب مستقیم GPT-6 Astra در بالاترین رده کیفیت. نقطهقوت اینمدل در استدلال دقیق، بازبینی، برنامهنویسی و تولید خروجیهای نهایی خوانا قرار دارد. همین ویژگی آنرا برای کارهایی جذاب میکند که محصول مدل مستقیماً درمعرض ارزیابی یک متخصص انسانی قرار میگیرد. مدل Claude Fable 5.1 همان پنجره زمینه یکمیلیون توکنی و قیمت پایه ۱۰دلار برای ورودی و ۵۰دلار برای خروجی را حفظ کرده، درحالیکه هزینه خواندن دادههای کش شده دراینمدل نسبت به Fable 5 به یکچهارم کاهش یافته. خانواده مدلهای هوش مصنوعی Claude درعینحال امکان تفکیک بار کاری را فراهم میکند. مدل Opus 5 با قیمت ۵ و ۲۵دلار برای مأموریتهای طولانی و برنامهنویسی عاملمحور طراحی شده و Sonnet 5 با قیمت ۲ و ۱۰دلار گزینه روزمره اقتصادیتری است. دادههای MindsHub یک ملاحظه مهم را نیز برجسته میسازد. مدلهای Claude در آزمون مورد استناد گزارش این وبگاه، بالاترین هزینههای اندازهگیریشده بهازای مأموریت را داشتهاند، زیرا میتوانند منابع بیشتری صرف استدلال کنند.
مدل Gemini 3.8 Flash؛ تبدیل توانمندی چندوجهی به قابلیت عملیاتی
این مدل مسیر متفاوتی را از سایر رقبا دنبال میکند. گوگل متن، تصویر، صوت و ویدئو را میپذیرد، زمینه طولانی را پردازش میکند و سرعتش برای عاملهای مبتنیبر تعامل مناسب است. این ترکیب، مدل Gemini 3.8 Flash را برای تحلیل مجموعههای بزرگ اسناد همراه با تصویر، پردازش محتوای صوتی و تصویری و گردشکارهای متصل به سرویس Google Workspace به گزینهای متمایز تبدیل میکند. وبگاه MindsHub هزینه هر مأموریت آزمایشی اینمدل را ۱.۲۴دلار گزارش کرده که فاصله قابلتوجهی با مدلهای ممتاز دارد. گوگل اینمدل را با پنجره زمینه یکمیلیون توکن و قیمت رقابتی ۰.۷۵دلار برای ورودی و ۳.۷۵دلار برای خروجی عرضه کرده و این قیمت تا پایان ۲۰۲۶ اعتبار دارد. وجود نسخه محدود Gemini 3.8 Flash Cyber برای حوزه تخصصی مرتبط با آسیبپذیریهای سایبری نیز نشان داده شاخه Flash درحالحرکت از مدل سریع عمومی بهسوی کاربردهای تخصصیتر است.
مدل Grok 4.6؛ پیوند داده زنده با چرخه استدلال
مزیت آن در دسترسی همزمان به وب و محتوای زنده پلتفرم اجتماعی ایکس نهفته. این ویژگی برای پایش رویدادهای جاری، تحلیل فضای آنلاین و مأموریتهایی که داده تازه باید وارد چرخه استدلال شود، اهمیت پیدا میکند. اینمدل پنجره زمینه ۵۰۰هزار توکنی دارد و قیمت پایه آن ۲دلار برای ورودی و ۶دلار برای خروجی است. دادههای مقایسهای یک نکته اقتصادی مهم را نیز آشکار میکنند. قیمت پایین هر توکن به مأموریت ارزانتر منتهی نمیشود زیرا مصرف بیشتر توکن میتواند هزینه نهایی را افزایش دهد.
مدلهای وزنباز چینی؛ رقابت بر سر کنترل، هزینه و استقرار
بخش مهم دیگر تحول هوش مصنوعی در ۲۰۲۶ در مدلهای دارای وزنباز دیده میشود. مدل GLM-5.3 Flash با ۳۲۰میلیارد پارامتر کل و ۱۸میلیارد پارامتر فعال، ورودی متن، تصویر و ویدئو و زمینه یکمیلیون توکنی، نمونه برجسته اینروند محسوب میشود. قیمت اعلامی مدل مذکور ۰.۱۵دلار برای ورودی و ۰.۵۰دلار برای خروجی است و در تخفیف عرضه پلتفرم OpenRouter به ۰.۰۷۵ و ۰.۲۵دلار میرسد. چنین ارقامی استفاده از مدلهای قدرتمند را در مسیریابی، استخراج اطلاعات و پردازش انبوه ازنظر اقتصادی جذابتر از گذشته میکند. علاوهبراین، مدل جدید DeepSeek V4 نیز همین رقابت را از مسیر هزینه دنبال میکند. نسخه Pro مدل مذکور برای استدلال و برنامهنویسی و نسخه Flash آن برای سرعت و حجم بالا مناسبتر است. هزینه V4 Flash در ساعات کمتقاضا تا ۰.۲۲دلار برای یکمیلیون توکن ورودی و ۰.۶۶دلار برای خروجی کاهش مییابد. مدل Qwen3.8-Flash شرکت علیبابا با وزنباز، ورودی متن، تصویر و ویدئو و زمینه یکمیلیون توکنی طی روزهای اخیر عرضه شده است.
روند بازار؛ جایگزینی معماری چندمدلی در دستیابی به کارآمدی
دادههای گزارشهای منتشره طی روزهای اخیر به نتیجه عملیاتی مهم میرسند: در مقطع کنونی، مزیت رقابتی سازمانها و گزینه بهینه برای کاربران بیشازآنکه از دسترسی به یک مدل برتر حاصل شود، از توان طراحی درست سبد مدلها ناشی خواهد شد. یک معماری کارآمد میتواند مدل ارزان و سریع را برای استخراج، دستهبندی و پیشنویس بهکار گیرد مدلی مانند Sonnet 5 و Grok 4.6 یا GPT-5.6 Terra را به امور روزمره عاملها اختصاص دهد و Astra و Fable 5.1 یا Opus 5 را تنها در مراحل پیچیده و سنگین فراخوانی کند. بهعقیده بسیاری کارشناسان، معیار نهایی انتخاب باید هزینه تولید یک خروجی قابلقبول و مطلوب باشد. طول اسمی پنجره زمینه، قیمت هر میلیون توکن یا یک امتیاز بنچمارک بهتنهایی کیفیت عملیاتی مدلهای جدید هوش مصنوعی را تعیین نمیکنند. پایداری مدل پس از دهها فراخوانی ابزار، هزینه تلاش مجدد برای انجام کار، کش، بازبینی انسانی، کیفیت استفاده از ابزار و محل پردازش داده بخشی از معادله هستند. نسل جدید مدلهای هوش مصنوعی درهمیننقطه معنای واقعی پیدا میکند. رقابت اکنون بر سر مدلی جریان دارد که بتواند درون سامانه عاملمحور، مأموریت محول را با کیفیت قابلپذیرش، هزینه قابلکنترل و حداقل مداخله انسانی بهپایان برساند.