• شماره 3730 -
  • 1405 شنبه 28 شهريور

گزارش

موج عرضه مدل‌های جدید هوش مصنوعی

موج عرضه مدل‌های جدید در تابستان و اول سپتامبر ۲۰۲۶، بازار هوش مصنوعی مولد را دستخوش تحولی گسترده کرده. مدل GPT-6 Astra در ۳ سپتامبر، Claude Fable 5.1 در 1 سپتامبر و Gemini 3.8 Flash در ۲ سپتامبر عرضه شدند و در هفته‌های پیش از آن‌ها Grok 4.6 و GLM-5.3 و Qwen3.8 و DeepSeek V4 و Kimi K3 وارد بازار شده بودند. نتیجه این تراکم عرضه، شکل‌گیری بازاری است که در آن فاصله میان مدل‌ها بیش‌از‌پیش طبق نوع کاربرد آن‌ها و مزیت‌های فنی آشکار می‌شود. به‌گزارش مهر؛ مدل مناسب برای پژوهش عمیق و کار چندمرحله‌ای لزوماً بهترین گزینه پردازش انبوه اسناد، برنامه‌نویسی روزمره یا تحلیل صوت و ویدئو نیست. گزارش اخیر وبگاه Teamday ارزیابی مدل‌ها را برهمین‌مبنا، با ترکیب توان برنامه‌نویسی، پژوهش، استفاده از ابزار، کار با رایانه، طول زمینه، هزینه و قابلیت استقرار صورت می‌دهد.

مدل GPT-6 Astra؛ گذار از ارائه پاسخ به اجرای کار
این‌مدل با پنجره زمینه ۱.۰۵‌میلیون توکن و خروجی ۱۲۸‌هزار توکن برای دشوارترین مأموریت‌های استدلالی، پژوهشی، برنامه‌نویسی و کار با رایانه عرضه شده است. مزیت اصلی این‌مدل زمانی آشکار می‌شود که یک کار از چند محیط عبور می‌کند. مدل می‌تواند در زنجیره‌ای واحد با کد، مرورگر، پژوهش و فایل‌های حرفه‌ای تعامل کند و وظیفه پیچیده را با راهنمایی انسانی کمتر پیش ببرد. در شاخص مورداستفاده MindsHub مدل GPT-6 Astra امتیاز ۵۳ را کسب کرده و همراه Claude Fable 5.1 در بالاترین سطح مقایسه قرار گرفته. باید به‌این‌نکته توجه داشت هزینه این توانایی بالا است. برهمین‌اساس، هزینه API برای هر یک‌میلیون توکن ورودی و خروجی مدل GPT-6 Astra به‌ترتیب ۱۰ و ۵۰‌دلار است. ازاین‌رو خانواده GPT-5.6 همچنان اهمیت عملیاتی خود را حفظ می‌کند. مدل Sol برای کار عمومی سنگین، Terra برای تعادل میان کیفیت و هزینه و Luna برای استخراج، خلاصه‌سازی و پردازش انبوه مناسب‌تر است. معماری مطلوب برای بسیاری از سازمان‌ها درنتیجه می‌تواند استفاده گزینشی از مدل GPT-6 Astra در مراحل دشوار و واگذاری عملیات پرتکرار به مدل‌های ارزان‌تر باشد.

 

مدل Claude Fable 5.1؛ مزیت در استدلال منتهی به خروجی قابل‌اتکا
رقیب مستقیم GPT-6 Astra در بالاترین رده کیفیت. نقطه‌قوت این‌مدل در استدلال دقیق، بازبینی، برنامه‌نویسی و تولید خروجی‌های نهایی خوانا قرار دارد. همین ویژگی آن‌را برای کارهایی جذاب می‌کند که محصول مدل مستقیماً درمعرض ارزیابی یک متخصص انسانی قرار می‌گیرد. مدل Claude Fable 5.1 همان پنجره زمینه یک‌میلیون توکنی و قیمت پایه ۱۰‌دلار برای ورودی و ۵۰‌دلار برای خروجی را حفظ کرده، درحالی‌که هزینه خواندن داده‌های کش شده دراین‌مدل نسبت به Fable 5 به یک‌چهارم کاهش یافته. خانواده مدل‌‌های هوش مصنوعی Claude درعین‌حال امکان تفکیک بار کاری را فراهم می‌کند. مدل Opus 5 با قیمت ۵ و ۲۵دلار برای مأموریت‌های طولانی و برنامه‌نویسی عامل‌محور طراحی شده و Sonnet 5 با قیمت ۲ و ۱۰دلار گزینه روزمره اقتصادی‌تری است. داده‌های MindsHub یک ملاحظه مهم را نیز برجسته می‌سازد. مدل‌های Claude در آزمون مورد استناد گزارش این وبگاه، بالاترین هزینه‌های اندازه‌گیری‌شده به‌ازای مأموریت را داشته‌اند، زیرا می‌توانند منابع بیشتری صرف استدلال کنند.

 

مدل Gemini 3.8 Flash؛ تبدیل توانمندی چندوجهی به قابلیت عملیاتی
این مدل مسیر متفاوتی را از سایر رقبا دنبال می‌کند. گوگل متن، تصویر، صوت و ویدئو را می‌پذیرد، زمینه طولانی را پردازش می‌کند و سرعتش برای عامل‌های مبتنی‌بر تعامل مناسب است. این ترکیب، مدل Gemini 3.8 Flash را برای تحلیل مجموعه‌های بزرگ اسناد همراه با تصویر، پردازش محتوای صوتی و تصویری و گردشکارهای متصل به سرویس Google Workspace به گزینه‌ای متمایز تبدیل می‌کند. وبگاه MindsHub هزینه هر مأموریت آزمایشی این‌مدل را ۱.۲۴دلار گزارش کرده که فاصله قابل‌توجهی با مدل‌های ممتاز دارد. گوگل این‌مدل را با پنجره زمینه یک‌میلیون توکن و قیمت رقابتی ۰.۷۵دلار برای ورودی و ۳.۷۵دلار برای خروجی عرضه کرده و این قیمت تا پایان ۲۰۲۶ اعتبار دارد. وجود نسخه محدود Gemini 3.8 Flash Cyber برای حوزه تخصصی مرتبط با آسیب‌پذیری‌های سایبری نیز نشان داده شاخه Flash درحال‌حرکت از مدل سریع عمومی به‌سوی کاربردهای تخصصی‌تر است.

 

مدل Grok 4.6؛ پیوند داده زنده با چرخه استدلال
مزیت آن در دسترسی هم‌زمان به وب و محتوای زنده پلتفرم اجتماعی ایکس نهفته. این ویژگی برای پایش رویدادهای جاری، تحلیل فضای آنلاین و مأموریت‌هایی که داده تازه باید وارد چرخه استدلال شود، اهمیت پیدا می‌کند. این‌مدل پنجره زمینه ۵۰۰‌هزار توکنی دارد و قیمت پایه آن ۲‌دلار برای ورودی و ۶‌دلار برای خروجی است. داده‌های مقایسه‌ای یک نکته اقتصادی مهم را نیز آشکار می‌کنند. قیمت پایین هر توکن به مأموریت ارزان‌تر منتهی نمی‌شود زیرا مصرف بیشتر توکن می‌تواند هزینه نهایی را افزایش دهد.

 

مدل‌های وزن‌باز چینی؛ رقابت بر سر کنترل، هزینه و استقرار
بخش مهم دیگر تحول هوش مصنوعی در ۲۰۲۶ در مدل‌های دارای وزن‌باز دیده می‌شود. مدل GLM-5.3 Flash با ۳۲۰‌میلیارد پارامتر کل و ۱۸‌میلیارد پارامتر فعال، ورودی متن، تصویر و ویدئو و زمینه یک‌میلیون توکنی، نمونه برجسته این‌روند محسوب می‌شود. قیمت اعلامی مدل مذکور ۰.۱۵‌دلار برای ورودی و ۰.۵۰‌دلار برای خروجی است و در تخفیف عرضه پلتفرم OpenRouter به ۰.۰۷۵ و ۰.۲۵‌دلار می‌رسد. چنین ارقامی استفاده از مدل‌های قدرتمند را در مسیریابی، استخراج اطلاعات و پردازش انبوه ازنظر اقتصادی جذاب‌تر از گذشته می‌کند. علاوه‌براین، مدل جدید DeepSeek V4 نیز همین رقابت را از مسیر هزینه دنبال می‌کند. نسخه Pro مدل مذکور برای استدلال و برنامه‌نویسی و نسخه Flash آن برای سرعت و حجم بالا مناسب‌تر است. هزینه V4 Flash در ساعات کم‌تقاضا تا ۰.۲۲‌دلار برای یک‌میلیون توکن ورودی و ۰.۶۶‌دلار برای خروجی کاهش می‌یابد. مدل Qwen3.8-Flash شرکت علی‌بابا با وزن‌باز، ورودی متن، تصویر و ویدئو و زمینه یک‌میلیون توکنی طی روزهای اخیر عرضه شده است. 

 

روند بازار؛ جایگزینی معماری چندمدلی در دستیابی به کارآمدی
داده‌های گزارش‌های منتشره طی روزهای اخیر به نتیجه عملیاتی مهم می‌رسند: در مقطع کنونی، مزیت رقابتی سازمان‌ها و گزینه بهینه برای کاربران بیش‌ازآن‌که از دسترسی به یک مدل برتر حاصل شود، از توان طراحی درست سبد مدل‌ها ناشی خواهد شد. یک معماری کارآمد می‌تواند مدل ارزان و سریع را برای استخراج، دسته‌بندی و پیش‌نویس به‌کار گیرد مدلی مانند Sonnet 5 و Grok 4.6 یا GPT-5.6 Terra را به امور روزمره عامل‌ها اختصاص دهد و Astra و Fable 5.1 یا Opus 5 را تنها در مراحل پیچیده و سنگین فراخوانی کند. به‌عقیده بسیاری کارشناسان، معیار نهایی انتخاب باید هزینه تولید یک خروجی قابل‌قبول و مطلوب باشد. طول اسمی پنجره زمینه، قیمت هر میلیون توکن یا یک امتیاز بنچمارک به‌تنهایی کیفیت عملیاتی مدل‌های جدید هوش مصنوعی را تعیین نمی‌کنند. پایداری مدل پس از ده‌ها فراخوانی ابزار، هزینه تلاش مجدد برای انجام کار، کش، بازبینی انسانی، کیفیت استفاده از ابزار و محل پردازش داده بخشی از معادله هستند. نسل جدید مدل‌های هوش مصنوعی د‌رهمین‌نقطه معنای واقعی پیدا می‌کند. رقابت اکنون بر سر مدلی جریان دارد که بتواند درون سامانه عامل‌محور، مأموریت محول را با کیفیت قابل‌پذیرش، هزینه قابل‌کنترل و حداقل مداخله انسانی به‌پایان برساند.

ارسال دیدگاه شما

روزنامه در یک نگاه
ویژه نامه
بالای صفحه