• شماره 3710 -
  • 1405 سه‌شنبه 3 شهريور

گزارش

رقابت هوش‌های مصنوعی در ۲۰۲۶

رقابت مدل‌های هوش مصنوعی در سال ۲۰۲۶ به مرحله‌ای رسیده که پرسش سنتی «بهترین مدل کدام است؟» بخش بزرگی از معنای خود را از دست داده. به‌گزارش مهر؛ داده‌های تازه وبگاه Arena.ai تصویری چندقطبی از مرز فناوری ترسیم می‌کنند. براین‌مبنا؛ آنتروپیک در متن، کدنویسی و عامل‌های هوشمند موقعیتی برجسته دارد، اپن‌ای‌آی در تولید و ویرایش تصویر فاصله معناداری با رقبا ایجاد کرده، گوگل حوزه تولید ویدئو را دراختیار گرفته و بازیگران چینی مانند مون‌شات، علی‌بابا، Z.ai، بایت‌دنس و مینی‌مکس در بخش‌هایی از مرز عملکرد، مستقیماً با آزمایشگاه‌های آمریکایی رقابت می‌کنند.

اهمیت بنچمارک Arena.ai از روش ارزیابی آن ناشی می‌شود. رتبه‌بندی‌های اصلی این پلتفرم بر مقایسه‌های دوبه‌دوی پاسخ مدل‌ها و ترجیح کاربران واقعی بنا شده‌اند و امتیازها با مدل آماری مدل بردلی-تری محاسبه می‌شوند. درواقع، Arena.ai در کنار رتبه خام، «بازه رتبه» را نیز منتشر می‌کند تا عدم‌قطعیت آماری آشکار بماند؛ بنابراین تفاوت چند امتیازی میان دو مدل الزاماً به‌معنای برتری قطعی یکی بر دیگری نیست؛ Arena.ai در سال ۲۰۲۶ شاخص Factuality را نیز به Text و Search افزود که با استخراج و راستی‌آزمایی ادعاهای قابل‌بررسی، صحت پاسخ را در کنار ترجیح انسانی اندازه‌گیری می‌کند. در مهم‌ترین جدول عمومی Arena.ai، یعنی Text Arena، داده‌های ۲۱ اوت ۲۰۲۶ که بر بیش از ۷.۹‌میلیون رأی و ۳۹۴ مدل استوار است، موقعیت بسیار قدرتمندی برای آنتروپیک نشان می‌دهد. براین‌مبنا؛ Claude Fable 5 با امتیاز ۱۵۰۸ در رتبه نخست قرار دارد و Claude Opus 4.6 با ۱۵۰۴ و Claude Opus 4.7 با ۱۵۰۲ جایگاه‌های دوم و سوم را به‌خود اختصاص داده‌اند. پس‌ازآن‌ها Muse Spark 1.2 متعلق به متا با امتیاز ۱۴۹۸ است. نکته تعیین‌کننده، تراکم خانواده Claude در صدر جدول است. چهار مدل آنتروپیک میان شش رتبه نخست حضور دارند. چنین آرایشی نشان می‌دهد برتری آنتروپیک درحال‌حاضر بیشتر به یک «خانواده توانمندی» شباهت دارد تا موفقیت یک مدل منفرد. همین الگو در زبان انگلیسی نیز تکرار می‌شود و Claude Fable 5 با امتیاز ۱۵۱۵ صدرنشین است. درمقابل، بهترین مدل اپن‌ای‌آی در داده ۱۹ اوت، GPT-5.6 Sol با امتیاز ۱۴۸۲ در رتبه ۱۸ جدول کلی متن قرار گرفته بود. فاصله رتبه، هم‌زمان با هم‌پوشانی بعضی بازه‌های اطمینان، نشان می‌دهد: ترجیح کاربران Arena.ai در تعاملات عمومی متنی اکنون به‌شکل محسوسی به‌سمت Claude متمایل شده. برتری آنتروپیک در حوزه کدنویسی حتی واضح‌تر از بخش تولید متن دیده می‌شود. براین‌اساس؛ در زیرشاخه Coding، سه مدل Claude Opus 4.6، Claude Opus 4.7 و Claude Fable 5 هر‌سه امتیاز ۱۵۵۲ کسب کرده‌اند و رتبه‌های نخست تا سوم را دراختیار دارند. همچنین، مدل Kimi K3 متعلق به شرکت مون‌شات نیز با امتیاز ۱۵۴۴ در میان مدعیان اصلی قرار گرفته. تصویر کلی در بخش Code Arena WebDev نیز مشابه استY هرچند قدرت بازیگران آسیایی دراین‌بخش آشکارتر می‌شود. برپایه داده‌های ۲۱ اوت و بیش از ۶۰۳هزار رأی، Claude Fable 5 با امتیاز ۱۶۹۱ در جایگاه اول، Kimi K3 در رتبه دوم و Qwen 3.8-Max متعلق به علی‌بابا با ۱۶۶۹ در رتبه سوم قرار دارند. علاوه‌براین؛ GPT-5.6 Sol نیز با سازوکار کدنویسی اختصاصی خود رتبه هفتم و امتیاز ۱۶۱۹ را به‌دست آورده است. این‌بخش یکی از مهم‌ترین نشانه‌های تغییر ساختار صنعت است. براین‌مبنا، گویا مون‌شات و علی‌بابا دیگر در سطح مدل‌های «کم‌هزینه جایگزین» ظاهر نمی‌شوند و در برخی وظایف توسعه نرم‌افزار مستقیماً در مرز عملکرد قرار گرفته‌اند. در طراحی مبتنی‌بر مرجع نیز Kimi K3 با امتیاز ۱۷۲۱ حتی بالاتر از Claude Fable 5 ایستاده است. در بخش Vision Arena که توانایی مدل‌ها برای تحلیل و استدلال روی ورودی‌های بصری را می‌سنجد، مدل Claude Fable 5 با امتیاز ۱۳۱۵ رتبه اول را دارد. مدل‌های Qwen 3.8-Max و Claude Opus 4.7 هردو با امتیاز ۱۳۰۱ در رتبه‌های بعد قرار گرفته‌اند. این جدول بر بیش از ۱.۱۸‌میلیون رأی و ۱۴۶ مدل استوار است. بخش متن‌باز این‌حوزه نیز اهمیت راهبردی دارد. دراین‌بخش، Kimi K2.6 با امتیاز ۱۲۶۳ بهترین مدل مجوزدار باز در Vision Arena است و پس‌ازآن، Gemma 4 31B گوگل، Kimi K2 Thinking و Qwen3.5 قرار دارند. فاصله موجود با مدل‌های اختصاصی هنوز محسوس است؛ اما تراکم مدل‌های متن‌باز آسیایی دراین‌رده نشان می‌دهد شکاف قابلیت به‌تدریج درحال‌کاهش است. بزرگ‌ترین برتری اختصاصی یک شرکت را باید در حوزه تصویر جست. براین‌مبنا؛ در بخش Text-to-Image Arena، مدل GPT Image 2 با امتیاز ۱۳۸۱ در رتبه اول و MAI-Image-2.6 با ۱۳۳۶ و Grok Imagine Image 2.0 با ۱۳۱۶ در رتبه‌های بعدی ایستاده‌اند. فاصله ۴۵‌امتیازی میان رتبه اول و دوم، همراه با بازه اطمینان محدود GPT Image 2، برتری نسبتاً قدرتمند اپن‌ای‌آی را نشان می‌دهد. این رتبه‌بندی بر نزدیک به ۵.۹۲‌میلیون رأی بنا شده است. درادامه، مزیت اپن‌ای‌آی در ویرایش تصویر برجسته‌تر می‌شود. مدل GPT Image 2 با امتیاز ۱۴۶۳ و حدود ۱۹۹‌هزار رأی در صدر جدول ۱۷ اوت قرار دارد؛ نیز Grok Imagine Image 2.0 با ۱۴۳۹ و MAI-Image-2.6 با ۱۴۲۰ در جایگاه‌های دوم و سوم هستند. حجم کل رأی‌های بخش Image Edit Arena نیز از ۲۹‌میلیون عبور کرده که این‌حوزه را به یکی از بزرگ‌ترین مجموعه‌های ترجیح انسانی Arena.ai تبدیل می‌کند؛ و چنین به‌نظر می‌رسد: اپن‌ای‌آی در رتبه‌بندی عمومی متن فعلاً صدر را به آنتروپیک واگذار کرده و در لایه تولید و ویرایش تصویر مزیت تخصصی قدرتمندی ساخته است. معماری رقابت از همین نقطه چندبعدی می‌شود. جایگاه یک شرکت را دیگر نمی‌توان با یک مدل زبانی واحد اندازه گرفت. بررسی داده‌های Arena.ai نشان می‌دهد که بازار تولید ویدئو ساختار متفاوتی دارد. در داده‌های ۱۴ اوت بخش Text-to-Video Arena، مدل Gemini Omni Flash گوگل با امتیاز ۱۵۱۲ صدرنشین است؛ FLUX 3 Video متعلق به Black Forest Labs با ۱۴۹۴ و Seedance 2.0 از بایت‌دنس با ۱۴۸۲ در رتبه‌های دو و سه قرار دارند. مدل Muse Video، متعلق به متا و مینی‌مکس اچ 3 نیز رتبه‌های بعد را اشغال کرده‌اند؛ درحالی‌که Sora 2 متعلق به اپن‌ای‌آی با امتیاز ۱۳۶۴ در رتبه هشتم قرار گرفته است. ازسویی، جدول ویرایش ویدئو Arena.ai تصویر دیگری ارائه می‌دهد: مدل Seedance 2.5 متعلق به بایت‌دنس با امتیاز ۱۴۱۱ در صدر قرار دارد و مینی‌مکس اچ 3 با ۱۳۸۸ و Gemini Omni Flash با ۱۳۵۸ در تعقیب آن هستند؛ بنابراین زنجیره ارزش ویدئوی مولد میان چند بازیگر توزیع شده و هیچ آزمایشگاهی بر تولید و ویرایش به‌طور هم‌زمان سلطه ندارد.

 

ارسال دیدگاه شما

روزنامه در یک نگاه
ویژه نامه
بالای صفحه