گزارش
رقابت هوشهای مصنوعی در ۲۰۲۶
رقابت مدلهای هوش مصنوعی در سال ۲۰۲۶ به مرحلهای رسیده که پرسش سنتی «بهترین مدل کدام است؟» بخش بزرگی از معنای خود را از دست داده. بهگزارش مهر؛ دادههای تازه وبگاه Arena.ai تصویری چندقطبی از مرز فناوری ترسیم میکنند. براینمبنا؛ آنتروپیک در متن، کدنویسی و عاملهای هوشمند موقعیتی برجسته دارد، اپنایآی در تولید و ویرایش تصویر فاصله معناداری با رقبا ایجاد کرده، گوگل حوزه تولید ویدئو را دراختیار گرفته و بازیگران چینی مانند مونشات، علیبابا، Z.ai، بایتدنس و مینیمکس در بخشهایی از مرز عملکرد، مستقیماً با آزمایشگاههای آمریکایی رقابت میکنند.
اهمیت بنچمارک Arena.ai از روش ارزیابی آن ناشی میشود. رتبهبندیهای اصلی این پلتفرم بر مقایسههای دوبهدوی پاسخ مدلها و ترجیح کاربران واقعی بنا شدهاند و امتیازها با مدل آماری مدل بردلی-تری محاسبه میشوند. درواقع، Arena.ai در کنار رتبه خام، «بازه رتبه» را نیز منتشر میکند تا عدمقطعیت آماری آشکار بماند؛ بنابراین تفاوت چند امتیازی میان دو مدل الزاماً بهمعنای برتری قطعی یکی بر دیگری نیست؛ Arena.ai در سال ۲۰۲۶ شاخص Factuality را نیز به Text و Search افزود که با استخراج و راستیآزمایی ادعاهای قابلبررسی، صحت پاسخ را در کنار ترجیح انسانی اندازهگیری میکند. در مهمترین جدول عمومی Arena.ai، یعنی Text Arena، دادههای ۲۱ اوت ۲۰۲۶ که بر بیش از ۷.۹میلیون رأی و ۳۹۴ مدل استوار است، موقعیت بسیار قدرتمندی برای آنتروپیک نشان میدهد. براینمبنا؛ Claude Fable 5 با امتیاز ۱۵۰۸ در رتبه نخست قرار دارد و Claude Opus 4.6 با ۱۵۰۴ و Claude Opus 4.7 با ۱۵۰۲ جایگاههای دوم و سوم را بهخود اختصاص دادهاند. پسازآنها Muse Spark 1.2 متعلق به متا با امتیاز ۱۴۹۸ است. نکته تعیینکننده، تراکم خانواده Claude در صدر جدول است. چهار مدل آنتروپیک میان شش رتبه نخست حضور دارند. چنین آرایشی نشان میدهد برتری آنتروپیک درحالحاضر بیشتر به یک «خانواده توانمندی» شباهت دارد تا موفقیت یک مدل منفرد. همین الگو در زبان انگلیسی نیز تکرار میشود و Claude Fable 5 با امتیاز ۱۵۱۵ صدرنشین است. درمقابل، بهترین مدل اپنایآی در داده ۱۹ اوت، GPT-5.6 Sol با امتیاز ۱۴۸۲ در رتبه ۱۸ جدول کلی متن قرار گرفته بود. فاصله رتبه، همزمان با همپوشانی بعضی بازههای اطمینان، نشان میدهد: ترجیح کاربران Arena.ai در تعاملات عمومی متنی اکنون بهشکل محسوسی بهسمت Claude متمایل شده. برتری آنتروپیک در حوزه کدنویسی حتی واضحتر از بخش تولید متن دیده میشود. برایناساس؛ در زیرشاخه Coding، سه مدل Claude Opus 4.6، Claude Opus 4.7 و Claude Fable 5 هرسه امتیاز ۱۵۵۲ کسب کردهاند و رتبههای نخست تا سوم را دراختیار دارند. همچنین، مدل Kimi K3 متعلق به شرکت مونشات نیز با امتیاز ۱۵۴۴ در میان مدعیان اصلی قرار گرفته. تصویر کلی در بخش Code Arena WebDev نیز مشابه استY هرچند قدرت بازیگران آسیایی دراینبخش آشکارتر میشود. برپایه دادههای ۲۱ اوت و بیش از ۶۰۳هزار رأی، Claude Fable 5 با امتیاز ۱۶۹۱ در جایگاه اول، Kimi K3 در رتبه دوم و Qwen 3.8-Max متعلق به علیبابا با ۱۶۶۹ در رتبه سوم قرار دارند. علاوهبراین؛ GPT-5.6 Sol نیز با سازوکار کدنویسی اختصاصی خود رتبه هفتم و امتیاز ۱۶۱۹ را بهدست آورده است. اینبخش یکی از مهمترین نشانههای تغییر ساختار صنعت است. براینمبنا، گویا مونشات و علیبابا دیگر در سطح مدلهای «کمهزینه جایگزین» ظاهر نمیشوند و در برخی وظایف توسعه نرمافزار مستقیماً در مرز عملکرد قرار گرفتهاند. در طراحی مبتنیبر مرجع نیز Kimi K3 با امتیاز ۱۷۲۱ حتی بالاتر از Claude Fable 5 ایستاده است. در بخش Vision Arena که توانایی مدلها برای تحلیل و استدلال روی ورودیهای بصری را میسنجد، مدل Claude Fable 5 با امتیاز ۱۳۱۵ رتبه اول را دارد. مدلهای Qwen 3.8-Max و Claude Opus 4.7 هردو با امتیاز ۱۳۰۱ در رتبههای بعد قرار گرفتهاند. این جدول بر بیش از ۱.۱۸میلیون رأی و ۱۴۶ مدل استوار است. بخش متنباز اینحوزه نیز اهمیت راهبردی دارد. دراینبخش، Kimi K2.6 با امتیاز ۱۲۶۳ بهترین مدل مجوزدار باز در Vision Arena است و پسازآن، Gemma 4 31B گوگل، Kimi K2 Thinking و Qwen3.5 قرار دارند. فاصله موجود با مدلهای اختصاصی هنوز محسوس است؛ اما تراکم مدلهای متنباز آسیایی دراینرده نشان میدهد شکاف قابلیت بهتدریج درحالکاهش است. بزرگترین برتری اختصاصی یک شرکت را باید در حوزه تصویر جست. براینمبنا؛ در بخش Text-to-Image Arena، مدل GPT Image 2 با امتیاز ۱۳۸۱ در رتبه اول و MAI-Image-2.6 با ۱۳۳۶ و Grok Imagine Image 2.0 با ۱۳۱۶ در رتبههای بعدی ایستادهاند. فاصله ۴۵امتیازی میان رتبه اول و دوم، همراه با بازه اطمینان محدود GPT Image 2، برتری نسبتاً قدرتمند اپنایآی را نشان میدهد. این رتبهبندی بر نزدیک به ۵.۹۲میلیون رأی بنا شده است. درادامه، مزیت اپنایآی در ویرایش تصویر برجستهتر میشود. مدل GPT Image 2 با امتیاز ۱۴۶۳ و حدود ۱۹۹هزار رأی در صدر جدول ۱۷ اوت قرار دارد؛ نیز Grok Imagine Image 2.0 با ۱۴۳۹ و MAI-Image-2.6 با ۱۴۲۰ در جایگاههای دوم و سوم هستند. حجم کل رأیهای بخش Image Edit Arena نیز از ۲۹میلیون عبور کرده که اینحوزه را به یکی از بزرگترین مجموعههای ترجیح انسانی Arena.ai تبدیل میکند؛ و چنین بهنظر میرسد: اپنایآی در رتبهبندی عمومی متن فعلاً صدر را به آنتروپیک واگذار کرده و در لایه تولید و ویرایش تصویر مزیت تخصصی قدرتمندی ساخته است. معماری رقابت از همین نقطه چندبعدی میشود. جایگاه یک شرکت را دیگر نمیتوان با یک مدل زبانی واحد اندازه گرفت. بررسی دادههای Arena.ai نشان میدهد که بازار تولید ویدئو ساختار متفاوتی دارد. در دادههای ۱۴ اوت بخش Text-to-Video Arena، مدل Gemini Omni Flash گوگل با امتیاز ۱۵۱۲ صدرنشین است؛ FLUX 3 Video متعلق به Black Forest Labs با ۱۴۹۴ و Seedance 2.0 از بایتدنس با ۱۴۸۲ در رتبههای دو و سه قرار دارند. مدل Muse Video، متعلق به متا و مینیمکس اچ 3 نیز رتبههای بعد را اشغال کردهاند؛ درحالیکه Sora 2 متعلق به اپنایآی با امتیاز ۱۳۶۴ در رتبه هشتم قرار گرفته است. ازسویی، جدول ویرایش ویدئو Arena.ai تصویر دیگری ارائه میدهد: مدل Seedance 2.5 متعلق به بایتدنس با امتیاز ۱۴۱۱ در صدر قرار دارد و مینیمکس اچ 3 با ۱۳۸۸ و Gemini Omni Flash با ۱۳۵۸ در تعقیب آن هستند؛ بنابراین زنجیره ارزش ویدئوی مولد میان چند بازیگر توزیع شده و هیچ آزمایشگاهی بر تولید و ویرایش بهطور همزمان سلطه ندارد.