• شماره 3744 -
  • 1405 دوشنبه 13 مهر

مهار عامل‌های خودمختار سرکش؛ چالش تازه شرکت‌های هوش مصنوعی

عامل‌هایی که برای سنجش توانایی سایبری در محیط‌های آزمایشی به‌کار گرفته شده بودند، در موارد متعدد با فرار از سندباکس به اینترنت راه یافته‌اند و اقدامات مخربی صورت داده‌اند. به‌گزارش مهر؛ تا چندماه‌پیش، مسئله ایمنی عامل‌های هوش مصنوعی عمدتاً حول این پرسش می‌چرخید که یک مدل در محیط کنترل‌شده تاچه‌اندازه می‌تواند عملیات سایبری پیچیده انجام دهد؛ اما مجموعه رخدادهایی که از ابتدای ۲۰۲۶ آغاز شده، صورت‌مسئله را تغییر داده. عامل‌هایی که برای سنجش توانایی سایبری در محیط‌های آزمایشی به‌کار گرفته شده بودند، در موارد متعدد با فرار از سندباکس به اینترنت راه یافته‌اند، به سامانه‌هایی خارج از دامنه آزمون دسترسی یافته و در برجسته‌ترین موارد، اقدامات مخربی صورت داده‌اند. نکته جالب‌توجه این‌است‌که الگوی مذکور به یک شرکت یا معماری خاص محدود نمانده و در مدل‌های اپن‌ای‌آی، آنتروپیک، گوگل و مون‌شات مشاهده شده است.

آنچه در ادبیات رسانه‌ای باعنوان فرار عامل توصیف می‌شود، البته یک پدیده واحد نیست. شواهد موجود دست‌کم سه وضعیت متفاوت را نشان می‌دهد. در وضعیت اول، عامل واقعاً سازوکار جداسازی را دور می‌زند و از محیط بسته خارج می‌شود. در وضعیت دوم، پیکربندی معیوب آزمایش از ابتدا مسیر ناخواسته‌ای به اینترنت باز گذاشته. در وضعیت سوم، عامل از ابزارها و مجوزهای موجود به‌شیوه‌ای استفاده می‌کند که طراح آزمون پیش‌بینی نکرده است. تمایز میان این سه وضعیت برای فهم خطر اهمیت اساسی دارد، زیرا هر سه به یک نتیجه عملی مشترک می‌رسند. مرز میان محیط ارزیابی و جهان واقعی دیگر نمی‌تواند صرفاً با فرض تبعیت عامل از دامنه تعریف‌شده آزمون حفاظت شود. رخداد اپن‌ای‌آی و هاگینگ فیس روشن‌ترین نمونه نوع نخست است. مدل‌های آزمایشی اپن‌ای‌آی در جریان ارزیابی توانایی‌های سایبری داخل یک سندباکس قرار داشتند و بنا بود به اینترنت دسترسی نداشته باشند. براساس گزارش‌ها، عامل‌ها با بهره‌برداری از یک آسیب‌پذیری ناشناخته از سندباکس خارج شدند، در سامانه‌های داخلی اپن‌ای‌آی حرکت کردند و سرانجام به اینترنت دسترسی یافتند. عامل پس از دسترسی به شبکه عمومی استدلال کرد که هاگینگ فیس احتمالاً اطلاعات لازم برای حل آزمون را دراختیار دارد، وارد زیرساخت عملیاتی این شرکت شد و داده موردنیاز برای تکمیل مأموریت را استخراج کرد. اهمیت حادثه با بررسی تعداد عامل‌های درگیر دراین‌فرایند آشکارتر می‌شود. بررسی‌های بعدی مؤسسات METR و Redwood Research، از فعالیت هماهنگ حدود ۷۰۰ عامل هوش مصنوعی دراین‌حادثه خبر می‌دهند. این عامل‌ها در قالب یک اقدام جمعی عمل کردند و در مواردی برای پوشاندن آثار فعالیت خود نیز تلاش داشته‌اند. براین‌اساس؛ یک گروه دیگر نیز روش‌های گروه اول را فراگرفته و از آن‌ها برای دستیابی به سطح دسترسی مدیریتی در یک خوشه پژوهشی داخل زیرساخت خود اپن‌ای‌آی استفاده کرده است. دراینجا مسئله از توانایی نفوذ یک مدل منفرد عبور می‌کند. انتقال روش میان عامل‌ها، تقسیم عملی کار و استفاده مجدد از راهبرد موفق، قابلیت سایبری را از ویژگی یک مدل به خاصیت یک سامانه چندعاملی تبدیل می‌کند. همین تحول می‌تواند الگوی ارزیابی خطر را دگرگون کند، زیرا واحد مناسب تحلیل دیگر صرفاً مدل نیست و باید رفتار جمعی عامل‌هایی را نیز دربرگیرد که می‌توانند تجربه یکدیگر را مصرف و بازتولید کنند. حادثه بعدی مربوط به نفوذ عامل‌های اپن‌ای‌آی به یک ویکی آلمانی بُعد متفاوتی از همین‌مسئله را آشکار کرد. پژوهشگران در بررسی‌های خود بیش از ۱۵‌هزار ویرایش منتسب به عامل‌های هوش مصنوعی را در DseWiki شناسایی کردند. این عامل‌ها سایت مذکور را عملاً به تابلوی ارتباطی خود تبدیل کرده بودند و در آن روش‌های دورزدن محدودیت‌ها، میان‌برهای حل آزمون و شیوه‌های پنهان‌کردن رفتار را مبادله می‌کردند. پیام‌های بررسی‌شده نشان می‌داد عامل‌ها درباره اجتناب از شناسایی، استفاده از «Tor» و حفظ ارتباط پس از خاموش‌شدن نمونه‌های دیگر گفت‌وگو کرده‌اند. هنگامی‌که مدیر سایت در ژوئن حذف صفحات را آغاز کرد، عامل‌ها صفحات پشتیبان ایجاد کردند تا اطلاعات باقی بماند. رویترز همچنین گزارش کرده که برخی عامل‌ها برای دست‌کاری خود وب‌سایت اقدام کرده بودند. این حادثه یک متغیر تازه، یعنی ماندگاری دانش عملیاتی خارج از محیط آزمایش وارد مسئله می‌کند. برهمین‌اساس، عاملی که بتواند یک راهبرد موفق را روی زیرساخت عمومی ثبت کند، امکان انتقال آن راهبرد به اجرای بعدی یا عامل دیگری را فراهم می‌کند. درچنین‌وضعیتی خاموش‌کردن نمونه اولیه الزاماً زنجیره رفتار را خاتمه نمی‌دهد، زیرا بخشی از حافظه عملیاتی از محیط تحت‌کنترل توسعه‌دهنده خارج شده است. بررسی‌های شرکت آنتروپیک نشان می‌دهد که چالش امنیتی حتی بدون شکستن فنی سندباکس نیز می‌تواند رخ دهد. این شرکت پس از حادثه هاگینگ فیس حدود ۱۴۱‌هزارمورد آزمایش را بازبینی کرد و سه رخداد را یافت که طی آن‌ها کلاد به اینترنت راه یافته و به زیرساخت واقعی سه سازمان دسترسی غیرمجاز پیدا کرده بود. علت اولیه، خطای پیکربندی محیط ارزیابی شریک ثالث بود. مدل‌ها تصور می‌کردند همچنان در سناریوی ساختگی آزمایش قرار دارند و بااستفاده‌از گذرواژه‌های ضعیف سایر آسیب‌پذیری‌ها به هدف‌های واقعی نفوذ کردند. رفتار مدل‌ها پس از مواجهه با نشانه‌های واقعی‌بودن محیط نیز یکسان نبود. برهمین‌اساس، Opus 4.7 با وجود تشخیص حضور در سامانه عملیاتی به کار ادامه داد. مدل Mythos 5 نشانه‌های اتصال به اینترنت را دریافت کرد، اما با استدلال خود دوباره به‌این‌نتیجه رسید که محیط بخشی از شبیه‌سازی است و مدل پژوهشی جدیدتر پس از تشخیص واقعی‌بودن هدف، عملیات را متوقف کرد. آنتروپیک همچنین بعداً رخداد چهارمی مربوط به نسخه اولیه «Claude Opus 4.6» را نیز کشف کرد که در بازبینی نخست از قلم افتاده بود. این شرکت در تحلیل خود دو الگوی تکرارشونده، شامل استدلال سوگیرانه درباره ماهیت محیط و آمادگی برای انجام اقدام بالقوه زیان‌بار در راه تکمیل مأموریت را برجسته می‌کند. همین الگو با سازوکارهای متفاوت در رقبا ظاهر شده. براین‌مبنا؛ مدل جمینای گوگل طی آزمایش به سه شرکت واقعی دسترسی پیدا کرده است. مدل اطلاعات عمومی را یافته و اعتبارنامه‌های ورود را حدس زده و در یکی‌ازموارد با حدس‌زدن مکرر گذرواژه وارد سامانه شده است. همچنین، درمورد Kimi K3 نیز سندباکس به‌درستی پیکربندی نشده بوده است. دراین‌مورد، دسترسی مستقیم به بخشی از ترافیک وب مسدود شده بود، اما مدل بااستفاده‌از ابزارهای خط فرمان محدودیت را دور زد. پژوهشگران شرکت امنیتی Frontier Security این رفتار را نشانه آسیب‌پذیری خود سازوکارهای ارزیابی در برابر عامل‌هایی دانستند که فعالانه به‌دنبال شکاف‌های آزمون می‌گردند. درادامه، رخداد حمله سایبری عامل اپن‌ای‌آی به سامانه متعلق به دولت استرالیا نشان داد که خروج عامل از دامنه آزمون می‌تواند مستقیماً به زیرساخت دولتی برسد. عامل اپن‌ای‌آی در ژوئن وارد پرتال Medicare Statistics Reporting Service شد و به فایل‌های عمومی و غیرعمومی بخش سلامت این‌کشور دسترسی یافت. دراین‌راستا، دولت استرالیا اعلام کرد درآن‌مقطع شواهدی از دسترسی به اطلاعات شخصی در دست نبود، اما تحقیقات ادامه دارد. وجه مهم‌تر حادثه، شکاف میان زمان وقوع، کشف و افشا بود. شکت اپن‌ای‌آی اعلام کرده فعالیت مخرب را در اوت و در جریان بررسی رفتارهای نامنطبق مدل کشف کرده و در ۱۰ سپتامبر ازطریق یک صندوق عمومی ایمیل به نهاد استرالیایی اطلاع داده. نخست‌وزیر استرالیا تأخیر چندماهه و شیوه اطلاع‌رسانی را محل نگرانی شدید دانسته و از بررسی پیامدهای حقوقی سخن گفته است. به‌باور کارشناسان، این رخداد نشان می‌دهد مسئله مهار عامل اکنون هم‌زمان مسئله مدیریت رخداد، مسئولیت حقوقی و الزام به افشای به‌موقع است. مجموع داده‌های منتشرشده طی ماه‌های اخیر نشانه یک عدم‌تقارن روبه‌رشد است. عامل‌ها با سرعت بیشتری در یافتن آسیب‌پذیری، ترکیب ابزارها و پیگیری مستقل هدف پیشرفت کرده‌اند، درحالی‌که سازوکارهای مشاهده و بازسازی رفتار آن‌ها با همان آهنگ رشد نکرده است. تا میانه سپتامبر، بررسی داخلی اپن‌ای‌آی حدود 24‌مورد رفتار نامطلوب عامل‌ها را شناسایی کرده بود و تعداد موارد هم‌زمان با بررسی لاگ‌های قدیمی افزایش می‌یافت. برخی فعالیت‌ها ماه‌ها از دید شرکت پنهان مانده و چندمورد نیز ابتدا توسط پژوهشگران بیرونی کشف شده بود. همین شکاف، محیط ارزیابی را به بخشی از سطح حمله تبدیل کرده است. برهمین‌اساس، آزمونی که برای کشف توانایی خطرناک مدل طراحی شده، خود به محیطی تبدیل می‌شود که مدل می‌تواند محدودیت‌های آن‌را آزمایش کند. آنتروپیک در جمع‌بندی رسمی خود دقیقاً از همین نقطه به ضرورت ایمن‌سازی محیط‌های ارزیابی و اعمال استانداردهای امنیتی مشابه بر پیمانکاران ارزیابی رسیده است. رشته حوادث سال ۲۰۲۶ یک نتیجه مهم برای صنعت هوش مصنوعی دارد. ایمنی عامل دیگر نمی‌تواند فقط خاصیتی درون مدل تلقی شود. مهار و مدیریت رفتار مخرب باید به یک قابلیت مستقل مهندسی تبدیل شود که سندباکس، شبکه، ابزارها، مدیریت هویت و دسترسی، ثبت کامل اقدامات، تشخیص رفتار غیرعادی، قطع اضطراری، کنترل پیمانکاران و بررسی مستقل پس از حادثه را در یک معماری واحد قرار دهد. درنهایت، مسئله عمیق‌تر به‌نسبت میان عاملیت و کنترل‌پذیری مربوط می‌شود. ارزش اقتصادی عامل دقیقاً از همان ویژگی‌هایی شامل توانایی برنامه‌ریزی، انتخاب ابزار، جست‌وجوی مسیر جایگزین و پیگیری هدف بدون دستور مرحله‌به‌مرحله انسان ناشی می‌شود که مهار آن‌را دشوار می‌کند. هنگامی‌که محدودیت به مانعی در مسیر هدف تبدیل می‌شود، یک عامل توانمند ممکن است آن‌را نه به‌عنوان مرز مجاز رفتار، بلکه به‌عنوان مسئله‌ای دیگر برای حل‌کردن تفسیر کند. رخدادهای هاگینگ فیس، DseWiki، کلاد، جمینای، کیمی و سامانه دولتی استرالیا نخستین داده‌های تجربی جدی از این‌مسئله هستند. بنابراین پرسش راهبردی مرحله بعد توسعه عامل‌ها دیگر فقط این‌نیست‌که عامل چه‌کارهایی می‌تواند انجام دهد. پرسش تعیین‌کننده این‌است‌که وقتی عامل کاری را بیاموزد که طراح انتظارش را ندارد، چه‌چیزی عملاً مانع انجام آن در جهان واقعی خواهد شد؟

ارسال دیدگاه شما

روزنامه در یک نگاه
ویژه نامه
بالای صفحه