اخیراً محققان شرکت فورسپوینت (Forcepoint) در بخش X-Labs خود، آسیبپذیری AI جدیدی را کشف کردهاند که نگرانیهای جدی در مورد اعتمادپذیری دستیاران هوش مصنوعی ایجاد میکند.
به گزارش گجت نیوز، این کشف نشان میدهد چگونه عاملهای هوش مصنوعی میتوانند با دادههای غلط مسموم شوند و آنها را به عنوان حقایق معتبر ذخیره کنند. یافتههای فورسپوینت در مورد چگونگی سوءاستفاده از حافظه بلندمدت هوش مصنوعی، تبعات گستردهای برای امنیت و کاربرد سیستمهای هوش مصنوعی دارد.
یک عامل هوش مصنوعی (ایجنت) میتواند با خواندن متون مخفی در صفحات وب، اطلاعات نادرست را به عنوان یک واقعیت دائمی در حافظه بلندمدت خود ذخیره کند. این اطلاعات جعلی هفتهها بعد، در کارهای نامربوط دیگر، توسط هوش مصنوعی بازیابی و مورد اعتماد قرار میگیرد. این روش که مسمومیت حافظه پایدار نام دارد، یک آسیبپذیری امنیتی جدی است.
MINJA (بهطور کامل Memory INJection Attack) نام آکادمیک این حمله است که در کنفرانس NeurIPS 2025 معرفی شد. این حمله بدون نیاز به دسترسیهای ویژه یا امتیازات بالا، فقط با ارسال درخواستهای عادی از طریق رابط کاربری استاندارد انجام میشود.
MINJA نرخ موفقیت بالای ۹۵ درصد برای تزریق و بیش از ۷۰ درصد برای حمله را در مدلهایی نظیر GPT-4o-mini، جمنای ۲.۰ فلش و لاما ۳.۱ ۸B نشان داده است. اگرچه این ارقام ممکن است در شرایط واقعی کمتر باشند، اما این تهدید برای محصولات پرکاربردی همچون ChatGPT، جمنای، کلود و مایکروسافت ۳۶۵ کوپایلوت همچنان قابل توجه است.
فورسپوینت برای مقابله با این پدیده، پیشنهاد میکند که بهجای اینکه خاطرات استخراج شده را به عنوان حقایق مطلق در نظر بگیریم، آنها را به عنوان اشیایی قابل بازرسی تلقی کنیم. این رویکرد شامل ذخیره هر حافظه به همراه فرادادههایی مانند منبع، نوع منبع، تایید کاربر و یک امتیاز ریسک است. استفاده از عباراتی که رفتار آینده را شکل میدهند (مانند «از این به بعد» یا «این را پیشفرض قرار بده») یا ظهور ناگهانی یک دامنه، تماس یا فروشنده جدید، به این امتیاز ریسک میافزاید.
تشخیص تناقض نیز در این طرح مهم است؛ اگر یک حافظه جدید با اطلاعات موجود در تضاد باشد، هر دو نمیتوانند درست باشند. در این صورت، سیستم تعارض را علامتگذاری کرده و آیتم جدید را برای تایید کاربر نگه میدارد، به جای آنکه آن را بهطور خودکار بازنویسی کند.
اطلاعات حساس مانند دستورالعملهای پرداخت، جزئیات بانکی یا تنظیمات امنیتی نیز وزن بالاتری دریافت میکنند. با این حال، هیچ یک از این روشها مشکل اساسی را حل نمیکند: عاملهای هوش مصنوعی، حافظه بازیابیشده را به عنوان تجربه خود میدانند، نه صرفاً یک ورودی. امتیازدهی فقط هزینه مسمومیت حافظه هوش مصنوعی را بالا میبرد و اعتقاد عامل را تغییر نمیدهد.