Sun'iy intellektga hujum qilishda ishlatilgan ASCII smuggling usuli endi spam xabarlarda qo'llanilmoqda

Kiberjinoyatchilar sun'iy intellekt modellariga yashirin prompt injection hujumlari uchun mo'ljallangan ASCII smuggling usulidan endi email spam filtrlarini chetlab o'tishda foydalanmoqda. Ushbu usulda inson ko'ziga ko'rinmaydigan, ammo kompyuterlar o'qiydigan maxsus Unicode teglari orqali xabarlardagi kalit so'zlar niqoblanadi. Microsoft ma'lumotlariga ko'ra, fevral oyida ushbu uslubdagi spam xabarlar kuniga 21 mingdan 2,5 milliontagacha keskin oshgan. Mazkur hiyla zamonaviy mashinali o'rganish (ML) va tabiiy tilni qayta ishlash (NLP) asosidagi spam tasniflagichlarning tokenizatsiya jarayonini chalkashtirib yuboradi.
Sun'iy intellekt agentlariga zararli buyruqlarni yashirin kiritish (prompt injection) uchun qo'llanilgan «ASCII smuggling» texnikasi endi ommaviy spam tarqatuvchilar tomonidan elektron pochta filtrlarini aylanib o'tish maqsadida keng qo'llanila boshlandi. Ushbu usul katta til modellariga (LLM) ko'rinmas ko'rsatmalar berish vositasi sifatida ikki yil oldin e'tibor qozongan edi.
ASCII smuggling texnikasi 128 ta maxsus Unicode teglaridan (masalan, «A» harfini ifodalovchi U+E0041) foydalanadi. Ushbu belgilar tizimlar tomonidan to'liq o'qilsa-da, oddiy inson ko'ziga mutlaqo ko'rinmaydi. Spammerlar filtrlar taqiqlagan «credit», «term» yoki pul miqdori kabi kalit so'zlar orasiga ushbu belgilarni joylashtirmoqda. Masalan, «funding» so'zi o'rtasiga ko'rinmas teg qo'yilganda, inson uni odatdagidek o'qiydi, ammo filtrlar uni alohida bo'laklar sifatida qabul qiladi.
Microsoft kompaniyasi joriy yil boshida ushbu usuldan foydalanish holatlarining keskin o'sganini qayd etdi. Microsoft Defender for Office tizimi fevral oyining boshida kuniga taxminan 21 000 ta shunday holatni aniqlagan bo'lsa, to'rt kun ichida bu ko'rsatkich sutkasiga 2,5 milliontaga yetgan. Bunday yuqori faollik bir necha oy davom etib, may oyining o'rtalariga kelib pasaygan.
Ushbu usulning asosiy xavfi shundaki, u zamonaviy spam-filtrlarning asosi bo'lgan ML va NLP modellarining tokenizatsiya jarayonini buzadi. Standart matn klassifikatorlari so'zlarni to'liq ko'rish o'rniga sub-tokenlarga ajratadi; ko'rinmas belgilar kiritilishi esa modelni so'zni noto'g'ri yoki kamyob tokenlar sifatida tushunishga majbur qiladi. Microsoft o'z tahlilida dasturchilarga matnlarni modellar tahliliga kiritishdan oldin to'g'ri normalizatsiya qilish va ko'rinmas belgilarni filtrlash bo'yicha tavsiyalar berdi.
Tizim ma'murlari va ML-dasturchilar matn klassifikatsiyasi hamda AI modellariga kelayotgan ma'lumotlarni qayta ishlashdan oldin yashirin Unicode belgilarini olib tashlaydigan normalizatsiya qoidalarini joriy etishlari lozim.