Amazon AI modellarini o‘rgatish uchun nodir kitoblarni yo‘q qilmoqda

404 Media surishtiruviga ko‘ra, Amazon sun'iy intellekt modellarini o‘rgatish uchun ko‘plab nodir kitoblarni sotib olib, ularning muqovasini kesgan holda skanerlamoqda. Jurnalistlar nodir kitob ichiga joylagan kuzatuv qurilmasi Amazonning Las-Vegasdagi VGT3 ob'ektiga borib tushgan. Kompaniya mijozlarga xizmat va mahsulotlar sifatini oshirish uchun kitoblarni qonuniy tijoriy yo‘llar bilan xarid qilayotganini bildirdi. Bunday kitoblar AI yaratgan soxta matnlardan xoli bo‘lgan toza insoniy ma'lumotlar manbai sifatida qadrlanadi.
O‘z faoliyatini onlayn kitob savdosidan boshlagan Amazon kompaniyasi sun'iy intellekt modellarini o‘qitish maqsadida katta miqdorda nodir kitoblarni sotib olib, ularni yo‘q qilmoqda. 404 Media nashri o‘tkazgan mustaqil surishtiruv jarayonida nodir kitobga yashirilgan kuzatuv qurilmasi orqali bu jarayon fosh bo‘ldi. Kitob oxir-oqibat Amazonning Las-Vegas shahrida joylashgan VGT3 nomli maxsus ob'ektiga olib borilgan.
Ushbu muassasada xodimlar kitoblarning orqa muqovalarini (umurtqasini) kesib tashlab, sahifalarni yuqori tezlikda sun'iy intellekt uchun skanerlashmoqda. Ob'ektning o‘ziga xos ramzi changalida kitob ushlab turgan dinozavr tasviridan iborat. Amazon o‘z bayonotida mijozlar foydalanadigan xizmat va mahsulotlarni yaxshilash maqsadida kitoblarni ochiq tijoriy kanallar orqali sotib olayotganini tasdiqlagan.
Yirik texnologiya gigantlari katta til modellarini (LLM) o‘qitish uchun ulkan hajmdagi sifatli matnlarga muhtoj. Internetdagi deyarli barcha ochiq resurslar allaqachon o‘zlashtirilgan bo‘lib, bosmadan chiqqan va internetda uchramaydigan nodir kitoblar qimmatli xomashyoga aylangan.
Bunday qadimiy va noyob matnlarning asosiy ustunligi shundaki, 2022-yilgacha chop etilgan kitoblarda AI tomonidan generatsiya qilingan matnlar umuman mavjud emas. Agar modellar boshqa sun'iy intellekt yaratgan kontent asosida qayta o‘qitilsa, bu modelning buzilishiga (model collapse) va natijalar sifatining keskin pasayishiga olib keladi.
Tadqiqotchi va dasturchilar uchun bu holat toza, sun'iy intellekt ta'siridan xoli (pre-2022) sifatli ma'lumotlar to'plamining naqadar qadrli ekanini va sintetik ma'lumotlar xavfini ko'rsatadi.
AI kod muharriridan foydalanishda eng muhim qoida — kichik o'zgarish, ko'rinadigan diff, majburiy test va qaytarish mumkin bo'lgan commit.