Bolalar tilni sun'iy intellektdan qanday qilib million barobar kamroq ma'lumot bilan o'rganadi?

Zamonaviy yirik til modellari (LLM) inson nutqini o'zlashtirish uchun astronomik miqdordagi ma'lumotlarga tayanadi. Masalan, Meta'ning Llama 3.1 modeli 15 trillion token bilan o'qitilgan bo'lsa, yetakchi modellar bundan ham 10 barobar ko'proq ma'lumot talab qilishi mumkin. Inson bolasi esa ona tilida to'g'ri jumlalar tuza olishi uchun bor-yo'g'i 10β30 million so'z eshitishi kifoya qiladi. Olimlar bu ulkan farqni "ma'lumotlar samaradorligi bo'shlig'i" deb atashmoqda. 2030-yillarga kelib internetdagi sifatli o'quv ma'lumotlari tugab qolishi kutilayotgan bir paytda, bolalarning til o'rganish mexanizmini tushunish AI kelajagi uchun muhim omilga aylanmoqda.
Zamonaviy sun'iy intellekt modellari insondek ravon suhbatlasha olsa-da, ularning ortida insoniy tajribaga to'g'ri kelmaydigan darajada ulkan hajmdagi ma'lumotlar yotadi. Stanford universiteti kognitiv olimi Maykl Frankning ta'kidlashicha, bolaning bir yil davomida yashash xonasida tabiiy ravishda o'zlashtiradigan til qobiliyatini sun'iy intellektda qayta yaratish uchun insoniyatning deyarli barcha bilimlari jamlangan ulkan axborot resurslarini yoqib yuborishga to'g'ri kelmoqda.
Bugungi kunda keng qo'llanilayotgan Meta'ning Llama 3.1 kabi modellari 15 trillion tokendan foydalangan holda dastlabki o'qitishdan o'tgan. Mutaxassislarning fikricha, eng ilg'or modellar esa bundan 10 barobar ko'p ma'lumotni qayta ishlaydi. Taqqoslash uchun: agar zamonaviy til modelining o'quv matnlari qog'ozga chop etilsa, hosil bo'lgan ustun Xalqaro kosmik stansiyadan ham yuqoriga chiqadi; o'smir eshitgan 100 million so'z esa atigi 20 metrli qog'oz ustunini hosil qiladi.
Bolalar til o'rganishni boshlaganda atigi 10 milliondan 30 milliongacha so'z eshitib, grammatik jihatdan to'g'ri jumlalar qura oladi. Tadqiqotchilar ta'kidlaganidek, agar GPT-2 kabi model 30 million so'z asosida o'qitilsa, u bolaga emas, ma'nosiz so'zlar generatoriga aylanadi. Bu holat kognitiv fanlarda Noam Xomskiy ilgari surgan "rag'bat yetishmovchiligi" (poverty of the stimulus) g'oyasini va til statistikadan ko'ra chuqurroq tizimga asoslangan degan bahslarni yana kun tartibiga olib chiqmoqda.
Olimlarning maqsadi β bolalar tilni qanday qilib shunchalik kam ma'lumot bilan tez o'rganishini teskari muhandislik orqali aniqlashdir. Bu mexanizmni anglash 2030-yillarda kutilayotgan ma'lumotlar tanqisligini yengish, videolarni samarali qayta ishlovchi yangi arxitekturalarni yaratish va ma'lumotlar bazasi kam bo'lgan kam sonli tillar uchun moslashuvchan modellarni ishlab chiqish imkonini beradi.
Tadqiqot AI tizimlarini gigant ma'lumotlar bazasisiz, kam resurs sarflagan holda samarali o'qitish va cheklangan ma'lumotga ega kichik tillar uchun ixcham modellarni yaratish imkonini beradi.
AI kod muharriridan foydalanishda eng muhim qoida β kichik o'zgarish, ko'rinadigan diff, majburiy test va qaytarish mumkin bo'lgan commit.