Қазақстан ғалымдары қазақ тілінде мәтін, сурет және аудионы түсінетін ЖИ моделін әзірледі
АСТАНА. KAZINFORM – Отандық ғалымдар әзірлеген жасанды интеллект моделін интернетке қоспай-ақ компьютерге жүктеп, пайдалануға болады. Назарбаев университетінің Ақылды жүйелер және жасанды интеллект институты жасаған Qolda-AVL моделі мәтінді түсініп қана қоймай, сурет пен аудионы да өңдей алады. Бұл туралы Назарбаев университетінің Ақылды жүйелер және жасанды интеллект институтының Senior Data Scientist маманы Ақылбек Мақсұтов айтты.
Маманның айтуынша, Qolda-AVL-дың басты ерекшелігі – оның ашық модель болуы, демек пайдаланушы дайын жүйеге ғана жүгінбей, модельді өз компьютеріне жүктеп, интернетсіз де іске қоса алады.
– Қазір жасанды интеллект дегенде ең алдымен ChatGPT, Gemini секілді модельдерді айтамыз. Олардың сайттарына кіріп, дайын сервисті пайдаланамыз, бірақ модельдің өзін өз компьютерімізге жүктей алмаймыз. Ал Qolda – ашық модель. Оны ноутбукке, телефонға немесе компьютерге жүктеп алып, интернетке қосылмай-ақ пайдалануға болады. Оның ішкі инфрақұрылымына кіріп, өзіміз жинаған ақпараттарды енгізіп, белгілі бір тілге немесе салаға бейімдей аламыз, – деді ол Jibek Joly телеарнасындағы «Бүгін Life » бағдарламасында.
Ғалымның сөзінше, ашық модельдердің тағы бір артықшылығы – пайдаланушының жүйеге енгізетін ақпаратын өз инфрақұрылымында сақтап, модельді жетілдіру мүмкіндігі.
Qolda-AVL моделі қазақ, орыс және ағылшын тілдеріндегі деректер негізінде әзірленген. Оның 4,3 миллиард параметрі бар. Бұған дейінгі қазақ тіліндегі ашық модельдердің бірқатары негізінен мәтінмен жұмыс істеуге бағытталса, Qolda-AVL визуалды ақпаратты да өңдей алады.
– Бұған дейін қазақ тілінде ашық модельдер болды. Мысалы KAZ-LLM шыққан кезде ол негізінен мәтіндік ақпаратпен жұмыс істейтін. Ал Qolda-AVL-дың ерекшелігі – берілген суретті де түсінеді. Сонымен қатар аудионы өңдеп, транскрипция жасай алады, яғни мәтінмен ғана шектелмей, бірнеше форматтағы ақпаратпен жұмыс істейді, – деді маман.
Qolda-AVL-дың үш нұсқасы әзірленген. Ақылбек Мақсұтовтың айтуынша, модель таныстырылғаннан бері оны мыңнан астам адам жүктеп алған.
Модельді әзірлеу және оқыту Назарбаев университетіндегі арнайы серверлерде жүргізіледі. Ғалымдардың айтуынша, модельдің негізгі компоненттері мен оқытуға арналған ақпарат университеттің өз инфрақұрылымында сақталады.
– Бізде іргетас деп аталатын сервер бар. Онда 24 A300 картасы орналасқан. Ақпарат та, модель де сол жерде жиналады. Модельді жаттықтырған кезде Amazon немесе Google сияқты сыртқы сервистерді пайдаланбаймыз. Яғни серверді сырттан жалға алып, интернет арқылы жұмыс істемейміз. Модельдің барлық чекпоинттары өз серверімізде орналасқан. Сондықтан ақпараттың қауіпсіздігіне қатысты алаңдаудың қажеті жоқ, – деді Ақылбек Мақсұтов.
Қазір Qolda-AVL модельдерінің кодтары мен оларды пайдалану жөніндегі ақпарат ашық платформаларда жарияланған. Дегенмен оны қарапайым чат-бот секілді бірден браузер арқылы пайдалану мүмкін емес. Қолданушы модельді жүктеп алып, арнайы кодтар арқылы іске қосуы қажет.
Ғалымның пікірінше, алдағы жылдары қазақ тіліндегі жасанды интеллект модельдерінің саны артып, олардың мүмкіндігі де кеңейе түседі.
– Алдағы бес жылда ChatGPT сияқты бізде де үш-төрт ірі модель болады деп ойлаймын. Өйткені сұраныс көп. Қазақ тілінде жазылған ақпарат неғұрлым көп болса, модельдер де соғұрлым жақсы дамиды. Әсіресе аударылған емес, бастапқыдан қазақ тілінде жазылған сапалы ақпараттың көп болуы маңызды, – деді ол.
Айта кетейік, бұған дейін, Google ым тілін мәтінге аударатын жасанды интеллектіні таныстырған еді.