Қазақ тіліндегі аудионы мәтінге айналдыру дәлдігі 98%-ға жетті

АСТАНА. KAZINFORM — Қазақ тіліне бейімделген транскрипция модельдерінің аудионы мәтінге айналдыру дәлдігі 98%-ға дейін артты. Бұл туралы Халықаралық «Қазақ тілі» қоғамы мен OpenAI компаниясының бірлескен жобасының нәтижелерін таныстыру кезінде жоба жетекшісі Анар Құрманжанқызы айтты.

Фото:pexels.com

Оның айтуынша, жоба аясында қазақ тіліндегі мәтін мен сөйлеу деректерінің сапалы корпусы жинақталып, соның негізінде жасанды интеллект құралдары әзірленіп жатыр.

— Қазақ тілінің мәтіндік корпусы 14 миллиард токенге жетті. Ондағы материалдар тақырып, жанр және жас ерекшеліктері бойынша жіктелген. Корпусқа қазақ тілінің тарихи даму кезеңдерін қамтитын мазмұнмен бірге шетелдегі қазақ диаспорасының тілдік мұрасы да енгізілді. Қор білім, ғылым, технология, экономика, құқық, медицина, тарих, этнография, медиа және балалар контентін түгел қамтиды, — деді Анар Құрманжанқызы.

Қазақ тіліндегі аудиодеректер қоры 12 мың сағатқа жеткен. Барлық жазба сыртқы шу, музыка және басқа да артық дыбыстардан тазартылған.

— Сонымен қатар қазақ тіліне бейімделген транскрипция модельдері қолданысқа енгізіліп, мәтінге айналдыру дәлдігі 98%-ға дейін жеткізілді, — деді жоба жетекшісі.

Сонымен қатар Анар Құрманжанқызы қазақ тіліне арналған Document AI және NLP құралдары жасалғанын атап өтті

— Олардың қатарында қазақ тіліндегі мәтінді жоғары дәлдікпен танитын OCR жүйесі, газет, кітап және PDF құжаттарының құрылымын ажырату, көпбағанды беттерді дұрыс ретпен оқу және деректерді тазарту тетіктері бар, — деді ол.

Айта кетейік, Халықаралық «Қазақ тілі» қоғамы мен OpenAI арасындағы бірлескен жоба 2025 жылғы 7 қарашада Вашингтонда жасалған келісім аясында жүзеге асырылып келеді. Жобаның мақсаты — сапалы цифрлық контент пен сенімді деректер қорын қалыптастыру арқылы үлкен тіл модельдерінің қазақ тіліндегі жұмыс сапасын арттыру.

Бұған дейін жасанды интеллектінің қазақ халқының тарихы, салт-дәстүрі мен мәдениетін қаншалықты білетіні арнайы сынақ арқылы тексерілгені хабарланды.