Қазақша сөзді мәтінге айналдыру: не жұмыс істейді
Қазақша сөзді мәтінге айналдыру мүмкін, бірақ әлемдік сервистер мұны ағылшын тілімен салыстырғанда айтарлықтай нашар жасайды. Себебі екі: тілдің агглютинативті морфологиясы және оқыту деректерінің тапшылығы. Төменде жаһандық жүйелердің қазақ тілінде неліктен сүрінетіні және дәл қазір қайда сапа қолайлы деңгейде екені талданады.
Қазақша сөйлеу машиналарға неліктен ағылшыннан қиынырақ беріледі?
Қазақ тілі агглютинативті. Ағылшынша бес бөлек сөзбен айтылатын нәрсе қазақшада суффикстер тізбегі бар бір сөзбен жеткізіледі, ал әр түбірдің ондаған формасы болады. Ағылшын тілінде оқытылған модель мұндай сөзді таныс емес блок ретінде қабылдап, не өткізіп жібереді, не кездейсоқ болжайды.
Деректер тапшылығы да маңызды фактор. Оқытуға арналған қазақша сөйлеу жазбалары ағылшын тілімен салыстырғанда әлдеқайда аз. Бұл айырмашылық дәлдікке тікелей әсер етеді.
Үшінші фактор: айтылым. Ол аймақтарға қарай айтарлықтай ерекшеленеді, ал үйреншіксіз акцент морфология мен деректер мәселесінің үстіне қосымша қате қосады.
Міне сондықтан жаһандық жүйелер Орталық Азия тілдерінде 30%-дан жоғары қателер жібереді, яғни үш сөздің бірі дұрыс танылмайды.
Сыну тілге байланысты екенін қалай анықтауға болады?
Жазба сапасының емес, жүйенің тіл мәселесі екенін көрсететін үш белгі бар.
Жалғанып қалған жұрнақтар. Қазақ жұрнақтары септік, тәуелділік, шақ және жақты бір мезгілде белгілейді. Движок тілді білмегенде сөзді кез келген жерден кесіп тастайды немесе бірнеше сөзді біріктіреді. Транскриптте қалыпты сөздің орнына мағынасыз әріп тіркесімдері пайда болады.
Жалқы есімдер мағынасыз жазуға айналады. Қазақ есімдерін, топонимдерді және ұйым атауларын жүйе өз сөздігіндегі үндес сөздерге сүйеніп фонетикалық жолмен транскрибациялайды. Транскриптте есімнің орнына кездейсоқ сөз немесе мағынасыз таңбалар қалады.
Қазақша-орысша аралас сөйлеу ауысу кезінде кесіледі. Алматы мен Астанадағы нақты жұмыс кеңесінде қазақша мен орысша бір фраза ішінде алмасады. Бір тілге бапталған жүйелер тілді ауыстырған кезде үш сценарийдің бірін береді: транскриптте мүлде үнсіздік, бір тілдің таңбаланымы екіншісінің кодтауымен, немесе фраза ортасында толық үзіліс.
Бұл нені білдіреді: егер транскрипт дәл осылай көрінсе, мәселе жазба сапасында немесе бағдарлама баптауларында емес. Мәселе: тану жүйесі қазақ тілі үшін оқытылмаған.
Аймаққа арналып оқытылған модель не береді
Бұл жерде нақты құрал туралы сөз басталады. Sezish Орталық Азия тілдеріне арнайы оқытылған жеке модельде жұмыс істейді: өзбек, қазақ, қырғыз, орыс және ағылшын тілдерін қамтиды.
Жарияланған дәлдік: шамамен 9% қателік, яғни он бір сөздің бірі дұрыс танылмайды.
Мұнда бір нюанс бар: 9% word error rate өлшемі өзбек тілінде жүргізілген. Қазақ тілі бойынша жеке жарияланған көрсеткіш жоқ. Оны қазақша өлшенген факт ретінде ауыстырып пайдалану дұрыс болмас. Модель қазақ тілін қоса алғанда аймаққа арналып оқытылған, алайда дұрыс жауап: қазақ тілі бойынша өлшенген және жарияланған WER бізде әзірге жоқ.
Салыстыру үшін: жаһандық жүйелерде өзбек тілінде қателер 30%-дан асады. Қазақ және көрші тілдердегі жағдай ұқсас, себептері бірдей: агглютинативті морфология және оқыту деректерінің аздығы.
Демоны sezi.sh/kk/ бетінде ешнәрсе жүктемей-ақ қазір тексеруге болады.
Қазақша дыбысты мәтінге айналдыруды қазір қайда сынауға болады?
| Тәсіл | Қалай жұмыс істейді | Шектеу |
|---|---|---|
| Демо, sezi.sh/kk/ | Батырманы басып, сөйлеп, нәтижені қараңыз. Сервер өңдейді. | Бір рет 30 секундқа дейін. Жүктеме кезінде «Демо бос емес» шығады. |
| Telegram-бот @sezishbot | Дауыстық хабарлама немесе аудиофайлды жіберіңіз, жауапқа тыныс белгілері бар мәтін келеді. Топтарда жұмыс істейді. | Күніне 10 минут тегін. Файлдар 20 МБ-қа дейін. |
| Mac | Жергілікті, модель 225 МБ, интернетсіз өңделеді. Диктовка және кездесулерді жазу. | Тек macOS. Толық офлайн тек осы жерде. |
| iPhone | App Store-дағы «Sezish Talk» қолданбасы, тегін. | Сервер арқылы өңделеді. |
| Android | Google Play-де шығады. | Әзірше қолжетімді емес. |
| Windows | Ерте бета, тек диктовка. | Кездесулерді жазу жоқ, функционал шектеулі. |
Туыстарыңыздан немесе әріптестерден Telegram-да қазақша дауыстық хабарламалар келетін болса, ол жеке сценарий. Ол туралы толығырақ сөзді мәтінге мақаласында талданған, ал дауыстық хабарламаны аудару бөлек сипатталған. Таймкодтары бар кездесулер жазбасы бөлек тақырып, кестеде ол Mac жолында белгіленген.
Қазақша аудио қайда кетеді және онымен не болады
Mac-та өңдеу жергілікті. Модель 225 МБ, компьютеріңізде жұмыс істейді: бір байт аудио да ешқайда жіберілмейді. Бұл мемлекеттік органдардың кеңестерін, заңи келіссөздерді немесе сыртқа шығаруға болмайтын кез келген жазбаларды транскрибациялайтындар үшін маңызды.
Сервер арқылы өңделгенде (бот, мобильді қолданбалар, веб-демо) аудио қорғалған TLS байланысы арқылы жіберіледі. Сервер файлды жедел жадта өңдеп, мәтінді қайтарады және жауап бергеннен кейін аудионы сақтамайды. Деректемеде тұрған тұжырым: «сервер мәтінді береді де, аудионы ұмытады».
Жазбалар мен транскрипт мәтіндері модельдерді оқыту үшін пайдаланылмайды. Қолданбада тіркелу, жарнама және трекерлер жоқ. Құрылғы идентификаторлары мен геолокация жиналмайды.
Толық шарттар: құпиялылық саясатында.
Жиі қойылатын сұрақтар
Қазақ тілін тану бағдарламасы қаншалықты дәл жұмыс істейді?
Жарияланған көрсеткіш: шамамен 9% қателік, он бір сөздің бірі дұрыс танылмайды. Бұл көрсеткіш өзбек тілінде өлшенген, қазақ тілі бойынша жеке сан жоқ. Жаһандық жүйелерде Орталық Азия тілдерінде қателер 30%-дан асады. Өзіңіздің дауысыңызда тексеру үшін: басты беттегі демоны 30 секундта сынап көруге болады.
Неліктен қазақ тілі бойынша қателік санын жеке жарияламайсыздар?
Өйткені жеке өлшем жоқ. Жарияланған 9% word error rate өзбек тілінде алынған. Оны қазақ тілінің көрсеткіші ретінде жариялау дұрыс болмас еді. Модель аймаққа арналып оқытылған, қазақ тілі де қамтылған, алайда адал жауап мынау: қазақ тілі бойынша өлшенген және жарияланған WER бізде әзірге жоқ.
Әңгімеде қазақша мен орысша араласса не болады?
Модель аймақтың бес тілінде, соның ішінде қазақша мен орысшада оқытылған. Жаһандық жүйелер мұндай жағдайда не бір тілді таңдап, екіншісіндегі фразаларды жоғалтады, не тілді ауыстырған сәтте транскриптті үзеді. Аралас сөйлеу бойынша жеке жарияланған өлшем бізде жоқ, сондықтан өз аудиоңызда тексеру үшін демо теориядан нақтырақ жауап береді.
Жүйе аймақтық айтылымды түсіне ме?
Уәде бере алмаймыз. Модель Орталық Азия тілдеріне арнайы оқытылғаны ғана белгілі. Әр акцент бойынша нақты дәлдік деректері жоқ. Белгілі бір аймақтың аудиосымен жұмыс жасайтын болсаңыз, ең адал жауап: демода өз материалыңызда сынап, нәтижені өзіңіз қараңыз.
Менің жазбаларым модельді оқыту үшін пайдаланыла ма?
Жоқ. Аудио да, транскрипт мәтіндері де оқыту үшін пайдаланылмайды. Бұл құпиялылық саясатында бекітілген. Mac-та жергілікті өңделгенде деректер мүлде құрылғыдан шықпайды.
Қазақша аудионы мәтінге интернетсіз айналдыруға бола ма?
Иә, бірақ тек Mac-та. Модель 225 МБ, бір рет жүктеледі де жергілікті жұмыс істейді: жазу кезінде де, өңдеу кезінде де интернет қажет емес. Бот, веб-демо және мобильді қолданбалар аудионы сервер арқылы өңдейді, сондықтан қосылым қажет болады.
Аудионы мәтінге айналдыруды тегін қанша уақыт пайдалануға болады?
Telegram-бот арқылы: күніне 10 минут тегін, қысқа файл өз ұзақтығы мөлшерінде ғана шегерілетін уақытты жұмсайды. Басты беттегі веб-демо: сұраныс бойынша 30 секундқа дейін. iPhone қолданбасы App Store-да тегін. Mac-та өңдеу компьютерде жергілікті жүреді, сондықтан серверлік минут лимиттері оған қатысты емес.