Hazırki vəziyyət
Yəqin ki, səsli yazma, YouTube-da avtomatik subtitrlər və ya Sirini, Aleksanı tanıyırsınız. Onlar ingilis dilini heyrətamiz dərəcədə yaxşı başa düşür. Bəs Azərbaycan dilini? O qədər də yox.
Bu texnologiyanın adı ASR (Automatic Speech Recognition — Avtomatik Nitq Tanıma), digər adı isə STT (Speech-To-Text — Nitqdən Mətnə): danışıq audiosunu yazılı mətnə çevirən süni intellekt modelləridir.
Bu modellər nitqi tanımağı insan beyninə bənzər şəkildə öyrənir — 'eşitdiklərindən'. Bir dildə nə qədər çox düzgün transkripsiya olunmuş səsli material ilə öyrədilirlərsə, o dili bir o qədər yaxşı anlayar. Problem isə sadə bir müqayisədə aydın şəkildə görünür. Ən populyar açıq mənbəli ASR modellərindən biri olan Whisper-in təlim bazasına baxaq:
| Dil | Təlim audiosu (saat) |
|---|---|
| İngilis | 438 218 |
| Rus | 9 761 |
| Türk | 4 333 |
| İtalyan | 2 585 |
| Azərbaycan | 47 |
Azərbaycan dilindəki təlim audiolarının toplam uzunluğu qırx yeddi saatdır. Bu, ingilis dilinin əlli illik materialı ilə müqayisədə bizim dilimizdə iki gündən az audio deməkdir. Whisper bu tip ictimaiyyətə açıq (open source) modellərdən yalnız biri və ən böyüyüdür, amma əsas məsələ əksər hallarda eynidir: ictimaiyyətə açıq Azərbaycan dili nitq bazası çox az olduğu üçün, Azərbaycan dilində səs audioları daha pis başa düşülür. Bu belə qaldıqca da, bu modellər dilimizi anlamaqda çətinlik çəkməyə davam edəcək.
Dataset daha dəqiq nə deməkdir?
Nitq dataseti sadəcə qısa audio parçalarından ibarət böyük bir kolleksiyasıdır — hər parça öz dəqiq yazılı transkripsiyası ilə. Vəssalam. Modellər məhz bundan öyrənir. Problem ondadır ki, mətnin audioya tam uyğun gəldiyini yoxlamaq üçün insan əməyi lazımdır — özü də bir xeyli insan əməyi. Məhz burada siz köməyə gələ bilərsiniz.
'Səsimiz' necə işləyir
İdeya budur: təbii, danışıq dilində Azərbaycan nitqinin mənbəyi kimi filmlərdən istifadə etmək — və parallel olaraq həmin filmlər üçün düzgün subtitrlər və tərcümələr yaratmaq.
- Filmlər seçilir (hüquq sahiblərinin icazəsi ilə — siz də film təklif edə bilərsiniz!).
- Whisper avtomatik qaralama subtitrlər yaradır. Modelin hazırda nə qədər zəif olduğunu, qaralama subtirdə hazırda nə qədər səhvlərin olduğunu özünüz görəcəksiniz — layihənin bütün məqsədi məhz bunu yaxşılaşdırmaqdır.
- Qaralamalar 'Səsimiz' platformasına yüklənir və mövcud filmlər siyahısında görünür.
- Siz (könüllü olan hər kəs) platformaya daxil olursunuz, bir film seçirsiniz və öz tempinizlə filmlərə baxır, dinləyir və subtitrləri düzəldirsiniz. Hər düzəldilmiş fayl qəbul edilməzdən əvvəl keyfiyyət yoxlamasından keçir.
- 'Səsimiz' platformasında yaradılmış subtirlər xırda hissələrə bölünür və datasetlərin yaradılmasında istifadə olunur. Daha sonra bu datasetlər süni intellekt modellərinin mükəlləşməsi üçün istifadə olunur
Subtitrlər və tərcümələr: Azərbaycanca subtitrlər təsdiqləndikdən sonra onları başqa dillərə tərcümə etmək asanlaşır — maşın tərcüməsi qaralama verir, könüllülər və mən onu yoxlayırıq, hazır subtitr faylları isə pulsuz ictimaiyyətə açıq şəkildə paylaşılır.
Dataset yaradılması: xüsusi skript filmin tam audiosunu təsdiqlənmiş mətnlə uyğunlaşdırılmış qısa parçalara bölür. Nəticədə təmiz təlim dataseti alınır. Yeni dataset Whisper-in təkmilləşdirilməsi (fine-tuning) üçün istifadə olunacaq və nəticələr WER (söz xətası dərəcəsi) və başqa keyfiyyət meyarları əsasında müqayisə ediləcək. Sonda dataset açıq şəkildə Hugging Face kimi platformalarda dərc olunacaq.