in

როგორ ქმნიან ციფრული ასისტენტების ადამიანურ ჟღერადობას

Lenovo
Lenovo

Siri-ს, Alexa-სა და სხვა ციფრული ასისტენტების ბუნებრივი ხმა ტექსტის ხმად გარდაქმნის ტექნოლოგიის, ანუ Text-to-Speech-ის დამსახურებაა. ადამიანის ორგანიზმში ბგერის ფორმირება ფილტვებიდან ხმის იოგებისკენ ჰაერის ნაკადის მოძრაობით იწყება, რასაც ხმის იოგების ვიბრაცია და ტვინის მითითებით პირის ღრუს, ენისა და ტუჩების მიერ ბგერების სიტყვებად ქცევა მოჰყვება. კომპიუტერი ამ ფიზიოლოგიურ პროცესს ელექტრონულად ასიმულირებს. იგი პატარა დინამიკზე ელექტრულ სიგნალებს აგზავნის, დინამიკის სწრაფი ვიბრაცია ჰაერის ტალღებს წარმოქმნის, ხოლო სპეციალური პროგრამული უზრუნველყოფა ამ სიგნალებს მართავს და მათ ადამიანური მეტყველების ფორმას ანიჭებს.

ნებისმიერი ფრაზის სათქმელად კომპიუტერი სიტყვებს მეტყველების უმცირეს შემადგენელ ნაწილაკებად, ანუ ფონემებად შლის. პროგრამა ქმნის ამ ბგერით ერთეულებს და მათ სწორი თანმიმდევრობით აჯგუფებს. მანქანების ადამიანური ხმით ამოქმედების პირველი მცდელობები XVIII საუკუნეში დაიწყო, როდესაც გამომგონებლები ჰაერის ნაკადის შესაქმნელად სპეციალურ საბერველებს, მილებსა და ტყავის მილაკებს იყენებდნენ, თუმცა მიღებული ხმა საკმაოდ უცნაური და არაბუნებრივი იყო.

ისტორიული განვითარება

პირველი ელექტრონული ხმის სინთეზატორები XX საუკუნის 30-იან წლებში გამოჩნდა. მათ შორის ცნობილი მოწყობილობა Voder გახლდათ, რომელიც 1939 წლის ნიუ-იორკის მსოფლიო გამოფენაზე წარადგინეს. საორგანო კლავიატურის მსგავს აპარატზე ღილაკებსა და პედალზე დაჭერით საბაზისო ფრაზების გამოცემა იყო შესაძლებელი.

სამოციან წლებში კომპანიებმა ფონემების გაერთიანებით შეძლეს კომპიუტერის ამეტყველება, თუმცა ჟღერადობა მაინც მკვეთრად რობოტული რჩებოდა. ეს განპირობებული იყო იმით, რომ პროგრამებს ჩაწერილი ხმებისგან შექმნილი ბგერითი რუკების, ანუ სპექტროგრამების აწყობა ფაზლივით უწევდათ.

ხელოვნური ინტელექტი ხმის შექმნისთვის

დღევანდელი ტექნოლოგიები სრულიად ახალ ეტაპზე გადავიდა და მანქანურ სწავლებას ეფუძნება. ინჟინრები ხელოვნურ ინტელექტს რეალური ადამიანების მრავალსაათიანი ჩანაწერებით წვრთნიან. პროგრამა აანალიზებს მეტყველების დეტალებს, სუნთქვის სიხშირით და სიცილით დაწყებული, ემოციური აღგზნებისას ხმის ტემბრის ცვლილებით დამთავრებული.

ეს ალგორითმები კომპანიებს საშუალებას აძლევს, შექმნან ადამიანური მეტყველების ზუსტი იმიტაცია. თანამედროვე სისტემებს რამდენიმეწამიანი აუდიოჩანაწერის მოსმენაც კი ჰყოფნით იმისათვის, რომ ადამიანის ხმის ტემბრი და მეტყველების მანერა სრულად დააკოპირონ.

პრაქტიკული გამოყენება

ტექსტის ხმად გარდაქმნის ტექნოლოგიას პრაქტიკული სარგებელი მოაქვს. ავტომობილებში იგი მძღოლებს ნავიგაციაში ეხმარება, მხედველობაშეზღუდულ პირებს სტატიებისა და ვებგვერდების მოსმენის საშუალებას აძლევს, ხოლო მეტყველების უნარდაკარგულ ადამიანებს კომუნიკაციის შესაძლებლობას უბრუნებს.

ტექნოლოგიის განვითარებას რისკებიც ახლავს, მაგალითად, აუდიო დიფფეიკების სახით. თაღლითები ამ მეთოდით ოჯახის წევრების, თანამშრომლებისა თუ ცნობილი ადამიანების ხმებს იმიტირებენ. ამ საფრთხის საპასუხოდ, სპეციალისტები აქტიურად მუშაობენ ინსტრუმენტებზე, რომლებიც ყალბი ხმების იდენტიფიცირებას უზრუნველყოფს.

წყარო: Fastcompany

ღია სცენა „თაკარა“ და სუხიშვილების ახალი დადგმა „რეკონსტრუქცია”, როგორც არ გაჩერების მუდმივი მოძრაობა

ავტოსერვისიდან საექსპოზიციო სივრცემდე – „თეგეტას“ პროექტმა Staged Mechanics საერთაშორისო აღიარება მოიპოვა