Ses sinyallerinden sentezlenmiş ses tespiti
Synthesized voice detection from audio signals
- Tez No: 976105
- Danışmanlar: DR. ÖĞR. ÜYESİ BURCU KIR SAVAŞ
- Tez Türü: Yüksek Lisans
- Konular: Bilim ve Teknoloji, Science and Technology
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Kocaeli Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Ses, insanın en temel ayırt edici fiziksel özelliklerinden birisidir. Günümüzde ses ile doğrulama teknolojisi güvenlik sistemlerinde sıkça kullanılmaktadır. Otomatik konuşmacı doğrulama (ASV) sistemi olarak bilinen bu teknoloji insanların özel bilgilerini içeren birçok dijital uygulamanın güvenliğini sağlamak için kullanılmaktadır. Ancak derin öğrenme ile ses sentezi konusundaki ilerlemeler gerçek insan sesine çok yakın sentetik sesler üretilebilmesini mümkün kılmaktadır. Otomatik konuşmacı doğruluma sistemleri ses sahteciliğine açık hale gelebilmektedir. ASV sistemleriyle entegre uygulamaların kullanıcıları mağdur olabilir. Bu çalışmada bir Konvolüsyonel Sinir Ağları (CNN) mimarisi önerilmiş ve önerilen CNN yapısı üzerinde yığın boyutu, kanal ve filtre sayısı, katman tipi parametrelerinin etkileri incelenmiştir. Çalışmada, 3 katmana kadar 1,8 ve 32 yığın boyutlarında 80 adet model; 4-10 katman sayılarında 1, 8 ve 32 yığın boyutlarında toplamda 402 farklı model hiperparametre optimizasyonu yöntemiyle eğitilmiştir. Model değerlendirilmesi Eşit Doğruluk Oranı (EER) ve doğruluk metrikleriyle yapılmıştır. Sonuçlar, filtre sayısı arttıkça modelin öğrenme yeteneğinin geliştiğini, ancak performans artışının zamanla azaldığını göstermektedir. Maxpooling katmanının genel model performansı üzerinde anlamlı bir pozitif ya da negatif etkisinin bulunmadığı, esas olarak boyut indirgeme işlevi gördüğü sonucuna varılmıştır. Kayıp, doğruluk ve EER değerlerinin yığın boyutu ile ters orantılı olduğu gözlemlenmiştir. Katman sayısının belirli bir artıştan sonra performansı artırmadığı, mevcut veri setinde en iyi eğitimlerin genellikle 8 yığın boyutunda gerçekleştiği ve en iyi deneyin %11,859 EER elde ettiği görülmüştür. Sessiz bölgelerin etkisi en iyi üç tanesi seçilerek test edilmiştir. EER performanslarında %99,999 ile %218,412 arasında bir düşüşün olduğu ve performans kayıplarının yüksek katman sayılarında daha çok olduğu gözlemlenmiştir. Deneylerde ASVSpoof 2019 Mantıksal Erişim (LA) veri seti kullanılmıştır.
Özet (Çeviri)
Voice is one of the most fundamental distinguishing physical characteristics of a person. Today, voice-based authentication technology is frequently used in security systems. This technology, known as automatic speaker verification (ASV), is applied to ensure the security of many digital applications that contain individuals' private information. However, advances in deep learning-based voice synthesis have made it possible to generate synthetic voices that are nearly indistinguishable from real human speech. ASV systems have thus become vulnerable to voice spoofing attacks, potentially compromising applications integrated with ASV and causing harm to their users. In this study, a Convolutional Neural Network (CNN) architecture is proposed, and the effects of parameters such as batch size, number of channels, number of filters, and layer type were investigated on the proposed CNN structure. A total of 80 models with up to 3 layers were trained using batch sizes of 1, 8, and 32, while an additional 402 models with 4 to 10 layers were trained using hyperparameter optimization for the same batch sizes. The models were evaluated using Equal Error Rate (EER) and accuracy metrics. The results show that increasing the number of filters improves the model's learning capability, although performance gains diminish over time. The max pooling layer was found to have no significant positive or negative effect on overall model performance and mainly served as a dimensionality reduction component. Loss, accuracy, and EER values were observed to be inversely proportional to batch size. Increasing the number of layers did not always improve performance, and the most successful training generally occurred with a batch size of 8 in the given dataset. The best result achieved was an EER of 11.859%. The effect of silent regions was tested using the three best-performing models. A decrease in EER performance ranging from 99.999% to 218.412% was observed, and the performance loss was more pronounced in models with a higher number of layers. The ASVSpoof 2019 Logical Access (LA) dataset was used in the experiments.
Benzer Tezler
- Duygusal reaksiyonların fizyolojik deneyim örnekleme ile analizi
Analysis of emotional reactions with physiological experience sampling
GÜLİN DOĞAN
Yüksek Lisans
Türkçe
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Kültür ÜniversitesiBilgisayar Ana Bilim Dalı
DR. ÖĞR. ÜYESİ FATMA PATLAR AKBULUT
- Oditoryumlarda akustik önlemler ve çoklu kullanım
Accoustical precautions and milti purpose usage of auditorums
ÇİĞDEM YÜCEL
- Temel boyutlarıyla müziksel işitmenin incelenmesi
Research in musical audibility with it's basic dimensions
MEHLİKA DÜNDAR
- Televizyon reklamlarının ses-söz uyumu (Prozodi) yönünden incelenmesi ve dilimizin müziğine etkileri
A study on the television advertisements from the point speech-sound harmany (prosody) and it's influence on the rhythm of our language
C. HAKAN ÇUHADAR