Geri Dön

Ses sinyallerinden sentezlenmiş ses tespiti

Synthesized voice detection from audio signals

  1. Tez No: 976105
  2. Yazar: MUHAMMED ALİ IRMAK
  3. Danışmanlar: DR. ÖĞR. ÜYESİ BURCU KIR SAVAŞ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilim ve Teknoloji, Science and Technology
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Kocaeli Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Ses, insanın en temel ayırt edici fiziksel özelliklerinden birisidir. Günümüzde ses ile doğrulama teknolojisi güvenlik sistemlerinde sıkça kullanılmaktadır. Otomatik konuşmacı doğrulama (ASV) sistemi olarak bilinen bu teknoloji insanların özel bilgilerini içeren birçok dijital uygulamanın güvenliğini sağlamak için kullanılmaktadır. Ancak derin öğrenme ile ses sentezi konusundaki ilerlemeler gerçek insan sesine çok yakın sentetik sesler üretilebilmesini mümkün kılmaktadır. Otomatik konuşmacı doğruluma sistemleri ses sahteciliğine açık hale gelebilmektedir. ASV sistemleriyle entegre uygulamaların kullanıcıları mağdur olabilir. Bu çalışmada bir Konvolüsyonel Sinir Ağları (CNN) mimarisi önerilmiş ve önerilen CNN yapısı üzerinde yığın boyutu, kanal ve filtre sayısı, katman tipi parametrelerinin etkileri incelenmiştir. Çalışmada, 3 katmana kadar 1,8 ve 32 yığın boyutlarında 80 adet model; 4-10 katman sayılarında 1, 8 ve 32 yığın boyutlarında toplamda 402 farklı model hiperparametre optimizasyonu yöntemiyle eğitilmiştir. Model değerlendirilmesi Eşit Doğruluk Oranı (EER) ve doğruluk metrikleriyle yapılmıştır. Sonuçlar, filtre sayısı arttıkça modelin öğrenme yeteneğinin geliştiğini, ancak performans artışının zamanla azaldığını göstermektedir. Maxpooling katmanının genel model performansı üzerinde anlamlı bir pozitif ya da negatif etkisinin bulunmadığı, esas olarak boyut indirgeme işlevi gördüğü sonucuna varılmıştır. Kayıp, doğruluk ve EER değerlerinin yığın boyutu ile ters orantılı olduğu gözlemlenmiştir. Katman sayısının belirli bir artıştan sonra performansı artırmadığı, mevcut veri setinde en iyi eğitimlerin genellikle 8 yığın boyutunda gerçekleştiği ve en iyi deneyin %11,859 EER elde ettiği görülmüştür. Sessiz bölgelerin etkisi en iyi üç tanesi seçilerek test edilmiştir. EER performanslarında %99,999 ile %218,412 arasında bir düşüşün olduğu ve performans kayıplarının yüksek katman sayılarında daha çok olduğu gözlemlenmiştir. Deneylerde ASVSpoof 2019 Mantıksal Erişim (LA) veri seti kullanılmıştır.

Özet (Çeviri)

Voice is one of the most fundamental distinguishing physical characteristics of a person. Today, voice-based authentication technology is frequently used in security systems. This technology, known as automatic speaker verification (ASV), is applied to ensure the security of many digital applications that contain individuals' private information. However, advances in deep learning-based voice synthesis have made it possible to generate synthetic voices that are nearly indistinguishable from real human speech. ASV systems have thus become vulnerable to voice spoofing attacks, potentially compromising applications integrated with ASV and causing harm to their users. In this study, a Convolutional Neural Network (CNN) architecture is proposed, and the effects of parameters such as batch size, number of channels, number of filters, and layer type were investigated on the proposed CNN structure. A total of 80 models with up to 3 layers were trained using batch sizes of 1, 8, and 32, while an additional 402 models with 4 to 10 layers were trained using hyperparameter optimization for the same batch sizes. The models were evaluated using Equal Error Rate (EER) and accuracy metrics. The results show that increasing the number of filters improves the model's learning capability, although performance gains diminish over time. The max pooling layer was found to have no significant positive or negative effect on overall model performance and mainly served as a dimensionality reduction component. Loss, accuracy, and EER values were observed to be inversely proportional to batch size. Increasing the number of layers did not always improve performance, and the most successful training generally occurred with a batch size of 8 in the given dataset. The best result achieved was an EER of 11.859%. The effect of silent regions was tested using the three best-performing models. A decrease in EER performance ranging from 99.999% to 218.412% was observed, and the performance loss was more pronounced in models with a higher number of layers. The ASVSpoof 2019 Logical Access (LA) dataset was used in the experiments.

Benzer Tezler

  1. Duygusal reaksiyonların fizyolojik deneyim örnekleme ile analizi

    Analysis of emotional reactions with physiological experience sampling

    GÜLİN DOĞAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Kültür Üniversitesi

    Bilgisayar Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ FATMA PATLAR AKBULUT

  2. Böceklerde ses çıkarma ve bunun yararları

    Sound production in insects its usefulness

    NİLGÜN MADANLAR

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    ZoolojiEge Üniversitesi

    Bitki Koruma Ana Bilim Dalı

    DOÇ. DR. ESAT PEHLİVAN

  3. Oditoryumlarda akustik önlemler ve çoklu kullanım

    Accoustical precautions and milti purpose usage of auditorums

    ÇİĞDEM YÜCEL

    Yüksek Lisans

    Türkçe

    Türkçe

    1987

    MimarlıkGazi Üniversitesi

    Mimarlık Ana Bilim Dalı

    DOÇ.DR. MUTBUL KAYILI

  4. Temel boyutlarıyla müziksel işitmenin incelenmesi

    Research in musical audibility with it's basic dimensions

    MEHLİKA DÜNDAR

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    MüzikGazi Üniversitesi

    SAADETTİN ÜNAL

  5. Televizyon reklamlarının ses-söz uyumu (Prozodi) yönünden incelenmesi ve dilimizin müziğine etkileri

    A study on the television advertisements from the point speech-sound harmany (prosody) and it's influence on the rhythm of our language

    C. HAKAN ÇUHADAR

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    MüzikGazi Üniversitesi

    SAADETTİN ÜNAL