Geri Dön

Açı genlik dönüşümü kullanarak konuşmacı tanımlama

Speaker identification using angle amplitude transform

  1. Tez No: 983247
  2. Yazar: BÜŞRA ORAN
  3. Danışmanlar: PROF. DR. CEMAL KÖSE
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Konuşmacı tanımlama, özellik çıkarımı, açı genlik dönüşümü, sınıflandırma algoritmaları, Speaker identification, feature extraction, angle amplitude transform, classification algorithms
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Karadeniz Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Konuşmacı tanımlama, belirli bir ses kaydından konuşmayı gerçekleştiren kişiyi belirleme süreci olup güvenlik sistemleri gibi birçok alanda kullanılmaktadır. Bu çalışmada konuşmacı tanıma sürecinde kullanılan özellik çıkarım yöntemlerinin karşılaştırmalı analizi yapılmıştır. Literatürde yaygın olarak kullanılan MFCC (Mel-Frekans Kepstrum Katsayıları) ve LPCC (Doğrusal Öngörülü Kepstral Katsayılar) yöntemleri incelenmiş, bunlara ek olarak ilk kez önerilen Açı Genlik Dönüşümü (AGD) yöntemi uygulanmıştır. AGD, ses sinyallerindeki tepe ve çukur noktalarından açı ve genlik değerlerini hesaplayarak iki boyutlu görüntüler oluşturur. Bu görüntülerden Yönlendirilmiş Gradyanların Histogramı (HOG) yöntemiyle özellikler çıkarılmış ve K-En Yakın Komşu (KNN) ile Destek Vektör Makineleri (SVM) algoritmalarında sınıflandırma yapılmıştır. Ayrıca, görüntüler doğrudan Konvolüsyonel Sinir Ağı (CNN) ile sınıflandırılmıştır. Çalışmada LibriSpeech ve VoxCeleb1 veri setleri kullanılmış; veriler eğitim ve test gruplarına ayrılmıştır. Deneysel sonuçlar, birinci ve ikinci derece AGD ile CNN kullanıldığında LibriSpeech veri setinde sırasıyla %93.2 ve %91, VoxCeleb1 veri setinde ise %75.5 ve %71 doğruluk oranına ulaşıldığını göstermektedir. Ayrıca, MFCC ve birinci derece AGD yöntemlerinin hibrit CNN yaklaşımıyla birlikte kullanılması LibriSpeech'te %97.6, VoxCeleb1'de ise %84.3 doğruluk oranı sağlamıştır. Elde edilen bulgular, AGD yönteminin konuşmacı tanıma alanında alternatif ve etkili bir yaklaşım sunduğunu ortaya koymaktadır.

Özet (Çeviri)

Speaker identification is the process of determining the person who performed the speech from a given audio recording, and it is widely used in various fields such as security systems. In this study, a comparative analysis of feature extraction methods used in the speaker recognition process was conducted. The commonly used methods in the literature, MFCC (Mel-Frequency Cepstral Coefficients) and LPCC (Linear Predictive Cepstral Coefficients), were examined, and in addition, a newly proposed method, Angle-Amplitude Transform (AAT), was applied for the first time. AAT computes angle and amplitude values from the peaks and troughs of speech signals and generates two-dimensional images. Features were extracted from these images using the Histogram of Oriented Gradients (HOG) method, and classification was performed with the K-Nearest Neighbors (KNN) and Support Vector Machines (SVM) algorithms. Furthermore, the images were directly classified using a Convolutional Neural Network (CNN). The LibriSpeech and VoxCeleb1 datasets were used in the study, and the data was divided into training and testing sets. Experimental results show that with first and second order AAT combined with CNN, accuracy rates of 93.2% and 91% were achieved on the LibriSpeech dataset, while 75.5% and 71% were obtained on the VoxCeleb1 dataset, respectively. Moreover, the hybrid CNN approach combining MFCC and first order AAT achieved accuracy rates of 97.6% on LibriSpeech and 84.3% on VoxCeleb1. The findings demonstrate that the AAT method provides an alternative and effective approach in the field of speaker recognition.

Benzer Tezler

  1. K-Abr bulgularının normalizasyonu ve koklear implantlı çocukların K-Abr sonuçları ile dil ve fonolojik döngü ölçümleri arasındaki ilişkinin incelenmesi

    Normalization of S-Abr results and investigation of the relationship between S-Abr results and language and phonological loop measurements of children with cochlear implants

    DENİZ TAŞKIRAN KÜÇÜKÖNCÜ

    Doktora

    Türkçe

    Türkçe

    2024

    Eğitim ve ÖğretimAnadolu Üniversitesi

    Özel Eğitim Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ NURDAN CANKUVVET AYKUT

  2. A block proccessing approach for doppler centroid estimation

    Doppler merkezi kestirimi için blok işleme yaklaşımı

    PELİN TUNÇAY

    Yüksek Lisans

    İngilizce

    İngilizce

    2013

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    İletişim Sistemleri Ana Bilim Dalı

    DOÇ. DR. MESUT KARTAL

  3. İnverse synthetic aperture radar imaging

    Ters yapay açıklıklı radarda görüntüleme

    İBRAHİM ÖLÇER

    Yüksek Lisans

    İngilizce

    İngilizce

    1995

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    PROF.DR. ERTUĞRUL ÇELEBİ

  4. Computer aided design of the self oscillating microwave mesfet mixer

    Kendinden uyarmalı çift geçitli GaAs mesfet karıştırıcının bilgisayar destekli tasarımı

    AHMAD HAKİMİ DARSİNOOİEH

    Yüksek Lisans

    İngilizce

    İngilizce

    1990

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    PROF.DR. OSMAN PALAMUTÇUOĞULLARI

  5. Modulation of terahertz waves by VO2 based metamaterials

    VO2 tabanlı metamalzemeler ile terahertz dalgaları modülasyonu

    AILEEN NOORI

    Doktora

    İngilizce

    İngilizce

    2023

    Fizik ve Fizik Mühendisliğiİzmir Yüksek Teknoloji Enstitüsü

    Fizik Ana Bilim Dalı

    PROF. DR. GÜLNUR AYGÜN ÖZYÜZER