Açı genlik dönüşümü kullanarak konuşmacı tanımlama
Speaker identification using angle amplitude transform
- Tez No: 983247
- Danışmanlar: PROF. DR. CEMAL KÖSE
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Konuşmacı tanımlama, özellik çıkarımı, açı genlik dönüşümü, sınıflandırma algoritmaları, Speaker identification, feature extraction, angle amplitude transform, classification algorithms
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Karadeniz Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Konuşmacı tanımlama, belirli bir ses kaydından konuşmayı gerçekleştiren kişiyi belirleme süreci olup güvenlik sistemleri gibi birçok alanda kullanılmaktadır. Bu çalışmada konuşmacı tanıma sürecinde kullanılan özellik çıkarım yöntemlerinin karşılaştırmalı analizi yapılmıştır. Literatürde yaygın olarak kullanılan MFCC (Mel-Frekans Kepstrum Katsayıları) ve LPCC (Doğrusal Öngörülü Kepstral Katsayılar) yöntemleri incelenmiş, bunlara ek olarak ilk kez önerilen Açı Genlik Dönüşümü (AGD) yöntemi uygulanmıştır. AGD, ses sinyallerindeki tepe ve çukur noktalarından açı ve genlik değerlerini hesaplayarak iki boyutlu görüntüler oluşturur. Bu görüntülerden Yönlendirilmiş Gradyanların Histogramı (HOG) yöntemiyle özellikler çıkarılmış ve K-En Yakın Komşu (KNN) ile Destek Vektör Makineleri (SVM) algoritmalarında sınıflandırma yapılmıştır. Ayrıca, görüntüler doğrudan Konvolüsyonel Sinir Ağı (CNN) ile sınıflandırılmıştır. Çalışmada LibriSpeech ve VoxCeleb1 veri setleri kullanılmış; veriler eğitim ve test gruplarına ayrılmıştır. Deneysel sonuçlar, birinci ve ikinci derece AGD ile CNN kullanıldığında LibriSpeech veri setinde sırasıyla %93.2 ve %91, VoxCeleb1 veri setinde ise %75.5 ve %71 doğruluk oranına ulaşıldığını göstermektedir. Ayrıca, MFCC ve birinci derece AGD yöntemlerinin hibrit CNN yaklaşımıyla birlikte kullanılması LibriSpeech'te %97.6, VoxCeleb1'de ise %84.3 doğruluk oranı sağlamıştır. Elde edilen bulgular, AGD yönteminin konuşmacı tanıma alanında alternatif ve etkili bir yaklaşım sunduğunu ortaya koymaktadır.
Özet (Çeviri)
Speaker identification is the process of determining the person who performed the speech from a given audio recording, and it is widely used in various fields such as security systems. In this study, a comparative analysis of feature extraction methods used in the speaker recognition process was conducted. The commonly used methods in the literature, MFCC (Mel-Frequency Cepstral Coefficients) and LPCC (Linear Predictive Cepstral Coefficients), were examined, and in addition, a newly proposed method, Angle-Amplitude Transform (AAT), was applied for the first time. AAT computes angle and amplitude values from the peaks and troughs of speech signals and generates two-dimensional images. Features were extracted from these images using the Histogram of Oriented Gradients (HOG) method, and classification was performed with the K-Nearest Neighbors (KNN) and Support Vector Machines (SVM) algorithms. Furthermore, the images were directly classified using a Convolutional Neural Network (CNN). The LibriSpeech and VoxCeleb1 datasets were used in the study, and the data was divided into training and testing sets. Experimental results show that with first and second order AAT combined with CNN, accuracy rates of 93.2% and 91% were achieved on the LibriSpeech dataset, while 75.5% and 71% were obtained on the VoxCeleb1 dataset, respectively. Moreover, the hybrid CNN approach combining MFCC and first order AAT achieved accuracy rates of 97.6% on LibriSpeech and 84.3% on VoxCeleb1. The findings demonstrate that the AAT method provides an alternative and effective approach in the field of speaker recognition.
Benzer Tezler
- K-Abr bulgularının normalizasyonu ve koklear implantlı çocukların K-Abr sonuçları ile dil ve fonolojik döngü ölçümleri arasındaki ilişkinin incelenmesi
Normalization of S-Abr results and investigation of the relationship between S-Abr results and language and phonological loop measurements of children with cochlear implants
DENİZ TAŞKIRAN KÜÇÜKÖNCÜ
Doktora
Türkçe
2024
Eğitim ve ÖğretimAnadolu ÜniversitesiÖzel Eğitim Ana Bilim Dalı
DR. ÖĞR. ÜYESİ NURDAN CANKUVVET AYKUT
- A block proccessing approach for doppler centroid estimation
Doppler merkezi kestirimi için blok işleme yaklaşımı
PELİN TUNÇAY
Yüksek Lisans
İngilizce
2013
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesiİletişim Sistemleri Ana Bilim Dalı
DOÇ. DR. MESUT KARTAL
- İnverse synthetic aperture radar imaging
Ters yapay açıklıklı radarda görüntüleme
İBRAHİM ÖLÇER
Yüksek Lisans
İngilizce
1995
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiPROF.DR. ERTUĞRUL ÇELEBİ
- Computer aided design of the self oscillating microwave mesfet mixer
Kendinden uyarmalı çift geçitli GaAs mesfet karıştırıcının bilgisayar destekli tasarımı
AHMAD HAKİMİ DARSİNOOİEH
Yüksek Lisans
İngilizce
1990
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiPROF.DR. OSMAN PALAMUTÇUOĞULLARI
- Modulation of terahertz waves by VO2 based metamaterials
VO2 tabanlı metamalzemeler ile terahertz dalgaları modülasyonu
AILEEN NOORI
Doktora
İngilizce
2023
Fizik ve Fizik Mühendisliğiİzmir Yüksek Teknoloji EnstitüsüFizik Ana Bilim Dalı
PROF. DR. GÜLNUR AYGÜN ÖZYÜZER