Geri Dön

Ortopedik cerrahlar ile yapay zekâ arasında ortopedi konseyindeki vakalarda klinik karar vermenin karşılaştırmalı retrospektif araştırılması

Comparison of clinical decision-making in orthopaedic board cases: A retrospective study between orthopaedic surgeons and artificial intelligence

  1. Tez No: 983824
  2. Yazar: IKRAM ALLAHVERDIYEV
  3. Danışmanlar: DOÇ. DR. TOLGA ONAY
  4. Tez Türü: Tıpta Uzmanlık
  5. Konular: Ortopedi ve Travmatoloji, Orthopedics and Traumatology
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: İstanbul Medeniyet Üniversitesi
  10. Enstitü: Tıp Fakültesi
  11. Ana Bilim Dalı: Ortopedi ve Travmatoloji Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Büyük dil modelleri (Large Language Models, LLM), klinik karar desteğinde giderek daha sık değerlendirilmektedir; ancak ortopedi pratiğinde gerçek klinik vakalarda konsey kararlarıyla ne ölçüde örtüştükleri ve hangi bağlamlarda ayrıştıkları net değildir. Bu tez çalışmasında, üçüncü basamak bir merkez olan İstanbul Medeniyet Üniversitesi Göztepe Prof. Dr. Süleyman Yalçın Şehir Hastanesi Ortopedi ve Travmatoloji Kliniği'nde haftalık ortopedi konseyi toplantılarında tartışılan vakalar üzerinden ChatGPT-5, Claude Opus 4.1 ve Gemini 2.5 Pro modellerinin klinik karar desteği performansı değerlendirilmiştir. Çalışma retrospektif, tek merkezli ve karşılaştırmalı gözlemsel tasarımda planlanmış; Mayıs 2024–Haziran 2025 döneminde bu toplantılarında tartışılan ve kriterlere uyan vakalar çalışmaya alınmıştır. Yaş ortalaması 49,17±20,24 yıl olan, 66'sı (%55,9) erkek, 52'si (%44,1) kadın toplam 118 olgu değerlendirilmiştir. Her olgu için standartlaştırılmış vaka özeti hazırlanmış ve her modele aynı içerikle iki standart soru yöneltilmiştir. Yanıtlar; konsey kararıyla uyum, klinik doğruluk, klinik içeriğe uygunluk, hata profili, ek bilgi talebi, zaman içi tutarlılık ve öneri tarzına göre iki bağımsız gözlemci tarafından değerlendirilmiş; klinik yorumu desteklemek amacıyla sınırlı bir nitel değerlendirme yapılmıştır. Klinik doğruluk açısından olgular, çalışmaya özgü olarak klinik kılavuz durumuna göre; klinik rehber bulunan (A), rehber bulunmayan ancak literatürle desteklenen (B) ve rehber/literatür desteği olmayan (C) şeklinde sınıflandırılmıştır. Travma olguları (%44,1) en sık klinik kategori idi. Konsey kararlarının %70,3'ü cerrahi ve %29,7'si konservatif tedavi yönündedir. Modeller, konseyin cerrahi karar verdiği olgularda“cerrahi”yanıtı %44,6–%66,3 oranında verirken, konservatif olgularda xiv“konservatif”yanıt %31,4–%60,0 aralığında kalmıştır. Konsey ile modeller arasındaki karar uyumu Cohen's kappa ile düşük ve anlamsız bulunmuştur (ChatGPT-5 κ=0,108; Claude κ=−0,079; Gemini κ=−0,022; tümü p>0,05). Üç modelin kendi aralarındaki karar uyumu Fleiss' kappa ile düşük-orta düzeydeydi (κ=0,282). Klinik doğruluk açısından, A'da modeller arasında anlamlı fark izlenmezken, B'de doğruluk dağılımları anlamlı farklılık göstermiş (p<0,05) ve C'de tüm modellerde doğruluk düzeylerinin belirgin olarak azaldığı görülmüştür. Ayrıca ek bilgi talebi (p<0,001), zaman içi tutarlılık (p=0,034) ve öneri tarzında (p<0,001) modeller arasında anlamlı farklılıklar saptanmıştır; Gemini 2.5 Pro daha sık spesifik ek bilgi talep edip daha yüksek kesinlik içeren dil kullanırken, ChatGPT-5 daha yüksek zamansal tutarlılık göstermiştir. Sonuç olarak, LLM'ler temel klinik kararlarda genel olarak benzer karar verme eğilimi göstermekle birlikte, konsey karar tipi ve klinik kılavuz bağlamına göre yanıt üretme biçimleri farklılaşmaktadır. Bu bulgular, LLM'lerin ortopedi pratiğinde tek başına karar verici değil, klinisyen denetiminde karar destek aracı olarak değerlendirilmesi gerektiğini göstermektedir.

Özet (Çeviri)

Large language models (LLMs) are increasingly evaluated for clinical decision support; however, in orthopaedic practice, the extent to which their outputs align with orthopaedic board decisions and the contexts in which they diverge remain unclear. This thesis assessed ChatGPT-5, Claude Opus 4.1, and Gemini 2.5 Pro using cases discussed at Istanbul Medeniyet University Göztepe Prof. Dr. Süleyman Yalçın City Hospital (Department of Orthopaedics and Traumatology), a tertiary referral center. This retrospective, single-center, comparative observational study included board cases discussed between May 2024 and June 2025 that met inclusion criteria. A total of 118 cases were analyzed (mean age 49.17 ± 20.24 years; 66 [55.9%] male, 52 [44.1%] female). For each case, a standardized summary was prepared, and two identical core questions were presented to each model. Outputs were independently assessed by two observers for concordance with the board decision, clinical accuracy, clinical relevance, error profile, request for additional information, temporal consistency, and recommendation style; a limited qualitative assessment was also performed. For clinical accuracy, cases were classified—specific to this study—by guideline status into: guideline-available (A), no guideline but literature-supported (B), and no guideline or literature support (C). Trauma was the most frequent category (44.1%), and board decisions were surgical in 70.3% and conservative in 29.7% of cases. Models classified cases with surgical council decisions as surgical at rates of 44.6–66.3%, while correct identification of conservative decisions ranged from 31.4–60.0%. Agreement between models and the council was low and not statistically significant by Cohen's kappa (ChatGPT-5 κ=0.108; Claude xvi κ=−0.079; Gemini κ=−0.022; all p>0.05). Inter-model agreement was fair according to Fleiss' kappa (κ=0.282). No significant differences were observed among models in A, accuracy distributions differed in B (p < 0.05), and accuracy decreased across models in C. Significant differences were also identified in requests for additional information (p < 0.001), temporal consistency (p = 0.034), and recommendation style (p < 0.001); Gemini 2.5 Pro more frequently requested specific additional information and used higher-certainty language, while ChatGPT-5 demonstrated higher temporal consistency. In conclusion, although LLMs showed broadly similar decision-making tendencies, response patterns varied by board decision type and guideline context; thus, LLMs should be used as clinician-supervised decision support tools, not standalone decision-makers.

Benzer Tezler

  1. Yapay zeka ve derin öğrenme teknolojileri ile kalça eklemi radyografilerinde femoral komponentin tanınması

    Identifying femoral stems from pelvic x-ray with deep learning and artificial intelligence algorithm

    AHMET METİN ÖZSEZEN

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2021

    Ortopedi ve TravmatolojiSağlık Bilimleri Üniversitesi

    Ortopedi ve Travmatoloji Ana Bilim Dalı

    PROF. DR. CEMİL YILDIZ

  2. Klinik etkililik açısından displastik koksartrozda kalça artroplasti ameliyatlarının volüm bazlı değerlendirilmesi

    Volume-based evaluation of hip arthroplasty surgery in dysplastic coxarthrosis in terms of clinical effectiveness

    SEVDA UZUN DIRVAR

    Doktora

    Türkçe

    Türkçe

    2021

    Sağlık YönetimiÜsküdar Üniversitesi

    Sağlık Yönetimi Ana Bilim Dalı

    PROF. DR. HAYDAR SUR

  3. Farklı malzemeler için yenilikçi diz implantı tasarımı ve sonlu elemanlar yöntemi ile optimizasyonu

    Innovative knee implant design for different materials and optimisation by finite element method

    TURAN IBRAHIMOVA

    Yüksek Lisans

    Türkçe

    Türkçe

    2023

    Makine MühendisliğiSakarya Üniversitesi

    Biyomedikal Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ OSMAN İYİBİLGİN

  4. Cerrahlarda ameliyat sonrası gelişen kas iskelet sistemi ağrıları üzerinde kinesio bantlama tekniğinin fonksiyonel performansa etkisi

    The effect of kinesiotape application on functional performance in surgeons having musculo-skeletal pain after surgery.

    NİHAN KARATAŞ

    Yüksek Lisans

    Türkçe

    Türkçe

    2010

    Fiziksel Tıp ve RehabilitasyonHacettepe Üniversitesi

    Fizik Tedavi ve Rehabilitasyon Ana Bilim Dalı

    PROF. DR. GÜL BALTACI

  5. Triple artrodez uygulamalarında rijit internal fiksasyon gerekli mi?

    Is rigid internal fixation required in triple artrodesia applications?

    FATİH UĞUR

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2003

    Ortopedi ve TravmatolojiSağlık Bakanlığı

    Ortopedi ve Travmatoloji Ana Bilim Dalı

    PROF. DR. GAZİ ZORER