PEDİATRİK ACİL HASTALARIN ULTRASONOGRAFİ RAPORLARININ DEĞERLENDİRİLMESİNDE CHATGPT’NİN ETKİNLİĞİ
İzmir Eğitim ve Araştırma Hastanesi Tıp Dergisi, cilt.30, sa.1, ss.77-82, 2026 (TRDizin)
- Yayın Türü: Makale / Tam Makale
- Cilt numarası: 30 Sayı: 1
- Basım Tarihi: 2026
- Dergi Adı: İzmir Eğitim ve Araştırma Hastanesi Tıp Dergisi
- Derginin Tarandığı İndeksler: TR DİZİN (ULAKBİM)
- Sayfa Sayıları: ss.77-82
- Recep Tayyip Erdoğan Üniversitesi Adresli: Evet
Özet
Giriş: Bu çal ışmanın amacı, ChatGPT modelinin pediatrik acil ultrason raporlarında acil patolojileri tespit etmedeki başarısını değerlendirmek ve sıfır atış ve az atış promptlama tekniklerinin etkinliğini karşılaştırmaktır. Gereç ve Yöntem: Çalışmaya toplam 196 pediatrik acil ultrason raporu dahil edildi. İlk olarak ultrason raporları anonimleştirildi. Board sertifikalı bir radyolog, raporları acil patoloji açısından pozitif veya negatif olarak etiketledi. ChatGPT-3.5 ve 4 modelleri, farklı prompt teknikleri (sıfır atış ve az atış) ve farklı zamanlarda (Mart ve Haziran) test edildi. Her modelin performansı doğruluk, duyarlılık, özgüllük ve F1 skoru kullan ılarak de ğerlendirildi. İkili sınıfları karşılaştırmak için McNemar testi kullanıldı. Bulgular: En s ık tespit edilen acil durum patolojileri testis torsiyonu, apandisit ve intussepsiyondu. ChatGPT-4 (Mart, s ıfır at ış) en yüksek başarı oranını elde etti (do ğruluk %94, duyarlılık %91, özgüllük %95). İkili sınıflandırmada, yalnızca ChatGPT-3.5 s ıfır at ış (Haziran) ve ChatGPT-4 s ıfır at ış (Haziran) cevapları arasında istatistiksel olarak anlamlı bir fark bulundu (p<0,05). Tüm modellerin doğruluk oranları %88 ile %94 arasındaydı. Az atışlı komut verme, sıfır atış tekniğine göre önemli bir performans avantajı göstermedi. Sonuç: ChatGPT modelleri, radyologların yorumlamalarıyla kar şılaştırıldığında acil patoloji durumlarını tespit etmek için başarılı bir yöntemdir. Çalışmamız, büyük dil modellerinin klinik iş akışlarında triyaj aracı olarak kullanılma potansiyelini göstermektedir.
Introduction: This study aims to evaluate the success of the ChatGPT model in detecting emergency pathologies in pediatric emergency ultrasound reports and to compare the effectiveness of zero-shot and few-shot prompting techniques. Material and Method: A total of 196 pediatric emergency ultrasound reports were included in the study. Firstly, the ultrasound reports were anonymized. A board-certified radiologist labeled the reports as positive or negative for emergency pathology. ChatGPT-3.5 and 4 models were tested with different prompting techniques (zero-shot and few-shot) and at different times (March and June). Performance of each model was assessed using accuracy, sensitivity, specificity, and F1-score. The McNemar test was used to compare the binary classes. Results: The most frequently identified emergency pathologies were testicular torsion, appendicitis, and intussusception. ChatGPT-4 (March, zero-shot) achieved the highest success rate (accuracy 94%, sensitivity 91%, specificity 95%). In binary classification, a stat istically significant difference was only found between ChatGPT-3.5 zero-shot (June) and ChatGPT-4 zero-shot (June) responses (p<0.05). The accuracy rates of all models ranged from 88% to 94%. Few-shot prompting did not show a significant performance advantage over the zero-shot technique. Conclusion: ChatGPT models are a successful method for detecting the presence of emergency pathology when compared to the reference standard of radiologist interpretation. Our study demonstrates the potential for large language models to be used as triage tools in clinical workflows.