Türkiye’den yeni akademik çalışma; popüler yapay zeka modelleri ChatGPT-5.1, DeepSeek-R1 Gemini 2.5 Flash’ın eczacılık uzmanlık sorularındaki başarısını ölçtü. Hacettepe Üniversitesi Eczacılık Fakültesi Klinik Eczacılık Anabilim Dalından araştırmacılar, yapay zeka modellerinin yüzde 90’ın üzerinde başarı sağladığını tespit. Ancak yapay zeka araçlarının yanlış cevap verdiklerinde bile “aşırı özgüvenli” tutum sergilemeleri nedeniyle uzmanlar uyardı. 

Günümüzün en popüler büyük dil modelleri (LLM), kez tıp eczacılık dünyasının en zorlu virajlarından biri olan Eczacılıkta Uzmanlık Eğitimi Giriş Sınavı (EUS) sorularıyla ter döktü. 2017-2025 yılları arasında çıkmış 84 çoktan seçmeli sorunun yapay zekaya yöneltildiği araştırmada dikkat çeken sonuçlar elde edildi.

Birinci, burun farkıyla Gemini 2.5 Flash

Araştırmada modellerin başarı oranları birbirine oldukça yakın çıksa zirvenin sahibi küçük farkla Gemini 2.5 Flash. Gemini 2.5 Flash: yüzde 92,9 doğruluk oranı sergilerken, ChatGPT-5.1: yüzde 90,5 doğruluk oranıyla ikinci oldu üçüncü sırada ise DeepSeek-R1: yüzde 89,3 doğruluk oranıyla yer. Üç modelin başarılı olma oranları arasındaki fark ise istatistiksel olarak anlamlı bulunamadı (p=0,584).

İstatistiksel analize göre üç modelin başarı oranları arasındaki küçük farklar anlamlı üstünlük oluşturmuyor; yani kabaca üç modelin eczacılık bilgisi konusunda benzer şekilde yüksek performans gösterdiği kabul ediliyor.

Asıl tehlike kendilerine aşırı güvenleri 

Araştırmanın en dikkat çekici düşündürücü kısmı ise yapay zekanın “özgüven” testinde ortaya çıktı. Modellere verdikleri cevaplardan ne kadar emin oldukları (1 5 arası ölçekle) sorulduğunda, modellerin yanlış cevap verdiklerinde dahi kendilerinden aşırı derecede emin oldukları görüldü.

Özellikle ChatGPT-5.1, yanlış bildiği soruların yüzde 87,5’ine “kesinlikle eminim (5/5)” diyerek en agresif aşırı özgüveni sergileyen model. oran Gemini 2.5 Flash’ta yüzde 66,7, DeepSeek-R1’ ise yüzde 55,6 olarak kaydedildi. Uzmanlar, yapay zekanın “kusursuz dille yanlış bilgi verme” (halüsinasyon) eğiliminin, eğitimde körü körüne güvenilirse ciddi riskler doğurabileceğine nedenle uzman denetimlerinin olması gerektiğine dikkat çekti. 

En “halk diline yakın” anlatan ChatGPT-5.1

Araştırmada modellerin sadece doğru cevap verip vermediği değil, cevapları ne kadar anlaşılır dille açıkladığı (metin okunabilirliği indeksleri kullanılarak) incelendi.

Yapılan analizlerde ChatGPT-5.1’in, Gemini DeepSeek’e kıyasla daha az karmaşık, anlaşılması daha kolay dil yapısı daha sade metinler ürettiği belirlendi. ChatGPT-5.1’i, karmaşık eczacılık konularını daha “okunabilir” kılmakta adım öne çıkarıyor.

Çalışmanın sonuç bölümünde, yapay zekanın eczacılık eğitiminde sınav hazırlık süreçlerinde harika “yardımcı araç” olabileceği belirtildi. Ancak modellerin bilmedikleri şeyleri biliyormuş gibi anlatma eğilimi nedeniyle; eğitim süreçlerinde mutlaka akademik rehberliğin, uzman denetiminin eleştirel gözün devrede olması gerektiğinin altı çizildi.

: Scientific Reports