İçerik Haritası
Global yapay zeka testinde şok sonuç: Haberlerin yarısı palavra çıktı
Yapay zeka sohbet robotları süratle günlük hayatımızın ve bilgiye erişim halimizin merkezine yerleşirken, güvenilirlikleri sorgulanmaya devam ediyor. Avrupa Yayın Birliği (EBU) tarafından 18 ülkeden ve 14 lisandan 22 kamu hizmeti medya kuruluşunun iştirakiyle gerçekleştirilen kapsamlı bir araştırma, bu tanınan yapay zeka sohbet robotlarının haber ve yeni bilgi konusunda sistematik olarak başarısız olduğunu gösterdi.
Araştırmacılar, en sık kullanılan yapay zeka platformlarından (OpenAI’nin ChatGPT’si, Microsoft Copilot, Google Gemini ve Perplexity) aldıkları haberle ilgili 3.000 cevabı doğruluk, kaynak kullanımı, gerçekleri görüşlerden ayırma ve bağlam sağlama üzere temel kriterlere nazaran kıymetlendirdi. Yapay zeka karşılıklarının %45’i en az bir kıymetli sorun içeriyordu ve %81’inde küçük meseleler tespit edildi. Bu değerli meselelerin başında ise kaynak gösterimi ve doğruluk geldi.
Yapay zeka asistanlarının karşılaştığı en büyük iki sorun, karşılıkların güvenilirliğini temelden sarsıyor. Cevapların %31’inde eksik, aldatıcı yahut büsbütün yanlış atıflar üzere önemli kaynak meseleleri görüldü. Örneğin, Copilot’a kuş gribiyle ilgili bir soru sorulduğunda, karşılığını 2006 tarihli, yeniliğini yitirmiş bir BBC makalesine dayandırdı. Cevapların %30’unda ise halüsinasyonlu ayrıntılar yahut yeniliğini yitirmiş bilgiler içeren büyük doğruluk meseleleri yaşandı. Örneğin ChatGPT, mevcut Papa’nın bir ay evvel öldüğünü ve yerine Papa XIV. Leo’nun geçtiğini sav etti.
En berbatı hangisi?
Test edilen dört model ortasında haberler konusunda en makûs performansı Google’ın Gemini modeli sergiledi. Araştırmacılar, Gemini’nin cevaplarının %76’sında sorun olduğunu tespit etti ve bu oran öbür modellerin iki katından fazlaydı. Copilot %37 ile ikinci, ChatGPT %36 ile üçüncü, Perplexity ise %30 ile en yeterli performansı gösteren model oldu.
EBU Medya Yöneticisi Jean Philip De Tender, bu başarısızlıkların münferit olaylar olmadığını belirterek, “Bunlar sistematik, hudut ötesi ve çok lisanlı ve bunun kamu itimadını tehlikeye attığına inanıyoruz” dedi ve ekledi: “İnsanlar neye güveneceklerini bilmediklerinde, en sonunda hiçbir şeye güvenmezler ve bu durum demokratik iştiraki bile engelleyebilir.”
Şurası bir gerçek: Yapay zeka, bilhassa süratle değişen bilgiler, karmaşık vakit çizelgeleri ve gerçekler ile görüşler ortasında ayrım gerektiren bahislerde zorluk yaşıyor. Örneğin, modellerin neredeyse yarısı “Trump bir ticaret savaşı mı başlatıyor?” üzere net bir cevap gerektirmeyen bir soruyu yanıtlarken kıymetli yanlışlar yapıyor.
Bu asistanlar, günlük kullanıcılar için süratle birincil bilgi kaynağı haline gelmeye çalışırken, bu güvenilirlik açığı büyük bir tehlike demek. Tüketiciler, yapay zeka asistanlarının yanlışsız olduğuna güvenmeye devam ederken, bu asistanlar sağlam haber kaynaklarına olan trafiği azaltmaya devam ediyor. Reuters Enstitüsü’nün raporuna nazaran, haber almak için yapay zeka asistanlarını kullanan 18-24 yaş ortası bireylerin oranı geçen yıldan bu yana iki katına çıktı.
Araştırmacılar, elde edilen bu sonuçlara karşın modellerde kimi güzelleşmeler olduğunu da kaydetti. Fakat genel kanı epey net gözüküyor: “Yapay zeka asistanları, haberlere erişmek ve onları tüketmek için hala sağlam bir yol değil.”
Chip Alıntıdır…


