İçerik Haritası
Avukatlık imtihanını bile geçen yapay zeka, aslında o kadar da zeki değil mi?
Yapay zeka modellerinin avukatlık baro imtihanlarını geçtiğine yahut doktora derecesine muadil zeka sergilediğine dair çıkan haberlerin güvenilirliği sorgulanmaya başlandı. Oxford İnternet Enstitüsü’nden çıkan yeni bir araştırma, AI performansını ölçmek için kullanılan yaygın test araçlarının büyük çoğunluğunun güvenilmez ve aldatıcı olabileceğini gösteriyor.
Araştırmacılar, dal ve akademi tarafından kullanılan, yapay zakanın mantık yürütme yeteneklerinden kodlama vazifelerindeki performansına kadar her şeyi test eden tam 445 farklı karşılaştırma testini derinlemesine inceledi. Uzmanlar, bu testlerin yaklaşımlarını kıymetlendirdi ve sunulan sonuçların göründüğü kadar kesin olmayabileceğine dair önemli işaretler buldu.
Bu güvensizliğin ana nedenleri ortasında, bir testin ölçmeyi amaçladığı maharetin bulanık tanımlanması ve modelleri karşılaştırmaya yarayan istatistiksel metotların şeffaf bir halde açıklanmaması yer alıyor. Araştırmacıların tespit ettiği en kritik sorun ise şu: “Birçok karşılaştırma testi, hedeflenen yetenekleri geçerli bir halde ölçemiyor.” Yani, bir test makul bir beceriyi ölçtüğünü argüman etse bile, aslında modelin gerçek kabiliyetini tam olarak yakalayan bir formül kullanmıyor.
Muhakeme mi, ezber mi? GSM8K testi örneği
Araştırmacılar, bu durumu çarpıcı bir örnekle açıklıyor: Grade School Math 8K (GSM8K) karşılaştırma testi. Bu test, büyük lisan modellerini ilkokul düzeyindeki matematik sorunlarıyla “çok adımlı matematiksel muhakemeye” zorlamak için tasarlandı.
Ancak araştırmacılar, testin bir modelin nitekim mantık yürütüp yürütmediği konusunda kesin bir bilgi vermediğini savunuyor. Çalışmanın baş müellifi Adam Mahdi, durumu şöyle örneklendiriyor: “Birinci sınıftaki bir öğrenciye iki artı beşin kaç olduğunu sorduğunuzda ‘yedi’ karşılığını alırsınız. Bu yanlışsız bir karşılıktır. Fakat yalnızca bu toplama sürecini yapabildiği için, o öğrencinin matematiksel muhakemede ustalaştığı sonucuna varabilir miyiz? Muhtemelen hayır.“
Çalışma, GSM8K skorlarının vakit içinde yükseldiğini gösteriyor. Bu artış birinci bakışta modellerin gelişimini gösterse de, tıpkı vakitte data kirlenmesine de işaret edebiliyor. Kirlenme, test sorularının modelin eğitim bilgi setine sızmasıyla yahut modelin bir tahlile mantık yürüterek varmak yerine karşılıkları ezberlemeye başlamasıyla gerçekleşiyor. Araştırmacılar, birebir performansı ölçmek için yeni sorular kullandıklarında, modellerin başarılarında değerli düşüşler yaşadığını fark etti.
Bu çalışma, AI testleri üzerine yapılan en kapsamlı incelemelerden biri olsa da, ölçüm sisteminin argüman edildiği kadar kusursuz olmadığını gösteren birinci ihtar değil. Geçen yıl Stanford’daki araştırmacılar da, tanınan AI testlerini tahlil ederek “aralarında geliştiriciler ile siyaset yapıcıların güvendiği testler de dahil olmak üzere büyük kalite farklılıkları” bulmuştu. Bu araştırmalar, performans ölçümlerinin yeterli niyetli tasarlanmış olsa bile, şirketler için kolaylıkla birer pazarlama aracına dönüşebileceğini bir defa daha hatırlatıyor.
Chip Alıntıdır…


