Veri Çoğalınca Zekâ Neden Körleşir?

Makine öğrenmesinde sık yapılan sezgisel hata şudur: Daha fazla değişken, daha fazla bilgi demektir; daha fazla bilgi de daha iyi tahmin. Kulağa mantıklı gelir. Hatta bir dedektif gibi düşünürsek, olay yerindeki her iz kıymetlidir. Fakat yüksek boyutlu veri dünyasında dedektifin cebine o kadar çok ipucu doldururuz ki, sonunda fail değil, cebin ağırlığı bulunur. İşte boyutluluk laneti tam olarak burada başlar: Değişken sayısı arttıkça problem zenginleşmez, çoğu zaman seyrekleşir, bulanıklaşır ve öğrenilmesi zorlaşır.

Boyut arttıkça uzay şişer

Bir veri noktasını iki değişkenle düşünmek kolaydır: x ve y ekseninde bir nokta. Üç boyutta hâlâ zihnimiz idare eder. Peki ya 100 boyut? 1000 boyut? Burada mesele sadece görselleştirme zorluğu değildir. Asıl sorun, uzayın hacminin patlayıcı biçimde büyümesidir. Bir odaya 10 sandalye koyarsanız dolu görünür. Aynı 10 sandalyeyi bir stadyuma koyarsanız neredeyse boşlukta kaybolurlar. Veri noktaları da yüksek boyutlarda böyle kaybolur: Elinizde çok örnek var sanırsınız ama uzay o kadar büyümüştür ki her nokta yalnız başına kalır.

Makine öğrenmesi modelleri örüntü bulmak ister. Örüntü bulmak için de benzer örneklerin birbirine yakın olması gerekir. Fakat boyut sayısı arttıkça yakınlık kavramı bozulur. En yakın komşu ile en uzak komşu arasındaki fark azalabilir. Mesafe ölçüleri anlamını yitirmeye başlar. Kısacası algoritmaya, mahalledeki benzer evleri bul diyorsunuz; fakat mahalle bir anda galaksiye dönüşüyor ve bütün evler birbirinden kozmik ölçekte uzaklaşıyor.

Her değişken bilgi değildir

Boyutluluk lanetinin en sinsi tarafı, değişkenlerin hepsinin eşit derecede yararlıymış gibi görünmesidir. Bir müşterinin yaşı, geliri ve önceki alışverişleri anlamlı olabilir. Ama tarayıcı pencere genişliği, formu doldurduğu saniyenin tek mi çift mi olduğu, kullandığı cihazın pil yüzdesi gibi değişkenler modele girdiğinde işler karışır. Model, gerçekten nedensel ya da istatistiksel olarak güçlü sinyali öğrenmek yerine, gürültünün içinde rastlantısal desenlere âşık olabilir.

Bu noktada aşırı öğrenme sahneye çıkar. Model eğitim verisinde harika sonuç verir; çünkü oradaki tesadüfleri bile ezberlemiştir. Ama yeni veri geldiğinde büyü bozulur. Sanki sınav sorularını ezberlemiş ama konuyu anlamamış bir öğrenci gibidir. Eğitimde parıldar, gerçek hayatta tökezler. Çok boyutlu veri, kötü düzenlenmişse modele bilgelik değil, özgüvenli cehalet verir.

Örnek sayısı neden yetmez?

Boyut arttıkça gereken veri miktarı da doğrusal değil, çoğu zaman üstel biçimde artar. Bir değişkeni 10 aralığa böldüğünüzü düşünün. İki değişkende 100 hücre oluşur. On değişkende 10 milyar hücre. Her hücrede yeterli örnek olsun istiyorsanız veri ihtiyacı astronomikleşir. Bu yüzden yüksek boyutlu problemlerde yalnızca daha çok veri toplamak her zaman çözüm değildir. Bazen veri toplamak, kovayla okyanusu doldurmaya benzer.

Çözüm, değişkenleri körlemesine çoğaltmak değil, bilgiyi sıkıştırmak ve anlamlı olanı ayıklamaktır. Öznitelik seçimi, gereksiz değişkenleri dışarıda bırakır. Boyut indirgeme yöntemleri, özellikle PCA gibi teknikler, verideki ana varyasyon yönlerini bulup daha düşük boyutlu bir temsil üretir. Düzenlileştirme yöntemleri modelin fazla karmaşıklaşmasını engeller. Karar ağaçları, gömülü yöntemler ve gözetimli öznitelik önem skorları da hangi değişkenlerin gerçekten işe yaradığını gösterebilir.

Derin öğrenmede bile bu lanet yok olmaz; sadece biçim değiştirir. Sinir ağları temsil öğrenebilir, yani ham veriden daha kullanışlı özellikler çıkarabilir. Ancak yeterli veri, uygun mimari, düzenlileştirme, doğrulama stratejisi ve dikkatli değerlendirme yoksa yüksek boyut yine tuzak kurar. Özellikle metin, görüntü ve genomik gibi alanlarda her piksel, kelime ya da gen bir değişken gibi davranabilir. Burada başarı, çokluğu olduğu gibi yutmakta değil, onu anlamlı yapıya dönüştürmektedir.

Boyutluluk laneti bize teknik olduğu kadar felsefi bir ders de verir: Her şeyi ölçmek, her şeyi anlamak değildir. Bir modele daha fazla sütun eklemek, ona daha fazla akıl vermeyebilir; bazen sadece daha geniş bir labirent inşa eder. İyi veri bilimi, değişken biriktirme sanatı değil, ayırt etme disiplinidir. Soru şudur: Modelin görmesini istediğimiz dünya gerçekten zengin mi, yoksa biz sadece gürültüyü yüksek çözünürlükte mi kaydediyoruz?

Model Haklı Çıktı, Peki Nedenini Kim Biliyor?

Derin öğrenme çağının en tuhaf manzarası şudur: Bir sistem milyonlarca görüntüye, metne, sese bakar; sonra bir karar verir. Kanserli hücreyi işaret eder, kredi başvurusunu reddeder, yüzünüzün kime benzediğini söyler, arabanın frene basmasına karar verir. Çoğu zaman da doğru çıkar. Fakat kapıyı açıp içeri baktığınızda, karşınızda düzenli bir mantık sarayı değil, milyarlarca sayısal ağırlıktan oluşan titreşimli bir orman bulursunuz. Model konuşur, ama gerekçe vermez. Sanki çok zeki ama içine kapanık bir kahinle çalışıyoruz.

Bu yüzden derin öğrenmenin kara kutu problemi sadece teknik bir mesele değildir; güven, sorumluluk ve iktidar meselesidir. Klasik yazılımda geliştirici genellikle şunu diyebilir: Eğer kullanıcı yaşı 18’den küçükse, erişim reddedilir. Mantık izlenebilir, hata ayıklanabilir, mahkemede anlatılabilir. Derin öğrenmede ise karar, tek tek yazılmış kurallardan değil, veriden öğrenilmiş karmaşık örüntülerden doğar. Modelin içinde insanın satır satır okuyacağı bir yasa kitabı yoktur; daha çok, deneyimle biçimlenmiş bir sezgi haritası vardır.

Kural Değil, Örüntü

Bir sinir ağı, veriler arasındaki ilişkileri katman katman dönüştürür. İlk katmanlar basit özellikleri yakalayabilir: kenarlar, renk geçişleri, ses frekansları, kelime parçaları. Daha derin katmanlarda bunlar birleşir, soyutlanır, yeni temsillere dönüşür. Sonuçta model, insanın doğrudan adlandıramadığı ara kavramlarla çalışabilir. Bir kediyi tanırken bıyık, kulak ve pati de görür; ama belki bizim fark etmediğimiz piksel ritimlerini de kullanır. İşte sorun burada başlar: Modelin doğru cevaba hangi patikadan gittiğini bilmek, cevabın kendisini bilmekten çok daha zordur.

Bu durum bazen komik, bazen tehlikelidir. Bir model hastalığı teşhis ediyor sanılırken aslında görüntü cihazının köşesindeki hastane işaretini öğrenmiş olabilir. Bir işe alım algoritması başarıyı ölçüyor sanılırken geçmişteki ayrımcı tercihleri cilalayıp yeniden üretiyor olabilir. Bir güvenlik sistemi suç riskini hesaplıyor sanılırken yoksulluğu cezalandırıyor olabilir. Kara kutu yalnızca karanlık olduğu için değil, karanlıkta neyi büyüttüğünü bilmediğimiz için ürkütücüdür.

Elbette bilim insanları bu kutuya el fenerleriyle girmeye çalışıyor. Açıklanabilir yapay zeka yöntemleri, modelin hangi özelliklere dikkat ettiğini göstermeye çalışır. Isı haritaları, bir görüntü sınıflandırılırken hangi bölgelerin etkili olduğunu renklendirir. SHAP ve LIME gibi teknikler, tekil kararların arkasındaki değişken etkilerini yaklaşık olarak hesaplar. Model damıtma, karmaşık bir ağı daha basit ve anlaşılır bir modele taklit ettirmeye çalışır. Bunlar önemlidir; fakat dürüst olmak gerekir: El feneri mağaranın tamamı değildir.

Doğruluk Yetmez

Bir sistemin yüksek doğruluk oranına sahip olması, onun adil, güvenilir veya açıklanabilir olduğu anlamına gelmez. Uçak iyi uçuyor diye kokpit göstergelerini sökmezsiniz. Tıp, hukuk, finans, eğitim ve güvenlik gibi alanlarda sadece sonuç değil, gerekçe de değerlidir. Çünkü insanlar istatistiksel nesneler değildir; itiraz eder, anlam arar, hesap sorar. Bir algoritma hayatınızı etkiliyorsa, size yalnızca sonuç değil, anlaşılabilir bir neden de borçludur.

Burada pratik yaklaşım şudur: Her problemi en büyük ve en opak modelle çözmeye çalışmamak gerekir. Bazen basit bir karar ağacı, lojistik regresyon ya da kural tabanlı sistem yeterince iyi ve çok daha şeffaftır. Derin öğrenme kullanılacaksa veri denetimi, önyargı testleri, açıklama araçları, insan gözetimi ve sürekli izleme birlikte tasarlanmalıdır. Modelin performansı kadar, nerede başarısız olduğu da ölçülmelidir. Çünkü gerçek mühendislik, yalnızca çalışan şeyi yapmak değil, çalışmadığında nasıl davranacağını da bilmektir.

Kara kutu meselesi bize garip bir ayna tutuyor. İnsan zihni de çoğu zaman kendi kararlarını sonradan açıklayan bir kara kutu değil midir? Önce sever, sonra gerekçe buluruz. Önce korkar, sonra mantık üretiriz. Fakat makinelerle farkımız şurada: Onlara sorumluluk devrederken, kendi bilinç bulanıklığımızı da kodun içine saklama lüksümüz yoktur. Derin öğrenme güçlüdür; ama güç, açıklama olmadan büyüdüğünde tekinsizleşir. Geleceğin en akıllı sistemleri sadece doğru tahmin yapanlar değil, hatasını gösterebilen, sınırını bilen ve insanın anlayabileceği bir dille hesap verebilen sistemler olacaktır.

Yapay Zekâ Neden Dün Bildiğini Bugün Unutur?

Bir makine öğrenmesi modelini çoğu zaman soğukkanlı bir matematik makinesi sanırız: Veriyi alır, örüntüyü çıkarır, bilgiyi saklar ve gerektiğinde kusursuzca geri çağırır. Ne var ki derin öğrenme modelleri, bazen sınava son gece çalışan öğrencilerden bile daha dramatik bir unutkanlık sergiler. Yeni bir görevi öğrenirken eski görevlerdeki başarısını kaybeder. Bu olguya genellikle yıkıcı unutma denir. Adı serttir, etkisi daha da serttir: Modelin belleği, arşiv gibi değil, üst üste yazılan ıslak bir defter gibi davranır.

İnsan hafızasında unutma eğrisi, zamanla bilginin solmasını anlatır. Makine öğrenmesinde ise mesele çoğu zaman zamanın geçmesi değil, yeni verinin ağırlıklar üzerinde yaptığı baskıdır. Bir sinir ağı, öğrendiği bilgiyi ayrı klasörlere koymaz; bilgiyi milyonlarca parametrenin ortak düzeninde temsil eder. Bu parametreler, modelin dünyayı yorumlama biçimidir. Yeni veri geldiğinde eğitim algoritması bu parametreleri günceller. Sorun şudur: Aynı parametreler eski bilgiyi de taşıyorsa, yeni ayar eski düzeni bozabilir. Bir piyano akort ederken gitarın tellerini de farkında olmadan gevşetmek gibi.

Unutma Neden Olur?

Temel mekanizma gradyan inişidir. Model hata yaptığında, parametrelerini hatayı azaltacak yönde değiştirir. Yeni görev için doğru olan bu hareket, eski görev için yanlış olabilir. Örneğin bir model önce kedileri köpeklerden ayırmayı öğrensin. Sonra ona kuş türlerini sınıflandırmayı öğretelim. Eğer eğitim sırasında eski kedi-köpek örnekleri hiç görünmezse, model parametrelerini kuşlar için optimize ederken memeli ayrımlarını taşıyan hassas yapıları zedeleyebilir. Modelin dünyası yeniden şekillenir; eski harita yeni kıtanın altında kalır.

Bu durum özellikle sürekli öğrenme senaryolarında kritik hale gelir. Gerçek dünya durağan değildir. Dolandırıcılık tespit sistemleri yeni hileleri, öneri sistemleri değişen kullanıcı zevklerini, otonom araçlar yeni yol koşullarını öğrenmek zorundadır. Fakat her güncelleme, geçmiş becerilerin üzerine kontrolsüzce yazarsa sistem güvenilir olmaktan çıkar. Bugün sahte işlemleri yakalayan model, yarın yeni dolandırıcılık türünü öğrenirken eski dolandırıcılığı kaçırabilir. Bu, yalnızca teknik bir hata değil; finans, sağlık ve güvenlik alanlarında somut risk demektir.

Çözüm: Belleği Tasarlamak

Yıkıcı unutmaya karşı ilk yaklaşım tekrar oynatmadır. Model yeni verilerle eğitilirken eski verilerden küçük örnekler de gösterilir. İnsanların tekrar ederek hatırlamasına benzer. Buna deneyim tekrarı denir. Ancak eski verinin tamamını saklamak her zaman mümkün değildir; gizlilik, maliyet ve ölçek sorunları vardır. Bu yüzden bazı yöntemler, eski verinin kendisini değil, özetini ya da yapay örneklerini kullanır.

İkinci yaklaşım düzenlileştirmedir. Burada modelin eski görevler için önemli olan parametreleri fazla değiştirmesi engellenir. Bazı ağırlıklar kritik kabul edilir ve yeni eğitim sırasında onların hareket alanı kısıtlanır. Bu, bir binayı yenilerken taşıyıcı kolonlara dokunmamaya benzer. Yeni odalar eklenebilir, duvarlar boyanabilir, ama yapı çökmesin diye temel korunur.

Üçüncü yaklaşım mimari büyütmedir. Model yeni görevler geldikçe yeni modüller, katmanlar veya uzman alt ağlar ekler. Böylece eski bilgiyle yeni bilgi aynı parametreler üzerinde kavga etmek zorunda kalmaz. Fakat bu da sınırsız büyüme sorununu getirir. Her yeni deneyim için yeni bir oda açarsak, sonunda saray değil, içinde kaybolduğumuz bir labirent inşa ederiz.

Asıl Ders: Öğrenmek Hatırlamayı Gerektirir

Makine öğrenmesinde unutma eğrisi bize basit ama güçlü bir ders verir: Öğrenme, yalnızca yeni bilgi eklemek değildir; eski bilginin hangi koşullarda korunacağını da tasarlamaktır. Zeki sistem, her veriye aynı iştahla saldıran sistem değildir. Zeki sistem, neyi değiştireceğini, neyi sabit tutacağını ve neyi yeniden değerlendireceğini bilen sistemdir.

Bu yüzden geleceğin yapay zekâsı sadece daha büyük modellerle kurulmayacak. Daha iyi bellek politikaları, daha zarif güncelleme stratejileri ve daha bilinçli veri akışları gerekecek. Unutmayan ama katılaşmayan, öğrenen ama kimliğini kaybetmeyen modeller hedeflenecek. Çünkü makine zekâsının gerçek sınavı, yeni bir şeyi öğrenmek değil; bunu yaparken dün kazandığı bilgeliği çöpe atmamak olacaktır.

Einstein ve Diğer Evren Modelleri

evren-modelleriSon onyıllarda, “saf” bilimin, özellikle de teorik fiziğin, yalnızca soyut düşüncenin ve matematiksel tümdengelimin ürünü olduğu önyargısı derine kök salmıştır. Eric Lerner’in işaret ettiği gibi, bu eğilimden kısmen Einstein sorumluydu. Sıkı sıkıya deneye dayanan ve ardından yüz binlerce bağımsız gözlemle doğrulanan Maxwell’in elektromanyetizma yasaları veya Newton’un kütleçekim yasaları gibi eski teorilerden farklı olarak, Einstein’in teorileri başlangıçta sadece iki gözlem temelinde doğrulanmıştı: güneşin çekim alanının yıldızlardan gelen ışığı saptırması ve Merkür’ün yörüngesindeki küçük bir sapma.

Görelilik teorisinin doğruluğunun sonradan anlaşılması, muhtemelen Einstein kadar dehası olmayan başkalarının da, ilerleme kaydetmenin yolunun bu olduğunu kabul etmelerine yol açtı. Zaman kaybına yol açan deneylerle ve usandırıcı gözlemlerle neden canımızı sıkalım ki? Gerçekten de, saf tümdengelim yöntemi aracılığıyla gerçeğe giden yolu bulabiliyorsak, neden duyularımızın tanıklığına bağımlı olalım? Kozmolojiye, neredeyse her şeyi dışlayan matematiksel hesaplamalara ve görelilik teorisine dayandırılan bütünüyle soyut bir teorik yaklaşım eğiliminin sürekli arttığını görüyoruz. Yayınlanan kozmoloji tez çalışmalarının yıllık sayısı 1965’te altmışken 1980’de beş yüzün üzerine fırladı, ama bu gelişme neredeyse yalnızca salt teorik çalışmalardaydı: 1980’de yaklaşık olarak bu tezlerin yüzde 95’i çeşitli matematiksel modellere hasredilmişti, “Binachi tipi XI evren” gibi.
Devamını oku “Einstein ve Diğer Evren Modelleri” →

Plazma Evren Modeli

Standart evren modelinin kendisi gediklerle doludur. Ama yine de, en başta bir alternatifinin olmaması nedeniyle, kötü bir şekilde sallanmasına rağmen hâlâ ayaklarının üzerinde durmaktadır. Bununla birlikte, bilim dünyasında bir şeyler kıpırdanıyor. Büyük patlama teorisini reddetmekle kalmayıp, sonsuz ve sürekli değişen bir evren fikrinden yola çıkan yeni fikirler şekillenmeye başlıyor. Bu teorilerden hangisinin haklı çıkacağını söylemek için henüz çok erken. İlginç hipotezlerden biri olan “Plazma Evren” hipotezi, Nobel Ödülünü kazanan İsveçli fizikçi Hannes Alfvén tarafından ileri sürülmüştü. Teoriyi ayrıntılarıyla ele alamasak da, en azından Alfvén’in fikirlerinden bazılarından söz etmek gerektiği kanısındayız.

plazma-evren

Alfvén laboratuvardaki plazma araştırmalarından kalkarak evrenin nasıl evrimleştiğini incelemeye başladı. Plazma elektriksel olarak iletken sıcak gazlardan oluşur. Bugün evrenin %99’unun plazma olduğu biliniyor. Normal gazlarda, elektronlar bir atoma bağlıyken ve kolayca hareket edemezken, bir plazmadaki elektronlar çok büyük sıcaklıklar nedeniyle atomdan koparlar, böylelikle de serbestçe hareket etmeleri olanaklı olur. Plazma kozmologları, “muazzam elektrik akımları ve güçlü manyetik alanlar tarafından kesilen ve elektromanyetizma ile kütleçekimin kozmik kontrpuanıyla düzenlenen” bir evren tasavvur ederler. 1970’lerde, Pioneer ve Voyager uzay araçları, Jüpiter, Satürn ve Uranüs etrafında plazma filamanlarıyla dolu elektrik akımlarının ve manyetik alanların varlığını saptadılar.

Devamını oku “Plazma Evren Modeli” →