Makine öğrenmesinde sık yapılan sezgisel hata şudur: Daha fazla değişken, daha fazla bilgi demektir; daha fazla bilgi de daha iyi tahmin. Kulağa mantıklı gelir. Hatta bir dedektif gibi düşünürsek, olay yerindeki her iz kıymetlidir. Fakat yüksek boyutlu veri dünyasında dedektifin cebine o kadar çok ipucu doldururuz ki, sonunda fail değil, cebin ağırlığı bulunur. İşte boyutluluk laneti tam olarak burada başlar: Değişken sayısı arttıkça problem zenginleşmez, çoğu zaman seyrekleşir, bulanıklaşır ve öğrenilmesi zorlaşır.
Boyut arttıkça uzay şişer
Bir veri noktasını iki değişkenle düşünmek kolaydır: x ve y ekseninde bir nokta. Üç boyutta hâlâ zihnimiz idare eder. Peki ya 100 boyut? 1000 boyut? Burada mesele sadece görselleştirme zorluğu değildir. Asıl sorun, uzayın hacminin patlayıcı biçimde büyümesidir. Bir odaya 10 sandalye koyarsanız dolu görünür. Aynı 10 sandalyeyi bir stadyuma koyarsanız neredeyse boşlukta kaybolurlar. Veri noktaları da yüksek boyutlarda böyle kaybolur: Elinizde çok örnek var sanırsınız ama uzay o kadar büyümüştür ki her nokta yalnız başına kalır.
Makine öğrenmesi modelleri örüntü bulmak ister. Örüntü bulmak için de benzer örneklerin birbirine yakın olması gerekir. Fakat boyut sayısı arttıkça yakınlık kavramı bozulur. En yakın komşu ile en uzak komşu arasındaki fark azalabilir. Mesafe ölçüleri anlamını yitirmeye başlar. Kısacası algoritmaya, mahalledeki benzer evleri bul diyorsunuz; fakat mahalle bir anda galaksiye dönüşüyor ve bütün evler birbirinden kozmik ölçekte uzaklaşıyor.
Her değişken bilgi değildir
Boyutluluk lanetinin en sinsi tarafı, değişkenlerin hepsinin eşit derecede yararlıymış gibi görünmesidir. Bir müşterinin yaşı, geliri ve önceki alışverişleri anlamlı olabilir. Ama tarayıcı pencere genişliği, formu doldurduğu saniyenin tek mi çift mi olduğu, kullandığı cihazın pil yüzdesi gibi değişkenler modele girdiğinde işler karışır. Model, gerçekten nedensel ya da istatistiksel olarak güçlü sinyali öğrenmek yerine, gürültünün içinde rastlantısal desenlere âşık olabilir.
Bu noktada aşırı öğrenme sahneye çıkar. Model eğitim verisinde harika sonuç verir; çünkü oradaki tesadüfleri bile ezberlemiştir. Ama yeni veri geldiğinde büyü bozulur. Sanki sınav sorularını ezberlemiş ama konuyu anlamamış bir öğrenci gibidir. Eğitimde parıldar, gerçek hayatta tökezler. Çok boyutlu veri, kötü düzenlenmişse modele bilgelik değil, özgüvenli cehalet verir.
Örnek sayısı neden yetmez?
Boyut arttıkça gereken veri miktarı da doğrusal değil, çoğu zaman üstel biçimde artar. Bir değişkeni 10 aralığa böldüğünüzü düşünün. İki değişkende 100 hücre oluşur. On değişkende 10 milyar hücre. Her hücrede yeterli örnek olsun istiyorsanız veri ihtiyacı astronomikleşir. Bu yüzden yüksek boyutlu problemlerde yalnızca daha çok veri toplamak her zaman çözüm değildir. Bazen veri toplamak, kovayla okyanusu doldurmaya benzer.
Çözüm, değişkenleri körlemesine çoğaltmak değil, bilgiyi sıkıştırmak ve anlamlı olanı ayıklamaktır. Öznitelik seçimi, gereksiz değişkenleri dışarıda bırakır. Boyut indirgeme yöntemleri, özellikle PCA gibi teknikler, verideki ana varyasyon yönlerini bulup daha düşük boyutlu bir temsil üretir. Düzenlileştirme yöntemleri modelin fazla karmaşıklaşmasını engeller. Karar ağaçları, gömülü yöntemler ve gözetimli öznitelik önem skorları da hangi değişkenlerin gerçekten işe yaradığını gösterebilir.
Derin öğrenmede bile bu lanet yok olmaz; sadece biçim değiştirir. Sinir ağları temsil öğrenebilir, yani ham veriden daha kullanışlı özellikler çıkarabilir. Ancak yeterli veri, uygun mimari, düzenlileştirme, doğrulama stratejisi ve dikkatli değerlendirme yoksa yüksek boyut yine tuzak kurar. Özellikle metin, görüntü ve genomik gibi alanlarda her piksel, kelime ya da gen bir değişken gibi davranabilir. Burada başarı, çokluğu olduğu gibi yutmakta değil, onu anlamlı yapıya dönüştürmektedir.
Boyutluluk laneti bize teknik olduğu kadar felsefi bir ders de verir: Her şeyi ölçmek, her şeyi anlamak değildir. Bir modele daha fazla sütun eklemek, ona daha fazla akıl vermeyebilir; bazen sadece daha geniş bir labirent inşa eder. İyi veri bilimi, değişken biriktirme sanatı değil, ayırt etme disiplinidir. Soru şudur: Modelin görmesini istediğimiz dünya gerçekten zengin mi, yoksa biz sadece gürültüyü yüksek çözünürlükte mi kaydediyoruz?
Son onyıllarda, “saf” bilimin, özellikle de teorik fiziğin, yalnızca soyut düşüncenin ve matematiksel tümdengelimin ürünü olduğu önyargısı derine kök salmıştır. Eric Lerner’in işaret ettiği gibi, bu eğilimden kısmen Einstein sorumluydu. Sıkı sıkıya deneye dayanan ve ardından yüz binlerce bağımsız gözlemle doğrulanan Maxwell’in elektromanyetizma yasaları veya Newton’un kütleçekim yasaları gibi eski teorilerden farklı olarak, Einstein’in teorileri başlangıçta sadece iki gözlem temelinde doğrulanmıştı: güneşin çekim alanının yıldızlardan gelen ışığı saptırması ve Merkür’ün yörüngesindeki küçük bir sapma.