| 3 dk okuma | 29 okunma

Veri olmadan AI olmaz

Bir AI modelinin kalitesi, kullandığın algoritmadan çok verinin kalitesiyle belirlenir.

Veri olmadan AI olmaz

Yapay zekâ öğrenmeye başlayan pek çok kişi, sürecin en önemli kısmının model seçimi olduğunu düşünür; oysa gerçek dünyadaki projelerde en kritik ve zaman alan aşama, doğru veriyi toplamak ve bu veriyi modele uygun hale getirmektir. Çünkü model ne kadar gelişmiş olursa olsun, eğer beslendiği veri hatalı, eksik ya da dengesizse, üreteceği sonuçlar da aynı şekilde problemli olacaktır. Bu yüzden deneyimli mühendisler arasında sıkça duyulan “garbage in, garbage out” sözü, AI projeleri için oldukça yerinde bir özet sunar.

Veri genellikle ham haliyle kullanılabilir değildir; eksik değerler, tutarsız girişler, farklı formatlar ve anlamsız kategoriler içerir. Örneğin bir kullanıcı veri setinde bazı kişilerin yaşı eksik olabilir ya da maaş bilgileri farklı para birimlerinde girilmiş olabilir. Bu tür problemler çözülmeden doğrudan model eğitmeye geçmek, modelin yanlış öğrenmesine ve genelleme yapamamasına neden olur. Dolayısıyla veri hazırlama süreci, sadece teknik bir adım değil, aynı zamanda problemin doğasını anlamayı gerektiren bir mühendislik sürecidir.

Bu noktada Python ekosistemi, özellikle veri manipülasyonu konusunda oldukça güçlü araçlar sunar. Aşağıdaki örnekte, eksik verilerin ortalama ile doldurulduğu basit ama gerçek hayatta sık kullanılan bir senaryoyu görebilirsin:

Örnek: Eksik verileri temizleme

import pandas as pd

df = pd.DataFrame({
"yas": [25, None, 35, 40],
"maas": [10000, 15000, None, 25000]
})

# Eksik değerleri sütun ortalaması ile doldurma
df = df.fillna(df.mean())

print(df)


Bu örnek küçük görünse de, aslında gerçek dünyadaki veri hazırlama sürecinin temelini oluşturur; çünkü çoğu zaman veri setinin önemli bir kısmı eksik ya da hatalı olur ve bu verilerin nasıl işleneceği, modelin performansını doğrudan etkiler.

Bir diğer önemli konu ise veri dengesidir. Örneğin bir spam filtreleme sistemi geliştirdiğini düşünelim; eğer veri setindeki e-postaların %95’i normal, sadece %5’i spam ise, model çoğu durumda “spam değil” diyerek yüksek doğruluk oranı yakalayabilir, ancak gerçekte işe yaramayan bir sistem ortaya çıkar. Bu yüzden veri dağılımını analiz etmek ve gerektiğinde dengelemek, başarılı bir AI projesinin vazgeçilmez adımlarından biridir.

Gerçek hayatta AI projelerinin büyük bir kısmı, aslında veriyle uğraşmakla geçer. Model eğitimi çoğu zaman sürecin küçük bir bölümünü oluştururken, veri toplama, temizleme ve dönüştürme aşamaları projenin %70-80’ini kapsayabilir. Bu yüzden iyi bir AI mühendisi olmak, sadece model kurmayı değil, veriyi anlamayı ve şekillendirmeyi de gerektirir.

Gerçek Hayat

Bir e-ticaret sitesinde öneri sistemi geliştirdiğini düşün; kullanıcı davranışları eksik ya da hatalı kaydedilmişse, model yanlış ürünler önermeye başlar ve bu durum doğrudan kullanıcı deneyimini ve satışları olumsuz etkiler.

AI projelerinde başarının anahtarı model değil, veridir; doğru hazırlanmış bir veri seti, ortalama bir modeli bile güçlü hale getirebilir.

Ertan Dağdelen

Yazan

Ertan Dağdelen

Brain & Youth Information Worker, Author, .Net, Flutter, AJAX, Arduino & Esp32, Pcb, 3D, Galatasaray, Gemini

Bu yazıyı paylaş

Yorumlar (0)

Bu yazı için yorumlar kapalı.