| 3 dk okuma | 34 okunma

Pandas ile veri hazırlama: AI projelerinin görünmeyen gücü

Başarılı bir AI modelinin arkasında çoğu zaman iyi yazılmış bir Pandas kodu vardır.

Pandas ile veri hazırlama: AI projelerinin görünmeyen gücü

AI projelerinde model kurmak genellikle en “havalı” kısım gibi görünse de, gerçek dünyada en fazla zaman harcanan aşama veri hazırlamadır ve bu noktada Python dünyasında en güçlü araçlardan biri Pandas kütüphanesidir. Çünkü ham veriyi anlamlı, temiz ve modele uygun hale getirmek; yalnızca teknik bilgi değil, aynı zamanda veriyle düşünme becerisi gerektirir ve Pandas bu süreci hem hızlandırır hem de okunabilir hale getirir.

Çoğu veri seti ilk bakışta düzenli görünse bile aslında birçok problem barındırır. Eksik değerler, yanlış veri tipleri, gereksiz sütunlar veya analiz için uygun olmayan formatlar oldukça yaygındır. Bu nedenle ilk adım genellikle veriyi keşfetmek ve neyle karşı karşıya olduğunu anlamaktır. Pandas bu noktada birkaç satır kodla oldukça güçlü bir özet sunar:

import pandas as pd

df = pd.read_csv("data.csv")

print(df.head()) # ilk 5 satır
print(df.info()) # veri tipleri
print(df.describe()) # istatistiksel özet


Bu basit adım, veri setindeki problemleri erkenden fark etmeni sağlar ve yanlış kararlar vermeni engeller.

Veri hazırlamanın bir diğer önemli aşaması ise eksik ve hatalı verilerin düzeltilmesidir. Gerçek projelerde verinin eksiksiz olması nadirdir ve bu eksikliği nasıl ele aldığın model performansını doğrudan etkiler. Örneğin bazı durumlarda eksik değerleri silmek mantıklı olabilirken, bazı durumlarda ortalama ya da medyan ile doldurmak daha doğru bir yaklaşım olur.

Örnek: Eksik veri işlemleri

# Eksik verileri kontrol etme
print(df.isnull().sum())

# Eksik verileri ortalama ile doldurma
df["maas"] = df["maas"].fillna(df["maas"].mean())

# Eksik verileri tamamen silme
df = df.dropna()


Bununla birlikte, AI modelleri genellikle sayısal verilerle çalıştığı için kategorik verilerin dönüştürülmesi gerekir. Örneğin “şehir” gibi metinsel bir değişken, modele doğrudan verilemez; bunun yerine sayısal bir temsile dönüştürülmelidir. Bu dönüşüm işlemi, feature engineering’in en temel parçalarından biridir.

Örnek: Kategorik veriyi sayısala çevirme

df = pd.get_dummies(df, columns=["sehir"])


Veri hazırlama sürecinin bir diğer kritik adımı ise yeni özellikler üretmektir. Ham veri her zaman model için en uygun formda olmayabilir ve bazen mevcut verilerden yeni anlamlı değişkenler üretmek modelin performansını ciddi şekilde artırabilir. Örneğin bir kullanıcının doğum tarihinden yaş bilgisini üretmek veya tarih verisinden “hafta sonu mu?” gibi yeni bir özellik çıkarmak oldukça yaygın bir yaklaşımdır.

Örnek: Yeni feature üretimi

df["yas"] = 2025 - df["dogum_yili"]


Gerçek hayatta iyi bir veri hazırlama süreci, model performansında dramatik farklar yaratabilir. Aynı veri setiyle çalışan iki farklı modelden biri çok daha iyi sonuç veriyorsa, bunun sebebi çoğu zaman algoritma değil, veri üzerinde yapılan işlemlerdir. Bu yüzden deneyimli mühendisler için Pandas sadece bir kütüphane değil, günlük iş akışının merkezinde yer alan bir araçtır.

Gerçek Hayat

Bir e-ticaret platformunda kullanıcıların satın alma davranışlarını analiz ettiğini düşün; kullanıcı verilerini doğru şekilde temizlemez ve dönüştürmezsen, öneri sistemin alakasız ürünler sunar ve bu da doğrudan gelir kaybına yol açar.

AI projelerinde farkı çoğu zaman model değil, veriye nasıl davrandığın belirler; Pandas bu sürecin en güçlü silahıdır.

Ertan Dağdelen

Yazan

Ertan Dağdelen

Brain & Youth Information Worker, Author, .Net, Flutter, AJAX, Arduino & Esp32, Pcb, 3D, Galatasaray, Gemini

Bu yazıyı paylaş

Yorumlar (0)

Bu yazı için yorumlar kapalı.