Veri Bilimi

Veri Analizinde En Kritik Aşama: Veri Temizleme

27.07.2026 · 3 dk okuma · 6 okunma

Veri Analizinde En Kritik Aşama: Veri Temizleme

Veri bilimi denince akla model kurmak gelir; oysa saha çalışmalarında zamanın büyük bölümü veri temizlemeye gider. Bu emek boşa değildir: analizin doğruluğu, kullanılan algoritmadan çok girdi kalitesine bağlıdır. Kirli veriyle çalışan en gelişmiş model bile güvenle yanlış sonuç üretir.

Veri temizleme aşamalarının sırasını gösteren özet görsel
Her adımda yapılan işlem not edilmeli; tekrarlanamayan temizlik analiz değil tahmindir.

Önce veriyi tanıyın

Temizliğe başlamadan önce şu soruların cevabı yazılmalıdır: Her satır neyi temsil ediyor? Sütunların birimi ne (TL mi kuruş mu, gün mü saat mi)? Veri hangi tarihte, hangi sistemden alındı? Bir satır tekil mi, yoksa aynı olay birden fazla kez mi kaydedilmiş?

Bu sorular cevaplanmadan yapılan her hesap risklidir. Örneğin "tutar" sütununun bazı kayıtlarda KDV dahil, bazılarında hariç olması, ortalamanın hiçbir anlam taşımamasına yol açar.

Eksik değerler: önce nedenini sorun

Eksik veriyi hemen doldurmak yerine neden eksik olduğunu anlamak gerekir. Üç tipik durum vardır:

  • Rastgele eksiklik: Sensör bazen okuma yapamamış. Doldurma veya silme görece güvenlidir.
  • Sistematik eksiklik: Belirli bir şubede alan hiç doldurulmamış. Silmek o şubeyi analizden çıkarır ve sonucu çarpıtır.
  • Anlamlı boşluk: "İkinci telefon" alanının boş olması eksik veri değil, bilginin yokluğudur. Sıfırla doldurmak hatalıdır.

Doldurma yaparken ortalama kullanmak en kolay ama en yanıltıcı yoldur; dağılımı daraltır. Kategoriye göre medyan veya bir önceki geçerli değerle taşıma, çoğu durumda daha güvenlidir. Hangi yöntemin kullanıldığı mutlaka not edilmelidir.

Yinelenen kayıtlar

Aynı kaydın iki kez girilmesi, özellikle birden çok kaynağın birleştirildiği veri kümelerinde sık görülür. Tekilleştirme yaparken tam eşleşme yeterli olmayabilir: "Ahmet Yılmaz" ile "AHMET YILMAZ " (sondaki boşlukla) farklı görünür. Bu yüzden karşılaştırmadan önce normalleştirme yapılmalıdır: büyük-küçük harf birleştirme, baştaki ve sondaki boşlukların temizlenmesi, Türkçe karakterlerin tutarlı hâle getirilmesi.

Aykırı değerler: silmeden önce bakın

Bir mağazanın günlük satışının aniden yüz katına çıkması iki şey anlatabilir: giriş hatası ya da gerçek bir kampanya günü. Aykırı değeri otomatik olarak silen bir akış, ikinci durumda en önemli bilgiyi çöpe atar.

Sağlıklı yaklaşım şudur: aykırı değerleri işaretleyin, kaynağına dönüp birkaç örneği elle inceleyin, ancak kanıtlanmış hatalarda düzeltme veya çıkarma yapın. Yaptığınız her müdahaleyi kayıt altına alın.

Altın kural: Ham veriyi asla değiştirmeyin. Temizlik, ham veriden yeni bir sürüm üretme işidir; üzerine yazma işi değil.

Tip ve biçim tutarlılığı

Türkiye verilerinde en sık karşılaşılan sorunlar şunlardır: ondalık ayırıcının bazen virgül bazen nokta olması, tarih biçiminin gün-ay-yıl ile ay-gün-yıl arasında karışması, telefon numaralarının başındaki sıfırın kaybolması ve sayısal kimlik alanlarının bilimsel gösterime dönüşmesi. Bu dördü, hesap tablolarından alınan verilerde neredeyse standarttır.

Önlem, veriyi okurken sütun tiplerini açıkça belirtmektir. Otomatik tip tahminine bırakılan her sütun, ileride sessiz bir hata kaynağıdır.

Tekrarlanabilirlik

Temizlik adımları elle yapılırsa, üç ay sonra aynı analizi tekrar üretemezsiniz. Tüm adımlar bir betikte toplanmalı ve baştan sona çalıştırılabilmelidir. Böylece yeni veri geldiğinde işlem birkaç saniyede tekrarlanır ve sonuçlar karşılaştırılabilir olur. Python ekosisteminde bu akış için pandas dokümantasyonu temel başvuru kaynağıdır.

Birleştirme (join) sırasında oluşan sessiz hatalar

Birden fazla kaynağı birleştirmek, veri temizliğinin en riskli adımıdır. Çünkü hata mesaj vermez; sadece satır sayısı değişir. İki tipik durum vardır: eşleşmeyen kayıtların sessizce düşmesi ve çoklu eşleşme nedeniyle satırların çoğalması.

Bu yüzden her birleştirmeden önce ve sonra satır sayısı not edilmelidir. Beklenen sayı 10.000 iken sonuç 14.300 çıkıyorsa, sağ taraftaki tabloda tekil olması gereken anahtar tekil değildir. Aynı şekilde sonuç 8.700 çıkıyorsa, 1.300 kayıt eşleşme bulamamıştır ve bunların kimler olduğu incelenmelidir; genellikle belirli bir şube, dönem veya kaynak sistem toplu hâlde dışarıda kalır.

Anahtar alanların tipleri de birleştirmeden önce eşitlenmelidir. Bir tarafta metin, diğer tarafta sayı olarak tutulan kimlik alanları hiç eşleşmez ve sonuç boş bir tablo olur.

Temizlik sonrası doğrulama

Temizlik bittiğinde şu kontroller yapılmalıdır: satır sayısı beklenen aralıkta mı, toplamlar kaynak sistemle tutuyor mu, kategorik alanlarda beklenmeyen değer var mı, tarih aralığı mantıklı mı (gelecekte kayıt var mı)? Bu dört kontrol, temizlik sırasında oluşan sessiz hataların çoğunu yakalar.

Sonuç

Veri temizleme, analizin sıkıcı ön hazırlığı değil, güvenilirliğin kaynağıdır. Veriyi tanıyın, eksikliğin nedenini sorun, aykırı değerleri incelemeden silmeyin, ham veriyi koruyun ve tüm adımları tekrarlanabilir hâle getirin. Bu beş alışkanlık, analizinizin üç ay sonra da savunulabilir olmasını sağlar.

Paylaş:

Sık Sorulan Sorular

Eksiklik rastgele ise ve oran düşükse silmek kabul edilebilir. Eksiklik belirli bir grupta yoğunlaşıyorsa silmek yanlılık yaratır; bu durumda nedeni araştırılmalı ve uygun bir doldurma yöntemi seçilmelidir.

Hayır. Bir aykırı değer veri girişi hatası olabileceği gibi gerçek ve en değerli gözlem de olabilir. Dolandırıcılık tespitinde aykırı değerler zaten aranan şeydir; silmeden önce mutlaka incelenmelidir.

Küçük ve tek seferlik işlerde yapılabilir. Ancak tekrar eden analizlerde elle yapılan işlemler kaydedilemediği için sonuç yeniden üretilemez; betik tabanlı bir akış tercih edilmelidir.

Ham veri asla üzerine yazılmamalıdır. Ham veri değişmez şekilde saklanır, temizlenmiş sürüm ayrı bir dosya veya tablo olarak üretilir; böylece hatalı bir temizlik adımı geri alınabilir.