Seçici veri kullanımı (cherry picking), bir veri kümesinden yalnızca önceden var olan bir tezi destekleyen kısmı seçip geri kalanını göz ardı etme eğilimidir. Spor ve veri analizinde bu tuzak, bir yorumun “doğru” görünmesini sağlar ama aslında seçilmiş parçalar üzerinden kurulmuş yanıltıcı bir sonuçtur.

Seçici Veri Kullanımı (Cherry Picking) Nedir?
Bu kavram aslında tarım kökenli bir benzetmeden geliyor: bir ağaçtan yalnızca en olgun kirazları toplayıp çürükleri görmezden gelmek. Veri analizine taşındığında ise, geniş bir istatistik havuzundan yalnızca tezi destekleyen kısmı vurgulamak, kalanını sessizce dışarıda bırakmak anlamına gelir. Bu davranış çoğu zaman kasıtlı bir manipülasyon değil, farkında olmadan yapılan bir seçim eğilimidir.
Örneğin bir takımın son beş maçındaki yüksek şut sayısı öne çıkarılırken, aynı dönemdeki düşük isabet oranı ya da rakip kalitesi görmezden gelinebilir. Sayı doğrudur, gerçektir; ama bağlamdan koparılmış bir gerçek, yanlış bir izlenim yaratır. Cherry picking’in tehlikeli tarafı tam da budur: kullanılan veri sahte değildir, sadece eksik sunulmuştur.
Veri destekli analizin temel amacı, mevcut bilgiyi mümkün olduğunca bütüncül biçimde değerlendirmektir. Seçici kullanım bu bütünlüğü bozar ve sonuçta ortaya çıkan yorum, gerçek eğilimden çok analistin önceden sahip olduğu görüşü doğrulamaya hizmet eder.
Bu Tuzak Spor Verisi Yorumlarında Neden Bu Kadar Sık Görülür?
Spor verisi doğası gereği bol ve çok katmanlıdır; bir takım veya oyuncu için onlarca farklı metrik üretilebilir. Bu bolluk, aslında istenilen sonucu destekleyecek bir sayı bulmayı kolaylaştırır. Yeterince geniş bir metrik havuzunda, hemen her tez için “uygun” bir istatistik bulunabilir; sorun bu istatistiğin temsil gücünde saklıdır.
Ayrıca zaman baskısı da bu eğilimi güçlendirir. Hızlı yorum üretme ihtiyacı, analistleri en çarpıcı ya da en kolay ulaşılan veriye yönlendirir. Çarpıcı sayı genellikle uç bir örnektir ve uç örnekler tanım gereği ortalamayı temsil etmez.
Üçüncü bir neden ise duygusal bağlılıktır. Bir takıma, oyuncuya veya taktik yaklaşıma önceden sempati duyan bir yorumcu, farkında olmadan kendi görüşünü destekleyen veriye daha kolay ikna olur. Bu durum veri-analizi sürecinde nesnelliği korumayı zorlaştıran en yaygın psikolojik eğilimlerden biridir.
Cherry Picking, Doğrulama Yanlılığından Nasıl Ayrılır?
İki kavram birbirine çok yakın görünse de aralarında ince bir fark var. Doğrulama yanlılığı, zihinsel bir eğilimdir; kişi zaten inandığı şeyi destekleyen bilgiyi daha kolay fark eder ve hatırlar. Seçici veri kullanımı ise bu eğilimin somut çıktısıdır; yani doğrulama yanlılığı sebep, cherry picking ise çoğu zaman onun sonucu olarak ortaya çıkan davranıştır.
Bir analist doğrulama yanlılığına sahip olabilir ama bunu fark edip düzeltebilir. Seçici veri kullanımı ise genellikle yazılı ya da sözlü bir çıktıya dönüştüğünde görünür hale gelir: bir yazıda, bir yorumda, bir grafikte. Bu yüzden ikincisini tespit etmek, birincisini tespit etmekten daha kolaydır; ortada somut bir metin veya rakam vardır.
Pratikte ayrım şu şekilde yapılabilir: doğrulama yanlılığı “neden bu veriyi arıyorum” sorusuyla, cherry picking ise “neden sadece bu veriyi gösteriyorum” sorusuyla ilgilidir. İkisi de taktik yorumlarında sıkça iç içe geçer, ama çözüm yöntemleri farklı disiplinler gerektirir.
Bir Analizde Seçici Veri Kullanımı Olup Olmadığı Nasıl Tespit Edilir?
Okuyucu ya da izleyici tarafında bu tuzağı yakalamanın birkaç somut yolu var. En etkili yöntem, sunulan istatistiğin zaman aralığını sorgulamaktır: “Bu sayı neden tam bu döneme ait, daha geniş bir dönemde durum nasıl?” sorusu çoğu zaman gerçeği ortaya çıkarır.
- Karşılaştırma noktası belirsizse (neye göre yüksek veya düşük olduğu belli değilse) veri seçici sunulmuş olabilir.
- Tek bir maç veya tek bir dönem üzerinden genel bir yargı kuruluyorsa dikkatli olmak gerekir.
- Aynı konuda karşıt sonuç veren başka bir metrik hiç zikredilmiyorsa, bu bir eksiklik işaretidir.
Bir başka pratik test, aynı iddiayı tersine çevirip sormaktır: “Bu veri tam tersini gösterseydi, yorumcu bunu da paylaşır mıydı?” Cevap hayırsa, elimizdeki analiz muhtemelen seçici bir sunumdan ibarettir. Bu sorgulama alışkanlığı, mac-analizi okurken kritik bir filtre görevi görür.
Seçici Veri Kullanımından Kaçınmak İçin Hangi Yöntemler İzlenir?
Kaçınmanın ilk adımı, analiz sürecine başlamadan önce hangi metriklerin bakılacağını önceden belirlemektir. Sonuç görüldükten sonra metrik seçmek, istemsizce sonucu destekleyen veriye yönelmeyi kolaylaştırır; oysa önceden belirlenmiş bir kriter listesi bu riski azaltır.
İkinci yöntem, karşıt hipotezi de aynı ciddiyetle test etmektir. Bir takımın güçlü olduğunu düşünüyorsanız, zayıf olduğuna dair kanıt arayan bir zihinsel egzersiz yapmak, gözden kaçan verileri gün yüzüne çıkarır. Bu, akademik araştırmalarda “null hipotez testi” mantığına benzer bir yaklaşımdır.
Üçüncüsü, tek bir kaynağa değil birden fazla bağımsız veri setine bakmaktır. Farklı kaynaklardan gelen benzer sonuçlar, o eğilimin gerçek olma ihtimalini artırır; tek bir kaynaktaki çarpıcı sayı ise çoğu zaman istisnai bir örnektir. Konunun uluslararası literatürdeki genel çerçevesi hakkında Wikipedia’nın cherry picking maddesi kavramsal bir başlangıç noktası sunar.
Ortalamaya Dönüş Kavramı Seçici Veri Tuzağıyla Nasıl İlişkilidir?
Ortalamaya dönüş (regression to mean), uç bir performansın ardından genellikle daha normal seviyelere geri dönme eğilimini tanımlar. Bir oyuncu olağanüstü bir dönemden geçtiğinde, bu performansın devam edeceğini varsaymak yaygın bir hatadır; istatistiksel olarak uç değerlerin zamanla ortalamaya yaklaşması beklenir.
Seçici veri kullanımı tam da bu uç dönemleri “yeni normal” gibi sunduğunda tehlikeli hale gelir. Bir oyuncunun en parlak beş maçı seçilip bu, onun genel seviyesiymiş gibi anlatılırsa, hem cherry picking hem de ortalamaya dönüş kavramının göz ardı edilmesi bir arada yaşanmış olur.
Bu iki kavramı birlikte düşünmek, veri destekli analizde daha temkinli bir okuma alışkanlığı kazandırır. Uç bir sayı gördüğünüzde önce “bu kalıcı mı, geçici mi” diye sormak; sonra “bu sayı bana tüm resmi mi, seçilmiş bir parçayı mı gösteriyor” diye sorgulamak, sağlıklı bir analiz kültürünün temelini oluşturur. Bu yaklaşım aynı zamanda sorumlu-oyun ilkesiyle de örtüşür; çünkü abartılı veya seçici sunulan istatistikler, gerçekçi olmayan beklentiler yaratma riski taşır ve temkinli, dengeli yorum her zaman daha sağlıklı bir bakış açısı sunar.
18+ — bilgilendirme amaçlıdır.
Sıkça Sorulan Sorular
Seçici veri kullanımı ile örneklem yanılgısı aynı şey midir?
Hayır, ikisi farklı mekanizmalardır. Örneklem yanılgısı yetersiz büyüklükte bir veri setinden genel sonuç çıkarmakla ilgilidir; seçici veri kullanımında ise veri seti yeterli olsa bile analist bilinçli ya da bilinçsiz şekilde yalnızca tezini destekleyen kısmı öne çıkarır. Biri hacim sorunu, diğeri seçim sorunudur.
Bir istatistiğin cherry picking olup olmadığını nasıl anlarım?
En pratik yöntem, aynı metriği farklı zaman aralıklarında ve farklı bağlamlarda tekrar sorgulamaktır. Eğer sonuç yalnızca belirli bir aralıkta anlamlı görünüyor ve aralık değiştikçe tez çöküyorsa, o veri seçici biçimde sunulmuş olabilir.
Veri destekli analizde tek bir istatistiğe güvenmek neden risklidir?
Tek bir sayı, bağlamından koparıldığında yanıltıcı bir hikaye kurabilir. Sağlıklı analiz birden fazla metriği, farklı zaman dilimlerini ve karşıt senaryoları birlikte değerlendirmeyi gerektirir; tek veri noktası her zaman eksik bir resim sunar.
