Yapay zekâ görünürlüğü ölçen bir panelde en sık sorulan soru şu: bu rakam ne kadar güvenilir? Cevabı vermek için önce kendi ölçümümüzü kendimize karşı kurduk.
Deney
İzlediğimiz bir markanın 50 sorusunu aynı gün, aynı motorda, arka arkaya üç tur çalıştırdık. Soru metni değişmedi, pazar değişmedi, motor değişmedi. Değişen tek şey turdu.
| Tur | Markanın anıldığı soru |
|---|---|
| 1. tur | 2 / 50 |
| 2. tur | 1 / 50 |
| 3. tur | 0 / 49 |
| Üç turda da çıkan | 0 |
Son satır yazının tamamı: üç turun üçünde birden çıkan tek bir soru yok. Birinci turda markayı gösteren soru, ikinci turda göstermedi. Aynı gün, aynı soru, aynı motor.
Bu bir hata değil
Dil modelleri olasılıksal çalışır. Aynı girdiye her seferinde aynı cevabı vermek zorunda değiller ve vermiyorlar da. Sorun modelde değil, ölçümü tek atışa dayandırmakta.
Tek atışla ölçen bir araç size iki farklı gün iki farklı tablo gösterir ve ikisi de doğrudur. Yanlış olan, aradaki farkı içerik değişikliğine ya da rakip hamlesine bağlamaktır. Çoğu zaman hiçbir şey değişmemiştir.
Ne yaptık?
İki şey. Birincisi düzenli tarama: sorular iki günde bir, her turda bir kez koşar. Aynı soruyu gün içinde defalarca sormak ölçümü iyileştirmiyor; yayımlanmış çalışmalar da beşinci tekrardan sonrasının bilgi taşımadığını gösteriyor. Kararsızlık tekrar sayısıyla değil, birikimle çözülüyor.
İkincisi pencere metriği: son N günde sorularınızın yüzde kaçında en az bir kez göründüğünüz. Anlık kapsamın yanında ayrı bir sayı olarak durur, çünkü ikisinin farkı bilginin kendisidir.
Farkın büyüklüğü
İzlediğimiz markada anlık kapsam yüzde 5,7 iken 30 günlük pencere yüzde 28,1 çıktı. Yaklaşık beş kat. Bu marka aslında motorun bildiği bir marka; sadece her seferinde öne çıkmıyor.
Tek bir rakam görseydiniz iki yanlıştan birini yapardınız: yüzde 5,7’yi görüp panik yapmak ya da yüzde 28,1’i görüp rahatlamak. Doğru okuma ikisinin arasında: konum sınırda, küçük bir hamle sonucu değiştirebilir.
Pencere metriğini nasıl okumalı?
İki rakamı yan yana koyunca dört durum çıkar ve dördü de farklı iş ister. Anlık düşük, pencere yüksek: motor sizi tanıyor ama kararsız; konumunuz sınırda, kaynak tarafına küçük bir hamle sonucu değiştirebilir. Anlık ve pencere birlikte yüksek: konum oturmuş, koruma modundasınız. İkisi birlikte düşük: motor sizi henüz tanımıyor; iş kararsızlıkta değil, içerik ve kaynak eksiğinde. Anlık yüksek, pencere düşük: yeni bir sıçrama; kalıcı olup olmadığını önümüzdeki günler söyler.
En sık yapılan hata, iki rakamın farkını hata sanmak. Fark bir ölçüm kusuru değil, motorun kararsızlığının kendisi. Fark kapanıyorsa konum oturuyor, açılıyorsa motor sizi giderek daha seyrek öne çıkarıyor demektir; ikisi de tek başına anlık rakamdan daha değerli bilgi.
İki günde bir ölçüm neden yeterli?
Madem tek atış yazı tura, günde yüz atış yapalım denebilir. Denemeler bunun işe yaramadığını gösteriyor: aynı soruyu gün içinde tekrar tekrar sormak, birkaç tekrardan sonra yeni bilgi getirmiyor. Yayımlanmış çalışmalar da aynı yönde; beşinci tekrardan sonrası gürültüyü ölçüyor.
Bunun yerine tekrarı zamana yayıyoruz: iki günde bir ölçüm, otuz günde yaklaşık on beş bağımsız gözlem. Aynı bütçeyle hem kararsızlık birikimli olarak görünür hale geliyor hem de gerçek bir değişim, örneğin yeni bir kaynağın devreye girmesi, eğride birkaç gün içinde okunuyor.
Kendi aracınızı test etmek isterseniz
- Aynı soruyu aynı motora üç kez sorun. Üçünde de aynı markalar çıkıyorsa şüphelenin; motorlar bu kadar kararlı değil.
- Kullandığınız aracın rakamı hangi yüzeyden aldığını sorun: kullanıcı arayüzü mü, geliştirici API’si mi? Cevap yoksa rakam karşılaştırılamaz.
- Tek günün rakamıyla sunulan her değişimi bekletin. Gerçek değişim birkaç günlük eğride de görünür; görünmüyorsa gürültüdür.
- "Son N günde en az bir kez görünme" gibi birikimli bir metrik isteyin. Yoksa kararsızlığı görme şansınız yok.
Ölçüm 24 Temmuz 2026’da yapıldı; 50 soru, üç tur, tek motor. Marka adı verilmiyor: veri gerçek bir hesabındır ve yayımlanması bize düşmez. Yöntem tarif edildiği gibi tekrarlanabilir.