Tüm yazılar

8,3 milyar persona, sıfır gerçek sonuç — biz kendimizi ölçtük

3 Eylül 2026 · Dekstr

Dekstr, persona panellerini müşterinin kendi verisinden kurup gerçek sonuçlarla kalibre ediyor. 2 Eylül 2026'da Dekstr kendi panelini, sonucunu kendisinin belirlemediği bir ölçüte karşı sınadı ve kalibrasyonsuz panel geçemedi. Hepsi burada.

Düzenek

İstediğimiz iddia dardı: panel kazanan reklam kreatifini seçebiliyor mu? "Panel tutarlı mı" değil — motorun iç ölçümü tutarlılığı çoktan gösteriyordu (A=51±2,7 / B=58,6±1,0, B 5/5), ama tutarlılık doğruluk değil.

Dış vekil: Meta Ad Library'de yayında kalma süresi. Bir çift = aynı reklam verenin ≥21 gün dönmüş kreatifi ile ≤7 günde kapatılıp bitmiş kreatifi. Kazananın uzun reklamı, kaybeden yayındayken de yayında olmalı; böylece tümden durmuş bir kampanya farkı taklit edemiyor. Aynı-metin çiftleri dışarıda — görsel testi bizim ölçümüz değil. Kural sabitleri tek yerde: PAIR_RULE, her eşiğin yanında gerekçesi.

Almanya, Türkiye değil. DSA gereği Ad Library AB'de pasif reklamları bitiş tarihiyle bir yıl gösteriyor; TR'de yalnız aktifler görünüyor, yani kaybeden seçilemiyor. TR için yol iki anlık görüntü (T0→T1) ve ayrı bir koşu.

Sınanan şey üretimin ta kendisi: ürünün koştuğu istem, kabul kapısı ve model neyse o. Ve söze değil koda bağlanmış beş pazarlık dışı kısıt: panel kreatifleri hiç görmüyor; kalibrasyon kapalı; backtest süreci üretim veritabanına ulaşamıyor; kontrol kolu var — aynı model, aynı ürün bilgisi, persona'sız; artı yedi deterministik aptal taban; birincil metrik güven aralıklı ikili sıralama isabeti.

Bir şey daha: panel en zayıf hâliyle sınandı. Dış reklam verenlerin analitiği bizde yok; kanıt paketi boştu, her persona yalnız beyandı ve beyanı da halka açık sayfa bilgisinden model yazdı. Aşağıdaki sayı, bir müşterinin ilk gün gördüğü panelin gücü — kendi verisi ve kendi sonuçları döngüye girmeden önceki hâli.

Sonuç

150 çift, 37 reklam veren, yargı başına 3 bağımsız koşu, toplam ~$50.

Persona paneli (üretim yolu)%46,7 (%95 GA 39–55)
Aynı LLM, persona'sız%46,7
Yazı-tura%50
Aptal taban: "uzun başlık kazanır"%64,7

Panel−LLM farkı 0,0 puan [−9,3, +8,7], McNemar p=1. Panelin kendi "fark gürültünün üstünde" işareti bilgi taşımadı (%47,3, n=131). Okuma: kalibrasyonsuz, beyan-only panel bu vekilde ayırt etmiyor ve persona katmanı tek LLM'e bir şey eklemiyor.

Sonra düzeltmeyi denedik

Önce teşhis: puan ile sonuç ilişkisizdi (kazananlara ortalama 30,9, kaybedenlere 32,4) ve panel çiftlerin yalnız %35'inde önce sunulan varyantı seçiyordu — pozisyon yanlılığı. İki düzeltme üretime girdi: ön-test istemi feed bağlamına çevrildi (persona telefonda kaydırıyor; 0 kaydırır geçer, ~60 durur okur, 80+ harekete geçer) ve her varyant artık ayrı çağrıda paneli tek başına görüyor — pozisyon yanlılığı yapısal olarak bitti.

Aynı donmuş 150 çifte v2: %45,7 [38–54] — v1'in %46,7'sinden istatistiksel olarak farksız (eşleşmiş fark −1,0 puan [−7,7, +6,3], p=0,47). Mekanik düzeldi; ayırt etme düzelmedi. Ardından tek bir yalnız-kanca sondası — yargıç her kreatifin yalnız ilk satırını gördü (60 çift): %37,5 [26–50]. Üç çerçeve, aynı yer. Verideki sinyal gerçek ("uzun başlık" %64,7, "kısa gövde" %56,7); LLM yargıçlar ona itibar etmiyor. Prompt iterasyonu burada durdu — koşu başına ~$50, ve bu noktadan sonrası öğrenmek değil dev-set'e uydurmak.

MatrAIx neyi değiştiriyor

3 Eylül'de Dekstr arXiv 2608.04205'i okudu: MatrAIx — Harvard/MIT önderliğinde ~100 yazar; fonlayanlar OpenAI, Anthropic, Microsoft, AWS ve Meta. 1.290 kategorik persona boyutu, 8,3 milyar kayıt, ~1M açık coreset, 1.010 görev şablonu, 18.189 deneme. Doğrulama: davranışsal sadakat %91,5, persona çıkarım kalitesi 4,135/5.

Ölçmedikleri şey gerçek dünya sonucu. Kendi cümleleri: "task success is not treated as evidence of human validity" ve kapanış — "simulate diverse users, then validate against reality." O "then"i yapan yok. Sadakat isabet değildir: bir panel kendi kartına %91,5 sadık olup gerçek sıralamada yazı-tura kalabilir. Dekstr tam olarak bunu ölçtü: %46,7.

Sırada ne var

Panel kurmak bedava altyapıya dönüşüyor ve 1.290 boyut darboğaz değil: v0→v2 koşularımız persona detayının isabeti değiştirmediğini gösteriyor. Savunulabilir kalan üç şey: müşterinin kendi verisi, gerçek sonuçlarla kalibrasyon ve dışa dönük dürüst ölçüm. Sonuncusu artık iki tarafa da kesiyor — "senin sonuçlarınla kalibre ediyoruz" bir cümle değil, ölçüm borcu. Sırada: kalibrasyon noktaları birikince kalibrasyonlu tekrar, TR için iki-anlık-görüntü tasarımı ve gerçek müşteri paneliyle koşu. Çiftler, paneller, yargılar ve raporlar repoda commit'li.