Bölüm Sınırı
Bölüm 5 şu hükmü kurdu:
Her AI ürününün hedef kullanıcı nüfusu ayrı tanımlanmalıdır. Bir ülkenin toplam nüfusu, o ülkedeki ürün-uygun kullanıcı nüfusu değildir.
Şimdi bir sonraki soruya geliyoruz:
Tanımlanmış uygun kullanıcı nüfusundan GEO-1000 için kaç kişi, hangi ülkeden, hangi dilden ve hangi yöntemle seçilecektir?
Bir AI ürünü için uygun kullanıcı nüfusunun:
- yüzde 40’ı A ülkesinde,
- yüzde 25’i B ülkesinde,
- yüzde 15’i C ülkesinde,
- yüzde 0,04’ü küçük bir ülkede
bulunuyorsa 1.000 geçerli gözlem nasıl dağıtılmalıdır? Küsuratlı kotalar nasıl tam sayıya dönüştürülecektir? Nüfus payı bir kişinin altında kalan ülkeler tamamen dışarıda mı kalacaktır? Her ülkeye en az bir kişi verildiğinde nüfus ağırlığı bozulacak mıdır? Küçük ülkeler ayrı bir havuzda toplanabilir mi? Dil adaleti için bazı diller fazla örneklenirse küresel skor nasıl hesaplanacaktır? Bir ülkede hedef 100 geçerli gözlem varsa, kaç kişi davet edilmelidir? Katılımcı görevi tamamlamadığında yerine kim alınacaktır? Yanlış cevap veren kullanıcı değiştirilebilir mi? Aynı kişi birden fazla AI ürününü test ederse örneklem hâlâ bağımsız mıdır?
Ham örneklem 1.000 kişi olsa da ağırlıklar çok dengesizse gerçek istatistiksel bilgi 1.000 kişiden daha az olabilir mi? Bu sorular yalnız operasyon ayrıntısı değildir. Örneklem tasarımı, hangi insanın GEO skorunda ne kadar söz sahibi olduğunu belirler. Yanlış örneklem:
- doğru cevapları yanlış ağırlıklandırabilir,
- küçük ülkeleri sembolik biçimde aşırı büyütebilir,
- büyük nüfusları olduğundan küçük gösterebilir,
- düşük kaynaklı dilleri görünmez bırakabilir,
- gönüllü teknoloji kullanıcılarını dünya nüfusu gibi sunabilir,
sonuçlara bakıldıktan sonra istenen skoru üretmek için değiştirilebilir. Daha önce kurulan denetim mimarisi, her kontrolün ölçülebilir olmasını ve model/ürün, tarih, ülke, dil, sorgu kümesi, tekrar sayısı ve ölçüm kaydı taşımasını gerektirir. Bu bölüm, aynı disiplini örneklem tasarımına uygular. Çünkü gerçek kanıt, sınır, bağlam ve zaman istemek; örneklemin nasıl oluşturulduğunu da görünür kılmayı gerektirir. Bu bölüm:
- ana nüfus panelinin 1.000 geçerli gözleme nasıl dağıtılacağını,
- tabaka ve hücrelerin nasıl kurulacağını,
- küçük ülkelerin nasıl yönetileceğini,
- küsuratların nasıl tam sayıya çevrileceğini,
- fazla örneklemenin nasıl ağırlıklandırılacağını,
- davet, yedek ve geçerli gözlem hedeflerinin nasıl ayrılacağını,
- tasarım ve analiz ağırlıklarının nasıl kurulacağını,
- etkin örneklem büyüklüğünün neden ham sayıdan farklı olabileceğini
tanımlar. Bu bölüm henüz:
- katılımcıların hangi panel sağlayıcısından seçileceğini,
- gönüllü veya olasılıklı örneklemde saha uygulamasının bütün ayrıntılarını,
- hakemlik ve yanıt puanlamasını,
- nihai güven aralığı yöntemini,
- bütün NOMOS skor formüllerini
tam olarak kesinleştirmez. Bölüm 6’nın görevi şudur:
Tanımlanmış hedef nüfusu, sonucu görmeden önce dondurulmuş, ağırlıklandırılabilir ve yeniden üretilebilir bir GEO-1000 örneklemine dönüştürmek.
NOMOS Challenge
Bir AI ürünü için 1.000 kişilik küresel panel kuruyorsunuz. On ülkenin ürün-uygun nüfusları şöyledir:
| Ülke | Uygun kullanıcı nüfusu |
|---|---|
| A | 400.000.000 |
| B | 250.000.000 |
| C | 150.000.000 |
| D | 100.000.000 |
| E | 60.000.000 |
| F | 30.000.000 |
| G | 8.000.000 |
| H | 1.500.000 |
| I | 400.000 |
| J | 100.000 |
| Toplam | 1.000.000.000 |
Saf nüfus oranına göre ham kotalar:
| Ülke | Ham kota |
|---|---|
| A | 400,0 |
| B | 250,0 |
| C | 150,0 |
| D | 100,0 |
| E | 60,0 |
| F | 30,0 |
| G | 8,0 |
| H | 1,5 |
| I | 0,4 |
| J | 0,1 |
Bir insanın yarısı seçilemez. Bir ülkeye 0,4 kişi gönderilemez. Ham kotaları en yakın tam sayıya yuvarlarsanız toplam 1.000’i aşabilir veya altında kalabilir. Her ülkeye en az bir kişi verirseniz I ve J ülkelerini nüfus paylarından daha fazla temsil edersiniz.
I ülkesine bir kişi vermek, teorik payını 2,5 kat büyütür. J ülkesine bir kişi vermek, teorik payını 10 kat büyütür. Bu aşırı temsil ağırlıkla düzeltilebilir. Fakat bir kişiyle ülke skoru üretilemez. I ve J’ye hiç kimse vermezseniz ne olur?
Eğer bu ülkeleri ayrı ve zorunlu tabaka olarak tanımladıysanız, hedef nüfustaki bazı insanların seçilme olasılığı sıfır olur. Bu durumda: “Bütün uygun küresel nüfusu temsil eden olasılıklı örneklem” iddiası zayıflar. Şimdi daha tehlikeli bir karar düşünün. Önce cevapları topluyorsunuz.
J ülkesindeki tek kullanıcı yanlış cevap alıyor. Sonra: “Bu ülkenin örneklemi çok küçük, kapsamdan çıkaralım.” diyorsunuz. A ülkesinde çok sayıda olumlu cevap var. Onu tam ağırlığıyla koruyorsunuz. Bu artık yuvarlama değildir. Sonuç odaklı örneklem değişikliğidir.
Başka bir durumda düşük sonuç veren bir dil grubundaki geçersiz kayıt oranını yükseltiyor, yedek katılımcıları yalnız olumlu cevap gelene kadar kullanıyorsunuz. Bu da örneklem değildir. Cevap seçme mekanizmasıdır. Bu bölümün ilk hükmü şudur:
Örneklem, AI yanıtları görülmeden önce kurulmalıdır.
İkinci hükmü şudur:
Katılımcının seçilme ihtimali yanıtın doğruluğuna bağlı olamaz.
Üçüncü hükmü şudur:
Küçük ülkenin görünürlüğü ile küresel skordaki nüfus ağırlığı ayrı yönetilmelidir.
Dördüncü hükmü şudur:
Fazla örneklemek mümkündür; fazla ağırlıklandırmak zorunlu değildir.
Beşinci hükmü şudur:
1.000 ham kayıt, her zaman 1.000 gözlemlik istatistiksel bilgi taşımaz.
1. BÖLÜMÜN AMACI
Bu bölümün amacı, her AI ürünü ve ölçüm dalgası için hedeflenen 1.000 geçerli gözlemi ürün-uygun kullanıcı nüfusuna dayalı, denetlenebilir bir örneklem tasarımına dönüştürmektir. Bölüm şu ayrımları normatif hâle getirir:
- Hedef nüfus ile seçilen örneklem
- Ham kota ile tam sayı tahsisi
- Ana nüfus paneli ile tamamlayıcı paneller
- Ülke görünürlüğü ile ülke ağırlığı
- Tabaka ile deneysel hücre
- Büyük ülke tabakası ile küçük ülke havuzu
- Saf orantılı tahsis ile orantısız fazla örnekleme
- Örneklem payı ile nüfus payı
- Davet sayısı ile geçerli gözlem hedefi
- Yedek katılımcı ile sonuç sonrası değiştirme
- Veri toplama geçersizliği ile olumsuz AI çıktısı
- Tasarım ağırlığı ile sonuç ağırlığı
- Ham örneklem büyüklüğü ile etkin örneklem büyüklüğü
- Ülke örneklemi ile dil örneklemi
- Çok dilli kullanıcı ile birden fazla insan
- Tek aşamalı seçim ile çok aşamalı seçim
- Native Reach tahsisi ile Common Support tahsisi
- Anlık dalga tahsisi ile zaman serisi tahsisi
- Nüfus tahmini ile ülke veya dil tanı analizi
- Ana 1.000 gözlem ile ek gözcü ve adalet panelleri
Bu bölümün sonunda her denetim şu sorulara cevap verebilmelidir:
1.000 gözlem neden bu ülke, dil ve kullanıcı gruplarına bu sayılarda dağıtıldı?
Her gözlemin küresel sonuç içindeki ağırlığı nasıl belirlendi?
Kimlerin seçilme olasılığı sıfırdı ve neden?
Kaç kişi davet edildi, kaç kişi tamamladı ve kaç gözlem geçerli kaldı?
Örneklem sonuçlar görülmeden önce donduruldu mu?
2. MERKEZÎ NORMATİF HÜKÜM
GEO-1000 ana nüfus örneklemi, her AI ürünü ve ölçüm dalgası için önceden dondurulmuş ürün-uygun nüfus çerçevesindeki insanlara, bilinen veya tahmin edilebilir seçilme olasılıkları atayan tabakalı bir örneklem tasarımına dayanmalıdır. Ana nüfus panelinin varsayılan hedefi:
AI ürünü ve ana ölçüm dalgası başına en az 1.000 geçerli gözlem
olarak korunur. Bu sayı:
- davet edilen kişi sayısı değildir,
- hesap sayısı değildir,
- ham ekran görüntüsü sayısı değildir,
bütün tamamlayıcı panellerin toplamı değildir. 1.000, ana nüfus panelinde protokolü karşılayan geçerli ürün-gözlemi hedefidir. Country Sentinel, Language Fairness ve Accessibility panelleri ek örnekler oluşturabilir. Bu ek örnekler:
- toplam saha hacmini 1.000’in üzerine çıkarabilir,
- küresel nüfus sonucunda uygun ağırlıklarla kullanılabilir,
fakat ana panelin 1.000 geçerli gözlem hedefini gizlice azaltmak için kullanılamaz.
3. ÖRNEKLEMİN TEMEL GÖSTERİMİ
Belirli bir AI ürünü a, ölçüm dalgası w ve hedef nüfus çerçevesi için tabakalar:
h ∈ H_{a,w}olarak gösterilsin. Her tabaka için:
- Nh: tabakadaki tahmini ürün-uygun insan nüfusu
- N: bütün hedef nüfus
- Wh: tabakanın nüfus ağırlığı
- n: hedef geçerli ana panel gözlemi
- qh: ham orantılı kota
- nh: tahsis edilen tam sayı geçerli gözlem hedefi
olsun. Toplam hedef nüfus:
N = Σ_{h=1}^H N_hTabakanın nüfus ağırlığı:
W_h = N_h / NHam orantılı kota:
q_h = nW_hşeklindedir. Ana orantılı tahsis, ideal koşullarda:
n_h ≈ nW_holmalıdır. Ancak:
- qh küsuratlı olabilir,
- bazı hücreler bir kişinin altında kalabilir,
- dil ve ülke alt grupları için asgari tanı örneği gerekebilir,
- yüksek riskli küçük gruplar ayrıca incelenebilir,
saha tamamlama oranları değişebilir. Bu nedenle ham kota doğrudan son tahsis değildir.
4. ÖRNEKLEM TASARIMININ ÜÇ AYRI AMACI
Aynı örneklem bütün amaçları aynı güçte yerine getiremeyebilir. Üç amaç ayrılmalıdır.
4.1. Küresel Nüfus Tahmini
Şu soruyu cevaplar:
Ürüne uygun küresel kullanıcı nüfusundaki ortalama insan hangi temsil sonucunu görür?
Nüfus ağırlığı temel önceliktir.
4.2. Alt Grup Tanısı
Şu soruyu cevaplar:
Belirli ülke, dil, plan veya kullanıcı gruplarında hangi temsil bozulmaları oluşur?
Küçük grupların fazla örneklenmesi gerekebilir.
4.3. Coğrafi ve Dilsel Kapsam
Şu soruyu cevaplar:
Hangi ülke ve dillerde en azından gerçek kullanıcı gözlemi bulunmaktadır?
Country Sentinel ve Language Fairness panelleri önem kazanır. Bu üç amaç aynı tek örneklemde açıklamasız biçimde birleştirilemez.
5. ANA ÖRNEKLEM MİMARİSİ
GEO-1000 için aday ana örneklem mimarisi dört katmandan oluşur.
5.1. Population Panel
Her AI ürünü ve dalga için en az 1.000 geçerli gözlemlik ana paneldir. Küresel nüfus tahminini üretir.
5.2. Country Sentinel Overlay
Ana nüfus panelinde doğrudan temsil edilemeyen küçük ülkeler için ek coğrafi gözlemler sağlar. Bu gözlemler:
- tekil olay,
- erişim durumu,
- sonraki araştırma ihtiyacı
gösterebilir. Tek başına ülke skoru oluşturmaz.
5.3. Language Fairness Oversample
Düşük kaynaklı veya ana panelde küçük kalan diller için ek gözlemler üretir. Küresel sonuçta gerçek nüfus ağırlıklarına geri döndürülür.
5.4. Accessibility Oversample
Standart panelin yeterince temsil edemediği yardımcı teknoloji ve erişilebilirlik kullanıcılarını ayrıca ölçer. Bu gözlemlerin hedef evreni ve ağırlığı ayrı kaydedilir.
6. TABAKA NEDİR?
Tabaka, örneklem tahsisi ve seçim olasılığı bakımından ayrı yönetilen nüfus bölümüdür. Tabaka şu alanlardan biri veya birkaçının birleşimi olabilir:
- Ülke
- Bölge
- Dil
- Locale
- AI planı
- Web veya mobil
- Kontrollü veya doğal kullanıcı paneli
- Erişilebilirlik durumu
- Kullanıcı türü
- Yargı alanı
Her küçük kombinasyon ayrı tabaka yapılırsa örneklem parçalanır. Örneğin: Ülke × dil × plan × mobil/web × yaş grubu × kullanıcı tipi kombinasyonu yüzlerce veya binlerce hücre üretebilir. 1.000 gözlem bu hücrelerin çoğunda güvenilir tahmin sağlamaz. Bu nedenle tabakalama:
- maddi,
- ölçülebilir,
- örneklem büyüklüğüne uygun
olmalıdır.
7. TABAKA İLE RAPORLAMA HÜCRESİ AYNI ŞEY DEĞİLDİR
Bir grup sonuç kartında ayrı gösterilebilir. Fakat örneklem tasarımında ayrı tabaka olmak zorunda değildir. Örneğin:
- küçük bir dil,
- belirli erişilebilirlik grubu,
- bir yaş bandı
ana örneklemde daha geniş tabaka içinde seçilebilir. Daha sonra analizde ayrı raporlanabilir. Bunun tersi de mümkündür: Örnekleme verimliliği için iki bölge ayrı tabakalanmış olabilir. Fakat kamu raporunda tek bölgesel sonuç altında birleştirilebilir. Tabaka tasarımı ile raporlama yapısı ayrı kayıtlar taşımalıdır.
8. TABAKALARIN KURULMA SIRASI
Ana Population Panel için aday sıralama şöyledir:
- AI ürünü ve kullanıcı yüzeyi
- Native Reach veya Common Support nüfus çerçevesi
- Ülke veya küçük ülke havuzu
- Ana denetim dili veya dil grubu
- Maddi plan/arayüz ayrımı, gerekiyorsa
- Katılımcı seçim çerçevesi
Plan ve arayüz her ülkede ayrı tabaka yapılmak zorunda değildir. Bunlar:
- alt tabaka,
- kota,
- rastgele atama
yoluyla yönetilebilir.
9. BÜYÜK VE KÜÇÜK ÜLKE TABAKALARI
Bir ülkenin ham kotası:
q_c = nN_c / Nşeklindedir. Ham kota yeterince büyükse ülke doğrudan ayrı tabaka olarak tutulabilir. Buna:
Kendini temsil eden ülke tabakası
denebilir. Ham kotası çok küçük ülkeleri tek tek ayrı zorunlu tabaka yapmak örneklem verimliliğini bozabilir. Bu ülkeler uygun biçimde:
- bölge,
- dil ailesi,
- ürün erişim rejimi,
- coğrafi yakınlık
altında küçük ülke havuzlarına alınabilir.
10. KÜÇÜK ÜLKE HAVUZU
Bir küçük ülke havuzu:
B_r = {c_1, c_2, …, c_k}olarak gösterilsin. Havuzun toplam uygun nüfusu:
N_{B_r} = Σ_{c∈B_r} N_cAna örneklem kotası:
q_{B_r} = nN_{B_r} / Nolarak hesaplanır. Havuz içinde ülke seçimi, uygun nüfus büyüklüğüne orantılı olasılıkla yapılabilir. Ülke c’nin havuz içinde seçilme olasılığı:
Pr(c | B_r) = N_c / N_{B_r}olabilir. Ardından seçilen ülke içinde katılımcı seçilir. Bu yaklaşım:
- küçük ülkelerin hedef nüfusta sıfır seçilme ihtimali taşımasını engelleyebilir,
- her ülkenin belirli bir dalgada mutlaka seçileceğini garanti etmez,
küresel nüfus tahminini korur. Bir ülkenin o dalgada seçilmemesi:
NOT SELECTED IN POPULATION SAMPLE
statüsüdür. Şu anlama gelmez: “Ülke hedef nüfusun parçası değildir.”
11. KÜÇÜK ÜLKELERİ HAVUZLAMANIN SINIRLARI
Küçük ülkeler yalnız nüfusları küçük olduğu için rastgele aynı havuza atılamaz. Havuz içindeki ülkeler ilgili olduğu ölçüde benzer:
- ürün erişimi,
- kullanıcı yüzeyi,
- dil veya locale yapısı,
- hukuki erişim,
- coğrafi bölge,
- veri toplama yöntemi
taşımalıdır. Ürün erişimi bulunmayan ülke ile tam erişim bulunan ülke aynı ana havuza konamaz. Farklı kullanım koşulları görünmez hâle getirilemez.
12. KÜÇÜK ÜLKE HAVUZU ÜLKE SKORU ÜRETMEZ
Havuzdan seçilen bir veya iki gözlem: havuzun küresel nüfus katkısında kullanılabilir, tekil ülke olayını gösterebilir. Fakat küçük ülke için ayrı istatistiksel skor üretmez. Ülke bazlı skor isteniyorsa ek:
- Country Sentinel,
- ülke özel örneklem,
- çok dalgalı birikimli örneklem
gerekebilir.
13. SAF NÜFUSA ORANTILI TAHSİS
Saf orantılı tahsis:
q_h = nW_hformülüne dayanır. Avantajları:
- ana nüfus tahmini için anlaşılırdır,
- büyük nüfuslara doğal ağırlık verir,
- ağırlık farklılığını azaltabilir,
kendi kendini ağırlıklandıran tasarıma yaklaşabilir. Sınırlamaları:
- küçük ülke ve dilleri çok az örnekleyebilir,
- alt grup skoru üretmeye yetmeyebilir,
- yüksek riskli küçük grupları görünmez bırakabilir,
küsurat ve sıfıra yakın kotalar oluşturabilir. Bu nedenle saf orantılı tahsis ana Population Panel için güçlü varsayılan olabilir. Tamamlayıcı panellerin yerine geçmez.
14. KÜSURATLARIN TAM SAYIYA DÖNÜŞTÜRÜLMESİ
Ham kotalar çoğu zaman küsuratlıdır. Toplam tahsis tam olarak n olmalıdır. Varsayılan yöntem olarak En Büyük Kalan Yöntemi kullanılabilir.
14.1. Birinci Adım
Her ham kota aşağı yuvarlanır:
b_h = ⌊q_h⌋14.2. İkinci Adım
Dağıtılmamış gözlem sayısı:
R = n − Σ_h b_holarak hesaplanır.
14.3. Üçüncü Adım
Her tabakanın kesir kısmı:
f_h = q_h − b_hhesaplanır.
14.4. Dördüncü Adım
Kalan R gözlem, en yüksek fh değerlerine sahip tabakalara birer tane eklenir.
14.5. Eşitlik Durumu
İki tabakanın kesir kısmı eşitse:
- nüfus büyüklüğü,
- önceden ilan edilmiş sabit sıra,
- kayıtlı rastgelelik tohumu
gibi sonuçtan bağımsız bir bağ bozma kuralı kullanılmalıdır. Sonuçlara bakılarak ülke seçilemez.
15. SENTETİK TAM SAYI TAHSİSİ
SENTETİK GÖSTERİM
Bölüm başındaki uygun nüfuslar:
| Ülke | Uygun nüfus | Ham kota |
|---|---|---|
| A | 400.000.000 | 400,0 |
| B | 250.000.000 | 250,0 |
| C | 150.000.000 | 150,0 |
| D | 100.000.000 | 100,0 |
| E | 60.000.000 | 60,0 |
| F | 30.000.000 | 30,0 |
| G | 8.000.000 | 8,0 |
| H | 1.500.000 | 1,5 |
| I | 400.000 | 0,4 |
| J | 100.000 | 0,1 |
Ülkeler ayrı tabakalar olarak korunursa aşağı yuvarlama:
| Ülke | Aşağı yuvarlanmış kota |
|---|---|
| A | 400 |
| B | 250 |
| C | 150 |
| D | 100 |
| E | 60 |
| F | 30 |
| G | 8 |
| H | 1 |
| I | 0 |
| J | 0 |
| Toplam | 999 |
Bir gözlem kalmıştır. En yüksek kesir H ülkesindeki 0,5 olduğu için H’ye eklenir. Nihai tahsis:
| Ülke | Nihai kota |
|---|---|
| A | 400 |
| B | 250 |
| C | 150 |
| D | 100 |
| E | 60 |
| F | 30 |
| G | 8 |
| H | 2 |
| I | 0 |
| J | 0 |
| Toplam | 1.000 |
Bu tasarım I ve J’yi ayrı deterministik tabaka olarak tanımladığı hâlde seçilme şansı vermiyorsa tam hedef evren çıkarımı bakımından sorun yaratabilir. Daha doğru çözüm küçük ülke havuzudur.
16. KÜÇÜK ÜLKE HAVUZLU SENTETİK TAHSİS
H, I ve J ülkeleri:
B_small = {H, I, J}havuzunda birleştirilsin. Havuz nüfusu:
1.500.000+400.000+100.000=2.000.000Havuz kotası:
1.000 × 2.000.000 / 1.000.000.000 = 2olur. Ana tahsis:
| Tabaka | Kota |
|---|---|
| A | 400 |
| B | 250 |
| C | 150 |
| D | 100 |
| E | 60 |
| F | 30 |
| G | 8 |
| Küçük ülke havuzu | 2 |
| Toplam | 1.000 |
Havuz içindeki ülke seçilme ağırlıkları:
| Ülke | Havuz içi nüfus payı |
|---|---|
| H | %75 |
| I | %20 |
| J | %5 |
İki ana nüfus gözlemi bu olasılıklara göre seçilir. Aynı dalgada:
- iki gözlem de H’den,
- biri H’den biri I’den,
- nadiren J’den
gelebilir. Bu tasarım J’yi her dalgada görünür yapmaz. Fakat J nüfusunun seçilme olasılığını sıfırlamaz. J’nin mutlaka gözlenmesi isteniyorsa Country Sentinel Panel’e ayrıca eklenir. Sentinel gözlemi küresel ana tahsiste J’ye 1.000’de bir ağırlık vermez. J’nin gerçek nüfus ağırlığı korunur.
17. ASGARİ HÜCRE TAHSİSİ
Bazı alt gruplar için saf orantılı kota tanısal analiz yapmaya yetmeyebilir. Örneğin bir dil hücresinin ham kotası 8 olabilir. Sekiz gözlemle güvenilir dil skoru üretilemez. Bu durumda üç seçenek vardır:
- Dil skoru yayımlamamak
- Hücreyi benzer gruplarla birleştirmek
- Hücreyi fazla örneklemek
Asgari hücre tahsisi sonuçlardan önce tanımlanmalıdır.
18. ADAY RAPORLAMA BANTLARI
CANDIDATE REPORTING BANDS — ADAY RAPORLAMA BANTLARI
Aşağıdaki eşikler nihai bilimsel karar değildir. Pilot ve dış incelemeyle kalibre edilmelidir.
1–29 Geçerli Gözlem
Tekil olay ve keşif Ülke veya dil oranı yayımlanmaz
OBSERVATIONAL ONLY
30–99 Geçerli Gözlem
Keşif düzeyi tahmin Geniş belirsizlik Kesin uygunluk hükmü verilmez
EXPLORATORY
100–199 Geçerli Gözlem
İlk alt grup tahmini Belirsizlik görünür olmalıdır
PROVISIONAL
200 ve Üzeri Geçerli Gözlem
Daha güçlü alt grup tahmini adayı Tasarım etkisi ve ağırlıklar yine değerlendirilir
STANDARD ESTIMATION CANDIDATE
Bu bantlar:
- hata oranı,
- beklenen hassasiyet,
- ağırlık değişkenliği,
- tasarım etkisi
dikkate alınmadan otomatik yeterlilik sayılmaz.
19. FAZLA ÖRNEKLEME
Bir ülke, dil veya kullanıcı grubu nüfus payından daha fazla gözlem alabilir. Buna fazla örnekleme denir. Amaçları:
- alt grup hassasiyetini artırmak,
- düşük kaynaklı dili görünür kılmak,
- yüksek riskli küçük grubu incelemek,
- Country Sentinel kapsamını genişletmek,
- erişilebilirlik kullanıcılarını yeterince temsil etmek
olabilir. Fazla örnekleme yanlış değildir. Yanlış olan:
Fazla örneklenen grubun örneklem payını gerçek nüfus payı gibi kullanmaktır.
20. NÜFUS PAYI VE ÖRNEKLEM PAYI
Tabaka h için nüfus payı:
W_h = N_h / NÖrneklem payı:
S_h = n_h / nşeklindedir. Saf orantılı tahsiste:
S_h ≈ W_holur. Fazla örneklemede:
S_h > W_holabilir. Az örneklemede:
S_h < W_holabilir. Küresel nüfus tahmini, Sh yerine Wh değerlerini korumalıdır.
21. TEMEL TASARIM AĞIRLIĞI
Basit tabakalı seçimde tabaka h içindeki her gözlemin temel ağırlığı:
d_i = N_h / n_holarak düşünülebilir. Normalize edilmiş tabaka ağırlığı:
a_h = W_h / S_hşeklinde yazılabilir. Gözlem düzeyindeki normalize ağırlık:
w_i = W_h / n_holabilir. Toplamı bir olacak biçimde:
Σ_i w_i = 1sağlanır. Ağırlıklı ikili geçiş tahmini:
θ̂ = Σ_i w_iY_iolarak hesaplanabilir. Burada:
Yi=1: geçiş kriterini karşılayan yanıtYi=0: karşılamayan yanıtolabilir. Nihai NOMOS sistemi yalnız ikili sonuç kullanmak zorunda değildir. Aynı ağırlık mantığı çok boyutlu yanıt puanlarına da uygulanabilir.
22. FAZLA ÖRNEKLEME ÖRNEĞİ
SENTETİK ÖRNEK
B ülkesinin uygun nüfusunda:
- Dil X: yüzde 80
- Dil Y: yüzde 20
olsun. Population Panel içinde B ülkesine 250 gözlem düşmektedir. Saf tahsis:
- Dil X: 200
- Dil Y: 50
olur. Dil Y için ek 50 Language Fairness gözlemi alınsın. Toplanan gözlemler:
- Dil X: 200
- Dil Y: 100
olur. Ham örneklemde Dil Y payı:
100/300 = %33,3olmuştur. Gerçek nüfus payı yüzde 20’dir. Küresel nüfus hesabında Dil Y yüzde 33,3 ağırlık alamaz. Tabaka içi normalize ağırlıklar:
- Dil X için toplam ağırlık: yüzde 80
- Dil Y için toplam ağırlık: yüzde 20
olarak korunur. Dil Y’deki 100 gözlemin her biri, Dil X’teki tek bir gözlemden daha düşük bireysel ağırlık alır. Buna karşılık Dil Y’nin ayrı tanısal raporunda 100 gözlemin tamamı kullanılır. Bu yaklaşım: alt grup görünürlüğünü artırır, küresel nüfus tahminini bozmaz.
23. ÇOK DİLLİ KULLANICILARIN TAHSİSİ
Bir kişi birden fazla dil hücresine uygun olabilir. Ana Population Panel için tercih edilen yaklaşımlardan biri, kullanıcıya önceden tanımlanmış bir ana denetim dili atamaktır. Ana denetim dili şu alanlara göre belirlenebilir:
- Günlük AI kullanım dili
- Ana veya ev dili
- Pazar ve locale
- İstemi doğal biçimde kullanma yeterliliği
- Panel dengesi
Kullanıcı diğer dillerde de test edilecekse bu gözlemler:
- eşlenmiş çok dilli panel,
- Language Fairness Panel
olarak ayrıca etiketlenir. Aynı kişinin bütün dillerde tam nüfus ağırlığı alması yasaktır.
24. ÜLKE İÇİNDE DİL TAHSİSİ
Ülke c içinde dil grupları l için uygun nüfus: Nc,l olsun. Ülke kotası: nc ise ham dil kotası:
q_{c,l} = n_c × N_{c,l} / Σ_l N_{c,l}olarak hesaplanabilir. Ancak dil grupları örtüşüyorsa:
Σ_l N_{c,l} > N_colabilir. Bu durumda doğrudan pay kullanmak çifte sayım yaratır. Çözüm seçenekleri:
- ana denetim dili sınıflandırması,
- bölünmüş insan ağırlığı,
- çok dilli ortak model,
- ayrı eşlenmiş dil paneli
olabilir. Kullanılan yöntem kayıt altına alınmalıdır.
25. NÜFUS İÇİNDE PLAN VE ARAYÜZ TAHSİSİ
Ücretsiz ve ücretli kullanıcılar ya da web ve mobil yüzeyler ayrı davranabilir. Ancak her ülke–dil hücresini ayrıca plan ve arayüz tabakasına bölmek örneklemi aşırı parçalayabilir. Üç yaklaşım kullanılabilir.
25.1. Nüfusa Orantılı Alt Tahsis
Gerçek kullanıcı dağılımı biliniyorsa plan ve arayüz paylarına göre tahsis yapılır.
25.2. Dengeli Deneysel Tahsis
Plan veya arayüz farkını karşılaştırmak için eşit veya fazla örnekleme yapılır. Küresel tahminde gerçek kullanım paylarına geri ağırlıklandırılır.
25.3. Ayrı Ürün Yüzeyi Skorları
Ücretsiz web, ücretli web ve mobil ürünler ayrı denetim nesneleri olarak raporlanır. Birleştirilmiş sonuç ayrıca üretilebilir. Hangi yaklaşımın kullanıldığı ölçümden önce tanımlanmalıdır.
26. DAVET SAYISI İLE GEÇERLİ GÖZLEM HEDEFİ
Bir tabakanın geçerli gözlem hedefi nh ise tam olarak nh kişi davet etmek genellikle yeterli olmaz. Çünkü:
- bazı kişiler katılmaz,
- bazıları görevi tamamlamaz,
- bazı kayıtlar protokol dışı kalır,
bazı kanıt paketleri geçersiz olur. Tabaka için beklenen tamamlama oranı: rh ve beklenen geçerlilik oranı: vh olsun. Davet hedefi yaklaşık olarak:
m_h = ⌈n_h / (r_hv_h)⌉şeklinde hesaplanabilir. Örnek:
- Geçerli gözlem hedefi: 100
- Tamamlama oranı beklentisi: yüzde 80
- Geçerlilik oranı beklentisi: yüzde 90
m_h = ⌈100 / (0,80 × 0,90)⌉ = 139kişi davet edilebilir. Bu bir garanti değildir. Saha ilerledikçe önceden tanımlanmış yedek sistemi kullanılabilir.
27. DAVET ŞİŞİRMESİNİN SINIRI
Daha çok kişiyi davet etmek tek başına örneklem yanlılığını çözmez. Erken yanıt verenler, geç yanıt verenlerden sistematik olarak farklı olabilir. Yalnız ilk tamamlayan 1.000 kişiyi almak:
- saat dilimi,
- teknoloji ilgisi,
- bağlantı kalitesi,
- çalışma düzeni
bakımından yanlılık üretebilir. Davet ve seçim sırası:
- rastgeleleştirilmeli,
- tabaka içinde kayıtlı olmalı,
saha penceresi boyunca yönetilmelidir.
28. YEDEK KATILIMCI SİSTEMİ
Her tabaka için sonuçlar görülmeden önce sıralanmış bir yedek liste oluşturulmalıdır. Yedek katılımcı yalnız şu nedenlerle devreye girebilir:
- Davete cevap verilmemesi
- Görevin tamamlanmaması
- Teknik veya etik uygunluk sorunu
- İstem protokolünün ihlali
- Kanıt paketinin geçersiz olması
- Aynı kişinin tekrar kaydedilmesi
Yedek kullanıcı şu nedenle devreye giremez:
Önceki kullanıcının AI cevabı yanlış, olumsuz veya istenmeyen çıktı verdi.
Yanlış AI cevabı geçerli sistem sonucudur. Katılımcı değişikliği nedeni olamaz.
29. GEÇERLİLİK KARARINDA SONUÇ KÖRLÜĞÜ
Mümkün olduğu ölçüde gözlemin protokole uygun olup olmadığına karar veren kişi:
- yanıtın doğru veya yanlış puanını,
- markaya olumlu veya olumsuz olduğunu
bilmeden değerlendirme yapmalıdır. Önce:
- Capture ve protokol geçerliliği
- Sonra maddi yanıt değerlendirmesi
yapılmalıdır. Aksi hâlde olumsuz cevaplar daha kolay: “geçersiz” ilan edilebilir.
30. TABAKA İÇİNDE YEDEK SIRASI
Yedek katılımcı mümkün olduğunca aynı:
- ülke,
- dil,
- ürün yüzeyi,
- plan,
- panel koşulu
tabakasından alınmalıdır. Aynı tabakada yedek kalmadıysa önceden tanımlı eskalasyon uygulanır:
- Aynı tabaka içinde ek rastgele seçim
- Önceden tanımlanmış üst tabaka havuzu
- Tahsisin eksik bırakılması ve kapsam uyarısı
- Yeni analiz sürümü
Sonuç görüldükten sonra başka ülkeden kullanıcı getirip açığı kapatmak sessizce yapılamaz.
31. TABAKA KISA KALIYORSA NE OLUR?
Bir tabaka hedefinin altında kalabilir. Örnek:
- hedef: 100
- geçerli gözlem: 72
Doğru seçenekler:
- Saha penceresini önceden tanımlı ölçüde uzatmak
- Yedek listeyi kullanmak
- Hücreyi benzer ve önceden tanımlı üst tabakayla birleştirmek
- Sonucu geniş belirsizlikle raporlamak
- Hücre sonucunu yayımlamamak
- Küresel ağırlığı uygun yöntemle yeniden hesaplamak
Yanlış seçenek: Düşük skorlu tabakayı analizden tamamen çıkarmak.
32. SONUÇ SONRASI KOTA DEĞİŞİKLİĞİ
Aşağıdaki değişiklikler sonuç odaklı örneklem manipülasyonudur:
- Düşük skorlu ülkenin hedef kotasını azaltmak
- Yüksek skorlu dilin kotasını artırmak
- Olumsuz cevap veren kullanıcıları geçersiz saymak
- Sonuçlara göre küçük ülke havuzunu yeniden tanımlamak
- Critical hata bulunan planı kapsam dışına almak
- İstenen ortalamaya ulaşana kadar yeni kullanıcı eklemek
Her maddi kota değişikliği:
- yeni tahsis sürümü,
- gerekçe,
- tarih,
- karar sahibi,
- önceki sonucun korunması
ile yapılmalıdır.
33. ÇOK AŞAMALI ÖRNEKLEM
Bütün bireylere doğrudan erişilemediğinde çok aşamalı örneklem kullanılabilir. Örnek:
- Bölge veya ülke havuzu seçimi
- Ülke seçimi
- Panel veya yerel araştırma ortağı seçimi
- Kullanıcı seçimi
- AI ürünü veya görev ataması
Tekil kullanıcının toplam seçilme olasılığı, aşamalardaki koşullu olasılıkların çarpımıdır:
π_i = π_r × π_{c|r} × π_{f|c} × π_{i|f}Burada:
- r: bölge veya küçük ülke havuzu
- c: ülke
- f: örnekleme çerçevesi veya panel
- i: kişi
Temel tasarım ağırlığı:
d_i = 1/π_iolur. Seçim olasılıkları kaydedilemiyorsa tasarım tam olasılıklı örneklem olarak sunulamaz. [K04; K07]
34. GÖNÜLLÜ VE OLASILIKSIZ PANELDE TAHSİS
Gerçek olasılıklı dünya paneli her zaman mümkün olmayabilir. Gönüllü veya profesyonel çevrim içi panel kullanılabilir. Bu durumda ülke ve dil kotaları yine ürün-uygun nüfusa göre kurulabilir. Ancak:
- katılımcının gerçek seçilme olasılığı bilinmeyebilir,
- kendi kendine seçilim bulunabilir,
ağırlıklandırma yalnız gözlenen değişkenler üzerinden düzeltme yapabilir. Doğru statü:
Tabakalı ve nüfusa kalibre edilmiş olasılıksız kullanıcı paneli
olabilir. Şu ifade kullanılamaz: “Dünya nüfusundan tamamen rastgele seçilmiş 1.000 kişi.”
35. AĞIRLIK MİMARİSİ
Nihai gözlem ağırlığı birden fazla bileşenden oluşabilir:
w_i = d_i × a_i^{NR} × g_i^{CAL}Burada:
- di: temel tasarım ağırlığı
- aiNR: yanıtlamama ayarlaması
- giCAL: kalibrasyon katsayısı
35.1. Tasarım Ağırlığı
Katılımcının örnekleme tasarımındaki seçilme ihtimalinin tersidir.
35.2. Yanıtlamama Ayarlaması
Benzer özellikteki seçilmiş kişilerin:
- kaçının yanıt verdiği,
- kaçının geçerli gözlem ürettiği
dikkate alınabilir. Örnek yanıt sınıfı r için:
a_r^{NR} = (Σ_{j∈S_r} d_j) / (Σ_{i∈R_r} d_i)Burada:
- Sr: seçilmiş uygun örnek
- Rr: yanıt veren veya geçerli gözlem üretenler
olabilir. Yanıtlamama ayarı: gözlenmeyen yanlılığı tamamen çözmez, varsayımlarıyla birlikte açıklanmalıdır.
35.3. Kalibrasyon Ağırlığı
Örneklem, bilinen nüfus toplamlarına:
- ülke,
- dil,
- yaş,
- plan,
- arayüz
bakımından kalibre edilebilir. Kalibrasyon yalnız güvenilir dış toplamlar varsa yapılmalıdır.
36. AĞIRLIK NORMALİZASYONU
Ağırlıklar:
- toplam nüfusa,
- toplam örneklem sayısına,
- bire
normalize edilebilir. Skor formülünde hangi normalizasyonun kullanıldığı açıklanmalıdır. Bire normalize edilmiş ağırlıklar:
w̃_i = w_i / Σ_j w_jolur. Ağırlıklı tahmin:
θ̂ = Σ_i w̃_iY_işeklinde hesaplanır.
37. AĞIRLIK KIRPMA
Bazı katılımcılar çok küçük ve az örneklenen grupları temsil ettiği için çok yüksek ağırlık alabilir. Bu durum:
- tahmin varyansını,
- tek gözlemin etkisini,
- skor oynaklığını
artırabilir. Ağırlıklar üst sınırla kırpılabilir. Fakat kırpma: nüfus temsilinde yanlılık yaratabilir, küçük grupları yeniden görünmezleştirebilir. Bu nedenle ağırlık kırpma:
- sonuçlardan önce tanımlanmalı,
- kırpılmamış sonuçla birlikte gösterilmeli,
duyarlılık analizi taşımalıdır.
38. ETKİN ÖRNEKLEM BÜYÜKLÜĞÜ
Ham gözlem sayısı: n olsa da ağırlıklar çok değişkense gerçek bilgi miktarı daha düşük olabilir. Kish etkin örneklem büyüklüğü:
n_eff = (Σ_i w_i)^2 / Σ_i w_i^2 [K08]olarak gösterilebilir. Eşit ağırlıklarda:
neff≈nolur. Ağırlıklar çok dengesizse: neff<n olur. Bir GEO-1000 çalışması:
- 1.000 geçerli gözlem,
- 620 etkin örneklem büyüklüğü
taşıyabilir. Kamuya yalnız: “1.000 kişi ölçüldü.” demek hassasiyeti olduğundan güçlü gösterebilir. Ana raporda en azından:
- ham geçerli gözlem sayısı,
- etkin örneklem büyüklüğü,
- ağırlık değişkenliği
bulunmalıdır.
39. AĞIRLIK TASARIM ETKİSİ
Ağırlıklardan kaynaklanan yaklaşık tasarım etkisi:
DEFF_w ≈ 1 + CV(w)^2ile gösterilebilir. Burada:
CV(w) = sd(w) / mean(w)ağırlıkların değişim katsayısıdır. Bu yalnız ağırlık etkisinin yaklaşık gösterimidir. Toplam tasarım etkisi ayrıca:
- kümelenme,
- tabakalama,
- tekrar ölçümü,
- eşlenmiş kullanıcılar
nedeniyle değişebilir.
40. KÜMELENME
Aynı:
- araştırma panelinden,
- ülkeden,
- dil topluluğundan,
- cihaz veya kurumdan,
- kullanıcıdan
gelen gözlemler birbirine benzeyebilir. Bu durumda 1.000 gözlem 1.000 tamamen bağımsız bilgi birimi değildir. Kümelenme:
- örneklem tasarımında,
- varyans hesabında,
- etkin örneklem büyüklüğünde
dikkate alınmalıdır.
41. AYNI KULLANICININ BİRDEN FAZLA AI ÜRÜNÜNÜ TEST ETMESİ
Bir kullanıcının birden fazla AI ürününü test etmesi modeller arası farkın aynı kişi üzerinde ölçülmesini sağlar. Avantajı: kullanıcı özellikleri kontrol edilebilir, eşlenmiş karşılaştırma güçlenebilir. Sınırlaması:
- ürün gözlemleri bağımsız değildir,
- görev sırası diğer cevapları etkileyebilir,
- kullanıcı ilk sistemden gördüğü cevabı sonraki sisteme taşıyabilir,
bütün ürünlere erişebilen kullanıcılar nüfustan farklı olabilir. Bu nedenle ürünler:
- rastgele sırayla atanmalı,
- önceki cevap paylaşımı engellenmeli,
- eşlenmiş tasarım kaydedilmeli,
analiz bağımlılığı korumalıdır. Her AI ürünü yine kendi 1.000 geçerli ürün-gözlemi hedefine sahip olmalıdır. Aynı 1.000 insan on ürünü test ederse:
- 1.000 benzersiz insan,
- 10.000 ürün-gözlemi
oluşabilir. Bu iki sayı aynı şey değildir.
42. DENGELİ EKSİK BLOK TASARIMI
Bütün kullanıcıların bütün AI ürünlerine erişmesi gerekmez. Örneğin on AI ürünü varsa her katılımcıya üç ürün atanabilir. Atamalar dengeli yapılırsa:
- her ürün 1.000 gözleme,
- her ürün çifti yeterli ortak kullanıcıya,
- daha geniş nüfus katılımına
ulaşabilir. Bu yaklaşıma aday olarak:
Dengeli eksik blok tasarımı
kullanılabilir. Avantajları:
- katılımcı yükünü azaltır,
- yalnız yoğun AI kullanıcılarını seçme riskini düşürür,
modeller arası eşlenmiş karşılaştırma sağlar. Kesin tasarım Bölüm 8 ve Bölüm 9’da ayrıntılandırılacaktır.
43. NATIVE REACH TAHSİSİ
Her AI ürünü kendi Native Reach nüfusuna göre ayrı tahsis alır. Bu nedenle aynı ülke:
- bir ürün için 200,
- başka ürün için 0,
- üçüncü ürün için 50
gözlem alabilir. Bu farklılık adaletsizlik değildir. Ürünlerin gerçek erişim evrenlerinin farklı olmasıdır. Native Reach skorları farklı nüfuslara ait olduğundan doğrudan sıralama için tek başına kullanılmamalıdır.
44. COMMON SUPPORT TAHSİSİ
Ürünler arası karşılaştırma için ortak erişim evreni oluşturulur. Ortak nüfus:
U_CS = ⋂_{a∈A} U_aşeklinde düşünülebilir. Her ürün aynı Common Support nüfus ağırlıklarıyla ölçülür. Bu yaklaşım:
- adil ürün karşılaştırması,
- aynı ülke ve dil tabanı
sağlar. Fakat ürünlerin doğal küresel erişim farkını göstermez. Bu nedenle Native Reach ve Common Support sonuçları birlikte raporlanmalıdır.
45. ÖRNEKLEMİN DALGALAR ARASINDA YÖNETİMİ
Birden fazla ölçüm dalgasında iki farklı hedef bulunabilir.
45.1. Güncel Kesit Sonucu
Her dalgada güncel ürün-uygun nüfus çerçevesi kullanılır. Bu skor: “Şu anda gerçek küresel erişim evreninde ne oluyor?” sorusuna cevap verir.
45.2. Sabit Çerçeveli Eğilim Sonucu
Başlangıç dalgasındaki nüfus ağırlıkları korunur. Bu skor: “Aynı referans nüfusta temsil zaman içinde nasıl değişti?” sorusuna cevap verir.
45.3. İki Sonucun Ayrılması
Ürün yeni ülkelere açıldığında güncel skor düşebilir. Bu düşüş:
- ürünün kötüleşmesinden,
- yeni ve zor nüfusların kapsama girmesinden
kaynaklanabilir. Sabit çerçeveli trend aynı anda iyileşme gösterebilir. Bu nedenle:
- Güncel-Frame Snapshot
- Fixed-Frame Trend
ayrı sonuçlardır.
46. PANEL YENİLEME VE DÖNÜŞÜM
Dalgalar arasında:
- aynı kullanıcılar,
- tamamen yeni kullanıcılar,
- kısmen yenilenen panel
kullanılabilir.
46.1. Tam Kesitsel Panel
Her dalgada yeni kullanıcılar seçilir. Nüfus tahmini için güçlü olabilir. Bireysel değişimi ölçmez.
46.2. Boylamsal Panel
Aynı kullanıcılar tekrar ölçülür. Bireysel kullanıcı ve ürün değişimini gösterir. Panel yıpranması ve öğrenme etkisi oluşturabilir.
46.3. Dönen Panel
Katılımcıların bir bölümü korunur, bir bölümü yenilenir. Hem trend hem taze nüfus temsili sağlar. Kullanılan panel yapısı sonuç kartında görünür olmalıdır.
47. ÖRNEKLEM KİLİDİ
Her dalga başlamadan önce aşağıdaki kayıtlar kilitlenmelidir:
- AI ürünü
- Kullanıcı yüzeyi
- Hedef nüfus sürümü
- Native Reach ülkeleri
- Common Support ülkeleri
- Tabakalar
- Küçük ülke havuzları
- Ham kotalar
- Tam sayı tahsisleri
- Dil tahsisleri
- Fazla örnekleme planı
- Davet hedefleri
- Yedek listeleri
- Seçim yöntemi
- Ağırlık formülü
- Sonuç körlüğü kuralı
- Kısa kalma eskalasyonu
- Analiz planı
- Bağ bozma yöntemi
- Rastgelelik tohumu, kullanılıyorsa
- Sorumlu insan onayı
Bu dosyaya:
NOMOS Sample Allocation Lock
adı verilebilir.
48. ÖRNEKLEM KİLİDİNDEN SONRA İZİN VERİLEN DEĞİŞİKLİKLER
Aşağıdaki olaylar yeni sürüm gerektirebilir:
- Ürünün ülkede erişiminin sona ermesi
- Ciddi saha güvenliği sorunu
- Nüfus verisinde maddi hata bulunması
- Panel sağlayıcının belirli ülkeyi teslim edememesi
- Araştırma etik şartının değişmesi
- Ölçüm aracında kritik hata
Değişiklik:
- gerekçeli,
- tarihli,
- onaylı,
- eski sürüm korunarak
yapılmalıdır. Sonuçların güçlü veya zayıf olması değişiklik gerekçesi değildir.
49. ÖRNEKLEM KALİTE STATÜLERİ
Bir örneklem dalgası şu statülerden birini taşıyabilir:
SQ-0 — NOT DESIGNED
Belgelenmiş örneklem tasarımı yoktur.
SQ-1 — CONVENIENCE OBSERVATION
Kolaylık veya gönüllü gözlem vardır. Nüfus genellemesi yapılamaz.
SQ-2 — QUOTA-CONTROLLED
Ülke ve dil kotaları vardır. Seçilme olasılıkları tam bilinmez.
SQ-3 — WEIGHTED PANEL
Tabakalı panel ve nüfus kalibrasyonu vardır. Kapsama ve kendi kendine seçilim sınırlamaları devam eder.
SQ-4 — PROBABILITY-BASED OR HYBRID
Bilinen seçim olasılıkları veya güçlü hibrit tasarım bulunmaktadır.
SQ-5 — REPLICATED AND CALIBRATED
Tasarım farklı dalga ve dış uygulamalarda tekrar edilmiş; yanlılık ve varyans davranışı kalibre edilmiştir. Bu statüler kamuya açık skorun güven sınıfını etkileyebilir.
50. SENTETİK UÇTAN UCA GEO-1000 TAHSİSİ
SENTETİK METODOLOJİ GÖSTERİMİ / Aşağıdaki ülkeler, nüfuslar, diller, AI ürünü ve hesaplamalar tamamen kurgusaldır. Sentetik Orion AI ürünü için Native Reach uygun nüfusu 1 milyar kişi olsun. Ana Population Panel hedefi:
n=1.00050.1. Ülke ve Küçük Ülke Havuzu Tahsisi
| Tabaka | Uygun nüfus | Nüfus payı | Ana kota |
|---|---|---|---|
| A | 400.000.000 | %40 | 400 |
| B | 250.000.000 | %25 | 250 |
| C | 150.000.000 | %15 | 150 |
| D | 100.000.000 | %10 | 100 |
| E | 60.000.000 | %6 | 60 |
| F | 30.000.000 | %3 | 30 |
| G | 8.000.000 | %0,8 | 8 |
| Küçük ülke havuzu | 2.000.000 | %0,2 | 2 |
| Toplam | 1.000.000.000 | %100 | 1.000 |
50.2. B Ülkesinde Dil Tahsisi
B ülkesindeki uygun nüfus:
- Dil X: yüzde 80
- Dil Y: yüzde 20
Population Panel tahsisi:
- Dil X: 200
- Dil Y: 50
Language Fairness ek tahsisi: Dil Y: 50 B ülkesindeki saha hedefi:
- Dil X: 200
- Dil Y: 100
- Toplam: 300
Fakat küresel Population Panel nüfus ağırlıkları:
- Dil X: B ülkesinin yüzde 80’i
- Dil Y: B ülkesinin yüzde 20’si
olarak kalır.
50.3. Country Sentinel Eki
Küçük ülke havuzundaki H, I ve J için Population Panel’de iki olasılıklı gözlem bulunmaktadır. Country Sentinel Panel ayrıca:
H: 1
I: 1
J: 1
gözlem hedefleyebilir. Bu üç gözlem:
- coğrafi kapsamı artırır,
- tekil ülke olaylarını gösterir,
ülke skoru oluşturmaz.
50.4. Accessibility Eki
Ana panelin erişilebilirlik kullanıcılarını yetersiz kapsadığı tespit edilirse 40 ek gözlem alınabilir. Bu kullanıcılar: ilgili nüfus gruplarına göre kalibre edilir, ayrı Accessibility Panel sonucu üretir.
50.5. Toplam Saha Hacmi
| Panel | Geçerli hedef |
|---|---|
| Population Panel | 1.000 |
| Language Fairness eki | 50 |
| Country Sentinel eki | 3 |
| Accessibility eki | 40 |
| Toplam geçerli saha hedefi | 1.093 |
GEO-1000 adı yine geçerlidir. Çünkü:
1.000, ana nüfus panelinin geçerli gözlem hedefidir.
Tamamlayıcı adalet ve kapsam panelleri buna eklenebilir.
50.6. Davet Hacmi
Population Panel’de ortalama:
- tamamlama: yüzde 82
- geçerlilik: yüzde 92
beklensin. Gerekli davet:
⌈1.000 / (0,82 × 0,92)⌉ = 1.326olabilir. Tamamlayıcı panellerle toplam davet 1.500’ü aşabilir. Bu nedenle:
GEO-1000, yalnız 1.000 kişiye davet gönderme yöntemi değildir.
50.7. Saha Sonucu
Population Panel’de:
- 1.326 kişi davet edilmiş,
- 1.080 görev tamamlanmış,
- 1.012 kayıt protokol bakımından geçerli bulunmuş,
- ilk 1.000 önceden tanımlanmış rastgele/yedek sırasına göre ana analize alınmış
olsun. Kalan 12 geçerli kayıt:
- yedek doğrulama,
- duyarlılık analizi,
- tekrar kontrolü
için saklanabilir. Sonuçlara bakılarak hangi 1.000’in seçileceğine karar verilemez.
51. NORMATİF TAHSİS ALGORİTMASI
Bir GEO-1000 ana paneli için varsayılan işlem sırası şöyledir:
Adım 1 — Ürün ve Dalga Kimliğini Kilitle
Hangi AI ürünü, yüzey ve tarihin ölçüldüğü belirlenir.
Adım 2 — Hedef Nüfus Sürümünü Kilitle
Bölüm 5’teki ürün-uygun nüfus çerçevesi kullanılır.
Adım 3 — Ana Geçerli Gözlem Hedefini Belirle
Varsayılan aday hedef:
n=1.000Adım 4 — Maddi Tabakaları Belirle
Ülke, dil ve gerekliyse plan/arayüz tabakaları tanımlanır.
Adım 5 — Küçük Ülke Havuzlarını Kur
Sıfıra yakın tahsis üretecek ülkeler uygun havuzlara alınır.
Adım 6 — Ham Orantılı Kotaları Hesapla
qh=nWhAdım 7 — Tam Sayı Tahsisini Yap
En Büyük Kalan veya önceden ilan edilmiş eşdeğer yöntem uygulanır.
Adım 8 — Fazla Örnekleme Planını Ekle
Country Sentinel, Language Fairness ve Accessibility ekleri ayrı kaydedilir.
Adım 9 — Davet ve Yedek Sayılarını Hesapla
Beklenen tamamlama ve geçerlilik oranları kullanılır.
Adım 10 — Seçim Sırasını Rastgeleleştir
Ana ve yedek listeler dondurulur.
Adım 11 — Ağırlık Formülünü Kaydet
Tasarım, yanıtlamama ve kalibrasyon ağırlıkları tanımlanır.
Adım 12 — Örneklem Kilidini Onayla
AI yanıtları görülmeden önce sürüm ve bütünlük kaydı oluşturulur.
52. ZORUNLU NORMATİF HÜKÜMLER
CH06-N01
GEO-1000 örneklem tahsisi AI yanıtları görülmeden önce oluşturulmalı ve sürümlenmelidir.
CH06-N02
Ana Population Panel hedefi, AI ürünü ve ana ölçüm dalgası başına en az 1.000 geçerli gözlem olarak tanımlanmalıdır; farklı bir hedef kullanılıyorsa gerekçesi açıklanmalıdır.
CH06-N03
Davet edilen kişi, görevi tamamlayan kişi ve geçerli gözlem sayıları birbirinden ayrılmalıdır.
CH06-N04
Ana tahsis, Bölüm 5’te tanımlanan ürün-uygun insan nüfusuna dayanmalıdır.
CH06-N05
Ülke veya dil kotaları toplam nüfusa değil ilgili ürün-uygun nüfus payına göre hesaplanmalıdır.
CH06-N06
Ham küsuratlı kotaların tam sayıya dönüştürülme yöntemi önceden tanımlanmalıdır.
CH06-N07
Yuvarlama bağlarının çözümü sonuçlardan bağımsız olmalıdır.
CH06-N08
Pozitif hedef nüfusu bulunan küçük ülkeler, ayrı sıfır olasılıklı deterministik tabakalar olarak bırakılmamalı; uygun havuz veya olasılıklı seçim yöntemi kullanılmalıdır.
CH06-N09
Küçük ülke havuzları ürün erişimi ve maddi nüfus özellikleri bakımından gerekçelendirilmelidir.
CH06-N10
Country Sentinel gözlemleri ana nüfus ağırlığını değiştirmeden ayrıca kaydedilmelidir.
CH06-N11
Bir Sentinel gözlemi ülke skoru olarak sunulamaz.
CH06-N12
Fazla örneklenen ülke, dil veya kullanıcı grupları küresel tahminde gerçek hedef nüfus ağırlıklarına geri döndürülmelidir.
CH06-N13
Örneklem payı nüfus payı gibi kullanılamaz.
CH06-N14
Aynı kişi birden fazla dil, hesap, oturum veya ürün nedeniyle küresel insan nüfusunda çoğaltılamaz.
CH06-N15
Geçerli olmayan gözlemler, geçersizlik nedeni sonuç içeriğine dayanmadan sınıflandırılmalıdır.
CH06-N16
Yanlış, olumsuz, ret veya Critical AI yanıtı katılımcı değiştirme gerekçesi olamaz.
CH06-N17
Yedek katılımcı listeleri sonuçlar görülmeden önce tabaka içinde oluşturulmalıdır.
CH06-N18
Tabaka açığı başka ülke veya dilden sessizce kapatılamaz.
CH06-N19
Sonuç sonrası kota, tabaka, küçük ülke havuzu veya ağırlık değişikliği yeni analiz sürümü gerektirir.
CH06-N20
Ağırlıkların bütün bileşenleri ve normalize edilme yöntemi yayımlanmalıdır.
CH06-N21
Yanıtlamama ayarlamasının varsayımları açıklanmalıdır.
CH06-N22
Ağırlık kırpma kullanılıyorsa kırpılmamış sonuç ve duyarlılık analizi korunmalıdır.
CH06-N23
Ana rapor ham gözlem sayısının yanında uygun etkin örneklem büyüklüğünü göstermelidir.
CH06-N24
Kümelenme, tekrar ve eşlenmiş kullanıcı bağımlılıkları varyans hesabında dikkate alınmalıdır.
CH06-N25
Aynı kişinin birden fazla AI ürününü test ettiği tasarım, tamamen bağımsız kullanıcı örneklemi gibi sunulamaz.
CH06-N26
Her AI ürünü kendi 1.000 geçerli ürün-gözlemi hedefine ayrı ulaşmalıdır.
CH06-N27
Native Reach ve Common Support tahsisleri ayrı örneklem kayıtları taşımalıdır.
CH06-N28
Dalgalar arasında güncel ve sabit çerçeveli sonuçlar açıklamasız biçimde birleştirilemez.
CH06-N29
Bir alt grup için örneklem yetersizse doğru statü INSUFFICIENT SAMPLE, EXPLORATORY veya NOT ESTIMATED olmalıdır.
CH06-N30
Ham örneklem büyüklüğü, ağırlık ve tasarım etkisi yok sayılarak kesin hassasiyet göstergesi olarak kullanılamaz.
CH06-N31
Gönüllü veya olasılıksız panelde seçim olasılıkları biliniyormuş gibi tasarım ağırlığı iddia edilemez.
CH06-N32
Örneklem, düşük skorlu grupları dışlamak veya yüksek skorlu grupları büyütmek amacıyla sonuç sonrası değiştirilemez.
CH06-N33
Ana Population Panel ile tamamlayıcı panellerin gözlemleri amaç ve ağırlık bakımından ayrı etiketlenmelidir.
CH06-N34
Örneklem kilidinin hesap verebilir insan veya kurum sahibi bulunmalıdır.
53. BAŞARISIZLIK BİÇİMLERİ
CH06-F01 — SONUÇTAN SONRA KOTA KURMAK
Ülke ve dil sayıları AI cevapları görüldükten sonra belirlenir.
CH06-F02 — EN İYİ CEVABA KADAR YEDEK KULLANMAK
Olumsuz yanıtlar geçerli olduğu hâlde yeni kullanıcıyla değiştirilir.
CH06-F03 — 1.000 DAVETİ 1.000 GEÇERLİ GÖZLEM SAYMAK
Tamamlamama ve geçersizlik gizlenir.
CH06-F04 — SAF YUVARLAMA İLE ÜLKEYİ SIFIRLAMAK
Pozitif hedef nüfusu bulunan ülkenin seçilme ihtimali sıfır bırakılır.
CH06-F05 — HER ÜLKEYE BİR KİŞİ VERİP NÜFUS ORANTISI DEMEK
Asgari kota nedeniyle oluşan orantısızlık saklanır.
CH06-F06 — SENTINEL GÖZLEMİNİ NÜFUS GÖZLEMİ SAYMAK
Küçük ülke ek gözlemi 1.000 kişilik ana panelde tam ağırlık alır.
CH06-F07 — KÜÇÜK ÜLKE HAVUZUNU SONUCA GÖRE KURMAK
Düşük skor üreten ülke başka havuza taşınır veya kapsamdan çıkarılır.
CH06-F08 — UYUŞMAZ ÜLKELERİ AYNI HAVUZA ATMAK
Ürün erişimi, dil veya yargı bakımından farklı ülkeler yalnız küçük oldukları için birleştirilir.
CH06-F09 — FAZLA ÖRNEKLEMEYİ FAZLA AĞIRLIKLANDIRMAK
Dil veya ülke nüfus payından daha yüksek örneklem payıyla küresel sonucu belirler.
CH06-F10 — ÇOK DİLLİ KİŞİLERİ ÇOĞALTMAK
Bir insan her dil hücresinde ayrı nüfus birimi sayılır.
CH06-F11 — ÖRNEKLEM PAYINI NÜFUS PAYI SAYMAK
Ham yanıt sayıları doğrudan küresel skora dönüştürülür.
CH06-F12 — DAVET SIRASINI KOLAYLIK SIRASIYLA KURMAK
İlk cevap veren hızlı kullanıcılar paneli belirler.
CH06-F13 — TABAKA DIŞI YEDEK KULLANMAK
Eksik ülke veya dil gözlemi başka gruptan katılımcıyla sessizce tamamlanır.
CH06-F14 — GEÇERSİZLİĞİ CEVAP İÇERİĞİNE BAĞLAMAK
Yanlış AI cevabı teknik olarak geçersiz ilan edilir.
CH06-F15 — RETLERİ YENİ KULLANICIYLA DEĞİŞTİRMEK
Sistem reddi gerçek kullanıcı sonucu olduğu hâlde paydadan çıkarılır.
CH06-F16 — AĞIRLIK FORMÜLÜNÜ GİZLEMEK
Kamu skoru hangi nüfus ve örneklem ağırlıklarıyla üretildiğini göstermez.
CH06-F17 — AĞIRLIK KIRPARAK KÜÇÜK GRUBU SİLMEK
Yüksek ağırlıklı küçük gruplar sonuç hoş görünmediği için kırpılır.
CH06-F18 — ETKİN ÖRNEKLEMİ GİZLEMEK
1.000 ham kayıt, ağırlıklar nedeniyle 500–600 bilgi birimine düşse bile “1.000 kişilik hassasiyet” olarak sunulur.
CH06-F19 — KÜMELENMEYİ BAĞIMSIZLIK SAYMAK
Aynı panel, kurum veya kullanıcıdan gelen gözlemler tamamen bağımsız kabul edilir.
CH06-F20 — AYNI 1.000 KİŞİYİ ON BİN BAĞIMSIZ İNSAN SAYMAK
On AI ürünü gözlemi, on kat nüfus genişliği gibi anlatılır.
CH06-F21 — COMMON SUPPORT’U NATIVE REACH SAYMAK
Ortak karşılaştırma örneklemi ürünün gerçek küresel erişim nüfusu gibi sunulur.
CH06-F22 — NATIVE REACH SONUÇLARINI DOĞRUDAN SIRALAMAK
Farklı hedef nüfuslardaki ürün skorları aynı evrenmiş gibi karşılaştırılır.
CH06-F23 — DALGALARDA NÜFUS DEĞİŞİMİNİ GİZLEMEK
Yeni ülkeler veya kullanıcı grupları skora girdiği hâlde trend yalnız ürün kalitesi değişimi gibi yorumlanır.
CH06-F24 — ALT GRUP İÇİN YETERSİZ ÖRNEKTEN KESİN SKOR ÜRETMEK
Birkaç düzine gözlem ülke veya dil için kesin puan olarak yayımlanır.
CH06-F25 — ÖRNEKLEM KİLİDİNİ SESSİZCE DEĞİŞTİRMEK
Kota, ağırlık veya havuz tanımı sürüm kaydı olmadan güncellenir.
CH06-F26 — UYGUNLUK ORANLARINI KÖR BİÇİMDE ÇARPMAK
Uygun nüfus ve kota hesapları bağımlı nüfus özelliklerini yok sayar.
CH06-F27 — TAMAMLAYICI PANELİ ANA PANELİN YERİNE KOYMAK
Dil adaleti veya gözcü gözlemleri 1.000 ana nüfus hedefini küçültmek için kullanılır.
CH06-F28 — PANEL KISA KALDIĞINDA DÜŞÜK SKORLU HÜCREYİ SİLMEK
Eksik örneklem, sonuç bakımından elverişsiz olduğu için kapsam dışı bırakılır.
CH06-F29 — AĞIRLIKLANDIRMAYI BİLİMSEL SÜS OLARAK KULLANMAK
Seçim ve kapsam yanlılığı açıklanmadan yalnız ağırlık eklenerek temsil sorunu çözüldüğü iddia edilir.
CH06-F30 — GEO-1000’İ TAM OLARAK 1.000 KİŞİYE SORMAK SANMAK
Davet, tamamlayıcı paneller, geçersizlik, tekrar ve etkin örneklem yapısı yok sayılır.
54. DENETİM PROSEDÜRÜ
Adım 1 — Örneklem Amacını Kaydet
Küresel nüfus tahmini Alt grup tanısı Ülke kapsamı Dil adaleti Erişilebilirlik Ürün karşılaştırması amaçları ayrılır.
Adım 2 — Hedef Nüfus Sürümünü Doğrula
Bölüm 5’teki nüfus dosyası ve tarih kaydı incelenir.
Adım 3 — Ana Geçerli Gözlem Hedefini Belirle
Varsayılan GEO-1000 hedefi veya gerekçeli alternatif yazılır.
Adım 4 — Tabakaları Kur
Ülke, dil ve maddi kullanıcı yüzeyi ayrımları belirlenir.
Adım 5 — Küçük Ülke Havuzlarını Tanımla
Her havuzun:
- ülkeleri,
- nüfusu,
- benzerlik gerekçesi,
- iç seçim yöntemi
kaydedilir.
Adım 6 — Ham Kotaları Hesapla
qh=nWhformülü veya gerekçeli alternatif kullanılır.
Adım 7 — Tam Sayı Tahsisini Uygula
Yuvarlama ve bağ bozma kuralı kaydedilir.
Adım 8 — Tamamlayıcı Fazla Örneklemeyi Ekle
Country Sentinel, Language Fairness ve Accessibility hedefleri ayrı tanımlanır.
Adım 9 — Davet ve Yedek Hacmini Hesapla
Tamamlama ve geçerlilik beklentileri kullanılır.
Adım 10 — Seçim ve Yedek Sırasını Dondur
Katılımcılar sonuç görülmeden önce seçilir veya sıralanır.
Adım 11 — Tasarım Ağırlıklarını Hesapla
Seçilme olasılıkları ve tabaka ağırlıkları kaydedilir.
Adım 12 — Kısa Kalma ve Yanıtlamama Prosedürünü Tanımla
Tabaka açığına verilecek önceden ilan edilmiş cevap yazılır.
Adım 13 — Örneklem Kilidini Oluştur
Belge kimliği, sürüm, tarih ve bütünlük kaydı eklenir.
Adım 14 — Saha Sonrası Geçerlilik Akışını İncele
Geçerlilik kararlarının yanıt doğruluğundan bağımsız verildiği doğrulanır.
Adım 15 — Nihai Ağırlıkları Üret
Tasarım, yanıtlamama ve kalibrasyon bileşenleri ayrılır.
Adım 16 — Etkin Örneklem Büyüklüğünü Hesapla
Ham sayı ile bilgi hacmi farkı raporlanır.
Adım 17 — Tahsis ve Gerçekleşmeyi Karşılaştır
Planlanan ve gerçekleşen gözlem sayıları hücre bazında gösterilir.
Adım 18 — Sonuç Sonrası Değişiklikleri Denetle
Kota, havuz, ağırlık ve kapsam değişiklikleri aranır.
55. GEREKLİ KANIT
AI ürün kimliği Ölçüm dalgası Hedef nüfus sürümü Population Panel hedefi Country Sentinel hedefi Language Fairness hedefi Accessibility Panel hedefi Tabaka listesi Tabaka nüfusları Nüfus ağırlıkları Ham kotalar Yuvarlama yöntemi Kesir ve kalan kayıtları Bağ bozma kuralı Küçük ülke havuzları Havuz içi seçim olasılıkları Ülke ve dil tahsisleri Plan ve arayüz tahsisleri Fazla örnekleme gerekçeleri Davet hedefleri Tamamlama varsayımları Geçerlilik varsayımları Ana ve yedek katılımcı listeleri Seçim veya rastgelelik kaydı Yanıtlamama kayıtları Geçersiz gözlem nedenleri Geçerlilik karar tarihleri Tasarım ağırlıkları Yanıtlamama ayarları Kalibrasyon katsayıları Ağırlık kırpma politikası Ham ve etkin örneklem büyüklüğü Kümelenme ve eşlenmiş kullanıcı kayıtları Native Reach tahsisi Common Support tahsisi
Sabit ve güncel çerçeve ağırlıkları Planlanan ve gerçekleşen tahsis karşılaştırması Örneklem kilidi Değişiklik günlüğü Sorumlu insan veya kurum
56. DENETİM KONTROL LİSTESİ
Ana geçerli gözlem hedefi açık mı? Hedef 1.000 davet mi, geçerli gözlem mi? Örneklem AI yanıtları görülmeden önce donduruldu mu? Hangi nüfus çerçevesi kullanıldı? Tabakalar hangi gerekçeyle kuruldu? Ham ülke ve dil kotaları gösteriliyor mu? Küsuratların tam sayıya dönüşüm yöntemi açık mı? Bağ bozma kuralı önceden belirlenmiş mi? Küçük ülkelerin seçilme olasılığı sıfır mı? Küçük ülke havuzları mantıksal olarak uyumlu mu? Sentinel gözlemleri ana nüfus ağırlığına karışmış mı? Bir Sentinel gözleminden ülke skoru üretilmiş mi? Dil ve erişilebilirlik grupları fazla örneklendiyse geri ağırlıklandırıldı mı? Aynı kişi birden fazla nüfus birimi olarak sayılmış mı? Davet, tamamlayan ve geçerli gözlem sayıları ayrı mı?
Yedek listeleri önceden oluşturulmuş mu? Yanlış veya olumsuz AI cevabı nedeniyle katılımcı değiştirilmiş mi? Geçerlilik kararı maddi doğruluk puanından önce mi verilmiş? Tabaka açığı başka ülkeden sessizce kapatılmış mı? Sonuç sonrası kota veya havuz değişmiş mi? Tasarım ağırlıkları yeniden üretilebilir mi? Yanıtlamama ayarının varsayımları açık mı? Ağırlık kırpma yapıldı mı ve etkisi gösterildi mi? Ham ve etkin örneklem büyüklüğü birlikte veriliyor mu? Aynı kullanıcı birden fazla AI ürününü test etmiş mi? Bu bağımlılık analizde korunmuş mu? Her AI ürünü ayrı 1.000 ürün-gözlemine ulaştı mı? Native Reach ve Common Support örneklemleri ayrıldı mı? Dalgalar arasında nüfus çerçevesi değişti mi?
Sabit ve güncel çerçeveli trendler ayrıldı mı? Yetersiz alt grup örnekleri kesin skor gibi yayımlanmış mı? Örneklem kalite statüsü doğru mu? Tamamlayıcı paneller ana panelin yerini almış mı? Örneklem kaydının hesap verebilir sahibi belli mi?
57. İTİRAZLAR VE CEVAPLAR
İtiraz 1 — “Neden her ülkeye doğrudan nüfus oranında kişi vermiyoruz?”
Büyük ve orta nüfuslu ülkelerde bu güçlü varsayılandır. Çok küçük ülkelerde ham kota bir kişinin altına düşebilir. Bu durumda:
- küçük ülke havuzu,
- olasılıklı ülke seçimi,
- ayrı Sentinel paneli
daha doğru olabilir.
İtiraz 2 — “Her ülkeye en az bir kişi vermek daha adil değil mi?”
Coğrafi kapsam açısından yararlı olabilir. Nüfus tahmini açısından orantısızdır. Doğru çözüm, bu bir kişiyi Sentinel gözlemi olarak ayrıca etiketlemektir.
İtiraz 3 — “Bir ülkenin ana panelde sıfır kişi alması onu tamamen dışlamaz mı?”
Ülke ayrı deterministik tabaka olarak sıfır kota alıyorsa sorun olabilir. Küçük ülke havuzunda pozitif seçim olasılığı verilebilir. Ayrıca Sentinel Panel ülkenin gözlemsel görünürlüğünü koruyabilir.
İtiraz 4 — “Küçük ülkeleri havuzlamak kültürel farkları silmez mi?”
Ülke skoru üretmek amacıyla kullanılırsa silebilir. Ana küresel tahmin için havuz, seçim olasılığını yönetir. Ülke kimliği gözlem kaydında korunur. Ayrı Sentinel ve ülke özel örneklem yapılabilir.
İtiraz 5 — “Neden 1.000’in içine Sentinel kullanıcılarını koymuyoruz?”
Koyulabilir. Fakat o zaman 1.000 kişilik örneklem saf nüfus orantılı olmaktan çıkar. Ağırlıklandırma gerekir ve ana tahminin etkin örneklem büyüklüğü düşebilir. Kurucu mimaride 1.000 gözlem Population Panel’e ayrılır; Sentinel gözlemleri buna eklenir.
İtiraz 6 — “Toplam saha maliyeti çok büyümez mi?”
Büyüyebilir. Standart, maliyeti saklayarak yapay kesinlik üretmemelidir. Daha düşük bütçede:
- daha az AI ürünü,
- daha az dil,
- daha küçük pilot,
- daha geniş belirsizlik
kullanılabilir. Doğru statü açıkça yazılmalıdır.
İtiraz 7 — “GEO-1000 adı varken neden 1.093 veya daha fazla gözlem topluyoruz?”
1.000, ana nüfus panelinin geçerli gözlem hedefidir. Adalet ve kapsam panelleri ana hedefe eklenebilir. Bu, standardın adını bozmaz. Ölçümün gerçek toplam saha hacmini görünür kılar.
İtiraz 8 — “Bir dili fazla örneklemek küresel sonucu neden bozsun?”
Fazla örneklenen dil ham yanıtlarda olduğundan büyük görünür. Nüfus ağırlığına geri döndürülürse küresel sonuç bozulmaz. Ayrı dil sonucu daha hassas hâle gelir.
İtiraz 9 — “Ağırlıklar çok karmaşık; ham ortalama daha anlaşılır değil mi?”
Ham ortalama, örneklem nüfusa orantılıysa anlamlı olabilir. Fazla örnekleme, yanıtlamama veya kapsama farkı varsa ham ortalama yanlış soruya cevap verir. Karmaşıklık, örneklem tasarımından doğuyorsa saklanamaz.
İtiraz 10 — “1.000 geçerli gözlem varsa etkin örneklem neden daha düşük olsun?”
Çünkü bazı gözlemler çok yüksek, bazıları çok düşük ağırlık taşıyabilir. Aynı panel veya kullanıcıdan gelen kayıtlar birbirine benzeyebilir. Ham sayı fiziksel kayıt adedidir. Etkin örneklem istatistiksel bilgi hacmine yaklaşır.
İtiraz 11 — “Aynı kişilerin bütün AI ürünlerini test etmesi daha adil değil mi?”
Kullanıcı farkını azaltır. Fakat:
- ürün erişim evrenini daraltabilir,
- görev yükünü artırabilir,
cevaplar arası bulaşma yaratabilir. Eşlenmiş veya dengeli eksik blok tasarımıyla yönetilebilir.
İtiraz 12 — “Bir tabaka hedefe ulaşmazsa küresel skor hiç yayımlanamaz mı?”
Her durumda değil. Eksiklik:
- nüfus ağırlığı,
- risk,
- yetersizliğin nedeni,
- kalan kapsam
bakımından değerlendirilir. Skor:
- daraltılmış kapsamla,
- geniş belirsizlikle,
- INSUFFICIENT KAPSAMA uyarısıyla
yayımlanabilir. Eksiklik saklanamaz.
İtiraz 13 — “Nüfus verisi değişirse her dalgada bütün kotaları yenilemek zorunda mıyız?”
Güncel anlık skor için yenileme gerekebilir. Trend karşılaştırması için sabit başlangıç ağırlıkları da korunabilir. İki sonuç ayrı yayımlanmalıdır.
İtiraz 14 — “Olasılıklı dünya paneli kuramazsak NOMOS uygulanamaz mı?”
Uygulanabilir. Fakat örneklem kalite statüsü doğru yazılmalıdır. Nüfusa kalibre edilmiş gönüllü panel değerli olabilir. Tam olasılıklı örneklem gibi sunulamaz.
60. BÖLÜMÜN ORTAK HÜKMÜ
GEO-1000’in gücü yalnız 1.000 sayısından doğmaz. 1.000 kişinin:
- hangi nüfustan geldiğinden,
- hangi olasılıkla seçildiğinden,
- hangi ülke ve dili temsil ettiğinden,
- aynı insanın kaç kez sayıldığından,
- hangi gözlemlerin geçerli kabul edildiğinden,
- küçük ülkelerin nasıl yönetildiğinden,
- fazla örneklenen grupların nasıl ağırlıklandırıldığından,
- kaç kişinin görevi tamamlamadığından,
- sonuçlara bakılarak kimin değiştirildiğinden
doğar. Yanlış örneklemle 100.000 cevap toplanabilir. Sonuç yine yanlış nüfus hakkında konuşabilir. Doğru örneklemle daha az cevap toplanabilir. Sonuç sınırları açık biçimde daha güvenilir olabilir. Bir ülkenin nüfusu büyükse küresel insan deneyiminde büyük ağırlık taşımalıdır. Fakat ürün orada kullanılamıyorsa sahte kullanıcı yaratılamaz. Bir ülkenin nüfusu küçükse küresel ağırlığı küçük kalmalıdır. Fakat tamamen görünmez bırakılmak zorunda değildir. Bir dil küresel nüfusta küçük olabilir. Fakat o dildeki ağır yanlış ayrıca ölçülebilir. Bir kullanıcı üç dil ve beş ürün kullanabilir. Bu, on beş ayrı insan oluşturmaz. Bir AI yanıtı yanlış olabilir. Bu, katılımcının geçersiz olduğu anlamına gelmez. Yanlış cevap, ölçmeye çalıştığımız şeydir.
Onu yeni kullanıcıyla değiştirmek ölçümü temizlemez. Gerçekliği siler. Ağırlıklandırma, yanlış paneli mucizevi biçimde dünya nüfusuna dönüştürmez. Fakat doğru tasarlanmış fazla örneklemenin küresel tahmini bozmadan alt grupları görünür kılmasını sağlayabilir. Bu nedenle NOMOS’un altıncı ölçüm yasası şudur:
Örneklem, sonucu üretmek için değil; sonucu adil biçimde gözlemek için kurulmalıdır.
Yedinci yasası şudur:
Küçük ülkenin görünürlüğü nüfus ağırlığını büyütmek zorunda değildir.
Sekizinci yasası şudur:
Fazla gözlem, fazla nüfus ağırlığı anlamına gelmez.
Dokuzuncu yasası şudur:
Yanlış AI cevabı veri kusuru değildir; geçerli protokol altında gözlenmişse denetimin konusudur.
Onuncu yasası şudur:
Bin gözlemin güveni, bin sayısından değil; seçimin ve ağırlığın yeniden üretilebilirliğinden doğar.
NOMOS’un Bölüm 6 Emri
Bana yalnız “1.000 kişi sorduk” deme.
Bu 1.000 kişinin hangi milyar insan arasından, hangi olasılıkla seçildiğini göster.
Bir ülkeye yarım insan düşüyor diye onu yok sayma. / Ama bir kişi verdin diye ülkenin tamamını ölçtüğünü de söyleme.
Küçük ülkeleri uygun havuzda olasılıklı biçimde seç. / Görünürlük gerekiyorsa ayrıca gözcü paneli kur.
Düşük kaynaklı dili fazla örnekleyebilirsin. / Fakat küresel skorda onu nüfusundan büyük yapma.
Bir insanı hesapları, dilleri, oturumları ve AI ürünleri kadar çoğaltma.
Katılımcı cevap vermediğinde yedeğini kullan. / AI yanlış cevap verdiğinde kullanıcını değiştirme.
Geçerliliğe cevabın doğruluğunu görmeden karar ver.
Kotan eksik kaldığında bunu açıkla. / Başka ülkeden insan getirip boşluğu saklama.
Sonucu gördükten sonra paydayı, ağırlığı, ülke havuzunu veya örneklem hedefini değiştirme.
Ham sayını göster. / Etkin örneklemini göster. / Kimin ağır, kimin hafif ağırlık aldığını göster.
Önce nüfusu kilitle. / Sonra tabakaları kur. / Sonra kotaları hesapla. / Sonra yedekleri seç. / Sonra ağırlıkları yaz. / Ve ancak bundan sonra ilk istemi gönder.
Bölümün Son Cümlesi
GEO-1000, bin cevabı bir araya getirme yöntemi değil; hedef nüfustaki her insanın temsil hakkını, seçilme olasılığı ve doğru ağırlık altında ölçülebilir hâle getirme protokolüdür.
Normatif Öz
Her AI ürünü ve ana ölçüm dalgası için GEO-1000 Population Panel, farklı bir hedef açıkça gerekçelendirilmedikçe en az 1.000 geçerli ürün-gözlemini hedeflemelidir. Örneklem tahsisi AI yanıtları görülmeden önce tasarlanmalı, sürümlenmeli ve kilitlenmelidir. Ana tahsis toplam ülke nüfusuna, davet sayısına, hesaplara, oturumlara veya kolaylık örneklemine değil ürün-uygun hedef insan nüfusuna dayanmalıdır. Küsuratlı kotalar önceden ilan edilmiş ve sonuçtan bağımsız yöntemle tam sayıya çevrilmelidir. Pozitif nüfus kütlesi taşıyan gruplara, bütün hedef nüfus adına çıkarım yapılırken deterministik sıfır seçilme olasılığı verilemez. Fazla örneklenen gruplar ham örneklem paylarını nüfus ağırlığı olarak kullanamaz. Yanlış, olumsuz, ret veya Critical AI çıktısı katılımcı değiştirme nedeni olamaz.

