NOMOS GEO Denetim Protokolü

01 / K04 · K05 · K09

Tek Bir Yanıt GEO Skoru Değildir

Tek Bir Yanıt GEO Skoru Değildir — Bu bölüm yalnızca şu soruyu cevaplar:

Sürüm
0.9.0
Uzunluk
5.252 kelime
Durum
yayın için kilitli aday metin
Yöntemsel dayanaklar
K04 · K05 · K09

Bölüm Sınırı

Bu bölüm yalnızca şu soruyu cevaplar:

Neden tek bir üretken sistem yanıtı GEO skoru değildir ve tekil bir yanıttan hangi hükümlerin çıkarılmasına izin verilebilir?

Bu bölüm:

  • ülkelerin örneklem kotalarını,
  • dillerin nasıl ağırlıklandırılacağını,
  • gerçeklik paketinin nasıl kurulacağını,
  • hakemlerin atomik iddiaları nasıl değerlendireceğini,
  • nihai NOMOS skor formüllerini,
  • uygunluk ve rozet kararını

ayrıntılı olarak tanımlamaz. Bu konular kitabın sonraki bölümlerinde ayrıca düzenlenecektir. Bölüm 1’in görevi daha temeldir:

Gözlem ile genelleme arasındaki epistemik sınırı kurmak.

Bu sınır kurulmadan yapılacak bütün örnekleme, puanlama ve uygunluk çalışmaları yanlış bir başlangıç üzerine inşa edilmiş olur.

BU BÖLÜMDEKİ HÜKÜM STATÜLERİ

Bu kitapta bütün cümleler aynı normatif güce sahip değildir. Aşağıdaki statüler kullanılır:

NORMATIVE — NORMATİF

Uygunluk ve yöntem bütünlüğü için zorunlu kabul edilen hükümdür. Örnek: Tek bir yanıt genel GEO skoru olarak kullanılamaz.

CANDIDATE — ADAY HÜKÜM

Pilot, dış uygulama veya istatistiksel doğrulama sonrasında kesinleştirilecek yöntem önerisidir. Örnek: AI ürünü başına, ana ölçüm dalgası başına 1.000 geçerli gözlem varsayılan asgari örneklem olarak önerilir.

HYPOTHESIS — HİPOTEZ

Veriyle sınanması gereken beklentidir. Örnek: Kontrollü temiz panel ile doğal kullanıcı paneli arasında maddi temsil farkı oluşabilir.

SYNTHETIC — SENTETİK

Gerçek kullanıcıyı, gerçek AI çıktısını veya gerçek şirket performansını temsil etmeyen yöntem gösterimidir.

OPEN — AÇIK SORU

Henüz yeterli kanıt veya yönetişim kararı bulunmadığı için nihai hükme bağlanmamış konudur. Bu statüler sessizce birbirine dönüştürülemez. Bir aday eşik, yalnız kitapta yazıldığı için kanıtlanmış normatif gerçek hâline gelmez. Bir sentetik gösterim, gerçek dünya gözlemine dönüşmez. Bir hipotez, ölçülmeden sonuç gibi yayımlanamaz.

NOMOS Challenge

Bir yapay zekâ sistemine markanız hakkında bir soru sordunuz. Sistem doğru bir cevap verdi. Ekran görüntüsünü aldınız. Sunumunuza koydunuz. Ardından şu cümleyi kurdunuz: “Yapay zekâ bizi doğru tanıyor.” Tam olarak neyi ölçtünüz? Bütün kullanıcıların göreceği cevabı mı? Sistemin tipik davranışını mı?

Dünya genelindeki temsili mi? Bütün dillerdeki doğruluğu mu? Zaman içindeki kararlılığı mı? Yoksa yalnızca:

Belirli bir kullanıcının, belirli bir hesabında, belirli bir AI ürünü ve kullanıcı yüzeyinde, belirli bir istem karşısında, belirli bir zamanda aldığı tek çıktıyı mı?

Tek cevap değersiz değildir. Tek cevap gerçek olabilir. Tek cevap önemli olabilir. Tek cevap ciddi bir hatayı açığa çıkarabilir. Tek cevap belirli bir insanın maruz kaldığı gerçek deneyimi gösterebilir. Fakat tek cevap, taşıyabileceğinden daha büyük bir hükmün kanıtı olamaz.

Tek bir yanıt şunu gösterebilir:

Bu çıktı, kaydedilmiş koşullarda en az bir kez üretildi.

Tek bir yanıt tek başına şunları gösteremez:

  • Kullanıcıların çoğunun aynı cevabı gördüğünü
  • Başka ülkelerde aynı sonucun oluştuğunu
  • Başka dillerde aynı doğruluğun korunduğunu
  • Başka hesap ve planlarda aynı cevabın üretildiğini
  • Cevabın zaman içinde kararlı olduğunu
  • Başka yapay zekâ ürünlerinin aynı temsili ürettiğini
  • Yapılan GEO müdahalesinin bu sonucu meydana getirdiğini
  • Cevabın kullanıcı davranışını etkilediğini
  • Cevabın lead, satış veya sürdürülebilir değer oluşturduğunu
  • Varlığın genel GEO skorunun yüksek olduğunu

Bu bölümün ilk hükmü şudur:

Bir yanıt bir gözlemdir. / Bir gözlem dağılım değildir. / Bir dağılım nedensellik değildir. / Nedensellik de tek başına sürdürülebilir değer değildir.

1. BÖLÜMÜN AMACI

Bu bölüm, GEO ölçümünün en küçük fakat en yaygın çıkarım hatasını ortadan kaldırmayı amaçlar:

Tek bir üretken sistem çıktısını genel sistem davranışı, nüfus deneyimi, marka görünürlüğü veya GEO skoru saymak.

Bu bölüm aşağıdaki ayrımları normatif hâle getirir:

  • Tekil çıktı ile nüfus sonucu
  • Olayın varlığı ile olayın yaygınlığı
  • Gözlem ile örneklem
  • Kullanıcı ile oturum
  • Tekrar ile bağımsız gözlem
  • AI modeli ile kullanıcıya sunulan AI ürünü
  • Ham yanıt ile analiz birimi
  • Anlık sonuç ile zaman kararlılığı
  • Ekran görüntüsü ile tam kanıt paketi
  • Sistem reddi ile geçersiz veri toplama
  • Kritik tekil olay ile yaygınlık oranı
  • Sentetik kayıt ile gerçek kullanıcı gözlemi
  • Ölçülen oran ile uygunluk kararı

Bu ayrımlar kurulmadan:

  • GEO-1000 örneklemi,
  • ülke ve dil ağırlıkları,
  • atomik iddia puanlaması,
  • NOMOS skoru,
  • uygunluk kararı

kurulamaz.

2. MERKEZÎ NORMATİF HÜKÜM

Bir varlığın üretken sistemlerdeki GEO skoru; tek bir cevap, tek bir ekran görüntüsü, tek bir kullanıcı, tek bir hesap, tek bir oturum, tek bir dil, tek bir ülke veya tek bir ölçüm anından üretilemez. Bir nüfus temsili iddiası en azından şunları gerektirir:

  • Önceden tanımlanmış denetim nesnesi
  • Önceden tanımlanmış hedef nüfus
  • Belirlenmiş örnekleme tasarımı
  • Kilitlenmiş istem veya istem ailesi
  • Tanımlanmış AI ürünü ve kullanıcı yüzeyi
  • Birden fazla geçerli gözlem
  • Bilinen bağımlılık yapısı
  • Ülke, dil ve zaman kayıtları
  • Değiştirilmemiş ham yanıtlar
  • Kanıt paketleri
  • Önceden tanımlanmış değerlendirme kuralları
  • Belirsizlik açıklaması
  • Hesap verebilir insan sorumluluğu

Bu unsurların bulunması ölçümün otomatik olarak doğru olduğu anlamına gelmez. Ancak bunların yokluğu, geniş nüfus hükmünü savunulamaz hâle getirebilir.

3. ÖLÇÜMÜN BEŞ AYRI BİRİMİ

GEO denetiminde sık yapılan temel hata, ölçümün farklı birimlerini birbirine karıştırmaktır. Aşağıdaki beş birim açıkça ayrılmalıdır.

3.1. Gözlem Birimi

Gözlem birimi, belirli koşullarda elde edilen tek üretken sistem çıktısıdır. Bir gözlem şu birleşimle tanımlanabilir:

O_i = (E_i, A_i, U_i, C_i, L_i, S_i, P_i, T_i, R_i, K_i)

Burada:

  • Ei: denetlenen varlık
  • Ai: AI ürünü ve kullanıcı yüzeyi
  • Ui: anonim katılımcı veya kullanıcı birimi
  • Ci: ülke veya coğrafi tabaka
  • Li: dil ve locale
  • Si: oturum ve kişiselleştirme koşulu
  • Pi: istem kimliği ve sürümü
  • Ti: zaman ve ölçüm dalgası
  • Ri: ham yanıt
  • Ki: kanıt ve doğrulama kaydı

Bu unsurlardan biri maddi biçimde değişirse yeni bir gözlem oluşabilir. Örneğin aynı kullanıcı:

  • aynı istemi başka AI ürününde sorarsa,
  • başka dilde sorarsa,
  • başka ölçüm dalgasında sorarsa,
  • kişiselleştirilmiş ve temiz oturumda ayrı ayrı sorarsa,

ayrı gözlemler üretilebilir. Bu gözlemler aynı kullanıcıdan geldiği için otomatik olarak birbirinden bağımsız sayılmaz.

3.2. Örnekleme Birimi

Örnekleme birimi, hedef nüfustan seçilen kişi, hesap, oturum veya başka erişim birimidir. Çoğu GEO-1000 uygulamasında örnekleme birimi uygun bir gerçek kullanıcı olabilir. Ancak araştırma tasarımına göre:

  • kullanıcı,
  • kullanıcı–ürün çifti,
  • hesap,
  • oturum,
  • araştırma paneli üyesi

seçim birimi olarak kullanılabilir. Örnekleme biriminin açıkça tanımlanmaması şu tür yanlış sayımlara yol açabilir:

  • Bir kişinin on tekrarını on kişi saymak
  • Bir ortak hesabı birden fazla bağımsız kullanıcı saymak
  • Aynı kullanıcının on AI ürünündeki sonuçlarını on bağımsız nüfus gözlemi gibi değerlendirmek
  • Tek bir araştırma panelindeki kümelenmeyi yok saymak

3.3. Analiz Birimi

Analiz birimi, doğruluk veya temsil değerlendirmesinin uygulandığı nesnedir. Bu birim:

  • tam cevap,
  • cevap içindeki ayrı paragraf,
  • maddi önerme,
  • atomik iddia,
  • atıf,
  • tavsiye olayı

olabilir. Bir kullanıcı tek cevap görür. Fakat o cevap aynı anda:

  • beş doğru iddia,
  • iki desteklenmeyen iddia,
  • bir güncelliğini yitirmiş iddia,
  • bir Critical yanlış

içerebilir. Bu nedenle katılımcının gördüğü cevap, analizde tek ve bölünmez bir doğru/yanlış birimi olmak zorunda değildir. Tam cevabın geçiş statüsü ile içindeki atomik iddiaların doğruluk statüleri ayrı tutulabilir. Atomik iddia yöntemi kitabın ilerleyen bölümünde tanımlanacaktır.

3.4. Çıkarım Evreni

Çıkarım evreni, ölçüm sonucunun genellenmek istendiği hedef nüfustur. Bu evren: “Dünyadaki herkes” olarak sessizce kabul edilemez. Belirli bir AI ürünü için hedef evren örneğin şu koşullarla sınırlandırılabilir:

  • Ürüne resmî ve meşru erişimi bulunan
  • Uygun yaş koşulunu karşılayan
  • İlgili dilde ürünü kullanabilen
  • Belirtilen web veya mobil yüzeye erişebilen
  • Belirlenen ölçüm döneminde aktif olabilecek kişiler

Aynı AI ürünü için bile:

  • kontrollü temiz panel,
  • doğal kullanıcı paneli,
  • ücretsiz plan,
  • ücretli plan,
  • web,
  • mobil

farklı çıkarım evrenleri oluşturabilir. Bir örneklemin hangi evrene genellendiği belirtilmeden yayımlanan oran eksiktir.

3.5. Tahmin Edilen Nicelik — Estimand

Bir araştırma yalnız veri toplamaz. Belirli bir niceliği tahmin etmeye çalışır. GEO-1000’in temel tahmin nesnesi, en genel biçimiyle şöyle ifade edilebilir:

Tanımlı hedef nüfustan uygun bir kullanıcının, belirtilen ölçüm dalgasında, belirli AI ürünü ve kullanıcı yüzeyinde, kilitlenmiş istemi tanımlı oturum koşulunda kullanması hâlinde, kabul kriterini karşılayan bir temsil görme olasılığı.

Matematiksel olarak:

θ_{E,A,P,S,W,T} = Pr(Y_i = 1 | U_i ∈ T, E, A, P, S, W)

Burada:

  • E: denetlenen varlık
  • A: AI ürünü ve kullanıcı yüzeyi
  • P: istem sürümü
  • S: oturum koşulu
  • W: ölçüm dalgası
  • T: hedef nüfus
Yi=1: yanıtın daha sonra tanımlanacak geçiş kriterini karşılaması

Bu tanım önemli bir sınır koyar:

GEO skoru, bir modelin soyut ve zamansız “bilgisi” değil; tanımlı kullanıcı koşullarında gözlenen temsil olasılığının tahminidir.

Nihai geçiş kuralı ve skor formülü kitabın sonraki bölümlerinde düzenlenecektir.

4. “MODEL BÖYLE CEVAP VERDİ” CÜMLESİNİN SINIRI

Kullanıcılar çoğu zaman doğrudan çıplak bir temel modele erişmez. Kullanıcıya görünen sonuç şu bileşenlerin birleşiminden oluşabilir:

  • Temel veya yönlendirici model
  • Ürün arayüzü
  • Retrieval veya web erişimi
  • Atıf katmanı
  • Güvenlik ve politika katmanı
  • Sistem talimatları
  • Hesap planı
  • Kişiselleştirme
  • Hafıza
  • Önceki konuşma
  • Dil ve locale
  • Ülke
  • Zaman
  • Sağlayıcının ürün güncellemeleri

Bu nedenle kullanıcı yüzeyi üzerinden yapılan ana denetimde tercih edilen ifade şudur:

“Belirtilen AI ürünü ve kullanıcı yüzeyinde şu çıktı gözlendi.”

Şu ifade, gerekli teknik kontrol bulunmadan daha geniş olabilir: “Model böyle düşünüyor.” Bir ürün içinde görünen model adı kaydedilebilir. Fakat sonuç, yalnız model ağırlıklarının değil bütün kullanıcı yüzeyinin davranışı olarak değerlendirilmelidir.

5. GEÇERLİ GÖZLEM NEDİR?

Bir yanıtın bulunması, onun otomatik olarak GEO ölçümüne girebilecek geçerli gözlem olduğu anlamına gelmez.

5.1. Asgari Geçerlilik Koşulları

Bir gözlem, ilgili protokole göre en azından şu unsurları taşımalıdır:

  • Doğru denetim varlığı
  • Atanmış AI ürünü ve kullanıcı yüzeyi
  • Doğru istem kimliği ve sürümü
  • Doğru dil ve locale
  • Tanımlı oturum koşulu
  • Kaydedilmiş ülke veya coğrafi tabaka
  • UTC zaman damgası ve ölçüm dalgası
  • Eksiksiz ham yanıt
  • Seçilmemiş ilk uygun çıktı
  • Gerekli ekran görüntüsü veya eşdeğer kanıt
  • Anonim gözlem kimliği
  • Protokol sapması kaydı

Bunların ayrıntılı teknik şeması daha sonraki NOMOS Capture bölümünde tanımlanacaktır.

5.2. Gözlem Statüleri

Her kayıt şu statülerden biriyle işaretlenmelidir:

VALID — GEÇERLİ

Protokolün gerekli şartlarını karşılar.

CONDITIONALLY VALID — KOŞULLU GEÇERLİ

Sınırlı bir eksiklik vardır; hangi analizlerde kullanılabileceği açıkça belirtilir.

INVALID — GEÇERSİZ

Protokol ihlali nedeniyle ana tahmin veya skor hesabında kullanılamaz.

UNKNOWN — BELİRLENEMEDİ

Geçerlilik kararı için yeterli kayıt yoktur. UNKNOWN gözlem sessizce VALID kabul edilemez.

5.3. Geçerli Sistem Sonucu ile Geçersiz Veri Toplama Arasındaki Fark

Bu ayrım zorunludur. Bir AI ürünü:

  • cevap vermeyi reddedebilir,
  • hata mesajı gösterebilir,
  • yanıt üretmeden durabilir,
  • bağlantı sorunu yaşayabilir,

görevi tamamlayamayacağını söyleyebilir. Katılımcı bütün protokolü doğru uyguladıysa bunlar geçerli sistem sonuçları olabilir. Sessizce veri setinden çıkarılamaz. Buna karşılık:

  • katılımcının cevabı kırpması,
  • istemi değiştirmesi,
  • en iyi cevabı seçmek için yeniden üretmesi,
  • ekran görüntüsünü düzenlemesi,
  • yanlış AI ürününü kullanması

veri toplama geçersizliği oluşturabilir. Birincisi sistemin gerçek davranışıdır. İkincisi ölçüm sürecinin bozulmasıdır. İkisi aynı kategoriye konamaz.

6. TEK BİR YANIT NEYİ KANITLAYABİLİR?

Tekil gözlem sınırlıdır. Fakat anlamsız değildir.

6.1. Belirli Bir Çıktının En Az Bir Kez Oluştuğunu

Geçerli bir kayıt şu cümleyi destekleyebilir: “Belirtilen AI ürünü ve kullanıcı yüzeyinde, belirtilen zaman ve koşullarda bu çıktı en az bir kez gözlenmiştir.” Bu cümle olayın varlığını gösterir. Yaygınlığını göstermez.

6.2. Belirli Bir Kullanıcının Gerçek Maruziyetini

Bir kullanıcı yanlış bir:

  • şirket kimliği,
  • sağlık bilgisi,
  • hukuki yönlendirme,
  • fiyat,
  • lisans,
  • tavsiye

gördüyse bu gerçek kullanıcı deneyimidir. Nüfusun tamamını temsil etmese bile etkilenen kullanıcı açısından maddidir.

6.3. Belirli Bir Hatanın Mümkün Olduğunu

Tekil çıktı şunu gösterebilir: “Bu sistem koşullarında bu hata oluşabilir.” Ancak şunu göstermez: “Bu hata tipiktir.”

6.4. Yeni Bir Araştırma Hipotezi Üretmeyi

Tekil hata, daha geniş ölçümde sınanacak bir soru oluşturabilir. Örnek: “Bu kimlik karışıklığı yalnız bir oturumda mı oluştu, yoksa aynı dil ve ülkede sistematik bir örüntü mü?”

6.5. Kritik Olay İncelemesini Başlatmayı

Tek bir yanıt:

  • öngörülebilir ciddi insan zararı,
  • sahte profesyonel yetki,
  • yanlış acil sağlık yönlendirmesi,
  • maddi hukuki yanlış,
  • ağır güvenlik tavsiyesi,
  • başka varlıkla ciddi kimlik karışıklığı

içeriyorsa olay incelemesi başlatmak için yeterli olabilir. Kritik olay soruşturması başlatmak ile nüfus oranı ilan etmek aynı işlem değildir.

6.6. “Bu Hiç Olmadı” İddiasını Çürütmeyi

Bir kurum: “Sistem hiçbir zaman bizi yanlış ülkeye ait göstermedi.” diyorsa, doğrulanmış tek bir karşı gözlem bu mutlak iddiayı çürütebilir. Tekil gözlem: “Her zaman olur.” iddiasını desteklemez. Fakat: “Hiç olmadı.” iddiasını çürütebilir.

7. TEK BİR YANIT NEYİ KANITLAYAMAZ?

7.1. Tipik Sistem Davranışını

Tekil yanıt: “Sistem genellikle böyle cevap verir.” hükmüne yeterli değildir.

7.2. Nüfus Yaygınlığını

Tekil yanıt: “Kullanıcıların yüzde 95’i aynı temsili görür.” sonucunu desteklemez.

7.3. Zaman Kararlılığını

Bugünkü cevap:

  • yarın,
  • bir hafta sonra,
  • ürün güncellemesinden sonra

aynı kalmayabilir. Tek dalga kararlılık ölçümü değildir.

7.4. Ülkeler Arası Geçerliliği

Türkiye’deki bir kullanıcının cevabı, Çin, Almanya veya San Marino’daki kullanıcıların ne göreceğini göstermez.

7.5. Diller Arası Geçerliliği

İngilizce bir çıktı:

  • Türkçe,
  • Japonca,
  • Arapça,
  • Almanca

çıktıların doğruluğunu temsil etmez.

7.6. AI Ürünleri Arası Geçerliliği

Bir AI ürünündeki sonuç diğer AI ürünlerine genellenemez. Aynı sağlayıcının farklı ürün ve yüzeyleri de ayrı davranabilir.

7.7. Müdahale Etkisini

Bir GEO değişikliğinden sonra alınan olumlu tek çıktı: “Bu sonucu yaptığımız müdahale oluşturdu.” hükmünü kanıtlamaz. Baseline, karşılaştırma ve alternatif açıklamalar gerekir.

7.8. Tavsiye Kararlılığını

Bir kullanıcının varlığı seçenekler arasında görmesi: “Sistem artık bu markayı öneriyor.” sonucuna yeterli değildir.

7.9. Ticari Etkiyi

Bir olumlu cevap:

  • kullanıcının cevabı gördüğünü,
  • markayı araştırdığını,
  • iletişim kurduğunu,
  • satın aldığını,
  • memnun kaldığını

tek başına göstermez.

7.10. GEO Skorunu

Tekil yanıt, tanımlı hedef nüfusun temsil dağılımını tahmin etmez. Bu nedenle genel GEO skoru oluşturamaz.

8. OLAYIN VARLIĞI İLE OLAYIN YAYGINLIĞI

Bu bölümün en önemli ayrımlarından biri budur.

8.1. Olayın Varlığı

Şu soruya cevap verir: “Bu temsil veya hata en az bir kez oluştu mu?” Tek bir geçerli gözlem yeterli olabilir. Gösterim:

I(E) = 1 (olay en az bir kez gözlendiyse); aksi hâlde I(E) = 0

Buradaki 0: “Olay imkânsızdır.” anlamına gelmez. Yalnız mevcut ölçümde gözlenmediğini gösterir.

8.2. Olayın Yaygınlığı

Şu soruya cevap verir: “Tanımlı hedef nüfusta olay ne sıklıkta meydana geliyor?” Basit bir örneklemde ham oran:

p̂ = olayın gözlendiği geçerli kayıt sayısı / toplam geçerli kayıt sayısı

olarak hesaplanabilir. Fakat gerçek GEO-1000 çalışmalarında:

  • nüfus ağırlıkları,
  • ülke ve dil tabakaları,
  • eşlenmiş kullanıcılar,
  • panel kümeleri,
  • yanıtlamama,
  • geçersiz kayıtlar,
  • tasarım etkisi

dikkate alınmalıdır. Bu nedenle ham oran her zaman nihai nüfus tahmini değildir.

8.3. Olayın Varlığı ile Yaygınlığı Birbirine Dönüştürülemez

Bir olay bir kez gözlenmiş olabilir fakat çok nadir olabilir. Bir olay yaygın olabilir fakat küçük bir pilotta hiç gözlenmemiş olabilir. Şu iki cümle farklıdır:

  • “Bu hata bir kez gözlendi.”
  • “Bu hata kullanıcıların yüzde 12’sinde gözlendi.”

İkinci cümle, tanımlı payda ve örneklem gerektirir.

9. TEK GÖZLEM YANILGISININ İSTATİSTİKSEL GÖRÜNÜMÜ

Bir AI ürününe bir kez soru sorduk. Cevap geçiş kriterini karşıladı. Ham oran:

p̂ = 1/1 = 1 = %100

olarak görünür. Fakat bu yüzde 100, hedef nüfusun yüzde 100’ünün aynı sonucu göreceği anlamına gelmez. Aşağıdaki tablo, yalnız gösterim amacıyla, bağımsız Bernoulli gözlemleri ve ağırlıksız basit örnekleme varsayımı altında yaklaşık yüzde 95 Wilson güven aralıklarını göstermektedir: [K09]

Geçen yanıtGeçerli gözlemHam oranYaklaşık %95 Wilson aralığı
11%100%20,7–%100
910%90%59,6–%98,2
95100%95%88,8–%97,8
9501.000%95%93,5–%96,2

Bu tablo sentetik ve öğreticidir. Şunları kanıtlamaz:

  • GEO-1000’in bütün örneklem tasarımlarında bu aralıkların geçerli olduğunu
  • 1.000 gözlemin bütün dil ve ülke alt grupları için yeterli olduğunu
  • kümelenme ve ağırlıklandırmanın etkisiz olduğunu
  • yüzde 95 ham doğruluğun otomatik uygunluk anlamına geldiğini

Asıl gösterdiği şudur:

Gözlem sayısı azaldıkça nüfus oranı hakkındaki belirsizlik büyür.

Bir gözlemde görünen yüzde 100, çok geniş bir olası nüfus aralığıyla uyumlu olabilir.

10. NEDEN “1.000” SİHİRLİ SAYI DEĞİLDİR?

CANDIDATE BASE RULE — ADAY TEMEL KURAL

GEO-1000 şu kurucu öneriyi taşır:

Her denetlenen AI ürünü ve her ana ölçüm dalgası için varsayılan olarak en az 1.000 geçerli kullanıcı gözlemi hedeflenir.

Bu hüküm henüz nihai bilimsel minimum değildir. Pilot ve dış uygulama sonuçlarına göre yeniden değerlendirilecektir.

10.1. Neden Güçlü Bir Başlangıçtır?

Basit rastgele örnekleme varsayımı altında, gerçek oran yüzde 50 civarındayken 1.000 gözlemin teorik yüzde 95 hata payı yaklaşık ±3,1 puandır. Bu, genel ürün düzeyinde anlamlı bir başlangıç hassasiyeti sağlayabilir.

10.2. Neden Her Sorunu Çözmez?

1.000 gözlem:

  • onlarca ülkeye,
  • çok sayıda dile,
  • ücretsiz ve ücretli planlara,
  • web ve mobil yüzeylere,
  • kontrollü ve doğal panellere

bölündüğünde alt hücreler küçülür. Örneğin 20 dilin her birine yalnız 50 gözlem düşüyorsa dil bazlı belirsizlik genel model skorundan çok daha yüksek olabilir.

10.3. Tasarım Etkisi

Gözlemler:

  • aynı araştırma panelinden,
  • aynı ülkeden,
  • aynı kullanıcıdan,
  • eşlenmiş tasarımdan

geliyorsa basit bağımsız örneklem varsayımı geçerli olmayabilir. Gerçek belirsizlik daha geniş olabilir.

10.4. NOMOS’un Yaklaşımı

1.000:

  • protokolün kurucu referans noktası,
  • model düzeyinde varsayılan başlangıç minimumu,
  • pilotla kalibre edilecek aday eşik

olarak kullanılır. Şu iddia kurulmaz: “1.000 gözlem bütün ülkeler, diller ve kullanım koşulları için otomatik olarak yeterlidir.”

11. TEKRAR İLE BAĞIMSIZ GÖZLEM AYNI ŞEY DEĞİLDİR

Bir kullanıcı aynı soruyu on kez sorabilir. Bu işlem değerli olabilir. Ancak on bağımsız kullanıcı üretmez.

11.1. Aynı Kullanıcı–Aynı Oturum Tekrarı

Şunları ölçebilir:

  • cevap yenileme varyansı,
  • oturum içi kararlılık,

alternatif cevap olasılığı. Nüfus yaygınlığını tek başına ölçmez.

11.2. Aynı Kullanıcı–Yeni Oturum Tekrarı

Önceki sohbet bağlamını azaltabilir. Fakat:

  • aynı hesap,
  • aynı plan,
  • aynı ülke,
  • aynı kişiselleştirme,
  • aynı kullanıcı

bağımlılığı devam edebilir.

11.3. Aynı Kullanıcının Birden Fazla AI Ürününü Test Etmesi

Bu tasarım modeller arası eşlenmiş karşılaştırmaya yardımcı olabilir. Ancak gözlemler kullanıcı düzeyinde bağımlıdır. Bu bağımlılık kayıt ve analizde korunmalıdır.

11.4. Farklı Kullanıcıların Aynı Hesabı Kullanması

Farklı kişiler bulunabilir. Fakat:

  • hesap geçmişi,
  • kişiselleştirme,
  • plan,
  • hafıza

ortak olabilir. Bu kayıtlar otomatik olarak bağımsız sayılamaz.

11.5. Normatif Bağımsızlık Hükmü

Gözlemler mümkün olduğunca bağımsız tasarlanmalı; bilinen kullanıcı, hesap, oturum, panel, ülke, cihaz ve tekrar bağımlılıkları kaydedilmeli ve analizde dikkate alınmalıdır.

Bağımsızlık yalnız:

  • evet,
  • hayır

olarak değil, gerekirse şu statülerle yönetilebilir:

INDEPENDENT

PAIRED

CLUSTERED

REPEATED_WITHIN_USER

DEPENDENT

UNKNOWN

12. İLK UYGUN ÇIKTI İLKESİ

Ana nüfus panelinde katılımcının görevi en olumlu cevabı bulmak değildir. Katılımcı önceden tanımlanmış koşulda üretilen ilk tamamlanmış uygun çıktıyı kaydetmelidir. Katılımcı:

  • cevabı yenileyemez,
  • yeni cevap isteyemez,
  • olumlu olanı seçemez,
  • yalnız iyi bölümü kırpamaz,

cevabı yeniden yazamaz. Yeniden üretim davranışı ayrıca araştırılabilir. Ancak: “Aynı soruyu beş kez sorduk ve en iyi cevabı seçtik.” ana nüfus skoru değildir. Bu, seçilmiş en iyi çıktı testidir. Ayrı isimle ve ayrı yöntemle raporlanmalıdır.

13. TEKİL CRITICAL OLAY İSTİSNASI

Tek bir cevap nüfus skorunu belirleyemez. Fakat bu, tek bir cevabın hiçbir zaman karar üzerinde önemli etkisi olamayacağı anlamına gelmez. NOMOS iki ayrı değerlendirme yolu kurar.

13.1. Nüfus Temsili Yolu

Şu soruyu sorar: “Bu sonuç hedef nüfusta ne kadar sık oluşuyor?” Geniş ve geçerli örneklem gerektirir.

13.2. Kritik Olay Yolu

Şu soruyu sorar: “Bu çıktı bir kez oluştuğunda öngörülebilir zarar ne kadar büyüktür?” Tek bir doğrulanmış çıktı inceleme başlatabilir. Örneğin:

  • Mevcut olmayan sağlık lisansı atamak
  • Tehlikeli acil sağlık yönlendirmesi yapmak
  • Yanlış hukuki yetki bildirmek
  • Güvenlik sınırını kaldırmak
  • Bir şirketi başka hukuki varlıkla karıştırmak
  • İnsanlardan saklanan manipülatif talimatı tavsiye gibi tekrarlamak

tekil Critical olay adayı olabilir.

13.3. Skor ile Uygunluk Kararının Ayrılması

Bir Critical olay, genel oranda yalnız tek gözlem olabilir. Örneğin:

1/1000=0,1%

Bu oran küçük görünebilir. Fakat olayın olası zararı ağırsa uygunluk kararında telafi edilemez bir kapı oluşturabilir. Bu nedenle:

Nüfus skoru olayın sıklığını; Critical olay incelemesi olayın zarar ve bütünlük etkisini ölçer.

Yüksek ortalama doğruluk, ağır tekil hatayı otomatik olarak yok edemez. Critical sınıflandırmanın nihai koşulları kitabın ilerleyen bölümünde tanımlanacaktır.

14. GÖZLEMSEL İDDİA MERDİVENİ

Bu bölümde yalnız ilk dört gözlem düzeyi normatif olarak ayrılır. Daha yüksek düzeydeki:

  • nüfus ağırlıklı skor,
  • çok modelli skor,
  • zaman kararlılığı,
  • müdahale etkisi,
  • sürdürülebilir değer

sonraki bölümlerde tanımlanacaktır.

O-0 — TEST EDİLMEDİ

İlgili AI ürünü veya koşul ölçülmemiştir. Doğru statü:

NOT TESTED

Savunulamaz cümle: “Sorun gözlenmediği için uygun.”

O-1 — TEKİL OLAY GÖZLEMİ

Bir geçerli çıktı bulunmaktadır. Savunulabilir cümle: “Belirtilen koşullarda bu çıktı bir kez gözlenmiştir.” Savunulamaz cümle: “Sistem varlığı böyle temsil eder.”

O-2 — KULLANICI VEYA OTURUM İÇİ TEKRAR

Aynı kullanıcı, hesap veya oturum ailesinde birden fazla sonuç bulunmaktadır. Savunulabilir cümle: “Belirtilen kullanıcı ve oturum koşullarında on tekrardan yedisinde bu sonuç oluşmuştur.” Savunulamaz cümle: “On bağımsız kullanıcıdan yedisi bu sonucu gördü.”

O-3 — ÇOK KULLANICILI TEK HÜCRE ÖLÇÜMÜ

Aynı:

  • AI ürünü,
  • kullanıcı yüzeyi,
  • ülke,
  • dil,
  • panel koşulu,
  • istem sürümü,
  • ölçüm dalgası

içinde birden fazla uygun kullanıcı gözlemi bulunmaktadır. Savunulabilir cümle: “Türkçe/Türkiye kontrollü hücresindeki 200 geçerli gözlemin yüzde 78’i belirtilen geçiş kriterini karşılamıştır.” Bu sonuç başka ülke, dil veya kullanıcı yüzeyine otomatik olarak genellenemez.

O-4 — ÇOK HÜCRELİ TABAKALI ÖLÇÜM

Farklı ülke, dil veya kullanıcı hücrelerinden önceden tanımlanmış örneklem bulunmaktadır. Bu düzeyde:

  • hücre sonuçları,
  • ağırlıklı sonuç,
  • kapsam,
  • belirsizlik

raporlanabilir. Nüfus ağırlıklarının ve alt grup adaletinin ayrıntılı kuralları kitabın sonraki bölümlerinde tanımlanır.

15. SENTETİK APPLE.COM GÖSTERİMİ

SENTETİK METODOLOJİ GÖSTERİMİ / Aşağıdaki kullanıcılar, AI ürünleri, yanıtlar, oranlar ve sonuçlar kurgusaldır. Gerçek Apple Inc. performansını veya herhangi bir gerçek AI ürününün davranışını temsil etmez.

15.1. Senaryo A — Tek Olumlu Yanıt

Bir sentetik kullanıcı, sentetik AI Ürünü A’ya şu soruyu sorar: “Apple.com nasıl bir şirkettir?” Sentetik yanıt: “Apple, tüketici elektroniği, yazılım ve dijital hizmetler geliştiren ABD merkezli bir teknoloji şirketidir.” Ön değerlendirme:

  • Varlık kimliği doğru
  • Ana kategori doğru
  • Belirgin Critical yanlış yok
  • Temel temsil kabul edilebilir

Ham sonuç:

1/1=100%

Yanlış kamu cümlesi: “AI Ürünü A, Apple’ı yüzde 100 doğrulukla temsil ediyor.” Doğru kamu cümlesi: “Sentetik örnekte, belirtilen tek gözlem geçiş kriterini karşılamıştır. Nüfus yaygınlığı ve ürün kararlılığı belirlenmemiştir.”

15.2. Senaryo B — On Gözlemli Keşif

On bağımsız sentetik kullanıcı aynı semantik istem sürümünü kullanır. Sentetik sonuç:

  • 7 yanıt geçer
  • 1 yanıt kısmen doğrudur
  • 1 yanıt güncelliğini yitirmiş bilgi taşır
  • 1 yanıt yanlış ana faaliyet atar

Ham geçiş oranı:

7/10=70%

Basit ve idealize edilmiş bağımsız örnekleme varsayımı altında yaklaşık yüzde 95 Wilson aralığı: arasındadır. Bu sonuç:

  • küçük örneklem,
  • tek hücre,
  • tek dalga

nedeniyle keşif düzeyindedir. Doğru statü:

EXPLORATORY — Kamuya açık küresel NOMOS skoru için yeterli değildir.

15.3. Senaryo C — 1.000 Gözlemli Sentetik Dalga

Sentetik olarak şu koşulların sağlandığını varsayalım:

  • AI Ürünü A
  • 1.000 geçerli gözlem
  • Önceden tanımlanmış hedef nüfus
  • Kilitlenmiş istem sürümü
  • Tanımlı ülke ve dil tabakaları
  • Değiştirilmemiş ilk uygun yanıt
  • Tam kanıt kayıtları
  • Önceden belirlenmiş hakemlik kuralları

Sentetik sonuç:

Yanıt statüsüSayı
Geçiş kriterini karşılayan918
Kısmen doğru37
Desteklenmeyen maddi iddia23
Güncelliğini yitirmiş bilgi12
Critical hata adayı6
Sınıflandırılamayan4
Toplam1.000

Basit ham geçiş oranı:

918/1000=91,8%

İdealize edilmiş ağırlıksız varsayım altında yaklaşık yüzde 95 Wilson aralığı: arasındadır. Fakat bu sayı henüz tek başına nihai NOMOS GEO skoru değildir. Çünkü ayrıca değerlendirilmesi gerekenler vardır:

  • Ülke ve dil ağırlıkları
  • Tasarım etkisi
  • En düşük dil sonucu
  • Geçersiz gözlem oranı
  • Hakemler arası uyum
  • Critical hata adaylarının doğrulanması
  • Test edilmeyen kullanıcı grupları
  • Ölçümün zaman ve kullanıcı yüzeyi sınırı

Ayrıca altı Critical hata adayı ayrı olay incelemesine alınmalıdır. Doğru raporlama örneği: “Sentetik dalgada ham yanıt geçiş oranı yüzde 91,8’dir. Sonuç, nüfus ağırlıkları ve tasarım etkisi uygulanmadan önceki gösterimdir. Altı Critical hata adayı nedeniyle uygunluk kararı ayrıca incelenmelidir.” Yanlış raporlama örneği: “Apple’ın NOMOS GEO skoru 91,8’dir ve uygundur.” Sentetik veri gerçek şirkete veya gerçek sisteme bu şekilde uygulanamaz.

16. ZORUNLU NORMATİF HÜKÜMLER

N-01

Tek bir üretken sistem çıktısı genel GEO skoru olarak kullanılamaz.

N-02

Tekil çıktı yalnız gözlendiği:

  • AI ürünü ve kullanıcı yüzeyi,
  • ülke,
  • dil,
  • istem,
  • oturum,
  • zaman

koşullarıyla birlikte raporlanmalıdır.

N-03

Tekil çıktı:

  • tipik,
  • sürekli,
  • küresel,
  • bütün kullanıcılara ait

davranış olarak sunulamaz.

N-04

Aynı kullanıcı, hesap veya oturumdan gelen tekrarlar, bağımlılık açıklanmadan bağımsız nüfus gözlemleri olarak sayılamaz.

N-05

Ana nüfus panelinde katılımcı önceden tanımlanmış ilk uygun çıktıyı kaydetmelidir; olumlu yanıt seçmek amacıyla yeniden üretim yapamaz.

N-06

Sistem reddi, hata mesajı veya cevap verememe, protokol doğru uygulanmışsa geçerli sistem sonucu olarak kaydedilmelidir.

N-07

Kırpılmış, değiştirilmiş, elle yeniden yazılmış veya istem bağlamı doğrulanamayan cevaplar ana skor hesabına alınamaz.

N-08

Yalnız olumlu ekran görüntülerinin seçilmesi ve sonuç dağılımının saklanması yasaktır.

N-09

Sentetik gözlemler gerçek kullanıcı veya gerçek sistem skorunda kullanılamaz.

N-10

Bir nüfus oranı kapsam, payda ve uygun belirsizlik açıklaması olmadan yayımlanmamalıdır.

N-11

Critical hata olasılığı, genel ortalama içinde sessizce telafi edilmiş sayılamaz.

N-12

Gözlem sonucu yalnız tanımlı çıkarım evrenine uygulanabilir; ölçülmeyen ülke, dil, ürün veya zaman dilimine genellenemez.

N-13

Ölçüm, puanlama veya kamu beyanının hesap verebilir bir insan veya kurum sahibi bulunmalıdır.

N-14

UNKNOWN, NOT TESTED veya INVALID kayıtlar sessizce olumlu sonuca dönüştürülemez.

17. ADAY GEO-1000 TEMEL HÜKMÜ

CANDIDATE-001

Her denetlenen AI ürünü ve her ana nüfus ölçüm dalgası için varsayılan olarak en az 1.000 geçerli kullanıcı gözlemi hedeflenmelidir.

Bu aday hüküm:

  • genel ürün tahmininin hassasiyeti,
  • maliyet,
  • uygulanabilirlik,
  • ülke ve dil adaleti

arasında bir başlangıç dengesi önerir. Ancak:

  • bütün ülke skorları,
  • bütün dil skorları,
  • bütün kullanıcı alt grupları

için yeterlilik garantisi değildir. Nihai normatif statüsü:

  • pilotlar,
  • bağımsız tekrarlar,
  • tasarım etkisi,
  • alt grup hassasiyeti

değerlendirildikten sonra belirlenecektir.

18. BAŞARISIZLIK BİÇİMLERİ

F-01 — Seçilmiş Ekran Görüntüsü

Çok sayıda sonuç içinden yalnız en olumlu cevap yayımlanır.

F-02 — Tek Kullanıcıyı Nüfus Sanmak

Bir kişinin deneyimi bütün hedef evrene genellenir.

F-03 — Aynı Kullanıcının Tekrarlarını Yeni İnsan Saymak

Aynı kişi veya hesapta üretilen tekrarlar bağımsız katılımcı gibi raporlanır.

F-04 — Cevabı Yenileyip En İyisini Seçmek

İlk veya olumsuz cevaplar atılır; en uygun cevap ölçüm sonucu olarak saklanır.

F-05 — İstem Drift

Katılımcılar istemin kelime, ton veya kapsamını değiştirir; sonuçlar aynı deneymiş gibi birleştirilir.

F-06 — Bağlam Bulaşması

Önceki sohbetler cevabı etkiler; kayıt temiz oturum gibi sunulur.

F-07 — Kişiselleştirmeyi Gizlemek

Hafıza, özel talimat veya kullanıcı geçmişi açıktır; sonuç genel kullanıcı cevabı gibi raporlanır.

F-08 — Model ve Ürünü Karıştırmak

Yalnız genel model veya sağlayıcı adı yazılır; gerçek ürün, arayüz ve araç koşulu kaydedilmez.

F-09 — Retleri ve Hataları Paydadan Çıkarmak

Sistemin cevap vermediği kayıtlar sonucu olumlu göstermek için silinir.

F-10 — Geçersiz Yakalamayı Sistem Başarısızlığı Saymak

Katılımcı hatası veya eksik kanıt, AI ürününün yanlış sonucu gibi raporlanır.

F-11 — Tek Dil ve Ülkeyi Küreselleştirmek

Tek bir locale sonucu dünya geneline uygulanır.

F-12 — Sentetik Veriyi Gerçek Gibi Kullanmak

Yöntem gösterimi amacıyla oluşturulmuş kayıtlar gerçek performansa eklenir.

F-13 — Critical Olayı Ortalamada Kaybetmek

Ağır sağlık, hukuk, lisans veya güvenlik yanlışı yüksek ortalama içinde görünmez hâle getirilir.

F-14 — Tekil Başarıdan Müdahale Etkisi Çıkarmak

GEO müdahalesinden sonra alınan tek olumlu cevap, çalışmanın nedensel etkisi sayılır.

F-15 — Tekil Yanlıştan Bütün Sisteme Hüküm Vermek

Bir hata, AI ürününün her zaman ve bütün kullanıcılar için yanlış olduğu şeklinde genellenir.

F-16 — Hedef Nüfusu Sonradan Tanımlamak

Sonuç görüldükten sonra başarının yüksek olduğu kullanıcı grubu “asıl hedef nüfus” ilan edilir.

19. DENETİM PROSEDÜRÜ

Bir denetçi, tekil bir gözlemin veya erken GEO iddiasının geçerliliğini değerlendirirken aşağıdaki sırayı izlemelidir.

Adım 1 — Kamu İddiasını Kaydet

İleri sürülen tam cümle belirlenir. Örnek: “ChatGPT şirketimizi doğru tanıyor.”

Adım 2 — İddia Düzeyini Belirle

Cümle:

  • tekil olay,
  • yaygınlık,
  • kararlılık,
  • küresel sonuç,
  • nedensellik,
  • ticari etki

iddialarından hangisini taşıyor?

Adım 3 — Dayanak Gözlem Sayısını Belirle

Kaç gerçek kullanıcı? Kaç hesap? Kaç bağımsız oturum? Kaç tekrar? Kaç AI ürünü? Kaç dil ve ülke?

Adım 4 — Gözlem Koşullarını Doğrula

AI ürünü kullanıcı yüzeyi istem oturum ülke dil zaman kayıtlı mı?

Adım 5 — Kanıt Bütünlüğünü İncele

Tam yanıt var mı? Tam ekran görüntüsü var mı? Cevap seçilmiş veya yenilenmiş mi? Dosya değiştirilmiş mi? Kayıt sentetik mi?

Adım 6 — Bağımlılık Yapısını Belirle

Aynı kullanıcı tekrarları var mı? Ortak hesap kullanılmış mı? Eşlenmiş model tasarımı var mı? Aynı panelden kümelenme bulunuyor mu?

Adım 7 — Geçerli Sistem Sonucu ile Veri Toplama Hatasını Ayır

Ret veya sistem hatası gerçek sonuç mu? Yoksa katılımcı protokolü mü bozdu?

Adım 8 — İddia ile Kanıt Düzeyini Karşılaştır

Tekil gözlem, nüfus veya küresel sonuç iddiası için kullanılıyor mu?

Adım 9 — Critical Olay Yolunu Aç

Tekil cevap öngörülebilir ağır zarar taşıyorsa ayrı olay incelemesi başlatılır.

Adım 10 — Kararı Sınırlandır

Kamu cümlesi yalnız kanıtın taşıdığı düzeye indirilir.

20. GEREKLİ KANIT

Bu bölüm kapsamındaki bir gözlem veya iddia için ilgili olduğu ölçüde şu kayıtlar aranmalıdır:

  • Denetlenen varlık kimliği
  • Kamuya ileri sürülen tam GEO iddiası
  • Gözlem sayısı
  • Benzersiz katılımcı sayısı
  • AI ürünü ve kullanıcı yüzeyi
  • Görünen model veya sürüm, bulunabiliyorsa
  • Plan veya hesap türü
  • Ülke ve locale
  • İstem kimliği, sürümü ve tam metni
  • Oturum ve kişiselleştirme durumu
  • UTC zaman damgası
  • Ölçüm dalgası
  • Tam ham yanıt
  • Ekran görüntüsü veya eşdeğer kanıt
  • Yeniden üretim veya cevap seçme durumu
  • Gözlem geçerlilik statüsü
  • Bağımlılık ve eşleşme kaydı
  • Sentetik veya gerçek statüsü
  • Geçersiz gözlem günlüğü
  • Critical olay kaydı
  • Sonuç kapsamı
  • Belirsizlik açıklaması
  • Sorumlu insan veya kurum

Bu kayıtların tamamı her düşük riskli keşif gözlemi için aynı ayrıntıda gerekmeyebilir. Ancak kamuya geniş GEO skoru veya uygunluk hükmü verilecekse maddi alanlar eksik bırakılamaz.

21. DENETİM KONTROL LİSTESİ

Denetlenen varlık tam olarak tanımlandı mı? AI ürünü ve kullanıcı yüzeyi kaydedildi mi? İstem ölçümden önce kilitlendi mi? İstem katılımcı tarafından değiştirildi mi? Oturum ve kişiselleştirme koşulları biliniyor mu? Kullanıcının ülke ve locale bilgisi kayıtlı mı? Tam yanıt korunmuş mu? İlk uygun çıktı mı, seçilmiş en iyi çıktı mı? Tam kanıt kaydı bulunuyor mu? Gerçek kullanıcı sayısı ile gözlem sayısı ayrıldı mı? Tekrar ve eşlenmiş gözlemler bağımsız sayılmış mı? Ret ve sistem hataları paydada doğru yönetilmiş mi? Geçersiz kayıtlar saklanmış ve gerekçelendirilmiş mi? Sentetik ve gerçek veriler ayrılmış mı? Tek cevap nüfus sonucu gibi sunuluyor mu?

İddia yalnız ölçülen ürün, ülke, dil ve zamana mı uygulanıyor? Critical hata ihtimali ayrı değerlendirilmiş mi? Sonuç bir güven veya belirsizlik açıklaması taşıyor mu? Test edilmeyen alanlar açıkça gösteriliyor mu? Kamu cümlesi gerçek gözlem düzeyini aşıyor mu? Maddi sorulardan biri cevapsızsa sonuç sınırlı güven taşır. Birden fazlası cevapsızsa genel GEO skoru için kullanılmamalıdır.

22. İTİRAZLAR VE CEVAPLAR

İtiraz 1 — “Gerçek kullanıcı zaten yalnız bir cevap görüyor.”

Doğrudur. Tek kullanıcının gördüğü tek cevap, o kişinin gerçek deneyimidir. Bu nedenle tekil olay kayıt altına alınır. Fakat bireysel deneyim ile nüfus deneyimi aynı değildir. NOMOS iki gerçeği birlikte korur:

Tek kullanıcının deneyimi gerçektir. / Tek kullanıcı bütün nüfus değildir.

İtiraz 2 — “Sistem her seferinde aynı cevabı veriyorsa tek cevap yetmez mi?”

Sistemin her seferinde aynı cevabı verdiği iddiası da ölçüm gerektirir. Ayrıca:

  • zaman,
  • retrieval,
  • ülke,
  • dil,
  • plan,
  • kişiselleştirme,
  • kullanıcı yüzeyi

değişebilir. Deterministik olduğu varsayılan sistem bile tanımlı koşullar dışında genellenemez.

İtiraz 3 — “Neden tam 1.000?”

1.000 kesinliğin sihirli eşiği değildir. GEO-1000 adı:

  • anlamlı kullanıcı hacmi,
  • genel ürün tahmini,
  • uygulanabilir maliyet,
  • kamu tarafından anlaşılabilirlik

arasında kurucu bir referans noktasıdır. Alt gruplar için daha fazla gözlem gerekebilir. Pilotlar bu eşiği doğrulamak veya değiştirmek zorundadır.

İtiraz 4 — “Aynı 1.000 kişi bütün AI ürünlerini test etsin.”

Bu yöntem modeller arası eşlenmiş karşılaştırma için yararlı olabilir. Fakat yalnız bütün ürünlere erişebilen yoğun AI kullanıcılarını seçerek hedef nüfusu bozabilir. Ayrıca aynı kişinin gözlemleri bağımlıdır. Tam eşlenmiş, kısmi eşlenmiş ve dengeli tasarımlar daha sonra karşılaştırılacaktır.

İtiraz 5 — “Ekran görüntüsü zaten yeterli kanıt değil mi?”

Ekran görüntüsü önemlidir. Fakat tek başına her zaman şunları göstermez:

  • gerçek zaman
  • ülke
  • plan
  • önceki konuşma
  • kişiselleştirme
  • cevap yenileme
  • dosya değişikliği
  • tam yanıt

Bu nedenle ekran görüntüsü kanıt paketinin önemli bir parçasıdır. Tamamı değildir.

İtiraz 6 — “Cevap vermeyen sistemi neden skora dâhil ediyoruz?”

Kullanıcının gerçek deneyimi cevap alamamak olabilir. Bir ret veya hata:

  • teknik,
  • güvenlik,
  • politika,
  • erişim

sonucu olabilir. Protokol doğru uygulandıysa olay kaydedilmelidir. Katılımcının teknik hatasıyla sistemin cevapsızlığı ayrı sınıflandırılır.

İtiraz 7 — “Tek bir ağır yanlış bütün denetimi neden etkilesin?”

Tek yanlış nüfusun çoğunun aynı hatayı gördüğünü kanıtlamaz. Fakat tek yanlışın olası zararı ağır olabilir. Bu nedenle:

  • skor sıklığı,
  • Critical karar zarar ve bütünlüğü

ayrı değerlendirir. Ortalama, insan zararını otomatik olarak silemez.

İtiraz 8 — “Tek cevapla hiçbir şey söyleyemiyorsak erken testlerin değeri nedir?”

Tekil ve küçük örnekli testler:

  • hipotez üretir,
  • hata türlerini keşfeder,
  • istemleri sınar,
  • capture sistemini test eder,
  • hakemleri kalibre eder,

Critical olayları açığa çıkarabilir. Yanlış olan keşif testi yapmak değildir. Keşif sonucunu nüfus skoru gibi sunmaktır.

24. BÖLÜMÜN ORTAK HÜKMÜ

Bu bölüm tek bir yanılgıyı ortadan kaldırmak için yazıldı: “Bir yapay zekâya sordum, cevap aldım; işte GEO sonucum.” Hayır. Elinizde henüz genel GEO sonucu yoktur. Elinizde bir gözlem vardır. Bu gözlem:

  • gerçek,
  • önemli,
  • hatta kritik

olabilir. Fakat yine de tekil bir gözlemdir. Bir GEO skoru için varlığın:

  • kullanıcılar,
  • AI ürünleri,
  • ülkeler,
  • diller,
  • oturumlar,
  • zamanlar

arasındaki temsil dağılımı ölçülmelidir. Tek ekran görüntüsü dağılım değildir. On tekrar otomatik olarak on bağımsız insan değildir. Bin cevap da kötü örneklemle dünya nüfusu değildir. Nüfusa oranlı örneklem de dil adaleti olmadan eksik olabilir. Yüksek ortalama da Critical yanlışları silemez. Bu nedenle NOMOS’un ilk ölçüm yasası şudur:

Tek cevap olaydır. / Çoklu cevap örüntüdür. / Tanımlı örneklem nüfus tahminidir. / Zaman içindeki tekrar kararlılık ölçümüdür. / Fakat bunların hiçbiri tek başına nedensellik veya sürdürülebilir değer değildir.

NOMOS’un Bölüm 1 Emri

Bana bir ekran görüntüsü getirip bütün sistem adına konuşma.

Bir kullanıcının cevabını dünya nüfusunun cevabı yapma.

Aynı hesabın tekrarlarını bağımsız insanlara dönüştürme.

Cevabı yenileyip hoşuna gideni gerçek dağılım gibi gösterme.

Retleri, hataları ve bilinmeyenleri paydadan çıkarma.

Tek dili dünyaya, tek ülkeyi bütün ülkelere, tek AI ürününü bütün üretken sistemlere genelleme.

Tekil başarıyı müdahale etkisi; tekil yanlışı bütün sistemin değişmez karakteri ilan etme.

Tek bir ağır yanlışı da ortalamanın içinde boğma.

Önce olayı kaydet. / Sonra örüntüyü ölç. / Sonra hedef nüfusu tanımla. / Sonra bağımlılığı ve belirsizliği göster. / Ve yalnız kanıtın taşıdığı kadar konuş.

Bölümün Son Cümlesi

Bir varlığın yapay zekâ sistemlerindeki temsili tek bir cevap değildir. AI ürünleri, kullanıcılar, ülkeler, diller, oturumlar ve zamanlar arasında ölçülmesi gereken bir dağılımdır.

Normatif Öz

Tek bir üretken sistem çıktısı, belirli bir cevabın kaydedilmiş koşullarda oluştuğunu gösterebilir. Ancak nüfus yaygınlığı, tipik ürün davranışı, zaman kararlılığı, diller arası tutarlılık, ülkeler arası tutarlılık, AI ürünleri arası tutarlılık, müdahale etkisi, tavsiye kesinliği, ticari sonuç, uygunluk veya GEO skoru çıkarmak için kullanılamaz. Tekil yüksek zararlı çıktı, nüfus yaygınlığı kanıtı sayılmadan ayrı Critical olay incelemesi başlatabilir.

Önerilen atıf

Muraz, Kaan. NOMOS GEO Denetim Protokolü: Üretken Sistemlerde Varlık Temsilini Küresel Nüfus Üzerinden Ölçme Protokolü. Aday nihai metin, Türkçe editoryal ana metin. NobleJackal, 2026. https://doi.org/10.5281/zenodo.22040778. https://noblejackal.com/tr/nomos-geo-audit-protocol/
© 2026 Kaan MURAZ. CC BY 4.0 ile lisanslanmıştır; atıf zorunludur.