NOMOS GEO Denetim Protokolü

07 / K04 · K06 · K07 · K20

Ülke Gözcü ve Dil Adaleti Panelleri

Ülke Gözcü ve Dil Adaleti Panelleri — Bölüm 5 şu hükmü kurdu:

Sürüm
0.9.0
Uzunluk
7.170 kelime
Durum
yayın için kilitli aday metin
Yöntemsel dayanaklar
K04 · K06 · K07 · K20

Bölüm Sınırı

Bölüm 5 şu hükmü kurdu:

Her AI ürünü için ürün-uygun kullanıcı nüfusu ayrı tanımlanmalıdır.

Bölüm 6 bu nüfusu örnekleme dönüştürdü:

Ana Population Panel, hedef nüfustaki insanlara sonuçlar görülmeden önce belirlenmiş seçilme olasılıkları ve ağırlıklar vermelidir.

Şimdi iki farklı adalet problemini çözmemiz gerekir. Birinci problem:

Nüfus ağırlığı çok küçük ülkeleri ana örneklemde görünmez bırakabilir.

İkinci problem:

Küresel nüfus ortalaması, düşük kaynaklı veya düşük nüfuslu dillerdeki ağır temsil bozulmasını gizleyebilir.

Saf nüfus örneklemi dünya nüfusundaki ortalama insan deneyimini ölçmek için güçlüdür. Fakat aynı örneklem:

  • her ülkeyi ayrı ayrı gözleyemez,
  • her dile yeterli örnek sağlayamaz,
  • küçük ülkeler için ülke skoru üretemez,

düşük kaynaklı dillerdeki nadir fakat maddi hataları yakalayamayabilir. Bu nedenle GEO-1000 yalnız tek panelden oluşamaz. Ana nüfus panelinin yanında iki tamamlayıcı yapı gerekir:

Country Sentinel Panel

Türkçesi:

Ülke Gözcü Paneli

ve:

Language Fairness Panel

Türkçesi:

Dil Adaleti Paneli

Ülke Gözcü Paneli şu soruya cevap verir:

Ana nüfus panelinde yeterince temsil edilmeyen ülkelerde en azından gerçek kullanıcı gözlemi, erişim doğrulaması veya erken risk sinyali var mı?

Dil Adaleti Paneli ise şu soruya cevap verir:

Küresel ortalama yüksek görünse bile belirli dillerde kullanıcılar maddi olarak daha yanlış, daha eksik veya daha riskli temsil görüyor mu?

Bu iki panel ana Population Panel’in yerine geçmez. Onu tamamlar. Bir ülkeye bir gözcü gözlemi vermek o ülkenin skorunu ölçmez. Bir dili fazla örneklemek de o dili küresel nüfusta olduğundan büyük yapmaz. Bu bölümün görevi:

  • ülke görünürlüğü ile nüfus ağırlığını,
  • dil adaleti ile küresel ortalamayı,
  • erken uyarı ile nüfus tahminini,
  • gözlem kapsamı ile istatistiksel yeterliliği

birbirinden ayırmaktır. Bu bölüm henüz:

  • istemlerin bütün dillerde nasıl çevrileceğini,
  • ters çeviri ve semantik eşdeğerlik testini,
  • katılımcıların ayrıntılı seçim mekanizmasını,
  • atomik iddiaların hakemlerce nasıl puanlanacağını,
  • nihai uygunluk eşiklerini

tam olarak tanımlamaz. Bu konular sonraki bölümlerde ayrıca düzenlenecektir. Bölüm 7’nin temel sorusu şudur:

Bir küresel skor üretirken küçük ülke ve dilleri yapay biçimde büyütmeden, fakat onları tamamen görünmez de bırakmadan nasıl ölçeriz?

NOMOS Challenge

Bir AI ürünü için 1.000 kişilik nüfus paneli kurdunuz. Nüfusa orantılı örneklem sonucunda:

  • birkaç büyük ülkeden yüzlerce kullanıcı,
  • bazı orta büyüklükteki ülkelerden onlarca kullanıcı,
  • küçük ülkelerin çoğundan hiç kullanıcı

geldi. Küresel skor:

94

olarak hesaplandı. Sonra şöyle dediniz: “Bu AI ürünü dünya genelinde markayı yüzde 94 doğrulukla temsil ediyor.” Fakat 70 küçük ülkede tek bir gerçek kullanıcı gözlemi bile bulunmuyor. Bu ülkeler dünya nüfusunun küçük bir bölümünü oluşturabilir. Yine de şu sorular cevapsızdır: Ürün gerçekten erişilebilir mi? İstem doğru dilde çalışıyor mu? Sistem ülkeyi başka ülkeyle karıştırıyor mu? Yerel şirket ile küresel marka birbirine karışıyor mu? Fiyat, hizmet ve hukuk bağlamı yanlış mı? Sistem cevap vermiyor mu? Düşük sıklıklı Critical hata var mı? Küresel nüfus skoru bu sorulara cevap vermez. Şimdi her ülkeye bir kişi eklediğinizi düşünün. 70 ek gözlem aldınız.

Bunları ana skorun içine, her biri 1/1.070 ağırlıkla eklediniz. Küçük ülkeleri gerçek nüfus paylarından kat kat büyük yaptınız. Bu kez coğrafi görünürlüğü artırdınız. Fakat nüfus tahminini bozdunuz. Sonra bir ülkedeki tek kullanıcının cevabı yanlış çıktı. Şöyle dediniz: “Bu ülkenin GEO skoru sıfır.” Bir kişinin cevabı ülkenin skoru değildir. Yalnız o ülkede belirli koşullarda gözlenmiş tekil olaydır. Şimdi dil tarafına geçin. İngilizce sonuç yüzde 98. Almanca yüzde 96. Türkçe yüzde 91. Düşük kaynaklı bir dilde yalnız sekiz kullanıcı var ve ham sonuç yüzde 50. Şöyle diyorsunuz: “Sekiz kişi yetersiz; bu dili rapordan çıkaralım.” Küresel skor yükseliyor. Fakat o dildeki kullanıcı deneyimi görünmez hâle geliyor.

Başka bir yaklaşımda düşük kaynaklı dile 200 ek kullanıcı veriyorsunuz. Ham örneklem ortalaması düşüyor. Sonra: “Küresel skor 84’e düştü.” diyorsunuz. Oysa dilin gerçek nüfus payı yüzde 2 olabilir. Fazla örnekleme tanı gücünü artırır. Nüfus ağırlığını artırmaz. Bu bölümün ilk hükmü şudur:

Gözlenmek ile ağırlık sahibi olmak aynı şey değildir.

İkinci hükmü şudur:

Tekil ülke gözlemi ülke skoru değildir.

Üçüncü hükmü şudur:

Dil adaleti, bütün dilleri küresel skorda eşit ağırlıklandırmak değildir.

Dördüncü hükmü şudur:

Yüksek küresel ortalama, belirli bir dildeki ağır bozulmayı ortadan kaldırmaz.

Beşinci hükmü şudur:

Kapsamı artırmak için alınan ek gözlemler, gerçek nüfus ağırlığıyla yeniden ilişkilendirilmeden ana skora eklenemez.

1. BÖLÜMÜN AMACI

Bu bölümün amacı, ana Population Panel’in istatistiksel nüfus temsilini bozmadan ülke ve dil görünürlüğünü artıran tamamlayıcı panelleri kurmaktır. Bölüm şu ayrımları normatif hâle getirir:

  • Nüfus ağırlığı ile coğrafi görünürlük
  • Ülke gözlemi ile ülke skoru
  • Tekil olay tespiti ile yaygınlık tahmini
  • Ana Population Panel ile Country Sentinel Panel
  • Country Sentinel Panel ile ülke özel doğrulama çalışması
  • Ülke sayısı kapsamı ile nüfus kapsamı
  • Dil sayısı kapsamı ile dil nüfusu kapsamı
  • Dil adaleti ile dillerin eşit küresel ağırlığı
  • Dil fazla örneklemesi ile küresel dil payı
  • Ana dil ile istem dili
  • Dil ile locale
  • Dil ile yazı sistemi
  • Desteklenen dil ile yalnız cevap üretilebilen dil
  • İstem çeviri kusuru ile AI dil kusuru
  • Kaynak eksikliği ile AI temsil kusuru
  • Hakem yetersizliği ile ürün başarısızlığı
  • Meşru yerel farklılık ile haksız dil eşitsizliği
  • Küresel ortalama ile alt grup tabanı
  • Ülke erişim kapsamı ile ülke temsil doğruluğu
  • Sentinel alarmı ile kesin uygunluk kararı
  • Tek dalga coğrafi kapsamı ile çok dalgalı gözetim çevrimi

Bu bölümün sonunda her GEO-1000 denetimi şu sorulara açık cevap verebilmelidir:

Hangi ülkelerde en az bir gerçek gözlem bulunmaktadır?

Hangi ülkelerde yalnız erken uyarı gözlemi, hangilerinde istatistiksel tahmin bulunmaktadır?

Hangi diller ölçüldü, hangileri yeterli örnekleme ulaştı ve hangileri test edilmedi?

Düşük kaynaklı diller fazla örneklendiyse küresel skora nasıl geri ağırlıklandırıldı?

Bir dildeki düşük sonucun kaynağı gerçekten AI ürünü mü; yoksa istem, kaynak, locale veya hakemlik kusuru mu?

2. MERKEZÎ NORMATİF HÜKÜM

GEO-1000, ana nüfus tahminini Population Panel ile; küçük ülke gözlemini Country Sentinel Panel ile; dil eşitsizliği ve düşük kaynaklı dil tanısını Language Fairness Panel ile ayrı ayrı yönetmelidir.

Bu üç yapı:

  • farklı amaçlara,
  • farklı örneklem hedeflerine,
  • farklı ağırlıklara,
  • farklı kamu iddialarına

sahiptir. Bir panelin gözlemi başka panelin anlamına açıklamasız biçimde dönüştürülemez. Varsayılan yapı:

PanelAna amacıÜretebileceği sonuçTek başına üretemeyeceği sonuç
Population PanelNüfus ağırlıklı küresel tahminKüresel ve tabakalı nüfus skoruHer küçük ülke için güvenilir ülke skoru
Country Sentinel PanelCoğrafi gözlem ve erken uyarıÜlke gözlem kapsamı, tekil olay, erişim sinyaliÜlke nüfus oranı
Language Fairness PanelDil bazlı tanı ve eşitsizlik ölçümüDil skorları, dil tabanı, adalet farkıDilleri küresel nüfusta otomatik eşit ağırlıklandırma

3. ÜLKE GÖZCÜ PANELİ NEDİR?

Country Sentinel Panel, ana nüfus panelinde yeterince veya hiç temsil edilmeyen ülkelerde:

  • ürün erişimini,
  • istem uygulanabilirliğini,
  • temel varlık çözümlemesini,
  • dil ve locale davranışını,
  • erken Critical hata sinyalini

gözlemek üzere kurulan tamamlayıcı denetim panelidir. Ülke Gözcü Paneli’nin temel görevi skor üretmek değildir.

Görünmeyen ülkeyi ilk kez görünür hâle getirmektir.

Bir gözcü gözlemi şunu gösterebilir: “Belirtilen ülkede, belirtilen AI ürünü, kullanıcı yüzeyi, dil ve zaman koşulunda bu sonuç en az bir kez gözlenmiştir.” Şunu gösteremez: “Bu ülkedeki kullanıcıların yüzde X’i aynı sonucu görür.”

4. ÜLKE GÖZCÜ BİRİMİ

Ülke Gözcü Paneli’nin temel gözlem birimi yalnız ülke değildir. Tercih edilen birim:

S_{c,a,l,s,w}

şeklindedir. Burada:

  • c: ülke veya yargı alanı
  • a: AI ürünü ve kullanıcı yüzeyi
  • l: dil, yazı sistemi ve locale
  • s: oturum veya plan koşulu
  • w: ölçüm dalgası

Bu ayrım gereklidir. Aynı ülkede:

  • birden fazla dil,
  • farklı planlar,
  • web ve mobil yüzeyler,
  • farklı hukuki veya teknik erişim koşulları

bulunabilir. Bir ülkeye bir kullanıcı eklemek, ülkenin bütün dil ve kullanıcı yüzeylerini gözlemek anlamına gelmez.

5. ÜLKE GÖZCÜ PANELİNİN GÖREVLERİ

5.1. Erişim Doğrulaması

Ürün resmî kayıtta ülkede erişilebilir görünse de gerçek kullanıcı:

  • oturum açamayabilir,
  • belirtilen yüzeye erişemeyebilir,

plan veya doğrulama engeliyle karşılaşabilir. Gözcü gözlemi resmî erişim kaydını saha düzeyinde sınar.

5.2. Temel Kimlik Kontrolü

AI ürünü denetlenen varlığı:

  • doğru şirket,
  • doğru marka,
  • doğru ülke ilişkisi

içinde çözümleyebiliyor mu?

5.3. Locale Sapması Tespiti

Aynı dilde farklı ülke locale’lerinde:

  • fiyat,
  • şirket,
  • hizmet,
  • hukuk,
  • tavsiye

değişiyor mu? Değişiyorsa bu fark maddi ve açıklanabilir mi?

5.4. Düşük Sıklıklı Ağır Hata Sinyali

Tek bir gözcü cevabında:

  • yanlış lisans,
  • yanlış hukuki varlık,
  • tehlikeli sağlık veya güvenlik bilgisi,
  • ağır kimlik birleşmesi

gözlenebilir. Tekil olay ülke yaygınlığını göstermez. Ancak doğrulama çalışmasını tetikleyebilir.

5.5. Yeni Araştırma Hipotezi

Gözcü paneli şu soruyu doğurabilir: “Bu olay tekil mi, yoksa ülkedeki kullanıcılar arasında tekrar eden bir örüntü mü?” Bu soru hedefli ek örneklemle sınanır.

5.6. Coğrafi Kapsam Kaydı

Ürünün kaç uygun ülkede gerçek kullanıcı gözlemi bulunduğunu gösterir. Bu, ülke skorlarının sayısı değildir. Gözlemsel kapsamdır.

6. ÜLKE GÖZCÜ PANELİNİN YAPAMAYACAĞI ŞEYLER

Ülke Gözcü Paneli tek başına:

  • güvenilir ülke skoru,
  • ülke nüfus oranı,
  • ülke sıralaması,
  • ülke uygunluk kararı,
  • ülke bazlı model üstünlüğü

üretemez. Bir ülkede tek gözcü cevabı doğruysa: “Ülke skoru 100” denemez. Yanlışsa: “Ülke skoru sıfır” denemez. Doğru statü:

OBSERVED_PASS

OBSERVED_ISSUE

OBSERVED_CRITICAL_CANDIDATE

ACCESS_FAILURE

INSUFFICIENT_FOR_COUNTRY_ESTIMATE

gibi gözlemsel kayıtlardır.

7. UYGUN ÜLKE SİCİLİ

Her AI ürünü için bir Uygun Ülke Sicili oluşturulmalıdır. Her ülke şu statülerden birini taşıyabilir:

CE-0 — UNKNOWN

Ürün ve denetim erişim durumu belirlenememiştir.

CE-1 — OUTSIDE NATIVE REACH

Ürün resmî veya meşru kullanım alanı dışında kalmaktadır. Ülke temsil doğruluğu skoruna alınmaz. Erişim kapsamı açığı olarak gösterilir.

CE-2 — RESTRICTED OR SPECIAL ACCESS

Yalnız:

  • kurum,
  • davet,
  • plan,
  • cihaz,
  • kullanıcı türü

üzerinden erişim vardır. Ayrı panel gerekebilir.

CE-3 — ELIGIBLE FOR SENTINEL OBSERVATION

Ürün, ilgili kullanıcı yüzeyi ve en az bir denetim dili bakımından gözcü gözlemine uygundur.

CE-4 — ELIGIBLE FOR POPULATION ESTIMATION

Ülke ana nüfus panelinde ürün-uygun nüfus payına sahiptir.

CE-5 — ELIGIBLE FOR COUNTRY ESTIMATION

Yeterli örneklem, etkin örneklem, dil kapsamı ve kalite koşulları altında ülke tahmini üretilebilir. Bir ülke CE-3 olabilir fakat CE-5 olmayabilir. Bu, ülkenin gözlendiği fakat güvenilir ülke skoru üretilemediği anlamına gelir.

8. GÖZCÜ GÖZLEMİ İLE ÜLKE TAHMİNİ ARASINDAKİ MERDİVEN

CS-0 — NOT OBSERVED

Uygun ülke için geçerli gözcü gözlemi yoktur.

CS-1 — SINGLE SENTINEL OBSERVATION

Bir geçerli ülke–ürün–dil gözlemi vardır. Yalnız olay kaydı üretir.

CS-2 — REPEATED SENTINEL OBSERVATION

Farklı dalga veya kullanıcılardan birkaç gözlem vardır. Örüntü şüphesi oluşturabilir. Ülke oranı için yeterli değildir.

CS-3 — EXPLORATORY COUNTRY SAMPLE

Bölüm 6’daki keşif örneklem bandına ulaşılmıştır. Geniş belirsizlikle keşif sonucu verilebilir.

CS-4 — PROVISIONAL COUNTRY ESTIMATE

Yeterli ve dengeli örneklem altında geçici ülke tahmini üretilebilir.

CS-5 — COUNTRY ESTIMATION CANDIDATE

Yeterli etkin örneklem, dil/locale kapsamı, tekrar dalgaları ve kalite kontrolleri bulunmaktadır. Ülke skoru adayı olabilir. Kesin eşikler pilot ve dış incelemeyle kalibre edilmelidir.

9. GÖZCÜ ÇEVRİMİ

Bütün uygun ülkelerin her dalgada gözlenmesi maliyet ve operasyon bakımından mümkün olmayabilir. Bu nedenle Gözcü Çevrimi kullanılabilir. Ölçüm dalgaları:

w=1,2,…,K

ve uygun ülkeler: c∈CS olsun. Ülke c’nin dalga w’de gözcü gözleme atanması:

z_{c,w} = 1 (ülke dalgada gözlenecekse); aksi hâlde z_{c,w} = 0

şeklinde gösterilebilir. Temel çevrim koşulu:

Σ_{w=1}^K z_{c,w} ≥ 1

olmalıdır. Yani uygun her ülke, tanımlı gözetim çevrimi içinde en az bir kez gözlenmelidir. Bu hüküm:

  • her ülkenin her dalgada gözleneceği,
  • bir gözlemin ülke skoru oluşturacağı

anlamına gelmez.

10. GÖZCÜ SIKLIK SINIFLARI

Ülkeler önceden tanımlanmış sıklık sınıflarına ayrılabilir.

SF-0 — OUTSIDE REACH

Ürün erişimi yoktur. Kullanıcı temsili gözlemi yapılmaz. Erişim statüsü izlenir.

SF-1 — ONCE PER SURVEILLANCE CYCLE

Düşük riskli, küçük veya Population Panel’de zaten yeterli dolaylı kapsam taşıyan ülkeler.

SF-2 — PERIODIC SENTINEL

Belirli aralıklarla yeniden gözlenir.

SF-3 — EVERY PRINCIPAL WAVE

Şu nedenlerle her ana dalgada gözlenebilir:

  • yüksek kullanıcı nüfusu,
  • maddi hedef pazar,
  • önceki ciddi hata,
  • hızlı erişim veya mevzuat değişimi,

yüksek riskli hizmet alanı.

SF-4 — INCIDENT MONITORING

Doğrulanmış Critical olay veya sürekli temsil bozulması nedeniyle sıklaştırılmış gözlem. Sıklık sınıfı sonuçlara bakıldıktan sonra geçmişe dönük değiştirilemez. Yeni olay, sonraki dalga için yeni sürüm oluşturabilir.

11. SENTINEL ÖNCELİĞİ

Ülke gözcü sıklığı yalnız nüfusa göre belirlenmemelidir. İlgili olduğu ölçüde şu alanlar dikkate alınabilir:

  • Ürün-uygun nüfus
  • Varlığın gerçek hizmet veya pazar kapsamı
  • Önceki yanlış temsil kayıtları
  • Yüksek riskli kullanıcı etkisi
  • Ürün erişimindeki değişiklik
  • Dil ve locale benzersizliği
  • Düşük kaynaklı dil kullanımı
  • Hukuki veya operasyonel farklılık
  • Son gözlemden bu yana geçen süre

Bu alanlar önceden belirlenmiş yönetişim kuralıyla kullanılmalıdır. “Bu ülkenin sonucu kötü, daha az ölçelim.” yaklaşımı yasaktır.

12. ÜLKE GÖZCÜ KAPSAM METRİKLERİ

Ülke kapsamı tek sayı değildir. En az üç ayrı metrik kullanılmalıdır.

12.1. Ülke Gözlem Kapsamı

En az bir geçerli gözcü veya nüfus gözlemi bulunan uygun ülkelerin oranıdır.

COC_count = |{c ∈ C_S : n_c^obs > 0}| / |C_S|

Bu metrik ülke sayısı bakımından kapsamı gösterir.

12.2. Nüfus Ağırlıklı Ülke Gözlem Kapsamı

En az bir geçerli gözleme sahip ülkelerdeki uygun nüfusun toplam hedef nüfusa oranıdır.

COC_pop = [Σ_{c:n_c^obs>0} N_c] / [Σ_{c∈C_S} N_c]

Bu metrik büyük nüfusların gözlenip gözlenmediğini gösterir.

12.3. Ülke Tahmin Kapsamı

Yeterli ülke örneklemine ulaşan ülkelerin oranıdır.

CEC = |{c : n_{c,eff} ≥ m_c}| / |C_S|

Burada mc, ülke tahmini için önceden belirlenmiş yeterlilik eşiğidir. Bir denetim:

  • yüzde 100 ülke gözlem kapsamı,
  • yüzde 99 nüfus gözlem kapsamı,
  • yalnız yüzde 10 ülke tahmin kapsamı

taşıyabilir. Bu sonuçlar birbirine dönüştürülemez.

13. GÖZCÜ ALARMI

Bir gözcü gözleminde maddi sorun bulunduğunda Gözcü Alarmı oluşturulur. Alarm türleri:

SA-1 — ACCESS ANOMALY

Resmî erişim kaydı ile gerçek kullanıcı erişimi çelişir.

SA-2 — VARLIK ANOMALY

Varlık başka şirket, ürün veya ülke operasyonuyla birleşir.

SA-3 — LANGUAGE OR LOCALE ANOMALY

Yanlış dil, yanlış ülke bağlamı veya belirgin locale sapması oluşur.

SA-4 — MATERIAL FACT ANOMALY

Maddi fiyat, hizmet, kapasite, ortaklık veya zaman yanlışı bulunur.

SA-5 — CRITICAL INCIDENT CANDIDATE

Sağlık, hukuk, finans, güvenlik, lisans veya ağır kimlik yanlışı bulunur.

SA-6 — REFERENCE OR İSTEM ANOMALY

Sorunun kaynağı AI yanıtı değil:

  • istem,
  • çeviri,
  • resmî kaynak,
  • hakemlik

kusuru olabilir. Alarm, otomatik ülke başarısızlığı değildir. Doğrulama ve eskalasyon başlangıcıdır.

14. GÖZCÜ ESKALASYON PROTOKOLÜ

Adım 1 — Geçerlilik Doğrulaması

Gözlem gerçekten protokole uygun mu? Doğru ülke Doğru ürün Doğru istem Doğru dil İlk uygun çıktı Tam kanıt kontrol edilir.

Adım 2 — Olayın Yeniden Kodlanması

Sorun:

  • AI ürünü,
  • referans kaydı,
  • istem,
  • katılımcı,
  • erişim

kaynaklarından hangisine ait olabilir?

Adım 3 — Bağımsız Tekrar

Sonuç seçmeden, önceden belirlenmiş yeni kullanıcı veya oturumlarla doğrulama yapılır.

Adım 4 — Hedefli Örneklem

Olay devam ediyorsa ülke özel örnekleme geçilebilir. Örneklem büyüklüğü:

  • olay şiddeti,
  • beklenen yaygınlık,
  • ülke nüfusu,
  • dil çeşitliliği

üzerinden önceden tanımlanır.

Adım 5 — Karar Ayrımı

Şu sonuçlar ayrı tutulur:

  • Tekil doğrulanmış olay
  • Tekrarlanan örüntü
  • Ülke oranı
  • Critical uygunluk etkisi

Tekil Critical olay yaygınlık tahmini olmadan da uygunluk incelemesini etkileyebilir.

15. DİL ADALETİ NEDİR?

Dil adaleti:

Bütün dillerin kelime kelime aynı cevabı alması değildir.

Şu anlama gelir:

Semantik olarak eşdeğer ve maddi bakımdan karşılaştırılabilir kullanıcı sorularında, gerçek yerel farklılıklar dışında, kullanıcıların dili nedeniyle sistematik olarak daha yanlış, daha eksik, daha kanıtsız veya daha riskli temsil görmemesi.

Dil adaleti şu eşitliği aramaz:

R_Türkçe = R_İngilizce = R_Japonca

kelime kelime. Şunu arar:

Kimlik, maddi gerçeklik, sınır, zaman, kaynak statüsü ve kullanıcı uygunluğu bakımından karşılaştırılabilir temsil.

16. DİL FARKI HER ZAMAN ADALETSİZLİK DEĞİLDİR

Aşağıdaki nedenlerle dil sonuçları meşru biçimde farklılaşabilir: Yerel hizmet kapsamı farklıdır. Fiyat ve sözleşme koşulları ülkeye göre değişir. Hukuki bilgi yargı alanına bağlıdır. Kullanıcı niyeti farklıdır. Promptlar semantik olarak aynı değildir. Resmî kaynaklar diller arasında farklı kapsam taşır. AI ürünü ilgili dili resmî olarak desteklemiyordur. Bu farkların her biri kayıt altına alınmalıdır. Açıklanabilir yerel fark: adaletsizlik olarak etiketlenmemelidir. Fakat gerçeklik aynı olduğu hâlde düşük kaynaklı dilde:

  • şirket kimliği bozuluyor,
  • sınırlar kaldırılıyor,
  • yanlış lisans ekleniyor,
  • cevap sürekli başka dilde veriliyor

ise dil temelli temsil problemi olabilir.

17. DİL BİRİMİ

Dil değerlendirmesinde yalnız genel dil adı yeterli olmayabilir. Tercih edilen dil birimi:

L=(λ,σ,ℓ,d)

şeklinde düşünülebilir. Burada:

  • λ: dil
  • σ: yazı sistemi
  • ℓ: locale veya ülke bağlamı
  • d: görev veya alan

Örnek olarak aynı dil:

  • farklı yazı sisteminde,
  • farklı ülkede,
  • hukuk veya sağlık alanında

ayrı ölçüm hücresi gerektirebilir. Bir dilin bütün kullanıcıları tek homojen grup değildir.

18. DİL DESTEK STATÜLERİ

Her AI ürünü, dil ve kullanıcı yüzeyi için şu statülerden biri kullanılabilir:

LS-0 — UNKNOWN

Destek durumu belirlenememiştir.

LS-1 — NOT SUPPORTED

Ürün ilgili dili resmî olarak desteklememektedir. Ana desteklenen dil skoru içinde değerlendirilmez. Deneysel test yapılabilir.

LS-2 — OBSERVED BUT UNSUPPORTED

Ürün cevap üretebilmektedir. Fakat resmî destek veya kalite taahhüdü yoktur. Ayrı deneysel sonuç olarak raporlanır.

LS-3 — LIMITED SUPPORT

Belirli görev, arayüz veya özelliklerde destek vardır.

LS-4 — OFFICIALLY SUPPORTED

Ürün dili genel olarak desteklediğini beyan etmektedir.

LS-5 — AUDIT-ELIGIBLE

Dil:

  • resmî destek,
  • istem eşdeğerliği,
  • yerel hakem,
  • referans yeterliliği,
  • geçerli capture

bakımından tam denetime uygundur. Resmî destek bulunması tek başına LS-5 oluşturmaz.

19. DÜŞÜK KAYNAKLI DİL

“Düşük kaynaklı dil” ifadesi dilin değerini veya insanlarının niteliğini tanımlamaz. Belirli teknoloji ve denetim bağlamında şu eksikliklerden birini veya birkaçını ifade eder:

  • Sınırlı dijital içerik
  • Az yerelleştirilmiş resmî kaynak
  • Az değerlendirme veri seti
  • Sınırlı hakem erişimi
  • Düşük ürün desteği
  • Az terminoloji kaynağı
  • Sınırlı makine çeviri kalitesi
  • Düşük kullanıcı paneli erişimi

Bir dil bir alanda düşük kaynaklı, başka alanda güçlü olabilir. Örneğin günlük konuşmada güçlü kaynak taşırken:

  • hukuk,
  • tıp,
  • belirli teknik alan

için sınırlı kaynak taşıyabilir. Bu nedenle dil kaynak düzeyi:

  • ürün,
  • görev,
  • zaman,
  • alan

ile birlikte tanımlanmalıdır.

20. DİL ADALETİ PANELİNİN GÖREVLERİ

20.1. Düşük Örnekli Dilleri Fazla Örneklemek

Ana nüfus panelinde yeterli gözlem almayan diller için ek kullanıcılar sağlar.

20.2. Dil Bazlı Maddi Hata Dağılımını Ölçmek

Yalnız genel doğruluk değil:

  • kimlik,
  • kapsam,
  • zaman,
  • kaynak,
  • tavsiye,
  • Critical hata

sonuçlarını ayrı inceler.

20.3. Yanıt Dilini Doğrulamak

AI istem diliyle uyumlu cevap veriyor mu? Başka dile geçiyorsa bunun nedeni nedir?

20.4. Dil ve Locale Ayrımını İncelemek

Aynı dil farklı ülkelerde farklı yerel gerçeklik taşıyor mu? AI bu farkı doğru yönetiyor mu?

20.5. Kaynak ve Resmî Temsil Paritesini İncelemek

Varlığın resmî kayıtları bütün dillerde aynı maddi gerçekliği taşıyor mu? Düşük AI sonucu kaynağın kendisindeki dil açığından doğabilir.

20.6. İstem Eşdeğerliğini Sınamak

Çeviriler gerçekten aynı kullanıcı niyetini taşıyor mu?

20.7. Hakem Paritesini Sınamak

Farklı dillerdeki hakemler aynı normatif standardı uygulayabiliyor mu?

21. DİL ADALETİ İÇİN DÖRT KAPI

Bir dil sonucu AI ürününün dil performansına atfedilmeden önce dört kapı değerlendirilmelidir.

Kapı 1 — İstem Eşdeğerliği

Promptlar semantik olarak karşılaştırılabilir mi? Başarısızsa:

PROMPT_EQUIVALENCE_FAILURE

statüsü verilir.

Kapı 2 — Referans Paritesi

Resmî ve doğrulanmış gerçeklik kayıtları ilgili dil için yeterli mi? Başarısızsa:

REFERENCE_LANGUAGE_GAP

statüsü verilir.

Kapı 3 — Ölçüm Paritesi

Capture, oturum, arayüz ve kullanıcı şartları karşılaştırılabilir mi? Başarısızsa:

MEASUREMENT_PARITY_FAILURE

statüsü verilir.

Kapı 4 — Hakem Paritesi

Ana dil veya yeterli yerel uzmanlıkta hakemler ve aynı değerlendirme kuralları var mı? Başarısızsa:

ADJUDICATION_LANGUAGE_GAP

statüsü verilir. Dört kapı yeterince karşılanmadan: “AI ürünü bu dilde daha kötüdür.” hükmü kesin biçimde kurulamaz. Dil açığı yine de GEO ekosistem bulgusudur. Fakat kaynağı doğru sınıflandırılmalıdır.

22. DİL EVRENİNİN KURULMASI

“Bütün diller” ifadesi sınırlandırılmadan kullanılamaz. Her denetim bir Kapsamdaki Dil Sicili oluşturmalıdır. Diller şu gruplardan seçilebilir:

22.1. Küresel Core Language Set

Ürün-uygun nüfusta geniş insan kitlesi tarafından kullanılan ana diller.

22.2. Varlık Market Language Set

Denetlenen varlığın:

  • hizmet,
  • içerik,
  • müşteri,
  • sözleşme

bakımından hedeflediği diller.

22.3. Product Support Language Set

AI ürününün resmî olarak desteklediği diller.

22.4. Low-Resource Sentinel Language Set

Nüfus panelinde zayıf kalan veya ürün davranışı bakımından risk taşıyan düşük kaynaklı diller.

22.5. High-Risk Language Set

Sağlık, hukuk, finans veya güvenlik bağlamında maddi kullanıcı etkisi taşıyan diller.

22.6. Experimental Language Set

Ürünün resmî olarak desteklemediği fakat gözlemsel veya araştırma amacıyla test edilen diller. Bu gruplar kesişebilir. Her dilin neden kapsama alındığı kaydedilmelidir.

23. DİL ADALETİ TAHSİSİ

Dil l için ana nüfus panelindeki hedef: nlP olsun. Adalet panelindeki ek hedef: nlF olsun. Toplanan toplam dil gözlemi:

n_l^T = n_l^P + n_l^F

olur. Küresel nüfus hesabında dilin toplam ağırlığı: Wl olarak korunur. Her gözleme düşen normalize ağırlık:

w_{i,l} = W_l / n_l^T

şeklinde düşünülebilir. Böylece dil fazla örneklenir. Fakat küresel skorda gerçek nüfus payını aşmaz.

24. DİL ADALETİ PANELİNİN KÜRESEL SKORA KATILIMI

Dil Adaleti gözlemleri iki yöntemle kullanılabilir.

24.1. Ayrı Tanısal Analiz

Adalet paneli yalnız dil skorlarını ve hata türlerini üretir. Ana Population Panel küresel skoru değiştirmez. Bu yöntem daha basittir.

24.2. Birleşik Yeniden Ağırlıklı Analiz

Population ve Language Fairness gözlemleri birlikte kullanılır. Her gözlem gerçek hedef dil nüfus ağırlığına göre yeniden ağırlıklandırılır. Bu yöntem bilgi hacmini artırabilir. Ancak:

  • çift sayım,
  • çok dilli kullanıcı,
  • panel bağımlılığı,
  • ağırlık değişkenliği

dikkate alınmalıdır. Kullanılan yöntem sonuçlar görülmeden önce tanımlanmalıdır.

25. DİL KAPSAM METRİKLERİ

25.1. Dil Gözlem Kapsamı

En az bir geçerli gözleme sahip kapsamdaki dillerin oranıdır.

LOC = |{l : n_l^obs > 0}| / |L_scope|

25.2. Dil Tahmin Kapsamı

Yeterli örneklem ve kalite şartlarına sahip dillerin oranıdır.

LEC = |{l : n_{l,eff} ≥ m_l}| / |L_scope|

25.3. Nüfus Ağırlıklı Dil Kapsamı

Yeterli biçimde gözlenen dil nüfusunun toplam hedef dil nüfusuna oranıdır. Çok dilli kullanıcıların çifte sayılmasını önleyecek ana denetim dili veya bölünmüş kişi ağırlığı gerektirir.

25.4. Ürün Destek Kapsamı

Kapsamdaki dillerin kaçında ürünün resmî destek sağladığını gösterir. Dil desteği ile temsil doğruluğu ayrı tutulur.

26. DİL EŞİTSİZLİĞİ METRİKLERİ

CANDIDATE METRICS — ADAY METRİKLER

Kesin metrik seti pilot ve dış incelemeyle kalibre edilmelidir.

26.1. Dil Sonucu

Her yeterli dil hücresi için: θl hesaplanır.

26.2. En Yüksek–En Düşük Farkı

DG_max = max_l θ_l − min_l θ_l

Kolay anlaşılır. Fakat küçük ve oynak tek hücreye duyarlıdır.

26.3. Sağlam Yüzdelik Farkı

DG_{90−10} = Q_{0,90}(θ_l) − Q_{0,10}(θ_l)

Aşırı uç hücrelere daha az duyarlıdır.

26.4. Dil Tabanı

Yeterli örneklem taşıyan en düşük dil sonucudur.

LF_min = min_{l∈L_est} θ_l

Bu değer küçük hücre belirsizliğiyle birlikte verilmelidir.

26.5. Sağlam Dil Tabanı

Yeterli dillerin alt yüzdelik veya alt grup ortalamasıdır. Örnek:

LF_10 = Q_{0,10}(θ_l)

26.6. Dil Critical Hata Oranı

Her dil için:

CR_l = doğrulanmış Critical hata içeren geçerli yanıt / geçerli dil yanıtı

Küresel ortalamadan ayrı yayımlanır.

26.7. Dil Bilinmeyen Oranı

U_l = UNKNOWN veya çözülemeyen yanıt / ilgili dil gözlemi

Yüksek bilinmeyen oranı düşük skor kadar önemli olabilir.

27. EŞİT DİL SKORU VE NÜFUS AĞIRLIKLI SKOR

Bütün dilleri eşit ağırlıklandıran tanısal sonuç üretilebilir:

G_equal-language = (1/L)Σ_{l=1}^L θ_l

Bu sonuç: “Ortalama test edilen dil deneyimi” sorusuna yaklaşır. Dünya nüfusundaki ortalama insan deneyimini temsil etmez. Nüfus ağırlıklı dil sonucu:

G_population-language = Σ_l W_lθ_l

ise nüfus dağılımını korur. İki skor farklıdır. Birbirinin yerine kullanılamaz. Dil adaleti kartında ikisi birlikte gösterilebilir.

28. DİL ADİLİĞİ EŞİT SONUÇ ZORUNLULUĞU DEĞİLDİR

İki dilde aynı skorun oluşmaması otomatik ihlal değildir. Fark şu nedenlerle açıklanabilir:

  • Gerçek yerel hizmet farkı
  • Ülkeye özgü hukuk
  • Ürünün resmî destek kapsamı
  • Kaynak erişimi
  • Kullanıcı niyeti
  • İstem alanı

Ancak farkın kaynağı açıklanamıyorsa veya düşük kaynaklı diller sistematik olarak:

  • yanlış kimlik,
  • yanlış yetki,
  • maddi eksiklik,
  • yüksek Critical hata

taşıyorsa dil adaleti sorunu vardır. NOMOS dil adaletini şöyle tanımlar:

Eşdeğer maddi koşullarda, dilin kendisinin sistematik yanlış temsil nedeni olmaması.

29. DİL VE ÜLKE KESİŞİMİ

Dil skoru, ülkelerden bağımsız değildir. Aynı dil:

  • farklı ülkelerde,
  • farklı ürün erişimi,
  • farklı yerel kaynak,
  • farklı hukuk,
  • farklı fiyat

bağlamında kullanılabilir. Bu nedenle gerektiğinde ülke–dil hücresi: (c,l) ayrı incelenmelidir. Örnek:

  • Almanya × Türkçe
  • Türkiye × Türkçe
  • Birleşik Krallık × Türkçe

aynı dil ama farklı locale ve pazar bağlamı taşıyabilir. Dil adaleti yalnız ülkenin resmî diliyle ölçülemez.

30. ÜLKE GÖZCÜ VE DİL ADALETİ PANELİNİN KESİŞİMİ

Bir gözlem aynı anda:

  • küçük ülke gözcü gözlemi,
  • düşük kaynaklı dil gözlemi

olabilir. Bu durumda kayıt şu alanları taşımalıdır:

PRIMARY_PANEL_ROLE

SECONDARY_DIAGNOSTIC_TAGS

nüfus ağırlığı Sentinel statüsü Dil Adaleti statüsü Aynı gözlem iki ayrı panelde tam ağırlıkla sayılmaz. Tek gözlemdir. Birden fazla tanısal etiketi vardır.

31. SENTINEL VE DİL PANELİNDE KATILIMCI DEĞİŞTİRME

Katılımcı yalnız protokol ihlali nedeniyle değiştirilebilir. Aşağıdaki sonuçlar değiştirme nedeni değildir:

  • Yanlış AI cevabı
  • Ret
  • Başka dilde cevap
  • Critical hata
  • Varlık karışıklığı
  • Olumsuz tavsiye

Bunlar ölçüm sonucudur. Sentinel panelin amacı özellikle beklenmeyen olayları bulmaktır. Beklenmeyen olay çıktığı için kullanıcıyı değiştirmek panelin amacını yok eder.

32. DİL HAKEMLİĞİ

Dil Adaleti Paneli’nde hakemlik en azından şu koşulları taşımalıdır:

  • İstem ve cevabı doğal veya yüksek yeterlilikte anlayabilme
  • Yerel terminoloji bilgisi
  • Kanıt kaynaklarını değerlendirebilme
  • Aynı normatif değerlendirme rehberini kullanma
  • Model ve mümkünse marka çıkarından kör olma
  • Çıkar çatışmasını açıklama
  • Anlaşmazlıkta üçüncü hakem yolu

Hakem bulunamayan dil:

ADJUDICATION_LANGUAGE_GAP

statüsü taşımalıdır. Otomatik çeviriyle İngilizceye çevrilip bütün nüanslar doğru kabul edilemez. Makine çevirisi yardımcı araç olabilir. Nihai yerel anlam doğrulaması değildir.

33. KAYNAK PARİTESİ

Varlığın İngilizce sitesinde:

  • kapsam,
  • fiyat,
  • lisans,
  • sınırlar,
  • kanıtlar

bulunuyor; başka dil sürümünde bunlar yoksa düşük AI sonucu yalnız model sorunu olmayabilir. Üç ayrı sonuç gerekir:

  • Varlık Language Source Gap
  • AI Product Language Representation Gap
  • Combined User-Facing Gap

Kullanıcı açısından nihai sorun yine gerçektir. Fakat düzeltme sorumluluğu farklı olabilir:

  • varlık,
  • AI sağlayıcısı,

her ikisi.

34. İSTEM PARİTESİ

Semantik olarak eşdeğer olmayan promptlar farklı cevap üretir. Örnek: Bir dilde: “Bu şirket ne iş yapar?” Başka dilde: “Bu şirket güvenilir ve önerilebilir midir?” sorulursa sonuçlar karşılaştırılamaz. İstem Anayasası sonraki bölümde ayrıntılandırılacaktır. Bu bölümün hükmü şudur:

İstem eşdeğerliği doğrulanmadan dil skoru farkı AI dil performansına atfedilemez.

35. YANIT DİLİ SAPMASI

Kullanıcı Türkçe istem verir. AI İngilizce cevap üretir. Bu sonuç:

  • maddi olgular doğru olsa bile,
  • kullanıcı deneyimini,
  • erişilebilirliği,
  • comprehension’ı

etkileyebilir. Yanıt dili sapması ayrı kaydedilmelidir:

MATCHED_LANGUAGE

PARTIAL_CODE_SWITCH

UNREQUESTED_LANGUAGE_SWITCH

UNUSABLE_LANGUAGE_OUTPUT

UNKNOWN

Kod değiştirme her zaman hata değildir. Örneğin teknik terimlerin İngilizce kullanımı normal olabilir. Yanıtın ana kullanılabilirliğini bozuyorsa maddidir.

36. YAZI SİSTEMİ VE TRANSLİTERASYON

Aynı dil farklı yazı sistemlerinde kullanılabilir. Bir varlığın:

  • adı,
  • ürün adı,
  • hukuki kimliği

transliterasyon sırasında başka varlıkla karışabilir. Dil Adaleti Paneli ilgili olduğu ölçüde:

  • yazı sistemi,
  • transliterasyon,
  • resmî yerel ad,
  • kullanıcı tarafından kullanılan ad

alanlarını kaydetmelidir. Yazı sistemi farkı yalnız biçimsel sayılmamalıdır. Varlık çözümlemesini etkiliyorsa maddidir.

37. SENTETİK ÜLKE GÖZCÜ ÇEVRİMİ

SENTETİK METODOLOJİ GÖSTERİMİ / Aşağıdaki ürün, ülkeler, sayılar ve sonuçlar kurgusaldır. Orion AI adlı sentetik ürünün Native Reach sicilinde: 120 uygun ülke bulunsun. Ana Population Panel, nüfus ağırlığı nedeniyle ilk dalgada yalnız 38 ülkeden geçerli gözlem üretmiş olsun.

37.1. İlk Dalga Kapsamı

Uygun ülke sayısı: 120 En az bir gözlem bulunan ülke: 38

COC_count = 38/120 = %31,7

Bu 38 ülke uygun nüfusun yüzde 97’sini taşısın.

COC_pop = %97

Sonuç: Ülke sayısı kapsamı düşük, nüfus kapsamı yüksektir.

37.2. Dört Dalgalı Gözcü Çevrimi

Kalan 82 ülke dört dalgaya, önceden dondurulmuş rastgele ve risk tabanlı programla dağıtılsın. Her ülke çevrim içinde en az bir kez gözlensin. Dördüncü dalga sonunda:

COC_count = 120/120 = %100

olur. Fakat ülke tahmini için yeterli örnekleme yalnız 14 ülkede ulaşılmış olsun.

CEC = 14/120 = %11,7

Doğru kamu kaydı: Ülke gözlem kapsamı: %100 / Nüfus gözlem kapsamı: %100’e yakın / Ülke tahmin kapsamı: %11,7 Yanlış kamu kaydı: “120 ülkenin tamamı güvenilir ülke skoruna sahiptir.”

37.3. Küçük Ülke Critical Alarmı

Sentinel gözleminde küçük J ülkesindeki AI cevabı denetlenen varlığı: lisanslı hukuk firması olarak yanlış tanımlasın. Gerçekte varlık hukuk hizmeti vermiyor olsun. Tek gözlem: J ülkesinin hata oranını göstermez, Critical olay adayını gösterir. Protokol: Gözlem geçerliliğini doğrular. İstem ve referans kaydını inceler. Yeni bağımsız kullanıcılarla tekrar yapar. Olay sürerse hedefli ülke örneklemi açar. Critical uygunluk etkisini ayrı değerlendirir. Tek olay küçüktür. Potansiyel zarar küçük olmak zorunda değildir.

38. SENTETİK DİL ADALETİ GÖSTERİMİ

SENTETİK ÖRNEK — GERÇEK AI VEYA ŞİRKET PERFORMANSI DEĞİLDİR

Sentetik Apple.com Core Identity sınama’ında beş dil bulunsun. Ana Population Panel tahsisi:

DilNüfus ağırlığıAna panel gözlemi
L1%55550
L2%25250
L3%10100
L4%660
L5%440
Toplam%1001.000

Sentetik dil sonuçları:

DilGeçiş oranı
L1%95
L2%92
L3%88
L4%65
L5%58

Nüfus ağırlıklı küresel sonuç:

0,55(95)+0,25(92)+0,10(88)+0,06(65)+0,04(58)=90,27

Küresel skor yüksektir. Fakat iki dilde ağır bozulma vardır.

38.1. Dil Adaleti Fazla Örneklemesi

L4’e 140, L5’e 160 ek gözlem alınsın. Yeni gözlem sayıları:

DilToplam gözlem
L1550
L2250
L3100
L4200
L5200
Toplam1.300

Ham 1.300 gözlem ortalaması yaklaşık: olabilir. Bu küresel nüfus skoru değildir. Çünkü L4 ve L5 fazla örneklenmiştir. Nüfus ağırlıkları korunduğunda küresel sonuç yine yaklaşık: olur. Fazla örnekleme küresel ortalamayı değiştirmedi. L4 ve L5 sonuçlarının hassasiyetini artırdı.

38.2. Dil Adaleti Sonuç Kartı

Sentetik sonuç: Nüfus ağırlıklı küresel skor: 90,27 Eşit dil skoru:

(95+92+88+65+58)/5=79,6

En yüksek–en düşük dil farkı: 37 puan En düşük dil: 58 Alt iki dil ortalaması: 61,5 Düşük kaynaklı dillerde Critical hata oranı: ayrıca raporlanır İstem eşdeğerliği: doğrulanmış varsayılsın Referans paritesi: doğrulanmış varsayılsın Doğru yorum:

Küresel nüfus temsili yüksek görünmektedir; ancak dil adaleti ciddi biçimde zayıftır.

Yanlış yorum: “Küresel skor 90 olduğu için bütün dillerde GEO başarılıdır.”

39. DİL BOZULMASININ KAYNAĞINI AYIRAN SENTETİK VAKA

Üç dil düşünelim.

Dil A

İstem eşdeğer Resmî kaynak tam Yerel hakem yeterli AI cevabı yanlış Sonuç: AI ürününe ait dil temsil sorunu adayı.

Dil B

İstem çevirisi maddi olarak farklı AI cevabı prompta uygun Sonuç: İstem Anayasası kusuru.

Dil C

Resmî dil sayfasında eski fiyat AI eski fiyatı aktarıyor İngilizce kaynak güncel Sonuç: Varlığın dil kaynak paritesi sorunu ve kullanıcıya ulaşan birleşik temsil açığı. Üç dilin düşük skoru aynı görünse bile düzeltme sahibi farklıdır.

40. ÜLKE VE DİL PANELLERİNİN KAMU SONUÇ KARTI

Aday kamu sonuç kartı şu alanları taşımalıdır:

Ülke Alanları

Native Reach uygun ülke sayısı En az bir gözlem bulunan ülke sayısı Ülke gözlem kapsamı Nüfus ağırlıklı gözlem kapsamı Ülke tahmin kapsamı Country Sentinel çevrim süresi Açık Sentinel alarmları OUTSIDE_NATIVE_REACH ülkeler NOT OBSERVED ülkeler Ölçüm tarihi

Dil Alanları

Kapsamdaki dil sayısı Gözlenen dil sayısı Tahmin üretilebilen dil sayısı Resmî desteklenen diller Deneysel diller Nüfus ağırlıklı küresel dil sonucu Eşit dil tanı sonucu Dil tabanı Dil farkı Critical hata oranları

REFERENCE_LANGUAGE_GAP

PROMPT_EQUIVALENCE_FAILURE

NOT TESTED diller Dil paneli sürümü Bu kart tek bir “çok dilli” rozetin taşıyamayacağı gerçekliği görünür kılar.

41. ZORUNLU NORMATİF HÜKÜMLER

CH07-N01

Country Sentinel ve Language Fairness panelleri ana Population Panel’den amaç, örneklem ve ağırlık bakımından ayrı tanımlanmalıdır.

CH07-N02

Bir gözcü gözlemi ülke nüfus skoru olarak kullanılamaz.

CH07-N03

Bir ülke için gözlem bulunması ile ülke tahmini üretilebilmesi ayrı statülerdir.

CH07-N04

Ülke sayısı kapsamı ve nüfus ağırlıklı ülke kapsamı birlikte raporlanmalıdır.

CH07-N05

Ülke tahmin kapsamı gözlem kapsamından ayrı gösterilmelidir.

CH07-N06

Uygun her ülke, tanımlı gözetim çevriminde sıfırdan büyük gözlenme olasılığı taşımalıdır; kapsam dışı ülkeler ayrıca gösterilmelidir.

CH07-N07

Gözcü çevrimi ve ülke sıklık sınıfları AI yanıtları görülmeden önce sürümlenmelidir.

CH07-N08

Düşük skorlu ülke, sonuç görüldükten sonra gözcü çevriminden çıkarılamaz.

CH07-N09

Gözcü alarmı otomatik ülke başarısızlığı değildir; doğrulama ve eskalasyon tetikleyicisidir.

CH07-N10

Tekil Critical gözcü olayı yaygınlık tahmini olmadan da ayrı uygunluk incelemesi başlatabilir.

CH07-N11

Ülke Gözcü Paneli gözlemleri ana Population Panel’de ham eşit ağırlıkla kullanılamaz.

CH07-N12

Country Sentinel gözlemlerinin ana skora katılması durumunda seçilme olasılıkları ve ağırlıkları açıkça modellenmelidir.

CH07-N13

Dil adaleti kelime kelime aynı yanıt zorunluluğu olarak tanımlanamaz.

CH07-N14

Dil adaleti, eşdeğer maddi koşullarda karşılaştırılabilir doğruluk, sınır, kaynak ve kullanıcı uygunluğu gerektirir.

CH07-N15

Dil ile ülke, dil ile locale ve dil ile yazı sistemi birbirinin yerine kullanılamaz.

CH07-N16

Kapsamdaki dil evreni ve her dilin kapsama alınma gerekçesi ölçümden önce açıklanmalıdır.

CH07-N17

“Bütün diller” iddiası yalnız gerçekten bütün ilgili dil ve kullanıcı yüzeyleri ölçülmüşse kullanılabilir; aksi hâlde “kapsamdaki diller” denmelidir.

CH07-N18

Resmî desteklenmeyen dildeki gözlem ana desteklenen ürün performansına açıklamasız biçimde eklenemez.

CH07-N19

Düşük kaynaklı dillerin fazla örneklenmesi küresel nüfus ağırlığını artırmamalıdır.

CH07-N20

Dil Adaleti Paneli gözlemleri küresel sonuca dâhil ediliyorsa gerçek hedef dil nüfusu ağırlıklarına geri döndürülmelidir.

CH07-N21

Aynı çok dilli kullanıcı küresel nüfus ağırlığında birden fazla tam insan gibi sayılamaz.

CH07-N22

İstem eşdeğerliği doğrulanmadan dil skoru farkı AI dil performansına kesin olarak atfedilemez.

CH07-N23

Referans paritesi değerlendirilmeden düşük dil skoru yalnız AI ürününe yüklenemez.

CH07-N24

Yerel hakem yeterliliği bulunmadan dil doğruluk kararı kesinleştirilemez.

CH07-N25

Yanıt dili sapması ve kod değiştirme ayrı kayıt edilmelidir.

CH07-N26

Meşru yerel gerçeklik farkı dil adaletsizliği olarak sınıflandırılamaz.

CH07-N27

Açıklanamayan maddi dil farkı yalnız kişiselleştirme veya stil farkı olarak kapatılamaz.

CH07-N28

Küresel nüfus skoru, dil adaleti sonucunun yerine geçemez.

CH07-N29

Eşit dil skoru, nüfus ağırlıklı küresel skor gibi sunulamaz.

CH07-N30

Dil bazlı Critical hata oranları genel ortalamadan ayrı gösterilmelidir.

CH07-N31

PROMPT_EQUIVALENCE_FAILURE, REFERENCE_LANGUAGE_GAP, MEASUREMENT_PARITY_FAILURE ve ADJUDICATION_LANGUAGE_GAP ayrı statüler olarak korunmalıdır.

CH07-N32

Country Sentinel ve Language Fairness panellerinde katılımcı değiştirme kararı AI cevabının doğruluğuna veya markaya yararına dayanamaz.

CH07-N33

Aynı gözlem birden fazla tanısal etikete sahip olabilir; ancak küresel tahminde açıklamasız biçimde birden fazla tam ağırlık alamaz.

CH07-N34

Ülke ve dil paneli kayıtlarının hesap verebilir insan veya kurum sahibi bulunmalıdır.

42. BAŞARISIZLIK BİÇİMLERİ

CH07-F01 — BİR KİŞİLİK ÜLKE SKORU

Tek gözcü gözlemi ülke GEO skoru olarak yayımlanır.

CH07-F02 — SEMBOLİK ÜLKE KAPSAMASI

Her ülkeye bir kişi verilir ve “dünya nüfusuna orantılı” denir.

CH07-F03 — ÜLKE SAYISIYLA NÜFUS KAPSAMINI KARIŞTIRMAK

Az sayıda büyük ülke gözlendiği hâlde yalnız nüfus kapsamı; çok sayıda küçük ülke gözlendiği hâlde yalnız ülke sayısı gösterilir.

CH07-F04 — GÖZLEM KAPSAMINI TAHMİN KAPSAMI SAYMAK

En az bir gözlemi bulunan bütün ülkeler skorlu ülke kabul edilir.

CH07-F05 — SENTINEL GÖZLEMİNİ ANA SKORDA ÇİFTE SAYMAK

Aynı gözlem hem Sentinel hem Population Panel’de tam ağırlık alır.

CH07-F06 — SENTINEL ALARMINI YAYGINLIK İDDİASINA DÖNÜŞTÜRMEK

Tek olay bütün ülke kullanıcılarına genellenir.

CH07-F07 — CRITICAL SENTINEL OLAYINI ÖNEMSİZLEŞTİRMEK

“Yalnız bir kullanıcı” denilerek yüksek zarar riski incelenmez.

CH07-F08 — DÜŞÜK SKORLU ÜLKEYİ ÇEVRİMDEN ÇIKARMAK

Gözcü takvimi sonuçlara göre değiştirilir.

CH07-F09 — YALNIZ TİCARİ PAZARLARI GÖZLEMEK

Ürün erişimi bulunan fakat ticari açıdan önemsiz görülen ülkeler tamamen dışlanır; sonuç küresel olarak sunulur.

CH07-F10 — ÜLKE İLE DİLİ AYNI SAYMAK

Ülkenin resmî dili bütün kullanıcıların dili kabul edilir.

CH07-F11 — TÜM DİLLER İDDİASI

Sınırlı birkaç dil ölçülür; sonuç “bütün dillerde” diye yayımlanır.

CH07-F12 — DÜŞÜK KAYNAKLI DİLİ SİLMEK

Örneklem küçük olduğu için dil rapordan tamamen çıkarılır.

CH07-F13 — DÜŞÜK KAYNAKLI DİLİ GLOBALDE AŞIRI BÜYÜTMEK

Fazla örneklenen dil ham örneklem payıyla küresel skora girer.

CH07-F14 — EŞİT DİL SKORUNU NÜFUS SKORU SAYMAK

Her dile eşit ağırlık veren tanısal skor dünya nüfusunun ortalama deneyimi gibi sunulur.

CH07-F15 — NÜFUS SKORUNU DİL ADALETİ SAYMAK

Büyük dillerin ağırlığıyla yükselen küresel sonuç, küçük dillerdeki bozulmayı gizler.

CH07-F16 — İSTEM ÇEVİRİ HATASINI AI HATASI SAYMAK

Semantik olarak farklı istemlerden çıkan fark modele yüklenir.

CH07-F17 — KAYNAK DİL AÇIĞINI AI HATASI SAYMAK

Yerelleştirilmiş resmî bilgi bulunmadığı hâlde bütün sorumluluk AI ürününe verilir.

CH07-F18 — AI HATASINI KAYNAK EKSİKLİĞİYLE SAVUNMAK

Aynı ve yeterli kaynaklar bulunduğu hâlde düşük kaynaklı dildeki yanlışlar yalnız site eksikliği diye kapatılır.

CH07-F19 — HAKEM DİL YETERSİZLİĞİNİ ÜRÜN BAŞARISIZLIĞI SAYMAK

Hakem cevabı yanlış anlamış olsa da sonuç kesinleştirilir.

CH07-F20 — MAKİNE ÇEVİRİSİNİ NİHAİ HAKEM SAYMAK

Yerel anlam kaybı kontrol edilmez.

CH07-F21 — KOD DEĞİŞTİRMEYİ OTOMATİK HATA SAYMAK

Doğal teknik terimler veya kabul edilebilir dil karışımı başarısızlık yapılır.

CH07-F22 — KULLANILAMAZ DİL SAPMASINI STİL SAYMAK

Sistem kullanıcının anlayamayacağı başka dilde cevap verdiği hâlde sonuç başarılı kabul edilir.

CH07-F23 — YAZI SİSTEMİ FARKINI GÖRMEZDEN GELMEK

Varlık karışıklığına yol açan transliterasyon hatası biçimsel sayılır.

CH07-F24 — ÇOK DİLLİ KULLANICIYI ÇİFTE SAYMAK

Aynı kişi bütün dillerde ayrı nüfus birimi olur.

CH07-F25 — MEŞRU YEREL FARKI ADALETSİZLİK SAYMAK

Fiyat veya hukuk farkı gerçek yerel koşula dayandığı hâlde dil yanlılığı ilan edilir.

CH07-F26 — AÇIKLANAMAYAN FARKI KİŞİSELLEŞTİRME SAYMAK

Eşdeğer koşullardaki maddi çelişki sorgulanmaz.

CH07-F27 — YETERSİZ DİL HÜCRESİNDEN KESİN SKOR

Birkaç gözlemle dil sıralaması yapılır.

CH07-F28 — DİL PANELİNİ SONUÇTAN SONRA KURMAK

Yalnız düşük veya yüksek çıkan diller sonradan seçilir.

CH07-F29 — SADECE YÜKSEK KAYNAKLI DİLLERİ ÖLÇMEK

Sonuç “çok dilli” diye sunulur.

CH07-F30 — TEST EDİLMEYEN DİLLERİ SAKLAMAK

Kamu sonuç kartında NOT TESTED alanı bulunmaz.

43. DENETİM PROSEDÜRÜ

Adım 1 — Ürün-Ülke Uygunluk Sicilini Dondur

Her ülke için:

  • Native Reach
  • ürün erişimi
  • denetim dili
  • kullanıcı yüzeyi

statüsü kaydedilir.

Adım 2 — Ana Population Panel Ülke Kapsamını Çıkar

Hangi ülkelerde ana panel gözlemi bulunduğu belirlenir.

Adım 3 — Sentinel Ülke Evrenini Belirle

Ana panelde yetersiz kalan ve CE-3 statüsü taşıyan ülkeler belirlenir.

Adım 4 — Gözcü Çevrimini Kur

Ülkeler:

  • sıklık sınıfı,
  • dalga,
  • dil/locale,
  • kullanıcı yüzeyi

bakımından atanır.

Adım 5 — Gözcü Katılımcılarını Önceden Seç

Ana ve yedek listeler sonuçlar görülmeden önce oluşturulur.

Adım 6 — Gözcü Sonuçlarını Sınıflandır

erişim, kimlik, dil, maddi gerçek, Critical olay statüleri atanır.

Adım 7 — Alarm ve Eskalasyon Uygula

Alarm türüne göre:

  • tekrar,
  • hedefli örneklem,
  • referans incelemesi,
  • uygunluk incelemesi

başlatılır.

Adım 8 — Ülke Kapsam Metriklerini Hesapla

ülke sayısı kapsamı, nüfus kapsamı, ülke tahmin kapsamı ayrı hesaplanır.

Adım 9 — Dil Sicilini Dondur

Her dil için:

  • kapsam nedeni,
  • destek statüsü,
  • yazı sistemi,
  • locale,
  • kullanıcı evreni

kaydedilir.

Adım 10 — Dil Adaleti Fazla Örneklemesini Kur

Ana nüfus panelinde yetersiz kalan diller için ek hedefler belirlenir.

Adım 11 — Dört Dil Kapısını Kontrol Et

İstem eşdeğerliği Referans paritesi Ölçüm paritesi Hakem paritesi değerlendirilir.

Adım 12 — Dil Gözlemlerini Puanla

Her dil için:

  • doğruluk,
  • maddi eksiklik,
  • Critical hata,
  • bilinmeyen,
  • yanıt dili sapması

kaydedilir.

Adım 13 — Küresel ve Tanısal Ağırlıkları Ayır

Nüfus ağırlıklı sonuç ile eşit dil tanı sonucu ayrı hesaplanır.

Adım 14 — Dil Eşitsizliğini Hesapla

dil tabanı, sağlam dil farkı, Critical hata farkı, bilinmeyen oranı hesaplanır.

Adım 15 — Ülke–Dil Kesişimlerini İncele

Maddi locale farkları veya çelişkileri belirlenir.

Adım 16 — Kamu Sonuç Kartını Oluştur

Kapsam, tahmin yeterliliği, alarmlar ve test edilmeyen alanlar görünür hâle getirilir.

44. GEREKLİ KANIT

AI ürün ve kullanıcı yüzeyi kaydı Native Reach ülke sicili Uygun ülke sayısı Ülke erişim statüleri Ana Population Panel ülke tahsisleri Country Sentinel evreni Gözcü çevrimi Gözcü sıklık sınıfları Ülke–dalga atama matrisi Ülke–dil atamaları Sentinel ana ve yedek listeleri Ülke gözlem sonuçları Sentinel alarmları Eskalasyon kayıtları Hedefli ülke örneklemleri Ülke gözlem kapsamı Nüfus ağırlıklı ülke kapsamı Ülke tahmin kapsamı Kapsamdaki dil sicili Dil destek statüleri Yazı sistemi ve locale kayıtları Ana dil örneklem sayıları Dil Adaleti fazla örneklem sayıları Dil nüfus ağırlıkları Çok dilli kullanıcı kayıtları İstem eşdeğerlik kayıtları Referans paritesi kayıtları Ölçüm paritesi kayıtları Yerel hakem yeterlilik kayıtları Dil sonuçları

Dil Critical hata oranları Yanıt dili sapmaları Dil eşitsizliği metrikleri Test edilmeyen diller Eşit dil ve nüfus ağırlıklı sonuçlar Panel ağırlıkları Çift sayım kontrolleri Kamu sonuç kartı Panel sürümleri Sorumlu insan veya kurum

45. DENETİM KONTROL LİSTESİ

Country Sentinel Panel’in amacı ana nüfus panelinden ayrılmış mı? Hangi ülkeler Sentinel kapsamına alındı? Ülkelerin uygunluk ve erişim statüsü güncel mi? Her uygun ülkenin gözetim çevriminde pozitif gözlenme ihtimali var mı? Gözcü çevrimi sonuçlardan önce donduruldu mu? Sentinel gözlemi ülke skoru gibi kullanılmış mı? Ülke gözlem kapsamı ve ülke tahmin kapsamı ayrılmış mı? Nüfus ağırlıklı ülke kapsamı ayrıca gösterilmiş mi? Sentinel gözlemleri ana skorda çifte sayılmış mı? Critical Sentinel alarmı doğrulandı mı? Tekil alarm yaygınlık iddiasına dönüştürülmüş mü? Alarm nedeniyle hedefli örneklem açılmış mı? Kapsamdaki dil evreni önceden tanımlandı mı? “Bütün diller” iddiası gerçek kapsamla uyumlu mu? Dil, yazı sistemi ve locale ayrıldı mı?

Ürünün dil destek statüsü kaydedildi mi? Düşük kaynaklı diller neden seçildi? Dil Adaleti örnekleri küresel skorda geri ağırlıklandırıldı mı? Aynı çok dilli kullanıcı çifte sayıldı mı? İstem eşdeğerliği doğrulandı mı? Resmî kaynaklar diller arasında maddi olarak eşit mi? Hakemler ilgili dili yeterli düzeyde biliyor mu? Makine çevirisi nihai hakem gibi kullanılmış mı? Yanıt dili sapmaları kaydedilmiş mi? Meşru yerel fark ile dil adaletsizliği ayrıldı mı? Dil tabanı ve dil farkı yayımlanmış mı? Dil bazlı Critical hata oranları görünür mü? REFERENCE_LANGUAGE_GAP ve diğer ölçüm kusurları ayrılmış mı? Test edilmeyen diller açık mı? Kamu skoru dil adaleti sorununu gizliyor mu?

Aynı gözlem birden fazla panelde tam ağırlık almış mı? Panel kayıtlarının hesap verebilir sahibi belli mi?

46. İTİRAZLAR VE CEVAPLAR

İtiraz 1 — “Her küçük ülkeye bir kişi vermek yine de hiç vermemekten iyi değil mi?”

Erken gözlem ve coğrafi kapsam için evet. Fakat bu kişi ülkenin oranını ölçmez. Doğru ad:

Sentinel gözlemi

olmalıdır.

İtiraz 2 — “Bir kişi ülke skoru üretmiyorsa neden gönderiyoruz?”

Çünkü tekil gözlem:

  • erişim sorununu,
  • varlık karışıklığını,
  • yanlış dili,
  • Critical olayı

ilk kez görünür hâle getirebilir. Gözcü paneli erken uyarı sistemidir.

İtiraz 3 — “Her ülkeyi her dalgada gözlemlemek zorunda mıyız?”

Hayır. Tanımlı bir gözetim çevrimi kullanılabilir. Yüksek riskli veya önemli ülkeler daha sık; küçük ve düşük riskli ülkeler dönüşümlü gözlenebilir. Takvim sonuçlardan önce belirlenmelidir.

İtiraz 4 — “Küçük ülkeler küresel skorda düşük ağırlık alıyorsa neden bu kadar önem veriyoruz?”

Çünkü nüfus payı düşük olabilir. Fakat:

  • hukuk,
  • dil,
  • yerel kullanıcı zararı,
  • coğrafi bütünlük

bakımından gerçek insan topluluklarıdır. Düşük ağırlık görünmezlik anlamına gelmemelidir.

İtiraz 5 — “Bütün dilleri eşit ağırlıklandırmak en adil yöntem değil mi?”

Eşit dil ağırlığı değerli bir tanısal bakış olabilir. Dünya nüfusundaki ortalama insan deneyimini temsil etmez. Nüfus skoru ve dil adaleti skoru ayrı yayımlanmalıdır.

İtiraz 6 — “Küçük dil küresel sonucu yalnız az etkiliyorsa düşük skoru neden önemli?”

Çünkü o dili kullanan insanlar için temsil sorunu gerçektir. Ayrıca ağır lisans, sağlık veya kimlik yanlışları nüfus payıyla otomatik olarak önemsizleşmez.

İtiraz 7 — “Düşük kaynaklı dilde kaynak azsa AI’yı suçlamak haksız değil mi?”

Yalnız AI’yı suçlamak haksız olabilir. Bu nedenle:

  • kaynak paritesi,
  • istem eşdeğerliği,
  • hakem yeterliliği

ayrı incelenir. Kullanıcıya ulaşan yanlış yine gerçektir. Düzeltme sahibi doğru belirlenmelidir.

İtiraz 8 — “Farklı ülkelerde aynı dilde farklı cevap normal değil mi?”

Gerçek yerel koşullar farklıysa normal olabilir. Aynı maddi gerçek farklı ve açıklamasız biçimde değişiyorsa sorun olabilir. Dil ve locale birlikte incelenmelidir.

İtiraz 9 — “AI başka dilde doğru cevap veriyorsa neden başarısız olsun?”

Kullanıcı cevabı anlayamıyorsa temsil kullanılabilir değildir. Yanıt dili sapması doğrulukla birlikte ayrı değerlendirilmelidir.

İtiraz 10 — “Dil skorları için 200 kullanıcı bulmak çok pahalı olabilir.”

Daha küçük örneklem kullanılabilir. Sonuç:

  • keşif,
  • geçici,
  • yetersiz örneklem

statüsüyle yayımlanmalıdır. Maliyet, sahte kesinlik hakkı vermez.

İtiraz 11 — “Küresel skor zaten yüksekse ayrı dil kartı müşteriyi gereksiz yere korkutmaz mı?”

Maddi dil bozulmasını saklamak müşteriyi korumaz. Yanlış güven üretir. Kısa ve anlaşılır sonuç kartı kullanılabilir.

İtiraz 12 — “Tek bir Critical Sentinel olayı bütün uygunluğu düşürür mü?”

Otomatik cevap olayın türüne bağlıdır. Tekil olay ülke yaygınlığını göstermez. Fakat ağır zarar veya sahte yetki taşıyorsa Critical inceleme ve geçici tedbir başlatabilir. Karar Bölüm 15’te tanımlanacaktır.

49. BÖLÜMÜN ORTAK HÜKMÜ

Bir dünya skoru üretmek kolaydır. Dünya nüfusunu büyük ülkelerle doldurursunuz. Küçük ülkeleri küsurat içinde kaybedersiniz. Yüksek kaynaklı dilleri ölçersiniz. Düşük kaynaklı dilleri: “Örneklem yetersiz.” diyerek çıkarırsınız. Sonra tek sayı yayımlarsınız. Bu sayı matematiksel olarak doğru hesaplanmış olabilir. Fakat dünyanın bütün temsil kusurlarını göstermeyebilir. NOMOS, her ülkeye eşit ağırlık vermez. Çünkü insanların nüfus payları eşit değildir. NOMOS, küçük ülkeyi de yok saymaz. Çünkü düşük nüfus var olmamak değildir. NOMOS, bütün dilleri küresel skorda eşit ağırlıklandırmaz. Çünkü bu dünya nüfusunun ortalama deneyimini bozabilir. NOMOS, küçük dili de görünmez bırakmaz. Çünkü küresel ağırlığı düşük olsa bile o dili kullanan insan için temsil hatası yüzde 100 gerçek olabilir.

Ülke Gözcü Paneli:

Nerede hiç bakmadığımızı gösterir.

Dil Adaleti Paneli:

Küresel ortalamanın altında kimin kaldığını gösterir.

Population Panel:

Dünya nüfusundaki ortalama deneyimi tahmin eder.

Bu üçü birlikte çalıştığında küresel skor hem nüfusa sadık hem de adalet bakımından denetlenebilir olur. Bir ülkedeki tek kullanıcı ülkenin tamamı değildir. Ama o kullanıcı gerçek insandır. Bir dil küresel nüfusun küçük parçası olabilir. Ama o dildeki yanlış daha az yanlış değildir. Bir Critical olay nadir olabilir. Ama zarar yalnız frekansla ölçülmez. Bu nedenle NOMOS’un yedinci ölçüm yasası şudur:

Görünürlük hakkı ile nüfus ağırlığı aynı şey değildir.

Sekizinci yasası şudur:

Ülke gözlemi, ülke tahmini değildir.

Dokuzuncu yasası şudur:

Dil adaleti, bütün dilleri eşit yapmak değil; dili nedeniyle kimsenin maddi gerçeklikten sistematik biçimde uzaklaştırılmamasıdır.

Onuncu yasası şudur:

Küresel ortalama, geride kalan dili ve ülkeyi görünmez kılıyorsa tek başına yeterli GEO sonucu değildir.

NOMOS’un Bölüm 7 Emri

Bana dünya skorunu gösterirken hiç bakmadığın ülkeleri saklama.

Küçük ülkeye bir kullanıcı gönderip o insanı ülkenin tamamı yapma.

Ama küçük ülkeyi nüfusu az diye sonsuza kadar görmezden de gelme.

Ülke gözlemini, ülke tahminini ve ülke uygunluğunu birbirinden ayır.

Tek bir ağır yanlış gördüğünde bütün ülkeye hüküm verme. / Fakat “yalnız bir cevap” diyerek insan zararını da yok sayma.

Büyük dillerdeki başarıyı küçük dillerin sessizliği üzerine kurma.

Düşük kaynaklı dili fazla örnekleyebilirsin. / Fakat onu dünya nüfusunda olduğundan büyük gösterme.

Eşit dil skorunu nüfus skoru; nüfus skorunu dil adaleti skoru yapma.

Çeviri yanlışsa beni suçlama. / Kaynağın eksikse bunu da söyle. / Hakem dili anlamıyorsa kesin hüküm verme.

Gerçek yerel farkı adaletsizlik; açıklanamayan maddi farkı yalnız stil sayma.

Önce ülkeleri gözle. / Sonra hangilerinde tahmin yapabildiğini söyle. / Sonra dilleri fazla örnekle. / Sonra onları gerçek nüfus ağırlığına geri döndür. / Ve küresel ortalamanın altında kalan insanları görünür bırak.

Bölümün Son Cümlesi

Gerçek küresel GEO ölçümü, yalnız dünyanın çoğunluğunun ne gördüğünü değil; küçük ülke ve dillerde kimin henüz görülmediğini, kimin yanlış görüldüğünü ve hangi sonucun yalnız tekil bir alarm olduğunu da açıkça göstermelidir.

Normatif Öz

GEO-1000 Population Panel, Ülke Gözcü Paneli ve Dil Adaleti Paneli amaç, örneklem, ağırlık ve kamu iddiası bakımından ayrı tutulmalıdır. Tek bir ülke gözcü gözlemi belirli ülke–ürün–dil bağlamında bir erişim durumunun, cevabın, anomalinin veya Critical olayın meydana geldiğini gösterebilir; ülke yaygınlık tahmini veya ülke GEO skoru olarak sunulamaz. Ülke sayısı kapsamı, nüfus ağırlıklı kapsam ve ülke tahmin kapsamı ayrı raporlanmalıdır. Dil adaleti, semantik olarak eşdeğer promptlarda ve karşılaştırılabilir koşullarda maddi temsili değerlendirmeli; kelime kelime aynı cevap istememeli ve meşru yerel farkları yok saymamalıdır. Fazla örneklenen diller küresel nüfus tahmininde gerçek hedef nüfus paylarına geri ağırlıklandırılmalıdır.

Önerilen atıf

Muraz, Kaan. NOMOS GEO Denetim Protokolü: Üretken Sistemlerde Varlık Temsilini Küresel Nüfus Üzerinden Ölçme Protokolü. Aday nihai metin, Türkçe editoryal ana metin. NobleJackal, 2026. https://doi.org/10.5281/zenodo.22040778. https://noblejackal.com/tr/nomos-geo-audit-protocol/
© 2026 Kaan MURAZ. CC BY 4.0 ile lisanslanmıştır; atıf zorunludur.