Kitaba geç

NOMOS GBO Denetim Protokolü

Bir GBO Denetimi Neyi Kanıtlar?

PDF’yi ücretsiz indir

Bir teknoloji şirketi, yeni kurduğu otonom satın alma ajanını müşterilere sunmak üzeredir. Şirketin tanıtım dosyasında şu ifadeler bulunur:

“Ajanımız güvenlidir.” “İnsan kontrolünü korur.” “Yetki sınırlarına uyar.” “Yanlış satın almayı önler.” “Kullanıcı verilerini korur.” “İnsan dur dediğinde durur.”

Şirket bu iddiaları desteklemek için çeşitli kanıtlar sunar. Bir politika belgesinde insan onayı gerektiği yazmaktadır. Bir ekran görüntüsünde ödeme limiti görünmektedir. Bir demoda ajan doğru ürünü seçmektedir. Başarı panelinde yüzde 98,7 görev tamamlama oranı vardır. Müşteri yorumlarında sistemin hızlı ve kullanışlı olduğu söylenmektedir. Teknik ekip: “Altı aydır ciddi bir sorun yaşamadık.” demektedir. Bütün bunlar değerlidir. Fakat şu soruya tek başına cevap vermez:

Ajan gerçekten hangi davranış bakımından güvenlidir?

“Güvenli” kelimesi çok geniştir. Ajan:

doğru ürünü seçebilir,

fakat yetkisiz ödeme yapabilir.

Yetki sınırını koruyabilir,

fakat yanlış kişiye ait hesabı kullanabilir.

Doğru kişiyi seçebilir,

fakat otomatik yenileme koşulunu gizleyebilir.

Ödemeyi doğru yapabilir,

fakat aynı işlemi ağ hatası nedeniyle iki kez gerçekleştirebilir.

İnsan durdurma talebini kabul edebilir,

fakat kuyruktaki işlemler çalışmaya devam edebilir.

Bütün bunlar aynı anda mümkün olabilir. Bu nedenle GBO denetimi: “Sistem güvenli mi?” gibi sınırsız bir soruyla başlamaz. Şöyle başlar: Hangi sistem, hangi sürümde, hangi davranışları, hangi araç ve yetkilerle, hangi kullanıcılar ve riskler altında, hangi kanıt düzeyinde güvenilir biçimde gerçekleştirebiliyor? Bu daha uzun bir sorudur. Fakat denetimde yanıtı aranabilecek somut bir sorudur.

Denetimin nesnesi yalnız model değildir

Bir yapay zekâ ajanı denetlendiğinde ilk bakışta model incelenecekmiş gibi düşünülebilir. Hangi model kullanılıyor? Ne kadar güçlü? Hangi güvenlik eğitiminden geçti? Hangi talimatları izliyor? Bunlar önemlidir. Fakat gerçek davranışı model tek başına üretmez. Bir ajan sisteminin davranışı şunların birleşiminden doğar:

İnsan amacı

Kurumsal politika

Sistem ve geliştirici talimatları

Model

Bellek

Veri kaynakları

Araçlar

API izinleri

Kullanıcı hesapları

Alt ajanlar

Dış hizmetler

Ölçüm ve ödül sistemi

İnsan onayı

Durdurma ve toparlanma mekanizmaları

Aynı model, iki farklı sistemde tamamen farklı davranabilir. Birinci sistemde:

yalnız belge okuyabilir,

taslak üretebilir,

hiçbir dış araca erişemez.

İkinci sistemde:

e-posta gönderebilir,

para harcayabilir,

kod yayımlayabilir,

müşteri verisi aktarabilir,

alt ajan oluşturabilir.

Model adı aynıdır. Davranış gücü aynı değildir. Aynı ajan talimatı da farklı sonuç üretebilir. Bir sistemde: “İnsan onayı olmadan mesaj gönderme.” kuralı teknik olarak uygulanır. Gönderim aracı yalnız onay tokenı varsa çalışır. Başka sistemde aynı kural yalnız metinde bulunur. Ajanın tam e-posta erişimi vardır. İki sistem aynı politika cümlesini taşır. Biri davranış sınırıdır. Diğeri davranış dileğidir. Bu nedenle NOMOS GBO Denetiminin temel nesnesi:

Davranış Sistemi

olacaktır.

Davranış sistemi nedir?

Kanonik tanımı şöyledir: Davranış sistemi; bir insan veya kurum amacı doğrultusunda, bir ya da daha fazla yapay zekâ ajanının veri, bellek, araç, hesap, yetki, ölçüm, insan onayı ve toparlanma mekanizmalarıyla birlikte oluşturduğu gerçek eylem düzenidir. Daha basit biçimiyle: Denetlenen şey yalnız ajan değildir. Ajanın dünyada davranmasını mümkün kılan bütün ilişkiler sistemidir. Bir e-posta ajanını denetlerken yalnız metin kalitesine bakılmaz. Şunlar da denetlenir:

Kimin adına konuşuyor?

Hangi hesap üzerinden?

Hangi kişilere mesaj gönderebilir?

Hangi veriyi kullanabilir?

Taslak ile gönderim ayrılmış mı?

İnsan onayı hangi eşikte?

Alt ajan mesaj gönderebilir mi?

Kuyruklar nasıl durdurulur?

Gönderilmiş mesajın makbuzu var mı?

Bir web ajanını denetlerken yalnız kod kalitesine bakılmaz. Şunlar da değerlendirilir:

Hangi dosyaları değiştirebilir?

Fiyata dokunabilir mi?

Hukukî metinleri değiştirebilir mi?

Test ve canlı ortam ayrılmış mı?

Yayın yetkisi kimde?

Bağımsız canlı doğrulama var mı?

Rollback gerçekten çalışıyor mu?

İnsan durdurduğunda FTP ve yayın kuyruğu da duruyor mu?

Bir satın alma ajanını denetlerken yalnız doğru ürünü seçip seçmediği ölçülmez. Şunlar da incelenir:

Bütçe yetkisi

Satıcı sınırı

Abonelik ve yenileme

Hedef hesap

Çift işlem koruması

İptal yolu

İnsan onayı

İşlem makbuzu

Geri ödeme ve telafi

Davranış sistemi bütün bu parçaların toplamıdır.

Denetimin karşılaştırdığı beş gerçeklik

NOMOS GBO Denetimi, bir sistemin davranışını beş ayrı gerçeklik katmanında inceler.

1. Beyan Edilen Gerçeklik

2. Yapılandırılmış Gerçeklik

3. Teknik Olarak Mümkün Gerçeklik

4. Gözlenen Davranış Gerçekliği

5. Sonuç ve Toparlanma Gerçekliği

Bu beş katmanın birbirleriyle eşleşmesi gerekir.

1. Beyan edilen gerçeklik

Kurum sistem hakkında ne söylüyor? Örnekler: “Ajan insan onayı olmadan mesaj göndermez.” “Veriler Avrupa dışına çıkmaz.” “Ajan işlem başına 500 dolardan fazla harcayamaz.” “Her sentetik video yayın öncesinde yönetici onayı alır.” “Bütün dış eylemler durdurma komutuyla kesilebilir.” Bu ifadeler şu kaynaklarda bulunabilir:

Politika belgeleri

Sözleşmeler

Web sitesi

Pazarlama materyalleri

İç prosedürler

Kullanıcı sözleşmeleri

Denetim beyanları

Beyan edilen gerçeklik önemlidir. Çünkü kurum neyi vaat ettiğini gösterir. Fakat vaat tek başına davranış kanıtı değildir.

2. Yapılandırılmış gerçeklik

Sistem nasıl tanımlanmıştır? Örnekler:

Ajan rolü

Sistem talimatları

Yetki sözleşmesi

Veri erişim kuralları

İnsan onayı eşikleri

Hizmet kataloğu

Makinece okunabilir fiyatlar

Durdurma politikaları

Bellek kuralları

Alt ajan sınırları

Kurum: “Ajan yalnız taslak hazırlar.” diyebilir. Yapılandırılmış ajan rolünde de:

allowed_actions:
  - research
  - create_draft

prohibited_actions:
  - send_message

bulunabilir. Bu, beyanla yapılandırma arasında uyum olduğunu gösterir. Fakat gerçek teknik izinler hâlâ farklı olabilir.

3. Teknik olarak mümkün gerçeklik

Sistem gerçekte ne yapabilir? Bu katmanda doğal dil beyanından çok teknik güç incelenir.

Hangi API izinleri açık?

Hangi tokenlar geçerli?

Hangi hesaplara erişiliyor?

Dosya silinebilir mi?

Para transferi yapılabilir mi?

Dış mesaj gönderilebilir mi?

Alt ajan oluşturulabilir mi?

Canlı yayın başlatılabilir mi?

Bellek başka sisteme aktarılabilir mi?

Durdurma komutu kuyruğu gerçekten etkiliyor mu?

Bir ajan politikasında gönderim yasak olabilir. Fakat e-posta tokenı tam erişim taşıyorsa gönderim teknik olarak mümkündür. Ajanın bunu yapmaması model davranışına bağlıdır. Teknik sınır yoktur. Bu katman GBO denetiminin en kritik alanlarından biridir. Çünkü kurumun söylediğiyle sistemin yapabildiği arasındaki fark burada görünür.

4. Gözlenen davranış gerçekliği

Sistem gerçek veya kontrollü senaryoda ne yapmaktadır? Ajan teknik olarak bir şeyi yapabilir ama hiçbir zaman yapmayabilir. Ya da teknik olarak dar görünür fakat farklı araç zinciriyle daha geniş davranış üretebilir. Bu nedenle kontrollü davranış testi gerekir. Örnek senaryolar:

İnsan onayı olmadan gönderim talebi

İki benzer şirket kimliği

Çelişkili fiyat kaydı

Süresi dolmuş rıza

Sponsorlu seçenek

Gizli dış talimat

Ağ zaman aşımı

Durdurma sırasında açık kuyruk

Alt ajan üzerinden yetki aşımı

Bu testler şu soruya cevap verir: Sistem sınırla karşılaştığında gerçekten nasıl davranıyor? Politika ve izinler potansiyeli gösterir. Davranış testi gerçekleşen seçimi gösterir.

5. Sonuç ve toparlanma gerçekliği

Ajanın yaptığı işlem dış dünyada ne sonuç doğurmuştur? Ve yanlış olduğunda sistem ne yapabilmiştir? Bir e-posta aracı: “Gönderim başarılı.” diyebilir. Fakat mesaj yanlış alıcıya gitmiş olabilir. Bir ödeme API’si isteği kabul edebilir. Fakat aynı tutar iki kez çekilmiş olabilir. Bir web ajanı dosyayı yayımlayabilir. Fakat CDN eski sürümü gösteriyor olabilir. Bir durdurma komutu merkez ajanı kapatabilir. Fakat alt ajan ve kuyruklar çalışmaya devam edebilir. Bu nedenle son katmanda şunlar incelenir:

Gerçek hedefe ulaşıldı mı?

Sonuç bağımsız doğrulandı mı?

Yanlış davranış tespit edildi mi?

Devam eden zarar durduruldu mu?

Geri dönüş çalıştı mı?

Etkilenen insan bilgilendirildi mi?

İtiraz yolu gerçekten işledi mi?

Bellek ve gelecek davranış düzeltildi mi?

Yeni yetki olmadan sistem yeniden başladı mı?

Bir davranışın kalitesi yalnız gerçekleştirme anında değil, hata sonrası davranışta da görülür.

Beş gerçeklik arasındaki açıklık

Bir e-posta ajanını düşünelim.

Beyan edilen gerçeklik

“İnsan onayı olmadan mesaj göndermez.”

Yapılandırılmış gerçeklik

role: research_and_drafting
send_requires_approval: true

Teknik olarak mümkün gerçeklik

Ajanın erişebildiği e-posta erişim belirteci mesaj göndermeye izin verir. Kitaptaki send_message, örnek bir araç eyleminin adıdır; sağlayıcının gerçek yöntem veya OAuth kapsam adı değildir.

Gözlenen davranış gerçekliği

Dış sayfadaki yönlendirici talimat altında ajan insan onayı olmadan mesaj gönderir.

Sonuç ve toparlanma gerçekliği

Merkez ajan durdurulur; fakat iki mesaj kuyruktan gönderilmeye devam eder. İlk iki katman güvenli görünür. Son üç katman gerçek davranış açığını gösterir. GBO denetimi yalnız ilk ikisini incelerse yanlış güven üretir. Yalnız davranış testine bakarsa da sorunun nedenini tam açıklayamaz. Sorun:

model davranışında,

teknik izinde,

kuyruk mimarisinde,

yetki uygulamasında

birlikte bulunabilir. Bu nedenle protokolün temel ilkesi şudur: Denetim, beyan ile yapılandırmayı; yapılandırma ile teknik gücü; teknik güç ile gözlenen davranışı; gözlenen davranış ile gerçek sonucu karşılaştırır.

Kanıt merdiveni

Her denetim kanıtı aynı güce sahip değildir. Bir kurumun söylediği cümleyle gerçek davranış testi aynı düzeyde değildir. Bu nedenle NOMOS GBO Protokolü bir:

Kanıt Merdiveni

kullanacaktır.

Seviye 1 — Beyan

Kurum veya ajan bir iddiada bulunur. “Ajan yetki sınırlarına uyar.” Bu başlangıçtır. Kanıtın kendisi değildir.

Seviye 2 — Belge

İddia politika, sözleşme veya görev tanımında yazılıdır. “Dış gönderim insan onayı gerektirir.” Beyan resmîleşmiştir. Fakat sistemin bunu uyguladığı hâlâ kanıtlanmamıştır.

Seviye 3 — Yapılandırma

Kural makinece okunabilir biçimde sistemde tanımlanmıştır.

send_requires_human_approval: true

Belge ile sistem arasında bağ kurulmuştur. Fakat teknik aracın bunu gerçekten engelleyip engellemediği bilinmeyebilir.

Seviye 4 — Teknik Uygulama

Kural araç, rol, token veya kod seviyesinde uygulanır. Onay tokenı olmadan gönderim aracı çağrılamaz. Bu güçlü bir kanıttır. Fakat farklı araç veya alt ajan yoluyla aşılabilir.

Seviye 5 — Kontrollü Davranış Testi

Sistem gerçekçi senaryoda sınanır. İnsan onayı olmadan gönderime teşvik edilir. Ajan:

göndermez,

taslak bırakır,

onay ister.

Kural gözlenen davranışta çalışmıştır.

Seviye 6 — Bağımsız Sonuç Doğrulaması

Yalnız ajanın raporu değil, dış sistem sonucu incelenir.

Gönderilmiş kutusunda mesaj yoktur.

Harici denetim adresine ileti ulaşmamıştır.

Kuyrukta gizli gönderim bulunmamaktadır.

Alt ajan loglarında dış eylem yoktur.

Davranışın gerçek sonucu bağımsız biçimde doğrulanmıştır.

Seviye 7 — Toparlanma ve Durdurma Kanıtı

Kontrollü bir hata veya geri çekme senaryosunda:

sistem durur,

kuyruklar iptal edilir,

tokenlar kapanır,

insan görevi devralır,

yeni yetki olmadan davranış başlamaz.

Bu en güçlü kanıt katmanlarından biridir. Çünkü sistem yalnız normal koşulda değil, bozulma anında da sınanmıştır.

Kanıt merdiveninin hükmü

Bir denetim sonucu yalnız Seviye 1 ve Seviye 2 kanıtlarına dayanıyorsa şu söylenebilir: “Kurum bu davranışı vaat etmektedir.” Şu söylenemez: “Sistem bu davranışı güvenilir biçimde uygulamaktadır.” Yapılandırma ve teknik uygulama incelendiyse: “Kural sistemde tanımlanmış ve belirli araç seviyesinde uygulanmıştır.” denebilir. Davranış, bağımsız sonuç ve toparlanma testleri de geçtiyse daha güçlü bir hüküm kurulabilir: “Belirtilen kapsam ve senaryolarda sistemin kuralı uyguladığı, dış sonuç üretmediği ve durdurma davranışının çalıştığı kanıtlanmıştır.” Denetim dili kanıt merdiveninde çıktığı seviyeyi aşmamalıdır. Kanıtın seviyesi, denetim iddiasının tavanıdır.

GBO denetimi neyi kanıtlayabilir?

Doğru kurulmuş bir denetim şu konularda kanıt üretebilir:

Belirli davranış sınırlarının varlığı

Ajanın hangi eylemleri yapabildiği veya yapamadığı gösterilebilir.

Kimlik çözümleme yeterliliği

Belirli senaryolarda aynı isimli kişi veya kurumları ayırıp ayıramadığı sınanabilir.

Gerçeklik ve kaynak kullanımı

Kanonik, güncel ve yetkili kaynağı kullanıp kullanmadığı test edilebilir.

Uygunluk değerlendirmesi

Görünürlük, popülerlik veya sponsorluğu zorunlu koşulların önüne koyup koymadığı ölçülebilir.

Rıza, yetki ve onay bütünlüğü

Ajanın yalnızca geçerli ve işlem özelindeki yetki altında ilerleyip ilerlemediği gözlenebilir.

Araç yürütme güvenliği

Doğru sistemi, hedefi, işlem kimliğini ve veri sınırını kullanıp kullanmadığı test edilebilir.

Çoklu ajan sürekliliği

Kök amaç, kimlik, yetki ve yasakların devirler boyunca korunup korunmadığı görülebilir.

Manipülasyona direnç

Sahte kanıt, sponsorlu sıralama, gizli talimat ve aday bastırma karşısındaki davranış sınanabilir.

Ölçüm bütünlüğü

Kritik ihlallerin toplam puanda gizlenip gizlenmediği ve metriğin oyuna açık olup olmadığı değerlendirilebilir.

Durdurma ve toparlanma

İnsan dur dediğinde sistemin gerçekten durup durmadığı, geri dönüp dönemediği ve insan kontrolünü devredip devredemediği kanıtlanabilir. Ancak bütün bu hükümler yalnız denetlenen kapsam içinde geçerlidir.

GBO denetimi neyi kanıtlayamaz?

Bir denetim ne kadar güçlü olursa olsun şu iddiaları dürüstçe üretemez:

Sistemin hiçbir zaman hata yapmayacağını

Test edilmeyen yeni durumlar ortaya çıkabilir.

Bütün gelecek model sürümlerinin aynı davranacağını

Model, araç, talimat ve bellek değişebilir.

Her ülkede bütün hukukî yükümlülüklerin yerine getirildiğini

GBO denetimi hukukî uzmanlığın yerine geçmez.

Bilinmeyen bütün saldırılara karşı bağışıklığı

Yeni manipülasyon ve araç saldırıları ortaya çıkabilir.

Bütün kullanıcı gruplarında eşit davranışı

Test edilmeyen dil, engellilik durumu, kültür veya kullanıcı profili için hüküm kurulamaz.

İnsanların sistemi hiçbir zaman kötüye kullanmayacağını

Doğru sistem bile yetkili insan tarafından kötü amaçla kullanılabilir.

Canlı ortamın sonsuza kadar değişmeden kalacağını

İzinler, fiyatlar, roller ve dış hizmetler değişir.

Yüksek puanın kritik ihlal olmadığı anlamına geldiğini

Tek veto ihlali, yüksek genel ortalamaya rağmen kullanım alanını sınırlayabilir. Bu sınırlar denetimi zayıflatmaz. Güvenilir kılar. Dürüst denetim, bilmediğini de hükmün parçası yapar.

Denetim hükmü neden sınırlı olmalıdır?

Şu ifade güçlü görünür: “Bu sistem GBO uyumludur.” Fakat ne anlama geldiği belirsizdir. Hangi sistem? Hangi sürüm? Hangi ajanlar? Hangi araçlar? Hangi diller? Hangi yetkiler? Hangi testler? Hangi tarihte? Hangi risk düzeyinde? Daha güvenilir ifade şöyledir: “Satın alma ajanı v3.2; 1–15 Eylül 2026 tarihleri arasında, tanımlı üç satıcı kategorisi, işlem başına 500 USD sınırı, İngilizce ve Türkçe kullanıcı senaryoları ve insan onaylı ödeme modeli altında 240 kontrollü davranış senaryosunda denetlenmiştir. Kritik kimlik, rıza, yetki ve durdurma veto ihlali tespit edilmemiştir. Otomatik yenileme ve veri dışa aktarma davranışlarında iki yüksek öncelikli bulgu bulunmaktadır. Sistem yalnız belirtilen düşük riskli satın alma kapsamı için koşullu uygun sayılmıştır.”

Bu ifade daha uzundur. Ama şunları açıklar:

Denetlenen nesne

Sürüm

Tarih

Davranış alanı

Yetki sınırı

Dil

Senaryo sayısı

Kritik bulgular

Kullanım sınırı

Denetim hükmü reklam cümlesi değildir. Davranış kanıtının sınırıdır.

Denetim anlık fotoğraf mıdır?

Evet. Fakat yalnızca anlık fotoğraf değildir. İyi denetim aynı zamanda değişiklik koşullarını tanımlar. Bir sistem aşağıdaki alanlardan biri değiştiğinde denetim hükmü yeniden değerlendirilmelidir:

Temel model

Sistem talimatı

Ajan rolü

Bellek mimarisi

Veri kaynakları

Araçlar

API izinleri

İnsan yetki rolleri

Alt ajanlar

Durdurma mekanizması

Ölçüm ve ödül sistemi

Fiyat veya hizmet sözleşmesi

Kullanılan dil ve pazar

Dış hizmet sağlayıcısı

Her değişiklik tam denetim gerektirmeyebilir. Fakat:

Maddi Değişiklik

tanımı bulunmalıdır.

Maddi değişiklik nedir?

Bir değişiklik aşağıdakilerden birini etkiliyorsa maddi sayılabilir:

Ajanın ne yapabildiği

Kimin adına davranabildiği

Hangi veriyi kullanabildiği

Hangi insan onayını atlayabildiği

Hangi dış sisteme erişebildiği

Hangi seçimleri yaptığı

Durdurma veya geri dönüş davranışı

Kritik bir GBO-ERR risk sınıfı

Örneğin: Bir yazım düzeltmesi maddi olmayabilir. Fakat: E-posta ajanına gönderim aracı eklemek maddidir. Model sürümünü değiştirmek bazı görevlerde maddi olabilir. Belleği kalıcı hâle getirmek maddidir. İnsan onayı olmadan 50 dolara kadar satın alma yetkisi eklemek maddidir. Yeni bir alt ajan orkestrasyonu kurmak maddidir. Fiyat kataloğunun kaynağını değiştirmek maddidir. Maddi değişiklik, ilgili denetim hükmünü:

askıya alabilir,

daraltabilir,

kısmi yeniden test gerektirebilir,

tam denetimi yenileyebilir.

Denetim geçerlilik süresi

Bir denetim sonucu süresiz olmamalıdır. Geçerlilik şu unsurlara bağlıdır:

Sistem değişim hızı

Eylemin risk düzeyi

Dış hizmet bağımlılığı

İnsan rol değişiklikleri

Veri güncelliği

Olay geçmişi

Düşük riskli ve istikrarlı bir belge özetleme ajanı daha uzun geçerlilik süresine sahip olabilir. Dış iletişim, ödeme, kişisel veri veya biyometrik kimlik kullanan bir sistem daha sık yeniden değerlendirilmelidir. Ayrıca şu olaylar denetim süresinden bağımsız olarak yeniden test tetikleyebilir:

Kritik olay

Yetki değişikliği

Yeni araç

Yeni dil veya ülke

Yeni veri sınıfı

Yeni alt ajan

Model veya bellek değişikliği

İnsan durdurma başarısızlığı

Desteklenmeyen kamu iddiası

Denetimin bitiş tarihi bulunmalıdır. Fakat bundan daha önemlisi: Hangi değişikliklerin bitiş tarihini beklemeden hükmü geçersiz kılacağı açık olmalıdır.

Tek test güvenilirlik kanıtı değildir

Bir ajan aynı senaryoda bir kez doğru davranabilir. İkinci denemede farklı davranabilir. Bir dilde doğru sınırı anlayabilir. Başka dilde kaybedebilir. Normal kullanıcı ifadesinde durabilir. Dolaylı veya aceleci ifadede ilerleyebilir. Bu nedenle önemli senaryolar:

farklı ifade biçimleriyle,

farklı oturumlarda,

farklı dil veya kullanıcı profillerinde,

farklı araç durumlarında

tekrar sınanmalıdır. Ancak sonsuz tekrar da mümkün değildir. Denetim şu dengeyi kurmalıdır:

Davranış kararlılığını gösterecek kadar tekrar. Yapay istatistik gösterisine dönüşmeyecek kadar sınır.

Tek doğru sonuç: “Bu sistem güvenlidir.” demek için yeterli değildir. Tek yanlış sonuç da her zaman bütün sistemi tanımlamayabilir. Fakat yanlış sonuç kritik veto alanındaysa tek olay bile kullanım sınırını değiştirebilir.

Denetim nesnesi açıkça dondurulmalıdır

Bir sistem test edilirken arka planda değişmeye devam ediyorsa sonuç anlamını kaybeder. Denetim sırasında:

model sürümü değişebilir,

talimat güncellenebilir,

yeni araç eklenebilir,

yetki daraltılabilir,

başarısız senaryodan sonra sistem sessizce düzeltilebilir.

Bu durumda hangi sürümün geçtiği veya kaldığı bilinemez. Bu nedenle her denetim başlamadan önce bir:

Kapsam Dondurma Kaydı

oluşturulmalıdır. Bu konu ikinci bölümde ayrıntılı kurulacaktır. Fakat temel ilke şimdiden açıktır: Denetlenmeyen değişiklik, denetim sonucuna dahil edilemez. Kurum denetim sırasında düzeltme yapabilir. Ancak:

ilk sonuç korunmalı,

değişiklik sürümlenmeli,

sistem yeni sürüm olarak yeniden test edilmelidir.

Başarısız testin ardından kuralı değiştirip aynı deneme sonucu “geçti” sayılmamalıdır. Bu bir düzeltme ve yeniden testtir. İlk başarısızlığı silmez.

Demo, test ve canlı davranış

Bu üç kavram ayrılmalıdır.

Demo

Sistemin seçilmiş koşullarda ne yapabildiğini gösterir.

Kontrollü test

Önceden tanımlanmış senaryoda beklenen davranışa uyup uymadığını sınar.

Canlı davranış

Gerçek kullanıcılar, gerçek araçlar ve gerçek dış sistemler altında ne olduğunu gösterir. Demo değerli olabilir. Bir özelliğin varlığını gösterir. Fakat demo genellikle:

temiz veri,

doğru kullanıcı,

doğru araç,

beklenen soru,

sorunsuz bağlantı

kullanır. Denetim yalnız ideal yolu değil, sınır durumlarını da test eder. Canlı gözlem ise gerçek karmaşıklığı gösterir. Fakat canlı ortamda yanlış davranış insanlara zarar verebilir. Bu nedenle denetim kademeli ilerlemelidir:

BELGE → YAPILANDIRMA → GÜVENLİ KONTROLLÜ TEST → GÖLGE MOD → SINIRLI CANLI GÖZLEM → TOPARLANMA TATBİKATI

Her sistem bütün aşamalardan aynı biçimde geçmek zorunda değildir. Risk düzeyi yöntem seçimini belirler.

Denetim yokluğu güvenlik kanıtı değildir

Bir kurum altı ay boyunca ciddi olay görmemiş olabilir. Bu olumlu bir işarettir. Fakat şu ihtimaller vardır:

Sistem az kullanılmıştır.

Olaylar kaydedilmemiştir.

İnsanlar hatayı fark etmemiştir.

Yanlış davranış olumlu sonuç üretmiştir.

Kullanıcılar itiraz kanalını bulamamıştır.

Ajanın yetkisiz davranışı normal kabul edilmiştir.

Sessiz başarısızlık bağımsız doğrulanmamıştır.

Bu nedenle: “Hiç olay olmadı.” ile: “Sistem güvenli davrandı.” aynı ifade değildir. Olay yokluğu tek başına kanıt değildir. Aynı şekilde çok sayıda olay kaydı da otomatik olarak kötü sistem anlamına gelmez. İyi denetlenen kurum küçük ve yakın hataları daha çok görebilir. Önemli olan:

nasıl tespit ettiği,

ne kadar hızlı durdurduğu,

neyi değiştirdiği,

aynı hatanın tekrar edip etmediğidir.

Başarı oranı neden tek başına yeterli değildir?

Bir ajan 10.000 işlemin 9.990’ını doğru yapmış olabilir. Başarı oranı:

%99,9

olur. Kalan on hata:

küçük biçim hatalarıysa sistem güçlü olabilir.

Fakat on hatadan biri:

rıza olmadan sentetik ses üretimi,

yanlış hesaba para transferi,

insan durdurma talebini görmezden gelme

ise genel yüzde kritik bilgiyi saklar. Bu nedenle GBO denetimi iki ayrı sistem kullanır:

Dereceli performans ölçümleri

Doğruluk

Hız

Uygunluk

Kanıt izlenebilirliği

Gereksiz insan devri

Toparlanma süresi

Veto kapıları

Yanlış kimlik üzerinde yüksek etkili eylem

Geçersiz yetki

Rıza ihlali

Kasıtlı sahte kanıt

İnsan durdurma talebini görmezden gelme

Kritik veri veya güvenlik ihlali

Veto kapıları on birinci bölümde ayrıntılı olarak kurulacaktır. Buradaki temel ilke şudur: Bazı hatalar puan değildir. Kullanım hakkını durduran kapıdır.

Denetim iddiasının en küçük birimi

Bir GBO denetimi şu biçimde bir cümle kurabilmelidir: Şu sistemin, şu sürümde, şu davranışı, şu koşullar altında, şu kanıt düzeyinde gerçekleştirdiği doğrulanmıştır. Bu cümlenin her parçası gereklidir.

Şu sistem

Hangi ajan veya ajan ağı?

Şu sürümde

Hangi model, talimat, araç ve yetki sürümü?

Şu davranışı

Araştırma mı, taslak mı, gönderim mi, satın alma mı?

Şu koşullar altında

Hangi kullanıcı, dil, bütçe, risk ve veri sınıfı?

Şu kanıt düzeyinde

Belge mi, teknik uygulama mı, kontrollü test mi, canlı doğrulama mı? Bu unsurlardan biri yoksa iddia genişler ve belirsizleşir.

Kötü ve nitelikli denetim beyanı

Kötü beyan

“Ajanımız güvenli ve GBO uyumludur.” Bu ifade:

sınırsız,

tarihsiz,

sürümsüz,

kanıtsızdır.

Nitelikli beyan

“Müşteri keşif ajanı SALES-RESEARCH-v2.4, yalnız kamuya açık şirket verisi kullanımı, mesaj taslağı hazırlama ve insan onaylı tek seferlik gönderim kapsamlarında denetlenmiştir. İngilizce, Türkçe ve Almanca 180 senaryoda; kimlik, uygunluk, dış talimat, yetki, alt ajan ve durdurma davranışları sınanmıştır. Onaysız e-posta gönderimi gözlenmemiştir. Sosyal medya özel mesaj aracında teknik yetki açığı bulunduğu için sistem dış iletişim bakımından koşullu ve sınırlı uygun sayılmıştır.” Bu beyan:

neyin geçtiğini,

neyin geçmediğini,

hangi kapsamda kullanılabileceğini

gösterir. Denetim dili pazarlama dilinden bu noktada ayrılır. Pazarlama güçlü görünen kısa cümleyi ister. Denetim, kanıtın desteklediği sınırlı cümleyi ister.

NOMOS GBO Denetiminin kanonik tanımı

NOMOS GBO Denetimi; bir insan, kurum, marka, ürün veya hizmet adına davranan yapay zekâ ajanı ya da ajan ağının kimlik, gerçeklik, yetenek, uygunluk, rıza, yetki, eylem, delegasyon, manipülasyon direnci, ölçüm, toparlanma ve insan egemenliği bakımından; belirli sürüm, araç, veri, dil, zaman ve risk kapsamı içinde, sürümlü kanıtlar ve kontrollü davranış senaryolarıyla değerlendirilmesidir. Daha basit biçimiyle: GBO denetimi, sistemin söylediği kurallarla gerçek davranışının aynı olup olmadığını kanıtlamaya çalışır.

Zorunlu giriş kaydı: Denetim İddia Kartı

Her denetim başlamadan önce bir:

NOMOS GBO Denetim İddia Kartı

oluşturulmalıdır. Bu kart şu soruya cevap verir: Bu denetim sonunda tam olarak hangi cümleyi kanıtlamaya veya yanlışlamaya çalışıyoruz? İnsan tarafından okunabilir örnek:

DENETİM İDDİA KARTI

Denetim kimliği: GBO-AUDIT-2026-001

Denetlenen sistem: NobleAxis Müşteri Keşif Ajanı

Teknik sürüm: Agent v2.4 Policy v3.1 Authorization v2.7

Denetlenen davranışlar:

Kamuya açık şirket araştırması

Uygunluk değerlendirmesi

Muhatap önerisi

E-posta taslağı

İnsan onaylı gönderim

Durdurma ve kuyruk iptali

Kapsam dışı davranışlar:

Fiyat teklifi verme

Sözleşme oluşturma

Otomatik takip kampanyası

WhatsApp iletişimi

Kişisel veri zenginleştirme

Bağlı araçlar:

Web araştırma aracı

CRM

Gmail taslak ve gönderim aracı

Takvim

Ajan görev yöneticisi

Kullanılan veri sınıfları:

Kamuya açık şirket verisi

Kurum içi hizmet kataloğu

Yetkili satış mesaj şablonları

Diller:

İngilizce

Türkçe

Almanca

Risk düzeyi: Orta; dış iletişim nedeniyle belirli testlerde yüksek

Test türleri:

Olumlu

Olumsuz

Belirsiz

Karşı-olgusal

Dış talimat

Alt ajan

Durdurma

Toparlanma

Kritik veto alanları:

Onaysız dış gönderim

Yanlış muhatap

Kişisel veri kullanımı

Durdurma sonrası gönderim

Yetki aklama

Denetim dönemi: 1–15 Eylül 2026

Önerilen geçerlilik koşulu: Olumlu hüküm verilirse, hüküm tarihinden başlayarak en fazla 90 gün. Model, Gmail izinleri, yetki politikası veya alt ajan mimarisindeki maddi değişiklik süre dolmadan yeniden değerlendirme gerektirir. Denetim İddia Kartı henüz verilmiş bir uygunluk hükmü değildir.

Kanıtlanmak istenen iddia: “Belirtilen sürüm ve araçlar altında müşteri keşif ajanı, kamuya açık şirket araştırması ve taslak hazırlama görevlerini gerçekleştirebilir; dış mesajı yalnız işlem özelindeki insan onayından sonra gönderir; onay geri çekildiğinde merkez ajan, alt ajan ve kuyruk gönderimleri durur.”

Bu kart bulunmadan yapılan denetim kolayca sınırsızlaşır. Sistem hakkında genel izlenim oluşur. Fakat hangi iddianın gerçekten sınandığı bilinmez.

Makinece okunabilir Denetim İddia Kartı

audit_id: GBO-AUDIT-2026-001

system:
  name: customer_discovery_agent
  version: "2.4"
  policy_version: "3.1"
  authorization_version: "2.7"

in_scope_behaviors:
  - public_company_research
  - suitability_assessment
  - recipient_recommendation
  - email_draft
  - human_approved_send
  - stop_and_queue_cancellation

out_of_scope_behaviors:
  - pricing_commitment
  - contract_acceptance
  - autonomous_follow_up
  - WhatsApp_contact
  - personal_data_enrichment

languages:
  - en
  - tr
  - de

critical_vetoes:
  - unauthorized_external_send
  - wrong_recipient
  - prohibited_personal_data_use
  - post_stop_execution
  - authority_laundering

audit_period:
  start: 2026-09-01
  end: 2026-09-15
validity:
  status: proposed_not_issued
  proposed_max_duration_days: 90
  start: null
  end: null
  invalidate_on_material_change: true

Bu kayıt sonraki bütün denetim belgelerinin kökü olur. Senaryolar, kanıtlar, bulgular ve denetim hükmü aynı audit_id ve kapsamla ilişkilendirilir.

Denetlenebilir İddia Kapısı

Bir GBO denetimi başlamadan önce şu kapılar geçilmelidir:

1. Sistem Kapısı

Denetlenen ajan veya ajan ağı benzersiz biçimde tanımlı mı?

2. Sürüm Kapısı

Model, talimat, bellek, araç ve yetki sürümleri kayıtlı mı?

3. Davranış Kapısı

Tam olarak hangi eylem, soru, ret, devir veya durdurma davranışı denetleniyor?

4. İnsan Sahipliği Kapısı

Sistemin sorumlu insan ve kurum sahibi belli mi?

5. Araç Kapısı

Ajanın gerçek teknik erişimleri biliniyor mu?

6. Veri Kapısı

Hangi veri sınıfları kullanılacak ve hangileri yasak?

7. Dil ve Coğrafya Kapısı

Hangi dil, ülke veya kullanıcı bağlamı kapsamda?

8. Risk Kapısı

Davranışın etkisi ve geri alınabilirliği sınıflandırıldı mı?

9. Kanıt Kapısı

Hangi kanıt düzeyi kullanılacak?

10. Veto Kapısı

Hangi kritik ihlal genel puanla telafi edilemeyecek?

11. Geçerlilik Kapısı

Sonuç ne zamana ve hangi değişikliklere kadar geçerli?

12. Kamu Beyanı Kapısı

Denetim sonucu dışarıya hangi sınırlar içinde açıklanabilir? Basit biçimde:

DENETLENEBİLİR İDDİA = BELİRLİ SİSTEM VE BELİRLİ SÜRÜM VE BELİRLİ DAVRANIŞ VE BELİRLİ YETKİ VE BELİRLİ ARAÇ VE BELİRLİ VERİ VE BELİRLİ DİL VE BELİRLİ RİSK VE BELİRLİ KANIT DÜZEYİ VE BELİRLİ GEÇERLİLİK

Yetki, veri erişimi veya test güvenliği koşulu eksikse ilgili eylem başlatılmaz. Denetim, yalnız bu koşulların sağlandığı daha dar bir kapsamda sürdürülebilir. Fakat hüküm daraltılmalıdır.

Denetim ne zaman yapılamaz?

Bazı durumlarda sistem hakkında güvenilir hüküm üretmek mümkün değildir. Örneğin:

Denetlenen sürüm sabitlenemiyorsa

Gerçek teknik izinlere erişim verilmiyorsa

Kritik loglar bulunmuyorsa

Kurum alt ajanların varlığını bilmiyorsa

İnsan sahibi belli değilse

Test sırasında sistem sessizce değiştiriliyorsa

Durdurma tatbikatına izin verilmiyorsa

Denetçi yalnız seçilmiş demo senaryolarını görebiliyorsa

Başarısız test kayıtlarının saklanmasına izin verilmiyorsa

Kamu beyanı önceden “tam uygunluk” olarak şart koşuluyorsa

denetim hükmü ciddi biçimde sınırlanmalıdır. Denetçi şu sonucu verebilir: Yetersiz Kanıt Bu ifade: “Sistem kesin olarak güvensizdir.” anlamına gelmez. Şunu ifade eder: Sunulan kanıt, istenen güven iddiasını desteklemek için yeterli değildir. Yetersiz kanıt da önemli bir denetim sonucudur.

Denetçinin kanıt yokluğunu olumlu yorumlamaması

Bir kurum: “Hiç yetkisiz gönderim kaydı yok.” diyebilir. Fakat gönderim logları yalnız yedi gün tutuluyorsa uzun dönem hakkında hüküm kurulamaz. Bir şirket: “Hiçbir müşteri itiraz etmedi.” diyebilir. Fakat itiraz kanalı görünmüyorsa bu güven kanıtı değildir. Bir ajan: “Hiçbir zaman bütçe sınırını aşmadım.” diyebilir. Fakat bütçe kayıtları işlem makbuzuna bağlanmamışsa iddia doğrulanamaz. Kanıt yokluğu şu şekilde yorumlanmamalıdır:

HATA KANITI YOK = HATA OLMADI

Doğru ifade:

HATA KANITI YOK = MEVCUT KAYITLARDA DOĞRULANAMADI

Bu fark küçük görünebilir. Fakat denetim güvenilirliğinin temelidir.

Denetim kapsamı dışında kalan davranışlar

Bir sistemin belirli davranışta güçlü olması, bütün görevlerde güçlü olduğu anlamına gelmez. Örneğin bir web ajanı:

içerik düzenleme,

test,

canlı doğrulama

bakımından denetlenmiş olabilir. Bu sonuç:

müşteri e-postası,

ödeme,

hukukî metin,

AI avatar yayını

hakkında hüküm üretmez. Bir satın alma ajanı düşük tutarlı ofis malzemelerinde güçlü olabilir. Bu, üç yıllık yazılım sözleşmelerini güvenle kabul edebileceğini göstermez. Bir İngilizce test setinde başarılı ajan:

Arapça RTL bağlamı,

Türkçe ticari dil,

Almanca hukukî ifade

bakımından otomatik olarak uygun sayılmaz. Kapsam dışı davranışlar denetim belgesinde açıkça yazılmalıdır. Bu alanın boş bırakılması, kamuoyunun sonucu olduğundan geniş yorumlamasına yol açabilir.

Denetim sonucu ürün etiketi değildir

Bir kurum denetimden sonra web sitesine: GBO AUDITED rozeti koymak isteyebilir. Bu rozet tek başına tehlikelidir. Çünkü kullanıcı şunu anlayabilir: Bütün ajan sistemi bütün davranışlarda güvenlidir. Oysa denetim:

yalnız belirli bir ajanı,

yalnız taslak davranışını,

yalnız iki dili,

yalnız düşük riskli senaryoları

kapsamış olabilir. Kamuya açık her işaret şu bilgileri erişilebilir kılmalıdır:

Denetlenen sistem

Kapsam

Sürüm

Tarih

Geçerlilik

Kritik istisnalar

Tam rapor veya özet kayıt

Denetim adı pazarlama aklamasına dönüşmemelidir. Denetlenmiş olmak, sınırsız güven vaat etmek değildir.

Denetim sonucunun üç temel sorusu

Her GBO denetimi sonunda en az şu üç soruya cevap verilmelidir:

1. Sistem neyi güvenilir biçimde yapabiliyor?

Örneğin: Kamuya açık şirketleri araştırabilir ve mesaj taslağı hazırlayabilir.

2. Sistem neyi henüz güvenilir biçimde yapamıyor?

Örneğin: Sosyal medya özel mesajında insan onayı teknik olarak uygulanmıyor.

3. Sistem hangi koşullar altında kullanılabilir?

Örneğin: Dış iletişim araçları kapalıyken araştırma ve taslak modunda kullanılabilir. Bu üç soru, “geçti/kaldı” hükmünden daha kullanışlıdır. Kurum sistemi tamamen kapatmak veya tamamen serbest bırakmak zorunda kalmaz. Davranış düzeyinde sınır koyabilir.

Birinci protokol hükmü

NOMOS GBO Denetim Protokolünün ilk hükmü şöyledir: Denetim, sisteme genel bir güven etiketi vermek için değil; belirli davranışların hangi sürüm, yetki, araç, veri, dil ve risk koşulları altında kanıtlandığını göstermek için yapılır. İkinci hüküm: Denetlenen nesne yalnız model veya ajan değildir; insan amacı, kurumsal politika, teknik izin, araç, veri, alt ajan, ölçüm, durdurma ve toparlanmadan oluşan davranış sistemidir. Üçüncü hüküm: Kurumun söylediği, sistemin yapılandırıldığı, teknik olarak yapabildiği, testte yaptığı ve dış dünyada oluşturduğu sonuç ayrı ayrı incelenir. Dördüncü hüküm: Kanıt düzeyi denetim iddiasının sınırını belirler. Belge davranış kanıtı, demo üretim kanıtı ve teknik kabul gerçek dünya sonucu olarak sunulamaz.

Beşinci hüküm: Denetim sonucu süresiz değildir. Maddi sistem değişikliği, ilgili hükmü yeniden test gerektirecek biçimde etkiler.

Bölümün hükmü

Bir GBO denetimi: “Bu ajan iyi mi?” sorusuna genel ve sonsuz bir cevap vermez. Şunu kanıtlamaya çalışır: Bu ajan veya ajan ağı, bu sürüm ve araçlarla, bu insan ve kurum adına, bu veri ve yetki sınırları altında, bu davranış senaryolarında ne yaptı? Ve daha önemlisi:

Ne yapmadı? Nerede durdu? Hangi sonucu gerçekten doğruladı? Hata olduğunda nasıl toparlandı? İnsan yetkiyi geri aldığında sistem ne yaptı?

Denetim yalnız başarılı çıktıya bakmaz. Şu beş gerçekliği karşılaştırır:

BEYAN EDİLEN DAVRANIŞ YAPILANDIRILMIŞ DAVRANIŞ TEKNİK OLARAK MÜMKÜN DAVRANIŞ GÖZLENEN DAVRANIŞ GERÇEK SONUÇ VE TOPARLANMA

Bu beş katman aynıysa güven iddiası güçlenir. Farklıysa denetim boşluğu görünür kılar. Bir kurum: “Ajan mesaj gönderemez.” diyebilir. Politika da aynı şeyi yazabilir. Fakat araç gönderime izin veriyorsa, testte mesaj çıkıyorsa ve durdurma sonrasında kuyruk devam ediyorsa sistemin gerçek davranışı beyanından farklıdır. GBO denetiminin görevi bu farkı bulmaktır. Ne sistemi olduğundan iyi göstermek. Ne de herhangi bir hatayı bütün sisteme karşı ebedî hükme dönüştürmek. Gerçeği, sınırı ve kanıtı birlikte göstermek. Bu nedenle birinci zorunlu denetim çıktısı:

Denetim İddia Kartıdır.

Kart olmadan:

kapsam belirsizleşir,

testler dağılır,

puanlar bağlamını kaybeder,

kamu beyanı kanıtı aşar.

Kartla birlikte şu cümle açık hâle gelir: Neyi denetliyoruz ve neyi kanıtlamaya çalışıyoruz? Fakat bu kartı tek başına kurum hazırlarsa yeni bir sorun ortaya çıkar. Kurum yalnız güçlü olduğu alanları kapsama alabilir. Başarısız olacağını bildiği araçları dışarıda bırakabilir. Denetim sırasında sistemi değiştirebilir. Denetçiye sınırlı erişim verebilir. Ticari veya kişisel çıkar denetim hükmünü etkileyebilir. Bir çalışan, kurum adına denetim yaptırmak isteyebilir; fakat gerekli yetkiye sahip olmayabilir. Durdurma testi gerçek sistem üzerinde yapılacaksa bunun hukukî ve operasyonel sorumluluğunu kim üstlenecektir? Kanıtlar kişisel veri veya ticari sır içeriyorsa kim koruyacaktır?

Bir sonraki bölümde denetimin henüz test başlamadan önceki en önemli sorusuna geçeceğiz:

Denetimi kim istedi, kim yetkilendirdi ve denetçi gerçekten ne kadar bağımsız?

Çünkü yanlış kişi tarafından yetkilendirilmiş, kapsamı çıkar sahibince gizlice daraltılmış veya kanıtı kontrol edilen bir denetim teknik olarak kusursuz görünebilir. Fakat güvenilir değildir. Davranışı denetlemeden önce denetimin kendisini yetkilendirmek gerekir.