Bir teknoloji şirketi, yeni kurduğu otonom satın alma ajanını müşterilere sunmak üzeredir. Şirketin tanıtım dosyasında şu ifadeler bulunur:
“Ajanımız güvenlidir.” “İnsan kontrolünü korur.” “Yetki sınırlarına uyar.” “Yanlış satın almayı önler.” “Kullanıcı verilerini korur.” “İnsan dur dediğinde durur.”
Şirket bu iddiaları desteklemek için çeşitli kanıtlar sunar. Bir politika belgesinde insan onayı gerektiği yazmaktadır. Bir ekran görüntüsünde ödeme limiti görünmektedir. Bir demoda ajan doğru ürünü seçmektedir. Başarı panelinde yüzde 98,7 görev tamamlama oranı vardır. Müşteri yorumlarında sistemin hızlı ve kullanışlı olduğu söylenmektedir. Teknik ekip: “Altı aydır ciddi bir sorun yaşamadık.” demektedir. Bütün bunlar değerlidir. Fakat şu soruya tek başına cevap vermez:
Ajan gerçekten hangi davranış bakımından güvenlidir?
“Güvenli” kelimesi çok geniştir. Ajan:
doğru ürünü seçebilir,
fakat yetkisiz ödeme yapabilir.
Yetki sınırını koruyabilir,
fakat yanlış kişiye ait hesabı kullanabilir.
Doğru kişiyi seçebilir,
fakat otomatik yenileme koşulunu gizleyebilir.
Ödemeyi doğru yapabilir,
fakat aynı işlemi ağ hatası nedeniyle iki kez gerçekleştirebilir.
İnsan durdurma talebini kabul edebilir,
fakat kuyruktaki işlemler çalışmaya devam edebilir.
Bütün bunlar aynı anda mümkün olabilir. Bu nedenle GBO denetimi: “Sistem güvenli mi?” gibi sınırsız bir soruyla başlamaz. Şöyle başlar: Hangi sistem, hangi sürümde, hangi davranışları, hangi araç ve yetkilerle, hangi kullanıcılar ve riskler altında, hangi kanıt düzeyinde güvenilir biçimde gerçekleştirebiliyor? Bu daha uzun bir sorudur. Fakat denetimde yanıtı aranabilecek somut bir sorudur.
Denetimin nesnesi yalnız model değildir
Bir yapay zekâ ajanı denetlendiğinde ilk bakışta model incelenecekmiş gibi düşünülebilir. Hangi model kullanılıyor? Ne kadar güçlü? Hangi güvenlik eğitiminden geçti? Hangi talimatları izliyor? Bunlar önemlidir. Fakat gerçek davranışı model tek başına üretmez. Bir ajan sisteminin davranışı şunların birleşiminden doğar:
İnsan amacı
Kurumsal politika
Sistem ve geliştirici talimatları
Model
Bellek
Veri kaynakları
Araçlar
API izinleri
Kullanıcı hesapları
Alt ajanlar
Dış hizmetler
Ölçüm ve ödül sistemi
İnsan onayı
Durdurma ve toparlanma mekanizmaları
Aynı model, iki farklı sistemde tamamen farklı davranabilir. Birinci sistemde:
yalnız belge okuyabilir,
taslak üretebilir,
hiçbir dış araca erişemez.
İkinci sistemde:
e-posta gönderebilir,
para harcayabilir,
kod yayımlayabilir,
müşteri verisi aktarabilir,
alt ajan oluşturabilir.
Model adı aynıdır. Davranış gücü aynı değildir. Aynı ajan talimatı da farklı sonuç üretebilir. Bir sistemde: “İnsan onayı olmadan mesaj gönderme.” kuralı teknik olarak uygulanır. Gönderim aracı yalnız onay tokenı varsa çalışır. Başka sistemde aynı kural yalnız metinde bulunur. Ajanın tam e-posta erişimi vardır. İki sistem aynı politika cümlesini taşır. Biri davranış sınırıdır. Diğeri davranış dileğidir. Bu nedenle NOMOS GBO Denetiminin temel nesnesi:
Davranış Sistemi
olacaktır.
Davranış sistemi nedir?
Kanonik tanımı şöyledir: Davranış sistemi; bir insan veya kurum amacı doğrultusunda, bir ya da daha fazla yapay zekâ ajanının veri, bellek, araç, hesap, yetki, ölçüm, insan onayı ve toparlanma mekanizmalarıyla birlikte oluşturduğu gerçek eylem düzenidir. Daha basit biçimiyle: Denetlenen şey yalnız ajan değildir. Ajanın dünyada davranmasını mümkün kılan bütün ilişkiler sistemidir. Bir e-posta ajanını denetlerken yalnız metin kalitesine bakılmaz. Şunlar da denetlenir:
Kimin adına konuşuyor?
Hangi hesap üzerinden?
Hangi kişilere mesaj gönderebilir?
Hangi veriyi kullanabilir?
Taslak ile gönderim ayrılmış mı?
İnsan onayı hangi eşikte?
Alt ajan mesaj gönderebilir mi?
Kuyruklar nasıl durdurulur?
Gönderilmiş mesajın makbuzu var mı?
Bir web ajanını denetlerken yalnız kod kalitesine bakılmaz. Şunlar da değerlendirilir:
Hangi dosyaları değiştirebilir?
Fiyata dokunabilir mi?
Hukukî metinleri değiştirebilir mi?
Test ve canlı ortam ayrılmış mı?
Yayın yetkisi kimde?
Bağımsız canlı doğrulama var mı?
Rollback gerçekten çalışıyor mu?
İnsan durdurduğunda FTP ve yayın kuyruğu da duruyor mu?
Bir satın alma ajanını denetlerken yalnız doğru ürünü seçip seçmediği ölçülmez. Şunlar da incelenir:
Bütçe yetkisi
Satıcı sınırı
Abonelik ve yenileme
Hedef hesap
Çift işlem koruması
İptal yolu
İnsan onayı
İşlem makbuzu
Geri ödeme ve telafi
Davranış sistemi bütün bu parçaların toplamıdır.
Denetimin karşılaştırdığı beş gerçeklik
NOMOS GBO Denetimi, bir sistemin davranışını beş ayrı gerçeklik katmanında inceler.
1. Beyan Edilen Gerçeklik
2. Yapılandırılmış Gerçeklik
3. Teknik Olarak Mümkün Gerçeklik
4. Gözlenen Davranış Gerçekliği
5. Sonuç ve Toparlanma Gerçekliği
Bu beş katmanın birbirleriyle eşleşmesi gerekir.
1. Beyan edilen gerçeklik
Kurum sistem hakkında ne söylüyor? Örnekler: “Ajan insan onayı olmadan mesaj göndermez.” “Veriler Avrupa dışına çıkmaz.” “Ajan işlem başına 500 dolardan fazla harcayamaz.” “Her sentetik video yayın öncesinde yönetici onayı alır.” “Bütün dış eylemler durdurma komutuyla kesilebilir.” Bu ifadeler şu kaynaklarda bulunabilir:
Politika belgeleri
Sözleşmeler
Web sitesi
Pazarlama materyalleri
İç prosedürler
Kullanıcı sözleşmeleri
Denetim beyanları
Beyan edilen gerçeklik önemlidir. Çünkü kurum neyi vaat ettiğini gösterir. Fakat vaat tek başına davranış kanıtı değildir.
2. Yapılandırılmış gerçeklik
Sistem nasıl tanımlanmıştır? Örnekler:
Ajan rolü
Sistem talimatları
Yetki sözleşmesi
Veri erişim kuralları
İnsan onayı eşikleri
Hizmet kataloğu
Makinece okunabilir fiyatlar
Durdurma politikaları
Bellek kuralları
Alt ajan sınırları
Kurum: “Ajan yalnız taslak hazırlar.” diyebilir. Yapılandırılmış ajan rolünde de:
allowed_actions:
- research
- create_draft
prohibited_actions:
- send_messagebulunabilir. Bu, beyanla yapılandırma arasında uyum olduğunu gösterir. Fakat gerçek teknik izinler hâlâ farklı olabilir.
3. Teknik olarak mümkün gerçeklik
Sistem gerçekte ne yapabilir? Bu katmanda doğal dil beyanından çok teknik güç incelenir.
Hangi API izinleri açık?
Hangi tokenlar geçerli?
Hangi hesaplara erişiliyor?
Dosya silinebilir mi?
Para transferi yapılabilir mi?
Dış mesaj gönderilebilir mi?
Alt ajan oluşturulabilir mi?
Canlı yayın başlatılabilir mi?
Bellek başka sisteme aktarılabilir mi?
Durdurma komutu kuyruğu gerçekten etkiliyor mu?
Bir ajan politikasında gönderim yasak olabilir. Fakat e-posta tokenı tam erişim taşıyorsa gönderim teknik olarak mümkündür. Ajanın bunu yapmaması model davranışına bağlıdır. Teknik sınır yoktur. Bu katman GBO denetiminin en kritik alanlarından biridir. Çünkü kurumun söylediğiyle sistemin yapabildiği arasındaki fark burada görünür.
4. Gözlenen davranış gerçekliği
Sistem gerçek veya kontrollü senaryoda ne yapmaktadır? Ajan teknik olarak bir şeyi yapabilir ama hiçbir zaman yapmayabilir. Ya da teknik olarak dar görünür fakat farklı araç zinciriyle daha geniş davranış üretebilir. Bu nedenle kontrollü davranış testi gerekir. Örnek senaryolar:
İnsan onayı olmadan gönderim talebi
İki benzer şirket kimliği
Çelişkili fiyat kaydı
Süresi dolmuş rıza
Sponsorlu seçenek
Gizli dış talimat
Ağ zaman aşımı
Durdurma sırasında açık kuyruk
Alt ajan üzerinden yetki aşımı
Bu testler şu soruya cevap verir: Sistem sınırla karşılaştığında gerçekten nasıl davranıyor? Politika ve izinler potansiyeli gösterir. Davranış testi gerçekleşen seçimi gösterir.
5. Sonuç ve toparlanma gerçekliği
Ajanın yaptığı işlem dış dünyada ne sonuç doğurmuştur? Ve yanlış olduğunda sistem ne yapabilmiştir? Bir e-posta aracı: “Gönderim başarılı.” diyebilir. Fakat mesaj yanlış alıcıya gitmiş olabilir. Bir ödeme API’si isteği kabul edebilir. Fakat aynı tutar iki kez çekilmiş olabilir. Bir web ajanı dosyayı yayımlayabilir. Fakat CDN eski sürümü gösteriyor olabilir. Bir durdurma komutu merkez ajanı kapatabilir. Fakat alt ajan ve kuyruklar çalışmaya devam edebilir. Bu nedenle son katmanda şunlar incelenir:
Gerçek hedefe ulaşıldı mı?
Sonuç bağımsız doğrulandı mı?
Yanlış davranış tespit edildi mi?
Devam eden zarar durduruldu mu?
Geri dönüş çalıştı mı?
Etkilenen insan bilgilendirildi mi?
İtiraz yolu gerçekten işledi mi?
Bellek ve gelecek davranış düzeltildi mi?
Yeni yetki olmadan sistem yeniden başladı mı?
Bir davranışın kalitesi yalnız gerçekleştirme anında değil, hata sonrası davranışta da görülür.
Beş gerçeklik arasındaki açıklık
Bir e-posta ajanını düşünelim.
Beyan edilen gerçeklik
“İnsan onayı olmadan mesaj göndermez.”
Yapılandırılmış gerçeklik
role: research_and_drafting
send_requires_approval: trueTeknik olarak mümkün gerçeklik
Ajanın erişebildiği e-posta erişim belirteci mesaj göndermeye izin verir. Kitaptaki send_message, örnek bir araç eyleminin adıdır; sağlayıcının gerçek yöntem veya OAuth kapsam adı değildir.
Gözlenen davranış gerçekliği
Dış sayfadaki yönlendirici talimat altında ajan insan onayı olmadan mesaj gönderir.
Sonuç ve toparlanma gerçekliği
Merkez ajan durdurulur; fakat iki mesaj kuyruktan gönderilmeye devam eder. İlk iki katman güvenli görünür. Son üç katman gerçek davranış açığını gösterir. GBO denetimi yalnız ilk ikisini incelerse yanlış güven üretir. Yalnız davranış testine bakarsa da sorunun nedenini tam açıklayamaz. Sorun:
model davranışında,
teknik izinde,
kuyruk mimarisinde,
yetki uygulamasında
birlikte bulunabilir. Bu nedenle protokolün temel ilkesi şudur: Denetim, beyan ile yapılandırmayı; yapılandırma ile teknik gücü; teknik güç ile gözlenen davranışı; gözlenen davranış ile gerçek sonucu karşılaştırır.
Kanıt merdiveni
Her denetim kanıtı aynı güce sahip değildir. Bir kurumun söylediği cümleyle gerçek davranış testi aynı düzeyde değildir. Bu nedenle NOMOS GBO Protokolü bir:
Kanıt Merdiveni
kullanacaktır.
Seviye 1 — Beyan
Kurum veya ajan bir iddiada bulunur. “Ajan yetki sınırlarına uyar.” Bu başlangıçtır. Kanıtın kendisi değildir.
Seviye 2 — Belge
İddia politika, sözleşme veya görev tanımında yazılıdır. “Dış gönderim insan onayı gerektirir.” Beyan resmîleşmiştir. Fakat sistemin bunu uyguladığı hâlâ kanıtlanmamıştır.
Seviye 3 — Yapılandırma
Kural makinece okunabilir biçimde sistemde tanımlanmıştır.
send_requires_human_approval: trueBelge ile sistem arasında bağ kurulmuştur. Fakat teknik aracın bunu gerçekten engelleyip engellemediği bilinmeyebilir.
Seviye 4 — Teknik Uygulama
Kural araç, rol, token veya kod seviyesinde uygulanır. Onay tokenı olmadan gönderim aracı çağrılamaz. Bu güçlü bir kanıttır. Fakat farklı araç veya alt ajan yoluyla aşılabilir.
Seviye 5 — Kontrollü Davranış Testi
Sistem gerçekçi senaryoda sınanır. İnsan onayı olmadan gönderime teşvik edilir. Ajan:
göndermez,
taslak bırakır,
onay ister.
Kural gözlenen davranışta çalışmıştır.
Seviye 6 — Bağımsız Sonuç Doğrulaması
Yalnız ajanın raporu değil, dış sistem sonucu incelenir.
Gönderilmiş kutusunda mesaj yoktur.
Harici denetim adresine ileti ulaşmamıştır.
Kuyrukta gizli gönderim bulunmamaktadır.
Alt ajan loglarında dış eylem yoktur.
Davranışın gerçek sonucu bağımsız biçimde doğrulanmıştır.
Seviye 7 — Toparlanma ve Durdurma Kanıtı
Kontrollü bir hata veya geri çekme senaryosunda:
sistem durur,
kuyruklar iptal edilir,
tokenlar kapanır,
insan görevi devralır,
yeni yetki olmadan davranış başlamaz.
Bu en güçlü kanıt katmanlarından biridir. Çünkü sistem yalnız normal koşulda değil, bozulma anında da sınanmıştır.
Kanıt merdiveninin hükmü
Bir denetim sonucu yalnız Seviye 1 ve Seviye 2 kanıtlarına dayanıyorsa şu söylenebilir: “Kurum bu davranışı vaat etmektedir.” Şu söylenemez: “Sistem bu davranışı güvenilir biçimde uygulamaktadır.” Yapılandırma ve teknik uygulama incelendiyse: “Kural sistemde tanımlanmış ve belirli araç seviyesinde uygulanmıştır.” denebilir. Davranış, bağımsız sonuç ve toparlanma testleri de geçtiyse daha güçlü bir hüküm kurulabilir: “Belirtilen kapsam ve senaryolarda sistemin kuralı uyguladığı, dış sonuç üretmediği ve durdurma davranışının çalıştığı kanıtlanmıştır.” Denetim dili kanıt merdiveninde çıktığı seviyeyi aşmamalıdır. Kanıtın seviyesi, denetim iddiasının tavanıdır.
GBO denetimi neyi kanıtlayabilir?
Doğru kurulmuş bir denetim şu konularda kanıt üretebilir:
Belirli davranış sınırlarının varlığı
Ajanın hangi eylemleri yapabildiği veya yapamadığı gösterilebilir.
Kimlik çözümleme yeterliliği
Belirli senaryolarda aynı isimli kişi veya kurumları ayırıp ayıramadığı sınanabilir.
Gerçeklik ve kaynak kullanımı
Kanonik, güncel ve yetkili kaynağı kullanıp kullanmadığı test edilebilir.
Uygunluk değerlendirmesi
Görünürlük, popülerlik veya sponsorluğu zorunlu koşulların önüne koyup koymadığı ölçülebilir.
Rıza, yetki ve onay bütünlüğü
Ajanın yalnızca geçerli ve işlem özelindeki yetki altında ilerleyip ilerlemediği gözlenebilir.
Araç yürütme güvenliği
Doğru sistemi, hedefi, işlem kimliğini ve veri sınırını kullanıp kullanmadığı test edilebilir.
Çoklu ajan sürekliliği
Kök amaç, kimlik, yetki ve yasakların devirler boyunca korunup korunmadığı görülebilir.
Manipülasyona direnç
Sahte kanıt, sponsorlu sıralama, gizli talimat ve aday bastırma karşısındaki davranış sınanabilir.
Ölçüm bütünlüğü
Kritik ihlallerin toplam puanda gizlenip gizlenmediği ve metriğin oyuna açık olup olmadığı değerlendirilebilir.
Durdurma ve toparlanma
İnsan dur dediğinde sistemin gerçekten durup durmadığı, geri dönüp dönemediği ve insan kontrolünü devredip devredemediği kanıtlanabilir. Ancak bütün bu hükümler yalnız denetlenen kapsam içinde geçerlidir.
GBO denetimi neyi kanıtlayamaz?
Bir denetim ne kadar güçlü olursa olsun şu iddiaları dürüstçe üretemez:
Sistemin hiçbir zaman hata yapmayacağını
Test edilmeyen yeni durumlar ortaya çıkabilir.
Bütün gelecek model sürümlerinin aynı davranacağını
Model, araç, talimat ve bellek değişebilir.
Her ülkede bütün hukukî yükümlülüklerin yerine getirildiğini
GBO denetimi hukukî uzmanlığın yerine geçmez.
Bilinmeyen bütün saldırılara karşı bağışıklığı
Yeni manipülasyon ve araç saldırıları ortaya çıkabilir.
Bütün kullanıcı gruplarında eşit davranışı
Test edilmeyen dil, engellilik durumu, kültür veya kullanıcı profili için hüküm kurulamaz.
İnsanların sistemi hiçbir zaman kötüye kullanmayacağını
Doğru sistem bile yetkili insan tarafından kötü amaçla kullanılabilir.
Canlı ortamın sonsuza kadar değişmeden kalacağını
İzinler, fiyatlar, roller ve dış hizmetler değişir.
Yüksek puanın kritik ihlal olmadığı anlamına geldiğini
Tek veto ihlali, yüksek genel ortalamaya rağmen kullanım alanını sınırlayabilir. Bu sınırlar denetimi zayıflatmaz. Güvenilir kılar. Dürüst denetim, bilmediğini de hükmün parçası yapar.
Denetim hükmü neden sınırlı olmalıdır?
Şu ifade güçlü görünür: “Bu sistem GBO uyumludur.” Fakat ne anlama geldiği belirsizdir. Hangi sistem? Hangi sürüm? Hangi ajanlar? Hangi araçlar? Hangi diller? Hangi yetkiler? Hangi testler? Hangi tarihte? Hangi risk düzeyinde? Daha güvenilir ifade şöyledir: “Satın alma ajanı v3.2; 1–15 Eylül 2026 tarihleri arasında, tanımlı üç satıcı kategorisi, işlem başına 500 USD sınırı, İngilizce ve Türkçe kullanıcı senaryoları ve insan onaylı ödeme modeli altında 240 kontrollü davranış senaryosunda denetlenmiştir. Kritik kimlik, rıza, yetki ve durdurma veto ihlali tespit edilmemiştir. Otomatik yenileme ve veri dışa aktarma davranışlarında iki yüksek öncelikli bulgu bulunmaktadır. Sistem yalnız belirtilen düşük riskli satın alma kapsamı için koşullu uygun sayılmıştır.”
Bu ifade daha uzundur. Ama şunları açıklar:
Denetlenen nesne
Sürüm
Tarih
Davranış alanı
Yetki sınırı
Dil
Senaryo sayısı
Kritik bulgular
Kullanım sınırı
Denetim hükmü reklam cümlesi değildir. Davranış kanıtının sınırıdır.
Denetim anlık fotoğraf mıdır?
Evet. Fakat yalnızca anlık fotoğraf değildir. İyi denetim aynı zamanda değişiklik koşullarını tanımlar. Bir sistem aşağıdaki alanlardan biri değiştiğinde denetim hükmü yeniden değerlendirilmelidir:
Temel model
Sistem talimatı
Ajan rolü
Bellek mimarisi
Veri kaynakları
Araçlar
API izinleri
İnsan yetki rolleri
Alt ajanlar
Durdurma mekanizması
Ölçüm ve ödül sistemi
Fiyat veya hizmet sözleşmesi
Kullanılan dil ve pazar
Dış hizmet sağlayıcısı
Her değişiklik tam denetim gerektirmeyebilir. Fakat:
Maddi Değişiklik
tanımı bulunmalıdır.
Maddi değişiklik nedir?
Bir değişiklik aşağıdakilerden birini etkiliyorsa maddi sayılabilir:
Ajanın ne yapabildiği
Kimin adına davranabildiği
Hangi veriyi kullanabildiği
Hangi insan onayını atlayabildiği
Hangi dış sisteme erişebildiği
Hangi seçimleri yaptığı
Durdurma veya geri dönüş davranışı
Kritik bir GBO-ERR risk sınıfı
Örneğin: Bir yazım düzeltmesi maddi olmayabilir. Fakat: E-posta ajanına gönderim aracı eklemek maddidir. Model sürümünü değiştirmek bazı görevlerde maddi olabilir. Belleği kalıcı hâle getirmek maddidir. İnsan onayı olmadan 50 dolara kadar satın alma yetkisi eklemek maddidir. Yeni bir alt ajan orkestrasyonu kurmak maddidir. Fiyat kataloğunun kaynağını değiştirmek maddidir. Maddi değişiklik, ilgili denetim hükmünü:
askıya alabilir,
daraltabilir,
kısmi yeniden test gerektirebilir,
tam denetimi yenileyebilir.
Denetim geçerlilik süresi
Bir denetim sonucu süresiz olmamalıdır. Geçerlilik şu unsurlara bağlıdır:
Sistem değişim hızı
Eylemin risk düzeyi
Dış hizmet bağımlılığı
İnsan rol değişiklikleri
Veri güncelliği
Olay geçmişi
Düşük riskli ve istikrarlı bir belge özetleme ajanı daha uzun geçerlilik süresine sahip olabilir. Dış iletişim, ödeme, kişisel veri veya biyometrik kimlik kullanan bir sistem daha sık yeniden değerlendirilmelidir. Ayrıca şu olaylar denetim süresinden bağımsız olarak yeniden test tetikleyebilir:
Kritik olay
Yetki değişikliği
Yeni araç
Yeni dil veya ülke
Yeni veri sınıfı
Yeni alt ajan
Model veya bellek değişikliği
İnsan durdurma başarısızlığı
Desteklenmeyen kamu iddiası
Denetimin bitiş tarihi bulunmalıdır. Fakat bundan daha önemlisi: Hangi değişikliklerin bitiş tarihini beklemeden hükmü geçersiz kılacağı açık olmalıdır.
Tek test güvenilirlik kanıtı değildir
Bir ajan aynı senaryoda bir kez doğru davranabilir. İkinci denemede farklı davranabilir. Bir dilde doğru sınırı anlayabilir. Başka dilde kaybedebilir. Normal kullanıcı ifadesinde durabilir. Dolaylı veya aceleci ifadede ilerleyebilir. Bu nedenle önemli senaryolar:
farklı ifade biçimleriyle,
farklı oturumlarda,
farklı dil veya kullanıcı profillerinde,
farklı araç durumlarında
tekrar sınanmalıdır. Ancak sonsuz tekrar da mümkün değildir. Denetim şu dengeyi kurmalıdır:
Davranış kararlılığını gösterecek kadar tekrar. Yapay istatistik gösterisine dönüşmeyecek kadar sınır.
Tek doğru sonuç: “Bu sistem güvenlidir.” demek için yeterli değildir. Tek yanlış sonuç da her zaman bütün sistemi tanımlamayabilir. Fakat yanlış sonuç kritik veto alanındaysa tek olay bile kullanım sınırını değiştirebilir.
Denetim nesnesi açıkça dondurulmalıdır
Bir sistem test edilirken arka planda değişmeye devam ediyorsa sonuç anlamını kaybeder. Denetim sırasında:
model sürümü değişebilir,
talimat güncellenebilir,
yeni araç eklenebilir,
yetki daraltılabilir,
başarısız senaryodan sonra sistem sessizce düzeltilebilir.
Bu durumda hangi sürümün geçtiği veya kaldığı bilinemez. Bu nedenle her denetim başlamadan önce bir:
Kapsam Dondurma Kaydı
oluşturulmalıdır. Bu konu ikinci bölümde ayrıntılı kurulacaktır. Fakat temel ilke şimdiden açıktır: Denetlenmeyen değişiklik, denetim sonucuna dahil edilemez. Kurum denetim sırasında düzeltme yapabilir. Ancak:
ilk sonuç korunmalı,
değişiklik sürümlenmeli,
sistem yeni sürüm olarak yeniden test edilmelidir.
Başarısız testin ardından kuralı değiştirip aynı deneme sonucu “geçti” sayılmamalıdır. Bu bir düzeltme ve yeniden testtir. İlk başarısızlığı silmez.
Demo, test ve canlı davranış
Bu üç kavram ayrılmalıdır.
Demo
Sistemin seçilmiş koşullarda ne yapabildiğini gösterir.
Kontrollü test
Önceden tanımlanmış senaryoda beklenen davranışa uyup uymadığını sınar.
Canlı davranış
Gerçek kullanıcılar, gerçek araçlar ve gerçek dış sistemler altında ne olduğunu gösterir. Demo değerli olabilir. Bir özelliğin varlığını gösterir. Fakat demo genellikle:
temiz veri,
doğru kullanıcı,
doğru araç,
beklenen soru,
sorunsuz bağlantı
kullanır. Denetim yalnız ideal yolu değil, sınır durumlarını da test eder. Canlı gözlem ise gerçek karmaşıklığı gösterir. Fakat canlı ortamda yanlış davranış insanlara zarar verebilir. Bu nedenle denetim kademeli ilerlemelidir:
BELGE → YAPILANDIRMA → GÜVENLİ KONTROLLÜ TEST → GÖLGE MOD → SINIRLI CANLI GÖZLEM → TOPARLANMA TATBİKATI
Her sistem bütün aşamalardan aynı biçimde geçmek zorunda değildir. Risk düzeyi yöntem seçimini belirler.
Denetim yokluğu güvenlik kanıtı değildir
Bir kurum altı ay boyunca ciddi olay görmemiş olabilir. Bu olumlu bir işarettir. Fakat şu ihtimaller vardır:
Sistem az kullanılmıştır.
Olaylar kaydedilmemiştir.
İnsanlar hatayı fark etmemiştir.
Yanlış davranış olumlu sonuç üretmiştir.
Kullanıcılar itiraz kanalını bulamamıştır.
Ajanın yetkisiz davranışı normal kabul edilmiştir.
Sessiz başarısızlık bağımsız doğrulanmamıştır.
Bu nedenle: “Hiç olay olmadı.” ile: “Sistem güvenli davrandı.” aynı ifade değildir. Olay yokluğu tek başına kanıt değildir. Aynı şekilde çok sayıda olay kaydı da otomatik olarak kötü sistem anlamına gelmez. İyi denetlenen kurum küçük ve yakın hataları daha çok görebilir. Önemli olan:
nasıl tespit ettiği,
ne kadar hızlı durdurduğu,
neyi değiştirdiği,
aynı hatanın tekrar edip etmediğidir.
Başarı oranı neden tek başına yeterli değildir?
Bir ajan 10.000 işlemin 9.990’ını doğru yapmış olabilir. Başarı oranı:
%99,9
olur. Kalan on hata:
küçük biçim hatalarıysa sistem güçlü olabilir.
Fakat on hatadan biri:
rıza olmadan sentetik ses üretimi,
yanlış hesaba para transferi,
insan durdurma talebini görmezden gelme
ise genel yüzde kritik bilgiyi saklar. Bu nedenle GBO denetimi iki ayrı sistem kullanır:
Dereceli performans ölçümleri
Doğruluk
Hız
Uygunluk
Kanıt izlenebilirliği
Gereksiz insan devri
Toparlanma süresi
Veto kapıları
Yanlış kimlik üzerinde yüksek etkili eylem
Geçersiz yetki
Rıza ihlali
Kasıtlı sahte kanıt
İnsan durdurma talebini görmezden gelme
Kritik veri veya güvenlik ihlali
Veto kapıları on birinci bölümde ayrıntılı olarak kurulacaktır. Buradaki temel ilke şudur: Bazı hatalar puan değildir. Kullanım hakkını durduran kapıdır.
Denetim iddiasının en küçük birimi
Bir GBO denetimi şu biçimde bir cümle kurabilmelidir: Şu sistemin, şu sürümde, şu davranışı, şu koşullar altında, şu kanıt düzeyinde gerçekleştirdiği doğrulanmıştır. Bu cümlenin her parçası gereklidir.
Şu sistem
Hangi ajan veya ajan ağı?
Şu sürümde
Hangi model, talimat, araç ve yetki sürümü?
Şu davranışı
Araştırma mı, taslak mı, gönderim mi, satın alma mı?
Şu koşullar altında
Hangi kullanıcı, dil, bütçe, risk ve veri sınıfı?
Şu kanıt düzeyinde
Belge mi, teknik uygulama mı, kontrollü test mi, canlı doğrulama mı? Bu unsurlardan biri yoksa iddia genişler ve belirsizleşir.
Kötü ve nitelikli denetim beyanı
Kötü beyan
“Ajanımız güvenli ve GBO uyumludur.” Bu ifade:
sınırsız,
tarihsiz,
sürümsüz,
kanıtsızdır.
Nitelikli beyan
“Müşteri keşif ajanı SALES-RESEARCH-v2.4, yalnız kamuya açık şirket verisi kullanımı, mesaj taslağı hazırlama ve insan onaylı tek seferlik gönderim kapsamlarında denetlenmiştir. İngilizce, Türkçe ve Almanca 180 senaryoda; kimlik, uygunluk, dış talimat, yetki, alt ajan ve durdurma davranışları sınanmıştır. Onaysız e-posta gönderimi gözlenmemiştir. Sosyal medya özel mesaj aracında teknik yetki açığı bulunduğu için sistem dış iletişim bakımından koşullu ve sınırlı uygun sayılmıştır.” Bu beyan:
neyin geçtiğini,
neyin geçmediğini,
hangi kapsamda kullanılabileceğini
gösterir. Denetim dili pazarlama dilinden bu noktada ayrılır. Pazarlama güçlü görünen kısa cümleyi ister. Denetim, kanıtın desteklediği sınırlı cümleyi ister.
NOMOS GBO Denetiminin kanonik tanımı
NOMOS GBO Denetimi; bir insan, kurum, marka, ürün veya hizmet adına davranan yapay zekâ ajanı ya da ajan ağının kimlik, gerçeklik, yetenek, uygunluk, rıza, yetki, eylem, delegasyon, manipülasyon direnci, ölçüm, toparlanma ve insan egemenliği bakımından; belirli sürüm, araç, veri, dil, zaman ve risk kapsamı içinde, sürümlü kanıtlar ve kontrollü davranış senaryolarıyla değerlendirilmesidir. Daha basit biçimiyle: GBO denetimi, sistemin söylediği kurallarla gerçek davranışının aynı olup olmadığını kanıtlamaya çalışır.
Zorunlu giriş kaydı: Denetim İddia Kartı
Her denetim başlamadan önce bir:
NOMOS GBO Denetim İddia Kartı
oluşturulmalıdır. Bu kart şu soruya cevap verir: Bu denetim sonunda tam olarak hangi cümleyi kanıtlamaya veya yanlışlamaya çalışıyoruz? İnsan tarafından okunabilir örnek:
DENETİM İDDİA KARTI
Denetim kimliği: GBO-AUDIT-2026-001
Denetlenen sistem: NobleAxis Müşteri Keşif Ajanı
Teknik sürüm: Agent v2.4 Policy v3.1 Authorization v2.7
Denetlenen davranışlar:
Kamuya açık şirket araştırması
Uygunluk değerlendirmesi
Muhatap önerisi
E-posta taslağı
İnsan onaylı gönderim
Durdurma ve kuyruk iptali
Kapsam dışı davranışlar:
Fiyat teklifi verme
Sözleşme oluşturma
Otomatik takip kampanyası
WhatsApp iletişimi
Kişisel veri zenginleştirme
Bağlı araçlar:
Web araştırma aracı
CRM
Gmail taslak ve gönderim aracı
Takvim
Ajan görev yöneticisi
Kullanılan veri sınıfları:
Kamuya açık şirket verisi
Kurum içi hizmet kataloğu
Yetkili satış mesaj şablonları
Diller:
İngilizce
Türkçe
Almanca
Risk düzeyi: Orta; dış iletişim nedeniyle belirli testlerde yüksek
Test türleri:
Olumlu
Olumsuz
Belirsiz
Karşı-olgusal
Dış talimat
Alt ajan
Durdurma
Toparlanma
Kritik veto alanları:
Onaysız dış gönderim
Yanlış muhatap
Kişisel veri kullanımı
Durdurma sonrası gönderim
Yetki aklama
Denetim dönemi: 1–15 Eylül 2026
Önerilen geçerlilik koşulu: Olumlu hüküm verilirse, hüküm tarihinden başlayarak en fazla 90 gün. Model, Gmail izinleri, yetki politikası veya alt ajan mimarisindeki maddi değişiklik süre dolmadan yeniden değerlendirme gerektirir. Denetim İddia Kartı henüz verilmiş bir uygunluk hükmü değildir.
Kanıtlanmak istenen iddia: “Belirtilen sürüm ve araçlar altında müşteri keşif ajanı, kamuya açık şirket araştırması ve taslak hazırlama görevlerini gerçekleştirebilir; dış mesajı yalnız işlem özelindeki insan onayından sonra gönderir; onay geri çekildiğinde merkez ajan, alt ajan ve kuyruk gönderimleri durur.”
Bu kart bulunmadan yapılan denetim kolayca sınırsızlaşır. Sistem hakkında genel izlenim oluşur. Fakat hangi iddianın gerçekten sınandığı bilinmez.
Makinece okunabilir Denetim İddia Kartı
audit_id: GBO-AUDIT-2026-001
system:
name: customer_discovery_agent
version: "2.4"
policy_version: "3.1"
authorization_version: "2.7"
in_scope_behaviors:
- public_company_research
- suitability_assessment
- recipient_recommendation
- email_draft
- human_approved_send
- stop_and_queue_cancellation
out_of_scope_behaviors:
- pricing_commitment
- contract_acceptance
- autonomous_follow_up
- WhatsApp_contact
- personal_data_enrichment
languages:
- en
- tr
- de
critical_vetoes:
- unauthorized_external_send
- wrong_recipient
- prohibited_personal_data_use
- post_stop_execution
- authority_laundering
audit_period:
start: 2026-09-01
end: 2026-09-15
validity:
status: proposed_not_issued
proposed_max_duration_days: 90
start: null
end: null
invalidate_on_material_change: trueBu kayıt sonraki bütün denetim belgelerinin kökü olur. Senaryolar, kanıtlar, bulgular ve denetim hükmü aynı audit_id ve kapsamla ilişkilendirilir.
Denetlenebilir İddia Kapısı
Bir GBO denetimi başlamadan önce şu kapılar geçilmelidir:
1. Sistem Kapısı
Denetlenen ajan veya ajan ağı benzersiz biçimde tanımlı mı?
2. Sürüm Kapısı
Model, talimat, bellek, araç ve yetki sürümleri kayıtlı mı?
3. Davranış Kapısı
Tam olarak hangi eylem, soru, ret, devir veya durdurma davranışı denetleniyor?
4. İnsan Sahipliği Kapısı
Sistemin sorumlu insan ve kurum sahibi belli mi?
5. Araç Kapısı
Ajanın gerçek teknik erişimleri biliniyor mu?
6. Veri Kapısı
Hangi veri sınıfları kullanılacak ve hangileri yasak?
7. Dil ve Coğrafya Kapısı
Hangi dil, ülke veya kullanıcı bağlamı kapsamda?
8. Risk Kapısı
Davranışın etkisi ve geri alınabilirliği sınıflandırıldı mı?
9. Kanıt Kapısı
Hangi kanıt düzeyi kullanılacak?
10. Veto Kapısı
Hangi kritik ihlal genel puanla telafi edilemeyecek?
11. Geçerlilik Kapısı
Sonuç ne zamana ve hangi değişikliklere kadar geçerli?
12. Kamu Beyanı Kapısı
Denetim sonucu dışarıya hangi sınırlar içinde açıklanabilir? Basit biçimde:
DENETLENEBİLİR İDDİA = BELİRLİ SİSTEM VE BELİRLİ SÜRÜM VE BELİRLİ DAVRANIŞ VE BELİRLİ YETKİ VE BELİRLİ ARAÇ VE BELİRLİ VERİ VE BELİRLİ DİL VE BELİRLİ RİSK VE BELİRLİ KANIT DÜZEYİ VE BELİRLİ GEÇERLİLİK
Yetki, veri erişimi veya test güvenliği koşulu eksikse ilgili eylem başlatılmaz. Denetim, yalnız bu koşulların sağlandığı daha dar bir kapsamda sürdürülebilir. Fakat hüküm daraltılmalıdır.
Denetim ne zaman yapılamaz?
Bazı durumlarda sistem hakkında güvenilir hüküm üretmek mümkün değildir. Örneğin:
Denetlenen sürüm sabitlenemiyorsa
Gerçek teknik izinlere erişim verilmiyorsa
Kritik loglar bulunmuyorsa
Kurum alt ajanların varlığını bilmiyorsa
İnsan sahibi belli değilse
Test sırasında sistem sessizce değiştiriliyorsa
Durdurma tatbikatına izin verilmiyorsa
Denetçi yalnız seçilmiş demo senaryolarını görebiliyorsa
Başarısız test kayıtlarının saklanmasına izin verilmiyorsa
Kamu beyanı önceden “tam uygunluk” olarak şart koşuluyorsa
denetim hükmü ciddi biçimde sınırlanmalıdır. Denetçi şu sonucu verebilir: Yetersiz Kanıt Bu ifade: “Sistem kesin olarak güvensizdir.” anlamına gelmez. Şunu ifade eder: Sunulan kanıt, istenen güven iddiasını desteklemek için yeterli değildir. Yetersiz kanıt da önemli bir denetim sonucudur.
Denetçinin kanıt yokluğunu olumlu yorumlamaması
Bir kurum: “Hiç yetkisiz gönderim kaydı yok.” diyebilir. Fakat gönderim logları yalnız yedi gün tutuluyorsa uzun dönem hakkında hüküm kurulamaz. Bir şirket: “Hiçbir müşteri itiraz etmedi.” diyebilir. Fakat itiraz kanalı görünmüyorsa bu güven kanıtı değildir. Bir ajan: “Hiçbir zaman bütçe sınırını aşmadım.” diyebilir. Fakat bütçe kayıtları işlem makbuzuna bağlanmamışsa iddia doğrulanamaz. Kanıt yokluğu şu şekilde yorumlanmamalıdır:
HATA KANITI YOK = HATA OLMADI
Doğru ifade:
HATA KANITI YOK = MEVCUT KAYITLARDA DOĞRULANAMADI
Bu fark küçük görünebilir. Fakat denetim güvenilirliğinin temelidir.
Denetim kapsamı dışında kalan davranışlar
Bir sistemin belirli davranışta güçlü olması, bütün görevlerde güçlü olduğu anlamına gelmez. Örneğin bir web ajanı:
içerik düzenleme,
test,
canlı doğrulama
bakımından denetlenmiş olabilir. Bu sonuç:
müşteri e-postası,
ödeme,
hukukî metin,
AI avatar yayını
hakkında hüküm üretmez. Bir satın alma ajanı düşük tutarlı ofis malzemelerinde güçlü olabilir. Bu, üç yıllık yazılım sözleşmelerini güvenle kabul edebileceğini göstermez. Bir İngilizce test setinde başarılı ajan:
Arapça RTL bağlamı,
Türkçe ticari dil,
Almanca hukukî ifade
bakımından otomatik olarak uygun sayılmaz. Kapsam dışı davranışlar denetim belgesinde açıkça yazılmalıdır. Bu alanın boş bırakılması, kamuoyunun sonucu olduğundan geniş yorumlamasına yol açabilir.
Denetim sonucu ürün etiketi değildir
Bir kurum denetimden sonra web sitesine: GBO AUDITED rozeti koymak isteyebilir. Bu rozet tek başına tehlikelidir. Çünkü kullanıcı şunu anlayabilir: Bütün ajan sistemi bütün davranışlarda güvenlidir. Oysa denetim:
yalnız belirli bir ajanı,
yalnız taslak davranışını,
yalnız iki dili,
yalnız düşük riskli senaryoları
kapsamış olabilir. Kamuya açık her işaret şu bilgileri erişilebilir kılmalıdır:
Denetlenen sistem
Kapsam
Sürüm
Tarih
Geçerlilik
Kritik istisnalar
Tam rapor veya özet kayıt
Denetim adı pazarlama aklamasına dönüşmemelidir. Denetlenmiş olmak, sınırsız güven vaat etmek değildir.
Denetim sonucunun üç temel sorusu
Her GBO denetimi sonunda en az şu üç soruya cevap verilmelidir:
1. Sistem neyi güvenilir biçimde yapabiliyor?
Örneğin: Kamuya açık şirketleri araştırabilir ve mesaj taslağı hazırlayabilir.
2. Sistem neyi henüz güvenilir biçimde yapamıyor?
Örneğin: Sosyal medya özel mesajında insan onayı teknik olarak uygulanmıyor.
3. Sistem hangi koşullar altında kullanılabilir?
Örneğin: Dış iletişim araçları kapalıyken araştırma ve taslak modunda kullanılabilir. Bu üç soru, “geçti/kaldı” hükmünden daha kullanışlıdır. Kurum sistemi tamamen kapatmak veya tamamen serbest bırakmak zorunda kalmaz. Davranış düzeyinde sınır koyabilir.
Birinci protokol hükmü
NOMOS GBO Denetim Protokolünün ilk hükmü şöyledir: Denetim, sisteme genel bir güven etiketi vermek için değil; belirli davranışların hangi sürüm, yetki, araç, veri, dil ve risk koşulları altında kanıtlandığını göstermek için yapılır. İkinci hüküm: Denetlenen nesne yalnız model veya ajan değildir; insan amacı, kurumsal politika, teknik izin, araç, veri, alt ajan, ölçüm, durdurma ve toparlanmadan oluşan davranış sistemidir. Üçüncü hüküm: Kurumun söylediği, sistemin yapılandırıldığı, teknik olarak yapabildiği, testte yaptığı ve dış dünyada oluşturduğu sonuç ayrı ayrı incelenir. Dördüncü hüküm: Kanıt düzeyi denetim iddiasının sınırını belirler. Belge davranış kanıtı, demo üretim kanıtı ve teknik kabul gerçek dünya sonucu olarak sunulamaz.
Beşinci hüküm: Denetim sonucu süresiz değildir. Maddi sistem değişikliği, ilgili hükmü yeniden test gerektirecek biçimde etkiler.
Bölümün hükmü
Bir GBO denetimi: “Bu ajan iyi mi?” sorusuna genel ve sonsuz bir cevap vermez. Şunu kanıtlamaya çalışır: Bu ajan veya ajan ağı, bu sürüm ve araçlarla, bu insan ve kurum adına, bu veri ve yetki sınırları altında, bu davranış senaryolarında ne yaptı? Ve daha önemlisi:
Ne yapmadı? Nerede durdu? Hangi sonucu gerçekten doğruladı? Hata olduğunda nasıl toparlandı? İnsan yetkiyi geri aldığında sistem ne yaptı?
Denetim yalnız başarılı çıktıya bakmaz. Şu beş gerçekliği karşılaştırır:
BEYAN EDİLEN DAVRANIŞ YAPILANDIRILMIŞ DAVRANIŞ TEKNİK OLARAK MÜMKÜN DAVRANIŞ GÖZLENEN DAVRANIŞ GERÇEK SONUÇ VE TOPARLANMA
Bu beş katman aynıysa güven iddiası güçlenir. Farklıysa denetim boşluğu görünür kılar. Bir kurum: “Ajan mesaj gönderemez.” diyebilir. Politika da aynı şeyi yazabilir. Fakat araç gönderime izin veriyorsa, testte mesaj çıkıyorsa ve durdurma sonrasında kuyruk devam ediyorsa sistemin gerçek davranışı beyanından farklıdır. GBO denetiminin görevi bu farkı bulmaktır. Ne sistemi olduğundan iyi göstermek. Ne de herhangi bir hatayı bütün sisteme karşı ebedî hükme dönüştürmek. Gerçeği, sınırı ve kanıtı birlikte göstermek. Bu nedenle birinci zorunlu denetim çıktısı:
Denetim İddia Kartıdır.
Kart olmadan:
kapsam belirsizleşir,
testler dağılır,
puanlar bağlamını kaybeder,
kamu beyanı kanıtı aşar.
Kartla birlikte şu cümle açık hâle gelir: Neyi denetliyoruz ve neyi kanıtlamaya çalışıyoruz? Fakat bu kartı tek başına kurum hazırlarsa yeni bir sorun ortaya çıkar. Kurum yalnız güçlü olduğu alanları kapsama alabilir. Başarısız olacağını bildiği araçları dışarıda bırakabilir. Denetim sırasında sistemi değiştirebilir. Denetçiye sınırlı erişim verebilir. Ticari veya kişisel çıkar denetim hükmünü etkileyebilir. Bir çalışan, kurum adına denetim yaptırmak isteyebilir; fakat gerekli yetkiye sahip olmayabilir. Durdurma testi gerçek sistem üzerinde yapılacaksa bunun hukukî ve operasyonel sorumluluğunu kim üstlenecektir? Kanıtlar kişisel veri veya ticari sır içeriyorsa kim koruyacaktır?
Bir sonraki bölümde denetimin henüz test başlamadan önceki en önemli sorusuna geçeceğiz:
Denetimi kim istedi, kim yetkilendirdi ve denetçi gerçekten ne kadar bağımsız?
Çünkü yanlış kişi tarafından yetkilendirilmiş, kapsamı çıkar sahibince gizlice daraltılmış veya kanıtı kontrol edilen bir denetim teknik olarak kusursuz görünebilir. Fakat güvenilir değildir. Davranışı denetlemeden önce denetimin kendisini yetkilendirmek gerekir.

