حد الفصل
هذا القسم يجيب فقط على السؤال التالي:
لماذا لا يمثل استجابة نظام توليدي واحدة درجة GEO، وما الأحكام التي يمكن استنتاجها من استجابة واحدة؟
هذا الفصل:
- حصص العينات للدول،
- كيف سيتم وزن اللغات،
- كيف سيتم إعداد حزمة الحقيقة،
- كيف سيقوم المحكمون بتقييم الادعاءات الفردية،
- الصيغ النهائية لدرجات NOMOS،
- ملاءمة القرار وشارة الاعتماد
هذا الفصل لا يحدد هذه الأمور بالتفصيل؛ الفصول التالية تتناولها بشكل منفصل. الفصل 1 له مهمة أكثر أساسية:
لتحديد الحدود المعرفية بين الملاحظة والتعميم.
أي دراسات أخذ عينات أو تقييم أو امتثال تُجرى قبل تحديد هذا الحد سيتم بناؤها على أساس خاطئ.
حالات الأحكام في هذا القسم
ليست كل الجمل في هذا الكتاب لها نفس القوة المعيارية. يتم استخدام الحالات التالية:
معياري — معياري
حكم يُعتبر إلزاميًا للامتثال والنزاهة المنهجية. مثال: لا يمكن استخدام استجابة واحدة كدرجة GEO عامة.
مرشح — حكم مرشح
طريقة موصى بها لتحديدها بشكل نهائي بعد التجربة التجريبية، أو التطبيق الخارجي، أو التحقق الإحصائي. مثال: يُوصى بملاحظات صحيحة 1,000 لكل منتج ذكاء اصطناعي، ولكل موجة قياس رئيسية، كعينة دنيا مفترضة.
الفرضية
هو توقع يحتاج إلى الاختبار باستخدام البيانات. مثال: قد يكون هناك اختلاف في تمثيل المادة بين عينة اختبار في ظروف منضبطة و عينة المستخدمين في ظروف الاستخدام الطبيعية.
اصطناعي
هو تمثيل طريقة لا تمثل مستخدمًا حقيقيًا، أو مخرج ذكاء اصطناعي حقيقي، أو أداء شركة حقيقي.
سؤال مفتوح
إنه موضوع لم يتم التوصل إلى استنتاج نهائي بشأنه بعد بسبب عدم كفاية الأدلة أو قرار الحوكمة. لا يمكن لهذه الحالات أن تتحول بصمت إلى بعضها البعض. لا يصبح عتبة مرشح حقيقة معيارية مثبتة لمجرد أنها مكتوبة في الكتاب. لا تتحول التمثيلات التركيبية إلى ملاحظة واقعية في العالم الحقيقي. لا يمكن نشر فرضية كنتيجة دون قياسها.
NOMOS التحدي
لقد طرحت سؤالاً على نظام الذكاء الاصطناعي حول علامتك التجارية. أعطاك النظام إجابة صحيحة. قمت بأخذ لقطة للشاشة. أدرجتها في عرضك التقديمي. ثم قلت الجملة التالية: “الذكاء الاصطناعي يعرفنا بشكل صحيح.” ما الذي قستَه بالضبط؟ الإجابة التي سيرها جميع المستخدمين؟ سلوك النظام النموذجي؟
ممثل عالمي؟ الدقة في جميع اللغات؟ الاستقرار على مر الزمن؟ أم فقط:
الإخراج الفردي الذي تلقاه مستخدم محدد، على حساب محدد، على منتج ذكاء اصطناعي محدد واجهة المستخدم، استجابةً لمطالبة محددة، في وقت محدد؟
الإجابة الواحدة ليست بلا قيمة. يمكن أن تكون الإجابة الواحدة صحيحة. يمكن أن تكون الإجابة الواحدة مهمة. يمكن أن تكشف الإجابة الواحدة عن خطأ جسيم. يمكن أن تظهر الإجابة الواحدة التجربة الحقيقية لشخص معين. ومع ذلك، لا يمكن للإجابة الواحدة أن تكون دليلاً على حكم أعظم مما تحتمل.
يمكن لاستجابة واحدة أن تظهر ما يلي:
تم إنتاج هذا المخرج مرة واحدة على الأقل في ظروف مسجلة.
لا يمكن لاستجابة واحدة فقط أن تظهر ما يلي:
- أن معظم المستخدمين شاهدوا نفس الإجابة
- أن نفس النتيجة حدثت في دول أخرى
- أن نفس الدقة تُحافظ عليها في لغات أخرى
- أن نفس الإجابة تم إنتاجها في حسابات وخطط أخرى
- أن الإجابة مستقرة مع مرور الوقت
- أن منتجات ذكاء اصطناعي أخرى أنتجت نفس التمثيل
- أن التدخل الجغرافي تسبب في هذه النتيجة
- أن الإجابة تؤثر على سلوك المستخدم
- أن الإجابة تولد العملاء المحتملين أو المبيعات أو قيمة مستدامة
- أن الدرجة الإجمالية للجهة في GEO مرتفعة
المقدمة الأولى لهذا القسم هي:
الاستجابة هي ملاحظة. / ليست توزيعًا للملاحظات. / التوزيع ليس سببًا. / السببية بمفردها ليست قيمة مستدامة.
1. غرض الفصل
يهدف هذا القسم إلى القضاء على أصغر خطأ استنتاجي ولكنه الأكثر شيوعًا في قياس GEO:
عد مخرج واحد من نظام توليدي كسلوك عام للنظام، تجربة للسكان، وضوح العلامة التجارية، أو درجة GEO.
يعمل هذا القسم على توحيد التمييزات التالية:
- مخرج واحد مقابل نتيجة المجتمع
- وجود حدث مقابل انتشار حدث
- الملاحظة مقابل العينة
- المستخدم مقابل الجلسة
- التكرار مقابل الملاحظة المستقلة
- نموذج الذكاء الاصطناعي مقابل منتج الذكاء الاصطناعي المقدم للمستخدم
- الاستجابة الخام مقابل وحدة التحليل
- النتيجة الفورية مقابل الاستقرار الزمني
- لقطة شاشة مقابل حزمة الأدلة الكاملة
- رفض النظام مقابل جمع البيانات غير الصالحة
- الحدث الفردي الحرج ومعدل الانتشار
- السجل الاصطناعي وملاحظة المستخدم الحقيقية
- معدل مقاس وقرار الامتثال
قبل إنشاء هذه التمييزات:
- عينة GEO-1000،
- أوزان البلد واللغة،
- تقييم الادعاء الذرية،
- درجة NOMOS،
- قرار الامتثال
لا يمكن إنشاؤه.
2. الأحكام المعيارية المركزية
لا يمكن توليد درجة GEO لكيان في الأنظمة التوليدية من استجابة واحدة، لقطة شاشة واحدة، مستخدم واحد، حساب واحد، جلسة واحدة، لغة واحدة، بلد واحد، أو قياس على نقطة زمنية واحدة. تتطلب الادعاءات الممثلة للسكان على الأقل ما يلي:
- موضوع تدقيق محدد مسبقًا
- السكان المستهدفون المحددون مسبقًا
- تصميم أخذ العينات المحدد
- المُدخل المؤمَّن أو عائلة المُدخل
- تم تعريف منتج الذكاء الاصطناعي واجهة المستخدم
- ملاحظات صالحة متعددة
- هيكل التبعية المعروف
- سجلات الدولة واللغة والوقت
- ردود خام غير معدلة
- حزم الأدلة
- قواعد التقييم المحددة مسبقًا
- بيان عدم اليقين
- المسؤولية البشرية المسؤولة
وجود هذه العناصر لا يعني بالضرورة أن القياس صحيح. ومع ذلك، قد يجعل غيابها التعميم على عدد كبير من السكان غير قابل للتطبيق.
3. خمسة وحدات قياس منفصلة
خطأ أساسي شائع في تدقيق GEO هو الخلط بين وحدات القياس المختلفة. يجب التمييز بوضوح بين الوحدات الخمسة التالية.
3.1. وحدة الملاحظة
وحدة الملاحظة هي ناتج النظام التوليدي الفردي الذي تم الحصول عليه في ظروف محددة. يمكن تعريف الملاحظة من خلال التركيبة التالية:
O_i= (E_i، A_i، U_i، C_i، L_i، S_i، P_i، T_i، R_i، K_i)هنا:
- Ei: الكيان الذي تم تدقيقه
- الذكاء الاصطناعي: منتج الذكاء الاصطناعي واجهة المستخدم
- UI: المساهم أو وحدة المستخدم المجهول
- Ci: البلد أو المستوى الجغرافي
- Li: اللغة والإعداد الإقليمي
- Si: الجلسة وحالة التخصيص
- Pi: معرف النسخة والطلب
- Ti: الوقت وموجة القياس
- Ri: الاستجابة الخام
- Ki: سجل الإثبات والتحقق
إذا تغير أحد هذه العناصر بشكل جوهري، يتم رصد جديد قد يحدث. على سبيل المثال، نفس المستخدم:
- إذا طلب نفس الاستعلام في منتج ذكاء اصطناعي آخر،
- إذا طلب بلغة أخرى،
- إذا طلب في موجة قياس مختلفة،
- إذا طلب بشكل منفصل في الجلسة المخصصة والنظيفة،
يمكن إنتاج ملاحظات منفصلة. هذه الملاحظات لا تُعتبر تلقائيًا مستقلة عن بعضها البعض لأنها تأتي من نفس المستخدم.
3.2. وحدة أخذ العينات
وحدة العينات هي الشخص أو الحساب أو الجلسة أو أي وحدة وصول أخرى يتم اختيارها من السكان المستهدفين. في معظم تطبيقات GEO-1000، يمكن أن تكون وحدة العينات مستخدمًا حقيقيًا مناسبًا. ومع ذلك، وفقًا لتصميم البحث:
- المستخدم،
- زوج المستخدم–المنتج،
- الحساب،
- الجلسة،
- عضو لوحة البحث
يمكن استخدامها كوحدة انتخاب. إن الفشل في تعريف وحدة العينات بوضوح يمكن أن يؤدي إلى الأنواع التالية من العد غير الصحيح:
- عد تكرارات الشخص الواحد العشر مرات كأنها عشرة أشخاص
- عد حساب مشترك كعدة مستخدمين مستقلين متعددين
- لتقييم نتائج عشرة منتجات ذكاء اصطناعي لنفس المستخدم كما لو كانت عشر ملاحظات مستقلة للسكان
- تجاهل التجميع في لوحة بحث واحدة
3.3. وحدة التحليل
وحدة التحليل هي الكيان الذي يتم تطبيق تقييم الدقة أو التمثيلية عليه. هذه الوحدة:
- الإجابة الدقيقة،
- فقرة منفصلة داخل الإجابة،
- اقتراح مادي،
- ادعاء ذري،
- استشهاد،
- قضية توصية
من الممكن. يرى المستخدم إجابة واحدة. ومع ذلك، يمكن أن تحتوي تلك الإجابة في الوقت نفسه على:
- خمس ادعاءات صحيحة،
- ادعاءاتان غير مدعومان،
- ادعاء واحد قديم،
- خطأ واحد جسيم
لذلك، لا يجب أن تكون الإجابة التي يراها المشارك وحدة واحدة غير قابلة للتقسيم من الحقيقة/الخطأ في التحليل. يمكن الحفاظ على حالة الانتقال للإجابة الكاملة وحالات الحقيقة للادعاءات الجزئية داخلها بشكل منفصل. سيتم تعريف طريقة الادعاءات الجزئي في فصل لاحق من الكتاب.
3.4. كون الاستدلال
كون الكون الاستنتاجي هو المجتمع المستهدف الذي يُراد أن يُعمَّم عليه نتيجة القياس. ولا يمكن قبول هذا الكون ضمنيًا على أنه "الجميع في العالم." بالنسبة لمنتج ذكاء اصطناعي محدد، يمكن تقييد الكون المستهدف بشروط مثل:
- الحصول على الوصول الرسمي والقانوني إلى المنتج
- استيفاء متطلبات العمر المناسبة
- القدرة على استخدام المنتج باللغة ذات الصلة
- القدرة على الوصول إلى واجهة الويب أو الجوال المحددة
- القدرة على التفاعل خلال فترة القياس المحددة
حتى بالنسبة لنفس منتج الذكاء الاصطناعي:
- عينة اختبار في ظروف منضبطة
- عينة المستخدمين في ظروف الاستخدام الطبيعية
- الخطة المجانية،
- الخطة المدفوعة،
- الويب،
- الهاتف المحمول
يمكن إنشاء عوالم استنتاجية مختلفة. السعر المنشور غير مكتمل إذا لم يتم تحديد إلى أي عالم يُعمم العينة.
3.5. الكمية المقدرة — التقدير المستهدف
الدراسة لا تقتصر فقط على جمع البيانات. فهي تحاول تقدير كمية محددة. يمكن التعبير عن التقدير المستهدف الأساسي لـ GEO-1000 في أكثر أشكاله عمومية كما يلي:
احتمالية أن يرى مستخدم مناسب من السكان المستهدفين المحددين، تحت موجة القياس المحددة، على منتج ذكاء اصطناعي معين واجهة المستخدم، تمثيلًا يفي بمعيار القبول عند استخدام مطالبة مثبّتة في ظروف جلسة محددة.
رياضياً:
θ_{E,A,P,S,W,T}= Pr(Y_i = 1| U_i ∈ T, E, A, P, S, W)هنا:
- E: الكيان الذي تم تدقيقه
- الإجابة: منتج الذكاء الاصطناعي واجهة المستخدم
- P: نسخة المُدخل
- S: شرط الجلسة
- W: موجة القياس
- T: السكان المستهدفون
Yi=1: الاستجابة تفي بمعيار الانتقال الذي سيتم تعريفه لاحقاًهذا التعريف يحدد حدودًا مهمة:
درجة GEO ليست 'معرفة' مجردة وخالدة للنموذج؛ إنها توقع لاحتمالية تمثيلات ملاحظة في ظل ظروف المستخدم المحددة.
سيتم ترتيب قاعدة الانتقال النهائية وصيغة الدرجات في الأقسام اللاحقة من الكتاب.
4. الحد من الجملة "هكذا استجاب النموذج"
غالبًا لا يصل المستخدمون مباشرة إلى نموذج أساسي مجرد. النتيجة المرئية للمستخدم قد تتكون من مزيج من المكونات التالية:
- النموذج الأساسي أو الموجه
- واجهة المنتج
- الوصول إلى الاسترجاع أو الويب
- طبقة الاستشهاد
- طبقة الأمن والسياسة
- تعليمات النظام
- خطة الحساب
- التخصيص
- الذاكرة
- المحادثة السابقة
- اللغة والمنطقة
- البلد
- الوقت
- تحديثات منتجات المزود
لهذا السبب، التعبير المفضل في التفتيش الرئيسي الذي يتم عبر واجهة المستخدم هو كما يلي:
"تم ملاحظة المنتج المحدد للذكاء الاصطناعي والإخراج التالي على واجهة المستخدم."
قد يكون التعبير التالي أوسع بدون السيطرة التقنية اللازمة: "النموذج يفكر بهذه الطريقة." يمكن تسجيل اسم النموذج الذي يظهر داخل المنتج. ومع ذلك، يجب تقييم النتيجة كسلوك كامل لـ واجهة المستخدم، وليس فقط كأوزان النموذج.
5. ما هو الملاحظة الصالحة؟
وجود استجابة لا يعني تلقائيًا أنها ملاحظة صالحة يمكن إدخالها في قياس GEO.
5.1. شروط الحد الأدنى للصلاحية
يجب أن تحتوي الملاحظة على العناصر التالية على الأقل وفقًا للبروتوكول ذي الصلة:
- وجود تقييم صحيح
- المنتج المخصص للذكاء الاصطناعي و واجهة المستخدم
- معرّف المُدخل الصحيح والإصدار
- اللغة والموقع الصحيح
- الحالة المحددة للجلسة
- البلد أو الطبقة الجغرافية المسجلة
- الطابع الزمني وموجة القياس UTC
- الاستجابة الخام الكاملة
- أول مخرج مناسب غير محدد
- لقطة الشاشة المطلوبة أو الدليل المكافئ
- معرّف الملاحظة المجهول
- سجل الانحراف عن البروتوكول
سيتم تحديد مخططهم الفني التفصيلي في قسم الالتقاط NOMOS لاحقًا.
5.2. حالات الملاحظة
يجب وضع علامة على كل سجل بإحدى الحالات التالية:
صالح — صالح
يستوفي الشروط المطلوبة للبروتوكول.
صالح بشرط — صالح بشرط
هناك نقص محدود؛ يتم تحديد التحليلات التي يمكن استخدامه لها بوضوح.
غير صالح — غير صالح
لا يمكن استخدامه في التقدير الرئيسي أو حساب النتيجة بسبب مخالفة البروتوكول.
مجهول — مجهول
لا يوجد سجل كافٍ لاتخاذ قرار بشأن الصلاحية. لا يمكن قبول ملاحظة مجهولة بصمت على أنها صالحة.
5.3. الفرق بين نتيجة نظام صالحة وجمع بيانات غير صالح
هذا التمييز إلزامي. منتج الذكاء الاصطناعي:
- قد يرفض الرد،
- قد يعرض رسالة خطأ،
- قد يتوقف دون توليد استجابة،
- قد يواجه مشكلة في الاتصال،
قد يقول إنه لا يستطيع إكمال المهمة. إذا طبق المشارك البروتوكول بأكمله بشكل صحيح، يمكن أن تكون هذه نتائج نظام صالحة. لا يمكن إزالتها من مجموعة البيانات بهدوء. في المقابل:
- يقوم المشارك بقص الاستجابة،
- تغيير صياغة المُدخل،
- إعادة التوليد لاختيار أفضل إجابة,
- تحرير لقطة الشاشة،
- استخدام المنتج الخاطئ للذكاء الاصطناعي
جمع البيانات يمكن أن يُحدث عدم صلاحية. الأولى هي السلوك الفعلي للنظام. الثانية هي تعطيل عملية القياس. لا يمكن وضع الاثنين في نفس الفئة.
6. ماذا يمكن أن يثبت استجابة واحدة؟
الملاحظة الواحدة محدودة. لكنها ليست بلا معنى.
6.1. أن مخرجا محددا حدث مرة واحدة على الأقل
يمكن لسجل صالح أن يدعم هذه الجملة: "على المنتج المحدد من الذكاء الاصطناعي و واجهة المستخدم، تحت الوقت والظروف المحددة، لوحظ هذا الناتج مرة واحدة على الأقل." تُظهر هذه الجملة وجود الحدث. إنها لا تُظهر انتشاره.
6.2. التعرض الفعلي لمستخدم محدد
يتم الخطأ في تمييز مستخدم على أنه:
- هوية شركة،
- معلومات صحية،
- إرشادات قانونية،
- السعر،
- رخصة،
- نصيحة
إذا تم رؤيته، فهذا تجربة مستخدم حقيقية. حتى لو لم تمثل كامل السكان، فهي مهمة من منظور المستخدم المتأثر.
6.3. احتمال حدوث خطأ محدد
قد يُظهر إخراج واحد: «قد يحدث هذا الخطأ تحت هذه الظروف النظامية.» ومع ذلك، لا يظهر: «هذا الخطأ نموذجي.»
6.4. توليد فرضية بحث جديدة
يمكن لخطأ واحد أن يخلق سؤالًا سيتم اختباره على نطاق أوسع. مثال: "هل حدث هذا الخلط في الهوية في جلسة واحدة فقط، أم أن هناك نمطًا منهجيًا في نفس اللغة والبلد؟"
6.5. بدء مراجعة للحادثة الحرجة
رد واحد:
- ضرر بشري خطير متوقع,
- سلطة مهنية مزيفة,
- إرشادات طبية طارئة غير صحيحة,
- خطأ قانوني جوهري,
- نصيحة سلامة خطيرة,
- ارتباك شديد في الهوية مع كيان آخر
قد يكون كافيًا لبدء مراجعة حادثة. بدء تحقيق في حادثة حرجة ليس نفس عملية إعلان نسبة السكانية.
6.6. دحض ادعاء "هذا لم يحدث أبدًا"
افترض أن منظمة تقول: 'لم يقم النظام أبدًا بتعييننا إلى البلد الخطأ.' يمكن لملاحظة مضادة واحدة مؤكدة أن تدحض هذا الادعاء المطلق. الملاحظة الفردية لا تدعم 'يحدث هذا طوال الوقت'، لكنها يمكن أن تدحض 'لم يحدث ذلك أبدًا.'
7. ما الذي لا يمكن لإجابة واحدة إثباته؟
7.1. السلوك النموذجي للنظام
الإجابة الواحدة ليست كافية للاستنتاج: 'عادةً ما يستجيب النظام بهذه الطريقة.'
7.2. انتشار السكان
استجابة واحدة لا تدعم النتيجة: '95% من المستخدمين يرون نفس التمثيل.'
7.3. الاستقرار الزمني
استجابة اليوم:
- غدًا،
- بعد أسبوع،
- بعد تحديث المنتج
قد لا يبقى كما هو. إنها ليست قياس استقرار لموجة واحدة.
7.4. الصلاحية عبر البلدان
استجابة من مستخدم في تركيا لا تشير إلى ما سيراه المستخدمون في الصين، ألمانيا، أو سان مارينو.
7.5. الصلاحية عبر اللغات
مخرجات باللغة الإنجليزية:
- التركية،
- اليابانية،
- العربية،
- الألمانية
لا تمثل دقة المخرجات.
7.6. صلاحية المنتج عبر الذكاء الاصطناعي
لا يمكن تعميم النتيجة في منتج ذكاء اصطناعي واحد على المنتجات الأخرى. قد تتصرف المنتجات والواجهات المختلفة لنفس المزود بشكل مختلف أيضًا.
7.7. تأثير التدخل
لا يثبت مخرج إيجابي واحد بعد تغيير GEO البيان: "تم إنشاء هذه النتيجة بواسطة تدخلنا." هناك حاجة إلى الأساس أو المقارنة وشرح بديل.
7.8. استقرار التوصية
وجود مستخدم يشاهد خيارًا لا يكفي للاستنتاج: "النظام يوصي الآن بهذه العلامة التجارية."
7.9. الأثر التجاري
استجابة إيجابية:
- تشير إلى أن المستخدم رأى الاستجابة،
- بحث عن العلامة التجارية،
- التي قمت بالتواصل بشأنها،
- التي اشتريتها،
- التي كنت راضيًا عنها
لا تظهر بمفردها.
7.10. درجة الجغرافيا
لا يُقدّر الرد الواحد التوزيع التمثيلي للسكان المستهدفين المحددين. لذلك، لا يمكنه إنتاج درجة GEO إجمالية.
8. وجود الحدث وانتشاره
هذا واحد من أهم التمييزات في هذا القسم.
8.1. وجود الحدث
يجيب على السؤال: "هل حدث هذا التمثيل أو الخطأ مرة واحدة على الأقل؟" قد تكون ملاحظة واحدة صالحة كافية. التمثيل:
I(E) = 1(إذا تم ملاحظة الحدث مرة واحدة على الأقل)؛ وإلا I(E) = 0الرمز 0 هنا لا يعني: "الحدث مستحيل." إنه يشير فقط إلى أنه لم يُلاحظ في القياس الحالي.
8.2. انتشار الحدث
يجيب عن السؤال: "كم مرة يحدث الحدث في السكان المستهدفين المحددين؟" في عينة بسيطة، يمكن حساب المعدل الخام على النحو التالي:
p̂ = عدد السجلات الصالحة التي لوحظ فيها الحدث / إجمالي عدد السجلات الصالحةومع ذلك، في الدراسات الواقعية GEO-1000:
- أوزان السكان،
- طبقات البلد واللغة،
- المستخدمون المطابقون،
- مجموعات اللوحة،
- عدم الاستجابة,
- سجلات غير صالحة،
- تأثير التصميم
يجب أخذها في الاعتبار. لذلك، فإن المعدل الخام ليس دائماً تقدير السكان النهائي.
8.3. لا يمكن تحويل الحدوث والسائدة إلى بعضهما البعض
قد يتم ملاحظة حدث مرة واحدة ولكنه نادر جداً. قد يكون الحدث شائعاً ولكن لم يتم ملاحظته على الإطلاق في تجربة صغيرة. الجملتان التاليتان مختلفتان:
- "تم ملاحظة هذا الخطأ مرة واحدة."
- "تم ملاحظة هذا الخطأ لدى 12% من المستخدمين."
الجملة الثانية تتطلب مقام وعينة محددين.
9. المظهر الإحصائي للتحيز نتيجة الملاحظة الفردية
لقد طرحنا سؤالًا على منتج ذكاء اصطناعي مرة واحدة. وقد استوفى الجواب معيار النجاح. النسبة الخام:
p̂ = 1/1= 1= 100%يبدو أنها 100 في المائة. لكن ذلك 100 في المائة لا يعني أن كل عضو من المجموعة المستهدفة سيرى النتيجة نفسها. للتوضيح فقط، يُظهر الجدول أدناه تقريبًا 95 في المائة من فترات الثقة لويلسون تحت الملاحظات المستقلة لبيرنولي والعينة العشوائية البسيطة غير المرجحة: [K09]
| الاستجابة السابقة | ملاحظة صالحة | النسبة الخام | تقريب فاصل ويلسون 95% |
|---|---|---|---|
| 1 | 1 | 100% | 20.7%-100% |
| 9 | 10 | 90% | 59.6%-98.2% |
| 95 | 100 | 95% | 88.8%-97.8% |
| 950 | 1,000 | 95% | 93.5%-96.2% |
هذا الجدول اصطناعي وتمثيلي. إنه لا يثبت:
- أن هذه الفواصل صالحة لجميع تصاميم أخذ العينات لـ GEO-1000
- أن ملاحظات 1,000 كافية لجميع المجموعات الفرعية من اللغات والدول
- أن التجميع والوزن غير فعالين
- أن نسبة الدقة الخام 95 تعني تلقائيًا الملاءمة
ما يوضحه فعليًا هو:
مع انخفاض عدد الملاحظات، يزداد الشك في نسبة السكان.
النسبة المئوية 100 التي تُرى في ملاحظة واحدة يمكن أن تكون متوافقة مع نطاق سكاني محتمل واسع جدًا.
10. لماذا "1,000" ليست رقماً سحرياً؟
قاعدة المرشح الأساسية — القاعدة التأسيسية للمرشح
تحمل GEO-1000 هذا الاقتراح التأسيسي:
لكل منتج ذكاء اصطناعي مراقب ولكل موجة قياس رئيسية، يتم استهداف الحد الأدنى من 1,000 ملاحظات مستخدم صالحة بشكل افتراضي.
هذا الحكم ليس بعد الحد الأدنى العلمي النهائي. سيتم إعادة تقييمه بناءً على نتائج التجربة التجريبية والتطبيق الخارجي.
10.1. لماذا هو بداية قوية؟
بموجب افتراض العينة العشوائية البسيطة، عندما يكون المعدل الحقيقي حوالي 50%، فإن هامش الخطأ النظري 95% لملاحظات 1,000 يكون تقريبًا ±3.1 نقطة. يمكن أن يوفر هذا دقة بداية ذات مغزى على مستوى المنتج العام.
10.2. لماذا لا يحل كل مشكلة؟
ملاحظات 1,000:
- إلى عشرات الدول،
- إلى العديد من اللغات،
- إلى الخطط المجانية والمدفوعة،
- إلى الواجهات على الويب والجوال،
- إلى اللوحات المحكمة والطبيعية
عند التقسيم، تنكمش الخلايا الفرعية. على سبيل المثال، إذا كان هناك فقط 50 ملاحظات لكل من لغات 20، يمكن أن يكون عدم اليقين القائم على اللغة أعلى بكثير من درجة النموذج الإجمالية.
10.3. تأثير التصميم
الملاحظات:
- من نفس لوحة البحث،
- من نفس البلد،
- من نفس المستخدم،
- من تصميم مطابق
موجودة، قد لا ينطبق افتراض العينة المستقلة البسيطة. يمكن أن يكون عدم اليقين الفعلي أوسع.
10.4. منهجية NOMOS
تعمل ملاحظات 1,000 كالتالي:
- نقطة المرجع التأسيسية للبروتوكول,
- الحد الأدنى الافتراضي للبدء على مستوى النموذج,
- عتبة المرشح ليتم معايرتها مع الطيار
NOMOS لا يدعي أن ملاحظات 1,000 كافية تلقائيًا لكل بلد أو لغة أو حالة استخدام.
11. الملاحظة المستقلة ليست هي نفسها الملاحظة المتكررة
يمكن للمستخدم أن يطرح نفس السؤال عشر مرات. هذه العملية يمكن أن تكون ذات قيمة. ومع ذلك، فهي لا تنتج عشرة مستخدمين مستقلين.
11.1. نفس المستخدم - نفس الجلسة تكرار
يمكن قياس:
- تباين تجديد الإجابة,
- الثبات داخل الجلسة،
احتمالية الإجابات البديلة. لا يقيس انتشار السكان بمفرده.
11.2. نفس المستخدم–تكرار جلسة جديدة
قد يقلل من سياق الدردشة السابقة. ومع ذلك:
- نفس الحساب،
- نفس الخطة،
- نفس الدولة،
- نفس التخصيص،
- نفس المستخدم
قد يستمر في خلق اعتماد إحصائي بين الملاحظات.
11.3. اختبار مستخدم واحد لعدة منتجات ذكاء اصطناعي
يمكن أن يساعد هذا التصميم في المقارنة المطابقة عبر النماذج. ومع ذلك، فإن الملاحظات تعتمد على مستوى المستخدم. يجب الحفاظ على هذا الاعتماد عند التسجيل والتحليل.
11.4. مستخدمون مختلفون يستخدمون نفس الحساب
قد يوجد أشخاص مختلفون. ومع ذلك:
- تاريخ الحساب،
- التخصيص،
- الخطة،
- الذاكرة
يمكن مشاركتها. لا يمكن اعتبار هذه السجلات مستقلة تلقائيًا.
11.5. نصّ استقلالية معيارية
يجب تصميم الملاحظات لتكون مستقلة قدر الإمكان؛ يجب تسجيل واعتماد المستخدم المعروف، الحساب، الجلسة، اللوحة، الدولة، الجهاز، والاعتمادات المتكررة وأخذها في الاعتبار في التحليل.
لا يجب أن يتم اختزال الاستقلالية إلى ثنائي:
- نعم،
- لا
إذا لزم الأمر، استخدم أحد حالات الاعتماد التالية:
مستقل
مزود
مجمّع
متكرر ضمن المستخدم
تابع
مجهول
12. مبدأ أول مخرَج مناسب
في لوحة السكان الرئيسية، مهمة المشارك ليست العثور على الإجابة الأكثر إيجابية. يجب على المشارك تسجيل أول إخراج مناسب مكتمل تم توليده تحت الشرط المحدد مسبقًا. المشارك:
- لا يمكنه تحديث الإجابة،
- لا يمكنه طلب إجابة جديدة،
- لا يمكنه اختيار الإجابة الإيجابية،
- لا يمكنه اقتصار التعديل على الجزء الجيد فقط،
لا يمكنه إعادة كتابة الإجابة. يمكن أيضًا دراسة سلوك الاستنساخ بشكل منفصل. ومع ذلك: "لقد طرحنا نفس السؤال خمس مرات واخترنا أفضل إجابة." ليست هذه هي نتيجة السكان الرئيسيين. هذا هو اختبار الإخراج الأفضل المحدد. يجب الإبلاغ عنه باسم وطريقة منفصلين.
13. استثناء حدث حرج واحد
لا يمكن لإجابة واحدة تحديد درجة المجتمع. ومع ذلك، هذا لا يعني أن الإجابة الواحدة لا يمكن أن يكون لها تأثير كبير على اتخاذ القرار. NOMOS يحدد مسارين تقييميين منفصلين.
13.1. مسار تمثيل المجتمع
يسأل السؤال: "كم مرة يحدث هذا الناتج في السكان المستهدفين؟" يتطلب عينة كبيرة وصحيحة.
13.2. مسار الحدث الحرج
يسأل السؤال: "ما مدى الضرر المتوقع عند حدوث هذا الناتج مرة واحدة؟" يمكن أن تؤدي نتيجة واحدة مؤكدة إلى تقييم. على سبيل المثال:
- منح رخصة صحية غير موجودة
- إجراء إحالة صحية طارئة خطيرة
- الإبلاغ عن سلطة قانونية غير صحيحة
- إزالة الحدود الأمنية
- خَلط شركة مع كيان قانوني آخر
- تكرار تعليمات تManipulative مخفية عن الناس كما لو كانت نصيحة
يمكن أن يكون حدثًا حرجًا مفردًا.
13.3. فصل القرار بين النتيجة والامتثال
يمكن أن يكون الحدث الحرج عادةً ملاحظة واحدة. على سبيل المثال:
1/1000=0.1%قد يبدو هذا المعدل صغيرًا. ومع ذلك، إذا كان الضرر المحتمل للحدث شديدًا، فقد يخلق فجوة لا يمكن إصلاحها في قرار الامتثال. لذلك:
يقيس معدل السكان تكرار الحدث؛ بينما يقيس مراجعة الحدث الحرج تأثير الحدث على الضرر والنزاهة.
لا يمكن للدقة العالية في المتوسط أن تلغي تلقائيًا الخطأ الفردي الكبير. سيتم تحديد الظروف النهائية للتصنيف الحرج في الفصول اللاحقة من الكتاب.
14. سلم الادعاءات الملاحظة
في هذا القسم، يتم فصل المستويات الأربعة الأولى من الملاحظة فقط بشكل معياري. على المستويات الأعلى:
- الدرجة الموزونة حسب السكان،
- درجة النماذج المتعددة،
- استقرار الزمن،
- تأثير التدخل،
- القيمة المستدامة
سيتم تعريفه في الأقسام التالية.
O-0— لم يتم اختباره
لم يتم قياس منتج الذكاء الاصطناعي أو الحالة ذات الصلة. الحالة الصحيحة:
لم يتم اختباره
جملة لا يمكن الدفاع عنها: "هذا مناسب لأن المشكلة لم تُلاحَظ."
O-1— ملاحظة حدث فردي
هناك نتيجة واحدة صالحة. صياغة يمكن الدفاع عنها: "تحت الظروف المحددة، لوحظ هذا الناتج مرة واحدة." جملة لا يمكن الدفاع عنها: "النظام يمثل الوجود بهذه الطريقة."
O-2— تكرار من المستخدم أو الجلسة
توجد نتائج متعددة لنفس المستخدم أو الحساب أو عائلة الجلسة. صياغة يمكن الدفاع عنها: "في ظروف المستخدم والجلسة المحددة، حدث هذا الناتج في سبع مرات من أصل عشر تكرارات." جملة لا يمكن الدفاع عنها: "سبعة من كل عشرة مستخدمين مستقلين شاهدوا هذا الناتج."
O-3— قياس خلية واحدة متعددة المستخدمين
نفس الشيء:
- منتج الذكاء الاصطناعي،
- واجهة المستخدم
- البلد،
- اللغة،
- حالة اللوحة،
- نسخة المُدخل،
- موجة القياس
يحتوي على العديد من ملاحظات المستخدم المناسبة. صياغة يمكن الدفاع عنها: “78% من 200 الملاحظات الصالحة في الخلية المسيطر عليها في تركيا/Turkish استوفت معيار الانتقال المحدد.” لا يمكن تعميم هذه النتيجة تلقائيًا على دول أو لغات أو واجهات مستخدم أخرى.
O-4— القياس متعدد الطبقات عبر الخلايا
توجد عينات محددة مسبقًا من دول ولغات أو خلايا مستخدم مختلفة. على هذا المستوى:
- نتائج الخلية،
- النتيجة المرجحة،
- النطاق،
- عدم اليقين
يمكن الإبلاغ عنها. القواعد التفصيلية لأوزان السكان وعدالة المجموعات الفرعية مذكورة في الفصول اللاحقة من الكتاب.
15. عرض توضيحي اصطناعي APPLE.COM
عرض توضيحي للمنهجية الاصطناعية / المستخدمون، منتجات الذكاء الاصطناعي، الردود، المعدلات، والنتائج أدناه كلها خيالية. ولا تمثل الأداء الفعلي لشركة Apple Inc. أو سلوك أي منتج ذكاء اصطناعي حقيقي.
15.1. السيناريو A — استجابة إيجابية واحدة
يقدّم مستخدم اصطناعي السؤال الآتي إلى منتج الذكاء الاصطناعي المُحاكى A: «إلى أي نوع من الشركات تنتمي Apple.com؟» الاستجابة الاصطناعية: «Apple شركة تكنولوجيا مقرها الولايات المتحدة، تطوّر إلكترونيات استهلاكية وبرمجيات وخدمات رقمية». التقييم الأولي:
- هوية الكيان صحيحة
- الفئة الرئيسية صحيحة
- لا توجد أخطاء حرجة واضحة
- التمثيل الأساسي مقبول
النتيجة الخام:
1/1=100%تصريح عام غير صحيح: "المنتج الذكاء الاصطناعي أ يمثل شركة أبل بدقة 100%." التصريح العام الصحيح: "في العينة التركيبية، الملاحظة الفردية المحددة استوفت معيار الانتقال. لم يتم تحديد انتشار السكان وموثوقية المنتج."
15.2. السيناريو ب — الاكتشاف بعشر ملاحظات
عشرة مستخدمين تركيبيين مستقلين يستخدمون نفس إصدار الطلب الدلالي. النتيجة التركيبية:
- تجاوبيات 7 تم اجتيازها
- استجابة 1 صحيحة جزئياً
- استجابة 1 تحتوي على معلومات قديمة
- استجابة 1 تعيّن النشاط الرئيسي الخاطئ
معدل النجاح الخام:
7/10=70%تحت افتراض بسيط ومثالي للعينات المستقلة، فإن فترة ويلسون التقريبية لـ 95 بالمئة بالضرورة واسعة. النتيجة تبقى استكشافية لأنها تعتمد على:
- عينة صغيرة،
- خلية واحدة،
- موجة واحدة
الحالة الصحيحة:
استكشافية — غير كافية للنقاط العالمية المتاحة للعامة لـ NOMOS.
15.3. السيناريو C — 1,000 موجة اصطناعية مرصودة
افترض بشكل اصطناعي أن الشروط التالية مستوفاة:
- المنتج الذكائي أ
- ملاحظات صالحة 1,000
- السكان المستهدفون المحددون مسبقًا
- نسخة صياغة المُدخل المؤمّنة
- طبقات الدولة واللغة المحددة
- الاستجابة الأولية المناسبة غير المعدلة
- سجلات الأدلة الكاملة
- قواعد التحكيم المحددة مسبقًا
النتيجة الاصطناعية:
| حالة الاستجابة | الرقم |
|---|---|
| استيفاء معيار الانتقال | 918 |
| صحيح جزئيًا | 37 |
| ادعاء بمادة غير مدعومة | 23 |
| معلومات قديمة | 12 |
| مرشح الخطأ الحرج | 6 |
| غير قابل للتصنيف | 4 |
| الإجمالي | 1,000 |
معدل النجاح الخام البسيط:
918/1000=91.8%الفاصل الزمني التقريبي 95% ويلسون تحت الافتراض المثالي غير الموزون: هو. ومع ذلك، هذا الرقم وحده ليس بعد النتيجة النهائية لـ NOMOS GEO. لأنه هناك عوامل إضافية يجب تقييمها:
- أوزان البلد واللغة
- تأثير التصميم
- أدنى نتيجة للغة
- معدل الملاحظات غير الصالحة
- اتفاق المقيمين
- التحقق من مرشحي الأخطاء الحرجة
- مجموعات المستخدمين غير المختبرة
- الوقت و واجهة المستخدم كحدود للقياس
يجب أن يخضع ستة مرشحين للأخطاء الحرجة أيضًا لمراجعة حادث منفصلة. التقرير الصحيح: 'معدل تمرير الاستجابة الخام في الموجة الاصطناعية هو 91.8 بالمئة. تصف هذه النتيجة الملاحظات قبل تطبيق أوزان السكان وتأثيرات التصميم. نظرًا لأنه تم تحديد ستة مرشحين للأخطاء الحرجة، فإن قرار الامتثال يتطلب مراجعة منفصلة.' التقرير غير الصحيح: 'درجة GEO لشركة Apple NOMOS هي 91.8 وهي متوافقة.' لا يمكن نسب البيانات الاصطناعية بهذه الطريقة إلى شركة حقيقية أو نظام حقيقي.
16. الأحكام الإلزامية المعيارية
N-01
لا يمكن استخدام مخرج نظام توليدي واحد كدرجة عامة للجيو.
N-02
نتاج مفرد يُلاحظ بمفرده:
- منتج الذكاء الاصطناعي و واجهة المستخدم
- البلد،
- اللغة،
- مُدخل,
- الجلسة،
- الوقت
يجب الإبلاغ عنه مع ظروفه.
N-03
مخرج فردي:
- نموذجي
- مستمر
- عالمي
- ينتمي إلى جميع المستخدمين
لا يمكن أن يُعرض كسلوك.
N-04
لا يمكن احتساب التكرارات من نفس المستخدم أو الحساب أو الجلسة كملاحظات سكانية مستقلة دون الكشف عن الاعتماد.
N-05
في لوحة السكان الرئيسية، يجب على المشارك تسجيل أول مخرج مناسب محدد مسبقًا؛ لا يمكن إجراء الاستنساخ لاختيار استجابة إيجابية.
N-06
يجب تسجيل رفض النظام، رسالة الخطأ، أو عدم القدرة على الاستجابة كنتيجة نظام صالحة إذا تم تطبيق البروتوكول بشكل صحيح.
N-07
لا يمكن تضمين الإجابات المقلمة أو المعدلة أو المعاد كتابتها يدويًا أو الإجابات التي لا يمكن التحقق من سياق الطلب الخاص بها في حساب النتيجة الرئيسية.
N-08
يُحظر اختيار لقطات الشاشة الإيجابية فقط وامتناع عن توزيع النتائج.
N-09
لا يمكن استخدام الملاحظات الاصطناعية في درجات المستخدم الحقيقي أو النظام الحقيقي.
N-10
لا ينبغي نشر نسبة السكان بدون التغطية والمقام وشرح مناسب لدرجة عدم اليقين.
N-11
لا يمكن تعويض احتمال حدوث خطأ حرج بهدوء ضمن المتوسط الكلي.
N-12
يمكن تطبيق نتيجة الملاحظة فقط على الكون الاستنتاجي الذي تم تعريفه بشكل فريد؛ لا يمكن تعميمها على الدول أو اللغات أو المنتجات أو الفترات الزمنية غير المقاسة.
N-13
يجب أن يكون للقياس أو التصنيف أو البيان العام صاحب مسؤول بشري أو مؤسسي.
N-14
السجلات المجهولة أو غير المختبرة أو غير الصالحة لا يمكن تحويلها بهدوء إلى نتيجة إيجابية.
17. المرشح GEO-1000 القاعدة الرئيسية
المرشح-001
بالنسبة لكل منتج ذكاء اصطناعي يتم تدقيقه ولكل موجة قياس للسكان الرئيسيين، يجب استهداف الحد الأدنى من 1,000 ملاحظات مستخدم صالحة بشكل افتراضي.
هذه الجملة المرشحة:
- دقة توقع المنتج العام،
- التكلفة،
- قابلية التطبيق،
- العدالة بين الدول واللغات
هذا يخلق توازنًا أوليًا بين هذه الاعتبارات. ومع ذلك، لا يضمن تغطية كافية لـ:
- جميع درجات الدول،
- جميع درجات اللغات،
- جميع فئات المستخدمين الفرعية
يجب بدلاً من ذلك اختبار الكفاية من خلال:
- التجارب التجريبية،
- التكرارات المستقلة،
- تأثير التصميم،
- حساسية الفئات الفرعية
تحدد هذه التقييمات الحالة المعيارية النهائية.
18. أشكال الفشل
F-01— لقطة الشاشة المختارة
يتم نشر الاستجابة الأكثر إيجابية فقط من بين العديد من النتائج.
F-02— التعامل مع مستخدم واحد كالسكان
يتم تعميم تجربة شخص واحد على كامل الكون المستهدف.
F-03— عد تكرارات نفس المستخدم كأشخاص جدد
التكرارات التي يولدها نفس الشخص أو الحساب يتم الإبلاغ عنها كمشاركين مستقلين.
F-04— تجديد الاستجابة واختيار الأنسب
يتم تجاهل الاستجابات الأولية أو السلبية؛ ويتم حفظ الاستجابة الأنسب كنتيجة للقياس.
F-05— انحراف صياغة المُدخل
يقوم المشاركون بتغيير الكلمة أو النبرة أو نطاق صياغة المُدخل؛ وتُدمج النتائج كما لو كانت من نفس التجربة.
F-06— تلوث السياق
المحادثات السابقة تؤثر على الاستجابة؛ ويتم عرض السجل كجلسة نظيفة.
F-07— إخفاء التخصيص
الذاكرة، التعليمات الخاصة، أو تاريخ المستخدم مرئي؛ يتم الإبلاغ عن النتيجة كرد عام للمستخدم.
F-08— نموذج ومنتج مربك
يُكتب فقط اسم النموذج العام أو المزود؛ لم يتم تسجيل المنتج الفعلي أو الواجهة أو حالة الأداة.
F-09— إزالة الأخطاء والعيوب من المقام
تم الحذف لجعل النتائج تبدو إيجابية عندما لا يستجيب النظام للسجلات.
F-10— احتساب الالتقاط غير الصالح كفشل النظام
تم الإبلاغ عنه كخطأ من المشترك، أو قصور الأدلة، أو نتيجة غير صحيحة لمنتج الذكاء الاصطناعي.
F-11— تعميم لغة وبلد واحد على مستوى العالم
يتم تطبيق نتيجة موقع واحد على مستوى العالم.
F-12— استخدام البيانات الاصطناعية كأنها حقيقية
يتم إضافة السجلات التي تم إنشاؤها لأغراض العرض إلى الأداء الفعلي.
F-13— فقدان حدث حاسم في المتوسط
يتم جعل الأخطاء الشديدة في الصحة أو القوانين أو التراخيص أو الأمان غير مرئية ضمن متوسط مرتفع.
F-14— استنتاج تأثير التدخل من نجاح واحد
يتم اعتبار الاستجابة الإيجابية الوحيدة التي تم تلقيها بعد تدخل GEO على أنها التأثير السببي للدراسة.
F-15— الحكم على النظام بأكمله من خطأ واحد
يتم تعميم خطأ واحد كما لو أن منتج الذكاء الاصطناعي خاطئ دائمًا وخاطئ لجميع المستخدمين.
F-16— تحديد السكان المستهدفين بعد ذلك
بعد رؤية النتيجة، يتم إعلان مجموعة المستخدمين ذات النجاح العالي على أنها "السكان المستهدفون الفعليون".
19. إجراء التدقيق
يجب على المدقق اتباع التسلسل أدناه عند تقييم صحة ملاحظة واحدة أو ادعاء GEO مبكر.
الخطوة 1— تسجيل الادعاء العام
يتم تحديد الجملة المقترحة بالكامل. مثال: "ChatGPT يعرف شركتنا بشكل صحيح."
الخطوة 2— تحديد مستوى الادعاء
قد تشير الجملة إلى:
- حدث واحد،
- الانتشار،
- الاستقرار،
- العواقب العالمية،
- السببية،
- التأثير التجاري
يجب تحديد المستوى المناسب.
الخطوة 3— تحديد عدد الملاحظات الداعمة
كم عدد المستخدمين الحقيقيين؟ كم عدد الحسابات؟ كم عدد الجلسات المستقلة؟ كم عدد التكرارات؟ كم عدد منتجات الذكاء الاصطناعي؟ كم عدد اللغات والدول؟
الخطوة 4— التحقق من شروط الملاحظة
هل تم تسجيل منتج الذكاء الاصطناعي، واجهة المستخدم، المُدخل، الجلسة، الدولة، اللغة والوقت جميعها؟
الخطوة 5— فحص سلامة الأدلة
هل هناك استجابة كاملة؟ هل هناك لقطة شاشة كاملة؟ هل تم اختيار الاستجابة أو تحديثها؟ هل تم تعديل الملف؟ هل السجل اصطناعي؟
الخطوة 6— تحديد هيكل الاعتماد
هل هناك تكرارات لنفس المستخدم؟ هل تم استخدام حساب مشترك؟ هل هناك تصميم نموذج معكوس؟ هل هناك تجميع من نفس اللوحة؟
الخطوة 7— فصل خطأ جمع البيانات عن النتيجة النظامية الصالحة
هل الرفض أو خطأ النظام هو النتيجة الفعلية؟ أم أن المشارك انتهك البروتوكول؟
الخطوة 8— قارن الادعاء بمستوى الدليل
هل تم استخدام ملاحظة واحدة لاستنتاجات على مستوى السكان أو العالمية؟
الخطوة 9— افتح المسار الحرج
إذا كان رد واحد يحمل ضررًا شديدًا متوقعًا، يتم بدء تحقيق حادثة منفصل.
الخطوة 10— حدد القرار
يتم تقليل الحكم العام فقط إلى المستوى الذي يحمله الدليل.
20. الدليل الضروري
بالنسبة لملاحظة أو ادعاء ضمن نطاق هذا القسم، يجب السعي للحصول على السجلات التالية بالقدر الذي تكون فيه ذات صلة:
- هوية الكيان المدقق
- الإفصاح الكامل عن ادعاء GEO للجمهور
- عدد الملاحظات
- عدد المشاركين الفريدين
- منتج الذكاء الاصطناعي و واجهة المستخدم
- النموذج أو الإصدار المرئي، إذا كان متاحًا
- نوع الخطة أو الحساب
- الدولة والموقع
- معرّف النص، الإصدار، والنص الكامل
- حالة الجلسة والتخصيص
- طابع زمني UTC
- موجة القياس
- الاستجابة الخام الكاملة
- لقطة شاشة أو دليل مكافئ
- حالة إعادة الإنتاج أو اختيار الإجابة
- حالة صلاحية الملاحظة
- سجل الاعتماد والمطابقة
- حالة تركيبية أم حقيقية
- سجل الملاحظة غير الصالحة
- سجل الحدث الحرج
- نطاق النتيجة
- بيان عدم اليقين
- الشخص أو المؤسسة المسؤولة
قد لا تكون كل هذه السجلات مطلوبة بنفس التفصيل لكل ملاحظة اكتشاف منخفض المخاطر. ومع ذلك، إذا كان من المقرر منح درجة GEO واسعة أو بند مطابقة للجمهور، فلا يمكن ترك الحقول الأساسية فارغة.
21. قائمة تدقيق التدقيق
هل تم تحديد الكيان المدقق بالكامل؟ هل تم تسجيل منتج الذكاء الاصطناعي و واجهة المستخدم؟ هل تم تثبيت النص قبل القياس؟ هل قام المشارك بتغيير النص؟ هل تم معرفة شروط الجلسة والتخصيص؟ هل تم تسجيل معلومات بلد المستخدم والموقع؟ هل تم الحفاظ على الاستجابة الكاملة؟ هل هو الإخراج الأول المناسب أم أفضل إخراج مختار؟ هل يوجد سجل كامل للأدلة؟ هل تم فصل العدد الفعلي للمستخدمين عن عدد الملاحظات؟ هل تم احتساب الملاحظات المكررة والمطابقة بشكل مستقل؟ هل تم التعامل بشكل صحيح مع حالات الرفض وأخطاء النظام في المقام؟ هل تم الاحتفاظ بالسجلات غير الصالحة وتوضيح سببها؟ هل تم فصل البيانات التركيبية والحقيقية؟ هل يتم تقديم استجابة واحدة كنتيجة للسكان؟
هل يُطبَّق الادعاء فقط على المنتج المقاس، أو البلد، أو اللغة، أو الوقت؟ هل تم تقييم احتمال حدوث خطأ جسيم بشكل منفصل؟ هل يحمل الناتج بيانًا بالثقة أو عدم اليقين؟ هل تُعرض المناطق غير المختبرة بوضوح؟ هل يتجاوز البيان العام مستوى الملاحظة الفعلية؟ إذا لم يُجب على أحد الأسئلة الواقعية، فإن الناتج يحمل ثقة محدودة. إذا تُرِك أكثر من سؤال واحد بدون إجابة، فلا ينبغي استخدامه لتقييم GEO العام.
22. الاعتراضات والردود
الاعتراض 1— "المستخدم الفعلي يرى بالفعل إجابة واحدة فقط."
هذا صحيح. الإجابة الوحيدة التي يراها المستخدم الفردي هي تجربة ذلك الشخص الحقيقية. لذلك، يتم تسجيل الأحداث الفردية. ومع ذلك، فإن الخبرة الفردية ليست هي نفسها خبرة السكان. نظام NOMOS يحافظ على كلا الحقائق معًا:
تجربة مستخدم واحد حقيقية. / المستخدم الواحد ليس هو جميع السكان.
اعتراض 2— “إذا كان النظام يعطي نفس الإجابة في كل مرة، أليست إجابة واحدة كافية؟”
الادعاء بأن النظام يعطي نفس الإجابة في كل مرة يحتاج أيضًا إلى قياس. بالإضافة إلى ذلك:
- الوقت،
- الاسترجاع،
- البلد،
- اللغة،
- الخطة،
- التخصيص،
- واجهة المستخدم
قد يختلف. حتى النظام الذي يُفترض أنه حتمي لا يمكن تعميمه خارج الشروط المحددة.
اعتراض 3— "لماذا بالضبط 1,000؟"
الرقم 1,000 ليس حدًا ساحرًا لليقين. GEO-1000 يعمل كنقطة مرجعية تأسيسية توازن بين:
- حجم مستخدمين كبير،
- تقدير واسع على مستوى المنتج،
- تكلفة قابلة للتطبيق،
- سهولة الفهم العامة.
قد تتطلب المجموعات الفرعية المزيد من الملاحظات. يجب أن تتحقق الدراسات التجريبية من الحد أو تعدله.
اعتراض 4— “دع نفس 1,000 الأشخاص يختبرون جميع منتجات الذكاء الاصطناعي.”
يمكن أن تكون هذه الطريقة مفيدة للمقارنة الزوجية بين النماذج. ومع ذلك، قد يؤدي اختيار المستخدمين المتقدمين فقط لذكاء اصطناعي والذين يمكنهم الوصول إلى جميع المنتجات إلى تحيز في السكان المستهدفين. أيضًا، الملاحظات من نفس الشخص تعتمد على بعضها البعض. سيتم مقارنة التصاميم المزدوجة بالكامل، والمزدوجة جزئيًا، والمتوازنة لاحقًا.
اعتراض 5— "أليس لقطة الشاشة دليلاً كافياً بالفعل؟"
لقطات الشاشة مهمة. ومع ذلك، بمفردها لا تظهر دائماً ما يلي:
- الزمن الحقيقي
- دولة
- خطة
- المحادثة السابقة
- التخصيص
- تحديث الإجابة
- تغيير الملف
- الرد الكامل
لهذا السبب، تُعَد لقطة الشاشة جزءًا مهمًا من حزمة الأدلة. إنها ليست كل شيء.
الاعتراض 6— “لماذا ندرج نظامًا لا يستجيب في النتيجة؟”
قد تكون تجربة المستخدم الحقيقية هي عدم الحصول على إجابة. الرفض أو الخطأ:
- فني،
- أمني،
- سياسي،
- الوصول
قد يكون هو النتيجة. إذا تم تطبيق البروتوكول بشكل صحيح، يجب تسجيل الحدث. يُصنَّف عدم استجابة النظام بسبب خطأ فني من قبل المشارك بشكل منفصل.
اعتراض 7— "لماذا يجب أن تؤثر خطأ شديد واحد على التفتيش بأكمله؟"
خطأ واحد لا يثبت أن معظم السكان ارتكبوا نفس الخطأ. ومع ذلك، فإن الضرر المحتمل لخطأ واحد يمكن أن يكون شديدًا. لذلك:
- تكرار النتيجة
- القرار الحرج والضرر والنزاهة
يتم تقييمها بشكل منفصل. المتوسط لا يمكنه مسح الضرر البشري تلقائيًا.
اعتراض 8— «إذا لم نستطع قول أي شيء برد واحد، ما هي قيمة الاختبارات المبكرة؟»
الاختبارات الفردية وعينة صغيرة:
- توليد الفرضيات
- اكتشف أنواع الأخطاء
- اختبارات التجارب،
- اختبر نظام الالتقاط،
- قم معايرة القضاة،
يمكن أن تكشف عن أحداث حرجة. ما هو الخطأ هو عدم إجراء اختبار استكشافي. ما هو الخطأ هو تقديم نتيجة الاختبار الاستكشافي كدرجة سكانية.
المبدأ الشائع للفصل 24
تم كتابة هذا الفصل للقضاء على مفهوم خاطئ واحد: "لقد سألت الذكاء الاصطناعي، وحصلت على إجابة؛ هذه هي نتيجة GEO الخاصة بي." لا. أنت لم تحصل بعد على نتيجة GEO عامة. ما لديك هو ملاحظة. هذه الملاحظة:
- حقيقية،
- هامة،
- وحتى حرجة
قد يكون كذلك. ومع ذلك، لا يزال مجرد ملاحظة واحدة. للحصول على درجة GEO، وجود:
- المستخدمين،
- منتجات الذكاء الاصطناعي،
- الدول،
- اللغات،
- الجلسات،
- الأوقات
ما يجب قياسه هو توزيع التمثيل عبر منتجات الذكاء الاصطناعي، والدول، واللغات، والجلسات، والوقت. لقطة شاشة واحدة ليست توزيعاً. عشر تكرارات آلية ليست عشرة أشخاص مستقلين. ولا تمثل ألف إجابة من عينة فقيرة سكان العالم. حتى العينة النسبية للسكان قد تكون غير مكتملة بدون عدالة لغوية. المتوسط العالي لا يمكن أن يمحو الأخطاء الحرجة. ولذلك فإن القانون الأول لقياس NOMOS هو:
الإجابة الواحدة هي حدث. / الإجابات المتعددة هي نمط. / العينة المحددة هي تقدير للسكان. / التكرار على مدى الزمن هو مقياس للاستقرار. / لكن أيًا من هذه وحدها ليست سببًا أو قيمة مستدامة.
طلب قسم 1 من NOMOS
لا تحضر لي لقطة شاشة واحدة ثم تتحدث عن النظام بأكمله.
لا تجعل إجابة مستخدم واحد هي إجابة سكان العالم.
لا تحوِّل النسخ المكررة من نفس الحساب إلى أشخاص مستقلين.
لا تقم بتحديث الإجابة وعرض المفضل كما لو كان التوزيع الحقيقي.
لا تزيل الرفض أو الأخطاء أو المجهولات من المقام.
لا تعمم لغة واحدة على العالم، أو دولة واحدة على كل الدول، أو منتج ذكاء اصطناعي واحد على جميع الأنظمة التوليدية.
لا تحول نجاحًا واحدًا إلى دليل على تأثير التدخل، أو خطأ واحد إلى صفة ثابتة للنظام بأكمله.
لا تُغرق خطأً شديدًا واحدًا ضمن المتوسط.
أولاً، سجّل الحدث. / ثم قس النمط. / ثم حدد السكان المستهدفين. / ثم أظهر الاعتمادية وعدم اليقين. / وتحدث فقط بالقدر الذي تحمله الأدلة.
جملة ختام الفصل
تمثيل الكيان في أنظمة الذكاء الاصطناعي ليس إجابة واحدة. منتجات الذكاء الاصطناعي هي توزيع يجب قياسه عبر المستخدمين والدول واللغات والجلسات والأوقات.
النواة المعيارية
يجوز لمخرج واحد من نظام توليدي أن يثبت وقوع استجابة بعينها في ظروف موثقة. ولا يجوز استخدام مخرج واحد للاستدلال على: - الانتشار في المجتمع المستهدف، - السلوك المعتاد للمنتج، - الاستقرار عبر الزمن، - الاتساق بين اللغات، - الاتساق بين البلدان، - الاتساق بين المنتجات، - أثر التدخل، - يقين التوصية، - الأثر التجاري، - المطابقة، - أو درجة GEO. ويجب أن تستند أي ادعاءات أوسع نطاقًا إلى مجتمع مستهدف محدد مسبقًا، وتصميم صالح متعدد الملاحظات، وبنية تبعية موثقة، وحزمة أدلة، وقاعدة تقييم، وبيان للنطاق، وإفصاح عن عدم اليقين. ويجوز لمخرج واحد ذي ضرر مرتفع أن يفعّل مراجعة مستقلة لحادثة حرجة، من دون أن يُعامل بوصفه دليلًا على مدى الانتشار في المجتمع المستهدف.

