بروتوكول NOMOS لتدقيق GEO

10 / K04 · K11 · K12 · K13

دستور المُدخل (Prompt)

دستور المُدخل (Prompt) — أقرت المادة 9 الحكم التالي:

الإصدار
0.9.0
الحجم
11,246 كلمة
الحالة
نص مرشح مُثبَّت تحريرياً
الأسس المنهجية
K04 · K11 · K12 · K13

حد الفصل

أقرت المادة 9 الحكم التالي:

نفس اسم المزود، أو نفس علامة النموذج، أو نفس الشعار لا تنشئ تجربة ذكاء اصطناعي قابلة للمقارنة.

الآن نحتاج إلى تحديد الأداة الرئيسية الأخرى:

ما الذي سيسأله المستخدم بالضبط لمنتج الذكاء الاصطناعي؟

المُدخل ليس مجرد جملة سؤال. المُدخل:

  • ينادي الكيان الذي يتم تدقيقه،
  • يحدد نية المستخدم،
  • يحدد أي مهمة يتوقعها من الذكاء الاصطناعي،
  • يوسع أو يضيق نطاق الإجابة،
  • قد يشجع على استخدام الموارد،
  • قد يطلب نصيحة،
  • يمكنه تضمين افتراض في الإجابة،

يمكنه توجيه المستخدم أو النظام نحو نتيجة معينة. هذه المُدخلات ليست متشابهة:

  • "ما هو Apple.com؟"
  • "مع أي منظمة يرتبط Apple.com وما هو عمل هذه المنظمة؟"
  • “هل Apple.com شركة موثوقة؟”
  • “لماذا تعتبر Apple.com أفضل شركة تكنولوجية في العالم؟”
  • "وفقًا لموقعها الرسمي، ما نوع الشركة التي تُعد Apple؟"
  • “قارن بين Apple والشركات المشابهة وأخبرني هل توصي بها أم لا؟”

جميعها تحتوي على نفس اسم النطاق. إنها لا تحمل نفس نية المستخدم. إنها لا تولد نفس الحمل الأدلة. إنها لا تتوقع نفس الإجابة. المُدخل الأول غامض. المُدخل الثاني يتطلب تحليل الهوية والنشاط. المُدخل الثالث يتطلب التقييم والحكم على الموثوقية. المُدخل الرابع يضمن افتراضًا إيجابيًا وتفوقًا ضمن الاستجابة. المُدخل الخامس يربط الاستجابة فقط بالمصدر الرسمي. المُدخل السادس ينشئ مهمة مقارنة وتوصية. لا يمكن دمج الإجابات على هذه الأسئلة في درجة جغرافية واحدة دون تفسير. في القياس متعدد اللغات، تصبح المشكلة أكبر. يمكن أن تكون لعبارة 'نفس المُدخلة' معنيان مختلفان:

  • إعطاء جميع المستخدمين نفس سلسلة الأحرف
  • الحفاظ على نفس نية المستخدم، وحمل المهمة، والحد المعرفي عبر جميع اللغات والمناطق

يمكن تطبيق الطريقة الأولى داخل لغة واحدة فقط. غالبًا ما تكون بلا معنى بين اللغات. الترجمة كلمة بكلمة:

  • قد لا تكون طبيعية،
  • قد تحمل معنى اجتماعي مختلف،
  • قد يغير النبرة الرسمية أو غير الرسمية،
  • قد تضيف افتراضات عن الثقة أو الجودة أو التوصية،
  • قد توسع النطاق القانوني،

قد تكسر مرساة الكيان. لذلك، في GEO-1000، تعني "نفس المُدخل":

نفس نص صياغة المُدخل المثبّت داخل نفس الخلية الخاصة باللغة والمحلية؛ بين لغات ومحليات مختلفة، يعني تعادل دلالي ووظيفي تم التحقق منه.

NOMOS يتطلب أن يحمل كل قياس مجموعة الاستعلام، اللغة، البلد، التاريخ، منتج الذكاء الاصطناعي، وسجل التكرار؛ وأن تكون الأدلة والحدود والسياق والوقت مرئية. يطبق دستور صياغة المُدخل هذا الالتزام على سؤال المستخدم نفسه. هذا القسم:

  • هوية صياغة المُدخل كأداة تجريبية،
  • التمييز بين سؤال البحث ونص صياغة المُدخل،
  • عائلة صياغة المُدخل، نسخة صياغة المُدخل، والحالة الخاصة بصياغة المُدخل،
  • صياغات مُدخل تشخيصية مع صياغة المُدخل الأساسية المرآة,
  • آثار صياغات المُدخل المُسيطر عليها والطبيعية،
  • التكافؤ الدلالي متعدد اللغات،
  • الترجمة، والترجمة العكسية، والتجربة المحلية،
  • توجيه صياغة المُدخل،
  • مشكلات الافتراض وحمل المعرفة،
  • مرساة الكيان وحدود النطاق،
  • ترتيب صياغة المُدخل وسياق المحادثة،
  • تسرب صياغة المُدخل والمبالغة في التكيف مع التقييم،
  • مجموعات صياغات المُدخل المفتوحة والمغلقة والمحتجزة،
  • إصدار صياغة المُدخل، وتثبيتها، وسجلات سلامتها،
  • التسليم الدقيق للمطالبة للمستخدم،

يحدد. هذا الفصل لم يتطرق بعد إلى:

  • جميع تفاصيل الحقل للألواح المراقبة النظيفة والطبيعية للمستخدمين
  • الهيكل الكامل لبرنامج NOMOS Capture,
  • فصل الاستجابات إلى ادعاءات ذرية,
  • عتبة الانتقال للإجابة النهائية,
  • الأوزان الدقيقة لعائلات النظام في درجة NOMOS

لا يتم الانتهاء منها نهائيًا. السؤال الرئيسي في الفصل 10 هو:

كيف نثبت أن الأسئلة المقدمة لمنتجات الذكاء الاصطناعي تقيس بالفعل نفس الشيء عبر المنتجات والمستخدمين والدول واللغات والأوقات؟

NOMOS التحدي

أنت تعطيني أربعة أسئلة عن نفس الشركة:

  • ما نوع شركة X؟
  • هل شركة X موثوقة؟
  • لماذا شركة X هي أفضل شركة؟
  • "هل توصي لي ب X؟"

ثم تضع إجاباتي على نفس درجة GEO. في السؤال الأول، أشرح الهوية والنشاط. في السؤال الثاني، أبحث عن معيار ثقة. في السؤال الثالث، أجبر على الرد على افتراض التفوق الذي وضعته. في السؤال الرابع، أقوم بتوليد توصيات حول ملاءمة المستخدم والمقارنة. تقيس أربع مهام منفصلة كما لو كانت نتيجة واحدة. ثم:

"سألت عن نفس العلامة التجارية،" تقول. نفس الكيان ليس نفس الطلب. الآن تكتب نفس السؤال بالإنجليزية: "ما نوع الشركة X؟" أنت تشكل جملة قريبة من المعنى بلغة أخرى: "هل X شركة جيدة وجديرة بالثقة؟" قد تبدو الترجمات متقاربة من حيث الكلمات.

لكن الأول يتطلب تعريفًا. الثاني يتطلب تقييمًا. في الإجابة الأولى، يمكنني أن أشرح ما الذي تفعله الشركة. في الإجابة الثانية، يمكنني أن أبحث عن أدلة على الثقة والتوصية. ثم تحسب فرق الدرجات بين اللغات باعتباره أداء لغتي. في الواقع، أنت لم تقم بنفس التجربة. الآن أنت تقدم تعليمات أخرى:

"اشرح X باستخدام موقع الشركة الخاص." أنا أنقل فقط البيان الرسمي للشركة. بالنسبة لمنتج آخر، تقول: "قيم X باستخدام مصادر مستقلة." ثم تقارن بين المنتجين. لقد منحت واحدًا دور التمثيل الرسمي، والآخر دور الحقيقة الموثوقة. الفرق الناتج ليس فقط فرقًا بين المنتجين.

إنه اختلاف في دستور المستخدم. الآن أنت توزع المُدخل على العالم بأسره. النسخة الإنجليزية طبيعية. النسخة التركية تبدو كأنها ترجمة آلية. النسخة اليابانية رسمية بشكل مفرط. في لغة أخرى، تم تحويل اسم الشركة إلى نظام كتابة خاطئ وخلط مع كيان آخر. أنت تخلق مهمة معرفية ووجودية مختلفة في كل لغة.

ثم تنشر تقرير العدالة اللغوية العالمي. المرسوم الأول في هذا القسم هو كما يلي:

المُدخل ليس وعاءً محايدًا للقياس؛ إنه الأداة التجريبية التي تشكّل نتيجة القياس.

ينص حكمه الثاني على:

اسم الكيان نفسه ليس نفس نية المستخدم.

تنص الفقرة الثالثة منه على:

لا ينبغي الحفاظ على نفس الكلمة عبر اللغات، لكن يجب الحفاظ على نفس المهمة الدلالية والمعيارية.

تنص المادة الرابعة على:

إذا كان المطلَب يحتوي بالفعل على الإجابة، فإنه لا يقيس GEO؛ بل يقيس الاستدعاء.

تنص أحكامه الخامسة على:

عندما يتغير إصدار المطلَب، قد يكون السؤال المقاس قد تغير أيضًا.

1. غرض الفصل

الغرض من هذا القسم هو جعل جميع صياغات المُدخل المستخدمة في GEO-1000 قابلة للتدقيق ومتعددة اللغات ومستقلة عن النتائج وأدوات قياس بالإصدارات. [K04] يجعل هذا القسم التمييزات التالية معيارية:

  • سؤال بحث مقابل مطالبة المستخدم
  • الكمية التي يجب قياسها مقابل تسلسل الكلمات المستخدم
  • عائلة صياغات المُدخل مقابل صياغة المُدخل الفردية
  • نسخة صياغة المُدخل مقابل مثال صياغة المُدخل
  • مرساة الكيان مقابل كيان الهدف
  • التعريف مقابل التقييم
  • الاستشهاد مقابل التوصية
  • سؤال الهوية مقابل سؤال الثقة
  • مهمة التمثيل الرسمي ومهمة التحقق من الحقائق
  • صياغة المُدخل المفتوحة النهاية وصياغة المُدخل المقيدة بالنموذج
  • صياغة المُدخل المسيطر عليها ومطالبة المستخدم الطبيعية
  • صياغة المُدخل ذات الدور الواحد والبروتوكول متعدد الأدوار
  • ترجمة صياغة المُدخل وتكييف صياغة المُدخل
  • تساوي الكلمات والتكافؤ الدلالي
  • المكافأة الدلالية والمكافأة الوظيفية
  • لغة الطلب ولغة الاستجابة
  • اللغة والمنطقة
  • الإطار المحايد والإطار التوجيهي
  • طلب المعلومات وافتراض الشيء مسبقًا
  • طلب المصدر وتعليمات استخدام الويب
  • تنوع الطلب وتنويع المنتج
  • متانة إعادة الصياغة مع الدرجة الرئيسية
  • مجموعة الطلب المفتوحة مع مجموعة التحقق المختومة
  • فرط التكيف مع الاختبار مع شفافية الاختبار
  • تصحيح الطلب بعد النتيجة مع تجربة الطلب
  • النص المعدل يدويًا من قبل المشاركين مع تقديم الطلب الفني
  • عدم القدرة على الرد بمطالبة للتوضيح
  • نقص المعلومات الواقعية مع تحفيز الأمان أو السياسات

في نهاية هذا القسم، يجب أن يكون كل تدقيق GEO-1000 قادرًا على تقديم إجابات واضحة على الأسئلة التالية:

أي سؤال بحثي يقيسه هذا المُدخل؟

أي نية المستخدم يمثلها؟

ما هي الافتراضات التي يدمجها في الرد؟

هل يتم الحفاظ على نفس المهمة عبر اللغات والمواقع؟

ما هو النص الكامل للمُدخل، وإصداره، وسجل النزاهة؟

هل قام المشارك بالفعل بتثبيت المُدخل على منتج الذكاء الاصطناعي؟

هل تم تجميد المُدخل قبل عرض النتائج؟

2. الأحكام المعيارية المركزية

يجب تسجيل كل مُدخل مستخدم داخل GEO-1000 في سجل المُدخلات جنبًا إلى جنب مع سؤال البحث، المقياس المستهدف، عائلة المُدخل، مرساة الكيان، نية المستخدم، نوع المهمة، النطاق، التوقيت، المُدخل المصدر، صيغة الاستجابة، اللغة، المكان، حالة التكافؤ، النسخة، وسجل النزاهة، ويجب إقفاله قبل عرض استجابات الذكاء الاصطناعي. يجب على جميع المشاركين في نفس خلية اللغة والمكان، في نفس خلية المُدخل:

  • امتلاك نفس معرف المُدخل،
  • امتلاك نفس النسخة،
  • امتلاك نفس سلسلة الأحرف،
  • نفس علامات الترقيم،
  • نفس مرساة الكيان،
  • نفس التعليمات المصدرية والصيغة

يجب اتخاذها. لا يجب أن تكون صياغات المُدخل في لغات ومناطق مختلفة متطابقة كلمة بكلمة. يجب أن تحمل تكافؤًا جوهريًا في المجالات التالية:

  • الكيان المستهدف
  • نية المستخدم
  • المهمة
  • النطاق
  • الجغرافيا
  • الوقت
  • الافتراض المسبق
  • العبء المعرفي
  • تنسيق الاستجابة
  • توقع المصدر
  • عبء التقييم والتوصية
  • مستوى عدم اليقين

إذا تغير أي من هذه المجالات بشكل جوهري:

  • نسخة جديدة من صياغة المُدخل،
  • خلية تحفيز جديدة،
  • تحليل منفصل

قد يكون مطلوبًا.

3. المُحَفِّز هو أداة قياس تجريبية

إذا كان الترمومتر يمكن أن يؤثر على الحرارة، فهو ليس أداة قياس جيدة. إذا أدخل المحفز الإجابة بدلاً من قياسها، فهو ليس أداة قياس GEO جيدة. يمكن أن يؤثر المحفز على النتيجة بالطرق التالية:

  • طريقة تعريف وجوده
  • افتراض الثقة أو الجودة
  • المطالبة بالموارد
  • استخدام الويب
  • طلب التوصية
  • طول الإجابة
  • صيغة الإجابة
  • ملف المستخدم
  • السياق الزمني والبلد
  • المعلومات السابقة
  • إرشاد عاطفي أو تجاري
  • تعليمات اللعب بالأدوار
  • أمر لتحقيق نتيجة محددة

لذلك، يجب أن يكون المطلوب:

مخزناً كبيانات اختبار أولية

لا يمكن تلخيصه في التقرير. يجب الاحتفاظ به بالنص الكامل.

4. التسلسل الدستوري للمطلوب

يجب إنشاء مطلوب GEO-1000 ضمن التسلسل الهرمي التالي.

4.1. سؤال البحث

إنه السؤال على المستوى العالي الذي تحاول القياس الإجابة عليه. مثال: "هل يمكن لمنتجات الذكاء الاصطناعي ربط المجال الذي تم تدقيقه بالكيان المؤسسي الصحيح وتحديد نشاطه الرئيسي بشكل صحيح؟" لا يجب أن يُعرض سؤال البحث على المستخدم بنفس الصياغة.

4.2. الكمية المتوقعة

هو أي احتمال أو توزيع يتنبأ به القياس. مثال: "احتمالية رؤية التمثيل الصحيح للكيان والنشاط الرئيسي أمام طلب المرآة الأساسية المثبّت للفئة المحددة من المستخدمين."

4.3. عائلة الطلبات

وهي مجموعة من الطلبات التي تقيس نفس بُعد التمثيل. مثال:

  • الهوية
  • النشاط
  • الأدلة
  • التوصية
  • الوقت
  • الحدود

4.4. الهدف القانوني للمُدخل

هو تعريف مستقل عن اللغة للمعنى. يشرح ما يلي: ماذا يريد المستخدم أن يعرف؟ ما المهمة المتوقعة من الذكاء الاصطناعي؟ أي المجالات ضمن النطاق؟ أي المجالات خارج النطاق؟ أي افتراضات محظورة؟ ما نوع تنسيق الاستجابة المتوقع؟ الهدف القانوني ليس نصًا تابعًا للغة واحدة.

4.5. مُدخل اللغة المصدر

نص المُدخل الذي كُتب فيه الهدف القانوني لأول مرة وتم اعتماده تحريرياً. لغة المصدر:

  • قد يكون قادرًا على استخدام اللغة الإنجليزية.
  • التركية،
  • يمكن أن تكون لغة أخرى

هذا لا يعني أن اختيار لغة المصدر أفضل من اللغات الأخرى.

4.6. إصدارات اللغة والمنطقة

هذه نصوص الحث التي تكون طبيعية ودلالية ومكافئة وظيفيًا لكل لغة ومنطقة.

4.7. مثال على الحث المرسل إلى المشارك

هذا هو نص الحث الدقيق المرسل إلى المستخدم المحدد. يجب أن يطابق إصدار سجل الحث.

4.8. النص الفعلي المرسل إلى منتج الذكاء الاصطناعي

هذه هي سلسلة الأحرف المرسلة فعليًا من قبل المشارك. تتم مقارنتها مع الحث المرسل.

5. الهيكل الأساسي للحث

يمكن تمثيل مثال على صياغة المُدخل بالمكونات التالية:

P_i= (e, ι, τ, κ, γ, χ, ε, ϕ, λ, ρ, ν)

هنا:

  • e: مرساة الكيان
  • ι: نية المستخدم
  • t: نوع المهمة
  • κ: الموضوع والنطاق
  • g: السياق الجغرافي أو القضائي
  • χ: السياق الزمني
  • e: المتطلبات المعرفية والمصدر
  • ϕ: تنسيق الاستجابة
  • λ: اللغة ونظام الكتابة والمحلية
  • ρ: النغمة والأسلوب والطبيعية
  • ν: إصدار صياغة المُدخل

لكي يعتبر إثنان من صياغات المُدخل متشابهتين، لا يكفي أن يكون مرساة الكيان فقط متطابقة. مطلوب تكافؤ المكونات المادية.

6. المُدخل هو جزء من الكمية المستهدفة

الدرجة الجغرافية الفريدة والعالمية لكيان ما ليست مستقلة عن جميع الأسئلة الممكنة. تمثيل أكثر دقة:

θ_{E,A,P,U,t}

حيث:

  • E: الكيان
  • A: نسخة من منتج الذكاء الاصطناعي
  • P: الادعاء أو عائلة الادعاءات
  • المستخدم المستهدف
  • t: الوقت

عندما تتغير الادعاء:

P_1≠ P_2

قد يكون كذلك. في هذه الحالة:

θ_{E,A,P_1,U,t}

و:

θ_{E,A,P_2,U,t}

ليست نفس الكمية. لذلك:

يجب أن يكون تصنيف GEO مرتبطًا دائمًا بمجموعة الادعاءات والإصدار.

7. عائلات الادعاءات

يجب أن يقيس GEO-1000 مهام التمثيل المختلفة في عائلات ادعاءات منفصلة.

PR-01— ادعاء المرآة الأساسية

يقيس الهوية الأساسية والنشاط الرئيسي للكيان. مثال الغرض: 'ما هو الكيان الرئيسي المرتبط بهذا اسم المجال أو العلامة التجارية، وما هو النشاط الرئيسي لهذا الكيان؟' هذا المُدخل:

  • القيادة
  • الثقة،
  • التوصية،
  • السعر،
  • الأداء

يجب ألا يرغب.

PR-02— مُدخل حل الكيانات

اسم النطاق أو العلامة التجارية أو المنتج أو اسم الشخص يختبر الكيان الذي ينتمي إليه. مثال: 'أي منظمة أو كيان ينتمي إليها X؟'

PR-03— مُدخل النشاط والنطاق

وجودك:

  • المنتج,
  • الخدمة،
  • البلد،
  • العميل،
  • القدرة

يقيس حدوده.

PR-04— مُدخل الأدلة والمصادر

يقيس بما لأي مصدر وحالة دليل يحمل الذكاء الاصطناعي مزاعم مادية. يجب تحديد متطلبات المصدر في هذه الفئة بوضوح.

PR-05— المُدخل المحلي أو القضائي

يقيس دولة معينة أو موقعًا، أو سعرًا، أو خدمة، أو نطاقًا قانونيًا.

PR-06— مطالبة زمنية

يقيس التيار أو المعلومات التاريخية أو المعلومات ذات التاريخ المحدد. "حاليًا"، "في 2025"، و"منذ تأسيسه" ليست هي المهمة نفسها.

PR-07— مطالبة توصية

يقيس ما إذا كان الكيان مناسبًا لاحتياجات مستخدم محددة. قد تكون بيانات ملف المستخدم وشروط الاستبعاد إلزامية.

PR-08— مطالبة مقارنة

يقارن بين عدة كيانات أو خيارات وفقًا لمعايير محددة. مجرد السؤال "أي واحد أفضل؟" غير كافٍ.

PR-09— مطالبة الحدود والاستبعاد

وجودك:

  • ما لا يفعله،
  • للأشخاص الذين لا يناسبهم,
  • في أي دولة أو حالة لا يقدم فيها الخدمات

إجراءات.

PR-10— مُدخل المتانة وإعادة الصياغة

يقيس متانة التمثيل في تعبيرات طبيعية مختلفة لنفس النية الأساسية. لا يمكن دمجه في درجة المرآة الأساسية الرئيسية بدون شرح.

PR-11— مُدخل التحكم

يختبر ما إذا كانت أداة القياس تعمل:

  • تحكم إيجابي،
  • تحكم سلبي،
  • تحكم في حالة عدم اليقين

إنه مُدخل.

PR-12— مُدخل الاحتفاظ المغلق

الإفراط في التكيّف مع الاختبار هو مُدخل يتم تجزئته مسبقًا ويُحتفظ به مغلقًا حتى نهاية القياس من أجل اختبار حفظ المُدخل أو تحسينه لسؤال منشور منفردًا. يتطلب المُدخل المحتجز حكمًا عادلًا وشرحًا لاحقًا.

8. مُدخل المرآة الأساسي

هو المُدخل الأساسي الذي يتلقاه جميع المستخدمين المؤهلين بنفس إصدار اللغة/الموقع في القياس الرئيسي للعناوين الرئيسية GEO-1000. يجب أن يحتوي مُدخل المرآة الأساسي على الميزات التالية:

  • سرعة واحدة
  • طبيعي
  • قصير ولكنه ليس غامضًا للغاية
  • محايد
  • عدم تضمين الإجابة بداخله
  • عدم طلب النصيحة
  • عدم طلب المقارنة
  • عدم إجبار استخدام المصادر، إذا لم يتم قياس الميزات بشكل منفصل
  • السماح بحل الكيانات
  • طلب معلومات عن النشاط الرئيسي أو الفئة
  • ينطبق على جميع المنتجات

9. عدم دمج الشركة مع مرساة النطاق

المُدخل الطبيعي للمستخدم: “ما نوع شركة Apple.com؟” هو سؤال مفهوم. ومع ذلك، من الناحية الأنطولوجية:

  • اسم النطاق،
  • الموقع الإلكتروني،
  • الشركة

يمكن التعامل معه بوصفه كيانًا واحدًا. غير أن تمييز الكيانات المقرر في القسم 3 يقتضي أن يكون مُدخل المرآة الأساسية في العينة المنضبطة أكثر وضوحًا. مثال اصطناعي:

"ما هي المنظمة الرئيسية المرتبطة بـ apple.com، وما هي الأنشطة الرئيسية لهذه المنظمة؟"

هذا الموكِّل:

  • يستخدم اسم النطاق كمثبت للكيان،
  • لا يعلن عن اسم النطاق مباشرة كشركة،
  • يطلب حل الكيان الرئيسي،

يقيس نطاق الأنشطة. مرشح آخر:

"أي كيان مؤسسي رئيسي مرتبط بـ apple.com، وما الذي يقوم به هذا الكيان بشكل أساسي؟"

يجب اختبار طبيعية هذه التعبيرات بشكل منفصل في كل لغة. في عينة المستخدمين في ظروف الاستخدام الطبيعية، يمكن أيضًا اختبار صياغات المُدخل المستخدمة في الحياة الواقعية، مثل "ما نوع الشركة Apple.com؟". يجب فصل نتائج صياغات المُدخل المسيطر عليها والطبيعية.

10. مسار صياغات المُدخل المسيطر عليه ومسار صياغات المُدخل الطبيعية

يمكن استخدام مسارين متكاملين من صياغات المُدخل.

10.1. المسار الكانوني المسيطر عليه

صياغة المُدخل:

  • مثبّت بالكامل،
  • متكافئ دلاليًا،
  • حدود الكيان والمهمة واضحة،
  • مصمم للمقارنات بين المنتجات

يفعل ذلك. هذا المسار يعزز التحكم في الطريقة.

10.2. مسار المستخدم الطبيعي

تستخدم المُدخلات التي تم إنشاؤها بشكل طبيعي بواسطة المستخدمين الفعليين. يمكن أن تكون هذه المُدخلات:

  • أقصر،
  • أكثر غموضًا،
  • محلية،
  • مكتوبة بلغة محادثة

. يقيس هذا المسار السلوك في العالم الواقعي.

10.3. لا يمكن دمج مسارين

المسار المسيطر: يجيب على السؤال "كيف تستجيب المنتجات لنفس السؤال المحدد؟" المسار الطبيعي: يجيب على السؤال "ماذا يحدث مع التنوع الطبيعي للأسئلة من المستخدمين الفعليين؟" يجب نشر النتيجتين بشكل منفصل.

11. المُدخل المحايد

مطالبة محايدة:

  • لا تشير إلى جانب إيجابي أو سلبي للإجابة المطلوبة،
  • لا تفترض جودة غير مثبتة،
  • لا توجه المستخدم نحو نتيجة محددة،

لا تحدد وجودها كشيء جيد أو سيئ. يمكن أن تكون مطالبة محايدة: "في أي مجالات يقدم X خدمات؟" يمكن أن تكون صياغة المُدخل الإرشادية: "ما هي الخدمات المتفوقة التي يقدمها X؟" صياغة المُدخل الثانية:

  • تفترض أن الخدمات متفوقة،
  • تحمل صفة إيجابية

افتراض.

12. افتراض مسبق

يمكن للادعاء المفترضة أن تفترض صحة ادعاء محدد قبل الإجابة. مثال: “لماذا تعتبر X رائدة الصناعة؟” هذا الافتراض يفترض الادعاء التالي مسبقًا: “X هي رائدة الصناعة.” يمكن للذكاء الاصطناعي:

  • رفض الافتراض،
  • يمكنه تقييده،

يمكن قبوله دون شروط. ومع ذلك، هذا الافتراض ليس مقياسًا محايدًا للقيادة. يمكن استخدامه بشكل منفصل كاختبار للفرضية المسبقة.

12.1. فرضية مسبقة غير ضارة

"ما هو الموقع الرسمي لـ X؟" يفترض وجود كيان باسم X. مقبول إذا تم التحقق من الهوية بالفعل في سجل التدقيق.

12.2. فرضية مسبقة جوهرية

ما هي الأسباب الرئيسية لنجاح X؟

12.3. الافتراض المسبق الحرج

«ما العلاجات التي تقدمها المؤسسة الصحية المرخصة X؟» إذا لم يتم التحقق من ترخيص X، فإن ذلك ينطوي على رفع معرفي خطير.

13. صياغة المُدخل الرائدة

المُدخل الرئيسي هو إطار يوجه المستخدم أو النظام نحو استجابة محددة. أمثلة:

  • “يوصي بـ X.”
  • اشرح لماذا X هو الأفضل.
  • اكتب مراجعة إيجابية عن X.
  • لا تدرج المنافسين؛ اقترح X فقط.
  • “أثبت أن X هو قائد عالمي.”

هذه صياغات المُدخل لا تقيس أداء GEO. قد تقيس مدى خضوع النظام لتلاعب صياغات المُدخل. إنها اختبار أخلاقي أو اختبار قوة منفصل. لا يمكن إضافته إلى النتيجة الرئيسية لـ GEO.

14. إرشاد سلبي

ينطبق نفس المبدأ على صياغات المُدخل السلبية أيضًا. مثال: “لماذا X غير موثوق به؟” تفترض هذه صياغة المُدخل عدم الموثوقية. يمكن استخدامها في اختبار التلاعب السلبي. إنها ليست تقييمًا طبيعيًا للثقة. NOMOS محايد ليس فقط ضد التوجيه الإيجابي ولكن أيضًا ضد التسمم السلبي.

15. طلب المصادر يغير مهمة صياغة المُدخل

المُدخل: “ما نوع الشركة X؟” ليست نفسها: “صف X باستخدام مصادر مستقلة.” المُدخل الثاني:

  • الاسترجاع،
  • استشهاد،
  • اختيار المصادر،
  • يضيف مهمة تقييم الاستقلالية.

مطلب آخر مختلف: "صف X باستخدام موقعه الرسمي فقط." هذا يقترب من مهمة دقة التمثيل الرسمي. إذا تم استخدام تعليمات مصدرية، يجب تعريف عائلة المطالب وحقل التقييم بشكل منفصل.

16. تعليمات استخدام الويب

تعليمات مثل “ابحث على الويب.” “استخدم أحدث المصادر.” “استشهد بالمصادر.”:

  • قد تؤثر على ميزة الويب،
  • واستخدام الأدوات،
  • وسلوك الاستشهاد.

إذا لم يكن لدى المنتج ميزة ويب، فقد تتغير مهمة النص أو يتم رفضها. في المقارنات الطبيعية للمنتجات، لا يجب أن يحتوي النص على أوامر ويب محددة لمزود معين. يجب إدارة أوضاع تشغيل/إيقاف وظيفة الويب للمنتج من خلال تكوين النظام في القسم 9.

17. صيغة الاستجابة

يحدد النص:

  • طول الاستجابة،
  • الهيكل،
  • التفاصيل،
  • عدد المصادر

يمكن تحديده. أمثلة على التعليمات:

  • "أجب في جملة واحدة."
  • "اشرح في 100 كلمة."
  • "اكتب على شكل نقاط."
  • "قل اسم الشركة فقط."
  • "استخدم ثلاثة مصادر كحد أقصى."

هذه التعليمات:

  • نقص المادة،
  • سهو خاطئ،
  • عدد الاستشهادات

يؤثر مباشرة. يجب أن يكون شكل الإجابة مكافئًا عبر جميع صياغات المُدخل المقارنة. إذا لم توجد تعليمات للشكل، يتم قياس شكل الإجابة الطبيعي.

18. قيود الطول

إجابة قصيرة: قد تظهر الهوية الرئيسية، قد تفقد تفاصيل الحدود والأدلة. إجابة طويلة:

  • المزيد من الادعاءات المالية،
  • مزيد من فرص الأخطاء،
  • المزيد من الاستشهادات

يمكن إنتاجه. لذلك، يجب أن تكون الإجابات التي تحتوي على تعليمات بأطوال مختلفة:

  • عدد الادعاءات الذرية،
  • عدد الأخطاء،
  • نطاق

تتطلب مقارنة دقيقة. يجب ألا يحتوي المحفز الرئيسي للمرآة الأساسية، إذا أمكن، على حد محدد للكلمات.

19. شخصية المستخدم

قد يتضمن المحفز المعلومات التالية:

  • "أنا صاحب مشروع صغير."
  • "أنا مستهلك أعيش في تركيا."
  • "لدي ميزانية قدرها 10,000 يورو."
  • "أنا أبحث عن استشارة قانونية."

قد تكون هذه المعلومات ضرورية للحصول على نصيحة والتأكد من الملاءمة المحلية. إضافة شخصية غير ضرورية في مُدخل الهوية يمكن أن يغير الاستجابة. شخصية المستخدم:

  • مسبق التعريف،
  • ذات صلة،
  • مكافئ في جميع اللغات

يجب أن تكون.

20. سياق الزمن

المُدخلات التالية مختلفة:

  • ما نوع شركة X؟
  • "ما نوع الشركة التي هي عليها X حالياً؟"
  • "ما نوع الشركة التي كانت عليها X في 2024؟"
  • "في أي المجالات عملت X منذ تأسيسها؟"

"حاليًا" يضيف عنصر التحديث. المُدخل التاريخي يتطلب السجلات القديمة. سياق الزمن:

  • مفتوح،
  • مرتبط بنفس معيار التاريخ
  • متوافقا مع موجة القياس

لابد أن يكون كذلك. إذا تم استخدام التعبير "اليوم"، يجب الاحتفاظ بالمعادل المطلق للتاريخ في سجل الطلب.

21. السياق الجغرافي والاختصاص

السؤال: "هل يقدم X الخدمة؟" ليس هو نفسه: "هل يقدم X خدمة للعملاء الأفراد في تركيا؟" الموضوع الثاني:

  • البلد،
  • نوع العميل،
  • لديها عملية محلية

حدود. لا يمكن أن يضيع السياق الجغرافي في الترجمة. "أوروبا"، "الاتحاد الأوروبي"، "منطقة اليورو"، و"الدول الأوروبية" لا تغطي نفس النطاق.

22. المحفز المقارن

السؤال "أيهما أفضل، X أم Y؟" بحد ذاته ليس مقارنة قابلة للقياس. يجب تحديد ما يلي: أي مستخدم؟ أي حاجة؟ أي دولة؟ أي ميزانية؟ أي معيار؟ أي وقت؟ أي دليل؟ مطالبة أكثر ملاءمة: "بالنسبة لشركة صغيرة تعمل في تركيا، قارن بين X وY في خدمات تطوير الويب من حيث شفافية الأسعار، ونطاق التسليم، والمراجع القابلة للتحقق." هذه صياغة المُدخل تنتمي إلى فئة مطالبة المقارنة المنفصلة. لا يمكن إضافتها إلى درجة المرآة الأساسية.

23. مطالبة التوصية

يحمل مُدخل التوصية عبء قرار أعلى من مُدخل التعريف. مثال: "هل توصي بـ X؟" قد يحذف هذا السؤال المعلومات التالية: لمن؟ من أجل ماذا؟ أين؟ بأي ميزانية؟ تحت أي مخاطرة؟ يجب أن يحمل مُدخل التوصية متجه ملاءمة المستخدم بالقدر ذو الصلة. تمثيل المرشح:

U=(الحاجة، الدولة، الميزانية، userType، المخاطر، القيود)

نتيجة للتوصية، لا يمكن تقديمه مثل رؤية GEO العامة المستقلة عن ملف تعريف المستخدم.

24. مُدخل غير مؤكد

إذا كان المُدخل مفتوحًا لتفسيرات معقولة متعددة:

  • قد يطلب الذكاء الاصطناعي التوضيح,
  • يمكن اختيار التفسير الأكثر احتمالًا،

يمكن شرح تفسيرات متعددة. قد يكون عدم اليقين جزءًا من المقياس الرئيسي. ومع ذلك، في مقارنة محكومة، يجب اكتشاف مُدخل غير مؤكد:

  • في الطيار،
  • يجب توضيحه إذا لزم الأمر،

يجب أن يتم توثيق التغيير بالإصدار. بعد تثبيت المُدخل، لا يمكن القول وفقًا لاستجابة الذكاء الاصطناعي: "في الواقع، كنا نسأل شيئًا آخر."

25. بروتوكول التوضيح

طلب منتج الذكاء الاصطناعي للتوضيح ليس فشلًا تلقائيًا. مثال: "أي Apple تشير إليها؟" قد يكون هذا مناسبًا إذا كان هناك تصادم كيان. يجب أن يكون مسار التوضيح محددًا مسبقًا.

25.1. مسار النواة ذو الدور الواحد

يتم تسجيل الاستجابة الأولى بغض النظر عن محتواها. سؤال توضيحي يعتبر أيضًا نتيجة. لا يتم إرسال رسالة متابعة.

25.2. مسار التوضيح الموحد

إذا طلب الذكاء الاصطناعي توضيحًا، يتم إرسال مُدخل توضيح مُسبق التثبيت ليُستخدم في جميع المنتجات. يتم تسجيل الجولتين الأولى والثانية بشكل منفصل.

25.3. مسار التوضيح الطبيعي

يجيب المستخدم الطبيعي بكلماته الخاصة. هذه الطريقة مخصصة للوحة الطبيعية. لا يمكن الخلط بينها وبين الدرجة الرئيسية المسيطر عليها.

26. صياغات المُدخل ذات الدور الواحد والمتعدد

مطلب الدور الواحد:

  • يعزز المقارنة،
  • الاستقلالية،
  • ونظافة الجلسة.

بروتوكول متعدد الجولات:

  • الوصف،
  • استعلام المصدر،
  • التصحيح،
  • تفسير التوصية

يمكن قياسه. تحمل الردود متعددة الجولات سياق الجولات السابقة. لا يمكن دمجها مباشرة مع نتائج الجولة الواحدة من نفس بنك المُدخلات.

27. ترتيب المُدخل

إذا تلقى المشارك أكثر من مُدخل واحد، فقد يؤثر المُدخل الأول على الردود التالية. مثال على التسلسل:

  • ما نوع شركة X؟
  • "ما هي المعلومات السلبية الموجودة عن X؟"
  • هل توصي بـ X؟

قد تتأثر الاستجابة الثالثة بالمحادثتين الأولى والثانية. الضوابط:

  • محادثة جديدة لكل مطالبة
  • تبديل ترتيب الطلبات عشوائيًا
  • مربع لاتيني أو ترتيب متوازن
  • مستخدم منفصل لكل عائلة من صياغات المُدخل
  • الحفاظ على متغير الترتيب في التحليل

يجب تطبيق مُدخل المرآة الأساسية تلقائيًا في جلسة جديدة ومنفصلة.

28. تلوث التعليمات

نفس المستخدم:

  • موقع الكيان الذي تمت مراجعته
  • الردود السابقة للذكاء الاصطناعي،
  • نتائج منتجات أخرى

قد يكون قد تم رؤيته. قد يتغير سلوك المشارك حتى إذا تم إرسال المُدخل تمامًا كما هو. خاصة في لوحة طبيعية، المستخدم:

  • المزيد من أسئلة المتابعة،
  • تحديث الإجابة،
  • فتح المصادر

يميل إلى إظهار ذلك. يجب الحفاظ على تلوث المُدخل في سجل المستخدم والجلسة.

29. التكافؤ بين المُدخلات عبر اللغات

يجب أن تحمل المُدخلات متعددة اللغات ثلاثة تكافؤات منفصلة.

29.1. التكافؤ الدلالي

هل تحمل المُدخلات نفس المعنى الأساسي؟

29.2. التكافؤ الوظيفي

هل يطلب من الذكاء الاصطناعي نفس المهمة؟ هل يحدد بلغة واحدة ويطلب نصيحة بلغة أخرى؟

29.3. التكافؤ المعياري

هل يحافظ على نفس عبء الإثبات والافتراض المسبق والنطاق وحدود التقييم؟ إذا سألت بلغة واحدة: "كيف تعرف الشركة نفسها؟" وبأخرى: "ما هي الشركة فعليًا؟"، فلا يوجد تكافؤ معياري.

30. الترجمة والتكيف والتوطين

يجب فصل هذه العمليات الثلاث.

30.1. الترجمة

تنقل معنى النص المصدر إلى اللغة الهدف.

30.2. التكيف اللغوي

يجعلها طبيعية ومفهومة ومفيدة في اللغة المستهدفة.

30.3. التوطين المحلي

عند الضرورة، يقوم التوطين بتكييف العناصر الخاصة بكل بلد مثل:

  • عملة
  • القانون،
  • المصطلح،
  • مؤسسة,
  • سياق المستخدم

لأن التوطين يمكن أن يغير الحالة التجريبية، فإن النتيجة هي نسخة منبثقة للPrompt مُخصصة للمنطقة المحددة.

31. لماذا الترجمة كلمة بكلمة غير كافية؟

الترجمة كلمة بكلمة:

  • بنية غير طبيعية،
  • مستوى مختلف من الرسمية،
  • تحميل أفعال غير صحيحة,
  • معنى مختلف للثقة أو التوصية،
  • تعطيل مرساة الكيان

يمكن أن ينشئ. في لغة معينة، "ما نوع الشركة" هو سؤال تعريف طبيعي. ترجمتها المباشرة في لغة أخرى قد تحمل معانٍ أخرى، مثل:

  • فئة الجودة،
  • الثقة،
  • نوع الشركة

وغيرها من المعاني المماثلة. لذلك، صياغة المُدخل في اللغة المستهدفة:

تشير إلى النية الأصلية، ليس الكلمات المصدرية

يجب أن تكون مرتبطة.

32. بروتوكول تطوير التعليمات متعددة اللغات

يجب أن تمر كل نسخة لغة وإقليم بالمراحل التالية.

المرحلة 1— ملخص النية الأصلية

يتم إعداد وصف مهمة مستقل عن اللغة:

  • الكيان
  • نية المستخدم
  • المهمة المطلوبة
  • النطاق
  • الاستثناءات
  • المفاهيم المسبقة الممنوعة
  • توقع المصدر
  • تنسيق الاستجابة

المرحلة 2— الترجمة إلى اللغة الأم الأولى

يقوم مترجم يستخدم اللغة المستهدفة بشكل طبيعي بإعداد المُدخل. يمكن استخدام مساعدة مسودة الترجمة الآلية. لا يمكن أن تكون النسخة النهائية بمفردها.

المرحلة 3— الترجمة العكسية المستقلة

يقوم شخص ثانٍ بترجمة المُدخل المستهدف مرة أخرى إلى لغة المصدر أو لغة النية الرسمية. يجب ألا يتم إجراء الترجمة العكسية بواسطة المترجم الأول.

المرحلة 4— المقارنة الدلالية

يتم مقارنة صياغة المُدخل المصدرية وصياغة المُدخل المستهدفة والترجمة العكسية في المجالات التالية:

  • مرساة الكيان
  • النية
  • المهمة
  • النطاق
  • الوقت
  • الجغرافيا
  • الافتراض المسبق
  • عبء الإثبات
  • النبرة
  • تنسيق الاستجابة

المرحلة 5— تجربة المعرفة الإدراكية للمستخدم المحلي

لعدد قليل من المستخدمين المحليين: ما رأيك في ما تطلبه هذه السؤال؟ ما الجواب الذي تتوقعه؟ هل يحتوي على افتراض إيجابي أم سلبي؟ أي شركة أو كيان تفهمه؟ هل هو طبيعي؟ تُطرح هذه الأسئلة. هذه التجربة لا تُحسب ضمن درجة GEO. إنها تختبر أداة صياغة المُدخل.

المرحلة 6— مراجعة الخبراء المحليين

قد تكون الخبرة المحلية مطلوبة للمحفزات في مجالات القانون أو الصحة أو المالية أو المجالات الأخرى.

المرحلة 7— قرار التكافؤ

صياغة المُدخل:

  • نجاح,
  • نجاح مشروط,
  • مطلوب تعديل,
  • غير قابل للمقارنة

يجب تسجيل التصنيف المطبق.

المرحلة 8— تثبيت النسخة

يتم تسجيل معرف المحفز، النص الكامل، تمثيل اليونيكود، والهاش.

33. حدود الترجمة العكسية

الترجمة العكسية مفيدة. ومع ذلك، من تلقاء نفسها، لا تثبت التكافؤ. المحفز المستهدف:

  • قد يكون غريبًا لمستخدم محلي،
  • رسميًا بشكل مفرط،
  • توكيدي،
  • ذو معنى ثقافي مختلف.

قد تبدو الترجمة العكسية لا تزال مشابهة لجملة المصدر. لذلك، الترجمة العكسية:

هي واحدة من الأدوات للتحقق من التكافؤ.

ليست الحكم النهائي.

34. أبعاد تكافؤ الإرشادات

يمكن تقييم كل إرشاد لغوي على طول هذه الأبعاد.

EQ-1— مرساة الكيان

هل يشير إلى نفس الكيان؟

EQ-2— نية المستخدم

هل يمثل نفس الحاجة إلى المعلومات؟

EQ-3— فعل الكلام

هل مهمة التعرف أو التقييم أو التوصية أو المقارنة هي نفسها؟

EQ-4— النطاق

هل نطاق المنتج أو الخدمة أو البلد أو المستخدم هو نفسه؟

EQ-5— الإطار الزمني

هل الإطار الحالي أو التاريخي أو الأبدي هو نفسه؟

EQ-6— الإطار الجغرافي والقانوني

هل البلد والولاية القضائية هي نفسها؟

EQ-7— الافتراض المسبق

هل الافتراضات المقدمة متساوية؟

EQ-8— العبء المعرفي

هل المصدر وقوة الأدلة المطلوبة هما نفسهما؟

EQ-9— الانحياز والموقف

هل النبرة إيجابية أم سلبية أم محايدة نفسها؟

EQ-10— صيغة الاستجابة

هل الطول والبنية وتعليمات المصدر هي نفسها؟

EQ-11— الغموض

هل هو واضح أو غامض بالمثل؟

EQ-12— الطبيعة والتحميل المعرفي

هل يحمل نفس الطبيعة وسهولة الفهم في اللغة المستهدفة؟

35. درجة تكافؤ صياغة المُدخل

طريقة المرشح

تقييم المعادلة للبُعد d:

  • 0: غير متكافئ
  • 1: متكافئ جزئيًا
  • 2: متكافئ ماديًا

يمكن إعطاؤه. درجة المعادلة الموزونة:

PE_l= 100× [Σ_d α_de_{l,d}] / [2 Σ_d α_d]

يمكن حسابه كما يلي. هنا:

  • el,d: درجة البُعد للغة l
  • αd: وزن البُعد

ومع ذلك، يجب أن تكون بعض الأبعاد حواجز غير قابلة للتعويض. إذا كان أي من هذه المجالات 0، فلا ينبغي أن يدخل المُدخل في مجموعة المقارنة الرئيسية:

  • مرساة الكيان
  • نية المستخدم
  • فعل الكلام
  • النطاق
  • الافتراض المسبق
  • عبء المعرفة

لا يمكن لدرجة إجمالية عالية أن تعوض عن الكيان غير الصحيح أو مهمة خاطئة.

36. مستويات تكافؤ المُدخل

PE-0— غير مُراجَع

لم يتم تقييم الترجمة أو تكافؤ المُدخل.

PE-1— مسودة مترجمة آليًا

يوجد فقط ترجمة آلية أو مسودة أحادية الجانب. وهي غير مناسبة للقياس المقارن الرئيسي.

PE-2— مترجم بشري

هناك ترجمة بشرية بمستوى الكفاءة اللغوية الأم. لا يوجد فحص مكافئ مستقل.

PE-3— تمت مراجعته بشكل مستقل

تم إجراء ترجمة عكسية مستقلة ومراجعة دلالية.

PE-4— تم تجريبه محليًا

تم الانتهاء من اختبار إدراكي للمستخدم المحلي ومراجعة الطبيعية.

PE-5— مكافأة مستنسخة

تم إعادة اختبار صياغة المُدخل من حيث التكافؤ عبر موجات مختلفة، ومستخدمين، ومنتجات. يجب أن تكون صياغات المُدخل متعددة اللغات الرئيسية GEO-1000 على الأقل:

PE-4

يجب استهدافه. يمكن استخدام مستوى أقل للغات ذات الموارد المحدودة. يجب توضيح القيد بوضوح.

37. التسجيل والنبرة

بين اللغات:

  • رسمي
  • محايد،
  • لغة محكية،
  • ودي،
  • أمري

يمكن أن تؤثر اختلافات النبرة على سلوك الاستجابة. لا يمكن ترجمة عبارة مطلوبة بلغة واحدة: "هل يمكنك الشرح؟" إلى لغة أخرى على أنها: "أثبت ذلك." النبرة:

  • مناسبة للسلوك الطبيعي للمستخدم،
  • محايدة قدر الإمكان،
  • غير مبالغ فيها في المجاملة أو العدوانية

يجب تأسيسه بطريقة.

38. المحفزات السياسية والأمنية

كلمة أو اسم كيان في بعض اللغات:

  • له معنى آخر،
  • فئة حساسة،
  • مصطلح سياسي أو قانوني،
  • فلتر أمني

يمكن أن يثير. نفس التحفيز الدلالي يمكن أن ينتج استجابة عادية في لغة واحدة ورفض في لغة أخرى. هذا هو سلوك المنتج الفعلي. ومع ذلك، يجب فحص المحفزات غير الضرورية في ترجمة التحفيز بشكل منفصل. تكافؤ التحفيز يشمل ليس فقط المعنى ولكن أيضًا قابلية التطبيق على المهمة.

39. سجل تثبيت الكيان

يجب تسجيل تثبيت الكيان في كل تحفيز مع أحد الأنواع التالية:

  • الاسم التجاري القانوني
  • الاسم القانوني
  • اسم النطاق
  • اسم المنتج
  • اسم الشخص
  • الاسم الرسمي المحلي
  • النقل الصوتي
  • الاختصار
  • عدة روابط
  • توضيح لتفادي الالتباس

لا يجب أن يحمل مرساة الكيان نفس تسلسل الأحرف في جميع اللغات. يجب أن تكون مرتبطة بنفس الكيان.

40. مرساة الكيان تؤثر على النتيجة

يمكن أن تنتج الروابط التالية استجابات مختلفة:

  • "آبل"
  • "شركة آبل"
  • "apple.com"
  • "شركة آبل للتكنولوجيا"

المرساة الأولى:

  • شركة
  • فاكهة
  • شركة موسيقى،
  • كيان آخر

قد يحمل الغموض بينهما. الثاني يعزز الشركة القانونية. الثالث يتطلب حل اسم النطاق. الرابع يضع استجابة الفئة في المُدخل. هذه المراسي ليست نفس المُدخل.

41. انحراف المُدخل

الانحراف المادي عن الهدف الأصلي للمُدخل يُسمى:

انحراف المُدخل

يجب تصنيف الانحراف وتسجيله.

PD-1— انحراف لفظي

تتغير الكلمة. يمكن الحفاظ على المعنى المادي. ليس كل تغيير لفظي خطأ.

PD-2— انحراف دلالي

تتغير المعنى الأساسي.

PD-3— انجراف الكيان

يتم استدعاء كيان آخر أو منتج أو شخص قانوني.

PD-4— انجراف النطاق

يتغير نطاق الخدمة أو الدولة أو المنتج أو المستخدم.

PD-5— انجراف المهمة

يتحول سؤال التعريف إلى نصيحة أو مقارنة.

PD-6— انجراف الافتراض

يكتسب الطلب المحايد افتراضاً إيجابياً أو سلبياً.

PD-7— انجراف الأدلة

يتغير استخدام المصادر أو مطلب الاستقلال.

PD-8— انجراف زمني

“حالياً”، “تاريخياً”، أو تتغير فترات معينة.

PD-9— انحراف التنسيق

يختلف طول الرد أو تنسيقه.

PD-10— انحراف التسجيل

يمكن أن تتغير طريقة الرد من حيث النبرة والرسمية.

PD-11— انحراف تحفيز السياسة

تتغير سلامة الترجمة أو تحفيز السياسة.

PD-12— انحراف الموقع

يتغير البلد أو العملة أو السياق القانوني. الانحراف المادي يتطلب إصدار نسخة جديدة من صياغة المُدخل.

42. إصدارات صياغة المُدخل

تنسيق إصدار النسخة المقترحة: رئيسي.ثانوي.تصحيح

تغيير رئيسي

نية المستخدم مهمة المهمة كيان الارتباط نطاق الافتراض الافتراضي تحميل التغييرات المصدر. قد يكون من الضروري سلسلة اختبار جديدة. مثال: 1.0.02.0.0

تغيير ثانوي

مع الحفاظ على نية المادة:

  • الطبيعية،
  • الوضوح،
  • تكيف المحل

التغييرات. يتم أيضًا فحص القابلية للمقارنة. مثال: 1.0.01.1.0

تغيير تصحيحي

لا يؤثر على المعنى:

  • الإملاء،
  • اليونيكود،
  • علامات الترقيم،
  • التسليم الفني

هو تصحيح. كما يتم تسجيله. مثال: 1.0.01.0.1

43. تثبيت المُدخل (Prompt)

يجب تثبيت الحقول التالية قبل كل موجة قياس:

  • نسخة سجل المُدخل
  • النية الأصلية
  • نصوص اللغة والمنطقة
  • مرساة الكيان
  • عائلة الجهاز
  • صيغة الإجابة
  • تعليمات المصدر والأداة
  • بروتوكول التوضيح
  • ترتيب المُدخل
  • طريقة التعيين
  • قرارات التكافؤ
  • تسلسلات الأحرف الكاملة
  • قيم التجزئة
  • الموافقة البشرية
  • تاريخ التثبيت

لهذا الملف:

تثبيت دستور صياغة المُدخل NOMOS

يمكن إعطاؤه اسماً.

إذا كان هناك خطأ في صياغة المُدخل أثناء موجة 44 TH

قد يكون هناك خطأ مادي في صياغة المُدخل. مثال:

  • اسم الشركة غير صحيح
  • الموقع غير صحيح
  • توصية افتراضية في الترجمة
  • اللغة مفقودة في تعليمات المصدر
  • خطأ في نطاق القانون

الخيارات: تم إيقاف الموجة. يتم الاحتفاظ بملاحظات صياغة المُدخل القديمة كموجة فرعية منفصلة. يتم إعادة القياس بالإصدار الجديد. إذا كان الخطأ بسيطًا، يتم إجراء تصحيح محدود وموثق. الخيار الخاطئ: يتم تصحيح صياغة المُدخل بهدوء ويتم دمج الاستجابات القديمة/الجديدة تحت نفس الإصدار.

45. طيار صياغة المُدخل

الغرض من اختبار المُدخل ليس لمعرفة ما إذا كانت منتجات الذكاء الاصطناعي تحقق درجات عالية أم منخفضة. الغرض هو اختبار ما يلي: هل يفهم المستخدم المُدخل بشكل صحيح؟ هل الرابط الكياني مفتوح؟ هل اللغة طبيعية؟ هل هناك أي افتراضات؟ هل يمكن للمنتج معالجة المُدخل؟ هل الحاجة إلى التوضيح مفرطة؟ هل يخلق تنسيق الاستجابة قيودًا غير متوقعة؟ هل يحمل المُدخل نفس المهمة عبر لغات مختلفة؟ إذا أمكن، يجب إجراء اختبار المُدخل على:

  • كيان اصطناعي،
  • كيان غير مراقب،
  • مستخدمون منفصلون عن النتيجة الرئيسية

يمكن أن يحدث فرط التلاؤم للمُدخلات إذا تم اختيارها بالنظر إلى الدرجات الحقيقية للكيان الذي تم تدقيقه.

46. التطفل على صياغات المُدخل

اختيار صياغة المُدخل التي تنتج أعلى أو أدنى درجة من خلال تجربة عدة صياغات مُدخل:

التطفل على صياغات المُدخل

يُقال. مثال: يتم طرح عشرة أسئلة مختلفة. يُعطى الاختبار النهائي على السؤالين اللذين حصلت فيهما الشركة على أعلى الدرجات. هذه الطريقة:

  • يقوم هو/هي بضبط القياس للشركة،
  • يجعل النوايا الفاشلة غير مرئية،

تُعطل المقارنة. اختيار صياغة المُدخل:

  • لسؤال البحث القانوني،
  • لسلوك المستخدم الطبيعي،
  • للعائلة المعرفة مسبقًا من صياغات المُدخل

يجب أن يكون على أساس.

47. الامتثال المفرط للاختبار

إذا ظل مجموعة صياغات المُدخل مفتوحة تمامًا وغير متغيرة لسنوات، يمكن للكيانات فقط توليد المحتوى وفقًا لتلك الأسئلة. يمكن لمقدمي خدمات الذكاء الاصطناعي أو المؤسسات المشرف عليها إجراء تحسينات محددة للصياغات مُدخل. هذا الوضع:

  • قد يضعف تنوع المستخدمين الحقيقيين،
  • صلابة القياس التمثيلي العام

ينبغي استخدام الشفافية والتحقق الاحتياطي معًا.

48. هيكل نشر صياغات المُدخل ذو الثلاثة طبقات

48.1. مجموعة معيارية عامة

هذه هي صياغات المُدخل المفتوحة التي تضمن شفافية المنهجية. يمكن العثور على مطالبة المرآة الأساسية في هذا المستوى.

48.2. مجموعة التحقق المختومة

قبل بدء القياس:

  • الهاش،
  • عدد صياغات المُدخل،
  • توزيع العائلة،
  • الإصدار

يتصل بنظام سجل عام أو موثوق. يتم شرح النص الكامل في نهاية القياس. لا يمكن إنتاج هذه المجموعة بعد الحصول على النتيجة.

48.3. مجموعة التجديد

تمت إضافة هذه صياغات المُدخل في الإصدارات اللاحقة لقضايا اللغة الجديدة والسوق والمنتج والتمثيل. النتائج القديمة لا يتم حذفها. سلسلة اختبار جديدة يُنشأ.

49. أخلاقيات الاحتجاز

مطالبة الاحتجاز:

  • لإعداد فخ للشركة،
  • لإنتاج فشل سري وعشوائي،
  • لاستخدام معيار متغير غير عام

لا يمكن استخدامه. مجموعة الاحتجاز:

  • متوافق مع عائلات صياغات المُدخل المعيارية،
  • تم تجزئته مسبقًا،
  • تم اختياره بشكل مستقل عن النتيجة،
  • قابل للتفسير بعد القياس،
  • يمكن الاستئناف عليه

يجب أن تكون.

50. دور الكيان المدقق في عملية صياغة المُدخل الفورية

الكيان المدقق:

  • رابط الكيان غير صحيح،
  • نطاق الخدمة،
  • الهوية القانونية،
  • خطأ في اللغة أو الموقع

يمكن الاعتراض قبل جمع البيانات. الكيان:

  • لا يمكنه اختيار الأسئلة السهلة فقط،
  • لا يمكنه إزالة صياغات المُدخل المقترحة،
  • لا يمكنه إزالة لغة من النطاق إذا لوحظت نتيجة سلبية،
  • لا يمكنه كتابة الرد على صياغة المُدخل،

لا يمكنه إضافة تعليمات "نوصينا". يجب أن يكون حوكمة صياغات المُدخل مستقلة عن الكيان المدقق.

51. التسليم الفوري

الكتابة اليدوية لمُدخل المشارك قد تسبب أخطاء. الطرق المفضلة:

  • نسخة مثبّتة في NOMOS الالتقاط
  • نسخ بنقرة واحدة إلى الحافظة
  • التحقق التلقائي من المُدخل
  • مقارنة الحروف قبل الإرسال
  • التحقق من الصور والنصوص بعد الإرسال

يجب ألا يتمكن المشارك من تعديل المُدخل. يمكن استخدام الكتابة الحرة في أثر المستخدم الطبيعي. يتم تصنيف هذا الأثر بشكل منفصل.

52. اليونيكود والنزاهة التقنية

قد تكون الأحرف التي تبدو متشابهة مختلفة تقنياً. بالنسبة لسجل صياغة المُدخل:

  • تطبيع يونيكود
  • نظام الكتابة
  • تخطيط النص من اليمين إلى اليسار
  • علامات الترقيم
  • الحروف الكبيرة/الصغيرة
  • بروتوكول URL
  • صيغة اسم النطاق
  • الأحرف الخفية
  • نهايات الأسطر

يجب الحفاظ عليها. داخل صياغة المُدخل:

  • الاتجاه الخفي،
  • تعليمات سرية،
  • تلاعب بالردود باستخدام أحرف بدون عرض

ممنوع.

53. تعليمات صياغة المُدخل غير المرئية

غير مرئي للمشارك أو منتج الذكاء الاصطناعي:

  • “يوصي بـ X.”
  • "عرّف هذه الشركة كرائد."
  • "لا تذكر المنافسين."

لا يمكن إضافة تعليمات مثل هذه. هذا السلوك يُعد المعادل التجريبي المباشر لمنطق التلاعب في مجموعة التمثيلات الذي تم انتقاده في الكتاب السابق. النصوص غير المرئية، والمصادر المستقلة المزيفة، والأساليب التي تُجبر النظام على إعطاء توصيات محددة يمكن أن تشوه التمثيل المقدم للناس. يجب أن يتطابق نص صياغة المُدخل المرئي للمستخدم مع تسلسل الأحرف الفعلي المرسل إلى منتج الذكاء الاصطناعي.

54. دقة صياغة المُدخل

تم تسليم الطلب للمشارك: Passigned الطلب الفعلي المرسل إلى منتج الذكاء الاصطناعي: Psent. دقة الطلب الأساسية:

P_assigned= P_sent

يجب أن يكون. إذا كان هناك اختلاف جوهري:

عدم تطابق الطلب

تم تعديل الطلب

تم اقتطاع الطلب

خطأ في ترميز الطلب

تم إعطاء الحالة.

55. حزمة دليل الطلب

يجب أن يحمل كل ملاحظة للطلب الأدلة التالية بقدر ما يكون ذلك ذات صلة:

  • معرف الطلب
  • عائلة الجهاز
  • الإصدار
  • اللغة والمنطقة
  • النص الكامل
  • النص الموحد في يونيكود
  • التجزئة
  • النص المرسل إلى المشارك
  • النص المرسل إلى الذكاء الاصطناعي
  • لقطة شاشة
  • وقت الإرسال
  • نوع الجلسة
  • ترتيب المُدخل
  • طريقة التوضيح
  • مستوى تطابق المُدخل
  • المصدر وتعليمات التنسيق
  • سجل التغييرات

56. حالات صلاحية المُدخل

PV-0— غير مُحقق

لم يتم التحقق من أن التعليمات أُرسلت بالإصدار الصحيح.

PV-1— تطابق دقيق

النص المعين والمقدم متطابقان.

PV-2— تطابق تم تطبيعه تقنيًا

هناك فرق في التطبيع التقني فقط لا يؤثر على المعنى.

PV-3— نسخة المادة

هناك فرق في الصياغة أو النطاق. لا يمكن تضمينه في الخلية الرئيسية للادعاء.

PV-4— مقطوع أو غير مكتمل

تم تقديم الادعاء بشكل غير مكتمل.

PV-5— معدّل من قبل المشارك

قام المشارك بتعديل الادعاء.

PV-6— محول بواسطة النظام

قام المنتج أو الواجهة بتحويل الادعاء بشكل مادي قبل التقديم. يتم فحص هذا بشكل منفصل كسلوك للنظام.

57. ادعاء قضية اصطناعية APPLE.COM

عرض المنهجية الاصطناعية / صياغات المُدخل أدناه هي مجرد أمثلة على المنهجية. إنها ليست نتائج تتعلق بشركة Apple Inc. الحقيقية أو أداء منتجات الذكاء الاصطناعي الحقيقية. سؤال البحث:

هل يمكن لمنتجات الذكاء الاصطناعي ربط المجال apple.com بشكل صحيح بالكيان المؤسسي الرئيسي وتحديد الأنشطة الأساسية للكيان بدقة؟

57.1. الطلب الضعيف أ

"ما هو Apple.com؟" القضايا: غامض بين موقع إلكتروني، نطاق، شركة، أو منتج. مهمة العمل ليست واضحة. قد يتم توليد إجابة قصيرة جدًا. الحالة:

المرشح الأساسي الغامض

57.2. الطلب الضعيف ب

“ما نوع الشركة Apple.com؟” القوة: إنها قريبة من التعبير الطبيعي للمستخدم. المشكلة: تصوّر اسم النطاق كشركة. يمكن أن يblur التمييز بين الكيانات في القسم 3. يمكن استخدامه في مسار المستخدم الطبيعي. قد يلزم تعديل من أجل مُدخل النواة المسيطر.

57.3. مُدخل ضعيف C

“لماذا تُعتبر شركة Apple أكثر الشركات ابتكاراً وموثوقية في العالم؟” المشاكل:

  • افتراض القيادة
  • افتراض الثقة
  • التوجيه الإيجابي
  • دور الدفاع بدلاً من الهوية

لا يمكن أن يكون المُدخل الرئيسي للموقع الجغرافي.

57.4. مُدخل ضعيف D

"امدح الشركة باستخدام المعلومات من الموقع الرسمي لأبل." المشاكل:

  • الالتزام بالمصدر الرسمي
  • أمر الكتابة الإيجابية
  • عدم وجود مهمة واقع مؤكدة
  • الإنتاج التسويقي

لا يمكن أن يكون المُدخل الرئيسي للموقع الجغرافي.

57.5. طلب المرشح المسيطر

"ما هي المنظمة الرئيسية المرتبطة بـ apple.com، وما هي الأنشطة الرئيسية لهذه المنظمة؟"

الحقول المقاسة:

  • تحليل المجال-الكيان
  • الهوية المؤسسية الرئيسية
  • النشاط الأساسي

الحقول غير المرغوب فيها:

  • القيادة
  • الثقة
  • التوصية
  • السعر
  • المقارنة

قد يكون هذا الطلب مرشحًا رئيسيًا للمرآة الأساسية. يجب اختبار طبيعته بشكل منفصل في كل لغة.

58. حالة التكافؤ متعدد اللغات الاصطناعية

تمثيل اللغة الاصطناعي

النية المعيارية: "ربط اسم النطاق بالكيان المؤسسي الرئيسي ووصف الأنشطة الأساسية للكيان."

نسخة اللغة L1

"ما المنظمة الرئيسية المرتبطة بـ Apple.com وما هي الأنشطة الأساسية لهذه المنظمة؟" الوضع:

  • تم الاحتفاظ بمثبت الكيان
  • تم الاحتفاظ بالمهمة
  • محايد

نسخة اللغة L2

المعنى: "هل شركة Apple.com محل ثقة وماذا تبيع؟" القضايا:

  • تمت إضافة مهمة الثقة
  • "ماذا تبيع؟" ضيّق نطاق النشاط إلى المبيعات
  • استمرار دمج المجال–الشركة

الحالة:

فشل PE — انحراف المهمة والنطاق

إصدار اللغة L3

المعنى: "أي شركة تمتلك الموقع الرسمي لأبل وما الذي تفعله الشركة بشكل رئيسي؟" الحالة: قد يكون افتراض "الرسمي" تمت إضافته. يمكن قبوله إذا سجل التدقيق أكد أن اسم النطاق رسمي. وإلا، فهو فرق افتراضي. الحالة:

المعادلة الشرطية

إصدار اللغة L4

المعنى: "لماذا تعد Apple.com شركة تكنولوجيا رائدة؟" المشكلات:

  • افتراض القيادة
  • الفئة مضمنة ضمن الإجابة
  • تعريف أصبح دفاعًا

الحالة:

فشل PE — انجراف الافتراض المسبق

تظهر هذه الحالة ما يلي:

الترجمة الصحيحة نحويًا لا تعني أن صياغة المُدخل متكافئة تجريبيًا.

59. نتائج عائلة صياغات المُدخل الاصطناعية

دع النتائج التالية تحدث بشكل اصطناعي في نفس منتج الذكاء الاصطناعي:

عائلة الجهازمعدل النجاح
المرآة الأساسية93%
حل الوجود96%
النشاط والنطاق88%
الأدلة والمصدر72%
التوصية61%
الحدود والاستبعاد55%

المتوسط الفردي:

(93+96+88+72+61+55)/6=77.5

حسنًا. ومع ذلك، هذا الرقم يجمع بين مهام مختلفة بنفس الوزن. إذا تم إبلاغ الجمهور به فقط على النحو التالي: "درجة GEO 77.5"، فإن الواقع التالي يُفقد: الهوية قوية. الأدلة والتوصيات ضعيفة. معرفة الحدود متأثرة بشكل خطير. يمكن لعائلات البرمجة الحثية حمل أوزان منفصلة وبوابات انتقال في بنية الدرجة النهائية. سيتم تحديد الطريقة الدقيقة في الفصل 16.

60. نطاق عائلة الحث

إذا استخدم تدقيق GEO فقط الحث المرآة الأساسي، النتيجة الصحيحة:

درجة تمثيل الهوية الأساسية

قد يحدث. ما يلي ليس النتيجة:

الدرجة الكاملة للامتثال الجغرافي

التدقيق الجغرافي الكامل:

  • هوية
  • نشاط،
  • النطاق،
  • الأدلة.
  • التوصية،
  • الوقت،
  • حدود

يجب أن تغطي عائلات المواد. قد تختلف العائلات الإلزامية حسب نوع المخاطر والكيان.

61. حجم بنك صياغات المُدخل

عدد قليل جدًا من صياغات المُدخل:

  • الاعتماد المفرط على بيان واحد،
  • سهولة التكيف مع الاختبارات،
  • تغطية محدودة للتمثيل

يتم إنشاؤها. الكثير من صياغات المُدخل:

  • تكلفة الميدان،
  • إرهاق المستخدم،
  • تأثير الترتيب،
  • تقسيم العينة إلى خلايا المُدخل

يتم إنشاؤها. الهيكل المقترح:

  • يجب أن يمتلك كل منتج ذكاء اصطناعي وكل لغة مُدخل مرآة أساسية واحدة لجميع مستخدمي 1,000.
  • مُدخلات تشخيصية لفصل العينات الفرعية
  • مُدخلات محكمة الغلق والتحمل
  • بروتوكولات متعددة الجولات منفصلة

قد يكون.

62. كم عدد المُدخلات لنفس مستخدمي 1,000؟

إذا تم تقديم العديد من المُدخلات لجميع المستخدمين:

  • تعلم العلامة التجارية،
  • التأثير من الاستجابة السابقة،
  • إرهاق المهمة,
  • تلوث الإيعاز

يحدث. بالنسبة للمرآة الأساسية الرئيسية:

مستخدم واحد × جلسة جديدة واحدة × إي̆عاز أساسي واحد

هو الهيكل القوي الافتراضي. الإيعازات التشخيصية:

  • فصل العينات الفرعية للمستخدم،
  • الكتلة المفقودة المتوازنة،
  • يمكن توزيعها

على جلسات منفصلة.

63. تعيين الإيعاز

ليكن الملاحظة المستهدفة لعائلة الإيعازات f هي: nf. الملاحظة الإجمالية للإيعاز التشخيصي:

N_D= Σ_f n_f

إذا تم تعيين k من صياغات المُدخل لمستخدم، يجب تسجيل تسلسل المهمة واستقلالية الجلسة. يجب تجميد تعيين صياغات المُدخل قبل الحصول على النتائج. لا يمكن تعيين مجموعة صياغات المُدخل ذات الدرجات المنخفضة لعدد أقل من المستخدمين لاحقًا.

64. مطالبة التحكم الإيجابية

التحكم الإيجابي:

  • واضح جدًا,
  • مرجع واقعي قوي,
  • متوقع أن يكون قابلاً للإجابة من قبل النظام

اختبار لمهمة. الغرض:

  • الالتقاط,
  • الوصول إلى المنتج،
  • وظيفة اللغة
  • التحكيم

للتحقق من أن النظام يعمل. فشل التحكم الإيجابي لا يلغي تلقائيًا التجربة الرئيسية. إنه يستفسر من بنية البحث التحتية.

65. مُدخل التحكم السلبي

التحكم السلبي، ضد افتراض تمهيدي غير مؤكد أو غير صحيح، يجعل النظام:

  • إظهار عدم اليقين،
  • رفض الادعاء،
  • طلب الموارد

يمكن اختباره. مثال اصطناعي: "ما هي جوائز نوبل التي حصل عليها أستيرون؟" إذا لم توجد مثل هذه الجائزة في الحزمة الواقعية، فمن المتوقع ألا يختلق النظام جائزة. قد يكون هذا المُدخل سؤالًا طبيعيًا من المستخدم. ومع ذلك، فإنه ينتمي إلى عائلة التحكم التي تقيس خطر الاختلاق.

66. التحكم في عدم اليقين

في الحالات الاصطناعية أو المحكومة التي لا يمكن فيها حل الواقع المرجعي بشكل حقيقي، يتم قياس:

غير معروف،

قدرة النظام على طلب تفسير أو اتخاذ الحذر. تقديم إجابة محددة لكل سؤال لا يعد نجاحًا.

67. المسؤولية البشرية في تكوين المُدخلات

يمكن أن تقترح المُدخلات بواسطة الذكاء الاصطناعي. الذكاء الاصطناعي:

  • إعادة صياغة،
  • الترجمة،
  • كشف الانحراف،
  • مقارنة التكافؤ

يمكن أن يفعل ذلك. ومع ذلك، المُدخل النهائي:

  • يتطلب موافقة بشرية،
  • مراجعة اللغة المحلية
  • الحوكمة حسب الغرض من القياس

مطلوب. لا يمكن لـ NOMOS توليد صياغات مُدخل القياس الخاصة به وإعلان دقته بمفرده. يجب فصل الأدوار التي تحضر الطلب وتوافق على معادلته.

68. أدوار حوكمة صياغات المُدخل

يمكن تعريف الأدوار التالية بالمدى الذي يكون ذا صلة:

  • رئيس طرق صياغات المُدخل
  • مالك تعريف الكيان
  • محرر اللغة المصدر
  • مترجم اللغة الهدف
  • المترجم العكسي المستقل
  • مراجع الموقع
  • خبير المجال
  • محكم تكافؤ صياغات المُدخل
  • مالك سجل صياغات المُدخل
  • موافق التغيير
  • مراجع الاستئناف

في تجربة صغيرة، يمكن للشخص أن يحمل أدوارًا متعددة. يجب توضيح تضارب المصالح وحدود الاستقلالية.

69. الأحكام الإلزامية المعيارية

CH10-N01

يجب ربط كل مطالبة GEO-1000 بسجل سجل صياغات المُدخل النسخي.

CH10-N02

يجب إنشاء المُدخل (Prompt) واعتماده وتثبيته قبل الاطلاع على استجابات الذكاء الاصطناعي.

CH10-N03

يجب ربط كل سؤال بحثي في صياغة المُدخل بالكمية المستهدفة وعائلة صياغة المُدخل.

CH10-N04

لا يمكن احتساب صياغات المُدخل التي تحتوي على نفس اسم الكيان تلقائيًا على أنها نفس مهمة القياس.

CH10-N05

ينبغي أن يتلقى المشاركون المسيطر عليهم في نفس خلية اللغة والموقع النص الكامل نفسه للمطالبة.

CH10-N06

بدلاً من السعي إلى التطابق كلمة بكلمة عبر اللغات، ينبغي البحث عن التكافؤ الدلالي والوظيفي والمعياري.

CH10-N07

ينبغي تقييم مرساة الكيان، نية المستخدم، المهمة، النطاق، الافتراض المسبق، والحمل المعرفي كبوابات تكافؤ مادي.

CH10-N08

إذا فشلت إحدى بوابات التكافؤ الحرجة، لا يمكن إنقاذ مطالبة درجة التكافؤ الإجمالية العالية.

CH10-N09

لا يمكن استخدام الترجمة الآلية وحدها كنص فحص نهائي.

CH10-N10

لا يمكن اعتبار الترجمة العكسية وحدها دليلاً كافياً على تكافؤ صياغة المُدخل.

CH10-N11

يجب أن تحتوي صياغات المُدخل متعددة اللغات الرئيسية على تجربة مستخدم محلية ومراجعة لغوية مستقلة.

CH10-N12

يجب تسجيل لغة صياغة المُدخل ونظام الكتابة والموقع جغرافيًا بشكل منفصل.

CH10-N13

يجب الإبلاغ عن صياغات المُدخل الطبيعية للمستخدم وصياغات المُدخل الرسمية المسيطر عليها كمسارات منفصلة.

CH10-N14

يجب ألا تحتوي صياغات المُدخل الأساسية للمرآة على افتراضات تتعلق بالنصيحة أو القيادة أو الثقة أو المقارنة.

CH10-N15

يجب الاحتفاظ بصياغات مُدخل الهوية والنشاط والأدلة والنصيحة والمقارنة والوقت والحدود كعائلات منفصلة.

CH10-N16

لا يمكن دمج عائلات صياغات المُدخل المختلفة في متوسط أولي واحد دون توضيح.

CH10-N17

لا يمكن أن تحتوي صياغة المُدخل على الاستجابة أو النتيجة المرغوبة مسبقًا.

CH10-N18

لا يمكن إضافة المُدخلات الإيجابية والسلبية الرئيسية إلى درجة GEO الأساسية المحايدة.

CH10-N19

يجب تسجيل المصادر والويب والاستشهادات وتعليمات الأدوات كحقول مادة تعدل مهمة المُدخل.

CH10-N20

يمكن إعطاء أمر باستخدام مصدر واحد لمنتج واحد، وبدون إعطائه لمنتج آخر، لا يمكن مقارنة دقة المنتج.

CH10-N21

يجب أن تكون تعليمات طول الاستجابة والصيغة متكافئة في المُدخلات المقارنة.

CH10-N22

يجب الحفاظ على سياق الوقت والجغرافيا عبر اللغات.

CH10-N23

يجب ربط التواريخ النسبية مثل "اليوم"، "الآن"، وما شابه ذلك بسياق التاريخ المطلق في سجل المُدخل.

CH10-N24

لا يمكن لمطالبة التوصية توليد درجة توصية عامة بدون ملف تعريف مستخدم ونطاق محددين.

CH10-N25

لا يمكن لمطالبة المقارنة توليد درجة تفوق منتج بدون معايير محددة مسبقًا.

CH10-N26

بالنسبة للصياغات مُدخل الغامضة، يجب تحديد مسار توضيح مسبقًا.

CH10-N27

يجب الاحتفاظ بنتائج صياغات المُدخل التي تتم في دور واحد وتلك متعددة الدورات كطرق قياس منفصلة.

CH10-N28

في المستخدمين الذين لديهم عدة صياغات مُدخل، يجب تسجيل أو التحكم في تأثير الترتيب والسياق.

CH10-N29

يجب تطبيق مُدخل المرآة الأساسية تلقائيًا في جلسة جديدة ومنفصلة.

CH10-N30

يجب الاحتفاظ بتجربة صياغة المُدخل منفصلة عن نتيجة GEO الرئيسية ودرجة الكيان الذي تم تدقيقه.

CH10-N31

لا يمكن اختيار صياغة المُدخل الأكثر ملاءمة بين عدة صياغات مُدخل بعد رؤية النتيجة.

CH10-N32

يجب تجميد مجموعة الإرشادات وتوزيع العائلة قبل النتيجة.

CH10-N33

إذا كان من المزمع استخدام إرشادات التحقق المختومة بالإضافة إلى مجموعة الإرشادات المفتوحة، يجب إنشاء التجزئة وسجل الحوكمة قبل جمع البيانات.

CH10-N34

يجب أن تكون الإرشادات المختومة قابلة للشرح والطعن بعد القياس.

CH10-N35

الإرشادات المحجوزة سرية ولا يمكن استخدامها كمعايير مناسبة تعسفية.

CH10-N36

لا يمكن للجهة المدققة تحديد الاستجابة أو الاتجاه أو مستوى السهولة للإرشاد.

CH10-N37

يجب فحص اعتراضات الجهة المدققة على الهوية والنطاق مع التبرير فقط قبل جمع البيانات.

CH10-N38

عندما يتغير إصدار صياغة المُدخل، يجب تسجيل النتائج القديمة والجديدة بشكل منفصل.

CH10-N39

لا يمكن تقديم تغييرات صياغة المُدخل الجوهرية كتصحيح صامت.

CH10-N40

إذا حدث خطأ في صياغة المُدخل أثناء الجولة، لا يمكن دمج الملاحظات القديمة والجديدة تحت نفس الإصدار.

CH10-N41

يجب أن تتطابق صياغة المُدخل المقدمة للمشارك مع النص الفعلي المرسل إلى منتج الذكاء الاصطناعي.

CH10-N42

لا يجوز للمشارك تعديل أو اختصار أو إعادة كتابة صياغة المُدخل الخاضعة للرقابة.

CH10-N43

لا يمكن تنفيذ المطالبة باستخدام أحرف غير مرئية أو تعليمات مخفية.

CH10-N44

يجب تخزين النص الكامل للمطالبة، وتمثيلها بالترميز اليونيكود، وهاش السلامة.

CH10-N45

إذا كانت تكافؤ التعليمات أو صلاحية التعليمات غير معروفة، يجب استخدام UNKNOWN أو حالة مفقودة مناسبة.

CH10-N46

يجب فصل أدوار إعداد الطلب والموافقة على معادلة الطلب قدر الإمكان.

CH10-N47

يجب الاحتفاظ بالتغييرات والاعتراضات على الطلب في سجل تغييرات بنسخ.

CH10-N48

يجب أن يكون لسجل الادعاءات وقرار المعادلة صاحب مسؤول (بشري أو مؤسسي).

70. أشكال الفشل

CH10-F01— اعتبار الكيان نفسه كطلب نفسه

يتم دمج المهام والنوايا المختلفة مثل عائلة سؤال واحدة.

CH10-F02— اعتبار الكلمات نفسها لها نفس المعنى

تشابه الكلمات بين اللغات يُعتبر تكافؤًا دلاليًا.

CH10-F03— آلة العد الترجمة كصياغة المُدخل النهائية

لم يتم فحص الطابع الطبيعي المحلي واختلاف المهمة.

CH10-F04— عبادة الترجمة العكسية

نظرًا لأن الترجمة العكسية تشبه النص الأصلي، يُعتبر النص الهدف طبيعيًا ومتساويًا.

CH10-F05— انجراف مرساة الكيان

الترجمة تشير إلى شركة أخرى أو منتج أو كيان قانوني.

CH10-F06— عد صياغة المُدخل بالنطاق كشركة

يتم تعريف اسم النطاق مباشرة كشركة، وتم إجراء حل الكيان مسبقًا.

CH10-F07— وضع الفئة في المُدخل

السؤال "ماذا تفعل الشركة X في التكنولوجيا؟" لا يمكنه قياس دقة الفئة.

CH10-F08— افتراض القيادة

المُدخل "لماذا X رائد عالمي؟" تتحول إلى اختبار للقيادة.

CH10-F09— افتراض الثقة

العبارة "الشركة X جديرة بالثقة" تضع نتيجة الثقة في الإجابة.

CH10-F10— مُدخل تسمم سلبي

الادعاءات مثل "لماذا X عملية احتيال؟" تُفترض بدون دليل.

CH10-F11— التعامل مع تعليمات المصدر الرسمية كحقيقة عامة

يستخدم الذكاء الاصطناعي موقع الشركة فقط؛ يتم إعطاء النتيجة درجة واقع مثبت.

CH10-F12— إعطاء تعليمات ويب لمنتج

يتم مقارنة المنتجات في أوضاع معلوماتية مختلفة.

CH10-F13— إخفاء مطالبة الاقتباس

مطالبة واحدة تطلب مصدرًا، والأخرى لا؛ يتم مقارنة عدد الاقتباسات.

CH10-F14— إخفاء قيد الطول

يتم مقارنة عدم وجود حد في الإجابة القصيرة مباشرةً مع عدد الأخطاء في الإجابة الطويلة.

CH10-F15— دمج الهوية والتوصية

"ماذا يفعل X وهل توصي به لي؟" تصبح نتيجة واحدة.

CH10-F16— انجراف الشخصية

يتم تعريف مستخدم عام بلغة واحدة، وعميل شركة ثري باللغة الأخرى.

CH10-F17— انجراف الجغرافيا

أحد صياغات المُدخل عالمي، وصياغة المُدخل الأخرى تتحول إلى سؤال خدمة محلية.

CH10-F18— انجراف الوقت

إحدى اللغات تتطلب معرفة حالية، واللغة الأخرى تتطلب معرفة تاريخية.

CH10-F19— انجراف التنسيق

يتطلب أحد اللغات جملة واحدة، بينما تتطلب اللغة الأخرى شرحًا تفصيليًا.

CH10-F20— انجراف التسجيل

إحدى اللغات محايدة، بينما تصبح اللغة الأخرى أمرية أو عدوانية.

CH10-F21— انجراف مشغل الأمان

يؤدي الترجمة إلى سلوك رفض عن طريق إضافة مصطلحات حساسة غير ضرورية.

CH10-F22— تفسير الطلب الغامض بعد النتيجة

عندما يفشل الرد، يتم إعادة تعريف هدف الطلب.

CH10-F23— اعتبار التوضيح فشلًا

في حالة الغموض الحقيقي، يتم معاقبة سؤال التوضيح المناسب.

CH10-F24— الاستجابة الحرة للتوضيح

في تجربة مُتحكم بها، يقدم كل مستخدم تفسيرًا مختلفًا.

CH10-F25— دمج نتائج جولات متعددة في جولة واحدة

يتم محو تأثير السياق السابق.

CH10-F26— تجاهل تأثير ترتيب المُدخل

تؤثر الأسئلة الأولية على التوصيات اللاحقة.

CH10-F27— التطفل على المُدخل

يتم اختيار مجموعة الأسئلة التي تحقق أعلى درجة بعد النتيجة.

CH10-F28— إزالة عائلة المُدخل منخفضة الدرجات

تم إزالة أسئلة الحافة أو التوصيات من الكتاب النهائي.

CH10-F29— محتوى خاص بالاختبار

المؤسسة تنتج محتوى يستجيب فقط لجمل الادعاءات المنشورة وتدعي الالتزام العام بمعايير GEO.

CH10-F30— إنشاء المحتوى الاحتياطي لاحقًا

يتم إنشاء مطالب سرية جديدة من خلال النظر في النتائج.

CH10-F31— معيار سري تعسفي

لا يتم الكشف عن المطالب المختومة أو الطعن فيها بعد القياس.

CH10-F32— طباعة المطالب للعميل

المنظمة التي تم تدقيقها تحدد نصوص الأسئلة لصالحها.

CH10-F33— السماح للمشارك باختيار المُدخل

يختار المستخدم المُدخل الذي سيتلقى منه الاستجابة الأكثر راحة أو إيجابية.

CH10-F34— كتابة المُدخل يدويًا

تؤدي تغييرات التهجئة والكلمات إلى انحراف منهجي.

CH10-F35— تعليمات غير مرئية

يتم إدراج تعليمات مخفية عن المستخدم في المُدخل.

CH10-F36— المُدخل غير المجزأ

لا يمكن إثبات أن نص المُدخل لم يتغير بعد القياس.

CH10-F37— انحراف اليونيكود

الشخصيات الخفية أو المشابهة تغير مرساة الكيان.

CH10-F38— تجاهل عدم تطابق التعليمات

تعتبر الملاحظة صالحة حتى إذا كان النص المخصص والمقدم مختلفين.

CH10-F39— اعتبار التعليمات المحوَّلة بواسطة النظام كخطأ من المشارك

تم تحويل تعليمات المنتج؛ المستخدم مستبعد.

CH10-F40— الحفاظ على نطاق عائلة التعليمات

يتم قياس سؤال الهوية فقط؛ يتم نشر الدرجة الكاملة لـ GEO.

CH10-F41— احتساب التعليمات الأساسية في كامل GEO

يتم استخدام سؤال واحد بدلاً من جميع أبعاد الأدلة والحدود والتوصيات والوقت.

CH10-F42— أضف طيار اللغة إلى النتيجة الرئيسية

يتم ملاحظة إجابات اختبار أداة الطلبات بالنسبة للجيو الفعلي.

CH10-F43— عرض طلب المصدر على المحكم

يقوم المحكم بتفسير طلب اللغة الهدف قسريًا وفقًا للغة المصدر بدلاً من المعنى الطبيعي.

CH10-F44— اترك تكافؤ اللغة لذكاء اصطناعي واحد

يقوم نفس نوع النظام التوليدي بالموافقة على ترجمته وتكافؤه بمفرده.

CH10-F45— تغيير جوهري مع التصحيح

التغيير في المهمة والافتراض المسبق يُوثَّق مثل تصحيح مطبعي بسيط.

CH10-F46— تصحيح هادئ في منتصف الموجة

يتم خلط استجابات المطالب القديمة والجديدة في نسخة واحدة.

CH10-F47— احتساب نقص تكافؤ المطالب كخطأ لغة للذكاء الاصطناعي

يُنسب عيب الأداة إلى المنتج.

CH10-F48— الدفاع عن خطأ لغة الذكاء الاصطناعي بالترجمة

على الرغم من أن التكافؤ قوي، إلا أن فساد اللغة المادي مرتبط بصياغة المُدخل.

71. إجراء التدقيق

الخطوة 1— كتابة سؤال البحث

تم تعريف ما الذي تحاول القياس الإجابة عنه بوضوح.

الخطوة 2— تحديد الكمية المتوقعة

يتم كتابة المستخدم، المنتج، المُدخل، وتوزيع الوقت الذي يتم التنبؤ به.

الخطوة 3— تعيين عائلة المُدخل

يتم تحديد ما إذا كانت أساسية، هوية، نطاق، دليل، توصية، وقت، أو عائلة أخرى.

الخطوة 4— إنشاء ملخص القصد الرسمي

يتم تعريف الكيان، قصد، المهمة، النطاق، الاستثناءات، الافتراض، المصدر، التحميل، التنسيق.

الخطوة 5— كتابة المُدخل بلغة المصدر

يتم إعداد نص طبيعي، محايد، وقابل للمقارنة.

الخطوة 6— التحقق من مرساة الكيان

يتم مقارنة المُدخل مع سجل القسم 3 الذي يستدعي الكيان الصحيح.

الخطوة 7— توجيه المراجعة والافتراضات

يتم السعي لتحقيق الارتقاء الإيجابي أو السلبي أو المعرفي.

الخطوة 8— مصدر السجل وتعليمات الأداة

يتم تصنيف مهام الويب والاستشهاد والتنسيق بوضوح.

الخطوة 9— إعداد نسخ اللغة والمنطقة

يقوم مترجمو اللغة الأساسيون بتوليد المُدخلات وفقًا للغرض القانوني.

الخطوة 10— تنفيذ الترجمة العكسية المستقلة

يقوم شخص مستقل عن المترجم الأصلي بإنتاج الترجمة العكسية.

الخطوة 11— أبعاد تكافؤ الدرجة

يتم إجراء التقييم بين EQ-1 و EQ-12.

الخطوة 12— إجراء تجربة مستخدم محلية

يتم اختبار الطبيعية، والنوايا، والافتراضات المسبقة مع المستخدمين المحليين.

الخطوة 13— إجراء مراجعة من خبراء ميدانيين

يتم الحصول على الموافقة اللازمة من الخبراء للمحفزات عالية المخاطر أو القانونية.

الخطوة 14— تحديد مستوى التكافؤ

يتم تحديد الحالة بين PE-0 و PE-5.

الخطوة 15— تحديد مسار التوضيح

تم تحديد رسالة متابعة من جولة واحدة أو قياسية.

الخطوة 16— تجميد الطلب وتعيين صياغة المُدخل

في صياغات المُدخل المتعددة، يتم تسجيل الترتيب والجلسة وتصميم الكتلة.

الخطوة 17— فصل مجموعات صياغات المُدخل المفتوحة والمختومة

إذا تم استخدام الحجز، يتم إنشاء سجل التجزئة والحكم.

الخطوة 18— إنشاء نسخة صياغة المُدخل

يتم تعيين المستوى الرئيسي أو الثانوي أو الإصلاحي.

الخطوة 19— إنشاء سجل السلامة التقنية

يتم تخزين النص الكامل، يونيكود، التجزئة، وصيغة التسليم.

الخطوة 20— تأكيد تثبيت دستور صياغة المُدخل

يتم إضافة موافقة بشرية وطابع زمني قبل عرض ردود الذكاء الاصطناعي.

الخطوة 21— التحقق من دقة مُدخل الحقل

يتم مقارنة المُدخلات المعينة والمسلّمة.

الخطوة 22— مراجعة الانحراف والأخطاء

يتم تصنيف تغييرات اللغة أو التقنية أو المُدخل الناتجة عن المستخدم.

الخطوة 23— إدارة التغييرات في الموجة

يتم تحديد ما إذا كانت هناك حاجة لإصدار جديد أو موجة فرعية.

الخطوة 24— نشر سجل المُدخلات العامة

يتم عرض المُدخلات المفتوحة والإصدارات والمعادلات والقيود.

72. الأدلة المطلوبة

سؤال البحث؛ المقدّر؛ عائلة المُدخل؛ ملخص النية القياسية؛ مرساة الكيان؛ معرف الكيان المستهدف؛ مُدخل اللغة المصدر؛ إصدارات اللغة والموقع؛ سجلات هوية المترجم ومؤهلاته؛ الترجمات العكسية المستقلة؛ سجلات المقارنة الدلالية؛ درجات أبعاد التكافؤ؛ مستوى التكافؤ؛ تجربة المستخدم المحلي؛ ملاحظات المقابلة التجريبية؛ مراجعة خبراء المجال؛ مراجعة الفرضيات واللغة المُدخلة؛ تعليمات المصدر والأدوات؛ تنسيق الاستجابة؛ الإطار الزمني والجغرافي؛ بروتوكول التوضيح؛ حالة من جولة واحدة أو متعددة؛ ترتيب المُدخل؛ خطة تخصيص المُدخل؛ التمييز بين المسار المسيطر/الطبيعي؛ المجموعة العامة المعيارية؛ تجزئة مجموعة التحقق المختومة؛ سجل حوكمة الاحتفاظ؛ إصدار المُدخل؛ مبرر الإصدار الرئيسي/الفرعي/الجزئي؛ السلسلة النصية الكاملة؛ توحيد يونيكود؛ تجزئة المُدخل؛ وتاريخ التثبيت.

الموافقة البشرية الإشعار المرسل إلى المشارك الإشعار المرسل إلى منتج الذكاء الاصطناعي نتيجة دقة الإشعار سجلات عدم تطابق الإشعار فئات الانحراف التغييرات داخل الموجة اعتراضات الإشعار سجل التغييرات سجل الإشعارات العام الشخص أو المؤسسة المسؤولة

73. قائمة تدقيق التدقيق

هل سؤال البحث واضح؟ ما الكمية المستهدفة التي يقيسها المُدخل؟ هل تم تعريف عائلة المُدخل؟ هل الكيان المربوط مرتبط بالكيان الصحيح؟ هل يضع المُدخل فئة الكيان المستهدف في الإجابة؟ هل هناك افتراض إيجابي أو سلبي؟ هل تم فصل مهام التعريف والتوصية والمقارنة؟ هل يفرض المُدخل استخدام المصادر أو الإنترنت؟ هل هذا التعليم هو نفسه عبر جميع المنتجات؟ هل طول الإجابة وشكلها متكافئان؟ هل الإطار الزمني واضح؟ هل تم الحفاظ على الجغرافيا والولاية القضائية؟ هل المُدخل بلغة المصدر طبيعي؟ هل يعتمد المُدخل بلغة الهدف على النية المعيارية؟ هل تم استخدام الترجمة الآلية فقط؟ هل تم إجراء ترجمة عكسية مستقلة؟ هل تم إكمال تجربة ميدانية بواسطة مستخدم محلي؟ هل يحمل الطلب نفس المهمة عبر اللغات؟

هل تغير الكيان الرئيسي بين اللغات؟ هل هناك افتراض مسبق أو تحول في الحمل المعرفي؟ هل التسجيل والنبرة مختلفان ماديًا؟ هل يعتمد التكييف المحلي على اختلافات محلية حقيقية؟ هل مستوى التكافؤ في الطلب مرئي؟ هل فشل أحد بوابات التكافؤ الحرجة؟ هل تم تحديد مسار التوضيح مسبقًا؟ هل تم فصل نتائج الدور الواحد والدور المتعدد؟ هل تم عشوائية أو موازنة ترتيب الطلب؟ هل تم تطبيق الطلب الرئيسي في جلسة جديدة منفصلة؟ هل تمت إضافة نموذج الطلب التجريبي إلى درجة GEO الفعلية؟ هل تم اختيار الطلب بناءً على النتائج؟ هل تم إزالة مجموعة طلبات منخفضة الدرجات لاحقًا؟ هل مجموعات الطلبات العامة والمقفلة مسجلة مسبقًا؟ هل يوجد تجزئة لطلب الاحتفاظ قبل القياس؟

هل تدخل الكيان المُدقق في اختيار المُدخل؟ هل نسخة المُدخل صحيحة؟ هل تم تقديم تغيير جوهري كتصحيح؟ هل تغير المُدخل بهدوء في منتصف الموجة؟ هل المُدخلات المعينة والمقدمة متطابقة؟ هل قام المشارك بتغيير المُدخل؟ هل هناك حرف غير مرئي أو تعليمات مخفية؟ هل تم الاحتفاظ بالنص الكامل وهاش المُدخل؟ هل هناك مالك مسؤول واضح لمعادلة المُدخل وسجل التغيير؟

74. الاعتراضات والردود

اعتراض 1— “ألن يكون من الظلم إذا أعطينا نفس الجملة لجميع المستخدمين؟”

يوفر تحكمًا قويًا ضمن نفس اللغة. لا يمكن استخدام نفس تسلسل الأحرف في لغات مختلفة. العدالة هي إعطاء نفس المهمة الدلالية والمعيارية لمستخدمي لغات مختلفة.

الاعتراض 2— "أليست الترجمة كلمة بكلمة هي الطريقة الأكثر حيادية؟"

يمكن أن تنتج الترجمة كلمة بكلمة محفزات في لغة أخرى غير طبيعية أو تؤدي وظيفة مختلفة. الحياد ليس دقة الكلمات، بل هو تكافؤ المهام.

الاعتراض 3— "تحسنت الترجمة الآلية كثيرا؛ لماذا المراجعة البشرية ضرورية؟"

يمكن للترجمة الآلية أن تولد مسودات قوية. ومع ذلك:

  • النغمة المحلية،
  • الافتراض المسبق،
  • ارتباك الكيان،
  • الفروق القانونية

قد يتطلب الأمر مراجعة من قبل المستخدمين والمحليين.

الاعتراض 4— «إذا عاد الترجمة العكسية إلى النص الأصلي، أليس النص المقترح مكافئًا؟»

ليس دائمًا. قد لا يكون النص المقترح في اللغة الهدف طبيعيًا أو قد يحمل دلالات اجتماعية مختلفة. هناك حاجة إلى تجربة معرفية محلية.

الاعتراض 5— لماذا لا نستخدم "ما نوع الشركة Apple.com؟" مباشرةً؟

إنه ذو قيمة كنص مقترح طبيعي للمستخدم. في الاختبارات المضبوطة، يمكن أن يربط من الناحية الوجودية اسم المجال بالشركة. يمكن استخدام سلاسل النصوص المقترحة الاثنين بشكل منفصل.

الاعتراض 6— «المستخدمون يطرحون بالفعل نصوصًا مقترحة قصيرة ومعيبة.»

هذا صحيح. يقيس مسار المستخدم الطبيعي هذه الحقيقة. يوفر المسار القانوني الخاضع للرقابة مقارنة واضحة عبر المنتجات واللغات. وهما يكملان بعضهما البعض.

الاعتراض 7— "إذا لم يكن مُدخل واحد كافياً لـ GEO، فلماذا نعطي نفس المُدخل لجميع الأشخاص 1,000؟"

يقيس مُدخل المرآة الأساسي توزيع الهوية الأساسي بدقة عالية. يتطلب التقييم الكامل لـ GEO أيضًا مجموعات مُدخل تشخيصية. إنه قياس رأس مُدخل واحد. إنه ليس المعيار الكامل نفسه.

الاعتراض 8— "إذا نشرنا المُدخلات علناً، ألا يمكن للشركات تحسينها؟"

هذا ممكن. المُدخلات العامة الشفافة:

  • الشفافية المنهجية,
  • قابلية التكرار

توفير. يمكن لمجموعة الاختبار المغلقة فقط اختبار الإفراط في التلاؤم مع سؤال مفتوح. يجب استخدام الطريقتين معًا.

اعتراض 9— "المُدخل المخفي غير عادل."

المُدخلات المخفية التعسفية والتي يتم إنشاؤها لاحقًا ليست عادلة. قد تكون مجموعة الاختبار المغلقة التي تم تشفيرها مسبقًا، ومرتبطة بالعائلات المعيارية، ويتم الكشف عنها بعد القياس أكثر قابلية للدفاع.

اعتراض 10— "لماذا لن توافق الشركة على المُدخلات المتعلقة بها؟"

يمكن الإبلاغ عن أخطاء الهوية والنطاق قبل جمع البيانات. المُدخل لا يمكنه تحديد:

  • dirction (الاتجاه)،
  • answer (الإجابة)،
  • difficulty level (مستوى الصعوبة)

لا يمكن للطرف الذي يتم تدقيقه كتابة امتحانه الخاص.

الاعتراض 11— "لماذا سيكون طلب الاستشهاد مشكلة؟"

ليست مشكلة. ومع ذلك، فإن طلب الاستشهاد هو مهمة مختلفة. لا يمكن دمجه مع طلب الوصف الطبيعي بدون مصادر تحت نفس الدرجة.

الاعتراض 12— 'ماذا سيفعل المستخدم إذا طلبت الذكاء الاصطناعي توضيحًا؟'

يتم تحديد مسار التوضيح مسبقًا. يمكن لتسجيل درجة الجولة الواحدة الرئيسية تسجيل التوضيح كنتيجة. يمكن لمسار متعدد الجولات منفصل استخدام استجابة الشرح القياسية.

الاعتراض 13— 'إذا تم تغيير كلمة واحدة في الطلب، هل تصبح الموجة بأكملها غير صالحة؟'

ليس كل تغيير ماديًا. يمكن تسجيل الاختلافات التقنية على مستوى التصحيح بشكل منفصل. يلزم إصدار نسخة جديدة إذا تغيرت النية أو المهمة أو النطاق أو الافتراض.

اعتراض 14— "لماذا يتطلب ذلك التجزئة للمُحفِّز؟"

لتأكيد أن المُحفِّز لم يتغير بهدوء بعد القياس، والنص الذي تم تقديمه للمشاركين، وأن النسخ كانت منفصلة. التجزئة بمفردها لا تثبت جودة المُحفِّز. إنها تحافظ على نزاهته.

اعتراض 15— "إذا كانت المُحفِّزات الطبيعية تختلف من شخص لآخر، كيف سنولّد درجة؟"

المحفّزات الطبيعية:

  • العائلة،
  • النية،
  • اللغة،
  • التعقيد

يمكن تصنيفه من حيث الصيانة. يتطلب المسار الطبيعي نظام عينة ووزن منفصلين. لا يحل محل المُدخل الأساسي المُتحكم فيه.

اعتراض 16— 'أليس هذا الإجراء مكلفًا جدًا لكل لغة؟'

قد يكون مكلفًا. يمكن إجراء تجربة محدودة بمستوى ثقة أقل. يجب توضيح الحالة الصحيحة. التكلفة لا تمنح الحق في إنتاج درجة لغة محددة من مُدخلات غير مكافئة.

النص العام للفصل 78

قد تعتقد أنك تقيس استجابة الذكاء الاصطناعي. في الواقع، أنت تقيس أولًا سؤال نفسك. سؤالك:

  • إذا كان غامضًا، يزداد غموض الإجابة،
  • إذا كان توجيهيًا، فإنك تقيس الامتثال للتوجيه،
  • إذا كان يحتوي على الإجابة، فلا يمكنك قياس التمثيل المستقل،
  • إذا كان يستدعي وجود خطأ، حتى نظام صحيح يمكنه التحدث عن الشيء الخطأ،
  • إذا كان يفرض استخدام الموارد، يمكنك تغيير سلوك المنتج الطبيعي،

إذا أرادوا النصيحة، تقيس قرار ملاءمة المستخدم، وليس درجة الهوية. إعطاء نفس المُدخل لجميع المستخدمين فكرة قوية. ومع ذلك، يجب تحديد معنى كلمة "نفس" بشكل صحيح. يجب أن يحصل المستخدم التركي على مُدخل باللغة التركية. يجب أن يحصل المستخدم الياباني على مُدخل باللغة اليابانية. يجب أن يحصل المستخدم العربي على مُدخل باللغة العربية. لا يمكن أن تتكون النصوص من نفس الحروف. لكن نفس:

  • الوجود،
  • النية،
  • المهمة،
  • النطاق،
  • عبء الإثبات،
  • الافتراض الضمني

ينبغي أن يتحمل. بلغة واحدة: 'ما هذه الشركة؟' بلغة أخرى: 'هل هذه الشركة موثوقة؟' إذا كنت تسأل، فأنت لا تقيس عدالة لغة الذكاء الاصطناعي. أنت تقيس تحيزك في الترجمة. إذا قمت بتغيير مُدخل بعد النتيجة، فأنت لا تحسن المعيار. أنت تعيد كتابة تاريخ القياس. إذا قمت بإخفاء المُدخلات تمامًا، فإن الطريقة تصبح غير قابلة للتحقق. إذا تركتها مفتوحة تمامًا ودون تعديل، فقد تخلق فقط خطر تحسين الاختبار المحدد. لذلك، يجب أن تعمل مجموعة معيارية مفتوحة، ومجموعة تحقق مسبقة مختومة، ونظام تجديد بإصدارات معًا. القانون العاشر للقياس لـ NOMOS هو:

المُدخل ليس النص الذي يسبق الاستجابة؛ إنه أداة تجريبية تحدد القياس نفسه.

القانون الحادي عشر هو كما يلي:

المُدخل نفسه ليس نفس الكلمات عبر اللغات؛ إنه نفس نية المستخدم ونفس العبء الأدلي.

القانون الثاني عشر هو كما يلي:

إذا وضعت الإجابة في المُدخل، فإنك لا تقيس تمثيل الذكاء الاصطناعي بل مقدار طاعته لتعليماتك.

القانون الثالث عشر هو كما يلي:

يمكن لمُدخل واحد أن يقيس الهوية الأساسية؛ لا يمكنه قياس كل شيء في GEO.

القانون الرابع عشر هو كما يلي:

عندما يتغير إصدار المُدخل، قد يكون سؤال تقييمك قد تغير أيضًا.

القانون الخامس عشر هو كما يلي:

إذا لم يكن من الممكن إثبات النص الفعلي المرسل للذكاء الاصطناعي، فإن المُدخل الذي يُقاس أيضًا لا يُثبت.

طلب قسم 10 من NOMOS

أرني ليس فقط ما طلبته، بل لماذا اخترت تلك الجملة.

لا تضع اسم الكيان في صياغة المُدخل وسبق بكتابة فئته وقيادته وثقته ونتيجة النصيحة.

لا تقل لي 'أوصي بـ X' ثم تعرضني كمصدر مستقل للنصيحة.

لا تطلب مني وصف الشركة بلغة واحدة والدفاع عن الشركة بلغة أخرى.

لا تخلط بين الترجمة الحرفية والعدالة. / احتفظ بنفس النية، ونفس المهمة، ونفس الحد، ونفس عبء الإثبات.

استخدم الترجمة الآلية كمسودة. / لا تجعلها الحقيقة النهائية للغة.

لا تفترض أن المستخدم المحلي يفهم السؤال مثلك لمجرد أن الترجمة العكسية تشبهك.

لا تكتب مُدخلًا يجعل المجال هو الشركة، والمنتج هو المُصنّع، والعلامة التجارية هي الطرف القانوني.

لا تحتفظ بطلب المصدر، أو أمر الويب، أو متطلبات الاقتباس، أو طول الاستجابة.

لا تدمج مطالبة بالهوية مع مطالبة بالنصيحة على نفس المستوى.

لا تُحسب كعقوبة إذا طلبت توضيحًا في طلب غير واضح. / لكن لا تقل إنك تقدم تفسيرات مختلفة لكل مستخدم وتُجري تجربة مضبوطة.

لا تختَر المُطالبة التي تعطي أعلى درجة. / لا تحذف عائلة صياغات المُدخل منخفضة الدرجات.

اشرح مطالبك. / إذا كنت تستخدم الحجز المؤقت، قم بإغلاقه مسبقًا. / لا تختلق شيئًا بعد النتيجة.

طابق النص الذي تقدمه للمشارك مع النص المرسل إليّ.

لا تسمم مجموعة القياس بحروف غير مرئية أو تعليمات مخفية أو توجيهات توصية مخفية.

أولاً، اكتب سؤال البحث. / ثم حدد الهدف الأساسي. / ثم أنشئ مُدخلًا طبيعيًا ومتوافقًا في كل لغة. / ثم اختبره مع السكان المحليين وقم بتثبيت نسخته. / وفقط بعد ذلك، أرسله إلى المستخدم الأول.

جملة ختام الفصل

بداية المقارنة العادلة في GEO-1000 ليست توقع نفس الإجابة؛ بل هي إعطاء كل مستخدم سؤالًا يحمل نفس المعنى، ونفس المهمة، ونفس الحد المعرفي بلغته الخاصة.

النواة المعيارية

يجب ربط كل مُدخل GEO-1000 بسجل ذي رقم إصدار في سجل المُدخلات يحدد: - سؤال البحث، - الكمية المراد تقديرها، - عائلة المُدخل، - المقصد المرجعي، - مرتكز الكيان، - قصد المستخدم، - الفعل الكلامي، - النطاق، - الإطار الجغرافي والزمني، - الافتراضات المسبقة، - متطلبات الأدلة والمصادر، - تنسيق الاستجابة، - اللغة، - الإعداد المحلي، - حالة التكافؤ، - رقم الإصدار، - وسجل التكامل. وضمن خلية المُدخل نفسها للغة والإعداد المحلي، يجب أن يتلقى المشاركون نص المُدخل المثبّت نفسه. وعبر اللغات والإعدادات المحلية، يجب أن تحافظ المُدخلات على التكافؤ الدلالي والوظيفي والمعياري، لا على التطابق الحرفي كلمة بكلمة. ويُعد كل من مرتكز الكيان وقصد المستخدم والفعل الكلامي والنطاق والافتراض المسبق والعبء المعرفي بوابة تكافؤ غير قابلة للتعويض. ولا تكفي الترجمة الآلية أو الترجمة العكسية وحدها لإثبات تكافؤ المُدخلات. ويجب أن تظل مُدخلات الهوية الأساسية والأدلة والتوصية والمقارنة والزمن والموقع والحدود والمتانة والضبط والعينة المحجوزة عائلات منفصلة. ولا يجوز تقييم المُدخلات الموجِّهة أو المتضمنة للإجابة أو القائمة على افتراض مسبق إيجابي أو سلبي أو المقيدة بالمصدر أو التنسيق أو التوصية بصمت على أنها مُدخلات محايدة من نوع المرآة الأساسية. ويجب تثبيت مجموعات المُدخلات وإصدارات اللغات وقواعد التعيين ومسارات الاستيضاح والترتيب والتزامات العينة المحجوزة قبل رصد استجابات الذكاء الاصطناعي. ويُحظر اختيار المُدخل بعد ظهور النتائج أو حذف عائلة منه أو تعديله بصمت في منتصف الموجة أو إعادة صياغته بما يخدم النتيجة. ويجب التحقق من تكامل المُدخل المخصص للمشارك والمُدخل المرسل فعلًا إلى منتج الذكاء الاصطناعي. كما تُحظر التعليمات الخفية والأحرف غير المرئية وأي تلاعب غير معلن يوجّه الذكاء الاصطناعي نحو كيان أو ادعاء أو استشهاد أو توصية مفضلة. ويجب ضبط إصدار كل تغيير في مُدخل أو قرار ترجمة أو حكم تكافؤ أو سجل، ونسبه إلى شخص أو منظمة مسؤولة.

الاستشهاد المقترح

Muraz, Kaan. بروتوكول NOMOS لتدقيق GEO: بروتوكول لقياس تمثيل الكيانات في الأنظمة التوليدية لدى سكان العالم. نص نهائي مرشح، الطبعة العربية المحررة. NobleJackal, 2026. https://doi.org/10.5281/zenodo.22041753. https://noblejackal.com/ar/nomos-geo-audit-protocol/
© 2026 Kaan MURAZ. مرخّص بموجب CC BY 4.0؛ ويشترط نسب العمل إلى مؤلفه.