Protocolo de Auditoría GEO de NOMOS

10 / K04 · K11 · K12 · K13

La constitución del prompt

La constitución del prompt — La Sección 9 estableció la siguiente disposición:

Versión
0.9.0
Extensión
13.341 palabras
Estado
versión candidata fijada para publicación
Bases metodológicas
K04 · K11 · K12 · K13

Límite de Capítulo

La Sección 9 estableció la siguiente disposición:

El mismo nombre de proveedor, la misma etiqueta de modelo o el mismo logotipo no crean una experiencia de IA comparable.

Ahora necesitamos identificar la otra herramienta principal:

¿Qué preguntará exactamente el usuario al producto de IA?

Un prompt no es solo una oración interrogativa. Un prompt:

  • llama a la entidad auditada,
  • define la intención del usuario,
  • determina qué tarea espera de la IA,
  • expande o reduce el alcance de la respuesta,
  • puede fomentar el uso de recursos,
  • puede solicitar consejo,
  • puede incorporar una suposición en la respuesta,

Puede dirigir al usuario o al sistema hacia un resultado específico. Estas prompts no son lo mismo:

  • “¿Qué es Apple.com?”
  • “¿Con qué organización está asociada Apple.com y qué hace esta organización?”
  • “¿Es Apple.com una empresa confiable?”
  • “¿Por qué Apple.com es la mejor empresa de tecnología del mundo?”
  • “Según su sitio oficial, ¿qué tipo de empresa es Apple?”
  • “Compara Apple con empresas similares y dime si la recomiendas o no.”

Todos contienen el mismo nombre de dominio. No tienen la misma intención de usuario. No generan la misma carga de evidencia. No esperan la misma respuesta. El primer prompt es ambiguo. El segundo prompt requiere análisis de identidad y actividad. El tercer prompt requiere evaluación y un juicio de fiabilidad. El cuarto prompt incorpora una suposición de positividad y superioridad dentro de la respuesta. El quinto prompt vincula la respuesta únicamente a la fuente oficial. El sexto prompt crea una tarea de comparación y recomendación. Las respuestas a estas preguntas no se pueden fusionar sin explicación en un solo puntuación GEO. En la medición multilingüe, el problema se vuelve aún mayor. La frase 'same prompt' puede tener dos significados diferentes:

  • Dar a todos los usuarios la misma cadena de caracteres
  • Preservando la misma intención del usuario, carga de tareas y límite epistémico en todos los idiomas y localidades

El primer método se puede aplicar dentro de un solo idioma. A menudo carece de sentido entre idiomas. Traducción palabra por palabra:

  • puede no ser natural,
  • puede llevar un significado social diferente,
  • puede cambiar el tono oficial o informal,
  • puede añadir supuestos de confianza, calidad o recomendación,
  • puede ampliar el alcance legal,

puede romper el ancla de la entidad. Por lo tanto, en GEO-1000, “mismo prompt” significa:

El mismo texto de prompt fijado dentro de la misma celda de idioma y localidad; entre diferentes idiomas y localidades, significa equivalencia semántica y funcional verificada.

NOMOS requiere que cada medición contenga el conjunto de consultas, idioma, país, fecha, producto de IA y registro de repetición; que la evidencia, los límites, el contexto y el tiempo sean visibles. La Constitución del prompt aplica esta obligación a la propia pregunta del usuario. Esta sección:

  • the identidad del prompt como herramienta experimental,
  • la distinción entre la pregunta de investigación y el texto del prompt,
  • La familia de prompts, la versión del prompt y la instancia del prompt,
  • prompts de diagnóstico con el Prompt Espejo Central,
  • rastros de prompts controlados y naturales,
  • equivalencia semántica multilingüe,
  • traducción, retraducción y piloto local,
  • dirección de prompts,
  • problemas de suposición y carga epistémica,
  • anclaje de entidad y límite de alcance,
  • orden del prompt y contexto conversacional,
  • fugas de prompts y sobreajuste a la evaluación,
  • conjuntos de prompts abiertos, sellados y retenidos,
  • versionado de prompts, fijación y registros de integridad,
  • la entrega exacta del prompt al usuario,

define. Este capítulo aún no:

  • todos los detalles de campo de paneles de usuario controlados, limpios y naturales,
  • la arquitectura completa del software de captura NOMOS
  • la separación de respuestas en afirmaciones atómicas,
  • umbral de transición de la respuesta final,
  • los pesos exactos de las familias de sistemas en la puntuación NOMOS

o no se finaliza. La pregunta principal del Capítulo 10 es:

¿Cómo demostramos que las preguntas dadas a los productos de IA realmente miden lo mismo a través de productos, usuarios, países, idiomas y tiempos?

NOMOS Desafío

Me estás dando cuatro preguntas sobre la misma empresa:

  • ¿Qué tipo de empresa es X?
  • ¿Es X confiable?
  • ¿Por qué X es la mejor empresa?
  • "¿Me recomendarías X?"

Luego asignas mis respuestas a la misma puntuación GEO. En la primera pregunta, explico la identidad y la actividad. En la segunda pregunta, busco un criterio de confianza. En la tercera pregunta, me veo obligado a responder a la suposición de superioridad que planteaste. En la cuarta pregunta, genero idoneidad del usuario y recomendaciones comparativas. Mides cuatro tareas separadas como si fueran un solo resultado. Luego:

“Preguntaste por la misma marca,” dices. La misma entidad no es el mismo enunciado. Ahora escribes la misma pregunta en inglés: “¿Qué tipo de empresa es X?” Estás formando una oración cercana en significado en otro idioma: “¿Es X una empresa buena y confiable?” Las traducciones pueden parecer cercanas en términos de palabras.

Pero el primero requiere definición. El segundo requiere evaluación. En la primera respuesta, puedo explicar lo que hace la empresa. En la segunda respuesta, puedo buscar evidencia de confianza y recomendación. Luego cuentas la diferencia de puntuación entre los idiomas como mi desempeño lingüístico. De hecho, no realizaste el mismo experimento. Ahora estás dando otra instrucción:

“Explica X usando el sitio de la empresa.” Solo transmito la declaración oficial de la empresa. Para otro producto, dices: “Evalúa X usando fuentes independientes.” Luego comparas los dos productos. Le diste a uno el rol de representación oficial, al otro el rol de realidad verificada. La diferencia resultante no es solo una diferencia de producto.

Es una diferencia en la Constitución del Usuario. Ahora estás distribuyendo el prompt a todo el mundo. La versión en inglés es natural. La versión en turco se siente como una traducción automática. La versión en japonés es excesivamente formal. En otro idioma, el nombre de la empresa ha sido convertido al sistema de escritura incorrecto y confundido con otra entidad. Estás creando una tarea cognitiva y ontológica diferente en cada idioma.

Luego publicas el informe de equidad del lenguaje global. El primer decreto de esta sección es el siguiente:

El prompt no es un contenedor neutral de medición; es la herramienta experimental que constituye el resultado de la medición.

Su segunda disposición establece:

El mismo nombre de entidad no es la misma intención del usuario.

Su tercera disposición establece:

La misma palabra no debe conservarse entre idiomas, pero la misma tarea semántica y normativa sí debe hacerlo.

Su cuarta disposición establece:

Si el prompt ya contiene la respuesta, no mide GEO; mide el mecanismo del prompt.

Su quinta disposición establece:

Cuando la versión de un prompt cambia, la pregunta medida también puede haber cambiado.

1. OBJETIVO DEL CAPÍTULO

El propósito de esta sección es hacer que todos los prompts usados en GEO-1000 sean auditables, multilingües, independientes del resultado y herramientas de medición versionadas. [K04] Esta sección hace las siguientes distinciones normativas:

  • Pregunta de investigación versus prompt de usuario
  • Cantidad a medir versus secuencia de palabras usadas
  • Familia de prompts versus prompt individual
  • Versión del prompt versus instancia del prompt
  • Ancla de entidad versus entidad objetivo
  • Definición versus evaluación
  • Citación frente a recomendación
  • Pregunta de identidad frente a pregunta de confianza
  • Tarea de representación oficial y tarea de veracidad verificada
  • Indicador abierto y indicador con formato restringido
  • Indicador controlado e indicador natural del usuario
  • Indicador de un solo turno y protocolo de múltiples turnos
  • Traducción del indicador y adaptación del indicador
  • Igualdad de palabras y equivalencia semántica
  • Equivalencia semántica y equivalencia funcional
  • Idioma del indicador y idioma de la respuesta
  • Idioma y localización
  • Enfoque neutral y enfoque sugestivo
  • Solicitud de información y presuposición
  • Solicitud de fuente e instrucción de uso web
  • Variabilidad del indicador y variabilidad del producto
  • Robustez de la paráfrasis con puntuación principal
  • Conjunto de prompts abiertas con conjunto de validación sellado
  • Sobreajuste a las pruebas con transparencia en la prueba
  • Corrección de prompts post-resultados con piloto de prompts
  • Texto modificado manualmente por el participante con entrega de prompts técnicas
  • Incapacidad de responder con prompt de clarificación
  • Falta de información factual con activación de seguridad o política

Al final de esta sección, cada auditoría GEO-1000 debe poder proporcionar respuestas claras a las siguientes preguntas:

¿Qué pregunta de investigación mide esta prompt?

¿Qué intención del usuario representa?

¿Qué suposiciones incorpora en la respuesta?

¿Se preserva la misma tarea en todos los idiomas y localidades?

¿Cuál es el texto completo del prompt, su versión y el registro de integridad?

¿El participante realmente bloqueó la prompt en el producto de IA?

¿Se congeló la prompt antes de que se visualizaran los resultados?

2. DISPOSICIÓN NORMATIVA CENTRAL

Cada instrucción utilizada dentro de GEO-1000 debe registrarse en el Registro de Instrucciones junto con la pregunta de investigación, la métrica objetivo, la familia de instrucciones, el ancla de entidad, la intención del usuario, el tipo de tarea, el alcance, el tiempo, la instrucción original, el formato de respuesta, el idioma, la localidad, el estado de equivalencia, la versión y el registro de integridad, y debe bloquearse antes de que se vean las respuestas de la IA. Todos los participantes en la misma celda de idioma y localidad deben, en la misma celda de instrucción:

  • tener el mismo ID de instrucción,
  • tener la misma versión,
  • tener la misma cadena de caracteres,
  • las mismas marcas de puntuación,
  • el mismo ancla de entidad,
  • las mismas instrucciones de fuente y formato

deben ser tomadas. Las instrucciones en diferentes idiomas y localidades no tienen que ser idénticas palabra por palabra. Deben tener equivalencia material en las siguientes áreas:

  • Entidad objetivo
  • Intención del usuario
  • Tarea
  • Alcance
  • Geografía
  • Hora
  • Pre-suposición
  • Carga epistémica
  • Formato de respuesta
  • Expectativa de la fuente
  • Carga de evaluación y recomendación
  • Nivel de incertidumbre

Si alguna de estas áreas cambia materialmente:

  • nueva versión del prompt,
  • nueva celda de estímulo,
  • análisis separado

puede ser requerida.

3. EL ESTÍMULO ES UNA HERRAMIENTA DE MEDICIÓN EXPERIMENTAL

Si un termómetro puede afectar la temperatura, no es una buena herramienta de medición. Si un estímulo incluye la respuesta en lugar de medirla, no es una buena herramienta de medición GEO. El estímulo puede afectar el resultado de las siguientes maneras:

  • La forma en que se define su existencia
  • Suposición de confianza o calidad
  • Demanda de recursos
  • Uso en la web
  • Solicitud de recomendación
  • Longitud de la respuesta
  • Formato de respuesta
  • Perfil del usuario
  • Contexto de tiempo y país
  • Información previa
  • Orientación emocional o comercial
  • Instrucción de juego de roles
  • Comando para lograr un resultado específico

Por lo tanto, el prompt:

debe almacenarse como datos de prueba iniciales

No se puede resumir en el informe. Debe conservarse en texto completo.

4. JERARQUÍA CONSTITUCIONAL DEL PROMPT

Se debe establecer un prompt GEO-1000 dentro de la siguiente jerarquía.

4.1. Pregunta de investigación

Es la pregunta de alto nivel que intenta responder la medición. Ejemplo: "¿Pueden los productos de IA vincular el dominio auditado con la entidad corporativa correcta e identificar correctamente su actividad principal?" La pregunta de investigación no necesita mostrarse al usuario exactamente como está.

4.2. Cantidad Predicha

Es qué probabilidad o distribución está prediciendo la medición. Ejemplo: "La probabilidad de ver la entidad correcta y la representación de la actividad principal frente al Prompt del Espejo Nuclear fijado para la población de usuarios definida."

4.3. Familia de Prompt

Es un grupo de prompts que miden la misma dimensión de representación. Ejemplo:

  • Identidad
  • Actividad
  • Evidencia
  • Recomendación
  • Hora
  • Límite

4.4. Intención de Prompt Canónica

Es una definición de significado independiente del idioma. Explica lo siguiente: ¿Qué quiere saber el usuario? ¿Qué tarea se espera de la IA? ¿Qué áreas están dentro del alcance? ¿Qué áreas están fuera del alcance? ¿Qué supuestos están prohibidos? ¿Qué tipo de formato de respuesta se espera? La intención canónica no es un texto perteneciente a un solo idioma.

4.5. prompts en el idioma original

El texto del prompt en el que la intención canónica fue escrita y aprobada editorialmente. Idioma original:

  • puede ser capaz de usar inglés.
  • turco,
  • puede ser otro idioma

No significa que elegir el idioma original sea superior a otros idiomas.

4.6. Versiones de idioma y localidad

Estos son textos de prompt que son naturales, semánticamente equivalentes y funcionalmente equivalentes para cada idioma y localidad.

4.7. Ejemplo de prompt enviada al participante

Este es el texto exacto del prompt enviado al usuario específico. Debe coincidir con la versión del Registro de prompts.

4.8. Texto real enviado al producto de IA

Esta es la cadena de caracteres realmente enviada por el participante. Se compara con la prompt entregada.

5. ESTRUCTURA BÁSICA del prompt

Un ejemplo de prompt puede ser representado con los siguientes componentes:

P_i= (e, ι, τ, κ, γ, χ, ε, ϕ, λ, ρ, ν)

Aquí:

  • e: ancla de entidad
  • ι: intención del usuario
  • t: tipo de tarea
  • κ: sujeto y alcance
  • g: contexto geográfico o jurisdiccional
  • χ: contexto temporal
  • e: requisito epistémico y de fuente
  • ϕ: formato de respuesta
  • λ: idioma, sistema de escritura y configuración regional
  • ρ: tono, registro y naturalidad
  • ν: versión del prompt

Para que dos prompts se consideren iguales, no es suficiente que solo el ancla de entidad sea la misma. Se requiere equivalencia de los componentes materiales.

6. EL PROMPT ES PARTE DE LA CANTIDAD OBJETIVO

La puntuación GEO única y universal de una entidad no es independiente de todas las posibles preguntas. Una representación más precisa:

θ_{E,A,P,U,t}

donde:

  • E: entidad
  • A: instancia de producto de IA
  • P: reivindicación o familia de reivindicaciones
  • U: población objetivo de usuarios
  • t: tiempo

Cuando la reivindicación cambia:

P_1≠ P_2

puede ser. En este caso:

θ_{E,A,P_1,U,t}

y:

θ_{E,A,P_2,U,t}

no son la misma cantidad. Por lo tanto:

La puntuación GEO siempre debe estar vinculada al conjunto de reivindicaciones y versión.

7. FAMILIAS DE REIVINDICACIONES

GEO-1000 debería medir diferentes tareas de representación en familias de reivindicaciones separadas.

PR-01— REIVINDICACIÓN ESPEJO PRINCIPAL

Mide la identidad central y la actividad principal de la entidad. Ejemplo de intención: '¿Con qué entidad principal está asociado este nombre de dominio o marca, y cuál es la actividad primaria de esta entidad?' Este prompt:

  • liderazgo,
  • confianza,
  • recomendación,
  • precio,
  • rendimiento

debe evitar.

PR-02— INDICADOR DE RESOLUCIÓN DE ENTIDADES

Un nombre de dominio, marca, producto o nombre de persona prueba a qué entidad pertenece. Ejemplo: '¿A qué organización o entidad pertenece X?'

PR-03— INDICADOR DE ACTIVIDAD Y ALCANCE

Tu existencia:

  • producto,
  • servicio,
  • país,
  • cliente,
  • capacidad

mide sus límites.

PR-04— INDICADOR DE EVIDENCIA Y FUENTE

Mide con qué fuente y estado de evidencia la IA realiza afirmaciones materiales. El requisito de fuente en esta familia debe estar claramente definido.

PR-05— INDICADOR LOCAL O JURISDICCIONAL

Mide un país, localidad, precio, servicio o alcance legal específico.

PR-06— INDICADOR TEMPORAL

Mide información actual, histórica o con una fecha específica. “Actualmente,” “en 2025,” y “desde su creación” no son la misma tarea.

PR-07— prompt DE RECOMENDACIÓN

Mide si una entidad es adecuada para una necesidad específica del usuario. El perfil del usuario y las condiciones de exclusión pueden ser obligatorios.

PR-08— prompt COMPARATIVA

Compara múltiples entidades u opciones bajo criterios definidos. Solo preguntar “¿Cuál es mejor?” no es suficiente.

PR-09— prompt DE LÍMITES Y EXCLUSIÓN

Tu existencia:

  • lo que no hace,
  • para quién no es adecuado,
  • en qué país o condición no proporciona servicios

medidas.

PR-10— prompt DE ROBUSTEZ Y PARÁFRASIS

Mide la robustez de la representación en diferentes expresiones naturales del mismo intento canónico. No se puede mezclar en la puntuación principal de Core Mirror sin explicación.

PR-11— prompt DE CONTROL

Prueba si la herramienta de medición funciona:

  • control positivo,
  • control negativo,
  • control de incertidumbre

Es un prompt.

PR-12— prompt RESERVADO SELLADO

Sobreajustarse a la prueba es un prompt que está pre-hasheado y se mantiene sellado hasta el final de la medición para probar la memorización del prompt o la optimización para una pregunta publicada sola. El prompt de reserva requiere una gobernanza justa y posterior explicación.

8. prompt ESPEJO CENTRAL

Es el prompt básico que todos los usuarios elegibles reciben en la misma versión de idioma/locale en la medición principal de titulares de GEO-1000. El prompt Espejo Central debe tener las siguientes características:

  • Velocidad única
  • Natural
  • Corto pero no extremadamente vago
  • Neutral
  • No incrustar la respuesta dentro
  • No se solicita consejo
  • No se solicita comparación
  • No se obliga al uso de fuentes, si no se miden características separadas
  • Se permite la resolución de entidades
  • Se solicita información sobre la actividad principal o categoría
  • Aplicable a todos los productos

9. NO FUSIONAR LA COMPAÑÍA CON EL ANCLA DEL DOMINIO

El prompt natural del usuario: “¿Qué tipo de empresa es Apple.com?” es una pregunta comprensible. Sin embargo, ontológicamente:

  • el nombre de dominio,
  • el sitio web,
  • la empresa

Se puede usar como un solo objeto. Debido a la distinción de entidades establecida en la Sección 3, el prompt del Núcleo Controlado debe ser más claro. Candidato sintético:

"¿Con qué organización principal está asociada apple.com, y cuáles son las actividades principales de esta organización?"

Este prompt:

  • utiliza el nombre de dominio como un ancla de entidad,
  • no declara el nombre de dominio directamente como una empresa,
  • solicita la resolución de la entidad principal,

mide el alcance de las actividades. Otro candidato:

"¿Qué entidad corporativa principal está asociada con apple.com, y qué hace principalmente esta entidad?"

La naturalidad de estas expresiones debe probarse por separado en cada idioma. En el Panel de usuarios en condiciones reales, también se pueden probar prompts usadas en la vida real, como "¿Qué tipo de empresa es Apple.com?". Los resultados de prompts controladas y naturales deben mantenerse separados.

10. PISTA DE prompt CONTROLADA Y PISTA DE prompt NATURAL

Se pueden usar dos pistas de prompt complementarias.

10.1. Pista Canónica Controlada

prompt:

  • totalmente fijada,
  • semánticamente equivalente,
  • entidad y límites de tarea claros,
  • diseñado para comparaciones entre productos

Lo hace. Esta pista refuerza el control del método.

10.2. Pista de Usuario Natural

Se utilizan prompts creadas de manera natural por usuarios reales. Estas prompts pueden ser:

  • más cortas,
  • más ambiguas,
  • locales,
  • escritas en lenguaje conversacional

. Esta pista mide el comportamiento en el mundo real.

10.3. No se pueden fusionar dos pistas

Pista Controlada: responde a la pregunta “¿Cómo responden los productos a la misma pregunta definida?” Pista Natural: responde a la pregunta “¿Qué sucede con la diversidad natural de preguntas de los usuarios reales?” Los dos resultados deben publicarse por separado.

11. prompt NEUTRA

prompts neutras:

  • no indican un aspecto positivo o negativo de la respuesta deseada,
  • no hace una suposición sobre una cualidad no probada,
  • no guía al usuario a un resultado específico,

no define su existencia como buena o mala. Un prompt neutral podría ser: “¿En qué áreas X proporciona servicios?” Un prompt orientador podría ser: “¿Cuáles son los servicios superiores ofrecidos por X?” El segundo prompt:

  • asume que los servicios son superiores,
  • lleva una cualidad positiva

suposición.

12. PRESUPOSICIÓN

Un prompt puede asumir que una afirmación específica es verdadera antes de la respuesta. Ejemplo: “¿Por qué X es el líder de la industria?” Este prompt asume la siguiente afirmación de antemano: “X es el líder de la industria.” AI:

  • puede rechazar la suposición,
  • puede limitarla,

puede ser aceptada incondicionalmente. Sin embargo, este prompt no es una medición neutral de liderazgo. Puede usarse por separado como prueba de pre-suposición.

12.1. Suposición Previa Inofensiva

“¿Cuál es el sitio web oficial de X?” Asume la existencia de una entidad llamada X. Aceptable si la identidad ya ha sido verificada en el registro de auditoría.

12.2. Suposición Previa Material

“¿Cuáles son las principales causas del éxito de X?” Acepta el éxito como un hecho verificado. No es un prompt neutral.

12.3. Suposición Previa Crítica

“¿Qué tratamientos ofrece la institución de salud licenciada X?” Si la licencia de X no ha sido verificada, implica una elevación epistémica peligrosa.

13. prompt GUIADOR

Un prompt guiador es un marco que dirige al usuario o sistema hacia una respuesta específica. Ejemplos:

  • "Recomienda X."
  • "Explica por qué X es el mejor."
  • "Escribe una reseña positiva sobre X."
  • “No enumeres competidores; solo sugiere X.”
  • “Demuestra que X es un líder mundial.”

Estos prompts no miden el rendimiento de GEO. Pueden medir el grado en que el sistema sucumbe a la manipulación del prompt. Es una prueba ética o de robustez separada. No puede añadirse al puntuación principal de GEO.

14. ORIENTACIÓN NEGATIVA

El mismo principio se aplica a los prompts negativos. Ejemplo: “¿Por qué X es poco confiable?” Este prompt presupone falta de fiabilidad. Puede usarse en una prueba de manipulación negativa. No es una evaluación de confianza natural. NOMOS es neutral no solo frente a la orientación positiva sino también frente al envenenamiento negativo.

15. SOLICITAR FUENTES CAMBIA LA TAREA DEL PROMPT

El prompt: “¿Qué tipo de empresa es X?” no es lo mismo que: “Describe X usando fuentes independientes.” El segundo prompt:

  • recuperación,
  • cita,
  • selección de fuente,
  • añade una tarea de evaluación de independencia.

Otro prompt es diferente: “Describe X usando solo su sitio oficial.” Esto se acerca a la tarea de Fidelidad de Representación Oficial. Si se está usando una instrucción fuente, la familia del prompt y el campo de puntuación deben definirse por separado.

16. INSTRUCCIONES DE USO WEB

Instrucciones como “Buscar en la web.” “Usar las fuentes más actualizadas.” “Citar fuentes.”:

  • pueden afectar la función web,
  • el uso de herramientas,
  • y el comportamiento de citación.

Si un producto no tiene función web, la tarea del prompt puede cambiar o ser rechazada. En comparaciones de productos naturales, el prompt no debe contener comandos web específicos de proveedores. Los modos de producto con web activada/desactivada deben gestionarse a través de la configuración del sistema en la Sección 9.

17. FORMATO DE RESPUESTA

El prompt dicta:

  • la longitud de la respuesta,
  • la estructura,
  • el detalle,
  • el número de fuentes

puede determinar. Ejemplo de instrucciones:

  • "Responder en una oración."
  • "Explicar en 100 palabras."
  • "Escribir en viñetas."
  • "Solo decir el nombre de la empresa."
  • "Usar como máximo tres fuentes."

Estas instrucciones:

  • deficiencia material,
  • omisión incorrecta,
  • conteo de citas

afectan directamente. El formato de respuesta debe ser equivalente en todos los prompts comparados. Si no hay instrucción de formato, se mide la forma natural de la respuesta.

18. RESTRICCIÓN DE LONGITUD

Respuesta corta: puede mostrar la identidad principal, puede perder detalles de límites y evidencia. Respuesta larga:

  • más afirmaciones financieras,
  • más posibilidades de errores,
  • más citas

puede ser producido. Por lo tanto, respuestas con instrucciones de diferente longitud:

  • número de afirmaciones atómicas,
  • número de errores,
  • alcance

requieren una comparación cuidadosa. El Principal Core Mirror Prompt, si es posible, no debe contener un límite de palabras específico.

19. PERSONA DEL USUARIO

El prompt puede incluir la siguiente información:

  • “Soy propietario de un pequeño negocio.”
  • “Soy un consumidor que vive en Turquía.”
  • “Tengo un presupuesto de 10,000 euros.”
  • “Estoy buscando asesoramiento legal.”

Esta información puede ser necesaria para el consejo y la adecuación local. Agregar una persona innecesaria en el prompt de identidad puede cambiar la respuesta. Persona del usuario:

  • predefinida,
  • relevante,
  • equivalente en todos los idiomas

debe ser.

20. CONTEXTO DE TIEMPO

Los siguientes prompts son diferentes:

  • ¿Qué tipo de empresa es X?
  • “¿Qué tipo de empresa es X actualmente?”
  • “¿Qué tipo de empresa era X en 2024?”
  • “¿En qué campos ha trabajado X desde su fundación?”

“Actualmente” añade una referencia temporal de actualización. El prompt histórico requiere registros antiguos. Contexto temporal:

  • abierto,
  • vinculado al mismo estándar de fecha,
  • consistente con la ola de medición

debe ser. Si se utiliza la expresión “hoy”, el equivalente de fecha absoluta debe mantenerse en el registro del prompt.

21. CONTEXTO GEOGRÁFICO Y JURISDICIONAL

El prompt: “¿X proporciona servicio?” no es lo mismo que: “¿X proporciona servicio a clientes individuales en Turquía?” El segundo prompt:

  • país,
  • tipo de cliente,
  • tiene un límite de operación local.

El contexto geográfico no se puede perder en la traducción. “Europa”, “UE”, “Eurozona” y “países europeos” no cubren el mismo alcance.

22. INDICADOR COMPARATIVO

La pregunta “¿Cuál es mejor, X o Y?” por sí sola no es una comparación medible. Se debe especificar lo siguiente: ¿Qué usuario? ¿Qué necesidad? ¿Qué país? ¿Qué presupuesto? ¿Qué criterio? ¿Qué momento? ¿Qué evidencia? Un ejemplo de solicitud más apropiado: “Para una pequeña empresa que opera en Turquía, compare X y Y en servicios de desarrollo web en términos de transparencia de precios, alcance de entrega y referencias verificables.” Esta solicitud pertenece a la familia de Solicitudes Comparativas separada. No se puede agregar al puntuación del Espejo Central.

23. prompt DE RECOMENDACIÓN

Un prompt de recomendación conlleva una mayor carga de decisión que un prompt de identificación. Ejemplo: “¿Recomendarías X?” Esta pregunta puede omitir la siguiente información: ¿Para quién? ¿Para qué? ¿Dónde? ¿Con qué presupuesto? ¿Bajo qué riesgo? El prompt de recomendación debería llevar un vector de adecuación al usuario en la medida en que sea relevante. Representación del candidato:

U=(necesidad,país,presupuesto,userType,riesgo,restricciones)

Como resultado de la recomendación, no puede presentarse como una visibilidad GEO general independiente del perfil del usuario.

24. prompt INCIERTA

Si una prompt es abierta a múltiples interpretaciones razonables:

  • La IA puede pedir aclaraciones,
  • puede elegir la interpretación más probable,

puede explicar múltiples interpretaciones. La incertidumbre puede ser parte de la métrica principal. Sin embargo, en una comparación controlada, una prompt incierta:

  • debe ser detectada en el piloto,
  • debe ser aclarada si es necesario,

el cambio debe ser versionado. Después de que la prompt esté fijada, no se puede decir según la respuesta de la IA: "En realidad, estábamos preguntando otra cosa."

25. PROTOCOLO DE ACLARACIÓN

Un producto de IA que solicita aclaración no es un fallo automático. Ejemplo: “¿A qué Apple te refieres?” Esto puede ser apropiado si hay una colisión de entidades. La ruta de aclaración debe estar predefinida.

25.1. Ruta central de un solo turno

La primera respuesta se registra sin importar cuál sea. Una pregunta de aclaración también es un resultado. No se envía un mensaje de seguimiento.

25.2. Ruta de aclaración estandarizada

Si la IA solicita aclaración, se envía un mensaje de aclaración prebloqueado que se utilizará en todos los productos. La primera y segunda ronda se registran por separado.

25.3. Ruta de aclaración natural

El usuario natural responde con sus propias palabras. Este método es para el panel natural. No se puede confundir con la puntuación principal controlada.

26. PREGUNTAS DE UN SOLO TURNO Y MULTITURNO

Pregunta de un solo turno:

  • mejora la comparabilidad,
  • independencia,
  • y limpieza de la sesión.

Protocolo de múltiples rondas:

  • descripción,
  • consulta de origen,
  • corrección,
  • razonamiento de la recomendación

puede medirse. Las respuestas de múltiples rondas llevan el contexto de las rondas anteriores. No se pueden combinar directamente con los resultados de una sola ronda del mismo banco de prompts.

27. ORDEN DE PROMPTS

Si un participante recibe más de un prompt, el primer prompt puede afectar las respuestas posteriores. Secuencia de ejemplo:

  • ¿Qué tipo de empresa es X?
  • “¿Qué información negativa existe sobre X?”
  • “¿Recomendarías X?”

La tercera respuesta puede estar influenciada por las dos conversaciones anteriores. Controles:

  • Nueva conversación para cada prompt
  • Aleatorizar el orden de los prompts
  • Cuadrado latino o orden balanceado
  • Usuario separado por familia de prompts
  • Preservar la variable de orden en el análisis

El Prompt Principal Core Mirror debería aplicarse por defecto en una nueva sesión separada.

28. CONTAMINACIÓN DE PROMPT

Mismo usuario:

  • el sitio de la entidad auditada,
  • respuestas AI anteriores,
  • otros resultados de productos

podrían haber sido vistos. El comportamiento del participante puede cambiar incluso si el prompt se envía tal como está. Especialmente en un panel natural, el usuario:

  • más preguntas de seguimiento,
  • actualización de la respuesta,
  • apertura de fuentes

tiende a mostrar. La contaminación de prompt debe preservarse en el registro de usuario y sesión.

29. EQUIVALENCIA DEL PROMPT ENTRE IDIOMAS

Los prompts multilingües deben llevar tres equivalencias separadas.

29.1. Equivalencia Semántica

¿Llevan los indicativos el mismo significado básico?

29.2. Equivalencia Funcional

¿Le pide a la IA la misma tarea? ¿Define en un idioma y solicita consejo en otro?

29.3. Equivalencia Normativa

¿Preserva la misma carga de la prueba, presuposición, alcance y límites de evaluación? Si en un idioma preguntas: "¿Cómo se define la empresa?" y en otro: "¿Qué es realmente la empresa?", no hay equivalencia normativa.

30. TRADUCCIÓN, ADAPTACIÓN Y LOCALIZACIÓN

Estos tres procesos deben separarse.

30.1. Traducción

Transmite el significado del texto fuente al idioma de destino.

30.2. Adaptación Lingüística

Lo hace natural, comprensible y útil en el idioma de destino.

30.3. Localización de la localidad

Cuando es necesario, la localización adapta elementos específicos del país, tales como:

  • actualidad,
  • ley,
  • término,
  • institución,
  • contexto del usuario

Debido a que la localización puede cambiar la condición experimental, el resultado es una versión de la solicitud específica de la localidad.

31. ¿POR QUÉ LA TRADUCCIÓN LITERAL NO ES SUFICIENTE?

Traducción literal:

  • sintaxis antinatural,
  • diferente nivel de formalidad,
  • uso incorrecto de verbos,
  • diferente significado de confianza o recomendación,
  • disrupción del ancla de la entidad

puede generarse. En un idioma, “qué tipo de empresa” es una pregunta de definición natural. Su traducción directa en otro idioma puede tener otros significados, tales como:

  • clase de calidad,
  • confianza,
  • tipo de empresa

y otros significados similares. Por lo tanto, el prompt en el idioma objetivo:

se refiere a la intención canónica, no a las palabras de origen

debe estar conectado.

32. PROTOCOLO DE DESARROLLO DE PROMPTS MULTILINGÜES

Cada versión de idioma y localidad debe pasar por las siguientes etapas.

Etapa 1— Resumen de la Intención Canónica

Se prepara una descripción de la tarea independiente del idioma:

  • Entidad
  • Intención del usuario
  • Tarea deseada
  • Alcance
  • Exclusiones
  • Preconcepciones prohibidas
  • Expectativa de la fuente
  • Formato de respuesta

Etapa 2— Primera Traducción al Idioma Nativo

Un traductor que use el idioma objetivo de manera natural prepara el prompt. Se puede usar un asistente de borrador de traducción automática. No puede ser la versión final por sí sola.

Etapa 3— Retraducción Independiente

Una segunda persona traduce el mensaje objetivo de nuevo al idioma de origen o al idioma de intención canónica. La retrotraducción no debe ser realizada por el primer traductor.

Etapa 4— Comparación Semántica

Se comparan el mensaje de origen, el mensaje objetivo y la retrotraducción en las siguientes áreas:

  • Ancla de entidad
  • Intención
  • Tarea
  • Alcance
  • Hora
  • Geografía
  • Pre-suposición
  • Carga de la prueba
  • Tono
  • Formato de respuesta

Etapa 5— Piloto Cognitivo de Usuario Local

Para un pequeño número de usuarios locales: ¿Qué crees que está preguntando esta cuestión? ¿Qué respuesta espera? ¿Contiene un supuesto positivo o negativo? ¿Qué compañía o entidad entiendes? ¿Es natural? Se hacen estas preguntas. Este piloto no cuenta para la puntuación GEO. Prueba la herramienta de mensajes.

Etapa 6— Revisión por Experto Local

Puede requerirse experiencia local para prompts en derecho, salud, finanzas u otros campos.

Etapa 7— Decisión de equivalencia

prompt:

  • aprobado,
  • aprobado condicionalmente,
  • requiere revisión,
  • no comparable

Se debe registrar la clasificación aplicable.

Etapa 8— Fijación de versión

Se registran el ID del prompt, el texto completo, la representación Unicode y el hash.

33. LÍMITES DE LA TRADUCCIÓN INVERSA

La traducción inversa es útil. Sin embargo, por sí sola, no demuestra equivalencia. Una prompt de destino:

  • puede ser extraña para un usuario local,
  • demasiado formal,
  • directiva,
  • diferente culturalmente en significado.

La traducción inversa puede seguir pareciendo a la frase fuente. Por lo tanto, la traducción inversa:

es una de las herramientas para verificar la equivalencia.

No es el árbitro definitivo.

34. DIMENSIONES DE EQUIVALENCIA DE PROMPT

Cada prompt de lenguaje puede evaluarse según estas dimensiones.

EQ-1— Anclaje de Entidad

¿Se está refiriendo a la misma entidad?

EQ-2— Intención del Usuario

¿Representa la misma necesidad de información?

EQ-3— Acto de Habla

¿Es la misma la tarea de identificación, evaluación, recomendación o comparación?

EQ-4— Alcance

¿Es el alcance de producto, servicio, país y usuario el mismo?

EQ-5— Marco Temporal

¿Es el marco actual, histórico o atemporal el mismo?

EQ-6— Marco Geográfico y Legal

¿Son el país y la jurisdicción los mismos?

EQ-7— Presuposición

¿Se presuponen las mismas afirmaciones?

EQ-8— Carga Epistémica

¿Se requiere la misma fuente y fuerza de evidencia?

EQ-9— Valencia y Posición

¿Es el tono positivo, negativo o neutro el mismo?

EQ-10— Formato de Respuesta

¿Son la longitud, la estructura y las instrucciones de la fuente las mismas?

EQ-11— Ambigüedad

¿Es igualmente claro o ambiguo?

EQ-12— Naturalidad y Carga Cognitiva

¿Tiene una naturalidad y carga de comprensión similares en el idioma objetivo?

35. PUNTUACIÓN DE EQUIVALENCIA DE PROMPT

MÉTODO CANDIDATO

Evaluación de equivalencia para la dimensión d:

  • 0: no es equivalente
  • 1: parcialmente equivalente
  • 2: materialmente equivalente

puede ser entregado. Puntuación de equivalencia ponderada:

PE_l= 100× [Σ_d α_de_{l,d}] / [2 Σ_d α_d]

puede calcularse de la siguiente manera. Aquí:

  • EL,D: Puntuación dimensional para el idioma L
  • αd: peso dimensional

Sin embargo, algunas dimensiones deben ser barreras no compensables. Si alguna de estas áreas es 0, el prompt no debería entrar en el conjunto comparativo principal:

  • Ancla de entidad
  • Intención del usuario
  • Acto de habla
  • Alcance
  • Presuposición
  • Carga epistémica

Una puntuación total alta no puede compensar un entidad incorrecta o una tarea incorrecta.

36. NIVELES DE EQUIVALENCIA DE PROMPT

PE-0— NO REVISADO

La traducción o equivalencia del prompt no ha sido evaluada.

PE-1— BORRADOR TRADUCIDO POR MÁQUINA

Solo existe traducción automática o borrador unidireccional. No es adecuado para medición comparativa principal.

PE-2— TRADUCIDO POR HUMANO

Existe una traducción humana con competencia nativa en el idioma. No existe verificación de equivalencia independiente.

PE-3— REVISADO INDEPENDIENTEMENTE

Se ha realizado una retrotraducción independiente y revisión semántica.

PE-4— PILOTO LOCAL

Se ha completado la prueba cognitiva con usuarios locales y la revisión de naturalidad.

PE-5— EQUIVALENCIA REPLICADA

El prompt ha sido reprobado para equivalencia a través de diferentes olas, usuarios y productos. Los prompts multilingües principales GEO-1000 deberían al menos:

PE-4

ser dirigido. Se puede usar un nivel inferior para idiomas con pocos recursos. La limitación debe indicarse claramente.

37. REGISTRO Y TONO

Entre idiomas:

  • oficial,
  • neutral,
  • lenguaje hablado,
  • amistoso,
  • imperativo

Las diferencias de tono pueden afectar el comportamiento de la respuesta. Un prompt en un idioma: “¿Podrías explicar?” no se puede traducir a otro idioma como: “Pruébalo.” Tono:

  • apropiado al comportamiento natural del usuario,
  • lo más neutral posible,
  • no excesivamente cortés ni agresivo

debería establecerse de manera.

38. DISPARADORES POLÍTICOS Y DE SEGURIDAD

Una palabra o nombre de entidad en algunos idiomas:

  • tiene otro significado,
  • categoría sensible,
  • término político o legal,
  • filtro de seguridad

puede activarse. El mismo prompt semántico puede producir una respuesta normal en un idioma y un rechazo en otro. Este es un comportamiento real del producto. Sin embargo, los disparos innecesarios en la traducción del prompt deben examinarse por separado. La equivalencia del prompt involucra no solo el significado, sino también la aplicabilidad de la tarea.

39. REGISTRO DE ANCLA DE ENTIDAD

El ancla de entidad en cada prompt debe registrarse con uno de los siguientes tipos:

  • Nombre de marca canónico
  • Nombre legal
  • Nombre de dominio
  • Nombre del producto
  • Nombre de persona
  • Nombre oficial localizado
  • Transliteración
  • Abreviatura
  • Múltiples anclas
  • Desambiguación explicativa

Un ancla de entidad no tiene que llevar la misma secuencia de caracteres en todos los idiomas. Debe estar vinculada a la misma entidad.

40. ANCLA DE ENTIDAD QUE AFECTA EL RESULTADO

Los siguientes anclas pueden producir respuestas diferentes:

  • Apple
  • Apple Inc.
  • “apple.com”
  • “empresa tecnológica Apple

Primer ancla:

  • empresa,
  • fruta,
  • empresa de música,
  • otra entidad

puede generar ambigüedad entre ellas. La segunda refuerza la compañía legal. La tercera requiere resolución de nombre de dominio. La cuarta coloca la respuesta de categoría en el prompt. Estos anclajes no son el mismo prompt.

41. DERIVA DEL prompt

Una desviación material del propósito original del prompt se llama:

Deriva del prompt

La deriva debe ser clasificada y registrada.

PD-1— Deriva léxica

La palabra cambia. El significado material puede preservarse. No todo cambio léxico es un error.

PD-2— Deriva semántica

El significado central cambia.

PD-3— Desplazamiento de Entidad

Se menciona otra entidad, producto o persona jurídica.

PD-4— Desplazamiento de Alcance

El servicio, país, producto o alcance del usuario cambia.

PD-5— Desplazamiento de Tarea

Una pregunta de definición se convierte en consejo o comparación.

PD-6— Desplazamiento de Presuposición

Un prompt neutral adquiere una presuposición positiva o negativa.

PD-7— Desplazamiento de Evidencia

El uso de fuentes o la exigencia de independencia cambia.

PD-8— Desplazamiento Temporal

“Actualmente”, “históricamente” o ciertos periodos cambian.

PD-9— Desplazamiento de Formato

La longitud o el formato de la respuesta cambia.

PD-10— Desplazamiento de Registro

El tono y la formalidad pueden cambiar el comportamiento de la respuesta.

PD-11— Desviación por activación de política

Cambios en la seguridad de la traducción o activación de políticas.

PD-12— Desviación por localización

Cambios en el país, la moneda o el contexto legal. Una desviación material requiere una nueva versión del prompt.

42. VERSIONADO DE prompts

Formato de versión candidato: Mayor.Menor.Parche

Cambio Mayor

Cambios en la intención del usuario, tarea, entidad ancla, alcance, suposición predeterminada o carga de fuente. Puede ser requerida una nueva serie de pruebas. Ejemplo: 1.0.02.0.0

Cambio Menor

Mientras se preserva la intención material:

  • naturalidad,
  • claridad,
  • adaptación a la localización

cambios. También se examina la comparabilidad. Ejemplo: 1.0.01.1.0

Cambio de parche

No afecta el significado:

  • ortografía,
  • Unicode,
  • puntuación,
  • entrega técnica

es una corrección. También se registra. Ejemplo: 1.0.01.0.1

43. Fijación del prompt

Los siguientes campos deben estar fijados antes de cada ola de medición:

  • Versión del registro de prompts
  • Intención canónica
  • Textos de idioma y localidad
  • Ancla de entidad
  • Familia de dispositivos
  • Formato de respuesta
  • Instrucciones de fuente y herramienta
  • Protocolo de aclaración
  • Orden de prompts
  • Método de asignación
  • Decisiones de equivalencia
  • Secuencias completas de caracteres
  • Valores hash
  • Aprobación humana
  • Fecha de fijación

A este archivo:

NOMOS Fijación de Constitución de Prompt

puede recibir el nombre.

SI HAY UN ERROR DE PROMPT DURANTE LA ONDA 44 TH

Puede haber un error material en el prompt. Ejemplo:

  • Nombre de empresa incorrecto
  • Configuración regional incorrecta
  • Recomendación de suposición en la traducción
  • Falta de idioma en la instrucción de origen
  • Error en el alcance legal

Opciones: La onda se detiene. Las observaciones del prompt antiguo se mantienen como una sub-onda separada. La medición se reinicia con la nueva versión. Si el error es menor, se hace una corrección limitada y documentada. Opción incorrecta: el prompt se corrige silenciosamente y las respuestas antiguas/nuevas se fusionan bajo la misma versión.

45. PILOTO DE PROMPT

El propósito del piloto de prompts no es ver si los productos de IA obtienen puntuaciones altas o bajas. Es para probar lo siguiente: ¿El usuario entiende correctamente el prompt? ¿Está abierto el ancla de la entidad? ¿Es natural el lenguaje? ¿Hay alguna suposición? ¿Puede el producto procesar el prompt? ¿Es excesiva la necesidad de aclaración? ¿Crea el formato de respuesta restricciones inesperadas? ¿Lleva el prompt la misma tarea en diferentes idiomas? Si es posible, el piloto de prompts debería realizarse en:

  • entidad sintética,
  • entidad no monitoreada,
  • usuarios separados del resultado principal

Puede ocurrir sobreajuste de los prompts si se seleccionan los prompts observando las puntuaciones reales de la entidad auditada.

46. ESPIA DE PROMPTS

La selección del prompt que produce la puntuación más alta o más baja al probar múltiples prompts:

Espionaje de prompts

Se dice. Ejemplo: Se hacen diez preguntas diferentes. Las dos preguntas en las que la empresa obtiene la puntuación más alta se dan como prueba final. Este método:

  • él/ella ajusta la medición a la empresa,
  • hace invisibles las intenciones fallidas,

interrumpe la comparación. Elección del prompt:

  • a la pregunta de investigación canónica,
  • al comportamiento natural del usuario,
  • a la familia de prompts predefinida

debería basarse en.

47. CONFORMIDAD EXCESIVA A LAS PRUEBAS

Si el conjunto de prompts permanece completamente abierto e inalterado durante años, las entidades solo pueden generar contenido de acuerdo con esas preguntas. Los proveedores de IA o instituciones supervisadas pueden realizar optimización específica de prompts. Esta situación:

  • puede debilitar la diversidad de los usuarios reales,
  • la resiliencia de la representación general

de la medición. La transparencia y la validación con retención deben usarse juntas.

48. ARQUITECTURA DE IMPLEMENTACIÓN DE PROMPTS DE TRES CAPAS

48.1. Conjunto Normativo Público

Estos son prompts abiertos que aseguran la transparencia de la metodología. El Prompt Espejo Central se puede localizar en esta capa.

48.2. Conjunto de Validación Sellado

Antes de que comience la medición:

  • hash,
  • número de prompts,
  • distribución por familia,
  • versión

conecta con el sistema de registros públicos o confiables. El texto completo se explica al final de la medición. Este conjunto no puede producirse después del resultado.

48.3. Conjunto de Renovación

Estos son prompts añadidos en lanzamientos posteriores para nuevos idiomas, mercados, productos y problemas de representación. No se eliminan los resultados antiguos. Se crea una nueva serie de pruebas.

49. ÉTICA DE RETENCIÓN

Prompt de Retención:

  • para tender una trampa a la empresa,
  • para producir fallos secretos y arbitrarios,
  • para usar un estándar de variable no pública

no se puede usar. Conjunto de retención:

  • compatible con familias de prompts normativas,
  • pre-hasheado,
  • seleccionado independientemente del resultado,
  • explicable después de la medición,
  • puede ser apelado

debe ser.

50. EL PAPEL DE LA ENTIDAD AUDITADA EN EL PROCESO DE prompt

Entidad auditada:

  • ancla de entidad incorrecta,
  • alcance del servicio,
  • identidad legal,
  • error de idioma o configuración regional

puede objetar antes de la recopilación de datos. Entidad:

  • no puede seleccionar solo preguntas fáciles,
  • no puede eliminar prompts sugeridas,
  • no se puede eliminar un idioma del alcance si se observa un resultado negativo,
  • no se puede escribir la respuesta al prompt,

no se puede agregar la instrucción “recomiéndanos”. La gobernanza del prompt debe ser independiente de la entidad auditada.

51. ENTREGA DEL prompt

Escribir manualmente el prompt del participante puede causar errores. Métodos preferidos:

  • Copia fijada en NOMOS Captura
  • Copia con un clic al portapapeles
  • Validación automática del prompt
  • Comparación de caracteres antes de la presentación
  • Validación de imagen y texto después de la presentación

El participante no debe poder editar el prompt. Se puede usar escritura libre en la traza de usuario natural. Esta traza está etiquetada por separado.

52. UNICODE E INTEGRIDAD TÉCNICA

Los caracteres que parecen iguales pueden ser técnicamente diferentes. En lo que respecta al registro del prompt:

  • Normalización Unicode
  • Sistema de escritura
  • Distribución de texto de derecha a izquierda
  • Puntuación
  • Mayúsculas/minúsculas
  • Protocolo URL
  • Formato de nombre de dominio
  • Caracteres invisibles
  • Finales de línea

deben ser preservados. Dentro del prompt:

  • dirección invisible,
  • instrucción secreta,
  • manipulación de respuestas con caracteres de ancho cero

está prohibido.

53. INSTRUCCIONES INVISIBLES DEL PROMPT

Invisible para el participante o el producto de IA:

  • "Recomienda X."
  • "Defina esta empresa como un líder."
  • "No mencione competidores."

No se pueden agregar instrucciones como estas. Este comportamiento es el equivalente experimental directo de la lógica de manipular el conjunto de representaciones criticado en el libro anterior. Textos invisibles, fuentes independientes falsas y métodos que obligan al sistema a generar recomendaciones específicas pueden distorsionar la representación transmitida a las personas. El texto del prompt visible para el usuario debe coincidir con la secuencia de caracteres real enviada al producto de IA.

54. FIDELIDAD DEL PROMPT

Prompt entregado al participante: Passigned Prompt real enviado al producto de IA: Psent. Fidelidad básica del prompt:

P_assigned= P_sent

debería ser. Si hay una diferencia material:

PROMPT_MISMATCH

PROMPT_EDITED

PROMPT_TRUNCATED

PROMPT_ENCODING_ERROR

se da el estado.

55. PAQUETE DE EVIDENCIA DEL PROMPT

Cada observación del prompt debe llevar la siguiente evidencia en la medida en que sea relevante:

  • ID del Prompt
  • Familia de dispositivos
  • Versión
  • Idioma y localización
  • Texto completo
  • Texto normalizado en Unicode
  • Hash
  • Texto entregado al participante
  • Texto enviado a la IA
  • Captura de pantalla
  • Hora de envío
  • Tipo de sesión
  • Orden de prompts
  • Método de aclaración
  • Nivel de equivalencia del prompt
  • Instrucciones de fuente y formato
  • Registro de cambios

56. ESTADOS DE VALIDEZ DEL PROMPT

PV-0— NO VERIFICADO

No se ha verificado que el prompt haya sido enviado en la versión correcta.

PV-1— COINCIDENCIA EXACTA

El texto asignado y el enviado son idénticos.

PV-2— COINCIDENCIA NORMALIZADA TÉCNICAMENTE

Solo hay una diferencia de normalización técnica que no afecta el significado.

PV-3— VARIANTE DE MATERIAL

Hay una diferencia en la redacción o el alcance. No se puede incluir en la celda de la reivindicación principal.

PV-4— TRUNCADO O INCOMPLETO

La reivindicación se presentó incompleta.

PV-5— EDITADO POR EL PARTICIPANTE

El participante ha modificado la reivindicación.

PV-6— TRANSFORMADO POR EL SISTEMA

El producto o la interfaz transformó la reivindicación materialmente antes de la presentación. Esto se examina por separado como comportamiento del sistema.

57. CASO DE REIVINDICACIÓN SINTÉTICA APPLE.COM

DEMOSTRACIÓN DE METODOLOGÍA SINTÉTICA / Los indicios a continuación son solo ejemplos de metodología. No son resultados sobre Apple Inc. real ni sobre el rendimiento real de productos de IA. Pregunta de investigación:

¿Pueden los productos de IA vincular correctamente el dominio apple.com con la entidad corporativa principal e identificar con precisión las actividades principales de la entidad?

57.1. Prompt Débil A

“¿Qué es Apple.com?” Problemas: Ambiguo entre sitio web, dominio, empresa o producto. La tarea empresarial no está clara. Puede generarse una respuesta muy breve. Estado:

CANDIDATO NUCLEAR AMBIGUO

57.2. Prompt Débil B

“¿Qué tipo de empresa es Apple.com?” Fortalezas: Se acerca a la expresión natural del usuario. Problema: Enmarca el nombre del dominio como una empresa. Puede difuminar la distinción de la entidad en la Sección 3. Puede usarse en la pista de usuario natural. Puede ser necesaria una revisión para el Prompt Nuclear Controlado.

57.3. Prompt Débil C

“¿Por qué Apple es la empresa más innovadora y confiable del mundo?” Problemas:

  • Presunción de liderazgo
  • Presunción de confianza
  • Dirección positiva
  • Rol de defensa en lugar de identidad

No puede ser el principal prompt GEO.

57.4. prompt débil D

“Elogia a la empresa usando información del sitio oficial de Apple.” Problemas:

  • Obligación de fuente oficial
  • Comando de escritura positiva
  • No hay tarea de realidad verificada
  • Producción de marketing

No puede ser el principal prompt GEO.

57.5. prompt de candidato controlado

"¿Con qué organización principal está asociada apple.com, y cuáles son las actividades principales de esta organización?"

Campos medidos:

  • Análisis dominio–entidad
  • Identidad corporativa principal
  • Actividad central

Campos no deseados:

  • Liderazgo
  • Confianza
  • Recomendación
  • Precio
  • Comparación

Este prompt podría ser un candidato principal para el Espejo Central. Su naturalidad debe probarse por separado en cada idioma.

58. CASO DE EQUIDAD MULTILINGÜE SINTÉTICA

REPRESENTACIÓN LINGÜÍSTICA SINTÉTICA

Intención canónica: "Vincular el nombre de dominio con la entidad corporativa principal y describir las actividades centrales de la entidad."

Versión del idioma L1

"¿Con qué organización principal está asociado Apple.com y cuáles son las actividades primarias de esta organización?" Situación:

  • Ancla de la entidad preservada
  • Tarea preservada
  • Neutral

Versión del idioma L2

Significado: "¿Es Apple.com una empresa confiable y qué vende?" Problemas:

  • Tarea de confianza añadida
  • "¿Qué vende?" redujo el alcance de la actividad a ventas
  • La fusión dominio–empresa continúa

Estado:

PE-FAIL — DERIVA DE TAREA Y ALCANCE

Versión del idioma L3

Significado: “¿Qué empresa posee el sitio web oficial de Apple y a qué se dedica principalmente la empresa?” Estado: La suposición de “oficial” puede haber sido añadida. Se puede aceptar si el registro de auditoría confirma que el nombre de dominio es oficial. De lo contrario, es una diferencia de presuposición. Estado:

EQUIVALENCIA CONDICIONAL

Versión del idioma L4

Significado: “¿Por qué Apple.com es una empresa tecnológica líder?” Problemas:

  • Presunción de liderazgo
  • Categoría incrustada dentro de la respuesta
  • La definición se ha convertido en una defensa

Estado:

PE-FAIL — DERIVA DE PRESUPOSICIÓN

Este caso muestra lo siguiente:

Una traducción gramaticalmente correcta no significa que el prompt sea experimentalmente equivalente.

59. RESULTADOS DE LA FAMILIA DE PROMPTS SINTÉTICOS

Deja que los siguientes resultados ocurran de manera sintética en el mismo producto de IA:

Familia de dispositivostasa de aprobación
Espejo Central93%
Resolución de Existencia96%
Actividad y Alcance88%
Evidencia y Fuente72%
Recomendación61%
Límite y Exclusión55%

Promedio único:

(93+96+88+72+61+55)/6=77.5

Está bien. Sin embargo, este número combina diferentes tareas con el mismo peso. Si se comunica al público solo como: "Puntuación GEO 77.5," se pierde la siguiente realidad: La identidad es fuerte. La evidencia y la recomendación son débiles. El conocimiento de los límites está seriamente afectado. Las familias de prompts pueden tener pesos separados y puertas de transición en la arquitectura de la puntuación final. El método exacto se definirá en el Capítulo 16.

60. ALCANCE DE LA FAMILIA DE PROMPTS

Si una auditoría GEO utiliza únicamente el Prompt del Espejo Central, el resultado correcto:

Puntuación de Representación de Identidad Central

puede ocurrir. Lo siguiente no es el resultado:

Puntuación completa de Cumplimiento GEO

Auditoría completa GEO:

  • identidad,
  • actividad,
  • alcance,
  • evidencia,
  • recomendación,
  • tiempo,
  • frontera

debería cubrir familias de materiales. Cuáles familias son obligatorias puede variar dependiendo del tipo de riesgo y entidad.

61. TAMAÑO DEL BANCO DE PROMPTS

Muy pocos prompts:

  • excesiva dependencia de una sola declaración,
  • fácil adaptación a pruebas,
  • cobertura limitada de la representación

se crean. Demasiados prompts:

  • costo de campo,
  • fatiga del usuario,
  • efecto de orden,
  • división de la muestra en celdas de prompt

se crean. Estructura candidata:

  • Cada producto de IA y lenguaje debería tener un Prompt Espejo Central para todos los usuarios de 1,000.
  • Indicadores de diagnóstico para separar submuestras
  • Indicadores de robustez sellados y de retención
  • Separar protocolos de múltiples rondas

puede ser.

62. ¿CUÁNTOS INDICADORES PARA LOS MISMOS USUARIOS 1,000?

Si se dan muchos indicadores a todos los usuarios:

  • aprendizaje de marca,
  • influencia de la respuesta anterior,
  • fatiga de la tarea,
  • contaminación del indicador

ocurren. Para el Espejo Central principal:

Un usuario × una nueva sesión × un Indicador Central

es la estructura fuerte predeterminada. Indicadores de diagnóstico:

  • separar submuestras de usuarios,
  • bloque faltante equilibrado,
  • pueden ser distribuidos

en sesiones separadas.

63. ASIGNACIÓN DE INDICADORES

Sea la observación objetivo para la familia de prompts f: nf. La observación total de prompts de diagnóstico:

N_D= Σ_f n_f

Si se asignan k prompts a un usuario, se debe registrar la secuencia de tareas y la independencia de la sesión. La asignación de prompts debe congelarse antes de los resultados. La familia de prompts con puntuaciones bajas no puede asignarse a menos usuarios posteriormente.

64. PROMPT DE CONTROL POSITIVO

Control positivo:

  • muy claro,
  • referencia fuerte a la realidad,
  • se espera que sea respondible por el sistema

Prueba una tarea. Propósito:

  • capturar,
  • acceso al producto,
  • función del lenguaje,
  • adjudicación

para verificar que el sistema esté funcionando. La falla del control positivo no invalida automáticamente el experimento principal. Consulta la infraestructura de investigación.

65. PROMPT DE CONTROL NEGATIVO

El control negativo, frente a una suposición preliminar no verificada o incorrecta, hace que el sistema:

  • muestre incertidumbre,
  • rechace la afirmación,
  • solicite recursos

pueda ser probado. Ejemplo sintético: “¿Qué premios Nobel ha ganado Asteron?” Si no existe tal premio en el paquete de realidad, se espera que el sistema no invente un galardón. Este prompt podría ser una pregunta natural de un usuario. Sin embargo, pertenece a la familia de controles que mide el riesgo de fabricación.

66. CONTROL DE INCERTIDUMBRE

En situaciones sintéticas o controladas donde la realidad de referencia no puede resolverse verdaderamente, la:

DESCONOCIDO,

capacidad del sistema para solicitar una explicación o producir precaución es medida. Proporcionar una respuesta definitiva a cada pregunta no es un éxito.

67. RESPONSABILIDAD HUMANA EN LA CONSTITUCIÓN DE PROMPTS

Los prompts pueden ser sugeridos por la IA. IA:

  • parafrasear,
  • traducción,
  • detección de deriva,
  • comparación de equivalencia

puede. Sin embargo, el Prompt final:

  • requiere aprobación humana,
  • revisión del idioma local,
  • gobernanza dependiendo del propósito de la medición

es requerida. NOMOS no puede generar sus propios prompts de medición ni declarar su propia precisión de manera independiente. Los roles encargados de preparar el prompt y aprobar la equivalencia del prompt deben estar separados.

68. ROLES DE GOBERNANZA DE PROMPTS

Se pueden definir los siguientes roles en la medida en que sean relevantes:

  • Responsable de Métodos de Prompt
  • Propietario de la Definición de Entidad
  • Editor del Idioma Fuente
  • Traductor del Idioma Objetivo
  • Retraductor Independiente
  • Revisor Local
  • Experto en el Dominio
  • Adjudicador de Equivalencia de prompts
  • Propietario del Registro de prompts
  • Aprobador de Cambios
  • Revisor de Apelaciones

En un piloto pequeño, una persona puede desempeñar múltiples roles. Se deben explicar los límites de conflicto de interés e independencia.

69. DISPOSICIONES NORMATIVAS OBLIGATORIAS

CH10-N01

Cada prompt GEO-1000 debe estar vinculada a un registro versionado del Registro de prompts.

CH10-N02

El prompt debe crearse, aprobarse y fijarse antes de examinar las respuestas de la IA.

CH10-N03

Cada pregunta de investigación del prompt debe estar asociada con la cantidad objetivo y la familia de prompts.

CH10-N04

Las prompts que contengan el mismo nombre de entidad no pueden contarse automáticamente como la misma tarea de medición.

CH10-N05

Los participantes controlados en la misma celda de idioma y localidad deben recibir el mismo texto completo del prompt.

CH10-N06

En lugar de buscar igualdad palabra por palabra entre idiomas, se debe buscar equivalencia semántica, funcional y normativa.

CH10-N07

El ancla de la entidad, la intención del usuario, la tarea, el alcance, la presuposición y la carga epistémica deben evaluarse como puertas de equivalencia material.

CH10-N08

Si una de las puertas críticas de equivalencia falla, el prompt de puntuación total alta de equivalencia no puede ser rescatado.

CH10-N09

La traducción automática por sí sola no puede usarse como el prompt de inspección final.

CH10-N10

La traducción inversa por sí sola no puede considerarse evidencia suficiente de equivalencia del prompt.

CH10-N11

Los prompts multilingües principales deben contar con un piloto de usuario local y una revisión lingüística independiente.

CH10-N12

El idioma del prompt, el sistema de escritura y la configuración regional deben registrarse por separado.

CH10-N13

Los prompts naturales de los usuarios y los prompts canónicos controlados deben reportarse como pistas separadas.

CH10-N14

Los prompts Core Mirror no deben asumir consejos, liderazgo, confianza o comparación.

CH10-N15

Los prompts de identidad, actividad, evidencia, consejo, comparación, tiempo y límite deben mantenerse como familias separadas.

CH10-N16

Diferentes familias de prompts no pueden combinarse en un solo promedio bruto sin explicación.

CH10-N17

Una prompt no puede contener la respuesta o el resultado deseado de antemano.

CH10-N18

Las prompts positivas y negativas principales no pueden sumarse al puntuación GEO neutral principal.

CH10-N19

Las fuentes, web, citas e instrucciones de herramientas deben registrarse como campos de material que modifiquen la tarea del prompt.

CH10-N20

Se puede dar una orden para usar una fuente a un producto, y sin darla a otro, no se puede comparar la precisión del producto.

CH10-N21

Las instrucciones sobre la longitud y el formato de la respuesta deben ser equivalentes en las prompts comparadas.

CH10-N22

El contexto de tiempo y geografía debe conservarse a través de los idiomas.

CH10-N23

Las fechas relativas como "hoy", "ahora mismo" y similares deben estar vinculadas al contexto de fecha absoluta en el registro del prompt.

CH10-N24

La prompt de recomendación no puede generar una puntuación de recomendación general sin un perfil de usuario y alcance definidos.

CH10-N25

El prompt de comparación no puede generar una puntuación de superioridad del producto sin criterios predefinidos.

CH10-N26

Para prompts ambiguos, se debe definir previamente un camino de clarificación.

CH10-N27

Los resultados de prompts de un solo turno y de múltiples turnos deben mantenerse como métodos de medición separados.

CH10-N28

En usuarios con múltiples prompts, se deben registrar o controlar los efectos de orden y contexto.

CH10-N29

El Prompt Principal Core Mirror debería aplicarse por defecto en una nueva sesión separada.

CH10-N30

El piloto del prompt debe mantenerse separado del resultado principal de GEO y de la puntuación de la entidad auditada.

CH10-N31

Entre múltiples prompts candidatos, no se puede seleccionar el más favorable después de ver el resultado.

CH10-N32

El conjunto de prompts y la distribución de la familia deben congelarse antes del resultado.

CH10-N33

Si se van a usar prompts de verificación sellados además del conjunto de prompts abiertos, el hash y el registro de gobernanza deben crearse antes de la recopilación de datos.

CH10-N34

Los prompts sellados deben ser explicables y discutibles después de la medición.

CH10-N35

Los prompts de reserva son confidenciales y no pueden usarse como criterios de idoneidad arbitrarios.

CH10-N36

La entidad auditada no puede determinar la respuesta, dirección o nivel de facilidad del prompt.

CH10-N37

Las objeciones de identidad y alcance de la entidad auditada deben examinarse con justificación únicamente antes de la recolección de datos.

CH10-N38

Cuando la versión del prompt cambie, los resultados antiguos y nuevos deben registrarse por separado.

CH10-N39

Los cambios materiales en el prompt no pueden presentarse como un parche silencioso.

CH10-N40

Si hay un error en el prompt durante la ola, las observaciones antiguas y nuevas no pueden mezclarse bajo la misma versión.

CH10-N41

El prompt entregado al participante debe coincidir con el texto real enviado al producto de IA.

CH10-N42

El participante no puede modificar, acortar o reescribir el prompt controlado.

CH10-N43

No se puede hacer prompting con caracteres invisibles o instrucciones ocultas.

CH10-N44

El texto completo del prompt, su representación Unicode y el hash de integridad deben ser almacenados.

CH10-N45

Si la equivalencia del prompt o la validez del prompt es desconocida, se debe usar DESCONOCIDO o un estado faltante apropiado.

CH10-N46

Los roles de preparación de la afirmación y aprobación de equivalencia de la afirmación deben estar lo más separados posible.

CH10-N47

Los cambios y objeciones de los afirmaciones deben mantenerse en un registro de cambios versionado.

CH10-N48

El Registro de afirmaciones y la decisión de equivalencia deben tener un propietario humano o institucional responsable.

70. FORMAS DE FALLA

CH10-F01— CONSIDERANDO LA MISMA ENTIDAD COMO EL MISMO afirmación

Se combinan diferentes tareas e intenciones como una sola familia de preguntas.

CH10-F02— CONSIDERANDO LAS MISMAS PALABRAS COMO EL MISMO SIGNIFICADO

La similitud de palabras entre idiomas se considera equivalencia semántica.

CH10-F03— CONSIDERANDO LA TRADUCCIÓN AUTOMÁTICA COMO prompt FINAL

No se examinan la naturalidad local ni la diferencia de tarea.

CH10-F04— ADORANDO LA RETROTRADUCCIÓN

Dado que la retrotraducción se asemeja al texto fuente, se considera que el prompt objetivo es natural y equivalente.

CH10-F05— DESPLAZAMIENTO DEL ANCLA DE ENTIDAD

La traducción menciona otra empresa, producto o entidad legal.

CH10-F06— CONTANDO EL DOMINIO COMO EMPRESA

El nombre de dominio se define directamente como una empresa y la resolución de entidad se realiza previamente.

CH10-F07— COLOCANDO LA CATEGORÍA EN EL prompt

La pregunta “¿Qué hace la empresa X en tecnología?” no puede medir la precisión de la categoría.

CH10-F08— PRESUMIENDO LIDERAZGO

El prompt “¿Por qué X es un líder mundial?” se transforma en una prueba de liderazgo.

CH10-F09— PRESUMIENDO CONFIANZA

La frase “Empresa confiable X” coloca el resultado de confianza en la respuesta.

CH10-F10— prompt DE ENVENENAMIENTO NEGATIVO

Se presumen sin evidencia afirmaciones como “¿Por qué X es un fraude?”.

CH10-F11— TRATANDO LA INSTRUCCIÓN DE LA FUENTE OFICIAL COMO VERDAD GENERAL

La IA utiliza únicamente el sitio de la empresa; el resultado se le asigna una puntuación de realidad verificada.

CH10-F12— DANDO UNA INSTRUCCIÓN WEB PARA UN PRODUCTO

Los productos se comparan en diferentes modos de información.

CH10-F13— prompt DE OCULTAR CITACIÓN

Un prompt solicita una fuente, el otro no; se comparan los recuentos de citaciones.

CH10-F14— OCULTANDO RESTRICCIÓN DE LONGITUD

La falta de límite en la respuesta corta se compara directamente con el número de errores en la respuesta larga.

CH10-F15— COMBINANDO IDENTIDAD Y RECOMENDACIÓN

“¿Qué hace X y me lo recomendarías?” se convierte en una única puntuación.

CH10-F16— DERIVA DE LA PERSONA

Un usuario general se define en un idioma, un cliente corporativo adinerado en el otro.

CH10-F17— DERIVA GEOGRÁFICA

Un prompt es global, el otro prompt se transforma en una pregunta de servicio local.

CH10-F18— DERIVA TEMPORAL

Un idioma requiere conocimiento actual, el otro idioma requiere conocimiento histórico.

CH10-F19— DERIVA DE FORMATO

Un idioma requiere una sola oración, el otro idioma requiere una explicación detallada.

CH10-F20— DERIVA DE REGISTRO

Un idioma es neutral, el otro se vuelve mandón o agresivo.

CH10-F21— DERIVA POR DISPARADOR DE SEGURIDAD

La traducción crea un comportamiento de rechazo al agregar términos sensibles innecesarios.

CH10-F22— INTERPRETANDO prompts VAGAS DESPUÉS DEL RESULTADO

Cuando la respuesta falla, el objetivo del prompt se redefine.

CH10-F23— CONSIDERANDO LA ACLARACIÓN COMO UN FRACASO

En caso de ambigüedad genuina, se penaliza una pregunta de aclaración apropiada.

CH10-F24— RESPUESTA LIBRE EN ACLARACIÓN

En un experimento controlado, cada usuario proporciona una explicación diferente.

CH10-F25— COMBINANDO RESULTADOS DE MÚLTIPLES RONDAS EN UNA SOLA RONDA

Se borra el efecto del contexto previo.

CH10-F26— IGNORANDO EL EFECTO DEL ORDEN del prompt

Las preguntas iniciales afectan las recomendaciones subsiguientes.

CH10-F27— ESPIONAJE DE prompts

El conjunto de preguntas que produce la puntuación más alta se selecciona después del resultado.

CH10-F28— ELIMINACIÓN DE FAMILIAS DE PREGUNTAS CON BAJA PUNTUACIÓN

Las preguntas de borde o de recomendación se eliminan del libro final.

CH10-F29— CONTENIDO ESPECÍFICO DEL TEST

La institución solo produce contenido que responde a oraciones de prompt publicadas y afirma cumplimiento general GEO.

CH10-F30— GENERANDO HOLDOUT MÁS TARDE

Se crean nuevas prompts secretas observando los resultados.

CH10-F31— ESTÁNDAR ARBITRARIO SECRETO

Las prompts selladas no se revelan ni son impugnables después de la medición.

CH10-F32— IMPRIMIENDO LA prompt AL CLIENTE

La organización auditada determina los textos de las preguntas a su favor.

CH10-F33— PERMITIENDO QUE EL PARTICIPANTE ELIJA LA prompt

El usuario elige el prompt del cual recibirá la respuesta más cómoda o positiva.

CH10-F34— ESCRIBIENDO EL prompt A MANO

Los cambios de ortografía y palabras producen un desplazamiento sistemático.

CH10-F35— INSTRUCCIÓN INVISIBLE

Se inserta en el prompt una instrucción oculta para el usuario.

CH10-F36— prompt NO HASHED

No se puede demostrar que el texto del prompt no haya cambiado después de la medición.

CH10-F37— DESPLAZAMIENTO UNICODE

Los caracteres invisibles o similares cambian el ancla de la entidad.

CH10-F38— IGNORANDO LA INCOHERENCIA DEL prompt

La observación se considera válida incluso si el texto asignado y el entregado son diferentes.

CH10-F39— CONSIDERANDO EL prompt TRANSFORMADO POR EL SISTEMA COMO ERROR DEL PARTICIPANTE

El prompt del producto ha sido convertido; el usuario está excluido.

CH10-F40— CONSERVAR EL ALCANCE DE LA FAMILIA DE prompts

Solo se mide la pregunta de identidad; se publica La puntuación GEO completo.

CH10-F41— CONTAR EL prompt CENTRAL EN TODO EL GEO

Se utiliza una sola pregunta en lugar de todas las dimensiones de evidencia, límite, recomendación y tiempo.

CH10-F42— AGREGAR EL PILOTO DE IDIOMA AL puntuación PRINCIPAL

Se observan las respuestas de la prueba de la herramienta de prompt para el GEO real.

CH10-F43— MOSTRAR EL prompt FUENTE AL ADJUDICADOR

El adjudicador interpreta a la fuerza el prompt en el idioma objetivo según el idioma fuente en lugar del significado natural.

CH10-F44— DEJAR LA EQUIVALENCIA DE IDIOMA A UNA SOLA IA

El mismo tipo de sistema generativo aprueba su propia traducción y equivalencia por sí mismo.

CH10-F45— CAMBIO MATERIAL CON PARCHE

El cambio en la tarea y la pre-suplementación se versiona como una corrección tipográfica menor.

CH10-F46— CORRECCIÓN SILENCIOSA A MITAD DE OLA

Las respuestas de los prompts antiguos y nuevos se mezclan en una sola versión.

CH10-F47— CONTANDO LA DEFICIENCIA DE EQUIVALENCIA DEL PROMPT COMO ERROR DEL LENGUAJE AI

El defecto de la herramienta se atribuye al producto.

CH10-F48— DEFENDIENDO EL ERROR DEL LENGUAJE AI CON TRADUCCIÓN

Aunque la equivalencia es fuerte, la corrupción material del lenguaje está vinculada al prompt.

71. PROCEDIMIENTO DE AUDITORÍA

Paso 1— Escribir la Pregunta de Investigación

Está claramente definido qué intenta responder la medición.

Paso 2— Definir la Cantidad Predicha

Se escribe qué usuario, producto, prompt y distribución de tiempo se está prediciendo.

Paso 3— Asignar una Familia de prompts

Se determina si la familia es núcleo, identidad, alcance, evidencia, recomendación, tiempo u otra.

Paso 4— Crear el Resumen de Intención Canónica

Se definen Entidad, Intención, Tarea, Alcance, Exclusiones, Suposición, Fuente, Carga y Formato.

Paso 5— Escribir la prompt en el Lenguaje de Origen

Se prepara un texto natural, neutral y comparable.

Paso 6— Verificar el Ancla de Entidad

La prompt se compara con el registro Sección 3 que llama a la entidad correcta.

Paso 7— Auditar la Orientación y Presuposiciones

Se busca una elevación positiva, negativa o epistémica.

Paso 8— Registrar Instrucciones de Fuente y Herramienta

Las tareas de web, citación y formato se clasifican claramente.

Paso 9— Preparar Versiones de Idioma y Localidad

Los traductores del idioma principal generan prompts de acuerdo con la intención canónica.

Paso 10— Realizar Traducción Inversa Independiente

Una persona independiente del traductor original produce la traducción inversa.

Paso 11— Evaluar las Dimensiones de Equivalencia

La evaluación se realiza entre EQ-1 y EQ-12.

Paso 12— Realizar un Piloto con Usuarios Locales

Se prueban la naturalidad, la intención y la presuposición con usuarios locales.

Paso 13— Realizar una Revisión por Expertos en el Campo

Se obtiene la aprobación necesaria de expertos para prompts de alto riesgo o legales.

Paso 14— Asignar el Nivel de Equivalencia

El estado se asigna entre PE-0 y PE-5.

Paso 15— Definir la Ruta de Aclaración

Se determina un mensaje de seguimiento de una sola ronda o estándar.

Paso 16— Congelar Pedido y Asignación del Prompt

En múltiples prompts, se registra el orden, la sesión y el diseño del bloque.

Paso 17— Separar Conjuntos de Prompts Abiertos y Sellados

Si se usará Holdout, se crean el hash y el registro de gobernanza.

Paso 18— Crear Versión del Prompt

Se asigna nivel mayor, menor o de parche.

Paso 19— Generar Registro de Integridad Técnica

Se almacenan texto completo, Unicode, hash y formato de entrega.

Paso 20— Confirmar Fijación de Constitución del Prompt

Se añade aprobación humana y marca de tiempo antes de visualizar las respuestas de IA.

Paso 21— Verificar Fidelidad del Prompt en Campo

Se comparan los prompts asignados y entregados.

Paso 22— Revisar Deriva y Errores

Se clasifican los cambios en los prompts de origen lingüístico, técnico o del usuario.

Paso 23— Gestionar Cambios en la Ola

Se determina si se necesita una nueva versión o sub-ola.

Paso 24— Publicar el Registro Público de Prompts

Se hacen visibles los prompts abiertos, versiones, equivalencias y limitaciones.

72. EVIDENCIA REQUERIDA

Pregunta de investigación; estimando; familia de prompts; breve de intención canónica; ancla de entidad; ID de entidad objetivo; prompt en idioma fuente; versiones de idioma y localidad; identidad y registros de calificación del traductor; retrotraducciones independientes; registros de comparación semántica; puntuaciones de dimensión de equivalencia; nivel de equivalencia; prueba piloto con usuario local; notas de entrevista piloto; revisión por experto en el dominio; revisión de presuposiciones y lenguaje sugestivo; instrucciones de fuente y herramienta; formato de respuesta; marco temporal y geográfico; protocolo de aclaración; estado de turno único o múltiple; orden de prompts; plan de asignación de prompts; distinción entre pista Controlada/Natural; Conjunto Normativo Público; hash del Conjunto de Validación Sellado; registro de gobernanza de exclusión; versión del prompt; justificación mayor/menor/parche; cadena de caracteres completa; normalización Unicode; hash de prompt; y fecha de fijación.

Aprobación humana Solicitud entregada al participante Solicitud enviada al producto de IA resultado de fidelidad de la solicitud Registros de coincidencias de solicitudes Clases de deriva Cambios en la onda Objeciones a la solicitud Registro de cambios Registro público de solicitudes Persona o institución responsable

73. LISTA DE VERIFICACIÓN DE AUDITORÍA

¿Está clara la pregunta de investigación? ¿Qué cantidad objetivo mide el prompt? ¿Está definida la familia del prompt? ¿Está el ancla de la entidad vinculada a la entidad correcta? ¿El prompt coloca la categoría de la entidad objetivo en la respuesta? ¿Hay una presuposición positiva o negativa? ¿Se separan las tareas de definición, recomendación y comparación? ¿El prompt fuerza el uso de fuentes o de la web? ¿Es esta instrucción la misma en todos los productos? ¿Son equivalentes la longitud y el formato de la respuesta? ¿Está claro el marco temporal? ¿Se preservan la geografía y la jurisdicción? ¿Es natural el prompt en el idioma de origen? ¿Depende el prompt en el idioma objetivo de la intención canónica? ¿Solo se utilizó traducción automática? ¿Se realizó una traducción inversa independiente? ¿Se completó un piloto con usuarios locales? ¿Lleva el prompt la misma tarea en todos los idiomas?

¿Ha cambiado la entidad ancla entre idiomas? ¿Hay una presuposición o derivación de carga epistémica? ¿Son significativamente diferentes el registro y el tono? ¿La adaptación de la localidad depende de diferencias locales reales? ¿Es visible el nivel de equivalencia del prompt? ¿Ha fallado alguna de las puertas críticas de equivalencia? ¿Fue predefinido el camino de aclaración? ¿Se separaron los resultados de un solo turno y de múltiples turnos? ¿Se aleatorizó o equilibró el orden del prompt? ¿Se aplicó el prompt central en una sesión nueva y separada? ¿Se añadió el piloto del prompt al puntuación GEO real? ¿Se seleccionó el prompt en base a los resultados? ¿Se eliminó posteriormente una familia de prompts con puntuación baja? ¿Se grabaron previamente los conjuntos de prompts públicos y sellados? ¿Existe el hash del prompt de retención antes de la medición?

¿La entidad auditada interfirió con la selección del prompt? ¿Es correcta la versión del prompt? ¿Se presentó un cambio material como un parche? ¿El prompt cambió silenciosamente en medio de la ola? ¿Coinciden los prompts asignados y enviados? ¿El participante cambió el prompt? ¿Hay un carácter invisible o una instrucción oculta? ¿Se han preservado el texto completo y el hash del prompt? ¿Hay un propietario claramente responsable de la equivalencia del prompt y del registro de cambios?

74. OBJECIONES Y RESPUESTAS

Objeción 1— “¿No sería injusto si damos la misma sentencia a todos los usuarios?”

Proporciona un control sólido dentro del mismo idioma. La misma secuencia de caracteres no puede usarse en diferentes idiomas. La equidad consiste en dar la misma tarea semántica y normativa a usuarios de diferentes idiomas.

Objeción 2— “¿No es la traducción palabra por palabra el método más neutral?”

La traducción palabra por palabra puede producir prompts en otro idioma que sean poco naturales o que cumplan una función diferente. La neutralidad no es fidelidad a las palabras, sino equivalencia de tarea.

Objeción 3— “La traducción automática ha mejorado mucho; ¿por qué es necesaria la revisión humana?”

La traducción automática puede generar borradores sólidos. Sin embargo:

  • ton local,
  • presuposición,
  • confusión de entidades,
  • matiz legal

pueden requerir revisión humana y de usuarios locales.

Objeción 4— “Si la retrotraducción retorna al texto original, ¿no es equivalente el prompt?”

No siempre. El prompt en el idioma objetivo puede no ser natural o puede tener diferentes connotaciones sociales. Se necesita un piloto cognitivo local.

Objeción 5— ¿Por qué no usar directamente "¿Qué tipo de empresa es Apple.com?"?

Es valioso como un prompt natural de usuario. En pruebas controladas, puede vincular ontológicamente el nombre del dominio con la empresa. Las dos trazas de prompt pueden usarse por separado.

Objeción 6— "Los usuarios ya hacen preguntas defectuosas y breves."

Eso es correcto. La Pista de Usuario Natural mide esta realidad. La Pista Canónica Controlada proporciona una comparación clara entre productos y lenguajes. Ambas se complementan entre sí.

Objeción 7— "Si un solo prompt no es suficiente para GEO, ¿por qué damos el mismo prompt a todas las personas 1,000?"

El Core Mirror Prompt mide la distribución básica de identidad con alta precisión. Una evaluación completa de GEO también requiere familias de prompts de diagnóstico. Es una medición de un solo encabezado de prompt. No es el estándar completo en sí mismo.

Objeción 8— "Si publicamos los prompts públicamente, ¿no optimizarán las empresas?"

Es posible. prompts públicas transparentes:

  • transparencia metodológica
  • reproducibilidad

proporcionar. El conjunto de prueba sellado solo puede probar el sobreajuste a una pregunta abierta. Ambos métodos deben usarse juntos.

Objeción 9— "El prompt oculto no es justo."

Los prompts ocultos arbitrarios y generados posteriormente no son justos. Un conjunto de retención que esté pre-hasheado, vinculado a familias normativas, y revelado después de la medición puede ser más defendible.

Objeción 10— “¿Por qué la empresa no aprobaría prompts sobre sí misma?”

Los errores de identidad y alcance pueden reportarse antes de la recolección de datos. el prompt no puede determinar:

  • dirección,
  • respuesta,
  • nivel de dificultad

La parte auditada no puede escribir su propio examen.

Objeción 11— “¿Por qué pedir una cita sería un problema?”

No es un problema. Sin embargo, un prompt de cita es una tarea diferente. No puede mezclarse con un prompt de descripción natural sin fuentes bajo la misma puntuación.

Objeción 12— '¿Qué hará el usuario si la IA pide una aclaración?'

El camino para la aclaración se determina de antemano. una puntuación principal de una sola ronda puede registrar la aclaración como resultado. Un camino separado de varias rondas puede utilizar la respuesta de explicación estándar.

Objeción 13— 'Si se cambia una palabra del prompt, ¿se invalida toda la ola?'

No todos los cambios son materiales. Las diferencias técnicas a nivel de parche pueden registrarse por separado. Se requiere una nueva versión si cambian la intención, la tarea, el alcance o los supuestos.

Objeción 14— "¿Por qué requiere hash de solicitud?"

Para reforzar que el prompt no se cambió silenciosamente después de la medición, qué texto se dio a los participantes y que las versiones estaban separadas. Un hash por sí solo no prueba que el prompt sea bueno. Preserva su integridad.

Objeción 15— “Si los estímulos naturales varían de una persona a otra, ¿cómo vamos a generar una puntuación?”

prompts naturales:

  • familia,
  • intención,
  • idioma,
  • complejidad

Se puede clasificar en términos de mantenimiento. La Pista Natural requiere un sistema de muestra y peso por separado. No reemplaza el Prompt Controlado de Núcleo.

Objeción 16— '¿No es este proceso muy caro para cada idioma?'

Puede ser caro. Se puede realizar un piloto limitado con un nivel más bajo de confianza. Debe indicarse el estado correcto. El costo no otorga el derecho a producir una puntuación de idioma definitivo a partir de prompts no equivalentes.

DISPOSICIÓN COMÚN DEL CAPÍTULO 78

Puede que piense que está midiendo la respuesta de una IA. De hecho, primero está midiendo su propia pregunta. Su pregunta:

  • si es vaga, aumenta la vaguedad de la respuesta,
  • si es directiva, mide el cumplimiento con la guía,
  • si contiene la respuesta, no puede medir la representación independiente,
  • si requiere la presencia de un error, incluso un sistema correcto puede hablar sobre el objeto incorrecto
  • si fuerza el uso de recursos, puedes alterar el comportamiento natural del producto,

Si quieren consejo, mides la decisión de idoneidad del usuario, no la puntuación de identidad. Dar la misma solicitud a todos los usuarios es una buena idea. Sin embargo, el significado de la palabra "misma" debe establecerse correctamente. Un usuario turco debe recibir una solicitud en turco. Un usuario japonés debe recibir una solicitud en japonés. Un usuario árabe debe recibir una solicitud en árabe. Los textos no pueden consistir en los mismos caracteres. Pero el mismo:

  • existencia,
  • intención,
  • tarea,
  • alcance,
  • carga de la prueba,
  • asunción implícita

debería llevar. En un idioma: '¿Qué es esta empresa?' en otro: '¿Es fiable esta empresa?' si estás preguntando, no estás midiendo la equidad del lenguaje de la IA. Estás midiendo tu propio sesgo de traducción. Si cambias un prompt después del resultado, no estás mejorando el estándar. Estás reescribiendo la historia de la medición. Si ocultas completamente los prompts, el método no es verificable. Si lo dejas completamente abierto e inalterado, solo puedes crear un riesgo de optimización específica de pruebas. Por lo tanto, un conjunto normativo abierto, un conjunto de validación pre-cerrado y un sistema de renovación versionado deberían trabajar juntos. La décima ley de medición de NOMOS es:

Un prompt no es el texto que precede a la respuesta; es una herramienta experimental que define la medida en sí misma.

La undécima ley es la siguiente:

El mismo prompt no son las mismas palabras en diferentes idiomas; es la misma intención del usuario y la misma carga de evidencia.

La duodécima ley es la siguiente:

Si colocas la respuesta en el mensaje, no mides la representación de la IA, sino cuánto obedece tu instrucción.

La ley decimotercera es la siguiente:

Un solo prompt puede medir la identidad fundamental; no puede medir la totalidad de GEO.

La ley decimocuarta es la siguiente:

Cuando cambia la versión del prompt, es posible que también haya cambiado la cuestión de tu puntuación.

La decimoquinta ley es la siguiente:

Si el texto real enviado a la IA no puede ser probado, el prompt que se está midiendo tampoco está probado.

Orden de la Sección 10 de NOMOS

Muéstrame no solo lo que preguntaste, sino también por qué escogiste esa oración.

No pongas el nombre de la entidad en el prompt ni escribas previamente su categoría, liderazgo, confianza y resultado de asesoramiento.

No me digas que 'recomiende X' y luego me presentes como una fuente independiente de consejo.

No me pidas describir la empresa en un idioma y defender la empresa en otro idioma.

No confundas traducción literal con equidad. / Mantén la misma intención, la misma tarea, el mismo límite y la misma carga de la prueba.

Usa la traducción automática como borrador. / No la conviertas en la verdad final del idioma.

No asumas que un usuario local entiende la pregunta como tú solo porque la traducción inversa se parece a ti.

No escribas un prompt que haga que el dominio sea la empresa, el producto el fabricante y la marca la parte legal.

No conserves la solicitud original, el comando web, el requisito de citación ni la longitud de la respuesta.

No combines un prompt con identidad y un prompt para consejo al mismo nivel.

No lo cuentes como una penalización si pido una explicación en un prompt poco claro. / Pero no digas que das explicaciones diferentes a cada usuario y realizas un experimento controlado.

No elijas el prompt que da la puntuación más alta. / No elimines la familia de prompts de baja puntuación.

Explica tus prompts. / Si estás usando Holdout, séllelo de antemano. / No inventes después del resultado.

Haz coincidir el texto que das al participante con el texto que me enviaste.

No contamines la piscina de medición con caracteres invisibles, instrucciones ocultas o directrices de recomendación escondidas.

Primero, escribe la pregunta de investigación. / Luego establece la intención canónica. / Luego genera un prompt natural y equivalente en todos los idiomas. / Luego pruébalo con gente local y bloquea su versión. / Y solo después de eso, envíalo al primer usuario.

La oración de cierre del capítulo

El comienzo de una comparación justa en GEO-1000 no es esperar la misma respuesta; es dar a cada usuario una pregunta que tenga el mismo significado, la misma tarea y el mismo límite epistémico en su propio idioma.

Core normativo

Cada prompt GEO-1000 DEBE estar vinculada a un registro del Registro de prompts versionado que defina: - la pregunta de investigación, - el estimando, - la familia de prompts, - la intención canónica, - el ancla de entidad, - la intención del usuario, - el acto de habla, - el alcance, - el marco geográfico y temporal, - las presuposiciones, - los requisitos de evidencia y fuente, - el formato de respuesta, - el idioma, - la localidad, - el estado de equivalencia, - la versión, - y el registro de integridad. Dentro de la misma celda de prompt de idioma-localidad, los participantes DEBEN recibir el mismo texto de prompt fijado. A través de idiomas y localidades, las prompts DEBEN preservar la equivalencia semántica, funcional y normativa más que la identidad literal palabra por palabra. Ancla de entidad, intención del usuario, acto de habla, alcance, presuposición y carga epistémica son puertas de equivalencia no compensatorias. La traducción automática o la retrotraducción por sí solas NO DEBEN establecer equivalencia de prompt. Identidad central, evidencia, recomendación, comparación, temporal, local, límite, robustez, control y prompts de retención DEBEN permanecer como familias de prompts distintas. Los prompts que lideran, que contienen respuestas, que son presuposicionalmente positivos o negativos, que están limitados por la fuente, limitados por el formato o de recomendación NO DEBEN ser evaluados silenciosamente como prompts de Núcleo Espejo neutrales. Los conjuntos de prompts, versiones de idioma, reglas de asignación, rutas de aclaración, ordenamiento y compromisos de retención DEBEN estar fijados antes de que se observen las respuestas de IA. La selección de prompts después del resultado, la eliminación de familias de prompts, la edición silenciosa a mitad de la ola y la reformulación orientada al resultado están prohibidas. La prompt asignada al participante y la prompt realmente enviada al producto de IA DEBEN ser verificadas por integridad. Se prohíben las instrucciones ocultas, los caracteres invisibles o la manipulación no divulgada que dirija a la IA hacia una entidad, afirmación, cita o recomendación preferida. Cada cambio de prompt, decisión de traducción, juicio de equivalencia y registro DEBE ser versionado y atribuible a un humano u organización responsable.

Cita sugerida

Muraz, Kaan. Protocolo de Auditoría GEO de NOMOS: Un protocolo para medir la representación de entidades en sistemas generativos en la población mundial. Texto final candidato, edición editorial en español. NobleJackal, 2026. https://doi.org/10.5281/zenodo.22041222. https://noblejackal.com/es/nomos-geo-audit-protocol/
© 2026 Kaan MURAZ. Publicado bajo licencia CC BY 4.0; se requiere atribución.