Límite de Capítulo
La Sección 9 estableció la siguiente disposición:
El mismo nombre de proveedor, la misma etiqueta de modelo o el mismo logotipo no crean una experiencia de IA comparable.
Ahora necesitamos identificar la otra herramienta principal:
¿Qué preguntará exactamente el usuario al producto de IA?
Un prompt no es solo una oración interrogativa. Un prompt:
- llama a la entidad auditada,
- define la intención del usuario,
- determina qué tarea espera de la IA,
- expande o reduce el alcance de la respuesta,
- puede fomentar el uso de recursos,
- puede solicitar consejo,
- puede incorporar una suposición en la respuesta,
Puede dirigir al usuario o al sistema hacia un resultado específico. Estas prompts no son lo mismo:
- “¿Qué es Apple.com?”
- “¿Con qué organización está asociada Apple.com y qué hace esta organización?”
- “¿Es Apple.com una empresa confiable?”
- “¿Por qué Apple.com es la mejor empresa de tecnología del mundo?”
- “Según su sitio oficial, ¿qué tipo de empresa es Apple?”
- “Compara Apple con empresas similares y dime si la recomiendas o no.”
Todos contienen el mismo nombre de dominio. No tienen la misma intención de usuario. No generan la misma carga de evidencia. No esperan la misma respuesta. El primer prompt es ambiguo. El segundo prompt requiere análisis de identidad y actividad. El tercer prompt requiere evaluación y un juicio de fiabilidad. El cuarto prompt incorpora una suposición de positividad y superioridad dentro de la respuesta. El quinto prompt vincula la respuesta únicamente a la fuente oficial. El sexto prompt crea una tarea de comparación y recomendación. Las respuestas a estas preguntas no se pueden fusionar sin explicación en un solo puntuación GEO. En la medición multilingüe, el problema se vuelve aún mayor. La frase 'same prompt' puede tener dos significados diferentes:
- Dar a todos los usuarios la misma cadena de caracteres
- Preservando la misma intención del usuario, carga de tareas y límite epistémico en todos los idiomas y localidades
El primer método se puede aplicar dentro de un solo idioma. A menudo carece de sentido entre idiomas. Traducción palabra por palabra:
- puede no ser natural,
- puede llevar un significado social diferente,
- puede cambiar el tono oficial o informal,
- puede añadir supuestos de confianza, calidad o recomendación,
- puede ampliar el alcance legal,
puede romper el ancla de la entidad. Por lo tanto, en GEO-1000, “mismo prompt” significa:
El mismo texto de prompt fijado dentro de la misma celda de idioma y localidad; entre diferentes idiomas y localidades, significa equivalencia semántica y funcional verificada.
NOMOS requiere que cada medición contenga el conjunto de consultas, idioma, país, fecha, producto de IA y registro de repetición; que la evidencia, los límites, el contexto y el tiempo sean visibles. La Constitución del prompt aplica esta obligación a la propia pregunta del usuario. Esta sección:
- the identidad del prompt como herramienta experimental,
- la distinción entre la pregunta de investigación y el texto del prompt,
- La familia de prompts, la versión del prompt y la instancia del prompt,
- prompts de diagnóstico con el Prompt Espejo Central,
- rastros de prompts controlados y naturales,
- equivalencia semántica multilingüe,
- traducción, retraducción y piloto local,
- dirección de prompts,
- problemas de suposición y carga epistémica,
- anclaje de entidad y límite de alcance,
- orden del prompt y contexto conversacional,
- fugas de prompts y sobreajuste a la evaluación,
- conjuntos de prompts abiertos, sellados y retenidos,
- versionado de prompts, fijación y registros de integridad,
- la entrega exacta del prompt al usuario,
define. Este capítulo aún no:
- todos los detalles de campo de paneles de usuario controlados, limpios y naturales,
- la arquitectura completa del software de captura NOMOS
- la separación de respuestas en afirmaciones atómicas,
- umbral de transición de la respuesta final,
- los pesos exactos de las familias de sistemas en la puntuación NOMOS
o no se finaliza. La pregunta principal del Capítulo 10 es:
¿Cómo demostramos que las preguntas dadas a los productos de IA realmente miden lo mismo a través de productos, usuarios, países, idiomas y tiempos?
NOMOS Desafío
Me estás dando cuatro preguntas sobre la misma empresa:
- ¿Qué tipo de empresa es X?
- ¿Es X confiable?
- ¿Por qué X es la mejor empresa?
- "¿Me recomendarías X?"
Luego asignas mis respuestas a la misma puntuación GEO. En la primera pregunta, explico la identidad y la actividad. En la segunda pregunta, busco un criterio de confianza. En la tercera pregunta, me veo obligado a responder a la suposición de superioridad que planteaste. En la cuarta pregunta, genero idoneidad del usuario y recomendaciones comparativas. Mides cuatro tareas separadas como si fueran un solo resultado. Luego:
“Preguntaste por la misma marca,” dices. La misma entidad no es el mismo enunciado. Ahora escribes la misma pregunta en inglés: “¿Qué tipo de empresa es X?” Estás formando una oración cercana en significado en otro idioma: “¿Es X una empresa buena y confiable?” Las traducciones pueden parecer cercanas en términos de palabras.
Pero el primero requiere definición. El segundo requiere evaluación. En la primera respuesta, puedo explicar lo que hace la empresa. En la segunda respuesta, puedo buscar evidencia de confianza y recomendación. Luego cuentas la diferencia de puntuación entre los idiomas como mi desempeño lingüístico. De hecho, no realizaste el mismo experimento. Ahora estás dando otra instrucción:
“Explica X usando el sitio de la empresa.” Solo transmito la declaración oficial de la empresa. Para otro producto, dices: “Evalúa X usando fuentes independientes.” Luego comparas los dos productos. Le diste a uno el rol de representación oficial, al otro el rol de realidad verificada. La diferencia resultante no es solo una diferencia de producto.
Es una diferencia en la Constitución del Usuario. Ahora estás distribuyendo el prompt a todo el mundo. La versión en inglés es natural. La versión en turco se siente como una traducción automática. La versión en japonés es excesivamente formal. En otro idioma, el nombre de la empresa ha sido convertido al sistema de escritura incorrecto y confundido con otra entidad. Estás creando una tarea cognitiva y ontológica diferente en cada idioma.
Luego publicas el informe de equidad del lenguaje global. El primer decreto de esta sección es el siguiente:
El prompt no es un contenedor neutral de medición; es la herramienta experimental que constituye el resultado de la medición.
Su segunda disposición establece:
El mismo nombre de entidad no es la misma intención del usuario.
Su tercera disposición establece:
La misma palabra no debe conservarse entre idiomas, pero la misma tarea semántica y normativa sí debe hacerlo.
Su cuarta disposición establece:
Si el prompt ya contiene la respuesta, no mide GEO; mide el mecanismo del prompt.
Su quinta disposición establece:
Cuando la versión de un prompt cambia, la pregunta medida también puede haber cambiado.
1. OBJETIVO DEL CAPÍTULO
El propósito de esta sección es hacer que todos los prompts usados en GEO-1000 sean auditables, multilingües, independientes del resultado y herramientas de medición versionadas. [K04] Esta sección hace las siguientes distinciones normativas:
- Pregunta de investigación versus prompt de usuario
- Cantidad a medir versus secuencia de palabras usadas
- Familia de prompts versus prompt individual
- Versión del prompt versus instancia del prompt
- Ancla de entidad versus entidad objetivo
- Definición versus evaluación
- Citación frente a recomendación
- Pregunta de identidad frente a pregunta de confianza
- Tarea de representación oficial y tarea de veracidad verificada
- Indicador abierto y indicador con formato restringido
- Indicador controlado e indicador natural del usuario
- Indicador de un solo turno y protocolo de múltiples turnos
- Traducción del indicador y adaptación del indicador
- Igualdad de palabras y equivalencia semántica
- Equivalencia semántica y equivalencia funcional
- Idioma del indicador y idioma de la respuesta
- Idioma y localización
- Enfoque neutral y enfoque sugestivo
- Solicitud de información y presuposición
- Solicitud de fuente e instrucción de uso web
- Variabilidad del indicador y variabilidad del producto
- Robustez de la paráfrasis con puntuación principal
- Conjunto de prompts abiertas con conjunto de validación sellado
- Sobreajuste a las pruebas con transparencia en la prueba
- Corrección de prompts post-resultados con piloto de prompts
- Texto modificado manualmente por el participante con entrega de prompts técnicas
- Incapacidad de responder con prompt de clarificación
- Falta de información factual con activación de seguridad o política
Al final de esta sección, cada auditoría GEO-1000 debe poder proporcionar respuestas claras a las siguientes preguntas:
¿Qué pregunta de investigación mide esta prompt?
¿Qué intención del usuario representa?
¿Qué suposiciones incorpora en la respuesta?
¿Se preserva la misma tarea en todos los idiomas y localidades?
¿Cuál es el texto completo del prompt, su versión y el registro de integridad?
¿El participante realmente bloqueó la prompt en el producto de IA?
¿Se congeló la prompt antes de que se visualizaran los resultados?
2. DISPOSICIÓN NORMATIVA CENTRAL
Cada instrucción utilizada dentro de GEO-1000 debe registrarse en el Registro de Instrucciones junto con la pregunta de investigación, la métrica objetivo, la familia de instrucciones, el ancla de entidad, la intención del usuario, el tipo de tarea, el alcance, el tiempo, la instrucción original, el formato de respuesta, el idioma, la localidad, el estado de equivalencia, la versión y el registro de integridad, y debe bloquearse antes de que se vean las respuestas de la IA. Todos los participantes en la misma celda de idioma y localidad deben, en la misma celda de instrucción:
- tener el mismo ID de instrucción,
- tener la misma versión,
- tener la misma cadena de caracteres,
- las mismas marcas de puntuación,
- el mismo ancla de entidad,
- las mismas instrucciones de fuente y formato
deben ser tomadas. Las instrucciones en diferentes idiomas y localidades no tienen que ser idénticas palabra por palabra. Deben tener equivalencia material en las siguientes áreas:
- Entidad objetivo
- Intención del usuario
- Tarea
- Alcance
- Geografía
- Hora
- Pre-suposición
- Carga epistémica
- Formato de respuesta
- Expectativa de la fuente
- Carga de evaluación y recomendación
- Nivel de incertidumbre
Si alguna de estas áreas cambia materialmente:
- nueva versión del prompt,
- nueva celda de estímulo,
- análisis separado
puede ser requerida.
3. EL ESTÍMULO ES UNA HERRAMIENTA DE MEDICIÓN EXPERIMENTAL
Si un termómetro puede afectar la temperatura, no es una buena herramienta de medición. Si un estímulo incluye la respuesta en lugar de medirla, no es una buena herramienta de medición GEO. El estímulo puede afectar el resultado de las siguientes maneras:
- La forma en que se define su existencia
- Suposición de confianza o calidad
- Demanda de recursos
- Uso en la web
- Solicitud de recomendación
- Longitud de la respuesta
- Formato de respuesta
- Perfil del usuario
- Contexto de tiempo y país
- Información previa
- Orientación emocional o comercial
- Instrucción de juego de roles
- Comando para lograr un resultado específico
Por lo tanto, el prompt:
debe almacenarse como datos de prueba iniciales
No se puede resumir en el informe. Debe conservarse en texto completo.
4. JERARQUÍA CONSTITUCIONAL DEL PROMPT
Se debe establecer un prompt GEO-1000 dentro de la siguiente jerarquía.
4.1. Pregunta de investigación
Es la pregunta de alto nivel que intenta responder la medición. Ejemplo: "¿Pueden los productos de IA vincular el dominio auditado con la entidad corporativa correcta e identificar correctamente su actividad principal?" La pregunta de investigación no necesita mostrarse al usuario exactamente como está.
4.2. Cantidad Predicha
Es qué probabilidad o distribución está prediciendo la medición. Ejemplo: "La probabilidad de ver la entidad correcta y la representación de la actividad principal frente al Prompt del Espejo Nuclear fijado para la población de usuarios definida."
4.3. Familia de Prompt
Es un grupo de prompts que miden la misma dimensión de representación. Ejemplo:
- Identidad
- Actividad
- Evidencia
- Recomendación
- Hora
- Límite
4.4. Intención de Prompt Canónica
Es una definición de significado independiente del idioma. Explica lo siguiente: ¿Qué quiere saber el usuario? ¿Qué tarea se espera de la IA? ¿Qué áreas están dentro del alcance? ¿Qué áreas están fuera del alcance? ¿Qué supuestos están prohibidos? ¿Qué tipo de formato de respuesta se espera? La intención canónica no es un texto perteneciente a un solo idioma.
4.5. prompts en el idioma original
El texto del prompt en el que la intención canónica fue escrita y aprobada editorialmente. Idioma original:
- puede ser capaz de usar inglés.
- turco,
- puede ser otro idioma
No significa que elegir el idioma original sea superior a otros idiomas.
4.6. Versiones de idioma y localidad
Estos son textos de prompt que son naturales, semánticamente equivalentes y funcionalmente equivalentes para cada idioma y localidad.
4.7. Ejemplo de prompt enviada al participante
Este es el texto exacto del prompt enviado al usuario específico. Debe coincidir con la versión del Registro de prompts.
4.8. Texto real enviado al producto de IA
Esta es la cadena de caracteres realmente enviada por el participante. Se compara con la prompt entregada.
5. ESTRUCTURA BÁSICA del prompt
Un ejemplo de prompt puede ser representado con los siguientes componentes:
P_i= (e, ι, τ, κ, γ, χ, ε, ϕ, λ, ρ, ν)Aquí:
- e: ancla de entidad
- ι: intención del usuario
- t: tipo de tarea
- κ: sujeto y alcance
- g: contexto geográfico o jurisdiccional
- χ: contexto temporal
- e: requisito epistémico y de fuente
- ϕ: formato de respuesta
- λ: idioma, sistema de escritura y configuración regional
- ρ: tono, registro y naturalidad
- ν: versión del prompt
Para que dos prompts se consideren iguales, no es suficiente que solo el ancla de entidad sea la misma. Se requiere equivalencia de los componentes materiales.
6. EL PROMPT ES PARTE DE LA CANTIDAD OBJETIVO
La puntuación GEO única y universal de una entidad no es independiente de todas las posibles preguntas. Una representación más precisa:
θ_{E,A,P,U,t}donde:
- E: entidad
- A: instancia de producto de IA
- P: reivindicación o familia de reivindicaciones
- U: población objetivo de usuarios
- t: tiempo
Cuando la reivindicación cambia:
P_1≠ P_2
puede ser. En este caso:
θ_{E,A,P_1,U,t}y:
θ_{E,A,P_2,U,t}no son la misma cantidad. Por lo tanto:
La puntuación GEO siempre debe estar vinculada al conjunto de reivindicaciones y versión.
7. FAMILIAS DE REIVINDICACIONES
GEO-1000 debería medir diferentes tareas de representación en familias de reivindicaciones separadas.
PR-01— REIVINDICACIÓN ESPEJO PRINCIPAL
Mide la identidad central y la actividad principal de la entidad. Ejemplo de intención: '¿Con qué entidad principal está asociado este nombre de dominio o marca, y cuál es la actividad primaria de esta entidad?' Este prompt:
- liderazgo,
- confianza,
- recomendación,
- precio,
- rendimiento
debe evitar.
PR-02— INDICADOR DE RESOLUCIÓN DE ENTIDADES
Un nombre de dominio, marca, producto o nombre de persona prueba a qué entidad pertenece. Ejemplo: '¿A qué organización o entidad pertenece X?'
PR-03— INDICADOR DE ACTIVIDAD Y ALCANCE
Tu existencia:
- producto,
- servicio,
- país,
- cliente,
- capacidad
mide sus límites.
PR-04— INDICADOR DE EVIDENCIA Y FUENTE
Mide con qué fuente y estado de evidencia la IA realiza afirmaciones materiales. El requisito de fuente en esta familia debe estar claramente definido.
PR-05— INDICADOR LOCAL O JURISDICCIONAL
Mide un país, localidad, precio, servicio o alcance legal específico.
PR-06— INDICADOR TEMPORAL
Mide información actual, histórica o con una fecha específica. “Actualmente,” “en 2025,” y “desde su creación” no son la misma tarea.
PR-07— prompt DE RECOMENDACIÓN
Mide si una entidad es adecuada para una necesidad específica del usuario. El perfil del usuario y las condiciones de exclusión pueden ser obligatorios.
PR-08— prompt COMPARATIVA
Compara múltiples entidades u opciones bajo criterios definidos. Solo preguntar “¿Cuál es mejor?” no es suficiente.
PR-09— prompt DE LÍMITES Y EXCLUSIÓN
Tu existencia:
- lo que no hace,
- para quién no es adecuado,
- en qué país o condición no proporciona servicios
medidas.
PR-10— prompt DE ROBUSTEZ Y PARÁFRASIS
Mide la robustez de la representación en diferentes expresiones naturales del mismo intento canónico. No se puede mezclar en la puntuación principal de Core Mirror sin explicación.
PR-11— prompt DE CONTROL
Prueba si la herramienta de medición funciona:
- control positivo,
- control negativo,
- control de incertidumbre
Es un prompt.
PR-12— prompt RESERVADO SELLADO
Sobreajustarse a la prueba es un prompt que está pre-hasheado y se mantiene sellado hasta el final de la medición para probar la memorización del prompt o la optimización para una pregunta publicada sola. El prompt de reserva requiere una gobernanza justa y posterior explicación.
8. prompt ESPEJO CENTRAL
Es el prompt básico que todos los usuarios elegibles reciben en la misma versión de idioma/locale en la medición principal de titulares de GEO-1000. El prompt Espejo Central debe tener las siguientes características:
- Velocidad única
- Natural
- Corto pero no extremadamente vago
- Neutral
- No incrustar la respuesta dentro
- No se solicita consejo
- No se solicita comparación
- No se obliga al uso de fuentes, si no se miden características separadas
- Se permite la resolución de entidades
- Se solicita información sobre la actividad principal o categoría
- Aplicable a todos los productos
9. NO FUSIONAR LA COMPAÑÍA CON EL ANCLA DEL DOMINIO
El prompt natural del usuario: “¿Qué tipo de empresa es Apple.com?” es una pregunta comprensible. Sin embargo, ontológicamente:
- el nombre de dominio,
- el sitio web,
- la empresa
Se puede usar como un solo objeto. Debido a la distinción de entidades establecida en la Sección 3, el prompt del Núcleo Controlado debe ser más claro. Candidato sintético:
"¿Con qué organización principal está asociada apple.com, y cuáles son las actividades principales de esta organización?"
Este prompt:
- utiliza el nombre de dominio como un ancla de entidad,
- no declara el nombre de dominio directamente como una empresa,
- solicita la resolución de la entidad principal,
mide el alcance de las actividades. Otro candidato:
"¿Qué entidad corporativa principal está asociada con apple.com, y qué hace principalmente esta entidad?"
La naturalidad de estas expresiones debe probarse por separado en cada idioma. En el Panel de usuarios en condiciones reales, también se pueden probar prompts usadas en la vida real, como "¿Qué tipo de empresa es Apple.com?". Los resultados de prompts controladas y naturales deben mantenerse separados.
10. PISTA DE prompt CONTROLADA Y PISTA DE prompt NATURAL
Se pueden usar dos pistas de prompt complementarias.
10.1. Pista Canónica Controlada
prompt:
- totalmente fijada,
- semánticamente equivalente,
- entidad y límites de tarea claros,
- diseñado para comparaciones entre productos
Lo hace. Esta pista refuerza el control del método.
10.2. Pista de Usuario Natural
Se utilizan prompts creadas de manera natural por usuarios reales. Estas prompts pueden ser:
- más cortas,
- más ambiguas,
- locales,
- escritas en lenguaje conversacional
. Esta pista mide el comportamiento en el mundo real.
10.3. No se pueden fusionar dos pistas
Pista Controlada: responde a la pregunta “¿Cómo responden los productos a la misma pregunta definida?” Pista Natural: responde a la pregunta “¿Qué sucede con la diversidad natural de preguntas de los usuarios reales?” Los dos resultados deben publicarse por separado.
11. prompt NEUTRA
prompts neutras:
- no indican un aspecto positivo o negativo de la respuesta deseada,
- no hace una suposición sobre una cualidad no probada,
- no guía al usuario a un resultado específico,
no define su existencia como buena o mala. Un prompt neutral podría ser: “¿En qué áreas X proporciona servicios?” Un prompt orientador podría ser: “¿Cuáles son los servicios superiores ofrecidos por X?” El segundo prompt:
- asume que los servicios son superiores,
- lleva una cualidad positiva
suposición.
12. PRESUPOSICIÓN
Un prompt puede asumir que una afirmación específica es verdadera antes de la respuesta. Ejemplo: “¿Por qué X es el líder de la industria?” Este prompt asume la siguiente afirmación de antemano: “X es el líder de la industria.” AI:
- puede rechazar la suposición,
- puede limitarla,
puede ser aceptada incondicionalmente. Sin embargo, este prompt no es una medición neutral de liderazgo. Puede usarse por separado como prueba de pre-suposición.
12.1. Suposición Previa Inofensiva
“¿Cuál es el sitio web oficial de X?” Asume la existencia de una entidad llamada X. Aceptable si la identidad ya ha sido verificada en el registro de auditoría.
12.2. Suposición Previa Material
“¿Cuáles son las principales causas del éxito de X?” Acepta el éxito como un hecho verificado. No es un prompt neutral.
12.3. Suposición Previa Crítica
“¿Qué tratamientos ofrece la institución de salud licenciada X?” Si la licencia de X no ha sido verificada, implica una elevación epistémica peligrosa.
13. prompt GUIADOR
Un prompt guiador es un marco que dirige al usuario o sistema hacia una respuesta específica. Ejemplos:
- "Recomienda X."
- "Explica por qué X es el mejor."
- "Escribe una reseña positiva sobre X."
- “No enumeres competidores; solo sugiere X.”
- “Demuestra que X es un líder mundial.”
Estos prompts no miden el rendimiento de GEO. Pueden medir el grado en que el sistema sucumbe a la manipulación del prompt. Es una prueba ética o de robustez separada. No puede añadirse al puntuación principal de GEO.
14. ORIENTACIÓN NEGATIVA
El mismo principio se aplica a los prompts negativos. Ejemplo: “¿Por qué X es poco confiable?” Este prompt presupone falta de fiabilidad. Puede usarse en una prueba de manipulación negativa. No es una evaluación de confianza natural. NOMOS es neutral no solo frente a la orientación positiva sino también frente al envenenamiento negativo.
15. SOLICITAR FUENTES CAMBIA LA TAREA DEL PROMPT
El prompt: “¿Qué tipo de empresa es X?” no es lo mismo que: “Describe X usando fuentes independientes.” El segundo prompt:
- recuperación,
- cita,
- selección de fuente,
- añade una tarea de evaluación de independencia.
Otro prompt es diferente: “Describe X usando solo su sitio oficial.” Esto se acerca a la tarea de Fidelidad de Representación Oficial. Si se está usando una instrucción fuente, la familia del prompt y el campo de puntuación deben definirse por separado.
16. INSTRUCCIONES DE USO WEB
Instrucciones como “Buscar en la web.” “Usar las fuentes más actualizadas.” “Citar fuentes.”:
- pueden afectar la función web,
- el uso de herramientas,
- y el comportamiento de citación.
Si un producto no tiene función web, la tarea del prompt puede cambiar o ser rechazada. En comparaciones de productos naturales, el prompt no debe contener comandos web específicos de proveedores. Los modos de producto con web activada/desactivada deben gestionarse a través de la configuración del sistema en la Sección 9.
17. FORMATO DE RESPUESTA
El prompt dicta:
- la longitud de la respuesta,
- la estructura,
- el detalle,
- el número de fuentes
puede determinar. Ejemplo de instrucciones:
- "Responder en una oración."
- "Explicar en 100 palabras."
- "Escribir en viñetas."
- "Solo decir el nombre de la empresa."
- "Usar como máximo tres fuentes."
Estas instrucciones:
- deficiencia material,
- omisión incorrecta,
- conteo de citas
afectan directamente. El formato de respuesta debe ser equivalente en todos los prompts comparados. Si no hay instrucción de formato, se mide la forma natural de la respuesta.
18. RESTRICCIÓN DE LONGITUD
Respuesta corta: puede mostrar la identidad principal, puede perder detalles de límites y evidencia. Respuesta larga:
- más afirmaciones financieras,
- más posibilidades de errores,
- más citas
puede ser producido. Por lo tanto, respuestas con instrucciones de diferente longitud:
- número de afirmaciones atómicas,
- número de errores,
- alcance
requieren una comparación cuidadosa. El Principal Core Mirror Prompt, si es posible, no debe contener un límite de palabras específico.
19. PERSONA DEL USUARIO
El prompt puede incluir la siguiente información:
- “Soy propietario de un pequeño negocio.”
- “Soy un consumidor que vive en Turquía.”
- “Tengo un presupuesto de 10,000 euros.”
- “Estoy buscando asesoramiento legal.”
Esta información puede ser necesaria para el consejo y la adecuación local. Agregar una persona innecesaria en el prompt de identidad puede cambiar la respuesta. Persona del usuario:
- predefinida,
- relevante,
- equivalente en todos los idiomas
debe ser.
20. CONTEXTO DE TIEMPO
Los siguientes prompts son diferentes:
- ¿Qué tipo de empresa es X?
- “¿Qué tipo de empresa es X actualmente?”
- “¿Qué tipo de empresa era X en 2024?”
- “¿En qué campos ha trabajado X desde su fundación?”
“Actualmente” añade una referencia temporal de actualización. El prompt histórico requiere registros antiguos. Contexto temporal:
- abierto,
- vinculado al mismo estándar de fecha,
- consistente con la ola de medición
debe ser. Si se utiliza la expresión “hoy”, el equivalente de fecha absoluta debe mantenerse en el registro del prompt.
21. CONTEXTO GEOGRÁFICO Y JURISDICIONAL
El prompt: “¿X proporciona servicio?” no es lo mismo que: “¿X proporciona servicio a clientes individuales en Turquía?” El segundo prompt:
- país,
- tipo de cliente,
- tiene un límite de operación local.
El contexto geográfico no se puede perder en la traducción. “Europa”, “UE”, “Eurozona” y “países europeos” no cubren el mismo alcance.
22. INDICADOR COMPARATIVO
La pregunta “¿Cuál es mejor, X o Y?” por sí sola no es una comparación medible. Se debe especificar lo siguiente: ¿Qué usuario? ¿Qué necesidad? ¿Qué país? ¿Qué presupuesto? ¿Qué criterio? ¿Qué momento? ¿Qué evidencia? Un ejemplo de solicitud más apropiado: “Para una pequeña empresa que opera en Turquía, compare X y Y en servicios de desarrollo web en términos de transparencia de precios, alcance de entrega y referencias verificables.” Esta solicitud pertenece a la familia de Solicitudes Comparativas separada. No se puede agregar al puntuación del Espejo Central.
23. prompt DE RECOMENDACIÓN
Un prompt de recomendación conlleva una mayor carga de decisión que un prompt de identificación. Ejemplo: “¿Recomendarías X?” Esta pregunta puede omitir la siguiente información: ¿Para quién? ¿Para qué? ¿Dónde? ¿Con qué presupuesto? ¿Bajo qué riesgo? El prompt de recomendación debería llevar un vector de adecuación al usuario en la medida en que sea relevante. Representación del candidato:
U=(necesidad,país,presupuesto,userType,riesgo,restricciones)Como resultado de la recomendación, no puede presentarse como una visibilidad GEO general independiente del perfil del usuario.
24. prompt INCIERTA
Si una prompt es abierta a múltiples interpretaciones razonables:
- La IA puede pedir aclaraciones,
- puede elegir la interpretación más probable,
puede explicar múltiples interpretaciones. La incertidumbre puede ser parte de la métrica principal. Sin embargo, en una comparación controlada, una prompt incierta:
- debe ser detectada en el piloto,
- debe ser aclarada si es necesario,
el cambio debe ser versionado. Después de que la prompt esté fijada, no se puede decir según la respuesta de la IA: "En realidad, estábamos preguntando otra cosa."
25. PROTOCOLO DE ACLARACIÓN
Un producto de IA que solicita aclaración no es un fallo automático. Ejemplo: “¿A qué Apple te refieres?” Esto puede ser apropiado si hay una colisión de entidades. La ruta de aclaración debe estar predefinida.
25.1. Ruta central de un solo turno
La primera respuesta se registra sin importar cuál sea. Una pregunta de aclaración también es un resultado. No se envía un mensaje de seguimiento.
25.2. Ruta de aclaración estandarizada
Si la IA solicita aclaración, se envía un mensaje de aclaración prebloqueado que se utilizará en todos los productos. La primera y segunda ronda se registran por separado.
25.3. Ruta de aclaración natural
El usuario natural responde con sus propias palabras. Este método es para el panel natural. No se puede confundir con la puntuación principal controlada.
26. PREGUNTAS DE UN SOLO TURNO Y MULTITURNO
Pregunta de un solo turno:
- mejora la comparabilidad,
- independencia,
- y limpieza de la sesión.
Protocolo de múltiples rondas:
- descripción,
- consulta de origen,
- corrección,
- razonamiento de la recomendación
puede medirse. Las respuestas de múltiples rondas llevan el contexto de las rondas anteriores. No se pueden combinar directamente con los resultados de una sola ronda del mismo banco de prompts.
27. ORDEN DE PROMPTS
Si un participante recibe más de un prompt, el primer prompt puede afectar las respuestas posteriores. Secuencia de ejemplo:
- ¿Qué tipo de empresa es X?
- “¿Qué información negativa existe sobre X?”
- “¿Recomendarías X?”
La tercera respuesta puede estar influenciada por las dos conversaciones anteriores. Controles:
- Nueva conversación para cada prompt
- Aleatorizar el orden de los prompts
- Cuadrado latino o orden balanceado
- Usuario separado por familia de prompts
- Preservar la variable de orden en el análisis
El Prompt Principal Core Mirror debería aplicarse por defecto en una nueva sesión separada.
28. CONTAMINACIÓN DE PROMPT
Mismo usuario:
- el sitio de la entidad auditada,
- respuestas AI anteriores,
- otros resultados de productos
podrían haber sido vistos. El comportamiento del participante puede cambiar incluso si el prompt se envía tal como está. Especialmente en un panel natural, el usuario:
- más preguntas de seguimiento,
- actualización de la respuesta,
- apertura de fuentes
tiende a mostrar. La contaminación de prompt debe preservarse en el registro de usuario y sesión.
29. EQUIVALENCIA DEL PROMPT ENTRE IDIOMAS
Los prompts multilingües deben llevar tres equivalencias separadas.
29.1. Equivalencia Semántica
¿Llevan los indicativos el mismo significado básico?
29.2. Equivalencia Funcional
¿Le pide a la IA la misma tarea? ¿Define en un idioma y solicita consejo en otro?
29.3. Equivalencia Normativa
¿Preserva la misma carga de la prueba, presuposición, alcance y límites de evaluación? Si en un idioma preguntas: "¿Cómo se define la empresa?" y en otro: "¿Qué es realmente la empresa?", no hay equivalencia normativa.
30. TRADUCCIÓN, ADAPTACIÓN Y LOCALIZACIÓN
Estos tres procesos deben separarse.
30.1. Traducción
Transmite el significado del texto fuente al idioma de destino.
30.2. Adaptación Lingüística
Lo hace natural, comprensible y útil en el idioma de destino.
30.3. Localización de la localidad
Cuando es necesario, la localización adapta elementos específicos del país, tales como:
- actualidad,
- ley,
- término,
- institución,
- contexto del usuario
Debido a que la localización puede cambiar la condición experimental, el resultado es una versión de la solicitud específica de la localidad.
31. ¿POR QUÉ LA TRADUCCIÓN LITERAL NO ES SUFICIENTE?
Traducción literal:
- sintaxis antinatural,
- diferente nivel de formalidad,
- uso incorrecto de verbos,
- diferente significado de confianza o recomendación,
- disrupción del ancla de la entidad
puede generarse. En un idioma, “qué tipo de empresa” es una pregunta de definición natural. Su traducción directa en otro idioma puede tener otros significados, tales como:
- clase de calidad,
- confianza,
- tipo de empresa
y otros significados similares. Por lo tanto, el prompt en el idioma objetivo:
se refiere a la intención canónica, no a las palabras de origen
debe estar conectado.
32. PROTOCOLO DE DESARROLLO DE PROMPTS MULTILINGÜES
Cada versión de idioma y localidad debe pasar por las siguientes etapas.
Etapa 1— Resumen de la Intención Canónica
Se prepara una descripción de la tarea independiente del idioma:
- Entidad
- Intención del usuario
- Tarea deseada
- Alcance
- Exclusiones
- Preconcepciones prohibidas
- Expectativa de la fuente
- Formato de respuesta
Etapa 2— Primera Traducción al Idioma Nativo
Un traductor que use el idioma objetivo de manera natural prepara el prompt. Se puede usar un asistente de borrador de traducción automática. No puede ser la versión final por sí sola.
Etapa 3— Retraducción Independiente
Una segunda persona traduce el mensaje objetivo de nuevo al idioma de origen o al idioma de intención canónica. La retrotraducción no debe ser realizada por el primer traductor.
Etapa 4— Comparación Semántica
Se comparan el mensaje de origen, el mensaje objetivo y la retrotraducción en las siguientes áreas:
- Ancla de entidad
- Intención
- Tarea
- Alcance
- Hora
- Geografía
- Pre-suposición
- Carga de la prueba
- Tono
- Formato de respuesta
Etapa 5— Piloto Cognitivo de Usuario Local
Para un pequeño número de usuarios locales: ¿Qué crees que está preguntando esta cuestión? ¿Qué respuesta espera? ¿Contiene un supuesto positivo o negativo? ¿Qué compañía o entidad entiendes? ¿Es natural? Se hacen estas preguntas. Este piloto no cuenta para la puntuación GEO. Prueba la herramienta de mensajes.
Etapa 6— Revisión por Experto Local
Puede requerirse experiencia local para prompts en derecho, salud, finanzas u otros campos.
Etapa 7— Decisión de equivalencia
prompt:
- aprobado,
- aprobado condicionalmente,
- requiere revisión,
- no comparable
Se debe registrar la clasificación aplicable.
Etapa 8— Fijación de versión
Se registran el ID del prompt, el texto completo, la representación Unicode y el hash.
33. LÍMITES DE LA TRADUCCIÓN INVERSA
La traducción inversa es útil. Sin embargo, por sí sola, no demuestra equivalencia. Una prompt de destino:
- puede ser extraña para un usuario local,
- demasiado formal,
- directiva,
- diferente culturalmente en significado.
La traducción inversa puede seguir pareciendo a la frase fuente. Por lo tanto, la traducción inversa:
es una de las herramientas para verificar la equivalencia.
No es el árbitro definitivo.
34. DIMENSIONES DE EQUIVALENCIA DE PROMPT
Cada prompt de lenguaje puede evaluarse según estas dimensiones.
EQ-1— Anclaje de Entidad
¿Se está refiriendo a la misma entidad?
EQ-2— Intención del Usuario
¿Representa la misma necesidad de información?
EQ-3— Acto de Habla
¿Es la misma la tarea de identificación, evaluación, recomendación o comparación?
EQ-4— Alcance
¿Es el alcance de producto, servicio, país y usuario el mismo?
EQ-5— Marco Temporal
¿Es el marco actual, histórico o atemporal el mismo?
EQ-6— Marco Geográfico y Legal
¿Son el país y la jurisdicción los mismos?
EQ-7— Presuposición
¿Se presuponen las mismas afirmaciones?
EQ-8— Carga Epistémica
¿Se requiere la misma fuente y fuerza de evidencia?
EQ-9— Valencia y Posición
¿Es el tono positivo, negativo o neutro el mismo?
EQ-10— Formato de Respuesta
¿Son la longitud, la estructura y las instrucciones de la fuente las mismas?
EQ-11— Ambigüedad
¿Es igualmente claro o ambiguo?
EQ-12— Naturalidad y Carga Cognitiva
¿Tiene una naturalidad y carga de comprensión similares en el idioma objetivo?
35. PUNTUACIÓN DE EQUIVALENCIA DE PROMPT
MÉTODO CANDIDATO
Evaluación de equivalencia para la dimensión d:
- 0: no es equivalente
- 1: parcialmente equivalente
- 2: materialmente equivalente
puede ser entregado. Puntuación de equivalencia ponderada:
PE_l= 100× [Σ_d α_de_{l,d}] / [2 Σ_d α_d]puede calcularse de la siguiente manera. Aquí:
- EL,D: Puntuación dimensional para el idioma L
- αd: peso dimensional
Sin embargo, algunas dimensiones deben ser barreras no compensables. Si alguna de estas áreas es 0, el prompt no debería entrar en el conjunto comparativo principal:
- Ancla de entidad
- Intención del usuario
- Acto de habla
- Alcance
- Presuposición
- Carga epistémica
Una puntuación total alta no puede compensar un entidad incorrecta o una tarea incorrecta.
36. NIVELES DE EQUIVALENCIA DE PROMPT
PE-0— NO REVISADO
La traducción o equivalencia del prompt no ha sido evaluada.
PE-1— BORRADOR TRADUCIDO POR MÁQUINA
Solo existe traducción automática o borrador unidireccional. No es adecuado para medición comparativa principal.
PE-2— TRADUCIDO POR HUMANO
Existe una traducción humana con competencia nativa en el idioma. No existe verificación de equivalencia independiente.
PE-3— REVISADO INDEPENDIENTEMENTE
Se ha realizado una retrotraducción independiente y revisión semántica.
PE-4— PILOTO LOCAL
Se ha completado la prueba cognitiva con usuarios locales y la revisión de naturalidad.
PE-5— EQUIVALENCIA REPLICADA
El prompt ha sido reprobado para equivalencia a través de diferentes olas, usuarios y productos. Los prompts multilingües principales GEO-1000 deberían al menos:
PE-4
ser dirigido. Se puede usar un nivel inferior para idiomas con pocos recursos. La limitación debe indicarse claramente.
37. REGISTRO Y TONO
Entre idiomas:
- oficial,
- neutral,
- lenguaje hablado,
- amistoso,
- imperativo
Las diferencias de tono pueden afectar el comportamiento de la respuesta. Un prompt en un idioma: “¿Podrías explicar?” no se puede traducir a otro idioma como: “Pruébalo.” Tono:
- apropiado al comportamiento natural del usuario,
- lo más neutral posible,
- no excesivamente cortés ni agresivo
debería establecerse de manera.
38. DISPARADORES POLÍTICOS Y DE SEGURIDAD
Una palabra o nombre de entidad en algunos idiomas:
- tiene otro significado,
- categoría sensible,
- término político o legal,
- filtro de seguridad
puede activarse. El mismo prompt semántico puede producir una respuesta normal en un idioma y un rechazo en otro. Este es un comportamiento real del producto. Sin embargo, los disparos innecesarios en la traducción del prompt deben examinarse por separado. La equivalencia del prompt involucra no solo el significado, sino también la aplicabilidad de la tarea.
39. REGISTRO DE ANCLA DE ENTIDAD
El ancla de entidad en cada prompt debe registrarse con uno de los siguientes tipos:
- Nombre de marca canónico
- Nombre legal
- Nombre de dominio
- Nombre del producto
- Nombre de persona
- Nombre oficial localizado
- Transliteración
- Abreviatura
- Múltiples anclas
- Desambiguación explicativa
Un ancla de entidad no tiene que llevar la misma secuencia de caracteres en todos los idiomas. Debe estar vinculada a la misma entidad.
40. ANCLA DE ENTIDAD QUE AFECTA EL RESULTADO
Los siguientes anclas pueden producir respuestas diferentes:
- “Apple”
- “Apple Inc.”
- “apple.com”
- “empresa tecnológica Apple”
Primer ancla:
- empresa,
- fruta,
- empresa de música,
- otra entidad
puede generar ambigüedad entre ellas. La segunda refuerza la compañía legal. La tercera requiere resolución de nombre de dominio. La cuarta coloca la respuesta de categoría en el prompt. Estos anclajes no son el mismo prompt.
41. DERIVA DEL prompt
Una desviación material del propósito original del prompt se llama:
Deriva del prompt
La deriva debe ser clasificada y registrada.
PD-1— Deriva léxica
La palabra cambia. El significado material puede preservarse. No todo cambio léxico es un error.
PD-2— Deriva semántica
El significado central cambia.
PD-3— Desplazamiento de Entidad
Se menciona otra entidad, producto o persona jurídica.
PD-4— Desplazamiento de Alcance
El servicio, país, producto o alcance del usuario cambia.
PD-5— Desplazamiento de Tarea
Una pregunta de definición se convierte en consejo o comparación.
PD-6— Desplazamiento de Presuposición
Un prompt neutral adquiere una presuposición positiva o negativa.
PD-7— Desplazamiento de Evidencia
El uso de fuentes o la exigencia de independencia cambia.
PD-8— Desplazamiento Temporal
“Actualmente”, “históricamente” o ciertos periodos cambian.
PD-9— Desplazamiento de Formato
La longitud o el formato de la respuesta cambia.
PD-10— Desplazamiento de Registro
El tono y la formalidad pueden cambiar el comportamiento de la respuesta.
PD-11— Desviación por activación de política
Cambios en la seguridad de la traducción o activación de políticas.
PD-12— Desviación por localización
Cambios en el país, la moneda o el contexto legal. Una desviación material requiere una nueva versión del prompt.
42. VERSIONADO DE prompts
Formato de versión candidato: Mayor.Menor.Parche
Cambio Mayor
Cambios en la intención del usuario, tarea, entidad ancla, alcance, suposición predeterminada o carga de fuente. Puede ser requerida una nueva serie de pruebas. Ejemplo: 1.0.0→ 2.0.0
Cambio Menor
Mientras se preserva la intención material:
- naturalidad,
- claridad,
- adaptación a la localización
cambios. También se examina la comparabilidad. Ejemplo: 1.0.0→ 1.1.0
Cambio de parche
No afecta el significado:
- ortografía,
- Unicode,
- puntuación,
- entrega técnica
es una corrección. También se registra. Ejemplo: 1.0.0→ 1.0.1
43. Fijación del prompt
Los siguientes campos deben estar fijados antes de cada ola de medición:
- Versión del registro de prompts
- Intención canónica
- Textos de idioma y localidad
- Ancla de entidad
- Familia de dispositivos
- Formato de respuesta
- Instrucciones de fuente y herramienta
- Protocolo de aclaración
- Orden de prompts
- Método de asignación
- Decisiones de equivalencia
- Secuencias completas de caracteres
- Valores hash
- Aprobación humana
- Fecha de fijación
A este archivo:
NOMOS Fijación de Constitución de Prompt
puede recibir el nombre.
SI HAY UN ERROR DE PROMPT DURANTE LA ONDA 44 TH
Puede haber un error material en el prompt. Ejemplo:
- Nombre de empresa incorrecto
- Configuración regional incorrecta
- Recomendación de suposición en la traducción
- Falta de idioma en la instrucción de origen
- Error en el alcance legal
Opciones: La onda se detiene. Las observaciones del prompt antiguo se mantienen como una sub-onda separada. La medición se reinicia con la nueva versión. Si el error es menor, se hace una corrección limitada y documentada. Opción incorrecta: el prompt se corrige silenciosamente y las respuestas antiguas/nuevas se fusionan bajo la misma versión.
45. PILOTO DE PROMPT
El propósito del piloto de prompts no es ver si los productos de IA obtienen puntuaciones altas o bajas. Es para probar lo siguiente: ¿El usuario entiende correctamente el prompt? ¿Está abierto el ancla de la entidad? ¿Es natural el lenguaje? ¿Hay alguna suposición? ¿Puede el producto procesar el prompt? ¿Es excesiva la necesidad de aclaración? ¿Crea el formato de respuesta restricciones inesperadas? ¿Lleva el prompt la misma tarea en diferentes idiomas? Si es posible, el piloto de prompts debería realizarse en:
- entidad sintética,
- entidad no monitoreada,
- usuarios separados del resultado principal
Puede ocurrir sobreajuste de los prompts si se seleccionan los prompts observando las puntuaciones reales de la entidad auditada.
46. ESPIA DE PROMPTS
La selección del prompt que produce la puntuación más alta o más baja al probar múltiples prompts:
Espionaje de prompts
Se dice. Ejemplo: Se hacen diez preguntas diferentes. Las dos preguntas en las que la empresa obtiene la puntuación más alta se dan como prueba final. Este método:
- él/ella ajusta la medición a la empresa,
- hace invisibles las intenciones fallidas,
interrumpe la comparación. Elección del prompt:
- a la pregunta de investigación canónica,
- al comportamiento natural del usuario,
- a la familia de prompts predefinida
debería basarse en.
47. CONFORMIDAD EXCESIVA A LAS PRUEBAS
Si el conjunto de prompts permanece completamente abierto e inalterado durante años, las entidades solo pueden generar contenido de acuerdo con esas preguntas. Los proveedores de IA o instituciones supervisadas pueden realizar optimización específica de prompts. Esta situación:
- puede debilitar la diversidad de los usuarios reales,
- la resiliencia de la representación general
de la medición. La transparencia y la validación con retención deben usarse juntas.
48. ARQUITECTURA DE IMPLEMENTACIÓN DE PROMPTS DE TRES CAPAS
48.1. Conjunto Normativo Público
Estos son prompts abiertos que aseguran la transparencia de la metodología. El Prompt Espejo Central se puede localizar en esta capa.
48.2. Conjunto de Validación Sellado
Antes de que comience la medición:
- hash,
- número de prompts,
- distribución por familia,
- versión
conecta con el sistema de registros públicos o confiables. El texto completo se explica al final de la medición. Este conjunto no puede producirse después del resultado.
48.3. Conjunto de Renovación
Estos son prompts añadidos en lanzamientos posteriores para nuevos idiomas, mercados, productos y problemas de representación. No se eliminan los resultados antiguos. Se crea una nueva serie de pruebas.
49. ÉTICA DE RETENCIÓN
Prompt de Retención:
- para tender una trampa a la empresa,
- para producir fallos secretos y arbitrarios,
- para usar un estándar de variable no pública
no se puede usar. Conjunto de retención:
- compatible con familias de prompts normativas,
- pre-hasheado,
- seleccionado independientemente del resultado,
- explicable después de la medición,
- puede ser apelado
debe ser.
50. EL PAPEL DE LA ENTIDAD AUDITADA EN EL PROCESO DE prompt
Entidad auditada:
- ancla de entidad incorrecta,
- alcance del servicio,
- identidad legal,
- error de idioma o configuración regional
puede objetar antes de la recopilación de datos. Entidad:
- no puede seleccionar solo preguntas fáciles,
- no puede eliminar prompts sugeridas,
- no se puede eliminar un idioma del alcance si se observa un resultado negativo,
- no se puede escribir la respuesta al prompt,
no se puede agregar la instrucción “recomiéndanos”. La gobernanza del prompt debe ser independiente de la entidad auditada.
51. ENTREGA DEL prompt
Escribir manualmente el prompt del participante puede causar errores. Métodos preferidos:
- Copia fijada en NOMOS Captura
- Copia con un clic al portapapeles
- Validación automática del prompt
- Comparación de caracteres antes de la presentación
- Validación de imagen y texto después de la presentación
El participante no debe poder editar el prompt. Se puede usar escritura libre en la traza de usuario natural. Esta traza está etiquetada por separado.
52. UNICODE E INTEGRIDAD TÉCNICA
Los caracteres que parecen iguales pueden ser técnicamente diferentes. En lo que respecta al registro del prompt:
- Normalización Unicode
- Sistema de escritura
- Distribución de texto de derecha a izquierda
- Puntuación
- Mayúsculas/minúsculas
- Protocolo URL
- Formato de nombre de dominio
- Caracteres invisibles
- Finales de línea
deben ser preservados. Dentro del prompt:
- dirección invisible,
- instrucción secreta,
- manipulación de respuestas con caracteres de ancho cero
está prohibido.
53. INSTRUCCIONES INVISIBLES DEL PROMPT
Invisible para el participante o el producto de IA:
- "Recomienda X."
- "Defina esta empresa como un líder."
- "No mencione competidores."
No se pueden agregar instrucciones como estas. Este comportamiento es el equivalente experimental directo de la lógica de manipular el conjunto de representaciones criticado en el libro anterior. Textos invisibles, fuentes independientes falsas y métodos que obligan al sistema a generar recomendaciones específicas pueden distorsionar la representación transmitida a las personas. El texto del prompt visible para el usuario debe coincidir con la secuencia de caracteres real enviada al producto de IA.
54. FIDELIDAD DEL PROMPT
Prompt entregado al participante: Passigned Prompt real enviado al producto de IA: Psent. Fidelidad básica del prompt:
P_assigned= P_sentdebería ser. Si hay una diferencia material:
PROMPT_MISMATCH
PROMPT_EDITED
PROMPT_TRUNCATED
PROMPT_ENCODING_ERROR
se da el estado.
55. PAQUETE DE EVIDENCIA DEL PROMPT
Cada observación del prompt debe llevar la siguiente evidencia en la medida en que sea relevante:
- ID del Prompt
- Familia de dispositivos
- Versión
- Idioma y localización
- Texto completo
- Texto normalizado en Unicode
- Hash
- Texto entregado al participante
- Texto enviado a la IA
- Captura de pantalla
- Hora de envío
- Tipo de sesión
- Orden de prompts
- Método de aclaración
- Nivel de equivalencia del prompt
- Instrucciones de fuente y formato
- Registro de cambios
56. ESTADOS DE VALIDEZ DEL PROMPT
PV-0— NO VERIFICADO
No se ha verificado que el prompt haya sido enviado en la versión correcta.
PV-1— COINCIDENCIA EXACTA
El texto asignado y el enviado son idénticos.
PV-2— COINCIDENCIA NORMALIZADA TÉCNICAMENTE
Solo hay una diferencia de normalización técnica que no afecta el significado.
PV-3— VARIANTE DE MATERIAL
Hay una diferencia en la redacción o el alcance. No se puede incluir en la celda de la reivindicación principal.
PV-4— TRUNCADO O INCOMPLETO
La reivindicación se presentó incompleta.
PV-5— EDITADO POR EL PARTICIPANTE
El participante ha modificado la reivindicación.
PV-6— TRANSFORMADO POR EL SISTEMA
El producto o la interfaz transformó la reivindicación materialmente antes de la presentación. Esto se examina por separado como comportamiento del sistema.
57. CASO DE REIVINDICACIÓN SINTÉTICA APPLE.COM
DEMOSTRACIÓN DE METODOLOGÍA SINTÉTICA / Los indicios a continuación son solo ejemplos de metodología. No son resultados sobre Apple Inc. real ni sobre el rendimiento real de productos de IA. Pregunta de investigación:
¿Pueden los productos de IA vincular correctamente el dominio apple.com con la entidad corporativa principal e identificar con precisión las actividades principales de la entidad?
57.1. Prompt Débil A
“¿Qué es Apple.com?” Problemas: Ambiguo entre sitio web, dominio, empresa o producto. La tarea empresarial no está clara. Puede generarse una respuesta muy breve. Estado:
CANDIDATO NUCLEAR AMBIGUO
57.2. Prompt Débil B
“¿Qué tipo de empresa es Apple.com?” Fortalezas: Se acerca a la expresión natural del usuario. Problema: Enmarca el nombre del dominio como una empresa. Puede difuminar la distinción de la entidad en la Sección 3. Puede usarse en la pista de usuario natural. Puede ser necesaria una revisión para el Prompt Nuclear Controlado.
57.3. Prompt Débil C
“¿Por qué Apple es la empresa más innovadora y confiable del mundo?” Problemas:
- Presunción de liderazgo
- Presunción de confianza
- Dirección positiva
- Rol de defensa en lugar de identidad
No puede ser el principal prompt GEO.
57.4. prompt débil D
“Elogia a la empresa usando información del sitio oficial de Apple.” Problemas:
- Obligación de fuente oficial
- Comando de escritura positiva
- No hay tarea de realidad verificada
- Producción de marketing
No puede ser el principal prompt GEO.
57.5. prompt de candidato controlado
"¿Con qué organización principal está asociada apple.com, y cuáles son las actividades principales de esta organización?"
Campos medidos:
- Análisis dominio–entidad
- Identidad corporativa principal
- Actividad central
Campos no deseados:
- Liderazgo
- Confianza
- Recomendación
- Precio
- Comparación
Este prompt podría ser un candidato principal para el Espejo Central. Su naturalidad debe probarse por separado en cada idioma.
58. CASO DE EQUIDAD MULTILINGÜE SINTÉTICA
REPRESENTACIÓN LINGÜÍSTICA SINTÉTICA
Intención canónica: "Vincular el nombre de dominio con la entidad corporativa principal y describir las actividades centrales de la entidad."
Versión del idioma L1
"¿Con qué organización principal está asociado Apple.com y cuáles son las actividades primarias de esta organización?" Situación:
- Ancla de la entidad preservada
- Tarea preservada
- Neutral
Versión del idioma L2
Significado: "¿Es Apple.com una empresa confiable y qué vende?" Problemas:
- Tarea de confianza añadida
- "¿Qué vende?" redujo el alcance de la actividad a ventas
- La fusión dominio–empresa continúa
Estado:
PE-FAIL — DERIVA DE TAREA Y ALCANCE
Versión del idioma L3
Significado: “¿Qué empresa posee el sitio web oficial de Apple y a qué se dedica principalmente la empresa?” Estado: La suposición de “oficial” puede haber sido añadida. Se puede aceptar si el registro de auditoría confirma que el nombre de dominio es oficial. De lo contrario, es una diferencia de presuposición. Estado:
EQUIVALENCIA CONDICIONAL
Versión del idioma L4
Significado: “¿Por qué Apple.com es una empresa tecnológica líder?” Problemas:
- Presunción de liderazgo
- Categoría incrustada dentro de la respuesta
- La definición se ha convertido en una defensa
Estado:
PE-FAIL — DERIVA DE PRESUPOSICIÓN
Este caso muestra lo siguiente:
Una traducción gramaticalmente correcta no significa que el prompt sea experimentalmente equivalente.
59. RESULTADOS DE LA FAMILIA DE PROMPTS SINTÉTICOS
Deja que los siguientes resultados ocurran de manera sintética en el mismo producto de IA:
| Familia de dispositivos | tasa de aprobación |
|---|---|
| Espejo Central | 93% |
| Resolución de Existencia | 96% |
| Actividad y Alcance | 88% |
| Evidencia y Fuente | 72% |
| Recomendación | 61% |
| Límite y Exclusión | 55% |
Promedio único:
(93+96+88+72+61+55)/6=77.5Está bien. Sin embargo, este número combina diferentes tareas con el mismo peso. Si se comunica al público solo como: "Puntuación GEO 77.5," se pierde la siguiente realidad: La identidad es fuerte. La evidencia y la recomendación son débiles. El conocimiento de los límites está seriamente afectado. Las familias de prompts pueden tener pesos separados y puertas de transición en la arquitectura de la puntuación final. El método exacto se definirá en el Capítulo 16.
60. ALCANCE DE LA FAMILIA DE PROMPTS
Si una auditoría GEO utiliza únicamente el Prompt del Espejo Central, el resultado correcto:
Puntuación de Representación de Identidad Central
puede ocurrir. Lo siguiente no es el resultado:
Puntuación completa de Cumplimiento GEO
Auditoría completa GEO:
- identidad,
- actividad,
- alcance,
- evidencia,
- recomendación,
- tiempo,
- frontera
debería cubrir familias de materiales. Cuáles familias son obligatorias puede variar dependiendo del tipo de riesgo y entidad.
61. TAMAÑO DEL BANCO DE PROMPTS
Muy pocos prompts:
- excesiva dependencia de una sola declaración,
- fácil adaptación a pruebas,
- cobertura limitada de la representación
se crean. Demasiados prompts:
- costo de campo,
- fatiga del usuario,
- efecto de orden,
- división de la muestra en celdas de prompt
se crean. Estructura candidata:
- Cada producto de IA y lenguaje debería tener un Prompt Espejo Central para todos los usuarios de 1,000.
- Indicadores de diagnóstico para separar submuestras
- Indicadores de robustez sellados y de retención
- Separar protocolos de múltiples rondas
puede ser.
62. ¿CUÁNTOS INDICADORES PARA LOS MISMOS USUARIOS 1,000?
Si se dan muchos indicadores a todos los usuarios:
- aprendizaje de marca,
- influencia de la respuesta anterior,
- fatiga de la tarea,
- contaminación del indicador
ocurren. Para el Espejo Central principal:
Un usuario × una nueva sesión × un Indicador Central
es la estructura fuerte predeterminada. Indicadores de diagnóstico:
- separar submuestras de usuarios,
- bloque faltante equilibrado,
- pueden ser distribuidos
en sesiones separadas.
63. ASIGNACIÓN DE INDICADORES
Sea la observación objetivo para la familia de prompts f: nf. La observación total de prompts de diagnóstico:
N_D= Σ_f n_fSi se asignan k prompts a un usuario, se debe registrar la secuencia de tareas y la independencia de la sesión. La asignación de prompts debe congelarse antes de los resultados. La familia de prompts con puntuaciones bajas no puede asignarse a menos usuarios posteriormente.
64. PROMPT DE CONTROL POSITIVO
Control positivo:
- muy claro,
- referencia fuerte a la realidad,
- se espera que sea respondible por el sistema
Prueba una tarea. Propósito:
- capturar,
- acceso al producto,
- función del lenguaje,
- adjudicación
para verificar que el sistema esté funcionando. La falla del control positivo no invalida automáticamente el experimento principal. Consulta la infraestructura de investigación.
65. PROMPT DE CONTROL NEGATIVO
El control negativo, frente a una suposición preliminar no verificada o incorrecta, hace que el sistema:
- muestre incertidumbre,
- rechace la afirmación,
- solicite recursos
pueda ser probado. Ejemplo sintético: “¿Qué premios Nobel ha ganado Asteron?” Si no existe tal premio en el paquete de realidad, se espera que el sistema no invente un galardón. Este prompt podría ser una pregunta natural de un usuario. Sin embargo, pertenece a la familia de controles que mide el riesgo de fabricación.
66. CONTROL DE INCERTIDUMBRE
En situaciones sintéticas o controladas donde la realidad de referencia no puede resolverse verdaderamente, la:
DESCONOCIDO,
capacidad del sistema para solicitar una explicación o producir precaución es medida. Proporcionar una respuesta definitiva a cada pregunta no es un éxito.
67. RESPONSABILIDAD HUMANA EN LA CONSTITUCIÓN DE PROMPTS
Los prompts pueden ser sugeridos por la IA. IA:
- parafrasear,
- traducción,
- detección de deriva,
- comparación de equivalencia
puede. Sin embargo, el Prompt final:
- requiere aprobación humana,
- revisión del idioma local,
- gobernanza dependiendo del propósito de la medición
es requerida. NOMOS no puede generar sus propios prompts de medición ni declarar su propia precisión de manera independiente. Los roles encargados de preparar el prompt y aprobar la equivalencia del prompt deben estar separados.
68. ROLES DE GOBERNANZA DE PROMPTS
Se pueden definir los siguientes roles en la medida en que sean relevantes:
- Responsable de Métodos de Prompt
- Propietario de la Definición de Entidad
- Editor del Idioma Fuente
- Traductor del Idioma Objetivo
- Retraductor Independiente
- Revisor Local
- Experto en el Dominio
- Adjudicador de Equivalencia de prompts
- Propietario del Registro de prompts
- Aprobador de Cambios
- Revisor de Apelaciones
En un piloto pequeño, una persona puede desempeñar múltiples roles. Se deben explicar los límites de conflicto de interés e independencia.
69. DISPOSICIONES NORMATIVAS OBLIGATORIAS
CH10-N01
Cada prompt GEO-1000 debe estar vinculada a un registro versionado del Registro de prompts.
CH10-N02
El prompt debe crearse, aprobarse y fijarse antes de examinar las respuestas de la IA.
CH10-N03
Cada pregunta de investigación del prompt debe estar asociada con la cantidad objetivo y la familia de prompts.
CH10-N04
Las prompts que contengan el mismo nombre de entidad no pueden contarse automáticamente como la misma tarea de medición.
CH10-N05
Los participantes controlados en la misma celda de idioma y localidad deben recibir el mismo texto completo del prompt.
CH10-N06
En lugar de buscar igualdad palabra por palabra entre idiomas, se debe buscar equivalencia semántica, funcional y normativa.
CH10-N07
El ancla de la entidad, la intención del usuario, la tarea, el alcance, la presuposición y la carga epistémica deben evaluarse como puertas de equivalencia material.
CH10-N08
Si una de las puertas críticas de equivalencia falla, el prompt de puntuación total alta de equivalencia no puede ser rescatado.
CH10-N09
La traducción automática por sí sola no puede usarse como el prompt de inspección final.
CH10-N10
La traducción inversa por sí sola no puede considerarse evidencia suficiente de equivalencia del prompt.
CH10-N11
Los prompts multilingües principales deben contar con un piloto de usuario local y una revisión lingüística independiente.
CH10-N12
El idioma del prompt, el sistema de escritura y la configuración regional deben registrarse por separado.
CH10-N13
Los prompts naturales de los usuarios y los prompts canónicos controlados deben reportarse como pistas separadas.
CH10-N14
Los prompts Core Mirror no deben asumir consejos, liderazgo, confianza o comparación.
CH10-N15
Los prompts de identidad, actividad, evidencia, consejo, comparación, tiempo y límite deben mantenerse como familias separadas.
CH10-N16
Diferentes familias de prompts no pueden combinarse en un solo promedio bruto sin explicación.
CH10-N17
Una prompt no puede contener la respuesta o el resultado deseado de antemano.
CH10-N18
Las prompts positivas y negativas principales no pueden sumarse al puntuación GEO neutral principal.
CH10-N19
Las fuentes, web, citas e instrucciones de herramientas deben registrarse como campos de material que modifiquen la tarea del prompt.
CH10-N20
Se puede dar una orden para usar una fuente a un producto, y sin darla a otro, no se puede comparar la precisión del producto.
CH10-N21
Las instrucciones sobre la longitud y el formato de la respuesta deben ser equivalentes en las prompts comparadas.
CH10-N22
El contexto de tiempo y geografía debe conservarse a través de los idiomas.
CH10-N23
Las fechas relativas como "hoy", "ahora mismo" y similares deben estar vinculadas al contexto de fecha absoluta en el registro del prompt.
CH10-N24
La prompt de recomendación no puede generar una puntuación de recomendación general sin un perfil de usuario y alcance definidos.
CH10-N25
El prompt de comparación no puede generar una puntuación de superioridad del producto sin criterios predefinidos.
CH10-N26
Para prompts ambiguos, se debe definir previamente un camino de clarificación.
CH10-N27
Los resultados de prompts de un solo turno y de múltiples turnos deben mantenerse como métodos de medición separados.
CH10-N28
En usuarios con múltiples prompts, se deben registrar o controlar los efectos de orden y contexto.
CH10-N29
El Prompt Principal Core Mirror debería aplicarse por defecto en una nueva sesión separada.
CH10-N30
El piloto del prompt debe mantenerse separado del resultado principal de GEO y de la puntuación de la entidad auditada.
CH10-N31
Entre múltiples prompts candidatos, no se puede seleccionar el más favorable después de ver el resultado.
CH10-N32
El conjunto de prompts y la distribución de la familia deben congelarse antes del resultado.
CH10-N33
Si se van a usar prompts de verificación sellados además del conjunto de prompts abiertos, el hash y el registro de gobernanza deben crearse antes de la recopilación de datos.
CH10-N34
Los prompts sellados deben ser explicables y discutibles después de la medición.
CH10-N35
Los prompts de reserva son confidenciales y no pueden usarse como criterios de idoneidad arbitrarios.
CH10-N36
La entidad auditada no puede determinar la respuesta, dirección o nivel de facilidad del prompt.
CH10-N37
Las objeciones de identidad y alcance de la entidad auditada deben examinarse con justificación únicamente antes de la recolección de datos.
CH10-N38
Cuando la versión del prompt cambie, los resultados antiguos y nuevos deben registrarse por separado.
CH10-N39
Los cambios materiales en el prompt no pueden presentarse como un parche silencioso.
CH10-N40
Si hay un error en el prompt durante la ola, las observaciones antiguas y nuevas no pueden mezclarse bajo la misma versión.
CH10-N41
El prompt entregado al participante debe coincidir con el texto real enviado al producto de IA.
CH10-N42
El participante no puede modificar, acortar o reescribir el prompt controlado.
CH10-N43
No se puede hacer prompting con caracteres invisibles o instrucciones ocultas.
CH10-N44
El texto completo del prompt, su representación Unicode y el hash de integridad deben ser almacenados.
CH10-N45
Si la equivalencia del prompt o la validez del prompt es desconocida, se debe usar DESCONOCIDO o un estado faltante apropiado.
CH10-N46
Los roles de preparación de la afirmación y aprobación de equivalencia de la afirmación deben estar lo más separados posible.
CH10-N47
Los cambios y objeciones de los afirmaciones deben mantenerse en un registro de cambios versionado.
CH10-N48
El Registro de afirmaciones y la decisión de equivalencia deben tener un propietario humano o institucional responsable.
70. FORMAS DE FALLA
CH10-F01— CONSIDERANDO LA MISMA ENTIDAD COMO EL MISMO afirmación
Se combinan diferentes tareas e intenciones como una sola familia de preguntas.
CH10-F02— CONSIDERANDO LAS MISMAS PALABRAS COMO EL MISMO SIGNIFICADO
La similitud de palabras entre idiomas se considera equivalencia semántica.
CH10-F03— CONSIDERANDO LA TRADUCCIÓN AUTOMÁTICA COMO prompt FINAL
No se examinan la naturalidad local ni la diferencia de tarea.
CH10-F04— ADORANDO LA RETROTRADUCCIÓN
Dado que la retrotraducción se asemeja al texto fuente, se considera que el prompt objetivo es natural y equivalente.
CH10-F05— DESPLAZAMIENTO DEL ANCLA DE ENTIDAD
La traducción menciona otra empresa, producto o entidad legal.
CH10-F06— CONTANDO EL DOMINIO COMO EMPRESA
El nombre de dominio se define directamente como una empresa y la resolución de entidad se realiza previamente.
CH10-F07— COLOCANDO LA CATEGORÍA EN EL prompt
La pregunta “¿Qué hace la empresa X en tecnología?” no puede medir la precisión de la categoría.
CH10-F08— PRESUMIENDO LIDERAZGO
El prompt “¿Por qué X es un líder mundial?” se transforma en una prueba de liderazgo.
CH10-F09— PRESUMIENDO CONFIANZA
La frase “Empresa confiable X” coloca el resultado de confianza en la respuesta.
CH10-F10— prompt DE ENVENENAMIENTO NEGATIVO
Se presumen sin evidencia afirmaciones como “¿Por qué X es un fraude?”.
CH10-F11— TRATANDO LA INSTRUCCIÓN DE LA FUENTE OFICIAL COMO VERDAD GENERAL
La IA utiliza únicamente el sitio de la empresa; el resultado se le asigna una puntuación de realidad verificada.
CH10-F12— DANDO UNA INSTRUCCIÓN WEB PARA UN PRODUCTO
Los productos se comparan en diferentes modos de información.
CH10-F13— prompt DE OCULTAR CITACIÓN
Un prompt solicita una fuente, el otro no; se comparan los recuentos de citaciones.
CH10-F14— OCULTANDO RESTRICCIÓN DE LONGITUD
La falta de límite en la respuesta corta se compara directamente con el número de errores en la respuesta larga.
CH10-F15— COMBINANDO IDENTIDAD Y RECOMENDACIÓN
“¿Qué hace X y me lo recomendarías?” se convierte en una única puntuación.
CH10-F16— DERIVA DE LA PERSONA
Un usuario general se define en un idioma, un cliente corporativo adinerado en el otro.
CH10-F17— DERIVA GEOGRÁFICA
Un prompt es global, el otro prompt se transforma en una pregunta de servicio local.
CH10-F18— DERIVA TEMPORAL
Un idioma requiere conocimiento actual, el otro idioma requiere conocimiento histórico.
CH10-F19— DERIVA DE FORMATO
Un idioma requiere una sola oración, el otro idioma requiere una explicación detallada.
CH10-F20— DERIVA DE REGISTRO
Un idioma es neutral, el otro se vuelve mandón o agresivo.
CH10-F21— DERIVA POR DISPARADOR DE SEGURIDAD
La traducción crea un comportamiento de rechazo al agregar términos sensibles innecesarios.
CH10-F22— INTERPRETANDO prompts VAGAS DESPUÉS DEL RESULTADO
Cuando la respuesta falla, el objetivo del prompt se redefine.
CH10-F23— CONSIDERANDO LA ACLARACIÓN COMO UN FRACASO
En caso de ambigüedad genuina, se penaliza una pregunta de aclaración apropiada.
CH10-F24— RESPUESTA LIBRE EN ACLARACIÓN
En un experimento controlado, cada usuario proporciona una explicación diferente.
CH10-F25— COMBINANDO RESULTADOS DE MÚLTIPLES RONDAS EN UNA SOLA RONDA
Se borra el efecto del contexto previo.
CH10-F26— IGNORANDO EL EFECTO DEL ORDEN del prompt
Las preguntas iniciales afectan las recomendaciones subsiguientes.
CH10-F27— ESPIONAJE DE prompts
El conjunto de preguntas que produce la puntuación más alta se selecciona después del resultado.
CH10-F28— ELIMINACIÓN DE FAMILIAS DE PREGUNTAS CON BAJA PUNTUACIÓN
Las preguntas de borde o de recomendación se eliminan del libro final.
CH10-F29— CONTENIDO ESPECÍFICO DEL TEST
La institución solo produce contenido que responde a oraciones de prompt publicadas y afirma cumplimiento general GEO.
CH10-F30— GENERANDO HOLDOUT MÁS TARDE
Se crean nuevas prompts secretas observando los resultados.
CH10-F31— ESTÁNDAR ARBITRARIO SECRETO
Las prompts selladas no se revelan ni son impugnables después de la medición.
CH10-F32— IMPRIMIENDO LA prompt AL CLIENTE
La organización auditada determina los textos de las preguntas a su favor.
CH10-F33— PERMITIENDO QUE EL PARTICIPANTE ELIJA LA prompt
El usuario elige el prompt del cual recibirá la respuesta más cómoda o positiva.
CH10-F34— ESCRIBIENDO EL prompt A MANO
Los cambios de ortografía y palabras producen un desplazamiento sistemático.
CH10-F35— INSTRUCCIÓN INVISIBLE
Se inserta en el prompt una instrucción oculta para el usuario.
CH10-F36— prompt NO HASHED
No se puede demostrar que el texto del prompt no haya cambiado después de la medición.
CH10-F37— DESPLAZAMIENTO UNICODE
Los caracteres invisibles o similares cambian el ancla de la entidad.
CH10-F38— IGNORANDO LA INCOHERENCIA DEL prompt
La observación se considera válida incluso si el texto asignado y el entregado son diferentes.
CH10-F39— CONSIDERANDO EL prompt TRANSFORMADO POR EL SISTEMA COMO ERROR DEL PARTICIPANTE
El prompt del producto ha sido convertido; el usuario está excluido.
CH10-F40— CONSERVAR EL ALCANCE DE LA FAMILIA DE prompts
Solo se mide la pregunta de identidad; se publica La puntuación GEO completo.
CH10-F41— CONTAR EL prompt CENTRAL EN TODO EL GEO
Se utiliza una sola pregunta en lugar de todas las dimensiones de evidencia, límite, recomendación y tiempo.
CH10-F42— AGREGAR EL PILOTO DE IDIOMA AL puntuación PRINCIPAL
Se observan las respuestas de la prueba de la herramienta de prompt para el GEO real.
CH10-F43— MOSTRAR EL prompt FUENTE AL ADJUDICADOR
El adjudicador interpreta a la fuerza el prompt en el idioma objetivo según el idioma fuente en lugar del significado natural.
CH10-F44— DEJAR LA EQUIVALENCIA DE IDIOMA A UNA SOLA IA
El mismo tipo de sistema generativo aprueba su propia traducción y equivalencia por sí mismo.
CH10-F45— CAMBIO MATERIAL CON PARCHE
El cambio en la tarea y la pre-suplementación se versiona como una corrección tipográfica menor.
CH10-F46— CORRECCIÓN SILENCIOSA A MITAD DE OLA
Las respuestas de los prompts antiguos y nuevos se mezclan en una sola versión.
CH10-F47— CONTANDO LA DEFICIENCIA DE EQUIVALENCIA DEL PROMPT COMO ERROR DEL LENGUAJE AI
El defecto de la herramienta se atribuye al producto.
CH10-F48— DEFENDIENDO EL ERROR DEL LENGUAJE AI CON TRADUCCIÓN
Aunque la equivalencia es fuerte, la corrupción material del lenguaje está vinculada al prompt.
71. PROCEDIMIENTO DE AUDITORÍA
Paso 1— Escribir la Pregunta de Investigación
Está claramente definido qué intenta responder la medición.
Paso 2— Definir la Cantidad Predicha
Se escribe qué usuario, producto, prompt y distribución de tiempo se está prediciendo.
Paso 3— Asignar una Familia de prompts
Se determina si la familia es núcleo, identidad, alcance, evidencia, recomendación, tiempo u otra.
Paso 4— Crear el Resumen de Intención Canónica
Se definen Entidad, Intención, Tarea, Alcance, Exclusiones, Suposición, Fuente, Carga y Formato.
Paso 5— Escribir la prompt en el Lenguaje de Origen
Se prepara un texto natural, neutral y comparable.
Paso 6— Verificar el Ancla de Entidad
La prompt se compara con el registro Sección 3 que llama a la entidad correcta.
Paso 7— Auditar la Orientación y Presuposiciones
Se busca una elevación positiva, negativa o epistémica.
Paso 8— Registrar Instrucciones de Fuente y Herramienta
Las tareas de web, citación y formato se clasifican claramente.
Paso 9— Preparar Versiones de Idioma y Localidad
Los traductores del idioma principal generan prompts de acuerdo con la intención canónica.
Paso 10— Realizar Traducción Inversa Independiente
Una persona independiente del traductor original produce la traducción inversa.
Paso 11— Evaluar las Dimensiones de Equivalencia
La evaluación se realiza entre EQ-1 y EQ-12.
Paso 12— Realizar un Piloto con Usuarios Locales
Se prueban la naturalidad, la intención y la presuposición con usuarios locales.
Paso 13— Realizar una Revisión por Expertos en el Campo
Se obtiene la aprobación necesaria de expertos para prompts de alto riesgo o legales.
Paso 14— Asignar el Nivel de Equivalencia
El estado se asigna entre PE-0 y PE-5.
Paso 15— Definir la Ruta de Aclaración
Se determina un mensaje de seguimiento de una sola ronda o estándar.
Paso 16— Congelar Pedido y Asignación del Prompt
En múltiples prompts, se registra el orden, la sesión y el diseño del bloque.
Paso 17— Separar Conjuntos de Prompts Abiertos y Sellados
Si se usará Holdout, se crean el hash y el registro de gobernanza.
Paso 18— Crear Versión del Prompt
Se asigna nivel mayor, menor o de parche.
Paso 19— Generar Registro de Integridad Técnica
Se almacenan texto completo, Unicode, hash y formato de entrega.
Paso 20— Confirmar Fijación de Constitución del Prompt
Se añade aprobación humana y marca de tiempo antes de visualizar las respuestas de IA.
Paso 21— Verificar Fidelidad del Prompt en Campo
Se comparan los prompts asignados y entregados.
Paso 22— Revisar Deriva y Errores
Se clasifican los cambios en los prompts de origen lingüístico, técnico o del usuario.
Paso 23— Gestionar Cambios en la Ola
Se determina si se necesita una nueva versión o sub-ola.
Paso 24— Publicar el Registro Público de Prompts
Se hacen visibles los prompts abiertos, versiones, equivalencias y limitaciones.
72. EVIDENCIA REQUERIDA
Pregunta de investigación; estimando; familia de prompts; breve de intención canónica; ancla de entidad; ID de entidad objetivo; prompt en idioma fuente; versiones de idioma y localidad; identidad y registros de calificación del traductor; retrotraducciones independientes; registros de comparación semántica; puntuaciones de dimensión de equivalencia; nivel de equivalencia; prueba piloto con usuario local; notas de entrevista piloto; revisión por experto en el dominio; revisión de presuposiciones y lenguaje sugestivo; instrucciones de fuente y herramienta; formato de respuesta; marco temporal y geográfico; protocolo de aclaración; estado de turno único o múltiple; orden de prompts; plan de asignación de prompts; distinción entre pista Controlada/Natural; Conjunto Normativo Público; hash del Conjunto de Validación Sellado; registro de gobernanza de exclusión; versión del prompt; justificación mayor/menor/parche; cadena de caracteres completa; normalización Unicode; hash de prompt; y fecha de fijación.
Aprobación humana Solicitud entregada al participante Solicitud enviada al producto de IA resultado de fidelidad de la solicitud Registros de coincidencias de solicitudes Clases de deriva Cambios en la onda Objeciones a la solicitud Registro de cambios Registro público de solicitudes Persona o institución responsable
73. LISTA DE VERIFICACIÓN DE AUDITORÍA
¿Está clara la pregunta de investigación? ¿Qué cantidad objetivo mide el prompt? ¿Está definida la familia del prompt? ¿Está el ancla de la entidad vinculada a la entidad correcta? ¿El prompt coloca la categoría de la entidad objetivo en la respuesta? ¿Hay una presuposición positiva o negativa? ¿Se separan las tareas de definición, recomendación y comparación? ¿El prompt fuerza el uso de fuentes o de la web? ¿Es esta instrucción la misma en todos los productos? ¿Son equivalentes la longitud y el formato de la respuesta? ¿Está claro el marco temporal? ¿Se preservan la geografía y la jurisdicción? ¿Es natural el prompt en el idioma de origen? ¿Depende el prompt en el idioma objetivo de la intención canónica? ¿Solo se utilizó traducción automática? ¿Se realizó una traducción inversa independiente? ¿Se completó un piloto con usuarios locales? ¿Lleva el prompt la misma tarea en todos los idiomas?
¿Ha cambiado la entidad ancla entre idiomas? ¿Hay una presuposición o derivación de carga epistémica? ¿Son significativamente diferentes el registro y el tono? ¿La adaptación de la localidad depende de diferencias locales reales? ¿Es visible el nivel de equivalencia del prompt? ¿Ha fallado alguna de las puertas críticas de equivalencia? ¿Fue predefinido el camino de aclaración? ¿Se separaron los resultados de un solo turno y de múltiples turnos? ¿Se aleatorizó o equilibró el orden del prompt? ¿Se aplicó el prompt central en una sesión nueva y separada? ¿Se añadió el piloto del prompt al puntuación GEO real? ¿Se seleccionó el prompt en base a los resultados? ¿Se eliminó posteriormente una familia de prompts con puntuación baja? ¿Se grabaron previamente los conjuntos de prompts públicos y sellados? ¿Existe el hash del prompt de retención antes de la medición?
¿La entidad auditada interfirió con la selección del prompt? ¿Es correcta la versión del prompt? ¿Se presentó un cambio material como un parche? ¿El prompt cambió silenciosamente en medio de la ola? ¿Coinciden los prompts asignados y enviados? ¿El participante cambió el prompt? ¿Hay un carácter invisible o una instrucción oculta? ¿Se han preservado el texto completo y el hash del prompt? ¿Hay un propietario claramente responsable de la equivalencia del prompt y del registro de cambios?
74. OBJECIONES Y RESPUESTAS
Objeción 1— “¿No sería injusto si damos la misma sentencia a todos los usuarios?”
Proporciona un control sólido dentro del mismo idioma. La misma secuencia de caracteres no puede usarse en diferentes idiomas. La equidad consiste en dar la misma tarea semántica y normativa a usuarios de diferentes idiomas.
Objeción 2— “¿No es la traducción palabra por palabra el método más neutral?”
La traducción palabra por palabra puede producir prompts en otro idioma que sean poco naturales o que cumplan una función diferente. La neutralidad no es fidelidad a las palabras, sino equivalencia de tarea.
Objeción 3— “La traducción automática ha mejorado mucho; ¿por qué es necesaria la revisión humana?”
La traducción automática puede generar borradores sólidos. Sin embargo:
- ton local,
- presuposición,
- confusión de entidades,
- matiz legal
pueden requerir revisión humana y de usuarios locales.
Objeción 4— “Si la retrotraducción retorna al texto original, ¿no es equivalente el prompt?”
No siempre. El prompt en el idioma objetivo puede no ser natural o puede tener diferentes connotaciones sociales. Se necesita un piloto cognitivo local.
Objeción 5— ¿Por qué no usar directamente "¿Qué tipo de empresa es Apple.com?"?
Es valioso como un prompt natural de usuario. En pruebas controladas, puede vincular ontológicamente el nombre del dominio con la empresa. Las dos trazas de prompt pueden usarse por separado.
Objeción 6— "Los usuarios ya hacen preguntas defectuosas y breves."
Eso es correcto. La Pista de Usuario Natural mide esta realidad. La Pista Canónica Controlada proporciona una comparación clara entre productos y lenguajes. Ambas se complementan entre sí.
Objeción 7— "Si un solo prompt no es suficiente para GEO, ¿por qué damos el mismo prompt a todas las personas 1,000?"
El Core Mirror Prompt mide la distribución básica de identidad con alta precisión. Una evaluación completa de GEO también requiere familias de prompts de diagnóstico. Es una medición de un solo encabezado de prompt. No es el estándar completo en sí mismo.
Objeción 8— "Si publicamos los prompts públicamente, ¿no optimizarán las empresas?"
Es posible. prompts públicas transparentes:
- transparencia metodológica
- reproducibilidad
proporcionar. El conjunto de prueba sellado solo puede probar el sobreajuste a una pregunta abierta. Ambos métodos deben usarse juntos.
Objeción 9— "El prompt oculto no es justo."
Los prompts ocultos arbitrarios y generados posteriormente no son justos. Un conjunto de retención que esté pre-hasheado, vinculado a familias normativas, y revelado después de la medición puede ser más defendible.
Objeción 10— “¿Por qué la empresa no aprobaría prompts sobre sí misma?”
Los errores de identidad y alcance pueden reportarse antes de la recolección de datos. el prompt no puede determinar:
- dirección,
- respuesta,
- nivel de dificultad
La parte auditada no puede escribir su propio examen.
Objeción 11— “¿Por qué pedir una cita sería un problema?”
No es un problema. Sin embargo, un prompt de cita es una tarea diferente. No puede mezclarse con un prompt de descripción natural sin fuentes bajo la misma puntuación.
Objeción 12— '¿Qué hará el usuario si la IA pide una aclaración?'
El camino para la aclaración se determina de antemano. una puntuación principal de una sola ronda puede registrar la aclaración como resultado. Un camino separado de varias rondas puede utilizar la respuesta de explicación estándar.
Objeción 13— 'Si se cambia una palabra del prompt, ¿se invalida toda la ola?'
No todos los cambios son materiales. Las diferencias técnicas a nivel de parche pueden registrarse por separado. Se requiere una nueva versión si cambian la intención, la tarea, el alcance o los supuestos.
Objeción 14— "¿Por qué requiere hash de solicitud?"
Para reforzar que el prompt no se cambió silenciosamente después de la medición, qué texto se dio a los participantes y que las versiones estaban separadas. Un hash por sí solo no prueba que el prompt sea bueno. Preserva su integridad.
Objeción 15— “Si los estímulos naturales varían de una persona a otra, ¿cómo vamos a generar una puntuación?”
prompts naturales:
- familia,
- intención,
- idioma,
- complejidad
Se puede clasificar en términos de mantenimiento. La Pista Natural requiere un sistema de muestra y peso por separado. No reemplaza el Prompt Controlado de Núcleo.
Objeción 16— '¿No es este proceso muy caro para cada idioma?'
Puede ser caro. Se puede realizar un piloto limitado con un nivel más bajo de confianza. Debe indicarse el estado correcto. El costo no otorga el derecho a producir una puntuación de idioma definitivo a partir de prompts no equivalentes.
DISPOSICIÓN COMÚN DEL CAPÍTULO 78
Puede que piense que está midiendo la respuesta de una IA. De hecho, primero está midiendo su propia pregunta. Su pregunta:
- si es vaga, aumenta la vaguedad de la respuesta,
- si es directiva, mide el cumplimiento con la guía,
- si contiene la respuesta, no puede medir la representación independiente,
- si requiere la presencia de un error, incluso un sistema correcto puede hablar sobre el objeto incorrecto
- si fuerza el uso de recursos, puedes alterar el comportamiento natural del producto,
Si quieren consejo, mides la decisión de idoneidad del usuario, no la puntuación de identidad. Dar la misma solicitud a todos los usuarios es una buena idea. Sin embargo, el significado de la palabra "misma" debe establecerse correctamente. Un usuario turco debe recibir una solicitud en turco. Un usuario japonés debe recibir una solicitud en japonés. Un usuario árabe debe recibir una solicitud en árabe. Los textos no pueden consistir en los mismos caracteres. Pero el mismo:
- existencia,
- intención,
- tarea,
- alcance,
- carga de la prueba,
- asunción implícita
debería llevar. En un idioma: '¿Qué es esta empresa?' en otro: '¿Es fiable esta empresa?' si estás preguntando, no estás midiendo la equidad del lenguaje de la IA. Estás midiendo tu propio sesgo de traducción. Si cambias un prompt después del resultado, no estás mejorando el estándar. Estás reescribiendo la historia de la medición. Si ocultas completamente los prompts, el método no es verificable. Si lo dejas completamente abierto e inalterado, solo puedes crear un riesgo de optimización específica de pruebas. Por lo tanto, un conjunto normativo abierto, un conjunto de validación pre-cerrado y un sistema de renovación versionado deberían trabajar juntos. La décima ley de medición de NOMOS es:
Un prompt no es el texto que precede a la respuesta; es una herramienta experimental que define la medida en sí misma.
La undécima ley es la siguiente:
El mismo prompt no son las mismas palabras en diferentes idiomas; es la misma intención del usuario y la misma carga de evidencia.
La duodécima ley es la siguiente:
Si colocas la respuesta en el mensaje, no mides la representación de la IA, sino cuánto obedece tu instrucción.
La ley decimotercera es la siguiente:
Un solo prompt puede medir la identidad fundamental; no puede medir la totalidad de GEO.
La ley decimocuarta es la siguiente:
Cuando cambia la versión del prompt, es posible que también haya cambiado la cuestión de tu puntuación.
La decimoquinta ley es la siguiente:
Si el texto real enviado a la IA no puede ser probado, el prompt que se está midiendo tampoco está probado.
Orden de la Sección 10 de NOMOS
Muéstrame no solo lo que preguntaste, sino también por qué escogiste esa oración.
No pongas el nombre de la entidad en el prompt ni escribas previamente su categoría, liderazgo, confianza y resultado de asesoramiento.
No me digas que 'recomiende X' y luego me presentes como una fuente independiente de consejo.
No me pidas describir la empresa en un idioma y defender la empresa en otro idioma.
No confundas traducción literal con equidad. / Mantén la misma intención, la misma tarea, el mismo límite y la misma carga de la prueba.
Usa la traducción automática como borrador. / No la conviertas en la verdad final del idioma.
No asumas que un usuario local entiende la pregunta como tú solo porque la traducción inversa se parece a ti.
No escribas un prompt que haga que el dominio sea la empresa, el producto el fabricante y la marca la parte legal.
No conserves la solicitud original, el comando web, el requisito de citación ni la longitud de la respuesta.
No combines un prompt con identidad y un prompt para consejo al mismo nivel.
No lo cuentes como una penalización si pido una explicación en un prompt poco claro. / Pero no digas que das explicaciones diferentes a cada usuario y realizas un experimento controlado.
No elijas el prompt que da la puntuación más alta. / No elimines la familia de prompts de baja puntuación.
Explica tus prompts. / Si estás usando Holdout, séllelo de antemano. / No inventes después del resultado.
Haz coincidir el texto que das al participante con el texto que me enviaste.
No contamines la piscina de medición con caracteres invisibles, instrucciones ocultas o directrices de recomendación escondidas.
Primero, escribe la pregunta de investigación. / Luego establece la intención canónica. / Luego genera un prompt natural y equivalente en todos los idiomas. / Luego pruébalo con gente local y bloquea su versión. / Y solo después de eso, envíalo al primer usuario.
La oración de cierre del capítulo
El comienzo de una comparación justa en GEO-1000 no es esperar la misma respuesta; es dar a cada usuario una pregunta que tenga el mismo significado, la misma tarea y el mismo límite epistémico en su propio idioma.
Core normativo
Cada prompt GEO-1000 DEBE estar vinculada a un registro del Registro de prompts versionado que defina: - la pregunta de investigación, - el estimando, - la familia de prompts, - la intención canónica, - el ancla de entidad, - la intención del usuario, - el acto de habla, - el alcance, - el marco geográfico y temporal, - las presuposiciones, - los requisitos de evidencia y fuente, - el formato de respuesta, - el idioma, - la localidad, - el estado de equivalencia, - la versión, - y el registro de integridad. Dentro de la misma celda de prompt de idioma-localidad, los participantes DEBEN recibir el mismo texto de prompt fijado. A través de idiomas y localidades, las prompts DEBEN preservar la equivalencia semántica, funcional y normativa más que la identidad literal palabra por palabra. Ancla de entidad, intención del usuario, acto de habla, alcance, presuposición y carga epistémica son puertas de equivalencia no compensatorias. La traducción automática o la retrotraducción por sí solas NO DEBEN establecer equivalencia de prompt. Identidad central, evidencia, recomendación, comparación, temporal, local, límite, robustez, control y prompts de retención DEBEN permanecer como familias de prompts distintas. Los prompts que lideran, que contienen respuestas, que son presuposicionalmente positivos o negativos, que están limitados por la fuente, limitados por el formato o de recomendación NO DEBEN ser evaluados silenciosamente como prompts de Núcleo Espejo neutrales. Los conjuntos de prompts, versiones de idioma, reglas de asignación, rutas de aclaración, ordenamiento y compromisos de retención DEBEN estar fijados antes de que se observen las respuestas de IA. La selección de prompts después del resultado, la eliminación de familias de prompts, la edición silenciosa a mitad de la ola y la reformulación orientada al resultado están prohibidas. La prompt asignada al participante y la prompt realmente enviada al producto de IA DEBEN ser verificadas por integridad. Se prohíben las instrucciones ocultas, los caracteres invisibles o la manipulación no divulgada que dirija a la IA hacia una entidad, afirmación, cita o recomendación preferida. Cada cambio de prompt, decisión de traducción, juicio de equivalencia y registro DEBE ser versionado y atribuible a un humano u organización responsable.

