Protocolo de Auditoría GEO de NOMOS

08 / K04 · K05 · K06 · K07 · K08 · K22

Selección y ponderación de participantes y sesgo de muestreo

Selección y ponderación de participantes y sesgo de muestreo — El capítulo 5 definió la población objetivo de usuarios. El capítulo 6 transformó esta población en un diseño de muestra distribuido entre países, idiomas y interfaces de usuario. El capítulo 7 estableció sistemas de observación complementarios para...

Versión
0.9.0
Extensión
12.459 palabras
Estado
versión candidata fijada para publicación
Bases metodológicas
K04 · K05 · K06 · K07 · K08 · K22

Límite de Capítulo

El capítulo 5 definió la población objetivo de usuarios. El capítulo 6 transformó esta población en un diseño de muestra distribuido entre países, idiomas y interfaces de usuario. El capítulo 7 estableció sistemas de observación complementarios para países pequeños y lenguas con pocos recursos que el panel principal de población podría dejar invisibles. Ahora los números en el plan de muestra necesitan convertirse en personas reales:

¿Dónde se encontrarán estos participantes, cómo serán seleccionados, bajo qué condiciones serán admitidos en el panel y con qué sesgos entrarán en la puntuación GEO?

¿De un panel en línea de una organización de investigación? ¿De una convocatoria abierta en redes sociales? ¿De universidades? ¿De la propia lista de usuarios del cliente? ¿De socios de investigación locales? ¿Solo de personas que usan productos de IA con frecuencia? ¿De aquellos que acceden al producto por primera vez? ¿De los clientes de la marca? ¿De empleados de competidores? ¿De suscriptores de planes pagos? ¿Cómo se verificará que una persona realmente vive en ese país? ¿Cuántas veces se contará a la misma persona si usa múltiples cuentas? ¿Cuánto se le pagará al participante? ¿El pago incentivará completar la tarea rápidamente o enviar un resultado específico? ¿Se preservará la observación si el participante carga una respuesta incorrecta de IA? ¿O será reemplazado por un nuevo usuario diciendo: 'La tarea se realizó incorrectamente.'? Se pueden haber recopilado mil capturas de pantalla válidas. Pero los participantes:

  • 60% son usuarios intensivos de IA.
  • 20% son estudiantes de tecnología,
  • 10% son clientes de la marca auditada,
  • 5% son empleados de la empresa,
  • el resto son usuarios generales

¿Qué población, entonces, representará el resultado? ¿Puede el ponderado demográfico corregir completamente la diferencia? Igualar los totales de edad, género, país y idioma no necesariamente corrige las diferencias no medidas en interés tecnológico, conocimiento de la marca, acceso a planes de pago o patrones de uso de la IA. El ponderado es valioso, pero no puede borrar todos los defectos en la selección de participantes. Este capítulo aplica el requisito anterior: que cada control de auditoría pueda ser probado por modelo, fecha, país, idioma, conjunto de consultas, número de repeticiones y registro de medición, a la selección de los participantes reales. También preserva la demanda central de NOMOS: evidencia, límite, contexto y tiempo. Este capítulo:

  • fuentes de selección de participantes
  • la distinción entre paneles probabilísticos y no probabilísticos,
  • verificación de elegibilidad e identidad,
  • control de acceso por país, idioma y producto,
  • unicidad del participante,
  • riesgo de recompensa y redirección,
  • condicionamiento del panel,
  • asignación de tareas,
  • no respuesta y deserción del panel,
  • participación fraudulenta o automatizada,
  • sesgo de selección y cobertura,
  • el poder y límite del ponderado,
  • estados de calidad de la muestra

define. Este capítulo aún no:

  • todas las áreas técnicas del registro del producto de IA,
  • el sistema completo de traducción y versión de los prompts,
  • La arquitectura detallada de la infraestructura Capture NOMOS,
  • adjudicación de afirmaciones atómicos,
  • la fórmula de puntuación final

no está completamente definida. La pregunta clave de la Sección 8 es:

Cuando recopilamos mil registros válidos, ¿cómo demostramos a qué personas reales pertenecen estos registros y qué población humana pueden representar?

NOMOS Desafío

Compras 1,000 personas de un panel de investigación en línea. El proveedor del panel te dice: “1,000 participantes listos según tus cuotas de país y edad.” Los participantes completan la tarea. Suben capturas de pantalla. Resultados sin procesar:

90 por ciento de representación precisa.

En tu informe, escribes: “90% de usuarios en todo el mundo están representados con precisión.” Sin embargo, la distribución real de participantes es la siguiente:

Frecuencia de uso de IAParticipación de la población objetivoParticipación en el panel
Uso bajo o poco frecuente50%10%
Uso medio30%30%
Uso intensivo20%60%

Usuarios intensivos de IA:

  • mejores hábitos de prompt,
  • más cuentas de pago,
  • nuevas interfaces de productos,
  • conocimiento de personalización,
  • mayor familiaridad con la tecnología

puede tener. Incluso si se usa el mismo prompt fijado:

  • plan de cuenta,
  • interfaz,
  • uso previo,
  • acceso al producto

puede ser diferente. Deja que las tasas de aprobación del grupo sintético sean las siguientes:

Frecuencia de uso de IAtasa de aprobación
Uso bajo o poco frecuente72%
Uso medio84%
Uso intensivo96%

El resultado bruto del panel:

0.10(72)+0.30(84)+0.60(96)=90

es decir:

90 por ciento

Con los pesos de la población objetivo, sin embargo, el resultado es:

0.50(72)+0.30(84)+0.20(96)=80.4

Por lo tanto, las mismas respuestas 1,000 producen dos resultados diferentes:

  • Resultado bruto del panel: 90 por ciento
  • Resultado de la población objetivo: 80.4 por ciento

Ahora imagina que lo has ponderado. Cada una de las 100 personas en el grupo de bajo uso recibe un peso alto. Cada una de las 600 personas en el grupo de alto uso recibe un peso bajo. El tamaño de muestra bruto sigue siendo 1,000. Sin embargo, el tamaño de muestra efectivo disminuye a aproximadamente 349. Por lo tanto, es posible que hayas recopilado 1,000 archivos. Estadísticamente, puede que no tengas el volumen de información de 1,000 personas iguales e independientes. Ahora una pregunta más difícil: En el grupo de bajo uso, personas que nunca han sido incluidas en el panel:

  • bajo nivel de conexión,
  • usando tecnología de asistencia,
  • viviendo en una ciudad pequeña,
  • no teniendo un dispositivo específico

Si hay personas, ¿puede el ponderado hacer que regresen? No. Una observación de una persona que no está en el marco de muestreo en absoluto no puede ser producida mediante ponderación. Ahora la empresa auditada envía conexiones a sus propios clientes: 'Por favor participe en la encuesta.' Los clientes leales de la empresa participan en alta proporción. Las personas que conocen a los competidores pero no usan la empresa participan menos. Los pesos de edad y país pueden ser correctos. El sesgo por lealtad a la marca puede continuar. Ahora otro problema: Se le dice al participante: 'Ganarás un bono si subes una respuesta de IA correcta y de alta calidad.' El participante revisa la respuesta. Elige el mejor resultado. Recorta la captura de pantalla. Esta ya no es la respuesta natural del producto de IA. Es la respuesta seleccionada creada por el sistema de recompensas. La primera regla de esta sección es:

El número de participantes no es el poder representativo de los participantes.

Su segunda disposición establece:

La asignación aleatoria no es selección aleatoria de la población.

Su tercera disposición establece:

El ponderado puede reducir el desequilibrio observado; no puede crear una persona no observada.

Su cuarta disposición establece:

La inclusión de un participante en el panel, la retención en la tarea o el reemplazo no pueden depender del contenido de la respuesta de la IA.

Su quinta disposición establece:

La recompensa debe otorgarse por completar el protocolo de manera honesta, no por elegir una respuesta positiva o deseada.

1. OBJETIVO DEL CAPÍTULO

El propósito de esta sección es hacer visible, imparcial y auditable toda la cadena de selección desde la población objetivo hasta la observación real del usuario. La sección distingue normativamente:

  • Población objetivo y marco de muestreo
  • Marco de muestreo versus fuente del participante
  • Persona seleccionada versus persona invitada
  • La persona invitada y la persona que acepta participar
  • El participante y la persona que completa la tarea
  • La persona que completa la tarea y la observación válida
  • Humano y cuenta
  • Humano y dispositivo
  • Humano y sesión
  • Panel probabilístico y panel de voluntarios
  • Selección aleatoria dentro del panel y selección aleatoria de la población
  • Cumplimiento de cuotas y representación verdadera
  • Equilibrio demográfico y equilibrio conductual
  • Familiaridad personal y idoneidad para la población objetivo
  • Cliente, empleado y usuario general
  • Recompensa al participante e incentivo por resultados
  • Velocidad de la tarea e integridad de la tarea
  • Observación inválida con no respuesta
  • Cambio de población con pérdida del panel
  • Participante falso y observación real de baja calidad
  • Fraude de datos y respuesta incorrecta de IA
  • Corrección de sesgo con ponderación
  • Producción de evidencia con calibración
  • Tamaño de muestra bruto vs. tamaño de muestra efectivo
  • Privacidad del participante y evidencia de auditoría
  • Panel de población general y panel de expertos o clientes

Al final de esta sección, cada auditor GEO-1000 debería poder responder a las siguientes preguntas:

¿De qué fuente y bajo qué regla se seleccionaron los participantes?

¿Quién no tuvo posibilidad de unirse al panel?

¿Quién tenía más probabilidades de participar y por qué?

¿Qué diferencias conocidas corrigen los pesos y cuáles no corrigen?

¿Se tomó una decisión de participación inválida o falsa sin ver el contenido de la respuesta de la IA?

¿Afectó la recompensa a los participantes su comportamiento y elección de respuestas?

2. DISPOSICIÓN NORMATIVA CENTRAL

Cada observación GEO-1000 debe llevar una cadena de selección de participantes trazable desde la población objetivo hasta un registro analítico válido; las decisiones de selección, invitación, aceptación, asignación de tareas, finalización, verificación, exclusión y ponderación deben ser independientes del contenido positivo o negativo de la respuesta de la IA. [K04–K06] Un panel de participantes únicamente:

  • país,
  • no implica ninguna idoneidad en términos de edad,
  • idioma

No puede considerarse adecuado para la representación de la población porque cumple con las cuotas. El panel también debe llevar la siguiente información en la medida que sea relevante:

  • Fuente del participante
  • Mecanismo de selección
  • Método de participación en el panel
  • Criterios de elegibilidad
  • Verificación única de humano
  • Verificación de país e idioma
  • Verificación de acceso al producto de IA
  • Información de cuenta y plan
  • Dispositivo e interfaz
  • Frecuencia de uso de IA
  • Familiaridad con la marca
  • Relación con la entidad auditada
  • Estructura de incentivos
  • Método de asignación de tareas
  • No respuesta
  • Invalidación
  • Repetición y condicionamiento del panel
  • Ponderación
  • Falta de cobertura
  • Privacidad y consentimiento

Medir parte de esta información puede afectar al participante. Por lo tanto, el orden de la recolección de datos también es parte del protocolo.

3. CADENA DE SELECCIÓN DE PARTICIPANTES

La cadena desde la población objetivo hasta la observación final consiste en las siguientes etapas:

U→F→S→I→E→A→C→V

Aquí:

  • U: población objetivo de usuarios
  • F: individuos incluidos en el marco muestral
  • S: personas seleccionadas
  • I: personas invitadas
  • E: individuos cuya elegibilidad ha sido confirmada y que han sido incluidos en el estudio
  • A: personas asignadas a la tarea
  • C: personas que completan la tarea
  • V: personas que producen observaciones analíticas válidas

En cada transición, se pueden perder personas o surgir nuevos sesgos. Por ejemplo:

  • Aquellos en la población objetivo que no están en el panel
  • Aquellos en el panel que no son invitados
  • Aquellos invitados que no aceptan
  • Aquellos que aceptan pero no completan la tarea
  • Aquellos que completan pero producen registros inválidos

no son las mismas personas. Por lo tanto, solo las últimas 1,000 observaciones válidas no pueden ser reportadas. Todo el embudo de selección debe ser visible.

4. FUENTES DE PARTICIPANTES

GEO-1000 no tiene que estar vinculado a una única fuente de participantes. Cada fuente tiene su propio sesgo y alcance.

4.1. Panel de Población de Probabilidad

Los participantes tienen una probabilidad conocida y no nula de ser seleccionados de una población definida. Fuentes:

  • hogar,
  • dirección,
  • población o registro elegible,
  • probabilidad de selección telefónica o por etapas múltiples

puede ser. Ventajas:

  • se puede establecer un peso de diseño,
  • la inferencia poblacional es más fuerte,

el proceso de selección puede ser más transparente. Limitaciones:

  • puede ser costoso a escala global,
  • en algunos países, puede que no exista un marco adecuado,
  • También puede ser necesario encontrar la subpoblación con acceso a productos de IA

De nuevo, habrá falta de respuesta. La selección probabilística no es automáticamente una representación perfecta.

4.2. Panel de Investigación Profesional de Voluntarios

Los participantes se han registrado previamente de forma voluntaria para el panel de investigación. Ventajas:

  • es rápido,
  • puede acceder a múltiples países,
  • puede proporcionar perfil y conocimiento de idiomas,

se puede realizar medición repetida. Limitaciones:

  • los participantes son propensos a la investigación,
  • el nivel de uso de la tecnología puede ser alto,
  • pueden estar presentes usuarios frecuentes del panel,
  • las probabilidades de ingreso a la población pueden ser desconocidas,

la misma persona puede estar registrada en más de un panel. Este panel:

no puede presentarse como una muestra probabilística de la población mundial

No debe representarse como una muestra de probabilidad de la población mundial.

4.3. Llamado Abierto en Línea

La participación se obtiene a través de las redes sociales, un sitio web o un formulario de registro abierto. Ventajas:

  • amplia visibilidad,
  • bajo costo,
  • acceso a pequeños países y comunidades lingüísticas

puede proporcionarse. Limitaciones:

  • fuerte auto-selección,
  • concentración de fanáticos o críticos de la marca,
  • participación falsa y repetida,
  • sobre-representación de entusiastas de la tecnología

puede crearse. Un llamado abierto puede ser mucho más adecuado que el Panel Principal de la Población para:

  • descubrimiento,
  • Observador por País,
  • Equidad Lingüística,
  • desafío de replicación

Estas fuentes pueden ser más adecuadas para esos propósitos.

4.4. Panel Afiliado a Universidad o Institución

Participantes:

  • son seleccionados a través de universidades,
  • institución pública,
  • centros de investigación,
  • organizaciones profesionales

Ventajas:

  • acceso local,
  • competencia lingüística,
  • supervisión ética,
  • llegar a comunidades con pocos recursos

puede proporcionarse. Limitaciones:

  • intensidad estudiantil o profesional,
  • efecto institucional,
  • parcialidad por edad y nivel educativo,
  • presión de participación corporativa

pueden crear.

4.5. Lista de clientes o usuarios

Se seleccionan los clientes o usuarios reales de la institución auditada. Esta fuente:

  • experiencia del cliente,
  • adecuación para el servicio,
  • reconocimiento de marca

es valiosa para la medición. No es un panel de población general. Clientes:

  • puede conocer mejor la marca,
  • puede tener una experiencia más positiva o más negativa,

puede tener más probabilidades de hacer la consulta relevante. El panel de clientes debe definirse por separado.

4.6. Participantes sugeridos por la institución auditada

Empresa:

  • empleado,
  • cliente,
  • socio,
  • seguidor

puede sugerir. Estos usuarios no pueden ser incluidos en el Panel de Población independiente principal sin explicación. Por separado:

PANEL NOMINADO POR LA ENTIDAD

debe ser etiquetado. Si la institución selecciona participantes, el resultado no es una medición de población independiente.

4.7. Panel híbrido de múltiples fuentes

Es la combinación de múltiples fuentes. Ejemplo:

  • panel nacional basado en probabilidad,
  • panel profesional en línea,
  • pequeño socio local en un país,
  • Comunidad de equidad lingüística

puede ser utilizada conjuntamente. Un panel híbrido puede aumentar la cobertura. Sin embargo, entre los recursos:

  • repetir individuos,
  • probabilidades de selección,
  • incentivos,
  • experiencia en tareas,
  • perfil del usuario

también deben ser modelados.

5. ESTADOS DE INTEGRIDAD EN LA SELECCIÓN DE PARTICIPANTES

La calidad de la selección de participantes de un panel puede clasificarse con los siguientes estados.

PSI-0— SELECCIÓN DESCONOCIDA

No se conoce suficientemente dónde y cómo fueron seleccionados los participantes. No se puede hacer una generalización poblacional.

PSI-1— CONVENIENCIA O INSCRIPCIÓN ABIERTA

Es una muestra por conveniencia o voluntaria abierta. Puede ser utilizada para exploración y detección de eventos.

PSI-2— CONTROL DE CUOTAS POR ADHESIÓN

Existen cuotas por país, idioma o demografía. La probabilidad de ingreso a la población es desconocida.

PSI-3— PANEL MULTIFUENTE CALIBRADO

Existen múltiples fuentes, cuotas predefinidas y calibración de la población. Puede persistir un sesgo de selección no medido.

PSI-4— DISEÑO PROBABILÍSTICO O HÍBRIDO FUERTE

Existe una probabilidad conocida de selección o un diseño híbrido fuerte de probabilidad–no probabilidad.

PSI-5— SELECCIÓN REPLICADA Y AUDITADA EXTERNAMENTE

Diseño de selección:

  • con diferentes proveedores,
  • en diferentes oleadas,
  • bajo auditoría independiente

Se ha examinado el comportamiento repetido y sesgado. Estos estados no garantizan la exactitud de la puntuación. Indica el nivel de confianza resultante de la selección de los participantes.

6. SELECCIÓN ALEATORIA DENTRO DEL PANEL Y SELECCIÓN ALEATORIA DE LA POBLACIÓN

Puede haber 100,000 usuarios registrados en un panel de voluntarios. De este panel, se pueden seleccionar aleatoriamente 1,000 personas. Selección:

es aleatoria dentro del panel.

Sin embargo, el panel en sí no se forma de manera aleatoria a partir de la población mundial. Por lo tanto, no se puede decir: “1,000 personas al azar de la población mundial.” La expresión correcta es:

1,000 participantes seleccionados aleatoriamente dentro de un panel de voluntarios pre-registrados y calibrados a la población objetivo.”

La aleatoriedad debe limitarse a la etapa en la que se aplica.

7. REGISTRO DE ELEGIBILIDAD DE PARTICIPANTES

Cada participante debe cumplir con las siguientes condiciones en la medida en que sean relevantes antes de ser incluido en el panel principal:

  • Elegibilidad por edad
  • Consentimiento voluntario
  • Idoneidad del país y la localidad
  • Competencia lingüística
  • Acceso al producto de IA
  • Plan correcto o interfaz de usuario
  • Dispositivo necesario y acceso técnico
  • Estado humano único
  • Independencia de la tarea
  • Declaración de intereses o relaciones
  • Seguridad de la investigación
  • Aprobación para la recopilación de datos y pruebas

La decisión de conformidad no puede cambiarse retroactivamente después de que se genere la respuesta de IA.

8. VERIFICACIÓN DEL PAÍS

La pregunta “¿A qué país pertenece el participante?” no tiene una única respuesta. Los siguientes campos deben separarse:

  • País de residencia habitual
  • País físico en el momento de la medición
  • País o región de mercado de la cuenta de IA
  • País de pago o plan
  • Ciudadanía
  • País objetivo del prompt
  • Localización

La ciudadanía puede no ser la variable principal para la mayoría de las mediciones GEO. Lo que es importante la mayoría de las veces:

Es la condición geográfica y del producto real en la que el usuario experimenta el producto.

8.1. Usuario viajero

El participante puede estar en un país distinto de su país de residencia habitual. Esta persona:

  • población residente,
  • ubicación de la medición,
  • usuario viajero

debería tener un estatus separado como.

8.2. VPN o cambiador de ubicación

Uso de VPN:

  • privacidad
  • red de instituciones,
  • hábitos normales de usuario

puede ser la razón. No debe considerarse fraude automático. Sin embargo, dificulta la verificación de la capa del país. Puede haber una regla en el panel principal del país controlado para desactivar o registrar el uso de VPN. Los cambios de ubicación usados para eludir restricciones no son adecuados para el panel principal Alcance natural.

8.3. Niveles de Verificación de País

GV-0— No verificado

Solo está disponible la autodeclaración.

GV-1— Verificado por el panel

El proveedor del panel tiene un registro de país existente.

GV-2— Consistente con la sesión

Declaración, configuración regional y señales de sesión son consistentes.

GV-3— Verificado con múltiples señales

Compatible con múltiples señales que protegen la privacidad.

GV-4— Auditado de manera independiente

El método de verificación del país ha pasado el control de calidad externo. No se requiere por defecto recopilar una dirección exacta o coordenadas sensibles. La verificación del país debe realizarse con minimización de datos.

9. DOMINIO DEL IDIOMA Y USO NATURAL

El conocimiento de un participante del idioma puede basarse únicamente en la declaración: "Sí, lo sé." Esto puede ser un registro inicial de bajo riesgo. En un panel de idioma de alta seguridad, además:

  • declaración de uso natural,
  • breve verificación de comprensión,
  • historial del panel,
  • evaluación de un adjudicador local,
  • prueba neutral antes de la tarea

pueden ser utilizados. La prueba de idioma no debe convertirse en un examen académico pesado que seleccione solo a personas con alta educación. El objetivo:

Que el participante entienda la prompt y la respuesta como un usuario real.

10. VERIFICACIÓN DEL ACCESO AL PRODUCTO DE IA

Participante:

  • debería poder acceder al producto de IA correcto,
  • el interfaz de usuario correcto,
  • la condición de plan o cuenta correcta

debe poder acceder. Las siguientes situaciones deben registrarse por separado:

  • Plan gratuito
  • Plan individual de pago
  • Plan empresarial
  • Plan de formación
  • Web
  • Móvil
  • Escritorio
  • Producto integrado
  • Modelo visible
  • Función web/de recuperación

Un participante no puede usar la cuenta de otra persona. No se puede solicitar compartir la contraseña. Se debe verificar la prueba de acceso al producto sin divulgar públicamente la identidad de la cuenta.

11. RELACIÓN ENTRE EL PARTICIPANTE Y LA ENTIDAD AUDITADA

La relación del participante con la organización monitoreada puede afectar el comportamiento de captura de respuestas o la familiaridad con la marca. Estados de relación:

PÚBLICO_GENERAL

CLIENTE_ACTUAL

EX_CLIENTE

POTENCIAL

EMPLEADO

EX_EMPLEADO

CONTRATISTA

SOCIO

INVERSOR

AFILIADO_COMPETIDOR

AFILIADO_PROVEEDOR_AI

INVESTIGADOR

DESCONOCIDO

Relaciones directas de empleados y tomadores de decisiones en el panel principal de población general:

  • pueden ser excluidas,
  • pueden colocarse en una capa separada,

puede protegerse con un peso real de población bajo. Excluir automáticamente a todos los individuos relacionados también puede estar mal. Si forman parte de la población real de clientes o empleados, pueden medirse por separado y explícitamente.

12. FAMILIARIDAD CON LA MARCA

Entidad participante auditada:

  • nunca ha oído hablar de ella,
  • conoce el nombre,
  • conoce el producto,
  • es cliente,
  • puede tener una opinión positiva o negativa fuerte.

Esta información:

  • puede afectar el comportamiento del participante,
  • Panel de usuarios en condiciones reales,
  • respuesta inmediata

deseada. Si la familiaridad se mide antes del estímulo, puede preparar al usuario para la marca. Por lo tanto, el orden de preferencia:

  • Información de panel previamente existente
  • Pregunta separada después de la tarea
  • Si es necesario, una premedición neutral que no guíe la marca

se puede llevar a cabo. La familiaridad debería ser visible en la muestra principal; no debería seleccionarse como una variable de ponderación después de ver los resultados.

13. CONOCIMIENTO SOBRE EL USO DE IA

Participantes:

  • usuario por primera vez,
  • usuario poco frecuente,
  • usuario regular,
  • usuario intenso o profesional

los individuos pueden ser. Frecuencia de uso de la IA:

  • acceso al producto,
  • tipo de plan,
  • conocimiento de la interfaz,
  • personalización,
  • probabilidad de completar la tarea correctamente

puede verse afectado. Sin embargo, seleccionar solo usuarios de IA con experiencia puede reducir los errores del protocolo. Pero puede distorsionar la estimación de la población natural. La solución correcta:

  • medir el nivel de uso,
  • compárelo con la población objetivo,
  • estratificar o ponderar si es necesario,

y preservar la experiencia real válida del usuario inexperto.

14. REGLA HUMANA ÚNICA

La unidad poblacional de GEO-1000 es un humano. La misma persona:

  • en múltiples paneles,
  • con múltiples cuentas de correo electrónico,
  • con múltiples cuentas de IA,
  • de diferentes dispositivos

puede participar. Deben realizarse verificaciones de unicidad de manera que se preserve la privacidad. Señales que se pueden usar:

  • Identidad del participante anónimo
  • Reverificación basada en criptografía o hash
  • Cumplimiento del dispositivo y la sesión
  • Registro de pago o incentivo
  • Patrón de tiempo y tarea
  • Misma captura de pantalla o archivo de respuesta
  • Reverificación segura a través de múltiples proveedores de panel

Ninguna señal individual necesita ser suficiente para la exclusión automática. En particular:

  • Familias que comparten un dispositivo común,
  • red de instituciones,
  • Herramientas de accesibilidad,
  • Usuarios de dispositivos compartidos de bajos ingresos

pueden ser considerados erróneamente como falsos. Los registros sospechosos deben someterse a revisión humana y a un proceso de apelación.

15. RECOMPENSA DEL PARTICIPANTE

El pago o la recompensa otorgada al participante puede influir en su comportamiento de datos.

15.1. Pago Independiente del Resultado

Método preferido:

Un pago fijo y previamente divulgado por completar la tarea de acuerdo con el protocolo.

Pago:

  • no puede depender de que la respuesta sea positiva,
  • puede ser forzada a las categorías de verdadero,
  • largo,
  • favorable a la marca,
  • o acompañado de citas.

La selección debe permanecer independiente de todos esos resultados.

15.2. Bono de Calidad

Si se va a utilizar un bono de calidad, solo:

  • evidencia completa,
  • solicitud correcta,
  • producto correcto,
  • entrega oportuna,
  • limpieza de datos personales

puede estar vinculado a las condiciones del protocolo. No puede estar vinculado al contenido de la respuesta de la IA.

15.3. Incentivo de Velocidad

Bono únicamente por velocidad:

  • prisa,
  • captura incompleta,
  • producto equivocado,
  • recorte de la respuesta

puede aumentar el riesgo. Se debe permitir un tiempo razonable dentro de la ventana de campo.

15.4. Pago por País

El pago puede variar según las tarifas locales y las condiciones de vida. Esta situación:

  • puede afectar la probabilidad de participación,
  • la composición del panel

y debe registrarse junto con el enfoque de pago y las diferencias entre países.

15.5. Coerción e Incentivo Excesivo

La recompensa no debe crear presión que la persona no pueda rechazar razonablemente. En particular:

  • personas de bajos ingresos,
  • estudiante,
  • empleados dependientes,
  • grupos vulnerables

deben tener protegida su voluntariedad.

16. TEXTO DE INVITACIÓN Y PRE-ORIENTACIÓN

Al invitar a un participante, el propósito de la investigación puede prepararlo para un resultado específico. Una invitación incorrecta: “Estamos probando cómo los sistemas de IA interpretan incorrectamente Apple.” Esta declaración puede llevar al participante a buscar errores. Otra invitación incorrecta: “Ayúdanos a demostrar el éxito de nuestra marca en la IA.” Esta declaración crea una expectativa de un resultado positivo. Invitación neutral preferida: “Estudio de la experiencia del usuario estandarizada y observación de la representación en productos de IA específicos.” La entidad auditada puede volverse visible más adelante debido a la naturaleza de la tarea. Sin embargo, no debe divulgarse el resultado deseado.

17. ASIGNACIÓN DE TAREA

Participantes:

  • Producto de IA,
  • prompts,
  • idioma,
  • onda,
  • condición de la sesión,
  • orden de la tarea

debe asignarse con antelación utilizando un método predefinido. El participante:

  • producto de IA favorito,
  • el plan que conoce mejor,
  • el idioma con alta probabilidad de recibir una respuesta positiva

si se les permite elegir por sí mismos, puede ocurrir un sesgo de asignación.

17.1. Asignación Aleatoria Dentro de la Capa

Después de verificar el acceso por país, idioma y producto, las tareas pueden asignarse aleatoriamente dentro de la capa.

17.2. Asignación por Bloque

Se pueden usar bloques para equilibrar planes gratuitos/pagados, móvil/web, o frecuencia de uso de IA.

17.3. Orden de Productos

Si una persona está probando más de un producto, el orden debe ser aleatorizado. La respuesta del primer producto puede afectar la evaluación de la siguiente respuesta o el comportamiento de la tarea.

17.4. Orden de prompts

Si un participante recibe más de una prompt:

  • aprendiendo,
  • adquiriendo nueva información sobre la marca,
  • llevando la respuesta anterior a la siguiente pregunta

surge el riesgo. El orden de los estímulos debe registrarse y equilibrarse si es necesario.

18. CONDICIONAMIENTO DEL PANEL

Los usuarios que participan frecuentemente en paneles de investigación pueden aprender las expectativas de la tarea. Una persona que participa repetidamente en la misma prueba:

  • puede recordar la respuesta correcta,
  • puede elegir la captura de pantalla con más cuidado,
  • puede revisar el sitio de la entidad auditada con antelación,

se pueden aprender los errores que se buscan. Esta situación se llama:

Condicionamiento del panel

El condicionamiento del panel puede cambiar la verdadera experiencia natural del usuario.

18.1. Fuentes de Condicionamiento

Olas GEO anteriores Re-medición de la misma entidad Banco de estímulos previo Capacitación en revisión por pares Compartición de tareas en comunidades de participantes Pagos anteriores y retroalimentación de calidad

18.2. Controles del Condicionamiento

Estado de participante nuevo y repetido Fecha de primera participación Exposición previa a la misma entidad Exposición previa a la misma familia de prompts Panel rotativo Aleatoriedad en el orden de las tareas Período de descanso especificado Submuestra de nuevos usuarios Comparación de resultados de usuarios condicionados y nuevos kullanıcı No está prohibido reutilizar al mismo participante. Es valioso para la medición longitudinal. No puede presentarse como un panel transversal natural.

19. CONTAMINACIÓN DE TAREAS Y COMUNICACIÓN ENTRE PARTICIPANTES

Participantes:

  • prompts,
  • respuestas,
  • capturas de pantalla,
  • resultados esperados

pueden ser compartidos entre sí. Esta situación puede interrumpir las observaciones independientes. Controles:

  • Limitar la duración de la oleada
  • Aleatorizar tareas
  • Obligación de no compartir resultados con los participantes
  • Buscar respuestas y elementos visuales repetidos
  • Examinar similitudes inusuales en texto y tiempo
  • Monitoreo de advertencias de proveedores de panel o comunidad

La comunicación del participante no es automáticamente fraude. Se debe examinar su efecto material.

20. TIPOS DE NO RESPUESTA

La no respuesta no es un evento único.

20.1. No responder a las invitaciones

El participante no responde en absoluto a la invitación de investigación.

20.2. Rechazo a participar

La persona ve la invitación y decide no participar.

20.3. No comenzar la tarea después de la calificación

Se encuentra que la persona es apta pero no inicia la tarea.

20.4. Interrupción de la tarea

El participante abandona la tarea a mitad de camino.

20.5. No subir evidencia

Se puede haber obtenido una respuesta de IA, pero no se sube el registro requerido.

20.6. Finalización inválida

La tarea está completada, pero:

  • prompt incorrecto,
  • producto equivocado,
  • respuesta seleccionada,
  • captura de pantalla faltante

son razones de invalidez. Las proporciones de estas etapas deben reportarse por separado.

21. EMBUDO DE RESPUESTAS

Para la capa h:

  • nhsel: persona seleccionada
  • nhinv: persona invitada
  • nhcon: persona que aceptó participar
  • nhsta: persona que comenzó la tarea
  • nhcom: persona que completó
  • nhval: observación válida

Seamos. Tasas básicas:

RR_h^invite= n_h^con/n_h^inv; RR_h^complete= n_h^com/n_h^sta; RR_h^valid= n_h^val/n_h^com

Se puede mostrar como. Cada una de estas tasas indica un problema diferente. Dar solo el conteo válido final oculta el sesgo del campo.

22. SESGO POR NO RESPUESTA

Las personas que no responden pueden ser diferentes de las que sí lo hacen. Ejemplo: Un usuario con internet lenta no puede completar una tarea. Un usuario con plan gratuito no puede acceder al producto. Un usuario inexperto encuentra difíciles las instrucciones. Un usuario intensivo de IA completa más rápido. En ciertos países, el pago sigue siendo bajo. Un usuario con una experiencia negativa con la marca puede estar más dispuesto a participar. Incluso si la tasa de no respuesta es alta, el sesgo puede ser bajo. Incluso si la tasa de no respuesta es baja, un pequeño grupo ausente puede ser financieramente significativo. Por lo tanto, no solo la tasa por sí sola:

Qué características difieren entre los que responden y los que no responden

debería ser examinado.

23. PESOS POR NO RESPUESTA

Si se va a utilizar una configuración de no respuesta, las clases deben determinarse antes de ver los resultados. Variables potenciales:

  • País
  • Idioma
  • Edad
  • Frecuencia de uso de IA
  • Plan
  • Interfaz
  • Fuente del panel
  • Accesibilidad
  • Familiaridad con la marca

Coeficiente de no respuesta:

a_r^{NR}= (Σ_{j∈S_r} d_j)/ (Σ_{i∈R_r} d_i)

puede calcularse como. Sin embargo, este ajuste solo se basa en la suposición dentro de la misma clase: que los encuestados representan suficientemente a los no encuestados. No resuelve las diferencias no medidas.

24. MECANISMOS DE DATOS FALTANTES

La ausencia de datos puede considerarse conceptualmente en tres clases.

24.1. Ausencia de datos aleatoria

La ausencia de datos no está materialmente relacionada con el resultado y las características del usuario. En realidad, puede ser rara.

24.2. Ausencia de datos explicada por características observadas

Deficiencia:

  • país,
  • no implica ninguna idoneidad en términos de edad,
  • plan,
  • idioma

está relacionada con áreas bien conocidas como. El ponderado puede ayudar parcialmente.

24.3. Deficiencia relacionada con características no observadas

Por ejemplo:

  • Desconfianza en el producto de IA,
  • Bajas habilidades digitales,
  • oposición de marca,
  • Preocupación por la privacidad

si no se mide, la ponderación no puede corregir completamente la deficiencia. En este caso, se necesita un análisis de sensibilidad.

25. PÉRDIDA DE PANEL Y SEPARACIÓN ENTRE ONDAS

En paneles longitudinales o giratorios donde se miden de nuevo los mismos usuarios, algunos individuos no participan en la siguiente ola. Esto es pérdida de panel. Los que quedan en el panel:

  • más disciplinado,
  • más motivado por la recompensa,
  • más experimentado,
  • más acostumbrado a la investigación

Puede ser. El cambio en la partitura con el tiempo puede deberse en parte a la composición de las viñetas.

25.1. Récord de rotación en los paneles

En cada oleada:

  • re-invitado,
  • participó,
  • se retiró,
  • recién agregado

deben mostrarse los números de usuarios.

25.2. Peso de la deserción del panel

Los participantes restantes pueden ser ponderados según la probabilidad de deserción. Este método no resuelve completamente el sesgo de la deserción no observada del panel.

25.3. Actualizar panel

Se pueden agregar nuevos usuarios para reemplazar a los usuarios perdidos. Los resultados para usuarios nuevos y que regresan deben reportarse por separado.

26. FRAUDE DE PARTICIPANTES Y AUTOMATIZACIÓN

Existe un riesgo de fraude cuando GEO-1000 es un panel incentivado y global. Comportamientos posibles:

  • Una persona participando con múltiples cuentas
  • Uso de bots automáticos
  • Subir capturas de pantalla de otra persona
  • Editar imágenes
  • Subir la misma respuesta en nombre de diferentes usuarios
  • Declarar un país o idioma incorrecto
  • Compartir una cuenta
  • Hacer que otra persona complete la tarea
  • Reingresar entre proveedores de panel
  • Crear granjas de tareas en masa

Este riesgo no permite que todos los participantes de bajos ingresos o rápidos sean considerados sospechosos. Detección de fraude:

  • debates,
  • múltiples señales,
  • revisión humana proporcional

debería basarse en.

27. ESTADOS DE FRAUDE E INTEGRIDAD

FI-0— NO EVALUADO

El registro no ha sido evaluado en términos de integridad.

FI-1— SIN ANOMALÍA MATERIAL

No se han encontrado signos claros de fraude. Esto no es una garantía absoluta de precisión.

FI-2— REVISIÓN REQUERIDA

Hay una o más señales sospechosas.

FI-3— SOSPECHA DE DUPLICADO O COLUSIÓN

Hay sospecha de repetición de persona, visual, respuesta o coordinación.

FI-4— MANIPULACIÓN DEL PROTOCOLO CONFIRMADA

El participante ha alterado deliberadamente el protocolo.

FI-5— OBSERVACIÓN FABRICADA CONFIRMADA

La observación no es una experiencia genuina de usuario de IA. FI-2 no es exclusión automática. Se requiere revisión.

28. SEÑALES DE FRAUDE

Mismo hash de captura de pantalla Misma huella de archivo raro Tiempo de finalización imposible Repeticiones de identidad múltiple desde el mismo dispositivo o sesión Conflicto material en país, zona y acceso a productos Incompatibilidad entre el texto de respuesta y la imagen Rastro de edición de imagen Misma persona en la lista principal y de respaldo Misma persona anónima a través de múltiples proveedores de panel Finalización serial y mecánica de tareas Mismo patrón de error inusual Una sola señal puede no ser prueba concluyente de fraude.

29. EQUIDAD EN LA DETECCIÓN DE FRAUDE

Los siguientes usuarios pueden ser marcados erróneamente como fraudulentos:

  • Familias que comparten un dispositivo común
  • Empleados que usan una red institucional
  • Participantes de laboratorio universitario
  • Individuos preocupados por la privacidad que usan VPN
  • Usuarios con discapacidad que usan lectores de pantalla o asistentes de automatización
  • Aquellos que suben imágenes comprimidas similares debido a ancho de banda bajo

Por lo tanto:

  • etiquetado automático,
  • revisión humana,
  • descripción del participante si es necesario,
  • apelación

deben trabajar juntos.

30. LA VALIDEZ DEL PARTICIPANTE DEBERÍA ESTAR SEPARADA DE LA PRECISIÓN DE LA RESPUESTA DE LA IA

El registro de un participante puede cumplir con el protocolo. La respuesta de la IA puede ser incorrecta. Esta es una observación válida. La respuesta de IA de otro participante puede ser correcta. Sin embargo, el usuario:

  • ha actualizado la respuesta tres veces,
  • solo subió la mejor respuesta,
  • puede haber cambiado el prompt

Esta es una observación no válida. Por lo tanto:

La respuesta correcta de la IA no significa datos válidos. / Una respuesta incorrecta de la IA no significa datos no válidos.

La evaluación de la validez debe hacerse antes de la puntuación sustantiva y de la manera más ciega posible.

31. CONFLICTO DE INTERESES Y FUENTE DEL PARTICIPANTE

Un participante o proveedor de panel puede beneficiarse de los siguientes resultados:

  • La empresa auditada recibiendo una puntuación alta
  • El producto de IA apareciendo como superior
  • Un competidor recibiendo una puntuación baja
  • Vender más auditorías
  • Premio o relación laboral

Por lo tanto:

  • relaciones con participantes,
  • acuerdo con el proveedor de panel,
  • salario independiente del resultado,
  • Intervención del cliente

debe ser explicado. Institución auditada:

  • qué usuarios invitar,
  • quién será considerado inválido,
  • Quién será reemplazado con un respaldo

no puede decidir.

32. EFECTO DEL PROVEEDOR DE PANEL

Los usuarios de dos proveedores de panel en el mismo país pueden ser diferentes. Un proveedor:

  • Entusiastas de la tecnología,
  • estudiantes,
  • participantes de investigación intensiva

tienen una tasa más alta en términos de cuidado. El proveedor de panel debe mantenerse como una variable de clúster o fuente en el análisis. Si es posible:

  • resultados basados en el proveedor,
  • efecto de la fuente,
  • comparación del proveedor dentro del mismo país

deben examinarse. Un panel global de un solo proveedor no puede presentarse como la población mundial en sí.

33. REPETIR INDIVIDUO EN PANEL MULTIFUENTE

El mismo individuo:

  • dos paneles profesionales,
  • en una convocatoria abierta,
  • en la lista de la universidad

se puede encontrar. Un panel de múltiples fuentes puede aumentar el número de registros sin aumentar la unicidad. Verificación de duplicación entre fuentes:

  • preservando la privacidad,
  • sin requerir la divulgación central de identidad,
  • permitiendo la objeción a las discrepancias

debería establecerse de manera.

34. MAPA DE SESGO DE MUESTRA

GEO-1000 debería supervisar por separado los siguientes tipos de sesgo.

SB-1— Sesgo de Cobertura

Algunos segmentos de la población objetivo no están en el marco de muestreo.

SB-2— Sesgo de Selección

La probabilidad de que los individuos en el marco sean seleccionados para el panel no se ajusta al diseño previsto.

SB-3— Sesgo de Auto-selección

Los voluntarios para el estudio son sistemáticamente diferentes de la población.

SB-4— Sesgo de Invitación y Orientación

El texto de invitación o la fuente atrae a personas con un punto de vista específico.

SB-5— Sesgo de No Respuesta

Las personas que no participan o no completan son diferentes en términos de resultados.

SB-6— Sesgo de Deserción del Panel

Los usuarios que permanecen entre oleadas son diferentes de los que abandonan.

SB-7— Sesgo de Incentivos

El pago o recompensa afecta la velocidad del participante, el comportamiento de selección o la respuesta.

SB-8— Condicionamiento del Panel

El participante aprende el comportamiento esperado de estudios previos.

SB-9— Sesgo de Asignación de Tareas

Los participantes eligen el producto, idioma o prompts por sí mismos o se asignan de manera desigual.

SB-10— Sesgo de Clasificación por País e Idioma

El participante es asignado al país o celda de idioma incorrecto.

SB-11— Sesgo de Producto, Plan e Interfaz

Solo ciertos usuarios de un plan o dispositivo determinan el panel.

SB-12— Sesgo de Familiaridad de Marca

Clientes, fanáticos, críticos o empleados están sobrerrepresentados.

SB-13— Sesgo de Fraude y Repetición

La misma persona o la participación automática obtiene demasiada influencia en el resultado.

SB-14— Sesgo de Exclusión de Validez

Las respuestas negativas de IA son consideradas inválidas con mayor frecuencia.

SB-15— Sesgo de Ponderación

Variables seleccionadas después del resultado o un cambio excesivo en la puntuación del modelo en la dirección deseada.

SB-16— Sesgo de Muestra Superviviente

Solo se presentan los usuarios que pueden completar exitosamente la tarea como la población real del producto.

35. PROPÓSITO DEL PONDERADO

El ponderado puede servir para los siguientes propósitos:

  • Corregir probabilidades de selección desiguales
  • Devolver el sobrerrepresentación a la proporción real de la población
  • Reducir las diferencias en las tasas de respuesta
  • Calibrar la muestra a totales objetivos conocidos
  • Combinar múltiples fuentes de panel

El ponderado no puede servir para los siguientes propósitos:

  • Crear una persona que no exista en el marco muestral
  • Corregir variables no medidas con precisión
  • Hacer real una observación falsa o errónea
  • Producir la puntuación deseada después del resultado
  • Convertir una sola celda pequeña en una puntuación confiable del país
  • Transformar automáticamente un panel no probabilístico en una muestra probabilística

36. ARQUITECTURA DE PESO PESADO

El peso final se puede mostrar de la siguiente manera:

w_i= d_i× a_i^{NR}× g_i^{CAL}× p_i^{SRC}

Aquí:

  • di: diseño básico o peso inicial
  • aiNR: configuración de respuesta
  • giCAL: calibración de la población
  • piSRC: fuente del panel o ajuste de muestra improbable

En el panel probabilístico:

d_i= 1/π_i

Es posible. El verdadero πi es desconocido en el panel no probabilístico. En este caso, el peso utilizado no es el peso de diseño, sino el peso basado en modelo o de calibración. Esta distinción debe conservarse en el informe.

37. LOS PESOS NO PUEDEN DEPENDER DEL RESULTADO

No se pueden usar las siguientes variables para crear pesos:

  • Si la respuesta de AI es correcta o no
  • Si se menciona la marca o no
  • Si hay una cita
  • Si se hace una recomendación
  • Ya ocurra un error crítico
  • Si a la organización auditada le gusta el resultado

Variables de ponderación:

  • Antes de ver el resultado,
  • Porque está relacionado con la población objetivo y el mecanismo de selección

Debe ser seleccionado. Si el resultado de la respuesta determina el peso, la puntuación se ajusta por sí misma.

38. VARIABLES DE CALIBRACIÓN

Áreas posibles de calibración:

  • País
  • Región
  • Idioma
  • Edad
  • Género, si es necesario y ético
  • Educación
  • Asentamiento urbano/rural
  • Tipo de acceso a internet
  • Dispositivo
  • Frecuencia de uso de IA
  • Plan gratuito/pago
  • Interfaz
  • Estado de accesibilidad

Es posible que no se disponga de totales fiables de la población objetivo para cada variable. Demasiadas variables de calibración:

  • pueden crear una variabilidad excesiva en los pesos,
  • tamaño efectivo de muestra bajo
  • sobreajuste del modelo

Debe congelarse antes de ver los resultados del conjunto de calibración.

39. EQUILIBRIO DE PONDERACIÓN

La muestra antes y después de la ponderación debe compararse con la población objetivo. Para cada campo:

  • participación objetivo
  • participación de la muestra sin ponderar
  • participación ponderada
  • diferencia restante

debe mostrarse. La ponderación se aplica solo al número de resultados y la tabla de equilibrio no se puede guardar.

40. DIAGNÓSTICOS DE PONDERACIÓN

El informe principal debe incluir los siguientes campos en la medida en que sean relevantes:

  • Peso mínimo
  • Peso máximo
  • Peso mediano
  • Coeficiente de variación del peso
  • Relación de pesos
  • Número de pesos recortados
  • Tamaño de muestra bruto
  • Tamaño de muestra efectivo
  • Efecto del diseño
  • Resultado sin ponderar
  • Resultado principal ponderado
  • Resultados alternativos con ponderación razonable

El número único ponderado no es un registro de control completo sin identificadores de ponderación.

41. VISUALIZACIÓN DE PONDERACIÓN SINTÉTICA

VISUALIZACIÓN DE METODOLOGÍA SINTÉTICA / Los participantes, tasas y puntuaciones a continuación son hipotéticos. Población objetivo y distribución del panel:

Frecuencia de uso de IAParticipación de la población objetivoParticipación bruta del panelObservación bruta
Uso bajo o poco frecuente50%10%100
Uso medio30%30%300
Uso intensivo20%60%600
Total100%100%1,000

Tasas de aprobación sintéticas:

Grupotasa de aprobaciónRespuesta anterior
Uso bajo o poco frecuente72%72
Uso medio84%252
Uso intensivo96%576
Total90%900

Resultado bruto:

900/1000=90%

41.1. Coeficientes de calibración

Bajo uso:

0.50/0.10=5

Uso medio:

0.30/0.30=1

Alto uso:

0.20/0.60 = 1/3

Respuesta ponderada:

72(5) + 252(1) + 576(1/3) = 804

Total ponderado:

100(5) + 300(1) + 600(1/3) = 1,000

Resultado ponderado:

804/1000=80.4%

41.2. Tamaño de muestra efectivo

n_eff= [100(5)+300(1)+600(1/3)]² / [100(5 ²)+300(1 ²)+600(1/3)²] ≈ 349

Tarjeta de resultados:

  • Observación válida en bruto: 1,000
  • Puntuación en bruto: 90 por ciento
  • Puntuación ponderada: 80.4 por ciento
  • Muestra efectiva: aproximadamente 349
  • Razón principal: sobrerepresentación de usuarios intensivos de IA

Interpretación correcta:

El panel contiene 1,000 observaciones válidas; sin embargo, como resultado de la calibración de la población objetivo, la estimación ha disminuido a 80.4%, y debido a la variabilidad de los pesos, el tamaño de muestra efectivo se ha convertido en aproximadamente 349.

Comentario incorrecto: “La precisión global ha sido demostrada como 90% con 1,000 personas.”

42. ¿QUÉ NO PUEDE CORREGIR EL PONDERADO?

Los siguientes grupos no deberían estar presentes en el panel sintético en absoluto:

  • Personas que usan lectores de pantalla
  • Usuarios rurales con baja conectividad
  • Personas que usan el producto de IA por primera vez
  • Pequeñas comunidades lingüísticas

El ponderado solo cambia el peso de los usuarios en el panel. El grupo no observado:

  • IA, tu respuesta,
  • revelar problemas de acceso,
  • distribución del error

no puede producir. Por lo tanto:

Cobertura cero significa información cero.

Resultado ponderado: puede ser una predicción más cercana a la población objetivo, no una observación completa de la población objetivo.

43. ANÁLISIS DE SENSIBILIDAD

Se debe examinar la dependencia del resultado ponderado en un solo modelo de ponderación. Resultados candidatos:

  • Resultado bruto no ponderado
  • Resultado enfocado en el diseño
  • Resultado calibrado demográficamente
  • Calibración con uso de IA añadido
  • Resultado con ponderación recortada
  • Resultado ajustado por el efecto del proveedor del panel

Si los resultados cambian de manera material:

Se debe dar la advertencia de sensibilidad de ponderación

No se puede presentar un solo resultado de "ponderación correcta" como una verdad absoluta.

44. AJUSTE DE PROPENSIÓN EN PANEL DE NO PROBABILIDAD

La tendencia de los miembros del panel de no probabilidad a entrar en el panel puede modelarse según la población objetivo. La probabilidad de que una persona esté en el panel:

p̂_i= Pr(i ∈ panel | X_i)

puede ser estimado. El peso de propensión inversa candidato:

w_i^P= 1/p̂_i

puede ser usado. Este método:

  • usa solo las variables Xi medidas,
  • es afectado por un modelo mal especificado,
  • la selección no observada no se resuelve,

requiere datos de referencia de objetivo fuertes. Por lo tanto, el resultado:

debería ser etiquetado como:

Estimación de panel no probabilístico calibrada por modelo

45. ESTIMACIONES DE ÁREA PEQUEÑA Y BASADAS EN MODELOS

El muestreo directo puede ser insuficiente en algunas celdas de país o idioma. Los métodos basados en modelos pueden tomar información de grupos vecinos o similares. Esto significa que el resultado:

  • puntuación del país observada directamente,
  • tasa bruta de usuario

no lo es. El estado correcto:

ESTIMACIÓN ASISTIDA POR MODELO

ESTIMACIÓN DE ÁREAS PEQUEÑAS

NO OBSERVADO DIRECTAMENTE

debe. La predicción basada en modelos no convierte un país sin observación del Observador por País en un país observado.

46. PRIVACIDAD Y VERIFICABILIDAD DEL PARTICIPANTE

GEO-1000 requiere prueba para cada observación. Esto no significa que la identidad del participante se divulgará públicamente. Una captura de pantalla puede incluir la siguiente información:

  • Nombre
  • Correo electrónico
  • Foto de perfil
  • Chat anterior
  • Plan de cuenta
  • Nombre de la institución
  • Información personal sensible

NOMOS Captura o sistema equivalente:

  • debe no capturar campos personales innecesarios,
  • debe realizar redacción automática o controlada,
  • debe conservar la evidencia en bruto en un repositorio seguro.

solo se deben presentar al público registros anónimos y verificables.

46.1. Manifiesto de Evidencia Pública

Registro público:

  • ID del observador,
  • celda país/idioma,
  • Producto de IA,
  • tiempo,
  • hash de la evidencia,
  • estado de verificación

puede ser llevado. Captura de pantalla completa:

  • editado,
  • acceso restringido,
  • abierto a auditor independiente

puede ser. La existencia de mil pruebas no requiere la divulgación pública de la identidad de mil personas.

46.2. Riesgo de País Pequeño Sensible

Si solo hay un participante en el país pequeño:

  • dispositivo,
  • tiempo,
  • idioma,
  • plan

Cuando se reúna, puede volverse más fácil volver a identificar a la persona. El nivel de detalle en los informes públicos debe reducirse. La integridad de la evidencia puede mantenerse en un sistema con acceso controlado.

47. CONSENTIMIENTO DEL PARTICIPANTE

El participante debe al menos conocer lo siguiente:

  • Qué tarea realizará
  • Qué datos y capturas de pantalla se recopilarán
  • Qué información personal no se recopilará
  • Cuánto tiempo se almacenarán los datos
  • Quién tendrá acceso
  • Cómo se publicará el resultado
  • Cómo se dará la recompensa
  • Que la participación es voluntaria
  • Derecho a retirarse u oponerse
  • No se solicitará la contraseña de la cuenta
  • No se espera violar los términos de los productos de IA

El consentimiento no debe estar oculto en un texto largo e incomprensible. [K06; K22]

48. SEGURIDAD DEL PARTICIPANTE

Por parte del participante:

  • proporcionar información personal de salud, legal o financiera a la IA,
  • usar datos reales de clientes,
  • compartir información confidencial del empleador,
  • debilitar la seguridad de la cuenta,
  • exceder los límites de uso,
  • violar la ley o los términos del producto

no puede ser solicitado. Las solicitudes de prueba deben tener, en la medida de lo posible, un contexto público y no personal.

49. EL PARTICIPANTE LLEVA DIVERSIDAD HUMANA, NO CALIDAD

Usuario inexperto:

  • puede completar la tarea más lentamente,
  • más difícil,
  • con más apoyo

Esta persona no es automáticamente un participante de baja calidad. Son una parte real de la población objetivo. Si el diseño de la investigación es tan complejo que solo las personas con altas habilidades digitales pueden completarlo: el problema puede no estar en el participante, sino en la herramienta de medición. El protocolo:

  • debería ser comprensible,
  • accesible,
  • lingüísticamente natural,
  • carga técnica limitada

debe ser.

50. TARJETA DE RESULTADOS PÚBLICOS DE LA SELECCIÓN DE PARTICIPANTES

El informe público del candidato debería incluir las siguientes áreas:

Recursos del Panel

Participación del panel de probabilidad Participación del panel de voluntarios profesionales Participación de llamada abierta Participación de universidades/instituciones Participación de clientes o paneles afiliados

Embudo de Participación

Persona en marco Seleccionado Invitado Aceptado Empezado Completado Produciendo observación válida

Elegibilidad e Integridad

Niveles de verificación de país Niveles de verificación de idioma Tasa de repetición de persona Tasa de registro sospechoso Tasa de fraude verificado Tasa de observación inválida

Composición del panel

Frecuencia de uso de IA Plan e interfaz Familiaridad con la marca Relación cliente/empleado Usuarios del panel nuevos y recurrentes Cobertura de accesibilidad

Peso Diagnósticos

Lo siguiente puede publicarse sin revelar la identidad de los participantes: puntuaciones sin procesar y ponderadas; pesos mínimos y máximos; el coeficiente de variación de los pesos; tamaño de muestra efectivo; sensibilidad a la ponderación; y advertencias sobre cobertura.

51. DISPOSICIONES NORMATIVAS OBLIGATORIAS

CH08-N01

Cada observación válida GEO-1000 debe tener una cadena de selección de participantes rastreable desde la población objetivo hasta el registro analítico.

CH08-N02

La selección aleatoria dentro del panel no puede presentarse como selección aleatoria de la población mundial objetivo.

CH08-N03

La fuente de los participantes, el método de selección y el estado del panel deben explicarse en el registro público del método.

CH08-N04

No se puede definir como una muestra probabilística improbable o voluntaria de la población.

CH08-N05

Los participantes propuestos por la institución auditada no pueden incluirse en el panel principal independiente de la población sin explicación.

CH08-N06

Las relaciones con clientes, empleados, socios, competidores y proveedores de IA deben registrarse por separado.

CH08-N07

Se debe verificar los criterios de elegibilidad de los participantes antes de que se vea la respuesta de la IA.

CH08-N08

La elegibilidad por país, idioma, producto, plan e interfaz debe determinarse antes de la asignación de la tarea relacionada.

CH08-N09

No se puede duplicar a la misma persona como unidad de población debido a múltiples cuentas, dispositivos, idiomas, paneles o productos de IA.

CH08-N10

Se debe realizar una verificación de persona única de acuerdo con los principios de minimización de datos y privacidad.

CH08-N11

Una sola señal técnica por sí sola no puede considerarse suficiente para una decisión automática y definitiva de que un participante es falso.

CH08-N12

La recompensa de un participante no puede estar vinculada a que la respuesta de la IA sea positiva, correcta, larga, contenga referencias o sea beneficiosa para la marca.

CH08-N13

El bono de calidad solo puede vincularse a la integridad del protocolo preespecificada.

CH08-N14

El texto de invitación e información no puede dirigir al participante a buscar un resultado positivo o negativo.

CH08-N15

El producto de IA debe asignarse o aleatorizarse antes de ver el resultado de la secuencia de prompts y tareas.

CH08-N16

La selección de producto e prompt basada en la preferencia del participante no puede usarse sin explicación en el panel principal de la población.

CH08-N17

Se debe registrar la condicionamiento del panel, la exposición previa a pruebas y la participación repetida.

CH08-N18

Los resultados de los participantes nuevos y condicionados deben analizarse por separado cuando sea necesario.

CH08-N19

La inclusión de un participante en el panel, su retención, exclusión o reemplazo con un respaldo no puede basarse en el contenido de la respuesta de la IA.

CH08-N20

Las salidas de IA incorrectas, negativas, de rechazo o críticas deben conservarse bajo un protocolo válido.

CH08-N21

La validez del participante debe evaluarse de forma ciega en la mayor medida posible y antes de evaluar la exactitud sustantiva de la respuesta.

CH08-N22

Las tasas de invitación, aceptación, inicio, finalización y observación válida deben informarse por separado.

CH08-N23

El entorno de la respuesta solo debe basarse en variables predefinidas y relevantes.

CH08-N24

El ponderado no puede hacer que los usuarios que no están presentes en el marco de muestreo estén representados.

CH08-N25

Las variables de ponderación no pueden depender del resultado de la respuesta de la IA, de la puntuación o del interés comercial de la institución regulada.

CH08-N26

Los pesos de panel de no probabilidad no pueden presentarse como pesos de diseño.

CH08-N27

Las variables de calibración y los totales objetivo deben ser liberados antes de que se vean los resultados.

CH08-N28

Los resultados sin ponderar y los resultados principales ponderados deben almacenarse juntos.

CH08-N29

Los diagnósticos de ponderación y el tamaño efectivo de la muestra deben ser visibles en el informe principal.

CH08-N30

Si se utiliza el recorte de pesos, deben conservarse el resultado sin recortar y el análisis de sensibilidad.

CH08-N31

Los efectos del proveedor del panel y de la fuente de los participantes deben mantenerse como variables separadas.

CH08-N32

En un panel de múltiples fuentes, se deben realizar verificaciones repetidas de personas entre fuentes.

CH08-N33

La detección de fraude debe incluir múltiples señales, revisión humana proporcional y un proceso de apelación.

CH08-N34

El uso de VPN, dispositivo compartido, red institucional o tecnología asistida no debe considerarse automáticamente fraude.

CH08-N35

La estimación de pequeñas áreas basada en modelos no puede presentarse directamente como una puntuación observada por país o idioma.

CH08-N36

Las capturas de pantalla de los participantes y las pruebas deben incluir minimización de datos personales, redacción y control de acceso.

CH08-N37

No se pueden solicitar contraseñas de cuentas, historial de chat privado o información sensible innecesaria a los participantes.

CH08-N38

No se puede pedir a los participantes que eludan restricciones de producto, edad, identidad, país o cuenta.

CH08-N39

No se pueden inscribir en el panel a niños o a usuarios que requieran protección especial sin protocolos éticos y de seguridad separados.

CH08-N40

Los registros de selección y ponderación de participantes deben tener un responsable humano o institucional.

52. FORMAS DE FALLA

CH08-F01— CONTAR ALEATORIOS DENTRO DEL PANEL COMO ALEATORIOS DEL MUNDO

La selección aleatoria dentro del panel voluntario se presenta como si fuera selección aleatoria de la población mundial.

CH08-F02— CONTAR EL CUMPLIMIENTO DE CUOTAS COMO REPRESENTATIVO

Se afirma que todos los sesgos conductuales y tecnológicos se resuelven porque se cumplen las cuotas de edad y país.

CH08-F03— CONTAR CLIENTES COMO POBLACIÓN GENERAL

La lista de usuarios de la institución monitoreada se utiliza como si fuera un panel de usuarios mundial.

CH08-F04— OCULTANDO EMPLEADOS Y SOCIOS

Los usuarios asociados con la institución se muestran como participantes generales independientes.

CH08-F05— CONTANDO UN SOLO PROVEEDOR DE PANEL COMO GLOBAL

No se examinan el efecto del proveedor ni el comportamiento del panel registrado.

CH08-F06— CONTANDO UNA CONVOCATORIA ABIERTA COMO MUESTRA PROBABLE

Se conserva la autoselección.

CH08-F07— DETERMINANDO EL PAÍS SÓLO POR IP

Se ignoran los viajes, VPN, la red institucional y las diferencias de región de la cuenta.

CH08-F08— CONTANDO LA CIUDADANÍA COMO EL PAÍS DE USO

La condición geográfica real de la experiencia del producto se clasifica incorrectamente.

CH08-F09— CONTANDO LA DECLARACIÓN DE IDIOMA COMO DEFINITIVA SIN REALIZAR PRUEBAS

El participante se mantiene en la celda de idioma aunque no entienda la instrucción ni la respuesta.

CH08-F10— CONVERTIR LA PRUEBA DE IDIOMA EN SELECCIÓN DE ÉLITE

Solo las personas altamente educadas permanecen en el panel.

CH08-F11— CONTANDO EL NÚMERO DE CUENTAS COMO PERSONAS

Una persona aumenta el peso poblacional con múltiples cuentas.

CH08-F12— CONTANDO UNA CUENTA COMPARTIDA COMO UNA SOLA PERSONA

Una cuenta utilizada por varias personas se interpreta como un solo usuario.

CH08-F13— PAGO DEPENDIENDO DEL RESULTADO

Se otorga un bono por una respuesta positiva, correcta o referenciada.

CH08-F14— ROMPIENDO EL PROTOCOLO CON BONO POR VELOCIDAD

El participante toma una captura de pantalla o se apresura a completar la tarea antes de finalizar la respuesta.

CH08-F15— EXPLICANDO EL RESULTADO EN LA INVITACIÓN

Se pide al participante que encuentre un error o éxito.

CH08-F16— PERMITIENDO QUE EL PARTICIPANTE ELIJA EL PRODUCTO

Los usuarios que seleccionan solo el producto de IA al que pueden acceder o que les gusta determinan el panel.

CH08-F17— OCULTANDO EL EFECTO DEL ORDEN DE LOS INPUTS

Las respuestas previas afectan las tareas posteriores.

CH08-F18— CONSIDERANDO EL CONDICIONAMIENTO DEL PANEL COMO USO NATURAL

A un usuario que ve la misma prueba múltiples veces se le presenta como un nuevo usuario.

CH08-F19— IGNORANDO LA COMPARTICIÓN DE RESULTADOS

Los participantes transfirieron tareas y respuestas entre sí.

CH08-F20— CONTANDO LAS NO RESPUESTAS COMO DATOS FALTANTES

No se examina la diferencia sistemática de los no participantes.

CH08-F21— CONTANDO LA PÉRDIDA DE PANEL COMO MEJORA EN LOS RESULTADOS

Los puntuaciones aumentan porque los usuarios débiles o inexpertos se retiran en olas posteriores.

CH08-F22— INVALIDANDO RESPUESTAS NEGATIVAS

El participante es reemplazado porque la IA proporcionó una respuesta incorrecta.

CH08-F23— VALIDANDO LA RESPUESTA CORRECTA

Incluso si el participante actualizó la respuesta, el registro se mantiene porque el resultado es correcto.

CH08-F24— PASANDO POR ALTO A BOTS Y PARTICIPACIONES REPETIDAS

La misma persona o automatización produce un gran número de observaciones.

CH08-F25— EXCLUSIÓN MASIVA CON UNA SOLA SEÑAL

VPN, dispositivo o velocidad hacen que los usuarios reales sean considerados falsos.

CH08-F26— REALIZANDO REVISIÓN DE FRAUDE BASADA EN LOS RESULTADOS

Los registros con puntuaciones bajos se examinan con mayor frecuencia.

CH08-F27— CREANDO UN GRUPO MUY INÉDITO

Se afirma que los usuarios no presentes en la muestra están representados.

CH08-F28— SELECCIONANDO CALIBRACIÓN POST-RESULTADO

Se seleccionan posteriormente las variables de peso que producen la puntuación más adecuada.

CH08-F29— CONTANDO LA PARTICIPACIÓN BRUTA DEL PANEL COMO PARTICIPACIÓN DE LA POBLACIÓN

Los usuarios intensivos de IA determinan el resultado global con números brutos.

CH08-F30— CONTANDO EL PESO INUSUAL COMO PESO DE DISEÑO

Se hace una inferencia exacta de la población aunque se desconozca la probabilidad real de selección.

CH08-F31— OCULTANDO EL RESULTADO SIN PESO

El efecto del modelo de pesos no es visible.

CH08-F32— OCULTANDO LA MUESTRA EFECTIVA

Aunque los registros brutos 1,000 contienen unidades de información 300–400, se afirma tener precisión completa.

CH08-F33— ELIMINACIÓN DE GRUPOS DÉBILES MEDIANTE RECORTE POR PESO

Se recortan los grupos pequeños con peso alto porque reducen el resultado.

CH08-F34— CONTANDO PUNTUACIONES ESTIMADAS BASADAS EN MODELO

A un país sin ejemplo se le asigna una puntuación definida.

CH08-F35— REVELANDO LA IDENTIDAD PARA EVIDENCIA

Las capturas de pantalla se publican públicamente con información personal.

CH08-F36— HACIENDO REIDENTIFICABLE A UN PARTICIPANTE DE UN PAÍS PEQUEÑO

La información del país, la hora, el dispositivo y el plan revelan a una sola persona.

CH08-F37— PIDIENDO AL PARTICIPANTE CONTRASEÑA O CHAT PRIVADO

Recopilar evidencia viola la seguridad de la cuenta.

CH08-F38— CONSIDERANDO BAJA COMPETENCIA DIGITAL COMO INAPROPIADO

Los usuarios objetivo reales son eliminados del panel.

CH08-F39— PERTURBANDO LA VOLUNTARIEDAD CON RECOMPENSA

El participante está bajo una presión que razonablemente no puede rechazar.

CH08-F40— DEJAR LA ELECCIÓN DEL PARTICIPANTE AL CLIENTE

La entidad auditada selecciona a las personas que pueden determinar el resultado del panel.

53. PROCEDIMIENTO DE AUDITORÍA

Paso 1— Mapear Fuentes de Participantes

Cada panel se registra por separado para socio, convocatoria abierta y fuente del cliente.

Paso 2— Asignar Estado de Selección

Se determina un estado apropiado entre PSI-0 y PSI-5 para cada fuente.

Paso 3— Comparar Cobertura con la Población Objetivo

Determinar qué usuarios objetivo no están presentes en el panel.

Paso 4— Guardar Probabilidad o Modelo de Selección del Participante

Se explica la selección conocida por probabilidad, cuota o voluntaria.

Paso 5— Reglas de Conformidad para Congelar

Edad, país, idioma, plan de producto, interfaz, unicidad, las condiciones de la relación de extracción están versionadas.

Paso 6— Revisa el texto de la invitación

Se evalúa si existe una guía positiva o negativa.

Paso 7— Examina la estructura de la recompensa

Se confirma que la recompensa es completamente independiente del resultado.

Paso 8— Verificar el país, idioma y acceso al producto participante

Se asignan niveles de verificación que protegen la privacidad.

Paso 9— Realizar una prueba humana única

Se examinan las repeticiones intra-fuente e inter-fuente.

Paso 10— Registrar las áreas de relaciones y familiaridad

Se determina la familiaridad del cliente, empleado, competidor, proveedor de IA y marca.

Paso 11— Distribuir tareas según el plan de asignación

Se verifican las asignaciones de producto, prompt, cola y ola.

Paso 12— Registrar la acondicionamiento del panel

Los usuarios nuevos, repetidos y que participaron previamente en la misma prueba se separan.

Paso 13— Configurar el embudo de participación

Se calculan los números de invitación, aceptación, inicio, finalización y validez.

Paso 14— Cegar la revisión de validez

Se determina la validez del protocolo sin que se vea tanto como sea posible la puntuación de la respuesta de la IA.

Paso 15— Examinar señales de fraude

Se utilizan múltiples señales y evaluación humana.

Paso 16— Analizar mi no respuesta y pérdida del panel

Se comparan las características conocidas de quienes participan y quienes no participan.

Paso 17— Generar Pesos de Diseño y Calibración

Las fuentes probabilísticas y no probabilísticas se manejan con métodos separados.

Paso 18— Calcular los Diagnósticos de Pesos

Se calcula la distribución de pesos, efecto de diseño, muestra efectiva y efecto de recorte.

Paso 19— Realizar Análisis de Sensibilidad

Se comparan los resultados crudos, principales, fuertemente aplicados y alternativos razonables.

Paso 20— Crear el Manifiesto de Privacidad y Evidencia

La prueba completa se encuentra en un repositorio seguro; las identidades de prueba anónimas se mantienen en un registro público.

Paso 21— Publicar la Tarjeta Electoral Pública

Se hacen visibles las fuentes del panel, el embudo de participación, los sesgos y el efecto de ponderación.

54. EVIDENCIA REQUERIDA

Registro de la población objetivo; marco de muestreo; proveedores de panel; fuentes de participantes; estado de selección; clase de panel de probabilidad o no probabilidad; método de registro en el panel; texto de invitación; reglas de admisión de participantes; verificación del país del participante; registro de competencia lingüística; registro de acceso al producto de IA; plan y interfaz de usuario; verificación de persona única; comprobaciones de duplicación entre fuentes; familiaridad con la marca; frecuencia de uso de IA; relación con la entidad auditada; relación con el proveedor de IA; compensación del participante; condiciones de bonificación; método de asignación de tareas; registro de aleatorización y bloqueo; orden de producto y solicitud; condicionamiento del panel; participación en piloto previo; número invitado; número que da su consentimiento; número de participantes que comienzan la tarea; número de participantes que la completan; número de observaciones válidas; razones de no respuesta; abandono del panel; razones de invalidez; e indicadores de fraude.

Registros de revisión y objeción Pesos de diseño Configuración de no respuesta Variables de calibración Modelo de propensión, si lo hay Registro de recorte de pesos Tamaño efectivo de la muestra Resultados de sensibilidad Efecto del proveedor del panel Puntuaciones sin ponderar y ponderadas Registro de consentimiento Política de almacenamiento y acceso a datos Reglas de redacción Manifiesto de evidencia pública Persona o institución responsable

55. LISTA DE VERIFICACIÓN DE AUDITORÍA

¿De qué fuentes provienen los participantes? ¿Cada fuente era probabilística, voluntaria o de convocatoria abierta? ¿Se presentó la aleatoriedad dentro del panel como la aleatoriedad de la población mundial? ¿Intervino la institución supervisora en la selección de participantes? ¿Son los participantes clientes y empleados separados? ¿Se documentaron las relaciones con proveedores de IA o competidores? ¿Cómo se verificó la elegibilidad del país? ¿Está el dominio del idioma al nivel del uso real? ¿Se utilizó el producto de IA, plan e interfaz correctos? ¿En cuántas cuentas o paneles participó la misma persona? ¿Se realizó la verificación cruzada entre fuentes? ¿El texto de la invitación guió el resultado? ¿La recompensa depende del contenido de la respuesta de la IA? ¿Redujeron los incentivos de velocidad la calidad del protocolo? ¿La asignación de tareas fue aleatoria o basada en reglas predefinidas? ¿El participante eligió el producto o se generó el mensaje por sí mismo?

¿Se equilibró el orden de los productos y los mensajes? ¿Se registró el condicionamiento del panel? ¿Compartieron los participantes los resultados de las tareas? ¿Es visible el embudo de invitación–aceptación–inicio–finalización–validez? ¿Los no respondedores difieren en características conocidas? ¿Afecta la deserción del panel a la tendencia temporal? ¿Se tomó la decisión de validez antes de calificar la respuesta de la IA? ¿Se consideraron más frecuentemente inválidas las respuestas negativas o críticas? ¿La detección de fraude contiene múltiples señales? ¿Causaron la VPN o dispositivos compartidos la exclusión automática? ¿Se le dio al participante un camino de apelación? ¿Se definieron las variables de peso antes del resultado? ¿Se etiquetaron correctamente los pesos de panel improbables? ¿Son fiables los totales objetivo? ¿Se presentan juntos los resultados sin ponderar y ponderados? ¿Está claro el tamaño de muestra efectivo? ¿Se mostró el impacto de la poda de pesos?

¿Se ha mostrado que los grupos que nunca se observan están ampliamente representados? ¿Se presentaron las predicciones basadas en modelos como si fueran observaciones directas? ¿Hay detalles personales en las capturas de pantalla de los participantes? ¿Pueden ser reidentificados los usuarios de países pequeños? ¿Se solicitaron contraseñas de cuentas o chats privados? ¿Es claro y comprensible el consentimiento de los participantes? ¿Hay un propietario claramente responsable de la elección de los participantes y de los registros de ponderación?

56. OBJECIONES Y RESPUESTAS

Objeción 1— "Si usamos un panel de investigación profesional, ¿por qué seguimos hablando de sesgo?"

Un panel profesional puede fortalecer la calidad de los datos y la gestión de campo. Los miembros del panel también son:

  • voluntario
  • acostumbrado a la investigación,
  • diferente en el uso de la tecnología

Es posible. El profesionalismo no elimina el sesgo. Hace que medir y gestionar sea más fácil.

Objeción 2— “Si se cumplen las cuotas de edad y país, ¿por qué no debería considerarse que el panel es representativo?”

Participantes:

  • Frecuencia de uso de la IA,
  • dispositivo,
  • plan,
  • conciencia de marca,
  • destreza digital

Puede diferir en términos de mantenimiento. Las cuotas solo equilibran las áreas que cubren.

Objeción 3— “¿No puede el ponderamiento corregir estas diferencias?”

Puede corregir parcialmente las diferencias para las cuales existen totales objetivos medidos y fiables. No puede corregir definitivamente las diferencias que nunca se observan o se miden.

Objeción 4— “Los clientes de la institución son usuarios reales; ¿por qué no deberían incluirse en el panel principal?”

Pueden ser tomados. Sin embargo, deben tomarse con la proporción y el estado de relación real que tienen en la población general. La lista completa de clientes no es un panel de población general.

Objeción 5— "¿Por qué sería un problema si el participante conoce la marca?"

No tiene que ser un problema. Son parte de la población de usuarios natural. Si la familiaridad no está equilibrada, el resultado puede variar. Por lo tanto, se registra y se analiza si es necesario.

Objeción 6— "Los usuarios intensivos de IA realizan la tarea con mayor precisión; ¿no sería mejor seleccionarlos?"

Puede ser más fácil para la prueba de protocolos. Sin embargo, si queremos medir la experiencia real de la población, los usuarios sin experiencia también son importantes. Si la tarea es demasiado compleja, la herramienta de medición debe corregirse. La población no debe simplificarse.

Objeción 7— 'Si el participante malinterpretó la respuesta, ¿por qué deberíamos mantener la observación?'

La tarea del participante no es evaluar la respuesta, sino capturarla correctamente. Si se aplica correctamente el protocolo de captura, la respuesta de la IA se conserva. La evaluación del material es responsabilidad de los jueces.

Objeción 8— “¿No se debería utilizar un filtro automático estricto para prevenir la participación falsa?”

El filtrado automático es útil. Si se convierte en la única decisión final, puede excluir injustamente a usuarios reales. Se necesitan múltiples señales y una revisión humana proporcional.

Objeción 9— 'Si no hacemos públicas mil capturas de pantalla, ¿se puede considerar que el método está probado?'

Imágenes de pantalla completa:

  • información personal,
  • seguridad de la cuenta,
  • redefinición

puede conllevar un riesgo. Para el público:

  • ejemplos editados,
  • manifiesto de observación,
  • hashes de integridad,
  • acceso a auditorías independientes

puede ser proporcionado. La demostrabilidad no es la divulgación de identidad.

Objeción 10— 'Si la puntuación ponderada es muy diferente de la puntuación en bruto, ¿cuál es correcta?'

Dos resultados responden a preguntas diferentes. La puntuación bruta es el resultado de las personas en el panel. La puntuación ponderada es la estimación de la población objetivo. Una gran diferencia indica que la composición del panel es importante. Ambos deben ser publicados.

Objeción 11— "Si la muestra efectiva cayó a 349, ¿fue un desperdicio recolectar 1,000 observaciones?"

Los grupos sobremuestreados pueden haber fortalecido el análisis de subgrupos. Sin embargo, la sensibilidad del pronóstico global puede ser menor que el número bruto de 1,000. Este hecho no debe ocultarse.

Objeción 12— "¿No se puede usar en absoluto el panel de no probabilidad?"

Se puede usar. Específicamente:

  • piloto,
  • idioma de bajos recursos,
  • país pequeño,
  • Descubrimiento rápido

Es valioso para. Debe ser publicado con el estatus y las restricciones correctas.

Objeción 13— "¿No es más confiable escoger a todos los participantes entre personas nuevas?"

Puede ser fuerte para la estimación poblacional transversal. Los usuarios recurrentes son valiosos para medir el cambio longitudinal. Los roles de panel nuevos y recurrentes deben mantenerse separados.

Objeción 14— "¿No aumenta el riesgo de privacidad recopilar datos de tantos participantes?"

Puede. Por lo tanto:

  • minimización de datos
  • identidad anónima,
  • redacción,
  • control de acceso
  • duración de almacenamiento

son partes obligatorias del protocolo. No se debe recopilar información innecesaria.

DISPOSICIÓN COMÚN DE LA SECCIÓN 59

El número más fácil en un estudio GEO:

1,000

Es posible. La pregunta más difícil es esta:

¿Cuál 1,000?

Dos paneles con el mismo país y cuotas de edad pueden producir resultados completamente diferentes. En uno:

  • usuarios intensivos de IA,
  • suscriptores de planes pagos,
  • trabajadores de tecnología

n son la mayoría. En el otro:

  • usuarios poco frecuentes,
  • usuarios móviles,
  • personas con bajas habilidades digitales

Es más visible. Ambos son personas 1,000. No es la misma población. Si ocultas de dónde provienen los participantes y solo publicas el resultado ponderado, conviertes la ponderación en un velo de confianza en lugar de un método de control. No puedes ponderar a una persona que no está presente en una muestra. No puedes cambiar la respuesta de un usuario porque sea incorrecta. Una respuesta incorrecta no es un fracaso de la investigación. Es el evento que la investigación está intentando medir. Si un participante ha seguido el protocolo incorrectamente a pesar de dar la respuesta correcta, no puedes preservar el registro. Una respuesta correcta no hace que una observación falsa sea real. Puedes pagarle más a una persona. Pero no para producir la respuesta que quieres. Puede pagar según las condiciones de vida de un país. Pero no puede comprar la voluntad del participante. Mil capturas de pantalla pueden servir como evidencia. No está obligado a revelar la identidad de mil personas al público.

La integridad de la evidencia y la privacidad humana pueden protegerse juntos. Por lo tanto, la octava ley de medición de NOMOS es la siguiente:

La potencia de la muestra no depende solo de cuántas personas la integran, sino también de los motivos y del modo en que fueron seleccionadas.

La novena ley es la siguiente:

El ponderado reequilibra la población observada; no crea al ser humano no observado.

La décima ley es:

Una respuesta incorrecta de IA puede ser un dato válido; una respuesta correcta de IA puede ser un dato inválido.

La undécima ley es la siguiente:

La recompensa del participante debe darse no por encontrar el resultado deseado, sino por probar el resultado observado sin modificarlo.

La duodécima ley es la siguiente:

La demostrabilidad no requiere que el participante renuncie a su privacidad.

Capítulo 8 Mandamiento de NOMOS

No me traigas mil personas por sí solas. / Muéstrame de qué mundo provienen estas mil personas.

No trates a un panel de voluntarios como una muestra poblacional aleatoria, una lista de clientes como el público general o un empleado como un usuario independiente.

No pienses que todas las diferencias que no mediste han mejorado solo porque se cumplieron las cuotas de país y edad.

No multipliques a una persona por el número de sus cuentas, dispositivos, idiomas o membresías en paneles.

No pongas a quienes aman la marca, a quienes odian la marca y a quienes no conocen la marca en absoluto en la misma caja invisible.

Pague al participante no por encontrar la respuesta correcta, sino por guardar la primera respuesta adecuada que vean sin cambiarla.

No cambie al usuario cuando la IA dé una respuesta incorrecta. / No verifique si la respuesta es correcta cuando el usuario rompa el protocolo.

No hagas que una persona que no está en el panel parezca ponderada como si existiera.

No ocultes el resultado en bruto. / No declares solo el resultado ponderado como la verdad. / Muestra la muestra efectiva. / Muestra su sensibilidad.

No declares a alguien que usa una VPN como falso, a alguien que usa un dispositivo compartido como un bot, o a alguien que usa tecnología asistida como automatización.

Investiga el fraude. / Pero no conviertas la investigación en sí misma en un nuevo sesgo de exclusión.

Guarda una captura de pantalla. / Protege el nombre, la cuenta y la vida privada de la persona.

Primero, define la población. / Luego muestra el marco. / Luego explica a quién elegiste, quién no vino, quién no pudo completarlo y por qué excluiste a alguien. / Y solo después de eso, decide cuánto puede tu puntuación representar a la humanidad.

La oración de cierre del capítulo

En GEO-1000, un participante es más que una persona que proporciona una respuesta. Un participante es una unidad de muestreo humano cuya capacidad para representar a otros en la población objetivo debe justificarse a través del camino de selección, el peso, la independencia y las salvaguardas de privacidad.

Core normativo

Cada observación GEO-1000 DEBE conservar un camino auditable de selección de participantes desde la población objetivo y el marco de muestreo hasta la selección, invitación, consentimiento, asignación, finalización, validación del protocolo, exclusión y ponderación final. La selección aleatoria dentro del panel NO DEBE ser representada como selección aleatoria de la población objetivo global a menos que el mecanismo de inclusión de toda la población respalde esa afirmación. La contratación de participantes, asignación, compensación, validación, reemplazo, exclusión y ponderación DEBE mantenerse independiente de si la respuesta de la IA es positiva, negativa, correcta, incorrecta, rechazada, crítica o comercialmente favorable. Las personas, cuentas, dispositivos, sesiones, idiomas, membresías de panel y observaciones de productos de IA DEBEN permanecer como unidades distintas. Las fuentes de participantes por probabilidad, opción, convocatoria abierta, suministradas por el cliente, institucionales e híbridas DEBEN identificarse por separado. El ponderado PUEDE reducir el desequilibrio observado, pero NO DEBE representarse como la creación de observaciones para poblaciones ausentes del marco muestral o como la corrección con certeza de selecciones no medidas. Los resultados no ponderados, resultados ponderados, diagnósticos de peso, brechas de cobertura, no respuesta, tamaño efectivo de muestra y análisis de sensibilidad DEBEN permanecer visibles. Las decisiones sobre fraude y duplicación DEBEN utilizar una revisión proporcional con múltiples señales y NO DEBEN tratar automáticamente el uso de VPN, dispositivos compartidos, redes institucionales o herramientas de accesibilidad como falsificación. La evidencia del participante DEBE seguir siendo verificable sin divulgar innecesariamente la identidad, credenciales de la cuenta, conversaciones privadas o ubicación precisa. Cada decisión de selección y ponderación de participantes DEBE estar versionada y ser atribuible a un humano u organización responsable.

Cita sugerida

Muraz, Kaan. Protocolo de Auditoría GEO de NOMOS: Un protocolo para medir la representación de entidades en sistemas generativos en la población mundial. Texto final candidato, edición editorial en español. NobleJackal, 2026. https://doi.org/10.5281/zenodo.22041222. https://noblejackal.com/es/nomos-geo-audit-protocol/
© 2026 Kaan MURAZ. Publicado bajo licencia CC BY 4.0; se requiere atribución.