GEO Framework / Edición en español

Primera parte — Ver la representación

Capítulo III — Medición

La medición no crea la realidad: delimita la parte que podemos ver. Ver un número no equivale a conocer una situación. Un gráfico puede mostrar un cambio, no su causa. Pueden contarse las menciones, seguirse las citas, calcularse tasas de recomendación y compararse tráfico, consultas y ventas. Todo ello es mensurable. Nada de ello constituye por sí solo éxito.

VERSIÓN
1.0.0
EXTENSIÓN
2306 palabras
ESTADO
Edición española fijada para publicación

Capítulo III — Medición texto íntegro

La disciplina de la observación

La medición no crea la realidad: delimita la parte que podemos ver. Ver un número no equivale a conocer una situación. Un gráfico puede mostrar un cambio, no su causa. Pueden contarse las menciones, seguirse las citas, calcularse tasas de recomendación y compararse tráfico, consultas y ventas. Todo ello es mensurable. Nada de ello constituye por sí solo éxito.

El informe GEO suele construirse al revés: primero se produce una cifra, después se le asigna un significado, el significado se convierte en éxito y el éxito se vincula con un resultado comercial. Cada transición añade una nueva afirmación, aunque la medición no cambie. La literatura sobre recuperación generativa de información también señala que la evaluación tradicional basada en clasificaciones no basta por sí sola para respuestas generadas.[5] El Framework rechaza esa cadena. Medir no es adornar una afirmación con una cifra, sino aplicar un protocolo que vuelve comparables las observaciones.

Lo que se mide establece el techo de lo que puede afirmarse.

1. El objeto de la medición

Todo sistema de medición debe responder cinco preguntas: ¿qué medimos?, ¿cuál es la unidad?, ¿bajo qué condiciones?, ¿frente a qué comparación?, ¿durante qué periodo? Sin esas respuestas, «nuestra visibilidad de marca es del 72 por ciento» carece de significado. ¿72 por ciento dentro de qué sistema, consultas, idioma y denominador? ¿Se midieron menciones, atributos correctos, respaldo de fuentes o recomendaciones? ¿Cómo se trataron los registros ausentes? Una cifra sin definición no es medición, sino decorado.

En GEO se miden cuatro campos distintos:

1.1. Representación de la entidad

¿Distingue el sistema a la persona, empresa, producto o institución correcta? ¿Colisionan nombres parecidos? ¿Son correctas la categoría, la geografía y la relación entre identidades antiguas y nuevas? ¿Conservan los distintos idiomas la misma entidad? Los registros pueden codificarse como correcto, parcial, colisionado, categoría equivocada, ambiguo o ausente. «La entidad no apareció» y «se reconoció a la entidad equivocada» no son lo mismo: lo primero es ausencia; lo segundo, distorsión.

1.2. Representación de atributos

Para cada atributo material se examinan exactitud, fundamento, alcance, vigencia, límites visibles y posibilidad de entrega. Los códigos pueden ser totalmente respaldado, parcialmente respaldado, sin respaldo, distorsionado u omitido. La palabra correcta no basta: también debe medirse el alcance. Haber trabajado con clientes internacionales no significa disponer de capacidad operativa global ilimitada.

1.3. Comportamiento de juicio

¿El sistema solo describe, compara, recomienda de forma condicional o absoluta, o excluye en el lugar correcto? Pueden utilizarse códigos como recomendación adecuada, recomendación condicional, recomendación inadecuada, fundamento sin respaldo, exclusión correcta, exclusión errónea y sin juicio. Contar recomendaciones no basta; el fundamento, la intención del usuario y los límites de la empresa se evalúan en el mismo registro. Una empresa recomendada ante todas las consultas quizá no tenga una representación fuerte, sino desbordada.

1.4. Rastro comercial

Se siguen por separado la declaración de influencia de IA, la referencia observable, el contacto, la consulta cualificada, la oferta, la venta, el beneficio bruto, la cancelación o devolución, la satisfacción y la recompra. Tráfico no es venta; venta no es beneficio; beneficio no es satisfacción; satisfacción no es continuidad. Las herramientas analíticas muestran partes de la cadena, no todo el recorrido. El rastro comercial puede mostrar relación entre representación y resultado; no establece por sí solo causalidad.

Los cuatro campos pueden relacionarse, pero no fundirse en una única cifra.

2. Unidad de medición y denominador

La unidad básica del Framework no es una puntuación, sino un registro de observación:

Una entidad + un sistema y forma de acceso + una consulta + un idioma + un momento + una condición de sesión + un resultado completo

Cuando cambia uno de esos elementos, nace un registro nuevo. Probar la misma consulta en otro sistema, idioma o fecha no continúa el registro anterior: constituye otra observación. El resultado puede parecerse; el registro es distinto.

Cada registro contiene, como mínimo, versión del protocolo, entidad, sistema e interfaz, momento, consulta completa, idioma, respuesta completa y fuentes, familia de consultas, resultado de codificación, evaluador, estado comparativo y límite probatorio. «Se examinaron diez respuestas» solo describe volumen. «En siete de diez respuestas, la entidad fue reconocida en la categoría correcta conforme al criterio previamente definido» puede ser una medición.

Toda tasa tiene numerador y denominador. «La marca fue recomendada diecisiete veces» es incompleto mientras no se declaren el total de consultas, los sistemas, las repeticiones, si el nombre aparecía en la consulta, los resultados fallidos y las pruebas de exclusión. «La marca fue recomendada en diecisiete de 240 resultados válidos producidos con cuarenta consultas, tres repeticiones y dos sistemas» muestra el campo del juicio.

Un registro ausente no es cero. Si el sistema no produjo respuesta, se registra «no se obtuvo resultado», no «la marca no apareció». Toda tasa declara registros totales, criterios de inclusión y exclusión, estructura de repeticiones, datos ausentes y método de codificación. Cuando se oculta el denominador, crece la cifra y disminuye la información.

3. Por qué se prohíbe una puntuación GEO única

El Framework no basa decisiones en una puntuación GEO compuesta. La representación no es unidimensional. Una marca puede ser coherente en identidad, estar distorsionada en atributos, ser recomendada con frecuencia y carecer de valor comercial. Una cifra única aplana esas tensiones. Lo aplanado se compara con facilidad, pero no se comprende.

Mención, cita, recomendación, lenguaje positivo, tráfico y conversión podrían ponderarse para producir un 78. Esos índices pueden servir como señales internas resumidas, pero no determinan por sí solos qué distorsión existe, qué derecho se afecta o si una afirmación pública puede autorizarse. El Framework utiliza un perfil de medición:

Tabla 3.1 — Perfil de medición GEO

CampoEstado observadoAlcanceLímite principal
Representación de entidadIdentidad principalmente correctaDos sistemas, dos idiomasNo se midieron otros sistemas
Representación de atributosParcial y contradictoriaCuatro atributos básicosPrecio y capacidad excluidos
Comportamiento de juicioRecomendación condicionalConsultas neutrales y comparativasSe desconoce la estabilidad a largo plazo
Rastro comercialRelación limitadaDoce declaraciones de clientesNo se estableció atribución completa

Las submediciones pueden incluir tasas o recuentos. No se prohíben los números, sino ocultar realidades distintas dentro de una puntuación única con facultad decisoria.

4. Punto, conjunto y dispersión

La medición tiene tres niveles de alcance. Una observación puntual corresponde a una consulta, un sistema y un momento; demuestra un hecho, no un patrón. Puede decirse: «El Sistema A recomendó la marca como segunda opción en esta consulta el 12 de agosto de 2026». No puede decirse: «La marca ocupa el segundo lugar en el Sistema A».

Una observación de conjunto reúne repeticiones controladas que prueban una misma intención con distintas formulaciones. Puede decirse: «En un conjunto de cuarenta consultas con intención de compra, la marca apareció en la categoría correcta en el 62 por ciento de los registros válidos». El resultado solo pertenece a ese conjunto; no se traslada a otros idiomas, sistemas o intenciones.

Una observación dispersa examina varios sistemas, idiomas, familias de consultas y ventanas temporales con reglas comunes de codificación. Amplía el alcance, pero no garantiza certeza. Cuanto mayor es la dispersión, más importante es no ocultar las diferencias ambientales. Un protocolo disperso produce más ruido con más datos.

El tiempo atraviesa los tres niveles. Una sola medición es instantánea. Para hablar de «estado» debe existir comportamiento repetido en intervalos definidos. Puede reportarse como singular, recurrente, estable, fluctuante, decreciente, desaparecido o aún no clasificable.

5. Bloqueo del protocolo

El protocolo se escribe antes de ver resultados. Se bloquean la entidad, los campos de medición, sistemas, idiomas, familias de consultas, repeticiones, ventana temporal, grupo comparativo, reglas de codificación y tratamiento de datos ausentes. Puede modificarse, pero el cambio no puede ocultarse.

Un sistema, idioma, conjunto de consultas o criterio nuevo crea otra versión del protocolo. Para comparar directamente resultados antiguos y nuevos, se muestra por separado el subconjunto común sin cambios. «Antes 42 por ciento, ahora 68» solo tiene sentido si ambos periodos miden lo mismo de la misma manera. Cuando cambia el protocolo, la serie se rompe; una serie rota no puede unirse mediante una historia de mejora.

Una prueba totalmente fija no detecta problemas nuevos; una prueba en cambio constante destruye la comparación. Por eso se mantienen dos conjuntos. El conjunto central permanece fijo para comparar en el tiempo. El conjunto exploratorio puede cambiar para buscar nuevas intenciones y errores. Sus resultados no se mezclan con la serie central: primero generan hipótesis y, con justificación, pueden incorporarse a una versión posterior.

6. Universo de consultas

Una prueba que solo usa consultas con el nombre de marca mide recuerdo dirigido, no descubrimiento. Un universo equilibrado contiene cinco familias:

  • Consultas de identidad: prueban nombre, categoría, directivos, productos y relaciones institucionales.
  • Consultas neutrales de descubrimiento: examinan necesidad, categoría, geografía y condiciones de uso sin nombrar la marca.
  • Consultas comparativas: comparan opciones bajo condiciones iguales y registran más el fundamento que la clasificación.
  • Consultas de contraste: buscan dónde se rompe la afirmación cuando puede ser más adecuado un competidor u otra categoría.
  • Consultas de exclusión: prueban el desbordamiento mediante preguntas en las que la marca no debe aparecer.

El universo debe probar el límite que puede sostener la entidad, no el resultado deseado. Se explica en qué medida las consultas representan intenciones reales. Las consultas controladas por investigadores y las formulaciones naturales de usuarios no se combinan sin distinción.

7. Juicio humano, codificación y desacuerdo

Un resultado generativo no puede verificarse a sí mismo. Preguntar al sistema «¿Es correcta esta respuesta?» no es auditoría independiente, sino otra salida del modelo. La medición exige definir códigos y ejemplos decisorios antes de ver resultados.

En afirmaciones de gran impacto, al menos dos evaluadores humanos codifican los mismos registros de forma independiente. Puede informarse primero el acuerdo bruto y después una medida como kappa de Cohen, que considera el acuerdo esperable por azar.[15] Un kappa alto no demuestra que los códigos sean verdaderos en el mundo; solo que los evaluadores aplican las definiciones de forma semejante. El desacuerdo bajo tampoco se oculta: indica insuficiencia de la definición, los ejemplos formativos o la base probatoria.

Las herramientas basadas en modelos que miden similitud textual o semántica pueden aportar señales útiles en grandes conjuntos.[19] Pero que dos respuestas se parezcan no significa que sean correctas. La similitud automática puede apoyar la clasificación; el juicio final sobre verdad, adecuación y ética permanece en manos humanas.

8. Comparabilidad, incertidumbre y datos ausentes

Dos cifras solo son comparables si miden lo mismo. Cuando cambian sistema o modelo, interfaz, idioma, conjunto, repeticiones, competidores, codificación, periodo o tratamiento de ausencias, los resultados no necesariamente son inválidos, pero quizá no pertenezcan a la misma serie. Comparar exige simetría. No toda cifra colocada junto a otra constituye comparación.

La medición no elimina la incertidumbre; la hace visible. Se distinguen tres estados:

  • No observado: no se realizó la prueba pertinente.
  • No encontrado: se realizó la prueba y el comportamiento no apareció.
  • No aplicable: el criterio no correspondía a ese registro.

Ninguno equivale automáticamente a cero. Si el sistema no muestra fuentes, se dice «no pudo observarse el respaldo», no «no hay respaldo»; si el cliente no menciona influencia de IA, «no declaró influencia», no «no hubo influencia»; si la marca no aparece, «la entidad no fue observada en esta consulta», no «el sistema no conoce la marca».

Todo informe mantiene visibles tres límites: alcance — qué se midió; vacío — qué no se midió; incertidumbre — qué otra cosa podría explicar el resultado. Escribir cero sobre lo desconocido no elimina la incertidumbre: la oculta.

9. Caso didáctico: Sable & Pine

Simulación didáctica — datos sintéticos. Este caso no representa una empresa ni periodos de medición reales.

Para Sable & Pine, firma ficticia de diseño de interiores corporativos, se presenta un informe de dos periodos: 42 por ciento en el primero y 68 en el segundo. A primera vista parece una mejora notable. Al abrir los protocolos se descubre que se midieron cosas distintas.

Tabla 3.2 — Comparación sintética de protocolos de Sable & Pine

ElementoPrimer periodoSegundo periodo
Número de sistemas13
IdiomaInglésInglés, alemán y turco
Número de consultas2060
Consultas con nombre de marca10 %55 %
Consultas de competidores y exclusiónPresentesAusentes
Criterio de codificaciónAtributo correctoMención
Repeticiones31

El 42 por ciento de atributos correctos y el 68 por ciento de menciones no son la misma variable. Además, en el segundo periodo se proporcionó el nombre con mayor frecuencia, se eliminó el campo de contraste y se redujeron las repeticiones. Al analizar por separado las doce consultas que siguieron el mismo protocolo en ambos periodos, el cambio es de 42 a 44 por ciento.

El Framework no desecha los datos del segundo periodo. Los conserva como inicio de otro protocolo, pero rechaza la «mejora» de 26 puntos. Un cambio de protocolo no es un cambio de rendimiento.

10. La decisión de la medición

El Registro de Medición del Anexo C muestra qué se observó. El Registro de Evidencia decide qué frase puede sostener esa observación. La medición crea el registro; la evidencia le permite hablar.

No se consideran medición: una puntuación GEO sin definición; cambiar las consultas después del resultado; conservar solo resultados positivos; presentar consultas de marca como descubrimiento neutral; mezclar sistemas e idiomas sin distinguirlos; describir un cambio de protocolo como mejora; tratar ausencias como cero; porcentajes sin denominador; usar tráfico, ventas y valor sostenible como equivalentes.

Estas prácticas pueden producir cifras. No producen medición.

La disposición del capítulo es:

La función de la medición no es mostrar lo buenos que somos, sino separar lo que sabemos, lo que solo hemos observado y lo que desconocemos.

Medir una distorsión no la corrige. Ver un cambio no explica su causa. Hacer visible un problema no obliga a intervenir. Por eso, antes de pasar de la medición a la acción, el siguiente capítulo preguntará: ¿Cuándo debemos tocar una representación y cuándo debemos limitarnos a observarla?

REGISTRO DE CITA

Gauss, Julian (Kaan Muraz). NobleJackal GEO Framework: Una propuesta de estándar para la representación, la evidencia y el valor sostenible. Versión 1.0.0. NobleJackal, 2026. https://doi.org/10.5281/zenodo.22011291. Edición web oficial: https://noblejackal.com/es/geo-framework/
© 2026 Kaan Muraz. Todos los derechos reservados.