Experimentos GEO: cómo medir impacto real (2026)
Actualizas una página, añades datos propios o consigues una mención en un medio. Dos semanas después, la tasa de aparición de tu marca sube. La tentación es presentar el cambio como resultado de la acción. El problema es que, durante esas dos semanas, el modelo pudo actualizarse, las fuentes recuperadas pudieron cambiar y tus respuestas pudieron fluctuar por puro muestreo.
Un gráfico antes y después no convierte una correlación en impacto. Para saber si una acción GEO probablemente movió la visibilidad necesitas definir el experimento antes de publicar: qué esperas que cambie, en qué preguntas, mediante qué mecanismo, frente a qué control y con qué umbral tomarás una decisión.
Este protocolo empieza donde terminan el banco de prompts para medir visibilidad de marca y el benchmark de variabilidad de respuestas de IA. El banco fija la muestra; el benchmark estima el ruido. El experimento utiliza ambos para comprobar una intervención concreta.
Los aprendizajes de cada experimento deben volver a la cola de trabajo: incorpóralos a tu backlog de acciones de visibilidad en IA para actualizar confianza y reordenar prioridades.
Qué puede demostrar realmente un experimento GEO
En la mayoría de casos no puedes repartir usuarios o modelos al azar entre una versión A y una versión B. Tampoco controlas el índice, la recuperación web ni las actualizaciones del proveedor. Por eso un experimento GEO suele ser un cuasi-experimento: compara una cohorte de prompts que debería reaccionar a la acción con otra que no debería hacerlo, antes y después de intervenir.
El resultado no es una prueba causal perfecta. Es una cadena de evidencia:
- La métrica elegida cambia en la cohorte tratada.
- El cambio supera la variabilidad observada en el baseline.
- Los prompts de control permanecen estables o cambian mucho menos.
- Aparece el mecanismo esperado, por ejemplo una nueva URL citada o un framing corregido.
- El efecto persiste en más de una ola de seguimiento.
Cuantas más piezas encajen, más defendible es atribuir el movimiento a la acción. Si solo mejora un porcentaje agregado durante una única medición, tienes una señal, no una conclusión.
Empieza por una hipótesis que pueda fallar
Una buena hipótesis obliga a declarar acción, audiencia, resultado, ventana y mecanismo. Usa esta estructura:
Si hacemos [acción concreta] en [activo o fuente], entonces [métrica primaria] cambiará en [cohorte de prompts y modelo] durante [ventana], porque [mecanismo esperado].
Ejemplo:
Si publicamos una comparativa verificable para agencias e incorporamos datos originales, entonces aumentará la tasa de citación de nuestra URL en prompts de evaluación de herramientas en Perplexity durante las cuatro semanas posteriores a la indexación, porque la página responderá directamente a esa intención con evidencia recuperable.
La hipótesis puede fallar. Esa es la característica que la hace útil. "Mejorar nuestra visibilidad en IA" no especifica qué resultado observar ni permite decidir cuándo detener una táctica.
Antes de ejecutar, escribe también una explicación rival. Por ejemplo: "la tasa puede subir por una actualización de Perplexity que favorezca a todas las marcas del sector". El grupo de control y las anotaciones del experimento existen para poner a prueba esa alternativa.
Define una métrica primaria y no la cambies después
Elige una sola métrica primaria alineada con la acción. Las métricas GEO de visibilidad en IA ofrecen el catálogo; aquí la decisión es cuál puede responder a la hipótesis.
| Acción | Métrica primaria adecuada | Evidencia secundaria |
|---|---|---|
| Mejorar una página para una intención | Tasa de citación de esa URL | Mención de marca y pasaje citado |
| Corregir un hecho de producto | Precision del framing | Fuente usada y persistencia del error |
| Conseguir cobertura en un medio | Tasa de cita del dominio o URL | Mención, posición y competidores |
| Crear una página comparativa | Share of Voice en prompts de comparación | Posición y argumentos de recomendación |
| Reforzar una entidad de marca | Tasa de respuestas con la entidad correcta | Variantes del nombre y atributos |
Puedes guardar métricas secundarias para diagnosticar, pero no elijas retrospectivamente la que más subió. Esa práctica, conocida como seleccionar el resultado después de observarlo, convierte el experimento en una búsqueda de coincidencias.
Define la unidad de análisis de forma explícita: por ejemplo, prompt_id + ejecución + modelo + modo + idioma + mercado. Si promedias modelos o mercados antes de analizar, puedes ocultar que el efecto solo existe en uno de ellos.
Construye una cohorte tratada y prompts de control
La cohorte tratada contiene las preguntas cuya respuesta debería verse afectada por la acción. Si actualizas una página sobre herramientas GEO para agencias, incluye prompts de comparación, evaluación y selección para ese público. No añadas preguntas generales sobre qué es GEO solo para aumentar la muestra.
Los prompts de control pertenecen al mismo mercado, idioma y modelo, pero cubren una intención que la acción no toca. En el ejemplo anterior podrían ser preguntas sobre medición para ecommerce o sobre definiciones básicas. Su función no es demostrar que nada cambia; es mostrar cuánto se mueve el entorno sin el tratamiento.
Un control útil cumple cuatro condiciones:
- Se ejecuta con el mismo protocolo y calendario.
- Tiene un nivel de variabilidad parecido en el baseline.
- No comparte el activo o mensaje que se va a modificar.
- Sigue siendo relevante para la misma marca y categoría.
No llames "grupo de control" a una lista histórica ejecutada con otro modelo, otro idioma o una frecuencia distinta. Esas diferencias impiden saber si el contraste procede de la acción o del diseño.
La ficha del experimento: decide antes de mirar
Crea una ficha única y congélala antes de intervenir.
| Campo | Ejemplo |
|---|---|
experiment_id |
EXP-2026-07-COMPARATIVA-01 |
| Problema | La marca no aparece en comparaciones para agencias |
| Hipótesis | Una comparativa con datos propios aumentará citas en Perplexity |
| Acción única | Publicar y enlazar una URL comparativa |
| Cohorte tratada | 14 prompts de selección para agencias |
| Cohorte de control | 14 prompts de otra intención con volatilidad similar |
| Entornos | Perplexity web, ES, España |
| Métrica primaria | Tasa de citación de la URL tratada |
| Baseline | Tres olas semanales con cinco repeticiones por prompt |
| Ventana de seguimiento | Semanas 2, 3 y 4 tras confirmar indexación |
| Criterio de éxito | Mejora neta sostenida y aparición de la URL esperada |
| Regla de decisión | Escalar, iterar o detener según resultado |
| Responsable | Nombre del owner y fecha de revision |
Los números del ejemplo son una heurística operativa, no una receta estadística universal. Una cohorte crítica o muy variable necesitará más repeticiones. Una prueba exploratoria puede empezar con menos, siempre que informe sus límites.
Protocolo paso a paso
1. Aisla una sola intervención
Decide qué cambia y qué permanece fijo. Una intervención puede ser actualizar una página, publicar un activo de datos, corregir schema, conseguir una inclusión editorial o resolver una incoherencia de entidad.
Evita publicar tres artículos, cambiar el mensaje de producto, lanzar una campaña de PR y reestructurar el enlazado interno el mismo día. Si el resultado cambia, no sabrás qué acción conservar. Cuando varias tareas son inseparables, trátalas como un paquete y deja claro que evalúas el paquete completo.
2. Mide el baseline con repeticiones
Ejecuta cohortes tratada y de control antes de intervenir. Conserva respuestas completas, fuentes, fecha, modelo, modo y cualquier identificador disponible. Repite cada prompt suficientes veces para estimar el rango habitual en lugar de depender de una respuesta afortunada.
El baseline debe cubrir más de un momento. Tres olas semanales suelen ser más informativas que quince ejecuciones en una tarde, porque incorporan variación temporal. Si el proveedor anuncia un cambio de modelo durante esta fase, anótalo o reinicia el baseline.
3. Publica y registra el momento de exposición
Guarda la URL o fuente intervenida, su versión, fecha de publicación y cambios exactos. Si puedes, conserva un hash o una captura del contenido. Verifica que la página responde, es indexable y no está bloqueada.
La fecha de publicación no siempre es la fecha de exposición. Un modelo conectado a la web no puede recuperar una página que aún no conoce o no puede rastrear. Inicia la ventana de seguimiento según el criterio predefinido, por ejemplo cuando la URL aparece indexada o cuando observas el primer rastreo relevante.
4. Congela el resto del entorno
Durante la ventana, no edites de nuevo el activo tratado salvo que exista un error crítico. Mantén la misma versión del banco, sesiones limpias, idioma, mercado, modo y calendario. Anota cualquier evento externo: actualización de modelo, noticia del sector, lanzamiento de un competidor o incidencia de acceso.
Congelar no significa ignorar el negocio. Significa documentar cambios inevitables para que la lectura final no finja un laboratorio que no existe.
5. Ejecuta las olas de seguimiento
Repite exactamente el protocolo del baseline. No descartes respuestas desfavorables ni sustituyas prompts que dejan de producir el resultado esperado. Si un prompt se vuelve inválido por un cambio real del mercado, márcalo y analiza el conjunto original antes de crear una nueva versión.
No detengas el experimento al primer pico positivo. Completa la ventana o aplica una regla de parada definida con anterioridad.
6. Calcula el cambio neto
Una lectura sencilla utiliza una diferencia de diferencias:
cambio neto = (tratada después - tratada antes) - (control después - control antes)
Supongamos este resultado ilustrativo:
| Cohorte | Baseline | Seguimiento | Cambio |
|---|---|---|---|
| Prompts tratados | 12% de citas | 28% de citas | +16 puntos |
| Prompts de control | 15% de citas | 19% de citas | +4 puntos |
| Cambio neto estimado | +12 puntos |
El ajuste no convierte el resultado en causalidad perfecta, pero evita atribuir a tu acción una subida general de cuatro puntos. Informa recuentos y denominadores junto a porcentajes; un salto de 0 a 50% con dos observaciones no equivale a un cambio estable.
7. Comprueba el mecanismo
Una mejora en la métrica es más creíble si ocurre por la vía prevista. Si la hipótesis esperaba que una nueva página fuera citada, busca esa URL en las respuestas. Si pretendía corregir un hecho, revisa el pasaje y la fuente que sostienen el nuevo framing.
Cuando la marca mejora pero el activo tratado nunca aparece y los controles también suben, el resultado puede ser real, pero el mecanismo propuesto no está demostrado. Separa "hubo mejora" de "esta acción causó la mejora".
Cómo interpretar los resultados sin forzar una victoria
Tratada mejora, control estable y mecanismo visible
Es el resultado más compatible con la hipótesis. Confirma que supera el rango del baseline y que persiste. Puedes escalar la táctica a otra intención mediante un experimento nuevo, no asumir que funcionará en todo el sitio.
Tratada y control mejoran a la vez
Probablemente existe un factor común: cambio de modelo, estacionalidad, crecimiento general de la marca o variación del índice. Calcula el cambio neto y evita adjudicar toda la mejora a la intervención.
La métrica no cambia, pero aparece el mecanismo
La IA empieza a citar la URL tratada, pero la marca no gana menciones o posición. La acción influyó en la evidencia, aunque todavía no en el resultado de negocio. Decide si necesita más tiempo, una propuesta más clara o apoyo externo.
Hay un pico y después vuelve al baseline
Trátalo como volatilidad hasta que se repita. Una ola positiva aislada no justifica escalar presupuesto.
No cambia nada
Un resultado nulo es útil si el experimento estaba bien diseñado. Puede indicar que la acción no era recuperable, que el mecanismo era débil, que la ventana fue demasiado corta o que la métrica no respondía al cambio. Documenta la lección y modifica una sola variable en la siguiente prueba.
Registro mínimo para que el resultado sea auditable
Conserva, como mínimo:
- ID y versión del experimento.
- Hipótesis y explicación rival.
- URL, fuente o activo intervenido.
- Descripción exacta del cambio y responsable.
- IDs de prompts tratados y de control.
- Modelo, modo, idioma, mercado y contexto de sesion.
- Respuesta completa, menciones, posición, framing y citas por ejecución.
- Fechas de baseline, exposición y seguimiento.
- Métrica primaria, denominador y regla de éxito.
- Incidencias, actualizaciones externas y desviaciones del protocolo.
- Decisión final: escalar, iterar, detener o repetir.
Este registro evita que un resultado prometedor se convierta en una anécdota imposible de reproducir cuando cambia el equipo.
Siete errores que invalidan el aprendizaje
- Cambiar demasiadas cosas a la vez. Obtienes movimiento, pero no sabes qué palanca funcionó.
- Elegir los prompts después de intervenir. La muestra se adapta al resultado que quieres demostrar.
- Usar una sola ejecución por prompt. Confundes una respuesta posible con el comportamiento habitual.
- No incluir controles. Cualquier cambio del entorno parece mérito de la acción.
- Mezclar modelos, modos o mercados. El promedio oculta efectos opuestos y rompe la comparabilidad.
- Cambiar la métrica primaria al final. Siempre encontrarás algún número que mejore por azar.
- Declarar causalidad absoluta. Un cuasi-experimento reduce explicaciones rivales; no controla todo el sistema generativo.
También evita convertir el experimento en un cálculo financiero completo. Si necesitas conectar la mejora con pipeline, ingresos y costes, utiliza el marco de ROI y atribución GEO después de validar primero que la acción movió la señal de visibilidad.
De un experimento a un programa de aprendizaje
El valor no está en hacer una prueba aislada, sino en acumular decisiones comparables. Usa un registro común para responder:
- Qué intervenciones mejoran citas, menciones o framing.
- En qué modelos e intenciones funcionan.
- Cuánto tardan en aparecer los primeros efectos.
- Qué resultados se repiten y cuáles fueron ruido.
- Qué tácticas deben escalarse, iterarse o abandonarse.
Cada experimento debe terminar con una decisión y una siguiente pregunta. Si una comparativa consigue citas pero no mejora la recomendación, el siguiente test puede trabajar el argumento. Si una mención editorial mejora un modelo y no otro, investiga las fuentes que utiliza cada entorno antes de repetir la inversión.
Mentio permite mantener un banco estable de preguntas, ejecutar mediciones recurrentes en varios modelos, conservar respuestas y comparar menciones, posición, competidores, framing y fuentes. Eso reduce el trabajo de captura y deja al equipo concentrarse en lo importante: formular una hipótesis limpia, controlar cambios y decidir con evidencia.
Checklist antes de lanzar
- La hipótesis especifica acción, cohorte, métrica, ventana y mecanismo.
- Hay una sola intervención o un paquete declarado.
- La métrica primaria se eligio antes de ver resultados.
- Los prompts tratados responden a una única intención.
- Los controles comparten entorno, pero no el tratamiento.
- El baseline contiene varias olas y repeticiones.
- El momento de exposición tiene un criterio verificable.
- El protocolo congela modelo, modo, idioma y mercado.
- La regla de éxito y la ventana están escritas.
- El informe incluirá límites y explicaciones rivales.
FAQ
¿Qué es un experimento GEO?
Es un protocolo que define antes de intervenir una hipótesis, una acción concreta, una cohorte de prompts afectada, prompts de control, un baseline, una ventana de seguimiento y un criterio de éxito. Su objetivo es separar un cambio compatible con la acción del ruido habitual y de factores externos.
¿Un experimento GEO es un test A/B?
Normalmente no es un A/B aleatorizado porque no controlas qué modelo, índice o fuente recibe cada usuario. Suele ser un cuasi-experimento antes-después con prompts tratados y de control. Aporta evidencia más fuerte que una simple comparación temporal, pero no demuestra causalidad absoluta.
¿Cuántos prompts necesito para un experimento GEO?
No existe un número universal. La cohorte debe cubrir la intención afectada sin mezclar problemas distintos y tener suficientes repeticiones para estimar su variabilidad. Entre diez y veinte prompts bien delimitados puede servir como punto de partida direccional, pero no es una garantía estadística.
¿Cuánto tiempo debo esperar después de publicar la acción?
Depende de si el modelo consulta la web, de la frecuencia de rastreo y de la superficie medida. Confirma primero que el activo es accesible e indexable, fija la ventana antes de ver resultados y usa varias olas de seguimiento. Los modelos sin recuperación web pueden tardar mucho más o no reflejar el cambio.
¿Qué prompts sirven como grupo de control?
Prompts del mismo mercado, idioma, marca y modelo que no deberían verse afectados directamente por la acción. Deben parecerse en volatilidad y valor, pero pertenecer a otra intención. Si también cambian, ayudan a detectar una actualización general o un factor externo.
¿Puede un experimento GEO demostrar que la acción causó el cambio?
Puede reforzar mucho la atribución si la cohorte tratada cambia, el control permanece estable, aparece el mecanismo esperado y el efecto se repite. Aun así, la mayoría de experimentos GEO son observacionales o cuasi-experimentales; conviene informar evidencia compatible con la hipótesis, no causalidad absoluta.
Convierte cada acción GEO en una decisión medible
Publicar, conseguir una mención o corregir una página no es el final del trabajo. Define primero qué debería cambiar, mide un baseline y compara el resultado con controles. Así dejas de coleccionar correlaciones y construyes un programa que aprende qué acciones merecen la siguiente inversión.
Cuando tengas el resultado del experimento, la plantilla de informe ejecutivo de visibilidad en IA te ayuda a presentarlo como decisión para dirección.
¿Quieres saber si la IA menciona tu marca?
Descubre tu visibilidad en ChatGPT, Claude y Gemini en minutos.
Artículos relacionados
Cómo crear un banco de prompts para medir la visibilidad de tu marca en IA
Aprende a crear un banco de prompts representativo, estable y accionable para medir menciones, posición y competidores en ChatGPT, Gemini y Perplexity.
Guías prácticasCómo medir la variabilidad de las respuestas de IA sin sesgar tu benchmark
Aprende a repetir prompts, controlar cambios y separar señal de ruido para construir un benchmark fiable de visibilidad de marca en respuestas de IA.
Estrategia GEOCómo medir el ROI real de tu estrategia GEO (más allá del share of voice)
Atribución, KPIs financieros y business case para defender tu inversión GEO ante el CFO. Modelo de cálculo de ROI con ejemplos reales en 2026.