Volver al blogLibro de diseño de investigación y cuadernos usados para planificar un benchmark reproducibleGuías prácticas

    Cómo medir la variabilidad de las respuestas de IA sin sesgar tu benchmark

    2026-07-17·12 min de lectura

    Ejecutas una pregunta en ChatGPT y tu marca aparece en segunda posición. Repites el mismo prompt unas horas después y desaparece. ¿Has perdido visibilidad o solo has observado una respuesta distinta dentro del comportamiento normal del modelo?

    Cuando midas más de un mercado, separa primero las celdas país-idioma y aplica el protocolo de repeticiones dentro de cada una para no mezclar ruido con diferencias reales entre mercados.

    Una medición aislada no puede responderlo. Los sistemas generativos no devuelven una lista fija: producen respuestas probabilísticas, pueden recuperar fuentes distintas y cambian con el contexto, el modelo y el momento. Si conviertes una sola ejecución en un KPI, el dashboard tendrá números precisos sobre una muestra poco fiable.

    La solución no es repetir hasta obtener el resultado que esperabas. Es definir un protocolo antes de mirar las respuestas: qué permanece fijo, cuántas veces se ejecuta cada pregunta, qué se registra y qué cambio será suficiente para actuar.

    Este artículo empieza donde termina la guía para crear un banco de prompts de visibilidad de marca. Allí diseñas la muestra de preguntas. Aquí conviertes esa muestra en un benchmark repetible capaz de distinguir señal de ruido.

    Qué significa variabilidad en una respuesta de IA

    La variabilidad es la diferencia entre respuestas obtenidas bajo condiciones que pretendemos comparar. Puede afectar a si una marca aparece, su posición, los competidores mencionados, las fuentes citadas y el argumento usado para recomendarla.

    No toda diferencia tiene la misma causa. Antes de calcular nada, separa tres ejes:

    1. Variabilidad dentro del mismo entorno. El mismo prompt, modelo, modo, idioma y ventana temporal produce respuestas distintas. Es el ruido base que debes estimar con repeticiones.
    2. Diferencias entre entornos. ChatGPT, Gemini y Perplexity no son réplicas del mismo sistema. Compararlos es útil, pero no mide repetibilidad; mide comportamiento por modelo.
    3. Cambio en el tiempo. Una nueva versión del modelo, una actualización de fuentes o una acción GEO puede desplazar el resultado. Solo puedes llamarlo cambio si conoces primero el rango normal de variación.

    Mezclar los tres ejes crea conclusiones falsas. Si una marca aparece cuatro veces en Perplexity y una en ChatGPT, la diferencia puede pertenecer al modelo. Si aparece tres de cinco veces hoy y cuatro de cinco la semana próxima, puede seguir dentro del ruido de muestreo. El diseño debe conservar cada dimensión por separado.

    Por qué el mismo prompt no siempre produce la misma respuesta

    Hay cuatro fuentes de variación que un benchmark práctico debe registrar.

    Generación probabilística

    Un modelo no recupera una frase única almacenada. Calcula una distribución de posibles continuaciones y construye la respuesta token a token. Incluso con una interfaz sin control visible de temperatura, el servicio puede introducir variación en la generación.

    Recuperación y frescura de fuentes

    Cuando el modo de búsqueda web está activo, el conjunto de documentos recuperados puede cambiar entre ejecuciones. Una noticia nueva, un resultado que sube de posición o una fuente temporalmente inaccesible altera la evidencia disponible.

    Contexto de sesión y configuración

    El historial de conversación, la ubicación, el idioma, el tipo de cuenta, el modo de respuesta y las instrucciones previas condicionan el resultado. Ejecutar una pregunta en un chat antiguo y otra en una sesión limpia no es repetir el mismo experimento.

    Versión del modelo y cambios del proveedor

    Los proveedores actualizan modelos, sistemas de búsqueda y políticas sin que el nombre comercial cambie siempre. Por eso debes guardar fecha, hora, modelo mostrado y cualquier identificador de versión disponible. Si no existe, registra al menos la interfaz y el modo utilizados.

    Estas causas no convierten la medición en inútil. La convierten en una medición por muestreo, como una encuesta o un test de calidad: el objetivo es estimar una distribución, no capturar una respuesta supuestamente definitiva.

    Define la unidad de medición antes de ejecutar

    La unidad mínima no es "la marca esta semana". Es una combinación explícita:

    prompt_id + versión del banco + modelo + modo + idioma + mercado + ventana temporal

    Cada cambio en esa combinación crea una serie distinta. Si activas búsqueda web a mitad de la medición, cambias el prompt o pasas de español de España a español de México, no debes unir los resultados como si pertenecieran al mismo benchmark.

    Usa un identificador estable para cada pregunta. El texto visible puede tener pequeñas correcciones en una nueva versión, pero el registro debe conservar qué versión produjo cada respuesta. La guía de métricas GEO explica qué indicadores seguir; este protocolo define cuándo esos indicadores son comparables.

    Protocolo de repetición paso a paso

    1. Congela el diseño de la ola

    Antes de ejecutar, fija:

    • Versión del banco de prompts.
    • Modelos y modos exactos.
    • Idioma y mercado.
    • Sesión nueva o contexto controlado.
    • Acceso a la web activado o desactivado.
    • Ventana de ejecución.
    • Número de repeticiones por prompt.
    • Reglas de extracción de menciones, posición, competidores y fuentes.

    Guarda esta configuración como manifiesto de la ola. Si algo cambia, crea otra ola; no edites el manifiesto después de ver los resultados.

    2. Ejecuta cada repetición en una sesión limpia

    Abre una conversación nueva para cada ejecución salvo que el objeto del estudio sea precisamente una conversación con contexto. No corrijas al modelo, no añadas pistas y no reformules cuando la respuesta no te guste.

    El benchmark mide lo que ocurre ante el prompt definido, no la habilidad del analista para conducir el chat hasta una mención.

    3. Distribuye las ejecuciones en una ventana estrecha

    Para estimar variabilidad de generación, ejecuta las repeticiones en un periodo suficientemente corto para reducir cambios externos. En un estudio semanal, puede ser una misma mañana o una ventana de pocas horas.

    Alterna o aleatoriza el orden de prompts para que una incidencia puntual no afecte siempre al mismo bloque. Si el proveedor limita la frecuencia, registra las pausas y conserva el mismo patrón entre olas.

    4. Conserva la respuesta completa

    No guardes solo "mencionado: sí/no". Almacena el texto bruto, fecha y hora UTC, prompt exacto, modelo, modo, idioma, mercado y configuración. Si es posible, añade un identificador o hash de la respuesta para detectar duplicados.

    El dato derivado puede corregirse; una respuesta que no guardaste no puede auditarse.

    5. Aplica reglas de extracción deterministas

    Define antes qué cuenta como mención. ¿Aceptas abreviaturas, productos, dominios o nombres antiguos? ¿La posición se calcula por orden de primera aparición o dentro de una lista de recomendaciones? ¿Una marca citada solo como ejemplo negativo cuenta igual?

    Usa el mismo diccionario de aliases y la misma regla en todas las respuestas. Automatiza la extracción cuando haya volumen y revisa una muestra manual para medir errores. No cambies la regla a mitad de la ola para favorecer un resultado.

    6. Calcula la distribución, no solo el promedio

    Para cada prompt y entorno, conserva el recuento de resultados. Si una marca aparece en tres de cinco respuestas, muestra 3/5 y no solo 60%. El recuento hace visible el tamaño de muestra y evita una falsa sensación de precisión.

    Resume después por intención, producto o mercado. Cada prompt debe mantener el mismo peso salvo que una ponderación se haya definido y documentado antes de ejecutar.

    7. Compara con un baseline versionado

    Las primeras olas sirven para estimar el rango normal. No atribuyas una mejora a una acción GEO solo porque el segundo dato supera al primero. Busca un desplazamiento mayor que la variabilidad habitual y confirma que persiste en otra ola comparable.

    Un benchmark útil conserva tanto el baseline como el historial de cambios. Sin ese registro, cada actualización del dashboard borra el contexto necesario para interpretar la siguiente.

    Cuántas repeticiones necesitas

    No existe un número universal. Depende de la decisión, el presupuesto y la inestabilidad observada. Estas cifras son heurísticas operativas, no garantías estadísticas:

    Repeticiones por prompt Uso recomendado Límite
    1 Control técnico de que el prompt funciona No permite estimar variabilidad
    3 Piloto y detección de inestabilidad evidente Muy sensible a una sola respuesta
    5 Baseline direccional para seguimiento recurrente Los intervalos siguen siendo amplios
    8-10 Prompts críticos, volátiles o decisiones de mayor impacto Más coste; no elimina el error de muestreo
    Más de 10 Estudios específicos que necesitan mayor precisión Debe justificarse con un objetivo estadístico y presupuesto

    Una estrategia eficiente usa dos niveles. Ejecuta cinco repeticiones en el núcleo del banco y amplía a ocho o diez solo en preguntas de alto valor o con resultados cercanos al umbral de decisión. Si un prompt es estable durante varias olas, puedes mantenerlo en el nivel base; si oscila, aumenta temporalmente la muestra.

    El número de prompts y el número de repeticiones resuelven problemas distintos. Añadir más preguntas mejora cobertura de intención. Repetir una misma pregunta mejora la estimación de su variabilidad. Cien prompts ejecutados una sola vez no sustituyen cinco ejecuciones de veinte prompts cuando quieres estudiar repetibilidad.

    Qué métricas revelan la variabilidad

    Este artículo no propone otro catálogo de KPIs. Usa métricas ya conocidas, pero conserva su distribución por repetición.

    Probabilidad de mención por prompt

    Calcula menciones / ejecuciones para cada prompt, modelo y ola. Con muestras pequeñas, acompaña la proporción con el recuento y un intervalo de Wilson. Ese intervalo evita parte de los problemas del intervalo normal cuando el resultado está cerca de 0% o 100%.

    No ocultes que 1/3 y 10/30 comparten porcentaje pero no precisión. En un dashboard, el denominador debe estar disponible.

    Distribución de posición

    Cuando la marca aparece, registra la primera posición relevante. Resume con mediana y rango, no solo con media. Mantén las ausencias como ausencias; asignarles de forma arbitraria la última posición mezcla dos fenómenos distintos.

    Ejemplo: posiciones 2, ausente, 4, 2, ausente significan una tasa de mención de 3/5 y una mediana de posición 2 entre apariciones. Ambas cifras cuentan una parte diferente de la historia.

    Estabilidad del conjunto de competidores

    Compara las marcas citadas en dos respuestas mediante similitud de Jaccard: tamaño de la intersección dividido por el tamaño de la unión. Un valor alto indica que el conjunto competitivo se repite; uno bajo muestra que la recomendación cambia de composición.

    No necesitas enseñar la fórmula al comité de dirección, pero sí conservarla en la metodología para que "competidores estables" tenga una definición reproducible.

    Consistencia del encuadre

    Etiqueta el motivo principal asociado a la marca: precio, facilidad, especialización, confianza, soporte u otra categoría definida. Calcula cuántas respuestas repiten el mismo encuadre y revisa manualmente los casos ambiguos.

    Esto evita declarar estable una presencia que aparece con narrativas contradictorias. La marca puede ser mencionada en todas las ejecuciones y, aun así, variar de "opción económica" a "solución premium".

    Solapamiento de fuentes citadas

    En respuestas con navegación, registra dominios y URLs. Mide cuántas fuentes se repiten entre ejecuciones y cuáles aparecen solo una vez. Una mención sostenida por fuentes estables suele ser más interpretable que otra dependiente de una URL distinta en cada respuesta.

    Plantilla mínima del dataset

    Una fila debe representar una ejecución, no un promedio. Como mínimo incluye:

    Campo Ejemplo Por qué importa
    wave_id 2026-W29-core-v3 Agrupa una ola comparable
    prompt_id discovery_crm_014 Mantiene identidad de la pregunta
    prompt_version 3.0 Detecta cambios en la muestra
    run_id 05 Identifica la repetición
    timestamp_utc 2026-07-17T09:42:00Z Permite auditar la ventana
    model ChatGPT Separa entornos
    model_mode web_on Controla recuperación
    locale_market es-ES / España Evita mezclar mercados
    fresh_session true Controla contexto
    brand_mentioned true Resultado binario base
    first_position 2 Orden dentro de la respuesta
    competitors A; B; C Permite medir estabilidad del set
    cited_domains example.com; review.com Audita fuentes
    framing facilidad de uso Captura narrativa
    raw_response_ref resp_7f31 Conecta con la evidencia original

    No sobrescribas filas cuando corrijas una extracción. Conserva un registro de la corrección, quién la hizo y qué regla cambió.

    Ejemplo: de una foto engañosa a un benchmark útil

    Imagina un banco de 20 prompts no branded para una categoría SaaS, medido en tres modelos.

    En la primera aproximación se ejecuta cada pregunta una vez. La marca aparece en 8 de 20 prompts en ChatGPT, 11 en Gemini y 13 en Perplexity. El equipo concluye que Perplexity es el mejor canal.

    Después aplica cinco repeticiones por prompt. El resultado revela algo distinto:

    • En ChatGPT, la marca aparece de forma estable en 7 prompts y de manera intermitente en 4.
    • En Gemini, aparece de forma estable en 9 y los competidores cambian poco.
    • En Perplexity, aparece en más respuestas, pero 8 prompts dependen de una sola fuente que entra y sale de la recuperación.

    La nueva conclusión no es un ranking simple. Gemini ofrece la presencia más estable; Perplexity tiene mayor cobertura, pero también mayor dependencia de fuentes variables. Las acciones cambian: reforzar la fuente ganable en Perplexity y proteger el encuadre consolidado en Gemini.

    El protocolo no elimina la variabilidad. La convierte en información para decidir.

    Cómo distinguir una mejora real del ruido

    Usa esta secuencia antes de atribuir un cambio a contenido, PR o producto:

    1. Verifica el protocolo. El prompt, modelo, modo, mercado, ventana y reglas de extracción deben ser equivalentes.
    2. Compara con la dispersión del baseline. Un cambio dentro del rango habitual es evidencia débil.
    3. Busca coherencia entre prompts relacionados. Una mejora real suele afectar a un bloque de intención, no a una sola pregunta aislada.
    4. Confirma en otra ola. La persistencia reduce el riesgo de reaccionar a una ejecución atípica.
    5. Revisa las respuestas y fuentes. El número indica dónde mirar; el texto explica por qué cambió.

    Si acabas de ejecutar una acción concreta, documenta la fecha en el mismo historial. No cambies a la vez el banco, el modelo y el contenido que quieres evaluar. Sin control de cambios, no hay atribución defendible.

    Para una comparación multmodelo, mantén series separadas y consulta la guía ChatGPT vs Gemini vs Perplexity para marcas. Las diferencias entre proveedores son contexto del análisis, no ruido que debas promediar.

    Cambiar el protocolo a mitad de una serie destruye la comparabilidad más rápido que el propio ruido. Trata cada ajuste como un release con ensayo paralelo siguiendo la gobernanza de la medición de visibilidad en IA.

    Sesgos que invalidan el benchmark

    Repetir hasta obtener una mención

    Parar cuando aparece la marca es selección del resultado. Define el número de ejecuciones antes y completa todas, incluso si las primeras parecen concluyentes.

    Mezclar preguntas branded y no branded

    Una consulta que contiene el nombre de la marca mide exactitud o percepción asistida. Una consulta de descubrimiento mide recomendación espontánea. Mantén ambos bloques y sus scores separados.

    Cambiar prompts sin crear una versión

    Una mejora de redacción puede cambiar la respuesta más que una acción GEO. Toda modificación requiere versión nueva, fecha y motivo. Conserva un núcleo estable para enlazar las series.

    Ejecutar en conversaciones con historial distinto

    El contexto previo puede introducir marcas, preferencias y restricciones. Usa sesiones limpias o un contexto estandarizado que se incluya explícitamente en el protocolo.

    Promediar modelos y mercados demasiado pronto

    Un promedio global puede esconder que la marca es estable en un mercado y volátil en otro. Segmenta primero; agrega después con ponderaciones definidas antes de ver los datos.

    Redondear muestras pequeñas como si fueran precisas

    67% parece exacto, pero puede significar solo dos menciones de tres intentos. Muestra siempre numerador y denominador, y no conviertas una diferencia de una respuesta en una narrativa ejecutiva.

    No guardar respuestas ni versiones

    Sin evidencia bruta no puedes revisar aliases, posiciones, fuentes ni errores de clasificación. Un benchmark no auditable es una opinión con una tabla.

    Cómo lo aplica Mentio

    Mentio automatiza la ejecución de preguntas relevantes en ChatGPT, Gemini, Perplexity, Claude y otros entornos, y organiza menciones, posición, competidores y fuentes. Eso reduce trabajo manual, pero no sustituye el diseño de medición.

    La configuración correcta parte de un banco versionado, separa modelos y mercados, conserva una cadencia comparable y revisa respuestas cuando una métrica se mueve fuera de su rango habitual. Un rastreador de visibilidad en IA aporta valor cuando hace visibles esas condiciones, no cuando oculta la muestra detrás de un único score.

    Con el rango habitual definido, el siguiente paso es probar hipótesis: consulta cómo diseñar un experimento GEO y medir si una acción cambia tu visibilidad.

    Durante un lanzamiento conviene aumentar la cadencia y las repeticiones por condición: el calendario completo está en la guía para monitorizar un lanzamiento de producto en IA.

    FAQ

    ¿Por qué una IA responde distinto al mismo prompt?

    Porque la generación es probabilística y también pueden variar las fuentes recuperadas, el contexto, la configuración o la versión del modelo. Una respuesta aislada no representa de forma fiable el comportamiento habitual.

    ¿Cuántas veces debo repetir cada prompt?

    Como heurística, tres ejecuciones detectan inestabilidad evidente, cinco permiten un baseline direccional y entre ocho y diez ayudan en prompts críticos o volátiles. Ajusta la muestra al riesgo y al presupuesto; no trates esos números como garantías estadísticas.

    ¿Puedo mezclar resultados de ChatGPT, Gemini y Perplexity?

    No en una única tasa sin segmentar. Mantén el mismo núcleo de prompts, calcula resultados por modelo y compara cada serie consigo misma. Después puedes crear una vista agregada con ponderaciones documentadas.

    ¿Qué intervalo debo mostrar para una tasa de mención?

    Con pocas repeticiones, muestra el recuento y un intervalo de Wilson para la proporción. Evita porcentajes con decimales innecesarios y el intervalo normal cerca de 0% o 100%.

    ¿Cómo sé si un cambio es señal y no ruido?

    Compáralo con la variabilidad del baseline, confirma que el protocolo no cambió y busca persistencia en una segunda ola. Una variación aislada dentro del rango habitual no basta para atribuir una mejora o una caída.

    ¿Cómo ayuda Mentio a controlar la variabilidad?

    Mentio ejecuta un banco estable en varios modelos, conserva resultados y compara menciones, posición, competidores y evolución. La interpretación sigue exigiendo versiones claras y series separadas por modelo, mercado y configuración.

    Cuando compares varias marcas, distingue el ruido interno de la dispersión entre competidores: el benchmark sectorial de visibilidad en IA describe cómo publicar la distribución de la cohorte junto a la incertidumbre de cada estimación.

    Mide una distribución, no una anécdota

    La pregunta útil no es "¿apareció mi marca en esta respuesta?", sino "¿con qué frecuencia, estabilidad y contexto aparece bajo condiciones comparables?". Ese cambio convierte una colección de capturas en un sistema de medición.

    Empieza con un núcleo pequeño, cinco repeticiones y reglas explícitas. Conserva las respuestas, aprende qué prompts son volátiles y amplía la muestra donde una decisión lo justifique. Solo entonces un movimiento del dashboard podrá tratarse como señal.

    ¿Quieres saber si la IA menciona tu marca?

    Descubre tu visibilidad en ChatGPT, Claude y Gemini en minutos.

    Artículos relacionados