Cómo medir visibilidad en IA por país e idioma sin mezclar mercados
Una marca puede aparecer en una respuesta en español desde España y desaparecer ante una pregunta equivalente desde México. También puede ser visible en inglés para Estados Unidos y no para Reino Unido. Si todas esas observaciones terminan en una sola tasa, el número parece preciso, pero no describe ningún mercado real.
La solución no es añadir una columna llamada "país" al final del análisis. Hay que diseñar la medición para que cada combinación de país e idioma conserve su propia muestra, configuración, denominador y baseline.
Esta guía empieza después de crear un banco de prompts de visibilidad. Aquí tomaremos intenciones ya definidas y construiremos un sistema localizado que permita responder: ¿estamos mejorando en cada mercado bajo condiciones comparables?
El error: convertir mercados distintos en una media
Imagina 100 ejecuciones:
- España en español: 40 ejecuciones, 20 menciones.
- México en español: 20 ejecuciones, 4 menciones.
- Estados Unidos en inglés: 40 ejecuciones, 8 menciones.
La tasa agregada es 32 / 100 = 32 %. Ese dato oculta tres realidades:
- España:
50 %. - México:
20 %. - Estados Unidos:
20 %.
Si el mes siguiente España crece y México cae, la media puede mejorar aunque una prioridad comercial empeore. También puede ocurrir lo contrario: un mercado pequeño con una muestra inestable mueve demasiado el total.
Una media global solo es interpretable cuando se construye después de medir cada mercado por separado y se conocen sus pesos. Nunca debe sustituir las vistas locales.
Define la unidad: la celda país x idioma
La unidad mínima es una celda de medición. Como mínimo contiene:
país objetivo x idioma de consulta x modelo x modo
Ejemplos:
ES-es | ChatGPT | búsqueda web activadaMX-es | Gemini | cuenta limpiaUS-en | Perplexity | webUS-es | ChatGPT | búsqueda web activada
País e idioma no son equivalentes. US-es puede representar compradores hispanohablantes en Estados Unidos, mientras MX-es representa otro mercado con el mismo idioma. Del mismo modo, CA-en y CA-fr comparten país, pero no audiencia lingüística.
Cada celda necesita:
- Objetivo y audiencia.
- Lista de intenciones incluidas.
- Variantes locales de los prompts.
- Configuración de ejecución.
- Reglas de aceptación y exclusión.
- Denominador propio.
- Baseline y versión.
- Responsable de QA.
Paso 1: decide qué mercados merecen una celda
No abras veinte países porque la herramienta muestre una bandera. Empieza por una pregunta de decisión:
¿En qué mercados necesitamos saber si una persona puede descubrir, comparar o elegir nuestra oferta mediante IA durante el próximo trimestre?
Prioriza con evidencia operativa:
| Señal | Pregunta |
|---|---|
| Ingresos o pipeline | ¿El mercado ya genera negocio material? |
| Inversión | ¿Hay campaña, equipo o lanzamiento local? |
| Disponibilidad | ¿La oferta se puede comprar y entregar allí? |
| Riesgo | ¿Una descripción incorrecta tendría impacto legal o comercial? |
| Oportunidad | ¿Existe una categoría o audiencia prioritaria todavía sin baseline? |
Una celda sin decisión asociada crea mantenimiento, no información. Documenta también los mercados excluidos y la fecha de revisión.
La estrategia GEO para España y Latinoamérica explica por qué el mercado hispano ofrece una oportunidad. Este protocolo resuelve otra cuestión: cómo medir España, México, Colombia o Argentina sin tratarlos como si fueran la misma audiencia.
Paso 2: crea un conjunto maestro de intenciones
Para comparar mercados necesitas equivalencia conceptual, no frases idénticas.
Asigna un ID estable a cada intención:
| ID | Intención | Etapa | Resultado esperado |
|---|---|---|---|
INT-01 |
Descubrir soluciones de la categoría | Descubrimiento | Lista de opciones relevantes |
INT-02 |
Comparar dos enfoques | Evaluación | Diferencias y criterios |
INT-03 |
Resolver un problema concreto | Consideración | Recomendación aplicable |
INT-04 |
Validar confianza | Decisión | Evidencia, límites y alternativas |
El ID conecta variantes locales sin afirmar que son la misma frase. Si una intención no existe en un mercado, márcala como no aplicable; no inventes una traducción para rellenar la tabla.
Conserva un núcleo común para comparaciones y un bloque local para necesidades exclusivas:
- Núcleo comparable: intenciones que existen en todas las celdas seleccionadas.
- Bloque local: preguntas relevantes solo para una regulación, canal, producto o hábito del mercado.
Calcula las comparaciones internacionales solo con el núcleo comparable. Informa el bloque local dentro de su mercado.
Paso 3: localiza por intención, no por traducción
Una traducción literal puede cambiar el nivel de naturalidad, la categoría o el conjunto de competidores que un usuario espera.
Para cada variante local registra:
| Campo | Ejemplo |
|---|---|
| ID de intención | INT-01 |
| Celda | MX-es |
| Prompt | ¿Qué plataformas sirven para medir visibilidad de marca en respuestas de IA en México? |
| Término de categoría | plataformas de visibilidad en IA |
| Contexto local | Disponibles para empresas mexicanas |
| Entidades esperadas | Categoría, no marcas forzadas |
| Revisor local | Responsable de México |
| Estado | Aprobado |
Un revisor local debe comprobar:
- Que la frase se usaría realmente en ese mercado.
- Que no contiene un localismo de otro país.
- Que la categoría y la oferta existen allí.
- Que moneda, regulación y disponibilidad son correctas.
- Que la pregunta no introduce la respuesta.
- Que mantiene la intención del ID maestro.
No fuerces el nombre del país en todos los prompts. Inclúyelo cuando una persona lo necesitaría para obtener una respuesta local; en otros casos, la ubicación y el idioma forman parte de la configuración.
Paso 4: congela la ficha de configuración
Los resultados pueden cambiar por más factores que el texto. Crea una ficha por celda y versión:
Cell ID:
Target country:
Query language:
Expected response language:
Model and version:
Mode / web access:
Account state:
Location method:
Session rule:
Execution window:
Prompt-bank version:
Entity and competitor rules:
Owner:
Mantén estable durante una comparación:
- Modelo y modo.
- Estado de sesión y memoria.
- Tipo de cuenta cuando afecte a funciones.
- Método usado para establecer ubicación.
- Ventana horaria y cadencia.
- Versión del prompt.
- Reglas de coincidencia para marca, productos y competidores.
No describas una ejecución como "México" si solo cambiaste el idioma del prompt. El país objetivo necesita un método verificable en la herramienta o el entorno. Si no puedes confirmarlo, etiqueta la observación como idioma, no como país.
Paso 5: ejecuta dentro de cada celda
La aleatoriedad sigue existiendo dentro de una configuración local. Aplica el protocolo de variabilidad de respuestas por separado en cada celda.
El orden correcto es:
- Congelar la celda.
- Ejecutar las variantes aprobadas.
- Repetir bajo la misma configuración.
- Registrar respuestas y exclusiones.
- Calcular métricas locales.
- Comparar con el baseline de esa celda.
- Construir, solo después, una vista multinacional.
No compenses ejecuciones faltantes de México añadiendo más ejecuciones de España. Si una celda no alcanza la cobertura mínima acordada, debe figurar como incompleta.
Dataset mínimo para conservar trazabilidad
Cada fila debe representar una ejecución:
| Campo | Contenido |
|---|---|
run_id |
ID único |
cell_id |
País, idioma, modelo y modo |
intent_id |
Intención maestra |
prompt_variant_id |
Texto local y versión |
target_country |
País declarado |
query_language |
Idioma solicitado |
response_language |
Idioma observado |
model |
Modelo y modo |
executed_at |
Fecha y hora |
accepted |
Sí / no |
exclusion_reason |
Motivo cuando no entra en métricas |
brand_mentioned |
Sí / no |
position |
Posición definida por el protocolo |
competitors |
Entidades detectadas |
sources |
URLs o dominios cuando existan |
raw_response |
Evidencia completa |
Guarda también la versión del diccionario de entidades. Una misma marca puede usar aliases distintos por país y un producto puede no estar disponible en todas las celdas.
Calcula denominadores por celda
La tasa de mención local es:
ejecuciones aceptadas con mención / ejecuciones aceptadas de la celda
No uses como denominador:
- Todos los prompts planificados si algunos no se ejecutaron.
- Respuestas de otro idioma.
- Ejecuciones excluidas por configuración incorrecta.
- Intenciones no aplicables al mercado.
- Repeticiones añadidas solo a una celda.
Publica siempre numerador, denominador y cobertura:
MX-es: 18 menciones / 60 ejecuciones aceptadas; 95 % de cobertura del plan
Aplica la misma regla a Share of Voice, posición, citas y presencia por intención. La guía general para medir visibilidad en IA define las métricas; aquí el requisito es que cada una conserve su universo local.
Construye un agregado solo con pesos explícitos
Hay tres vistas útiles:
- Por celda: la vista operativa principal.
- Media no ponderada: da el mismo peso a cada celda completa.
- Índice ponderado: refleja una prioridad de negocio documentada.
Ejemplo:
| Celda | Tasa de mención | Peso comercial |
|---|---|---|
| ES-es | 50 % | 50 % |
| MX-es | 20 % | 30 % |
| US-en | 20 % | 20 % |
Índice ponderado:
(0,50 x 0,50) + (0,20 x 0,30) + (0,20 x 0,20) = 35 %
El peso no mejora la calidad del dato. Solo responde a una pregunta de negocio. Versiona los pesos, muestra la vista por celda y evita cambiarlos entre periodos sin recalcular el histórico.
Compara deltas, no posiciones absolutas entre mercados
Una tasa mayor en España que en México no demuestra que el equipo español trabaje mejor. Las celdas pueden diferir en competencia, fuentes, madurez de categoría y comportamiento del modelo.
Las comparaciones más defendibles son:
ES-es actualfrente a su propio baseline.MX-es actualfrente a su propio baseline.- Cambio de una intención común dentro de cada celda.
- Diferencia entre cohortes tratada y control dentro del mismo mercado.
- Cobertura y calidad de datos por celda.
Después puedes comparar los deltas:
| Celda | Baseline | Actual | Delta |
|---|---|---|---|
| ES-es | 42 % | 50 % | +8 pp |
| MX-es | 24 % | 20 % | -4 pp |
| US-en | 18 % | 20 % | +2 pp |
La lectura correcta no es "España gana". Es "España mejora respecto a su condición inicial, México retrocede y Estados Unidos permanece cerca del baseline".
Ejemplo: España, México y Estados Unidos
Una empresa SaaS opera en España y México y empieza a vender en Estados Unidos. Define:
ES-es: núcleo comparable más preguntas sobre integraciones usadas en España.MX-es: el mismo núcleo por intención, con terminología y disponibilidad mexicanas.US-en: núcleo equivalente en inglés, con competidores y categorías de Estados Unidos.US-es: celda exploratoria para compradores hispanohablantes, informada por separado.
Durante QA detecta que tres respuestas de MX-es aparecen en inglés y que dos prompts de US-en incluyen un producto no disponible allí. Excluye esas ejecuciones, corrige la siguiente versión y no rellena los huecos con datos de otra celda.
El informe muestra cuatro resultados locales, cobertura, exclusiones y deltas. La dirección recibe además un índice ponderado con pesos comerciales aprobados, pero puede abrir cada mercado y ver qué explica el total.
QA para detectar contaminación entre mercados
Antes de aceptar una ejecución, comprueba:
- El país objetivo está confirmado por el método acordado.
- El prompt corresponde a la variante y versión de la celda.
- La respuesta usa el idioma esperado o tiene una regla explícita de excepción.
- Producto, precio, moneda y disponibilidad corresponden al mercado.
- Los competidores comparados operan allí.
- La sesión no conserva contexto de otra celda.
- El modelo y el modo coinciden con la ficha.
- La ejecución entra en la ventana temporal definida.
- Las reglas de aliases y entidades son las correctas.
- La evidencia completa puede revisarse.
Incluye prompts de control locales. Por ejemplo, una consulta sobre disponibilidad que debería producir respuestas distintas en España y México. Si ambas celdas devuelven sistemáticamente la misma oferta, revisa la configuración antes de interpretar la visibilidad.
Dashboard mínimo por mercado
La portada debe responder primero qué mercado necesita atención:
| Celda | Cobertura | Mención | Share of Voice | Delta | Estado |
|---|---|---|---|---|---|
| ES-es | 100 % | 50 % | 31 % | +8 pp | Mejora |
| MX-es | 95 % | 20 % | 14 % | -4 pp | Revisar |
| US-en | 100 % | 20 % | 18 % | +2 pp | Estable |
Al abrir una celda, muestra:
- Intenciones y prompts locales.
- Distribución de repeticiones.
- Marca, posición, competidores y fuentes.
- Respuestas excluidas y motivos.
- Baseline y cambios de versión.
- Responsable y siguiente acción.
Para dirección, lleva el índice ponderado y las decisiones a un informe ejecutivo de visibilidad en IA. Conserva el detalle local para que el resumen no convierta un promedio en una explicación.
Errores que invalidan una medición internacional
- Usar idioma como sustituto de país.
- Traducir literalmente prompts sin validar intención local.
- Mezclar respuestas de varios mercados en un solo denominador.
- Comparar menciones brutas con tamaños de muestra distintos.
- Cambiar pesos comerciales sin recalcular el histórico.
- Permitir productos o competidores no disponibles en la celda.
- Ejecutar varias celdas en una sesión con memoria compartida.
- Ocultar respuestas excluidas o cobertura incompleta.
- Declarar una ubicación que la herramienta no puede confirmar.
- Presentar el agregado sin permitir abrir cada mercado.
FAQ
¿Por qué no debo mezclar países en una sola métrica de visibilidad en IA?
Porque cada país e idioma puede tener prompts, fuentes, competidores, disponibilidad y comportamiento distintos. Al mezclarlos, una mejora en un mercado grande puede ocultar una caída en otro y el denominador deja de representar una condición concreta.
¿Qué es una celda país-idioma?
Es la unidad mínima de una medición localizada. Combina un país objetivo y un idioma de consulta con una configuración documentada de modelo, cuenta, ubicación, prompt y ventana de ejecución. Sus resultados conservan un denominador y un baseline propios.
¿Debo traducir literalmente los mismos prompts?
No. Debes conservar la intención y el nivel del embudo, pero adaptar vocabulario, categoría, ubicación y alternativas reales del mercado. Una traducción literal puede sonar artificial o representar una decisión de compra diferente.
¿Cómo comparo dos mercados con tamaños distintos?
Compara tasas dentro de cada celda y, para una vista global, aplica pesos explícitos basados en una decisión de negocio. No sumes menciones brutas. Mantén también la vista sin ponderar para que un peso comercial no oculte problemas de calidad.
¿Puedo comparar español de España y español de México?
Sí, si son celdas separadas con prompts equivalentes por intención, configuración controlada y baselines propios. El idioma compartido no convierte ambos mercados en una sola muestra: cambian términos, competidores, disponibilidad y contexto local.
¿Qué controles evitan contaminar un benchmark internacional?
Registra país, idioma solicitado y observado, variante del prompt, modelo, modo, cuenta, ubicación, fecha y respuesta. Añade pruebas de control locales y excluye ejecuciones con idioma incorrecto, ubicación no confirmada o configuración diferente.
Esa separación por mercado también condiciona la comparación entre marcas: el benchmark sectorial de visibilidad en IA exige comparar pares solo dentro de celdas equivalentes de país, idioma, modelo e intención.
Separa primero; compara después
Una medición multinacional es útil cuando cada mercado puede explicar su propio resultado. Diseña celdas, conserva baselines y denominadores locales y deja el agregado para el final. Así una mejora global nunca ocultará qué país avanzó, cuál retrocedió y dónde falta evidencia.
¿Quieres saber si la IA menciona tu marca?
Descubre tu visibilidad en ChatGPT, Claude y Gemini en minutos.
Artículos relacionados
Cómo crear un banco de prompts para medir la visibilidad de tu marca en IA
Aprende a crear un banco de prompts representativo, estable y accionable para medir menciones, posición y competidores en ChatGPT, Gemini y Perplexity.
Guías prácticasCómo medir la variabilidad de las respuestas de IA sin sesgar tu benchmark
Aprende a repetir prompts, controlar cambios y separar señal de ruido para construir un benchmark fiable de visibilidad de marca en respuestas de IA.
Mercado hispanoGEO para empresas de España y Latinoamérica: la oportunidad que nadie está aprovechando
El mercado hispanohablante tiene una ventaja enorme en GEO: casi nadie está optimizando para IA en español. Descubre cómo aprovecharlo.