Cómo construimos los perfiles

Partimos de fuentes oficiales y legalmente admisibles (p. ej. DANE en Colombia, INEGI en México) para fijar las cuotas reales de cada segmento: edad, estrato, Sisbén, región, género y otras variables relevantes. Sobre esas proporciones generamos agentes con un perfil sociodemográfico coherente —cruzando variables para evitar combinaciones imposibles— y los situamos en un grafo causal que conecta condiciones de vida, valores y comportamiento esperado. Ningún perfil corresponde a una persona real.

Qué modelos usamos

Combinamos modelos de lenguaje de última generación (familia Claude de Anthropic) con una capa estadística determinística propia (muestreo por cuotas, ponderación y agregación). El modelo aporta el razonamiento de cada agente; la capa estadística aporta estructura, reproducibilidad y los intervalos de estabilidad. Registramos la versión de modelo y de metodología de cada estudio para trazabilidad.

Cómo calibramos y comparamos con datos reales

La calibración consiste en ajustar cuotas, ponderaciones y prompts para que las distribuciones del panel sintético se acerquen a referencias conocidas. Cuando existe un dato real comparable (una encuesta pública, un resultado histórico, datos propios del cliente), hacemos backtesting: contrastamos la simulación contra ese dato y documentamos la desviación. La literatura reciente muestra que los usuarios sintéticos pueden replicar tendencias generales, aunque con menor heterogeneidad que los participantes humanos —por eso la comparación y la revisión humana son parte del método, no un extra.

Margen de incertidumbre

El % de confianza y el ± que ves en la Consola describen la estabilidad interna del panel sintético (cuánto varía el resultado al repetir la corrida con ese número de perfiles), no el margen de error de una encuesta a personas reales. Bajo condiciones favorables hablamos de rangos de aproximación orientativos; en zonas con poca cobertura de datos, sectores nuevos o poblaciones complejas la incertidumbre es mayor y lo advertimos.

Cuándo NO debe usarse

No uses la simulación como base única para decisiones clínicas, electorales, de crédito, empleo, vivienda, seguridad o cualquier decisión que afecte derechos de personas. No la uses para microtargeting dañino, manipulación encubierta ni desinformación. En sectores sensibles aplicamos revisión humana obligatoria y controles de uso responsable (ver SUAIGov y SUAUP).

Límites por sesgo, cultura, datos e idioma

Los resultados heredan los sesgos de los modelos y de las fuentes; pueden subrepresentar matices culturales locales, jerga regional, experiencias minoritarias o contextos de baja cobertura de datos. El idioma y la formulación del estímulo influyen en la respuesta. Documentamos estas limitaciones y, en decisiones importantes, recomendamos triangular con investigación humana.