¿Cómo medís lo que los asistentes de IA realmente recomiendan? Corremos los experimentos — métricas preespecificadas, intervalos de confianza, miles de respuestas archivadas — y publicamos lo que encontramos, incluidas las partes incómodas. La propia metodología de GenSig está construida sobre estos resultados.
Hicimos las mismas preguntas con intención de compra 2.500 veces en cinco configuraciones de API y 30 veces a mano en las apps de consumo reales (ChatGPT web, Gemini web). La API pelada del LLM se perdió 3 de las 5 marcas que las sesiones reales recomiendan de forma consistente; temperatura 0 hizo las respuestas muy repetibles — del conjunto de marcas equivocado; y cada API con grounding de búsqueda resultó reflejar su propia superficie de consumo.
Cada estudio viene con sus datos crudos y código — descargá el dataset de Research #1 (2.500 respuestas de API + 30 corridas en apps de consumo, prompts, diccionario de marcas y código de análisis).
¿Nuevo en visibilidad en IA? Empezá acá: visibilidad de marca en IA — qué es, por qué importa y cómo medirla, después la guía práctica de medición.
Vienen más estudios — replicaciones a lo largo de categorías y mercados. Preguntas, correcciones y pedidos de replicación: [email protected].