Investigación

¿Cómo medís lo que los asistentes de IA realmente recomiendan? Corremos los experimentos — métricas preespecificadas, intervalos de confianza, miles de respuestas archivadas — y publicamos lo que encontramos, incluidas las partes incómodas. La propia metodología de GenSig está construida sobre estos resultados.

Investigación de GenSig #1 · Julio 2026

¿Qué tan estables son las recomendaciones de marca de la IA?
Un estudio de reproducibilidad y fidelidad

Hicimos las mismas preguntas con intención de compra 2.500 veces en cinco configuraciones de API y 30 veces a mano en las apps de consumo reales (ChatGPT web, Gemini web). La API pelada del LLM se perdió 3 de las 5 marcas que las sesiones reales recomiendan de forma consistente; temperatura 0 hizo las respuestas muy repetibles — del conjunto de marcas equivocado; y cada API con grounding de búsqueda resultó reflejar su propia superficie de consumo.

ρ = 0.23API pelada vs lo que ChatGPT web realmente recomienda — la medición ingenua está casi sin correlación con la realidad
<1%de 500 corridas de API pelada mencionan la marca #3 del navegador — la memoria del modelo va atrás del mercado
J = 1.0la API de búsqueda de OpenAI reprodujo el top-5 de ChatGPT web exactamente — medí cada superficie por su propio canal live
Leé el estudio →

Cada estudio viene con sus datos crudos y código — descargá el dataset de Research #1 (2.500 respuestas de API + 30 corridas en apps de consumo, prompts, diccionario de marcas y código de análisis).

¿Nuevo en visibilidad en IA? Empezá acá: visibilidad de marca en IA — qué es, por qué importa y cómo medirla, después la guía práctica de medición.

Vienen más estudios — replicaciones a lo largo de categorías y mercados. Preguntas, correcciones y pedidos de replicación: [email protected].