Investigación de GenSig #1 · Julio 2026 · Descargá el PDF

¿Qué tan estables son las recomendaciones de marca de la IA? Un estudio de reproducibilidad y fidelidad

Investigación de GenSig #1 · Julio 2026

TL;DR. Hicimos las mismas preguntas con intención de compra 2.500 veces en cinco configuraciones de API, y 30 veces a mano en las apps de consumo (ChatGPT web y Gemini web), para una categoría: plataformas de inversión en Argentina. Tres hallazgos:

  1. La API pelada del LLM no mide lo que ven los usuarios — mide la memoria del modelo. Se perdió 3 de las 5 plataformas que las sesiones reales de navegador recomiendan de forma consistente, e infló dos que los navegadores casi nunca mencionan.
  2. La reproducibilidad y la fidelidad son ejes independientes. Temperatura 0 hizo las respuestas muy repetibles — del conjunto de marcas equivocado (lo más reproducible, lo menos fiel). El determinismo no es exactitud.
  3. Las APIs aumentadas con búsqueda reflejan su propia superficie de consumo. La variante de búsqueda de OpenAI reprodujo el top-5 de ChatGPT web exactamente; Gemini con grounding fue el mejor espejo de Gemini web y recuperó todas las marcas núcleo que la API pelada se perdió.

Si medís la "visibilidad en IA" de una marca — como hace una categoría creciente de herramientas — estos resultados dicen que el cómo cambia la respuesta más de lo que la mayoría de los dashboards admite.


Por qué esto importa

Cada vez más compradores empiezan su investigación de producto dentro de los asistentes de IA, y surgió una categoría de herramientas para medir si un asistente recomienda tu marca. Estas herramientas se dividen en dos bandos: las que consultan APIs del modelo, y las que scrapean las apps de chat de consumo. El bando del scraping argumenta que las APIs no reflejan lo que los usuarios realmente ven. El bando de las APIs argumenta que el scraping es frágil e irreproducible.

Ambos bandos hacen afirmaciones empíricas. No pudimos encontrar datos publicados que las prueben — así que corrimos el experimento.

Método

Categoría y prompts. Una categoría con intención de compra: plataformas de inversión en Argentina (elegida por ser un mercado local vivo con entrantes que se mueven rápido). Cinco prompts congelados en español que parafrasean la misma intención (mejores plataformas / app para principiantes / acciones y CEDEARs / broker online / mejores plataformas). Los prompts no contienen nombres de marcas.

Condiciones de API (100 corridas por prompt por condición = 500 por condición, N=2.500):

Condición Qué es
bare gpt-4o-mini, temperatura por defecto — la medición ingenua
bare_t0 igual, temperatura 0
persona + system prompt "le estás respondiendo a una persona que vive en Argentina"
search gpt-4o-mini-search-preview (búsqueda web integrada)
grounded gemini-flash-latest con grounding de Google Search

Ancla de consumo. 30 corridas manuales en las apps reales: 5 prompts × 3 pasadas en días distintos × 2 superficies (ChatGPT web, Gemini web), desde una cuenta de consumidor común en una conexión residencial argentina, un chat nuevo por prompt, solo la primera respuesta.

Medición. Detección de marcas por diccionario de alias congelado (25 marcas). Métricas preespecificadas antes de correr: tasa de mención con intervalos de Wilson del 95%; kappa de Fleiss entre corridas (corridas como evaluadores, marcas como ítems binarios); Jaccard medio por pares del conjunto top-3; W de Kendall (corregido por empates) sobre los rankings de marcas núcleo; ρ de Spearman entre el vector de tasa de mención de cada condición y el de cada ancla.

Costo. Menos de US$10 en créditos de API. Cada respuesta cruda se archiva como JSONL.

Resultados

1. Las superficies de consumo coinciden en un núcleo estable

A lo largo de 15 corridas de navegador por superficie, ChatGPT web recomendó las mismas cinco plataformas con consistencia casi perfecta: InvertirOnline (15/15), Balanz (15/15), Cocos (14/15), PPI (11/15), Bull Market (11/15). Gemini web comparte los líderes (Balanz, InvertirOnline 15/15) con una cola más amplia de billeteras fintech. Sea lo que sea que "la IA recomienda" significa para un usuario, en esta categoría no es ruido.

2. La API pelada cuenta una historia distinta a la del navegador

Fig 1 — tasas de mención, navegador vs API

La API pelada (n=500) recuperó InvertirOnline (79%) y Balanz (44%) — pero Cocos, la recomendación #3 del navegador, aparece en menos del 1% de las corridas de API pelada. PPI y Bull Market apenas figuran. Mientras tanto, la API pelada infla Rava (61%) y eToro (43%), que los navegadores mencionan en ≤2 de 15 corridas.

Correlación de rangos con el ancla de ChatGPT web: ρ = 0.23. Solapamiento del top-5: 25%.

Nuestra interpretación: el modelo pelado responde desde la memoria paramétrica, que va atrás del mercado. El ascenso de Cocos entre los consumidores es reciente; el producto de navegador, que busca en la web live, lo refleja — los pesos del modelo no. Un prompt de persona geográfica ayudó solo marginalmente (ρ = 0.30).

3. El determinismo no es exactitud

Fig 3 — estabilidad por condición

A temperatura por defecto, el conjunto top-3 de la API pelada es volátil (Jaccard medio por pares 0.36; top-3 modal en solo el 10% de las corridas). A temperatura 0 se vuelve muy repetible (Jaccard 0.92, modal 84%) — y su correlación con el ancla de navegador cae a ρ ≈ −0.04 / 0.10. Temperatura 0 te da una medición precisa y repetible del prior desactualizado del modelo.

Esto importa porque a los "números consistentes" muchas veces se los trata como evidencia de calidad de medición. Acá, la configuración más consistente fue la menos fiel.

4. Las APIs aumentadas con búsqueda reflejan su propia superficie de consumo

Fig 2 — el cuadrante

La fidelidad, en otras palabras, es específica de la superficie: una API-con-búsqueda aproxima el producto de consumo de su propia familia. No existe un único "lo que dice la IA" — está lo que dice ChatGPT y lo que dice Gemini, y cada uno se mide mejor por su propio canal aumentado con búsqueda.

5. Dos observaciones de advertencia

Limitaciones

Una categoría, un mercado, una ventana de tiempo (todas las corridas de API en horas; el ancla a lo largo de 3 días). El ancla de consumo son 15 corridas por superficie desde una sola cuenta e IP — suficiente para establecer el núcleo estable, no tasas de grano fino. La detección de marcas es por diccionario (alias congelados antes de correr). Versiones de modelos: gpt-4o-mini, gpt-4o-mini-search-preview, gemini-flash-latest, julio 2026. Los resultados pueden diferir por categoría (un piloto en billeteras argentinas mostró brechas de fidelidad de API pelada menores — la recencia de los entrantes de la categoría parece importar), por mercado, y a medida que los proveedores actualizan modelos. Planeamos replicaciones a lo largo de categorías como Research #2.

Implicancias si medís la visibilidad en IA

  1. No midas con una API pelada y lo llames realidad. En esta categoría se pierde por completo a los entrantes recientes e infla los obsoletos.
  2. No confundas repetibilidad con exactitud. Los pipelines a temp-0 producen dashboards estables de la memoria del modelo, no de lo que ven los usuarios.
  3. Medí por superficie, por el canal aumentado con búsqueda de esa superficie. OpenAI-con-búsqueda para aproximar ChatGPT; Gemini-con-grounding para aproximar Gemini.
  4. Promedios sobre corridas repetidas, con intervalos — las mediciones de un solo tiro de un sistema estocástico son ruido con una interfaz.

Datos y código

Descargá el dataset completo y el código (1.1 MB, .zip) — el material crudo completo detrás de cada número de este artículo: 2.500 respuestas de API más las 30 corridas ancla en apps de consumo (JSONL + CSV), los prompts congelados, el diccionario de alias de 25 marcas, el runner reanudable y el script de análisis. analysis.py recalcula cada figura y tabla offline, sin claves de API. Las herramientas basadas en scraping no pueden compartir su equivalente en absoluto — sus datos crudos incorporan recolección que viola los ToS. La reproducibilidad es el punto.


GenSig (gensig.app) mide la visibilidad de marca en las respuestas de IA usando muestreo repetido de API con intervalos de confianza — la metodología que este estudio valida y somete a estrés. Preguntas, replicaciones y correcciones son bienvenidas: [email protected].