Investigación de GenSig #1 · Julio 2026
TL;DR. Hicimos las mismas preguntas con intención de compra 2.500 veces en cinco configuraciones de API, y 30 veces a mano en las apps de consumo (ChatGPT web y Gemini web), para una categoría: plataformas de inversión en Argentina. Tres hallazgos:
Si medís la "visibilidad en IA" de una marca — como hace una categoría creciente de herramientas — estos resultados dicen que el cómo cambia la respuesta más de lo que la mayoría de los dashboards admite.
Cada vez más compradores empiezan su investigación de producto dentro de los asistentes de IA, y surgió una categoría de herramientas para medir si un asistente recomienda tu marca. Estas herramientas se dividen en dos bandos: las que consultan APIs del modelo, y las que scrapean las apps de chat de consumo. El bando del scraping argumenta que las APIs no reflejan lo que los usuarios realmente ven. El bando de las APIs argumenta que el scraping es frágil e irreproducible.
Ambos bandos hacen afirmaciones empíricas. No pudimos encontrar datos publicados que las prueben — así que corrimos el experimento.
Categoría y prompts. Una categoría con intención de compra: plataformas de inversión en Argentina (elegida por ser un mercado local vivo con entrantes que se mueven rápido). Cinco prompts congelados en español que parafrasean la misma intención (mejores plataformas / app para principiantes / acciones y CEDEARs / broker online / mejores plataformas). Los prompts no contienen nombres de marcas.
Condiciones de API (100 corridas por prompt por condición = 500 por condición, N=2.500):
| Condición | Qué es |
|---|---|
bare |
gpt-4o-mini, temperatura por defecto — la medición ingenua |
bare_t0 |
igual, temperatura 0 |
persona |
+ system prompt "le estás respondiendo a una persona que vive en Argentina" |
search |
gpt-4o-mini-search-preview (búsqueda web integrada) |
grounded |
gemini-flash-latest con grounding de Google Search |
Ancla de consumo. 30 corridas manuales en las apps reales: 5 prompts × 3 pasadas en días distintos × 2 superficies (ChatGPT web, Gemini web), desde una cuenta de consumidor común en una conexión residencial argentina, un chat nuevo por prompt, solo la primera respuesta.
Medición. Detección de marcas por diccionario de alias congelado (25 marcas). Métricas preespecificadas antes de correr: tasa de mención con intervalos de Wilson del 95%; kappa de Fleiss entre corridas (corridas como evaluadores, marcas como ítems binarios); Jaccard medio por pares del conjunto top-3; W de Kendall (corregido por empates) sobre los rankings de marcas núcleo; ρ de Spearman entre el vector de tasa de mención de cada condición y el de cada ancla.
Costo. Menos de US$10 en créditos de API. Cada respuesta cruda se archiva como JSONL.
A lo largo de 15 corridas de navegador por superficie, ChatGPT web recomendó las mismas cinco plataformas con consistencia casi perfecta: InvertirOnline (15/15), Balanz (15/15), Cocos (14/15), PPI (11/15), Bull Market (11/15). Gemini web comparte los líderes (Balanz, InvertirOnline 15/15) con una cola más amplia de billeteras fintech. Sea lo que sea que "la IA recomienda" significa para un usuario, en esta categoría no es ruido.

La API pelada (n=500) recuperó InvertirOnline (79%) y Balanz (44%) — pero Cocos, la recomendación #3 del navegador, aparece en menos del 1% de las corridas de API pelada. PPI y Bull Market apenas figuran. Mientras tanto, la API pelada infla Rava (61%) y eToro (43%), que los navegadores mencionan en ≤2 de 15 corridas.
Correlación de rangos con el ancla de ChatGPT web: ρ = 0.23. Solapamiento del top-5: 25%.
Nuestra interpretación: el modelo pelado responde desde la memoria paramétrica, que va atrás del mercado. El ascenso de Cocos entre los consumidores es reciente; el producto de navegador, que busca en la web live, lo refleja — los pesos del modelo no. Un prompt de persona geográfica ayudó solo marginalmente (ρ = 0.30).

A temperatura por defecto, el conjunto top-3 de la API pelada es volátil (Jaccard medio por pares 0.36; top-3 modal en solo el 10% de las corridas). A temperatura 0 se vuelve muy repetible (Jaccard 0.92, modal 84%) — y su correlación con el ancla de navegador cae a ρ ≈ −0.04 / 0.10. Temperatura 0 te da una medición precisa y repetible del prior desactualizado del modelo.
Esto importa porque a los "números consistentes" muchas veces se los trata como evidencia de calidad de medición. Acá, la configuración más consistente fue la menos fiel.

La fidelidad, en otras palabras, es específica de la superficie: una API-con-búsqueda aproxima el producto de consumo de su propia familia. No existe un único "lo que dice la IA" — está lo que dice ChatGPT y lo que dice Gemini, y cada uno se mide mejor por su propio canal aumentado con búsqueda.
Una categoría, un mercado, una ventana de tiempo (todas las corridas de API en horas; el ancla a lo largo de 3 días). El ancla de consumo son 15 corridas por superficie desde una sola cuenta e IP — suficiente para establecer el núcleo estable, no tasas de grano fino. La detección de marcas es por diccionario (alias congelados antes de correr). Versiones de modelos: gpt-4o-mini, gpt-4o-mini-search-preview, gemini-flash-latest, julio 2026. Los resultados pueden diferir por categoría (un piloto en billeteras argentinas mostró brechas de fidelidad de API pelada menores — la recencia de los entrantes de la categoría parece importar), por mercado, y a medida que los proveedores actualizan modelos. Planeamos replicaciones a lo largo de categorías como Research #2.
Descargá el dataset completo y el código (1.1 MB, .zip) —
el material crudo completo detrás de cada número de este artículo: 2.500 respuestas de
API más las 30 corridas ancla en apps de consumo (JSONL + CSV), los prompts congelados,
el diccionario de alias de 25 marcas, el runner reanudable y el script de análisis.
analysis.py recalcula cada figura y tabla offline, sin claves de
API. Las herramientas basadas en scraping no pueden compartir su equivalente en absoluto — sus datos crudos
incorporan recolección que viola los ToS. La reproducibilidad es el punto.
GenSig (gensig.app) mide la visibilidad de marca en las respuestas de IA usando muestreo repetido de API con intervalos de confianza — la metodología que este estudio valida y somete a estrés. Preguntas, replicaciones y correcciones son bienvenidas: [email protected].