Corpus fallido a exitoso
Severidad: Importante
Audiencia: operadores y desarrolladores. Aplica al entender como Smart Mibizum decide que queries analizar.
El problema
¿Que queries manda el aprendizaje IA al modelo para que aprenda sinónimos? Si pasamos "todas las búsquedas sin resultados" del día, generamos ruido masivo: queries azarosas, búsquedas progresivas (a, ac, ace, aceit...), recetas pegadas, intentos de SKU sin sentido. El modelo malgasta tokens en ruido y propone sinónimos pobres.
La regla
TIP
La mejor señal de typo aprendible es el patrón intento fallido a exitoso en la misma sesión:
Un cliente busca
X(0 resultados), reescribe aY(con resultados) dentro de N minutos en la misma sesión.
El aprendizaje IA usa este corpus como entrada principal. Es mucho más fiable que mandar las "0-results a ciegas" porque ya hay confirmación humana de que queria decir el cliente: el mismo se corrigio.
Por qué
- Señal confirmada por el cliente: si reescribio de
caguacateaaguacatey encontro lo que buscaba, sabemos que el intento original era un typo del segundo, no una búsqueda exotica abandonada. - Ratio señal/ruido alto: en una tienda real, sobre ~66.000 búsquedas en 22 días salen ~30 pares fallido-exitoso por día. Es el 0.3% del log de 0-results, pero el 80% de los typos aprendibles.
- Anonimización trivial: el modelo solo necesita el par
(failed, rescue). Nunca se le envia sessión ID, IP, customer ID ni timestamp. Privacidad por diseño. - Coste controlado: pocos pares = pocos tokens = coste anual estimado bajo (1-15 USD/año por tienda dependiendo del modelo IA elegido).
Ejemplos del corpus real
Estos son pares detectados en una tienda real un día cualquiera:
| Failed | Rescue | Confidence | Razón (Smart) |
|---|---|---|---|
bisulfiiit | bisulfiit | 0.93 | Letra repetida (typo de teclado) |
sodiumpca | sodium pca | 0.88 | Falta espacio; producto INCI |
tensoactius | tensioactius | 0.82 | Falta una letra |
bamboo | bambu | 0.70 | Cambio de idioma inglés a castellano |
mant ca dekarite | manteca dekarite | 0.78 | Espacio extra y falta letra |
previoti | prebioti | 0.75 | Letras intercambiadas (typo) |
Para merchants
El aprendizaje IA observa como se corrigen los clientes a si mismos en tu tienda. Cuando alguien busca una palabra, no encuentra nada, y en la misma sesión reescribe a otra palabra con resultados, Mibizum lo anota como un typo candidato. Cada noche revisa esos candidatos y los aprende automáticamente (en modo auto) o te los propone para aprobar (en modo hybrid).
Cuanto más tráfico tenga tu tienda, más rápido aprende. Con pocas sesiones al día, el aprendizaje sera conservador (espera a tener varias confirmaciones del mismo typo antes de aplicarlo). Esto se configura desde el panel en Ajustes > Smart > Sesiones mínimas.
Anti-patrones
DANGER
No pases todas las 0-results al modelo IA. El coste explota, el ratio señal/ruido cae. El modelo descarta el 90% como ruido, gastando tokens en analizar lo que ya sabias que era basura.
DANGER
No uses solo similitud textual (Levenshtein) sin ventana de sesión. Falsos positivos: aceite y aceituna son similares pero no es typo. La señal "el cliente se corrigio a si mismo" filtra esto.
DANGER
No uses ventana temporal muy ancha (1h). Captura ruido (cliente cierra sesión, vuelve más tarde con otra intención). 5 minutos cubre el 95% de las correcciones reales.