Conector Sitemap
Descubre las URLs de tus páginas de detalle desde tu sitemap.xml y extrae un documento de cada una parseando su HTML.
Es la mejor opción cuando tu home/listado es una SPA (JavaScript puro, sin HTML útil) pero tus páginas de detalle sí tienen SSR/prerender (el caso típico de muchos portales de eventos e inmobiliarias).
Configuración
| Campo | Obligatorio | Descripción |
|---|---|---|
sitemapUrl | Sí | URL del sitemap.xml. Puede ser un sitemap_index (lo expandimos un nivel) o un urlset directo. |
urlFilter | No | Expresión regular que debe casar la URL. Útil para quedarte solo con las páginas de detalle. |
maxUrls | No | Cuántas URLs procesar (por defecto 12, máximo 500). En la previsualización del onboarding se usa un número pequeño. |
adapter | No | product, event o auto (por defecto). En auto decidimos el tipo mirando los datos estructurados de cada página. |
{
"sitemapUrl": "https://tu-web.com/sitemap_index.xml",
"urlFilter": "/producto/",
"maxUrls": 200,
"adapter": "product"
}Cómo extrae cada página
Para cada URL descargada, el adaptador intenta, en cascada:
- Datos estructurados — JSON-LD, microdata, RDFa o microformatos (Schema.org
Product/Event…). Ver Mapeo de campos. - Open Graph —
og:title,og:image,product:price:amount… - Heurística —
h1, imagen principal y zona de precio.
Con adapter: "auto", si la página declara un Product lo tratamos como producto (precio, stock, oferta); si declara un Event, como evento (fecha, ubicación). Las señales de disponibilidad y oferta se traducen a las badges del sistema (agotado, en oferta…).
Buenas prácticas
- Usa
urlFilterpara no rastrear categorías, etiquetas o páginas de autor. - Si tu sitemap es un índice enorme, empieza con un
maxUrlsbajo y sube cuando veas que la extracción es correcta en la previsualización del onboarding. - Una página inaccesible no rompe la sincronización: se salta y seguimos.
Frecuencia
Por defecto se re-sincroniza cada 12 horas. Los sitemaps cambian poco, así que rara vez necesitarás más. Ver Programación y planes.