¿Tienes una web de más de 100k URLs? ¿Quieres una demo de OnCrawl junto con auditoría de SEO Técnico gratis de tu web? Rellena el siguiente formulario y evaluaré tu propuesta personalmente.
Personalmente me gusta decir que OnCrawl es «un screaming SEO Frog» en la nube con cientos de filtros y análisis preconfigurados. Dicho de otra manera es una herramienta que permite ahorrar muchísimo tiempo a la hora de cruzar datos de crawling, análisis de LOGs, backlinks de Majestic SEO junto con con los de Google Search Console o Google Analytics.
Como dicen por ahí que una imagen vale más que mil palabras, un vídeo más que mil imágenes:
Cuando contratemos OnCrawl nos encontraremos con estas partes dentro de la herramienta:
Crawl Analysis
Simplemente rastrea el sitio. El crawler accede a la home de tu web y va siguiendo todos y cada uno de los enlaces hasta que llega hasta el último. La única limitación es 50 niveles de profundidad o las URLs que tengas contratadas en tu plan. También puede seguir URLs contenidas en un sitemap o empezar el rastreo en un listado dado en la configuración. Ojo, únicamente seguirá enlaces dentro de hrefs. En próximas versiones se espera que se pueda configurar el crawler para decidir si se siguen o no destinos de canonicals, redirecciones, hreflangs, alternates, nofollows, etc .
Indexabilidad
Ofrecerá resultados sobre páginas indexables, sitemaps, canonicals, robots.txt, hreflangs, alternate mobile… Ojo, los datos agregados ofrecen muchísima información, pero lo verdaderamente interesante es cuando se trata información segmentada. Una de las tareas más importantes que hay que hacer para sacarle rendimiento a este informe es precisamente segmentar la web en grupos de URLs. Podemos segmentar en base a URL (esta forma de hacerlo es totalmente retroactivo) o usando la capacidad de Scraping, dicho de otro modo en base a «cosas dentro del HTML». Al igual que la funcionalidad de buscar en el código fuente de Screaming, es algo que debemos configurar ANTES del rastreo.
Link Flow
Una parte fundamental del análisis de la arquitectura de la información. Hay una pregunta sencilla, ¿Son nuestras páginas más importantes las que más enlaces reciben? otra un poquito más complicada ¿los reciben desde los clústers que deben recibirlos? Ambas se pueden responder de forma muy fácil con el la métrica InRank (una especie de page rank propio de la herramienta que tiene en cuenta unas cuantas cosas más para evaluar la calidad de un link) y el informe LinkFlow en base a los grupos de URLs que hayas predefinido.
Contenido
Una de las partes más interesantes de la herramienta y quizá la que menos podríamos trabajar con crawlers en local como Screaming SEO Frog. Herramientas que detecten el contenido duplicado hay muchas, pero OnCrawl va un pasito más allá, identifica clusters de información en base a % de duplicidad y valora los canonicals de cada una de las URLs para ver si el canonical «soluciona» el duplicado. De ahí que en los informes sobre duplicados tengamos obtengamos diferencias entre URLs con contenido duplicado cuyo canonical no apunta a otra URL del clister de duplicidades vs otras donde si lo hace. Estas últimas nos las marca de color naranja, a diferencia del rojo (#fail) o verde (#ok)
Payload
Se trata de un informe de velocidad y rendimiento de la web. A mi modo ver, se queda corto, únicamente sirve para ver qué zonas, secciones o tipología de contenidos cargan más rápido o más lento. Pero lo verdaderamente interesante será cuando puedan implementar tiempos de renderizado sobre las nuevas tendencias en diseño y desarrollo web.
Regex útiles para OnCrawl
OnCrawl usa un tipo de Expresiones regulares basada en Lucene. En este post simplemente quería compartir varias de las regex que uso habitualmente con la herramienta por si os pudiesen ser de ayuda.
- Encontrar caracteres extendidos: [^(a-zA-Z-0-9—-\/)]
- Un directorio SIN slash final: [a-zA-Z-0-9—-]+?
- Un directorio CON slash final: [a-zA-Z-0-9—-]+?/
- Y así podemos ir concatenando… [a-zA-Z-0-9—-]+?/[a-zA-Z-0-9—-]+? o incluso [a-zA-Z-0-9—-]+?/usuario/pepe/[a-zA-Z-0-9—-]+? etc
Google Search Console
La forma más inexacta pero a su vez menos proclive a fallos. Sencillamente falla poco porque no hay lugar a error humano, aquí no se puede olvidar meter el ga.js ni meterlo más veces de la cuenta. No hay que dar de alta la web en ningún sitio, sencillamente si Google envía tráfico a un dominio, estos clicks se recogen de forma aproximada en Google Search Console. No es necesario que hayas verificado tu web para que se recojan estos datos, verificarla simplemente sirve para poder acceder a ellos, pero los datos ahí están.
Cuenta con la ventaja adicional de que contabilizan (o deberían) absolutamente todo el tráfico que llega de Google a tu web. Especialmente sirve para salir de dudas en casos de implementaciones donde el tema de las duplicidades de cookie entre la vista normal HTML y la vista AMP no esté nada claro. Hagas lo que hagas con tus tags de medición JS, Google Search Console siempre estará en «modo shadow» recogiendo datos por su cuenta. Ahora es cuestión simplemente de que cada vez sea más y más preciso.
Es más, en instalaciones donde los compañeros de medición digital hayan tenido la genial idea de no recoger la variable «url física» donde corresponde en una instalación o marcado por defecto, será la única manera de cruzar con OnCrawl los datos de URLs activas, posicionadas o con tráfico SEO. Nunca falla, si tienes contratada la opción de integrar los datos de Search Console, siempre vas a poder cruzar todos los informes de OnCrawl con datos de tráfico y URLs.
Hits de usuarios con referrer «*google*» u otros LLMs
Finalmente tenemos los queridísimos LOGs. Aquí sí que re recoge todo, absolutamente todo, cualquier petición a nuestro httpd, ya sea humana o de bot que tenga una respuesta por parte de nuestra máquina, queda reflejada en los LOGs. Por un lado recogemos datos del propio Googlebot pero también son valiosísimos los datos de usuarios con referrer Google. Podríamos interpretar que es un hit o visita atribuible a SEO, sin embargo vemos que los datos a veces no coinciden con los de Search Console o Google Analytics, ¿por qué?
En primer lugar, Analytics recoge sesiones, cookies. Search Console recoge Clicks, si entras 15 veces en un ratio de 20 minutos de Google a una web, habrás generado 15 clicks pero una única sesión. Sin embargo, esto normalmente apenas supone discrepancia en los datos.
Las discrepancias mayores se producen en el caso de instalaciones de AMP activas. Existe un patrón de consumo de nuestros contenidos que simplemente consume la versión cacheada en los servidores de Google y que nunca hará un hit a nuestra máquina local, no veremos nada en nuestros logs, únicamente se recogerá en Search Console y en Google Analytics en caso de que tengamos marcada la vista AMP.
OnCrawl Data Scraping
Como bien sabéis todos los que usáis OnCrawl, una de las tareas más importantes a las que nos tenemos que enfrentar antes del empezar el análisis de cualquier proyecto web es precisamente segmentar bien la información, en el caso de un análisis SEO, segmentar bien las URLs.
Podemos hacerlo de 2 formas. La primera; con regex en base a «cosas que contengan o no contengan las URLs. De esta manera podremos tantos grupos como queramos incluso de forma retroactiva, es decir, podremos configurar grupos incluso después de rastrear el sitio y sin necesidad de volver a rastrearlo.
La segunda fórmula requiere pensar qué es lo que queremos segmentar antes de lanzar el crawler. Se trata del Scraping de Custom Fields, o dicho de otra forma, se trata de segmentar o agrupar URLs en base a «cosa o trozos de código que aparezcan en su HTML». La fórmula más sencilla es un regex que simplemente verifica si existe o no existe un determinado trozo de código. Pero lo verdaderamente interesante viene con xpath, donde puedes colocar variables y categorizar URLs de forma dinámica.
Lo que vemos en el ejemplo anterior es un xpath que recoge lo que tiene la variable article:tag de un post en wordpress. De esta manera una vez dentro de la herramienta y habiendo rastreado previamente el sitio entero previa configuración de xpaths, podremos hacer grupos de URLs en base a los valores recogidos en esa variable. A continuación os dejo los xpaths necesarios para categorizar contenido de un wordpress para que solo tengáis que copiar, pegar y rastrear. Ojo que algunos de ellos puede que sean de Yoast y no de un WP limpio.
- tag: string(//meta[@property=»article:tag»]/@content)
- categoria: string(//meta[@property=»article:section»]/@content)
- published_time: string(//meta[@property=»article:published_time»]/@content)
- modified_time: string(//meta[@property=»article:modified_time»]/@content)
- autor: string(//meta[@property=»article:author»]/@content)
- tipo de contenido: string(//meta[@property=»og:type»]/@content)
- Extraer el ID o identifier, muy útil para trabajar con WP All Import o WP All Export: //head/link[@rel=’shortlink’]/@href
Otros regex útiles para SEO
Para contar el nº de directorios:
1 directorio: /[a-zA-Z-0-9—-]+?/
2 directorios: /[a-zA-Z-0-9—-]+?/[a-zA-Z-0-9—-]+?/
etc
jSON para OnCrawl
Fechas móviles
A continuación os dejo con un JSON para segmentar por artículos publicados en fechas móviles o variables, mes -1, trimestre -1, etc.
[
{
"color": "#F1C8AE",
"name": "current month",
"oql": {
"field": [
"custom_datePublished",
"between",
[
"now/M",
"now"
]
]
}
},
{
"color": "#E69F9E",
"name": "month -1 ",
"oql": {
"field": [
"custom_datePublished",
"between",
[
"now-1M/M",
"now/M"
]
]
}
},
{
"color": "#DC778E",
"name": "month - 2",
"oql": {
"field": [
"custom_datePublished",
"between",
[
"now-2M/M",
"now-1M/M"
]
]
}
},
{
"color": "#C65787",
"name": "month -3",
"oql": {
"field": [
"custom_datePublished",
"between",
[
"now-3M/M",
"now-2M/M"
]
]
}
},
{
"color": "#9B448B",
"name": "quarter -1",
"oql": {
"field": [
"custom_datePublished",
"between",
[
"now-6M/M",
"now-3M/M"
]
]
}
},
{
"color": "#703290",
"name": "quarter -2",
"oql": {
"field": [
"custom_datePublished",
"between",
[
"now-9M/M",
"now-6M/M"
]
]
}
},
{
"color": "#32164B",
"name": "quarter -3",
"oql": {
"field": [
"custom_datePublished",
"between",
[
"now-12M/M",
"now-9M/M"
]
]
}
},
{
"color": "#333333",
"name": "no date",
"oql": {
"field": [
"custom_datePublished",
"has_no_value",
""
]
}
}
]OnCrawl Labs
OnCrawl ha lanzado una nueva plataforma de I + D llamada OnCrawl Labs, un laboratorio dedicado a SEO, ciencia de datos y aprendizaje automático. Desarrollado en Google Colab y usando los lenguajes Python y R, OnCrawl Labs ofrece una cartera de algoritmos de aprendizaje para ayudar a expertos SEO y ciencia de datos a predecir su rendimiento SEO.
Entre otras cosas se puede solicitar a Google la indexación en tiempo real de todas aquellas páginas que no estén indexadas. Se trata de una característica especialmente importante para sitios web medios y grandes que evolucionan con frecuencia, particularmente comercio electrónico, clasificados y editores en línea, donde la visibilidad de búsqueda rápida de las páginas nuevas afectan directamente al negocio. Los principales motores de búsqueda proporcionan medios de forma manual enviando páginas para indexar. Sin embargo, en los casos de uso descritos anteriormente, esto puede requerir recursos humanos de SEO para mantener extensas listas diarias de páginas creadas, a veces automáticamente, por equipos de producción y contenido. Obtener una lista completa puede ser difícil. Además, dependiendo del número de páginas nuevas, el envío manual a menudo no es una opción factible.
OnCrawl Labs ofrece funciones de indexación en tiempo real para automatizar la creación de una lista de nuevas URL basado en datos de rastreo y para automatizar el envío por lotes de la lista de nuevas URL para indexación por buscadores. Los SEO ahora pueden enviar URL nuevas y de máxima prioridad a Google y Bing en tiempo real usando su API para indexación o descubrimiento, tan pronto como sean descubiertos por análisis de rastreo.
«OnCrawl lanza su laboratorio abierto con modelos explicados, reproducibles y documentados de Data Science con el objetivo de proporcionar un enfoque personalizado basado en sus datos SEO confiables y verificados. El laboratorio está abierto a todos los sitios, independientemente de su tamaño: nuestra API siempre ha sido un método preferido para usuarios tanto de sitios pequeños
como medianos, pero ahora ofrecemos exportaciones asincrónicas para sitios de gran volumen. OnCrawl Labs ofrece una oportunidad para probar y aprender y también nos permite priorizar nuestra hoja de ruta al integrar los modelos más utilizados en nuestra plataforma.
Usando inteligencia artificial para generar contenido cualitativo
Un buen SEO requiere un buen contenido, pero la creación de contenido es cara. La generación automatizada de texto puede ser útil para SEO en una serie de casos. Cuando la generación de texto es altamente cualitativa, se puede usar para la creación de anclas para enlaces internos, variantes de etiquetas de título o variantes de meta descripciones por ejemplo.
La generación de texto menos cualitativa también se puede utilizar como guía para ayudar a los SEO a escribir contenido para una consulta. Si bien los modelos de generación de texto se han vuelto cada vez más fáciles de encontrar en inglés, los idiomas que no son inglés han tenido problemas para encontrar un método cualitativo.
OnCrawl Labs ofrece un método basado en el modelo GPT-2 que produce con éxito contenido cualitativo en idiomas distintos del inglés y se probó ampliamente en francés. Los SEO son ahora puede acceder a un modelo independiente del idioma para la generación de texto que puede usarse para SEO.
Detectar sobre y bajo rendimiento durante las auditorías de SEO
Uno de los propósitos de una auditoría SEO es encontrar métricas o KPI donde el sitio web no funciona como esperado. Estas métricas, como la velocidad de la página, el número de impresiones en un SERP de Google o el número de enlaces internos que apuntan a una URL varía naturalmente de un rastreo a otro. La detección de anomalías le permite saber si un cambio está dentro del rango «normal» para el sitio web, o si el cambio representa un evento inusual que debe abordarse.
El uso del aprendizaje automático para encontrar anomalías reveladas por los rastreos también significa que puede tomar eventos estacionales en cuenta, junto con cambios graduales en el sitio web con el tiempo. Examinar las anomalías también puede revelar si ciertas métricas son clave para el SEO de un sitio web, y que solo son incidentales.
OnCrawl Labs ahora ofrece la posibilidad de usar múltiples rastreos con el mismo perfil de rastreo para establecer una línea de base para lo que constituyen valores normales en un sitio web dado para métricas seleccionadas. Pero también identifica cuándo un análisis de rastreo produce resultados que están fuera del rango normal de valores para estas métricas.