← Todos los artículos

La canibalización que Ahrefs no puede ver

· 3 min de lectura · Autor Mikhail Kuzmitskii

productsemanticscannibalization

Ver como Markdown ↗

La canibalización que Ahrefs no puede ver

En resumen: las herramientas clásicas contra duplicados comparan palabras. Pero dos páginas pueden competir por significado sin compartir palabras (paráfrasis), o una página puede cubrir el tema de otra con tanta profundidad que le arrebata sus citas. Esto lo detectamos con embeddings.

Dónde el enfoque léxico se queda ciego

Los shingles y la coincidencia de palabras encuentran bien los duplicados textuales. Pero:

  • Paráfrasis — mismo significado, palabras distintas → similitud léxica ≈ 0, y sin embargo la competencia por una misma intención es real.
  • Sombra temática — la página A apunta a la consulta X, pero su cuerpo cubre el tema Y tan bien que empieza a competir con la página B (la construida para Y) por la relevancia de Y.

Ninguno de los dos es visible para una herramienta que solo mira la coincidencia de cadenas de texto.

Lo que construimos — tres auditorías semánticas

Las tres miden la cercanía en el espacio vectorial (agnósticas al proveedor: embeddings de Voyage / OpenAI / locales; los vectores se cachean).

  • dup-scan --semantic — pares de páginas con coseno alto que el pase léxico no detectó (paráfrasis → MERGE/301).
  • entity-shadow — canibalización latente: A “ensombrece” a B.
  • link-equity --semanticsiteRadius (dispersión alrededor del centroide del sitio), valores atípicos semánticamente fuera de tema, y huérfanos por brecha semántica (una página lejana en significado de todas las demás).

Cómo funciona entity-shadow

Lo que importa aquí no es la “similitud en general”, sino la dirección. Para cada página incrustamos por separado su PRIMARY (target_keyword + título) y su BODY (cuerpo). La página A ensombrece a B cuando:

  1. cosine(A.body, B.primary) es alto (el cuerpo de A cubre el tema de B);
  2. cosine(A.primary, B.primary) es bajo (A reclama un tema distinto);
  3. la brecha entre ambos es ≥ un umbral.

La brecha es la señal: un cuerpo largo frente a una keyword precisa produce un coseno moderado, así que la similitud absoluta no discrimina — pero la diferencia cuerpo-vs-keyword sí lo hace.

En qué se diferencia de un dup-scan normal

  • dup-scan (léxico) → duplicados textuales / casi textuales.
  • dup-scan —semantic → paráfrasis.
  • entity-shadow → A reclama el tema X pero le roba a B las citas del tema Y (no es un duplicado en absoluto).
  • canibalización de intención en cocoon → dos spokes reparten una intención por metadatos.

Qué hacer al respecto

  • Duplicado/paráfrasis → fusionar (301) en la versión más fuerte.
  • Sombra → diferenciar: acotar el cuerpo de A a su tema X, y darle la cobertura de Y a la página B (y enlazar hacia ella).

En resumen

  • El enfoque léxico detecta lo textual; el significado y la “sombra” — no.
  • Los embeddings detectan la paráfrasis (dup-scan --semantic) y la canibalización latente (entity-shadow).
  • entity-shadow mira la brecha cuerpo-vs-keyword, no la similitud absoluta.
  • Solución: duplicado → fusionar; sombra → diferenciar.

Fuentes

  • Las propias auditorías semánticas de seo·matrix (dup-scan --semantic, entity-shadow, link-equity --semantic), calibradas sobre corpus reales.
  • Por qué el significado le gana a las palabras en la recuperación por IA: las respuestas se ensamblan a partir de pasajes en el espacio de embeddings — US v. Google (2025) sobre FastSearch/RankEmbed, y nuestro análisis SEO vs GEO.

Preguntas frecuentes

¿En qué se diferencia la canibalización semántica de la clásica?

Las herramientas léxicas comparan palabras. Pero dos páginas pueden competir por significado aunque no compartan ninguna palabra — eso solo es visible en el espacio de embeddings, no mediante la coincidencia de keywords.

¿Cómo la detectan?

Con tres auditorías basadas en embeddings: dup-scan (casi duplicados), entity-shadow (una página que ensombrece la entidad objetivo de otra) y siteRadius (qué tan ampliamente se dispersan los temas del sitio alrededor de su centro).

¿Qué hacen con los pares encontrados?

Según el tipo — fusionar, diferenciar claramente o enlazar entre sí. El informe agrupa los hallazgos por acción.

¿Te fue útil?
Lanza SEO/GEO con seo·matrix → o una solicitud sin Telegram →

Comentarios

Los comentarios se moderan.