# La canibalización que Ahrefs no puede ver

> Las herramientas léxicas comparan palabras. Pero dos páginas compiten por SIGNIFICADO — incluso sin palabras en común. Cómo detectamos la canibalización semántica con embeddings: dup-scan…

_Source: https://seomatrix.ai/ru/blog/semantic-cannibalization/ · Updated: 2026-06-26_

---

En resumen: las herramientas clásicas contra duplicados comparan **palabras**. Pero dos páginas pueden competir por **significado** sin compartir palabras (paráfrasis), o una página puede cubrir el tema de otra con tanta profundidad que le **arrebata** sus citas. Esto lo detectamos con embeddings.

## Dónde el enfoque léxico se queda ciego

Los shingles y la coincidencia de palabras encuentran bien los duplicados textuales. Pero:

- **Paráfrasis** — mismo significado, palabras distintas → similitud léxica ≈ 0, y sin embargo la competencia por una misma intención es real.
- **Sombra temática** — la página A apunta a la consulta X, pero su cuerpo cubre el tema Y tan bien que empieza a competir con la página B (la construida para Y) por la relevancia de Y.

Ninguno de los dos es visible para una herramienta que solo mira la coincidencia de cadenas de texto.

## Lo que construimos — tres auditorías semánticas

Las tres miden la cercanía en el espacio **vectorial** (agnósticas al proveedor: embeddings de Voyage / OpenAI / locales; los vectores se cachean).

- **`dup-scan --semantic`** — pares de páginas con coseno alto que el pase léxico no detectó (paráfrasis → MERGE/301).
- **`entity-shadow`** — canibalización latente: A "ensombrece" a B.
- **`link-equity --semantic`** — **siteRadius** (dispersión alrededor del centroide del sitio), valores atípicos semánticamente fuera de tema, y **huérfanos por brecha semántica** (una página lejana en significado de todas las demás).

## Cómo funciona entity-shadow

Lo que importa aquí no es la "similitud en general", sino la **dirección**. Para cada página incrustamos por separado su **PRIMARY** (target_keyword + título) y su **BODY** (cuerpo). La página **A ensombrece a B** cuando:

1. `cosine(A.body, B.primary)` es alto (el cuerpo de A cubre el tema de B);
2. `cosine(A.primary, B.primary)` es bajo (A reclama un tema distinto);
3. la **brecha** entre ambos es ≥ un umbral.

La brecha es la señal: un cuerpo largo frente a una keyword precisa produce un coseno moderado, así que la similitud absoluta no discrimina — pero la diferencia cuerpo-vs-keyword sí lo hace.

> **Calibrado sobre corpus reales** — Los umbrales no se fijaron a ojo: en un corpus real (fotografía, 86 artículos) la similitud cruzada llegaba como máximo a ~0.77, así que cambiamos a umbrales basados en la brecha (cross ≥ 0.45, primary < 0.65, gap ≥ 0.10) → ~4 pares razonables, ~5% de ruido.

## En qué se diferencia de un dup-scan normal

- **dup-scan (léxico)** → duplicados textuales / casi textuales.
- **dup-scan --semantic** → paráfrasis.
- **entity-shadow** → A reclama el tema X pero le roba a B las citas del tema Y (no es un duplicado en absoluto).
- **canibalización de intención en cocoon** → dos spokes reparten una intención por metadatos.

## Qué hacer al respecto

- Duplicado/paráfrasis → fusionar (301) en la versión más fuerte.
- Sombra → **diferenciar**: acotar el cuerpo de A a su tema X, y darle la cobertura de Y a la página B (y enlazar hacia ella).

## En resumen

- El enfoque léxico detecta lo textual; el significado y la "sombra" — no.
- Los embeddings detectan la paráfrasis (`dup-scan --semantic`) y la canibalización latente (`entity-shadow`).
- entity-shadow mira la brecha cuerpo-vs-keyword, no la similitud absoluta.
- Solución: duplicado → fusionar; sombra → diferenciar.

## Fuentes

- Las propias auditorías semánticas de seo·matrix (`dup-scan --semantic`, `entity-shadow`, `link-equity --semantic`), calibradas sobre corpus reales.
- Por qué el significado le gana a las palabras en la recuperación por IA: las respuestas se ensamblan a partir de pasajes en el espacio de embeddings — *US v. Google* (2025) sobre FastSearch/RankEmbed, y nuestro análisis [SEO vs GEO](/blog/seo-vs-geo-2026/).

## FAQ

### ¿En qué se diferencia la canibalización semántica de la clásica?

Las herramientas léxicas comparan palabras. Pero dos páginas pueden competir por significado aunque no compartan ninguna palabra — eso solo es visible en el espacio de embeddings, no mediante la coincidencia de keywords.

### ¿Cómo la detectan?

Con tres auditorías basadas en embeddings: dup-scan (casi duplicados), entity-shadow (una página que ensombrece la entidad objetivo de otra) y siteRadius (qué tan ampliamente se dispersan los temas del sitio alrededor de su centro).

### ¿Qué hacen con los pares encontrados?

Según el tipo — fusionar, diferenciar claramente o enlazar entre sí. El informe agrupa los hallazgos por acción.

