Home → Blog → Content Similarity Analyzer – Wykrywanie kanibalizacji treści na etapie briefu
Aplikacja
Content Similarity Analyzer – Wykrywanie kanibalizacji treści na etapie briefu
Spis treści
Zwiń▼
Słuchaj artykułuGoogle Wavenet2 min0:00
Naciśnij play, aby słuchać
Kanibalizacja słów kluczowych to powszechny problem w SEO, z którym zazwyczaj walczymy dopiero po zaindeksowaniu treści. A co gdyby rozwiązać ten problem zanim artykuł w ogóle powstanie?
Content Similarity Analyzer to autorskie narzędzie stworzone w Streamlit, które przenosi kontrolę jakości na sam początek procesu redakcyjnego. Aplikacja analizuje foldery z briefami contentowymi i wykrywa semantyczne duplikaty jeszcze przed zleceniem tekstu copywriterowi.
To idealne rozwiązanie przy budowaniu rozbudowanych map tematycznych (Topical Authority), gdzie granice między poszczególnymi artykułami często się zacierają.
Jak działa prewencyjna analiza treści?
Narzędzie nie opiera się na prostym dopasowaniu słów kluczowych, lecz wykorzystuje lokalny model językowy (SentenceTransformer(’paraphrase-multilingual-MiniLM-L12-v2′) do generowania embeddingów. Dzięki temu „rozumie” kontekst planowanych sekcji artykułu.
Proces analizy przebiega w kilku krokach:
- Import: Wczytanie folderu z briefami przygotowanymi w formacie Markdown.
- Segmentacja: Narzędzie dzieli każdy brief na logiczne bloki: nagłówki, sekcje „wiedza” (kontekst dla writera) oraz słowa kluczowe.
- Wektoryzacja: Każdy segment zamieniany jest na reprezentację wektorową.
- Porównanie: Algorytm porównuje wszystkie sekcje ze sobą („każdy z każdym”), szukając zbyt dużych podobieństw.
System oceniania ryzyka i raportowanie
Aplikacja błyskawicznie przetwarza setki sekcji (np. 150 sekcji w 30 sekund), generując przejrzysty raport z podziałem na poziomy zagrożenia kanibalizacją:
- 🔴 CRITICAL (≥90%): Treści niemal identyczne – wymagana natychmiastowa interwencja i zmiana struktury briefu.
- 🟡 WARNING (75-90%): Wysokie ryzyko powtórzeń merytorycznych.
- 🔵 INFO (60-75%): Tematy pokrewne, warto monitorować linkowanie wewnętrzne.
Szczegółowa analiza duplikatów
Największą siłą narzędzia jest podgląd konkretnych par (tzw. pairwise comparison). Jak widać na poniższych zrzutach, system zestawia ze sobą dwa briefy i wskazuje dokładnie, w których miejscach dochodzi do konfliktu.
Narzędzie analizuje nie tylko nagłówki (np. definicje SIEM vs SOC), ale także sekcje [CORE MESSAGE] oraz listy słów kluczowych. Dzięki temu możesz precyzyjnie zdecydować, czy połączyć dwa tematy w jeden, czy wyraźniej rozdzielić intencje artykułów.
Całość działa lokalnie, zapewniając szybkość i prywatność danych, pozwalając proaktywnie zarządzać spójnością content planu.
Link do repozytorium aplikacji Content Similarity Analyzer
🔗 https://github.com/maciusman/brief-nexus-analyze-similarity
Kanibalizacja słów kluczowych to powszechny problem w SEO, z którym zazwyczaj walczymy dopiero po zaindeksowaniu treści. A co gdyby rozwiązać ten problem zanim artykuł w ogóle powstanie?
Content Similarity Analyzer to autorskie narzędzie stworzone w Streamlit, które przenosi kontrolę jakości na sam początek procesu redakcyjnego. Aplikacja analizuje foldery z briefami contentowymi i wykrywa semantyczne duplikaty jeszcze przed zleceniem tekstu copywriterowi.
To idealne rozwiązanie przy budowaniu rozbudowanych map tematycznych (Topical Authority), gdzie granice między poszczególnymi artykułami często się zacierają.
Jak działa prewencyjna analiza treści?
Narzędzie nie opiera się na prostym dopasowaniu słów kluczowych, lecz wykorzystuje lokalny model językowy (SentenceTransformer(’paraphrase-multilingual-MiniLM-L12-v2′) do generowania embeddingów. Dzięki temu „rozumie” kontekst planowanych sekcji artykułu.
Proces analizy przebiega w kilku krokach:
Import: Wczytanie folderu z briefami przygotowanymi w formacie Markdown.
Segmentacja: Narzędzie dzieli każdy brief na logiczne bloki: nagłówki, sekcje „wiedza” (kontekst dla writera) oraz słowa kluczowe.
Wektoryzacja: Każdy segment zamieniany jest na reprezentację wektorową.
Porównanie: Algorytm porównuje wszystkie sekcje ze sobą („każdy z każdym”), szukając zbyt dużych podobieństw.
System oceniania ryzyka i raportowanie
Aplikacja błyskawicznie przetwarza setki sekcji (np. 150 sekcji w 30 sekund), generując przejrzysty raport z podziałem na poziomy zagrożenia kanibalizacją:
🔴 CRITICAL (≥90%): Treści niemal identyczne – wymagana natychmiastowa interwencja i zmiana struktury briefu.
🟡 WARNING (75-90%): Wysokie ryzyko powtórzeń merytorycznych.
🔵 INFO (60-75%): Tematy pokrewne, warto monitorować linkowanie wewnętrzne.
Szczegółowa analiza duplikatów
Największą siłą narzędzia jest podgląd konkretnych par (tzw. pairwise comparison). Jak widać na poniższych zrzutach, system zestawia ze sobą dwa briefy i wskazuje dokładnie, w których miejscach dochodzi do konfliktu.
Narzędzie analizuje nie tylko nagłówki (np. definicje SIEM vs SOC), ale także sekcje [CORE MESSAGE] oraz listy słów kluczowych. Dzięki temu możesz precyzyjnie zdecydować, czy połączyć dwa tematy w jeden, czy wyraźniej rozdzielić intencje artykułów.
Całość działa lokalnie, zapewniając szybkość i prywatność danych, pozwalając proaktywnie zarządzać spójnością content planu.
Link do repozytorium aplikacji Content Similarity Analyzer
Łączę techniczne SEO z potencjałem AI Search. Projektuję strategie oparte o Grafy Wiedzy, semantykę, intencje zapytań i automatyzację procesów.
Pomagam firmom z segmentu e-commerce, B2B oraz biznesom lokalnym zrozumieć, jak algorytmy AI interpretują ich działalność i wdrażam rozwiązania, które budują przewagę w erze AI Search.
✨
Potrzebujesz pomocy w SEO?
Umów się na darmową 30-minutową konsultację. Porozmawiamy o Twojej stronie i możliwościach wzrostu w Google i wyszukiwarkach AI.