Duplicate content je duplicitný obsah, ktorý sa zobrazuje na viacerých URL adresách. Zistite, ako ho identifikovať a vyriešiť pre lepšie SEO.
Duplicate content znamená rovnaký alebo takmer identický obsah, ktorý sa nachádza na viacerých URL adresách. Môže ísť o duplicitu v rámci jedného webu (interná) alebo medzi rôznymi doménami (externá). Google takýto obsah nepenalizuje priamo, ale spôsobuje problémy s indexovaním a rozrieďuje SEO hodnotu vašich stránok.
Podľa odhadov sa duplicitný obsah nachádza na 25–30 % všetkých webov. Väčšinou vzniká neúmyselne, technickými chybami, nesprávnym nastavením CMS alebo automatickým generovaním URL parametrov. Ak ho neriešite, Google môže indexovať nesprávnu verziu stránky, alebo ju vôbec nezaradiť do vyhľadávania. To je priamy výpadok organického trafficu bez toho, aby ste o tom vedeli.
Duplicate content z pohľadu Google znamená bloky obsahu, ktoré sú buď úplne totožné, alebo sa líšia len minimálne. Googlebot pri crawlovaní webu narazí na rovnaký text na dvoch alebo viacerých URL a musí rozhodnúť, ktorú verziu má zaradiť do indexu. Toto rozhodnutie nemusí byť v prospech tej stránky, ktorú vy považujete za hlavnú.
Google duplicitný obsah nevníma ako spam. Nepenalizuje ho priamo znížením rankingu. Problém je iný, keď existuje 5 URL s rovnakým obsahom, Google si vyberie jednu ako kanonickú a ostatné ignoruje. Ak si vyberie zlú, vaša hlavná produktová stránka môže vypadnúť z indexu v prospech nejakej URL s parametrami typu ?sort=price&color=blue.
V praxi to vyzerá tak: máte e-shop s 500 produktami, každý produkt má 3 farebné varianty generujúce unikátne URL, k tomu filtrovacie parametre. Zrazu máte 2000+ URL s prakticky rovnakým obsahom. Google crawl budget sa míňa na duplicity namiesto nových stránok ktoré chcete indexovať.
Rozlišujeme dva základné typy duplicitného obsahu. Každý má iné príčiny a vyžaduje iné riešenie.
Vzniká v rámci jednej domény. Najčastejšie príčiny sú technické, rovnaký obsah dostupný na viacerých URL. Typické prípady:
Interná duplicita je bežná a väčšinou neúmyselná. Dobrá správa: dá sa vyriešiť technickými úpravami na vašej strane.
Vzniká keď sa rovnaký obsah nachádza na rôznych doménach. Môže ísť o legálny syndikovaný obsah (publikujete článok na vlastnom blogu aj na médiu), scraping (niekto vám obsah ukradol), alebo o produktové popisy od výrobcu ktoré používa 50 e-shopov.
Pri externej duplicite Google určí kanonickú verziu podľa autority domény a ďalších signálov. Ak máte slabšiu doménu než konkurent s rovnakým obsahom, Google môže preferovať jeho verziu. To je problém hlavne pri produktových popisoch, výrobca poskytne identický text všetkým predajcom a Google si vyberie len jedného.
Identifikácia duplicitného obsahu vyžaduje kombináciu nástrojov. Žiadny jeden nástroj neodhalí všetko.
Prvý krok je zadarmo. V sekcii Coverage (Pokrytie) nájdete stránky vylúčené z indexu s dôvodom "Duplicate without user-selected canonical" alebo "Duplicate, Google chose different canonical than user". To sú priame signály duplicity ktoré Google už identifikoval. Ak máte stovky takýchto stránok, je čas konať.
Pre systematický audit potrebujete crawlovacie nástroje. Screaming Frog (bezplatná verzia do 500 URL) alebo Sitebulb precrawlujú celý web a identifikujú stránky s rovnakými title tagmi, meta popismi alebo obsahom body. Copyscape alebo Siteliner kontrolujú externú duplicitu, či váš obsah nie je skopírovaný inde.
Jednoduchý manuálny test: vezmite unikátnu vetu z vašej stránky, dajte ju do úvodzoviek a vyhľadajte v Google. Ak sa objaví na iných doménach, máte externú duplicitu.
Skontrolujte základné veci ručne. Zadajte do prehliadača váš web s HTTP aj HTTPS, s WWW aj bez. Všetky štyri kombinácie by mali presmerovať na jednu kanonickú verziu. Ak nie, máte problém. Podobne skontrolujte trailing slash. /kontakt a /kontakt/ by mali ísť na rovnakú URL.
Existuje niekoľko technických riešení. Výber závisí od typu duplicity a štruktúry vášho webu.
Najpouživanejšie riešenie. Tag rel="canonical" v hlavičke stránky hovorí Google: "Toto je preferovaná verzia, ostatné duplicitné URL ignoruj." Implementuje sa ako <link rel="canonical" href="https://vasadomena.sk/produkt/" />.
Canonical tag je odporúčanie, nie direktíva. Google ho väčšinou rešpektuje, ale môže ho ignorovať ak vidí konflikt (canonical ukazuje na 404 stránku, na redirect, alebo obsah je výrazne odlišný). Preto kontrolujte v Search Console či Google rešpektuje vaše canonical nastavenia.
Každá stránka by mala mať self-referencing canonical, ukazovať sama na seba. To eliminuje problémy s URL parametrami ktoré návštevníci pridávajú.
Ak máte dve URL s rovnakým obsahom a jedna nemá dôvod existovať, 301 redirect je čistejšie riešenie než canonical. Presmerujete duplicitnú URL na kanonickú a hotovo. Používa sa pri migrácii webu, zlučovaní stránok alebo odstraňovaní starých URL.
301 redirect prenáša väčšinu SEO hodnoty na cieľovú stránku. Podľa potvrdenia od Google je to prakticky 100 %, aj keď historicky sa hovorilo o strate 10–15 %.
Google Search Console umožňuje definovať ako má Google narábať s URL parametrami. Môžete povedať že parameter ?sort= nemení obsah stránky a Google ho má ignorovať. Toto riešenie je užitočné pri e-shopoch s množstvom filtrovacích parametrov.
Meta tag noindex povie Google aby stránku neindexoval. Používa sa keď duplicitná stránka musí existovať pre používateľov (napríklad print verzia), ale nechcete ju v indexe. Na rozdiel od canonical toto nie je odporúčanie, je to direktíva ktorú Google rešpektuje.
Pri odstraňovaní duplicít vidíme opakovane rovnaké chyby. Vyhnite sa im:
Ďalšia častá chyba je riešiť duplicitu až keď sa prejaví pokles trafficu. Pri e-shope na mieru riešime správnu URL štruktúru a canonical nastavenia od začiatku. Opraviť tisíce URL spätne je násobne drahšie než to nastaviť správne pri vývoji.
Nie priamo. Google nemá "duplicate content penalty" ako manuálny postih. Neznížite si ranking len tým, že máte duplicity na webe.
Problém je nepriamy. Duplicitný obsah spôsobuje:
Výnimkou je úmyselná manipulácia. Ak kopírujete obsah z iných webov vo veľkom rozsahu, Google to môže považovať za thin content alebo spam. To už je penalizácia.
Ak chcete riešiť duplicitný obsah systematicky, držte sa tohto postupu:
Pri komplexnejších weboch pomáha tracking a analytika na identifikáciu ktoré duplicitné URL reálne dostávajú traffic. Často zistíte, že väčšina duplicít nemá žiadne návštevy a môžete ich bezpečne presmerovať alebo noindexovať.
Duplicate content nie je katastrofa, ale ignorovať ho je chyba. Technické duplicity vznikajú na väčšine webov automaticky a vyriešiť ich je otázka správneho nastavenia, nie prepisovania obsahu. Canonical tagy, 301 presmerovania a čistá URL štruktúra sú základné nástroje ktoré by mal mať každý web implementované od začiatku.
Pre viac inšpirácie si pozrite naše projekty z praxe.
Pri tvorbe webstránok pre klientov riešime URL štruktúru a canonical nastavenia ako súčasť vývoja. Ak máte existujúci web a chcete audit duplicitného obsahu, napíšte nám a pozrieme sa na to spolu.

