sitemap.xml i robots.txt pełnią różne role. Mapa witryny wskazuje ważne adresy, które wyszukiwarka powinna poznać. Plik robots określa, których ścieżek robot nie powinien pobierać. Błędne połączenie tych mechanizmów może wysyłać sprzeczne sygnały.
Sitemap i robots.txt — najważniejsza różnica
| Plik | Do czego służy | Czego nie robi |
|---|---|---|
sitemap.xml | Przekazuje listę ważnych, kanonicznych adresów witryny. | Nie gwarantuje crawlowania ani indeksacji. |
robots.txt | Zarządza dostępem robotów do ścieżek. | Nie służy do usuwania adresów z wyników ani wyboru canonical. |
Disallow. Mapa zachęca do odkrycia adresu, a robots uniemożliwia pobranie jego treści.Jak zbudować robots.txt
Plik powinien znajdować się w katalogu głównym hosta, na przykład https://example.pl/robots.txt, i odpowiadać kodem 200 jako zwykły tekst. Minimalna konfiguracja dla publicznej witryny może wyglądać tak:
User-agent: *
Allow: /
Sitemap: https://example.pl/sitemap.xml
Blokuj wyłącznie ścieżki, których robot rzeczywiście nie powinien pobierać, np. techniczne wyniki wyszukiwania lub panele administracyjne. Przed dodaniem reguły upewnij się, że nie obejmie ważnych zasobów CSS, JavaScriptu ani obrazów potrzebnych do renderowania strony.
Co umieszczać w sitemap.xml
Mapa powinna zawierać pełne adresy HTTPS stron, które mają szansę pojawić się w wyszukiwarce. Każdy wpis powinien prowadzić bezpośrednio do końcowego URL-u odpowiadającego kodem 200.
- Dodawaj tylko adresy kanoniczne.
- Nie umieszczaj przekierowań, błędów 404 i stron z
noindex. - Nie dodawaj wariantów parametrów będących duplikatami.
- Używaj jednej, spójnej wersji hosta i protokołu.
- Aktualizuj mapę po dodaniu, usunięciu lub trwałym przeniesieniu strony.
Google zaleca pełne, bezwzględne URL-e oraz umieszczanie w mapie adresów przeznaczonych do wyników wyszukiwania. Szczegóły znajdują się w dokumentacji tworzenia i przesyłania sitemap.
Spójność z canonical i linkowaniem
Sitemap jest jednym z sygnałów wyboru wersji kanonicznej. Silniejszy efekt daje połączenie kilku zgodnych sygnałów:
- URL w sitemapie.
- Samodzielny canonical wskazujący ten sam URL.
- Linki wewnętrzne prowadzące do tej wersji.
- Przekierowania pozostałych wariantów do wersji preferowanej.
Nie wskazuj jednego adresu w sitemapie, a innego w canonical. Google może wybrać własną wersję, jeżeli sygnały są niespójne.
Najczęstsze błędy konfiguracji
| Problem | Skutek | Naprawa |
|---|---|---|
Disallow: / | Cała witryna jest zablokowana do crawlowania. | Usuń regułę po zakończeniu prac nad wersją testową. |
| Adresy HTTP w mapie | Robot musi przechodzić przez przekierowanie. | Zapisz końcowe adresy HTTPS. |
URL z noindex w sitemapie | Sprzeczny komunikat o znaczeniu strony. | Usuń URL z mapy albo zweryfikuj decyzję o noindex. |
| Blokada CSS lub JS | Robot może nie zobaczyć strony tak jak użytkownik. | Odblokuj zasoby potrzebne do renderowania. |
| Nieaktualne adresy | Niepotrzebne błędy i przekierowania podczas crawlowania. | Generuj mapę z aktualnego źródła stron. |
Jak przetestować oba pliki
- Otwórz
/robots.txti/sitemap.xmlbez logowania. - Potwierdź kod 200, prawidłowy typ treści i brak przekierowania do błędu.
- Sprawdź, czy dyrektywa
Sitemap:zawiera pełny działający adres. - Porównaj URL-e mapy z regułami
Disallow. - Dla kilku wpisów sprawdź status, canonical, meta robots i linki wewnętrzne.
- Po zmianie ponów dokładnie te same testy na produkcji.
Duże witryny i indeks sitemap
Pojedynczy plik ma limit 50 MB bez kompresji lub 50 000 adresów. Większe serwisy powinny dzielić mapy według logicznych typów treści i publikować indeks sitemap. Podział ułatwia też diagnozę, która grupa URL-i ma problemy.
Checklista przed publikacją
- Robots i sitemap działają przez HTTPS.
- Robots wskazuje pełny adres mapy.
- Mapa zawiera wyłącznie końcowe URL-e 200.
- Wpisy nie są blokowane i nie mają
noindex. - Canonical oraz linkowanie wskazują te same wersje.
- Usunięte strony zniknęły z mapy.
- Zmiany zostały sprawdzone na środowisku produkcyjnym.
Źródła i dalsza lektura
Poradnik opiera się na praktyce technicznej analizatora oraz oficjalnej dokumentacji Google Search Central wskazanej w treści.