Robots.txt służy jako pierwszy punkt kontaktu między Twoją witryną a robotami wyszukiwarek. Umieszczony w katalogu głównym (np. ottawaseo.com/robots.txt), ten plik tekstowy określa, które części Twojej witryny mogą być skanowane przez konkretne crawlery, a które powinny być zablokowane. Główne zastosowania to kontrola budżetu crawlowania - szczególnie ważne dla dużych witryn z tysiącami stron, gdzie chcesz, aby Googlebot skoncentrował się na wartościowych treściach zamiast marnować zasoby na strony administracyjne, parametry URL czy duplikaty. Na przykład w portfolio 500+ domen Ottawa SEO blokujemy typowo foldery /wp-admin/, /cgi-bin/, strony wyników wyszukiwania wewnętrznego, oraz parametry sessionID. Robots.txt NIE jest mechanizmem bezpieczeństwa - każdy może go przeczytać, wpisując adres w przeglądarce. Jeśli chcesz ukryć wrażliwe dane, użyj autentykacji na poziomie serwera lub meta robots noindex. Plik ten jest tylko sugestią dla dobrze wychowanych botów; złośliwe scrapery go ignorują. Typowa struktura zawiera dyrektywy User-agent (określa bota), Disallow (blokuje ścieżki), Allow (nadpisuje blokady dla podfolderów), oraz opcjonalnie Sitemap (wskazuje lokalizację mapy XML). Częste błędy to przypadkowe zablokowanie całej witryny przez Disallow: / (widzieliśmy to wielokrotnie u nowych klientów) lub blokowanie plików CSS/JS, co uniemożliwia Google poprawne renderowanie strony. Dla większości witryn SMB w Ottawie czy Toronto potrzebujesz prostego robots.txt - zablokuj admin, duplikaty, maybe staging subdomain. Dla e-commerce z filtracją blokuj parametry sortowania i paginacji. Zawsze testuj w Google Search Console (narzędzie do testowania robots.txt) przed wdrożeniem, bo jeden błąd może wykluczyć całą witrynę z indeksu w ciągu dni.