Biała sylwetka robota na tle turkusowych fal - ilustracja badania blokowania botów AI w plikach robots.txt
|

Ile polskich stron blokuje boty AI? Badanie 1000 domen

Spis treści

Sprawdziliśmy plik robots.txt tysiąca najpopularniejszych polskich domen i policzyliśmy, ile z nich blokuje boty sztucznej inteligencji. Blokuje przynajmniej jednego bota 20,5% stron. Ale najciekawsze okazało się co innego: trzy czwarte blokujących odróżnia trenowanie modelu od pokazania treści użytkownikowi - i blokuje wyłącznie to pierwsze.

Co dokładnie zmierzyliśmy

Próbę stanowi 1000 domen z końcówką .pl o najwyższej pozycji na liście Tranco - publicznym rankingu popularności witryn, z którego korzysta się w badaniach naukowych. Wykorzystaliśmy listę dzienną wygenerowaną 28 sierpnia 2026 roku; polskich domen jest w niej 9283. Zakres rang w naszej próbie sięga od 693 (allegro.pl) do 138 196.

Dla każdej domeny pobraliśmy plik robots.txt - jeden odczyt, 29 sierpnia 2026. Ten sam mechanizm, którego używa nasz test botów AI, pozwala sprawdzić pojedynczy adres w kilka sekund.

Czego nie udało się zmierzyć

StanDomenUdział
odczytano robots.txt72572,5%
brak pliku - czyli brak reguł i brak blokady21221,2%
nie zmierzono - błąd sieci, przekroczony czas, błąd serwera636,3%

Domeny niezmierzone wykluczyliśmy z mianownika, zamiast doliczać je do grupy „nie blokuje”. Domena, do której nie udało się dotrzeć, nie jest domeną zezwalającą - a policzenie jej jako takiej zaniżyłoby wszystkie odsetki. Podstawą analizy jest więc 937 domen.

Kryterium, które decyduje o wszystkim

Samo słowo Disallow w pliku niczego nie przesądza. Liczy się, skąd pochodzi reguła:

  • Blokada celowa - strona ma własną sekcję dla konkretnego bota, na przykład User-agent: GPTBot. To świadoma decyzja wobec sztucznej inteligencji.
  • Blokada ogólna - bot podpada tylko pod User-agent: *, która dotyczy tak samo Googlebota. Taka reguła nie mówi nic o stosunku wydawcy do AI.

W tym badaniu liczymy wyłącznie blokady celowe. Zsumowanie obu rodzajów dałoby nagłówek, który byłby po prostu nieprawdziwy. Warto też znać regułę, którą łatwo przeoczyć: w standardzie RFC 9309 sekcja nazwana ma pierwszeństwo przed gwiazdką. Strona, która blokuje wszystko przez User-agent: *, ale ma pustą sekcję User-agent: GPTBot, w rzeczywistości GPTBota przepuszcza. Własny plik możesz sprawdzić testerem robots.txt.

Który bot jest blokowany najczęściej

BotWłaścicielDo czego służyBlokujeUdział
GPTBotOpenAItrenowanie modeli14515,5%
CCBotCommon Crawlkorpus dla wielu modeli12613,4%
BytespiderByteDancetrenowanie modeli10911,6%
AmazonbotAmazontrenowanie modeli10611,3%
ClaudeBotAnthropictrenowanie modeli10210,9%
Meta-ExternalAgentMetatrenowanie modeli10210,9%
Google-ExtendedGoogletrenowanie Gemini859,1%
Applebot-ExtendedAppletrenowanie modeli859,1%
anthropic-aiAnthropicstarsza nazwa bota485,1%
PerplexityBotPerplexitywyszukiwarka AI293,1%
ChatGPT-UserOpenAIodczyt na żądanie użytkownika272,9%
OAI-SearchBotOpenAIwyszukiwarka ChatGPT222,3%
Claude-UserAnthropicodczyt na żądanie użytkownika40,4%

Jedna uwaga, bo to źródło częstych nieporozumień: Google-Extended nie dotyczy wyszukiwarki. Zablokowanie go wyłącza stronę z trenowania modelu Gemini, ale nie usuwa jej z wyników wyszukiwania Google.

Najważniejszy wniosek: „nie trenuj na mnie, ale możesz mnie pokazać”

Boty AI pełnią dwie różne funkcje. Jedne zbierają treść do trenowania modelu. Inne odczytują stronę wtedy, gdy użytkownik zadaje pytanie, i cytują ją w odpowiedzi. Kiedy rozdzielimy te dwie grupy, obraz zmienia się całkowicie.

ZachowanieDomenUdział
blokuje boty trenujące modele18820,1%
blokuje boty odczytu i wyszukiwarek AI495,2%
blokuje oba rodzaje45
blokuje tylko trening, przepuszcza odczyt14374% blokujących

Trzy czwarte polskich stron, które w ogóle sięgnęły po blokadę, zajęło stanowisko: nie trenuj na mojej treści, ale możesz ją pokazać użytkownikowi, który pyta.

Najostrzej widać to w danych OpenAI. GPTBot blokuje 15,5% domen, a ChatGPT-User zaledwie 2,9% - ta sama firma, dwa różne boty, pięciokrotna różnica. U Anthropic kontrast jest jeszcze większy: ClaudeBot 10,9% wobec Claude-User 0,4%.

To nie jest przypadek ani niedopatrzenie przy konfiguracji. To świadome rozróżnienie między byciem materiałem treningowym a byciem źródłem cytowanym w odpowiedzi. Pierwsze nic wydawcy nie daje. Drugie może przynieść ruch i rozpoznawalność.

Jedna decyzja widoczna w dziewięciu serwisach

Najbardziej konsekwentne blokady w całej próbie należą do jednej grupy wydawniczej. Dziewięć domen PTWP - wnp.pl, portalsamorzadowy.pl, rynekzdrowia.pl, farmer.pl, portalspozywczy.pl, pulshr.pl, dlahandlu.pl, propertynews.pl oraz ptwp.pl - blokuje dokładnie 12 z 13 badanych botów, co do jednego.

Tak wygląda decyzja podjęta na poziomie wydawcy, a nie pojedynczej redakcji. Dla porównania, w większości próby blokady są wybiórcze i obejmują dwa lub trzy najbardziej znane boty.

Czy więksi blokują częściej? Nie

Pozycja w próbieBlokujeUdział
1-10024 ze 10024,0%
101-25029 ze 15019,3%
251-50066 z 25026,4%
501-100073 z 43716,7%

Brak wyraźnego trendu. Blokowanie botów AI nie jest praktyką zarezerwowaną dla największych serwisów - rozkłada się po całej próbie.

Czego to badanie nie mówi

  • Plik robots.txt to deklaracja, nie egzekucja. Zmierzyliśmy, czego strony sobie życzą, a nie czy boty tego przestrzegają. Sprawdzenie przestrzegania wymaga analizy logów serwera i jest osobnym zadaniem.
  • Próba to 1000 najpopularniejszych domen, nie „polski internet”. Ranking Tranco mierzy popularność, więc wynik opisuje serwisy z realnym ruchem. Małe strony firmowe zachowują się prawdopodobnie inaczej i nie ma ich w tej próbie.
  • Nie dzieliliśmy domen na typy. Tranco nie klasyfikuje witryn, więc z tych danych nie da się powiedzieć „tyle procent wydawców” ani „tyle procent sklepów” bez ręcznej klasyfikacji.
  • To pomiar jednorazowy. Pokazuje stan na 29 sierpnia 2026, a nie kierunek zmiany. Powtórzymy go za kwartał tą samą metodą.
  • Lista botów obejmuje 13 pozycji. Nowe pojawiają się co kilka miesięcy, więc strona blokująca bota spoza tej listy zostanie tu policzona jako nieblokująca.

Co z tego wynika dla twojej strony

Decyzja o blokowaniu botów AI nie jest zerojedynkowa i dane pokazują, że większość świadomych wydawców tak ją właśnie traktuje. Zanim zablokujesz wszystko, rozważ trzy pytania:

  1. Czy chcesz być cytowany w odpowiedziach AI? Jeśli tak, zablokuj boty treningowe, ale przepuść boty odczytu - inaczej znikniesz z odpowiedzi ChatGPT i Perplexity.
  2. Czy blokujesz przez gwiazdkę? Reguła User-agent: * dotyczy też Googlebota. Boty AI blokuje się osobnymi sekcjami.
  3. Czy twój plik działa tak, jak myślisz? Pierwszeństwo sekcji nazwanej nad gwiazdką sprawia, że pliki bywają skonfigurowane odwrotnie do intencji.

Swój plik sprawdzisz naszym testem botów AI - pokazuje, które z 13 botów mają dostęp do twojej strony. Składnię i zasięg reguł zweryfikujesz testerem robots.txt.

Metoda i dane

Badanie wykonaliśmy własnym parserem zgodnym z RFC 9309, obsługującym grupowanie sekcji i pierwszeństwo sekcji nazwanej nad gwiazdką. Przed uruchomieniem skanu parser przeszedł 17 testów jednostkowych obejmujących między innymi oba warianty pierwszeństwa oraz rozróżnienie blokady celowej od ogólnej. Próba pochodzi z publicznej listy Tranco, więc pomiar można powtórzyć na tej samej podstawie.

Michał Wiercimok
O autorze
Michał Wiercimok
Ekspert marketingu internetowego

Michał Wiercimok - specjalista marketingu internetowego z ponad 20-letnim doświadczeniem. Prowadzi własną agencję marketingową i doradza firmom w zakresie Google Ads, SEO, analityki (GA4) oraz wykorzystania sztucznej inteligencji w marketingu. Zrealizował ponad 100 projektów dla klientów z różnych branż; wyróżniony w programie Google Partners Rising Stars (2016). Działa z Katowic.