Ile polskich stron blokuje boty AI? Badanie 1000 domen
Spis treści
Sprawdziliśmy plik robots.txt tysiąca najpopularniejszych polskich domen i policzyliśmy, ile z nich blokuje boty sztucznej inteligencji. Blokuje przynajmniej jednego bota 20,5% stron. Ale najciekawsze okazało się co innego: trzy czwarte blokujących odróżnia trenowanie modelu od pokazania treści użytkownikowi - i blokuje wyłącznie to pierwsze.
Co dokładnie zmierzyliśmy
Próbę stanowi 1000 domen z końcówką .pl o najwyższej pozycji na liście Tranco - publicznym rankingu popularności witryn, z którego korzysta się w badaniach naukowych. Wykorzystaliśmy listę dzienną wygenerowaną 28 sierpnia 2026 roku; polskich domen jest w niej 9283. Zakres rang w naszej próbie sięga od 693 (allegro.pl) do 138 196.
Dla każdej domeny pobraliśmy plik robots.txt - jeden odczyt, 29 sierpnia 2026. Ten sam mechanizm, którego używa nasz test botów AI, pozwala sprawdzić pojedynczy adres w kilka sekund.
Czego nie udało się zmierzyć
| Stan | Domen | Udział |
|---|---|---|
odczytano robots.txt | 725 | 72,5% |
| brak pliku - czyli brak reguł i brak blokady | 212 | 21,2% |
| nie zmierzono - błąd sieci, przekroczony czas, błąd serwera | 63 | 6,3% |
Domeny niezmierzone wykluczyliśmy z mianownika, zamiast doliczać je do grupy „nie blokuje”. Domena, do której nie udało się dotrzeć, nie jest domeną zezwalającą - a policzenie jej jako takiej zaniżyłoby wszystkie odsetki. Podstawą analizy jest więc 937 domen.
Kryterium, które decyduje o wszystkim
Samo słowo Disallow w pliku niczego nie przesądza. Liczy się, skąd pochodzi reguła:
- Blokada celowa - strona ma własną sekcję dla konkretnego bota, na przykład
User-agent: GPTBot. To świadoma decyzja wobec sztucznej inteligencji. - Blokada ogólna - bot podpada tylko pod
User-agent: *, która dotyczy tak samo Googlebota. Taka reguła nie mówi nic o stosunku wydawcy do AI.
W tym badaniu liczymy wyłącznie blokady celowe. Zsumowanie obu rodzajów dałoby nagłówek, który byłby po prostu nieprawdziwy. Warto też znać regułę, którą łatwo przeoczyć: w standardzie RFC 9309 sekcja nazwana ma pierwszeństwo przed gwiazdką. Strona, która blokuje wszystko przez User-agent: *, ale ma pustą sekcję User-agent: GPTBot, w rzeczywistości GPTBota przepuszcza. Własny plik możesz sprawdzić testerem robots.txt.
Który bot jest blokowany najczęściej
| Bot | Właściciel | Do czego służy | Blokuje | Udział |
|---|---|---|---|---|
| GPTBot | OpenAI | trenowanie modeli | 145 | 15,5% |
| CCBot | Common Crawl | korpus dla wielu modeli | 126 | 13,4% |
| Bytespider | ByteDance | trenowanie modeli | 109 | 11,6% |
| Amazonbot | Amazon | trenowanie modeli | 106 | 11,3% |
| ClaudeBot | Anthropic | trenowanie modeli | 102 | 10,9% |
| Meta-ExternalAgent | Meta | trenowanie modeli | 102 | 10,9% |
| Google-Extended | trenowanie Gemini | 85 | 9,1% | |
| Applebot-Extended | Apple | trenowanie modeli | 85 | 9,1% |
| anthropic-ai | Anthropic | starsza nazwa bota | 48 | 5,1% |
| PerplexityBot | Perplexity | wyszukiwarka AI | 29 | 3,1% |
| ChatGPT-User | OpenAI | odczyt na żądanie użytkownika | 27 | 2,9% |
| OAI-SearchBot | OpenAI | wyszukiwarka ChatGPT | 22 | 2,3% |
| Claude-User | Anthropic | odczyt na żądanie użytkownika | 4 | 0,4% |
Jedna uwaga, bo to źródło częstych nieporozumień: Google-Extended nie dotyczy wyszukiwarki. Zablokowanie go wyłącza stronę z trenowania modelu Gemini, ale nie usuwa jej z wyników wyszukiwania Google.
Najważniejszy wniosek: „nie trenuj na mnie, ale możesz mnie pokazać”
Boty AI pełnią dwie różne funkcje. Jedne zbierają treść do trenowania modelu. Inne odczytują stronę wtedy, gdy użytkownik zadaje pytanie, i cytują ją w odpowiedzi. Kiedy rozdzielimy te dwie grupy, obraz zmienia się całkowicie.
| Zachowanie | Domen | Udział |
|---|---|---|
| blokuje boty trenujące modele | 188 | 20,1% |
| blokuje boty odczytu i wyszukiwarek AI | 49 | 5,2% |
| blokuje oba rodzaje | 45 | – |
| blokuje tylko trening, przepuszcza odczyt | 143 | 74% blokujących |
Trzy czwarte polskich stron, które w ogóle sięgnęły po blokadę, zajęło stanowisko: nie trenuj na mojej treści, ale możesz ją pokazać użytkownikowi, który pyta.
Najostrzej widać to w danych OpenAI. GPTBot blokuje 15,5% domen, a ChatGPT-User zaledwie 2,9% - ta sama firma, dwa różne boty, pięciokrotna różnica. U Anthropic kontrast jest jeszcze większy: ClaudeBot 10,9% wobec Claude-User 0,4%.
To nie jest przypadek ani niedopatrzenie przy konfiguracji. To świadome rozróżnienie między byciem materiałem treningowym a byciem źródłem cytowanym w odpowiedzi. Pierwsze nic wydawcy nie daje. Drugie może przynieść ruch i rozpoznawalność.
Jedna decyzja widoczna w dziewięciu serwisach
Najbardziej konsekwentne blokady w całej próbie należą do jednej grupy wydawniczej. Dziewięć domen PTWP - wnp.pl, portalsamorzadowy.pl, rynekzdrowia.pl, farmer.pl, portalspozywczy.pl, pulshr.pl, dlahandlu.pl, propertynews.pl oraz ptwp.pl - blokuje dokładnie 12 z 13 badanych botów, co do jednego.
Tak wygląda decyzja podjęta na poziomie wydawcy, a nie pojedynczej redakcji. Dla porównania, w większości próby blokady są wybiórcze i obejmują dwa lub trzy najbardziej znane boty.
Czy więksi blokują częściej? Nie
| Pozycja w próbie | Blokuje | Udział |
|---|---|---|
| 1-100 | 24 ze 100 | 24,0% |
| 101-250 | 29 ze 150 | 19,3% |
| 251-500 | 66 z 250 | 26,4% |
| 501-1000 | 73 z 437 | 16,7% |
Brak wyraźnego trendu. Blokowanie botów AI nie jest praktyką zarezerwowaną dla największych serwisów - rozkłada się po całej próbie.
Czego to badanie nie mówi
- Plik robots.txt to deklaracja, nie egzekucja. Zmierzyliśmy, czego strony sobie życzą, a nie czy boty tego przestrzegają. Sprawdzenie przestrzegania wymaga analizy logów serwera i jest osobnym zadaniem.
- Próba to 1000 najpopularniejszych domen, nie „polski internet”. Ranking Tranco mierzy popularność, więc wynik opisuje serwisy z realnym ruchem. Małe strony firmowe zachowują się prawdopodobnie inaczej i nie ma ich w tej próbie.
- Nie dzieliliśmy domen na typy. Tranco nie klasyfikuje witryn, więc z tych danych nie da się powiedzieć „tyle procent wydawców” ani „tyle procent sklepów” bez ręcznej klasyfikacji.
- To pomiar jednorazowy. Pokazuje stan na 29 sierpnia 2026, a nie kierunek zmiany. Powtórzymy go za kwartał tą samą metodą.
- Lista botów obejmuje 13 pozycji. Nowe pojawiają się co kilka miesięcy, więc strona blokująca bota spoza tej listy zostanie tu policzona jako nieblokująca.
Co z tego wynika dla twojej strony
Decyzja o blokowaniu botów AI nie jest zerojedynkowa i dane pokazują, że większość świadomych wydawców tak ją właśnie traktuje. Zanim zablokujesz wszystko, rozważ trzy pytania:
- Czy chcesz być cytowany w odpowiedziach AI? Jeśli tak, zablokuj boty treningowe, ale przepuść boty odczytu - inaczej znikniesz z odpowiedzi ChatGPT i Perplexity.
- Czy blokujesz przez gwiazdkę? Reguła
User-agent: *dotyczy też Googlebota. Boty AI blokuje się osobnymi sekcjami. - Czy twój plik działa tak, jak myślisz? Pierwszeństwo sekcji nazwanej nad gwiazdką sprawia, że pliki bywają skonfigurowane odwrotnie do intencji.
Swój plik sprawdzisz naszym testem botów AI - pokazuje, które z 13 botów mają dostęp do twojej strony. Składnię i zasięg reguł zweryfikujesz testerem robots.txt.
Metoda i dane
Badanie wykonaliśmy własnym parserem zgodnym z RFC 9309, obsługującym grupowanie sekcji i pierwszeństwo sekcji nazwanej nad gwiazdką. Przed uruchomieniem skanu parser przeszedł 17 testów jednostkowych obejmujących między innymi oba warianty pierwszeństwa oraz rozróżnienie blokady celowej od ogólnej. Próba pochodzi z publicznej listy Tranco, więc pomiar można powtórzyć na tej samej podstawie.

