CrawlerPulse
CrawlerPulse / Europe / Italy / repubblica.it

La Repubblica

repubblica.it · Italy · GEDI · measured 8 Oct 2026

Google Search
Allowed
Google-Extended
Blocked
OpenAI
Blocked
Anthropic
Allowed
Perplexity
Blocked
Meta
Allowed
Common Crawl
Blocked
ByteDance
Blocked
Apple
Blocked
Amazon
Allowed

robots.txt

As read on 8 Oct 2026, 7,531 bytes. 16 rule groups name AI crawlers; shown first.

User-agent: GPTBot
Disallow: 		/

User-agent: Google-Extended
Disallow: 		/

User-agent: CCBot
Disallow: 		/

User-agent: anthropic-ai
Disallow: 		/

User-agent: Omgilibot
Disallow: 		/

User-agent: FacebookBot
Disallow: 		/

User-agent: cohere-ai
Disallow: 		/

User-agent: PetalBot
Disallow: 		/

User-agent: PerplexityBot
Disallow: 		/

User-agent: Amazonbot
Allow: 		/

User-agent: Bytespider
Disallow: 		/

User-agent: Diffbot
Disallow: 		/

User-agent: ImagesiftBot
Disallow: 		/

User-agent: Timpibot
Disallow: 		/

User-agent: YouBot
Disallow: 		/

User-agent: Applebot-Extended
Disallow: 		/

User-agent: *
Allow: 		/
Disallow: 		/ultimora/24ore/nazionale/news-dettaglio/3688417
Disallow: 		/ultimora/24ore/AUTO-IN-CAMBIO-DI-DROGA-13-ARRESTI-DELLA-POLIZIA-DI-PESCARA-(2)/news-dettaglio/3746479
Disallow: 		/sport/ciclismo/2023/10/24/news/doping_ciclismo_virtuale_azzurro_zanasca_rischia_una_lunga_squalifica-418660589/
Disallow: 		/spettacoli/people/2023/09/07/news/kanye_west_e_bianca_censori_in_italia_la_lunga_estate_calda_degli_scandali-413629176/<
Disallow: 		/speciale/
Disallow: 		/social/sites/repubblica/d/boxes/shares/
Disallow: 		/servizi/
Disallow: 		/ricerca/
Disallow: 		/politica/2017/01/19/news/il_fratello_del_ministro_alfano_rischia_il_posto_e_costera_all_erario_mezzo_milione_di_euro[1]156371739/
Disallow: 		/persone/
Disallow: 		/online/cronaca/veronaecstasy/bologna/bologna.html
Disallow: 		/online/
Disallow: 		/news/ired/ultimora/cronaca/rep_cronaca_n_3487677.html
Disallow: 		/java
Disallow: 		/ipad/
Disallow: 		/interstitial/
Disallow: 		/indici/
Disallow: 		/il-gusto/2022/04/27/news/frode_fiscale_bancarotta_fraudolenta_arrestato_giovanni_maspero_ristorante_i_tigli_in_theoria-347110162/
Disallow: 		/esteri/2024/07/24/diretta/kamala_harris_nel_mirino_dei_repubblicani_usa_ricorso_contro_il_trasferimento_dei_fondi_dalla_campagna_di_biden-423411481/
Disallow: 		/embed/*
Disallow: 		/economia/miojob/
Disallow: 		/economia/2013/01/31/news/mps_verso_sequestro_conservativo- 51615470/
Disallow: 		/dal-quotidiano/
Disallow: 		/corporate/privacy/index_static.html?
Disallow: 		/cgi-bin/back.cgi
Disallow: 		/blaize/datalayer
Disallow: 		/audio/i-daily-di-repubblica
Disallow: 		/audio-test-app
Disallow: 		/api/checkpw-v1/premium/amp/pingback*
Disallow: 		/api/*
Disallow: 		/annunci/
Disallow: 		/2010/
Disallow: 		/2009/
Disallow: 		/2008/
Disallow: 		/2007/
Disallow: 		/2006/05/gallerie/politica/farabutti-foto-lettori-95/esterne191030071909103240_big.jpg
Disallow: 		/2006/05/gallerie/politica/farabutti-foto-lettori-95/esterne191030071909103240.jpg
Disallow: 		/2006/
Disallow: 		/2005/
Disallow: 		/2004/
Disallow: 		/2003/
Disallow: 		 /coccodrilli/
Disallow: 		/swf
Disallow: 		/serietv/schede/cerca/?query=
Disallow: 		/online3
Disallow: 		/mobile/
Disallow: 		/ztest/
Disallow: 		/dossier/sapori/guide-espresso*
Disallow: 		/dossier/motori*
Disallow: 		/topics/*?p=
Disallow: 		/mobile-rep/
Disallow: 		/tv/
Disallow: 		/static/__sdemo__/
Disallow: 		/quotidiano
Sitemap: 		https://www.repubblica.it/sitemap-n.xml
Sitemap: 		https://video.repubblica.it/sitemap-v-day.xml
Sitemap: 		https://video.repubblica.it/sitemap-v.xml
Sitemap: 		https://www.repubblica.it/sitemap-italian-tech-n.xml
Sitemap: 		https://www.repubblica.it/sitemap-il-gusto-n.xml
Sitemap: 		https://www.repubblica.it/sitemap-salute-n.xml
Sitemap: 		https://www.repubblica.it/sitemap-green-and-blue-n.xml
Sitemap: 		https://www.repubblica.it/sitemap-dirette-sport-n.xml
Sitemap: 		https://www.repubblica.it/sitemap.xml
Sitemap: 		https://www.repubblica.it/sitemap-italian-tech.xml
Sitemap: 		https://www.repubblica.it/sitemap-il-gusto.xml
Sitemap: 		https://www.repubblica.it/sitemap-salute.xml
Sitemap: 		https://www.repubblica.it/sitemap-green-and-blue.xml

User-agent: Yandex
Disallow: 		/

User-agent: AhrefsBot
Disallow: 		/

User-agent: archive.org_bot
Disallow: 		/

User-agent: ArchiveBot
Disallow: 		/

User-agent: Arquivo-web-crawler
Disallow: 		/

User-agent: AwarioRssBot
Disallow: 		/

User-agent: AwarioSmartBot
Disallow: 		/

User-agent: BacklinkCrawler
Disallow: 		/

User-agent: BIXOCRAWLER
Disallow: 		/

User-agent: BLEXBot
Disallow: 		/

User-agent: Cliqzbot
Disallow: 		/

User-agent: ConveraCrawler
Disallow: 		/

User-agent: crawler4j
Disallow: 		/

User-agent: CrystalSemanticsBot
Disallow: 		/

User-agent: DataForSeoBot
Disallow: 		/

User-agent: discobot
Disallow: 		/

User-agent: discoverybot
Disallow: 		/

User-agent: dloader(NaverRobot)
Disallow: 		/

User-agent: dotbot
Disallow: 		/

User-agent: Download Ninja
Disallow: 		/

User-agent: DuckAssistBot
Disallow: 		/

User-agent: europarchive.org
Disallow: 		/

User-agent: Exabot
Disallow: 		/

User-agent: ExtractorPro
Disallow: 		/

User-agent: Fetch
Disallow: 		/

User-agent: Flamingo_SearchEngine
Disallow: 		/

User-agent: FriendlyCrawler
Disallow: 		/

User-agent: Gigabot
Disallow: 		/

User-agent: GumGum Bot
Disallow: 		/

User-agent: ia_archiver
Disallow: 		/

User-agent: ia_archiver-web.archive.org
Disallow: 		/

User-agent: IstellaBot
Disallow: 		/

User-agent: Jetbot
Disallow: 		/

User-agent: JikeSpider
Disallow: 		/

User-agent: Jyxobot
Disallow: 		/

User-agent: k2spider
Disallow: 		/

User-agent: Kangaroo Bot
Disallow: 		/

User-agent: kbcrawl
Disallow: 		/

User-agent: LexxeBot/1.0
Disallow: 		/

User-agent: LinkArchiver
Disallow: 		/

User-agent: LinkextractorPro
Disallow: 		/

User-agent: Livelapbot
Disallow: 		/

User-agent: magpie-crawler
Disallow: 		/

User-agent: meta-externalfetcher
Disallow: 		/

User-agent: MJ12bot
Disallow: 		/

User-agent: Moreoverbot
Disallow: 		/

User-agent: MSIECrawler
Disallow: 		/

User-agent: nabot
Disallow: 		/

User-agent: NaverBot
Disallow: 		/

User-agent: NerdByNature.Bot
Disallow: 		/

User-agent: netEstate NE Crawler
Disallow: 		/

User-agent: nNetSeer crawler
Disallow: 		/

User-agent: NextGenSearchBot
Disallow: 		/

User-agent: Nicecrawler
Disallow: 		/

User-agent: NPBot
Disallow: 		/

User-agent: nutch
Disallow: 		/

User-agent: Openbot
Disallow: 		/

User-agent: PanguBot
Disallow: 		/

User-agent: peer39_crawler
Disallow: 		/

User-agent: peer39_crawler/1.0
Disallow: 		/

User-agent: PiplBot
Disallow: 		/

User-agent: Pixray-Seeker
Disallow: 		/

User-agent: Primalbot
Disallow: 		/

User-agent: psbot
Disallow: 		/

User-agent: QuerySeekerSpider
Disallow: 		/

User-agent: Quora-Bot
Disallow: 		/

User-agent: rogerbot
Disallow: 		/

User-agent: Scrapy
Disallow: 		/

User-agent: searchpreview
Disallow: 		/

User-agent: SemrushBot
Disallow: 		/

User-agent: SEOENGBot
Disallow: 		/

User-agent: SEOkicks-Robot
Disallow: 		/

User-agent: SiteBot
Disallow: 		/

User-agent: SiteBot/0.1
Disallow: 		/

User-agent: Slurp
Disallow: 		/

User-agent: Sosospider
Disallow: 		/

User-agent: spbot
Disallow: 		/

User-agent: trendictionbot
Disallow: 		/

User-agent: trovitBot
Disallow: 		/

User-agent: True_Robot
Disallow: 		/

User-agent: TurnitinBot
Disallow: 		/

User-agent: UbiCrawler
Disallow: 		/

User-agent: uMBot-LN
Disallow: 		/

User-agent: URL_Spider_Pro
Disallow: 		/

User-agent: verticalsearch
Disallow: 		/

User-agent: WBSearchBot
Disallow: 		/

User-agent: web-archive-net.com.bot
Disallow: 		/

User-agent: WeSEE:Search
Disallow: 		/

User-agent: Wotbot
Disallow: 		/

User-agent: Zealbot
Disallow: 		/

User-agent: AppleBot
Disallow: 		/

History

Changes recorded since June 2026.

No change recorded.

In context

Italy
54.5% block at least one AI crawler
Behind Cloudflare
No
Same group
gedi.it, gelocal.it, huffingtonpost.it, ilsecoloxix.it, lastampa.it