CrawlerPulse
CrawlerPulse / Oceania / New Zealand / scoop.co.nz

Scoop.co.nz

scoop.co.nz · New Zealand · Scoop Media Limited · measured 8 Oct 2026

Google Search
Allowed
Google-Extended
Blocked
OpenAI
Blocked
Anthropic
Blocked
Perplexity
Allowed
Meta
Blocked
Common Crawl
Blocked
ByteDance
Blocked
Apple
Blocked
Amazon
Blocked

robots.txt

As read on 8 Oct 2026, 5,464 bytes. 15 rule groups name AI crawlers; shown first.

User-agent: Amazonbot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Diffbot
Disallow: /

User-agent: FacebookBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: GPTBot
Disallow: /

User-agent: meta-externalagent
Disallow: /

User-agent: Omgili
Disallow: /

User-agent: PetalBot
Disallow: /

User-agent: Timpibot
Disallow: /

User-agent: YouBot
Disallow: /

User-agent: AhrefsBot
Disallow: /

User-agent: Ai2Bot-Dolma
Disallow: /

User-agent: aiHitBot
Disallow: /

User-agent: Amazon AdBot
Disallow: /

User-agent: AmazonAdBot
Disallow: /

User-agent: AmazonProductDiscovery
Disallow: /

User-agent: ApifyBot
Disallow: /

User-agent: ApifyWebsiteContentCrawler
Disallow: /

User-agent: Automattic Analytics Crawler
Disallow: /

User-agent: AwarioBot
Disallow: /

User-agent: BigUpDataBot
Disallow: /

User-agent: BLEXBot
Disallow: /

User-agent: BrandVerity
Disallow: /

User-agent: Bravebot
Disallow: /

User-agent: Brightbot
Disallow: /

User-agent: Caliperbot
Disallow: /

User-agent: channable
Disallow: /

User-agent: ChatGLM-Spider
Disallow: /

User-agent: CheckMarkNetwork
Disallow: /

User-agent: Clickagy Intelligence Bot
Disallow: /

User-agent: Clickagy Intelligence Bot v2
Disallow: /

User-agent: CloudVertexBot
Disallow: /

User-agent: cohere-training-data-crawler
Disallow: /

User-agent: contxbot
Disallow: /

User-agent: Cotoyogi
Disallow: /

User-agent: CriteoBot
Disallow: /

User-agent: DataForSEO
Disallow: /

User-agent: DataForSEO Bot
Disallow: /

User-agent: DataForSeoBot
Disallow: /

User-agent: Datenbank Crawler
Disallow: /

User-agent: DomainStatsBot
Disallow: /

User-agent: Dotbot
Disallow: /

User-agent: Dragonbot
Disallow: /

User-agent: ds9
Disallow: /

User-agent: DVbot
Disallow: /

User-agent: ExaBot
Disallow: /

User-agent: FirecrawlAgent
Disallow: /

User-agent: GoogleOther
Disallow: /

User-agent: HubSpot
Disallow: /

User-agent: Hypestat
Disallow: /

User-agent: ICC-Crawler
Disallow: /

User-agent: imageSpider
Disallow: /

User-agent: IonCrawl
Disallow: /

User-agent: Kangaroo Bot
Disallow: /

User-agent: Klaviyo
Disallow: /

User-agent: laion-huggingface-processor
Disallow: /

User-agent: LCC
Disallow: /

User-agent: McontextualBot
Disallow: /

User-agent: MediavineMetadataParser
Disallow: /

User-agent: MegaIndex.ru
Disallow: /

User-agent: MgidBot
Disallow: /

User-agent: Missinglettr
Disallow: /

User-agent: MixrankBot
Disallow: /

User-agent: MJ12bot
Disallow: /

User-agent: MuckRack
Disallow: /

User-agent: NanoInteractive
Disallow: /

User-agent: Netcraft
Disallow: /

User-agent: netEstate Imprint Crawler
Disallow: /

User-agent: netEstate NE Crawler
Disallow: /

User-agent: NetSeer crawler
Disallow: /

User-agent: Netvibes
Disallow: /

User-agent: NewsRoom.BI
Disallow: /

User-agent: NostoCrawlerBot
Disallow: /

User-agent: outbrain
Disallow: /

User-agent: Owler
Disallow: /

User-agent: page-preview-tool
Disallow: /

User-agent: Pandalytics
Disallow: /

User-agent: PanguBot
Disallow: /

User-agent: parse.ly scraper
Disallow: /

User-agent: productsup.io/crawler
Disallow: /

User-agent: proximic
Disallow: /

User-agent: Quantcastbot
Disallow: /

User-agent: Qwarrybot
Disallow: /

User-agent: SBIntuitionsBot
Disallow: /

User-agent: scraping@nytimes.com
Disallow: /

User-agent: SemrushBot
Disallow: /

User-agent: SemrushBot-BA
Disallow: /

User-agent: SemrushBotBacklinks
Disallow: /

User-agent: SemrushBot-CT
Disallow: /

User-agent: SemrushBot-OCOB
Disallow: /

User-agent: SentiBot
Disallow: /

User-agent: SEOkicks
Disallow: /

User-agent: SERankingBacklinksBot
Disallow: /

User-agent: Serpstatbot
Disallow: /

User-agent: SeznamBot
Disallow: /

User-agent: ShapBot
Disallow: /

User-agent: SlickBot
Disallow: /

User-agent: SmartologyBot
Disallow: /

User-agent: Spider
Disallow: /

User-agent: Taboola
Disallow: /

User-agent: Taboolabot
Disallow: /

User-agent: TavilyBot
Disallow: /

User-agent: TikTokSpider
Disallow: /

User-agent: TTD-Content
Disallow: /

User-agent: Uipbot
Disallow: /

User-agent: VelenPublicWebCrawler
Disallow: /

User-agent: Verity
Disallow: /

User-agent: weborama-fetcher
Disallow: /

User-agent: webspidermount
Disallow: /

User-agent: webzio
Disallow: /

User-agent: webzio-extended
Disallow: /

User-agent: wknd-bot
Disallow: /

User-agent: YaDirectFetcher
Disallow: /

User-agent: Yahoo Ad monitoring
Disallow: /

User-agent: YisouSpider
Disallow: /

User-agent: *
Disallow: /hero-dashboard/
Disallow: /member/

User-agent: Morning Paper
Disallow: /

User-agent: NPBot
Disallow: /

User-agent: Art-online.com
Disallow: /

User-agent: turnitinbot
Disallow: /

User-agent: baiduspider
Disallow: /

User-agent: aipbot
Disallow: /

User-agent: maxamine.com--robot
Disallow: /
sitemap: http://www.scoop.co.nz/sitemap.xml
<%def all_bots>\
Disallow: /cgi-bin/
Disallow: /myscoop/
Disallow: /stories/print.html
Disallow: /stories/email/
Disallow: /share/
Disallow: /xl
<% $spamtrap %>
<%init>
my $spamtrap;
unless ($ENV{'HTTP_USER_AGENT'} =~ m/^Mozilla/) {
        $spamtrap = 'Disallow: /robots/bad-robot.html';
}
</%init>
</%def>

History

Changes recorded since June 2026.

No change recorded.

In context

New Zealand
21.8% block at least one AI crawler
Behind Cloudflare
No