krazy176 大佬有话说 :
爬虫大佬看看,pixabay用的是什么反爬技术?
在家挑个网站学习爬虫,随便选了个pixabay.com,浏览器能正常访问,但是复制浏览器的所有headers用php的curl来抓取,就403了,非常黑科技:
$ch = curl_init(‘https://pixabay.com’);
curl_setopt($ch, CURLOPT_RETURNTRANSFER, true);
curl_setopt($ch, CURLOPT_HEADER, true);
curl_setopt($ch, CURLOPT_SSL_VERIFYPEER, false);
curl_setopt($ch, CURLOPT_FOLLOWLOCATION,TRUE);
curl_setopt($ch, CURLOPT_HTTPHEADER, array(
"accept: text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,image/apng;q=0.8,application/signed-exchange;v=b3",
"Accept-Language:en-US,en;q=0.5",
"Accept-Encoding: gzip, deflate, br",
"User-agent: Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/74.0.3729.131 Safari/537.36",
));
$html = curl_exec($ch);
curl_close($ch);
echo $html;
这到底是咋回事
feixiang 大佬有话说 :
好像是cloudflare的防盗链
Yikmings 大佬有话说 :
套了CF, Detected 到不是正常系統/瀏覽器會自動5秒驗證 :lol