网页抓取不仅适用于本网站



我使用相同的代码来获取不同网页的价格(特别是 7 个(,一切正常,但在 1 中我无法获得任何数据,你能告诉我这是不可能的,如果页面有任何保护?提前谢谢。

$source = file_get_contents("https://www.cyberpuerta.mx/Computo-Hardware/Discos-Duros-SSD-NAS/Discos-Duros-Internos-para-PC/Disco-Duro-Interno-Western-Digital-Caviar-Blue-3-5-1TB-SATA-III-6-Gbit-s-7200RPM-64MB-Cache.html");
preg_match("'<span class="priceText">(.*?)</span>'", $source, $price);
echo $price[1];

我希望这个结果:$869.00

此代码仅在代码中显示的网站上运行不佳。

将 curl 与代理集一起使用,这通常会欺骗网站保护人员相信它是真正的用户。

$URL = "https://www.cyberpuerta.mx/Computo-Hardware/Discos-Duros-SSD-NAS/Discos-Duros-Internos-para-PC/Disco-Duro-Interno-Western-Digital-Caviar-Blue-3-5-1TB-SATA-III-6-Gbit-s-7200RPM-64MB-Cache.html";
$agent= 'Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1; .NET CLR 1.0.3705; .NET CLR 1.1.4322)'; 
$ch = curl_init(); 
curl_setopt($ch, CURLOPT_SSL_VERIFYPEER, false); 
curl_setopt($ch, CURLOPT_VERBOSE, true); 
curl_setopt($ch, CURLOPT_RETURNTRANSFER, true); 
curl_setopt($ch, CURLOPT_USERAGENT, $agent); 
curl_setopt($ch, CURLOPT_URL, $URL); 
$result =curl_exec($ch);
preg_match("'<span class="priceText">(.*?)</span>'", $result, $price);
echo $price[1];

最新更新