php获取网页标题和内容函数

  次阅读 来源:互联网(转载协议) 2016-03-01 14:34 我要评论(0)

有时候我们需要获取网页的标题与内容,就是个采集函数,这里简单分享下,方便需要的朋友

代码如下:

function getPageContent($url) {

//$url='http://www.ttphp.com;

$pageinfo = array();

$pageinfo[content_type] = '';

$pageinfo[charset] = '';

$pageinfo[title] = '';

$pageinfo[description] = '';

$pageinfo[keywords] = '';

$pageinfo[body] = '';

$pageinfo['httpcode'] = 200;

$pageinfo['all'] = '';

$ch = curl_init();

curl_setopt($ch, CURLOPT_USERAGENT, "Mozilla/4.0 (compatible; MSIE 5.01; Windows NT 5.0)");

curl_setopt($ch, CURLOPT_RETURNTRANSFER,1);

curl_setopt($ch, CURLOPT_SSL_VERIFYHOST, 0);

curl_setopt($ch, CURLOPT_SSL_VERIFYPEER,0);

curl_setopt($ch, CURLOPT_TIMEOUT, 8);

curl_setopt($ch, CURLOPT_FILETIME, 1);

curl_setopt($ch, CURLOPT_FOLLOWLOCATION, 1);

//curl_setopt($ch, CURLOPT_HEADER, 1);

curl_setopt($ch, CURLOPT_URL,$url);

$curl_start = microtime(true);

$store = curl_exec ($ch);

$curl_time = microtime(true) - $curl_start;

if( curl_error($ch) ) {

$pageinfo['httpcode'] = 505;//gate way error

echo 'Curl error: ' . curl_error($ch) ."/n";

return $pageinfo;

}

//print_r(curl_getinfo($ch));

$pageinfo['httpcode'] = curl_getinfo($ch,CURLINFO_HTTP_CODE);

//echo curl_getinfo($ch,CURLINFO_CONTENT_TYPE)."/n";

$pageinfo[content_type] = curl_getinfo($ch,CURLINFO_CONTENT_TYPE);

if(intval($pageinfo['httpcode']) <> 200 or !preg_match('@text/html@',curl_getinfo($ch,CURLINFO_CONTENT_TYPE) )) {

//print_r(curl_getinfo($ch) );

//exit;

return $pageinfo;

}

preg_match('/charset=([^/s/n/r]+)/i',curl_getinfo($ch,CURLINFO_CONTENT_TYPE),$matches); //从header 里取charset

if( trim($matches[1]) ) {

$pageinfo[charset] = trim($matches[1]);

}

//echo $pageinfo[charset];

//exit;

curl_close ($ch);

//echo $store;

//remove javascript

$store = preg_replace("/<mce:script.*><!--

(.*)<//script>/smUi",'',$store);

//remove link

$store = preg_replace("/<link/s+[^>]+>/smUi",'',$store);

//remove <!---->

本站部分文章来源于网络以及网友投稿,本站只负责对文章进行整理、排版、编辑,是出于传递更多信息之目的,并不意味着赞同其观点或证实其内容的真实性。如果您有什么意见或建议,请联系QQ28-1688-302!

人工智能实验室
相关文章相关文章
  • 长虹新款智能语音空调,告诉你空调也能玩Siri

    长虹新款智能语音空调,告诉你空调也能玩Siri

  • 第一批国家重点研发计划公布,旷视科技开启“五年行动”

    第一批国家重点研发计划公布,旷视科技开启“五年行动”

  • 让AI触手可及  Qualcomm携手创通联达推出全新终端侧AI开发套件

    让AI触手可及 Qualcomm携手创通联达推出全新终端侧AI开发套件

  • 品友互动为Digital Travel APAC2018 唯一受邀中国AI企业

    品友互动为Digital Travel APAC2018 唯一受邀中国AI企业

网友点评网友点评
阅读推荐阅读推荐

据外媒报道,STEER打造了首款完全自动驾驶停车技术,旨在使常规车辆转变为无人驾驶车辆。STEER的首款技术应用是4级自动驾驶及网络安全停车...

近日,美国软性机器抓手制造商 Soft Robotics 宣布,获得 2000 万美元的融资,本轮投资者包括 Scale Venture Partners,Calibrate Ventures...

据外媒报道,加州车管局发布了《2017自动驾驶脱离报告(California Autonomous Vehicle Disengagement Reports)》,其中谈及了脱离的具体...

用人机语音交互,来解决智能家居适老的问题;通过家庭门禁与安防套件、空气净化套件、可燃气体与有害气体监控套件等相互联动,在不同生活情...