温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

php怎么使用pthreads v3多线程实现抓取新浪新闻信息

发布时间:2021-05-24 11:53:41 来源:亿速云 阅读:215 作者:小新 栏目:开发技术

这篇文章主要介绍php怎么使用pthreads v3多线程实现抓取新浪新闻信息,文中介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们一定要看完!

我们使用pthreads,来写一个多线程的抓取页面小程序,把结果存到数据库里。

数据表结构如下:

CREATE TABLE `tb_sina` (  `id` int(11) unsigned NOT NULL AUTO_INCREMENT COMMENT 'ID',  `url` varchar(256) DEFAULT '' COMMENT 'url地址',  `title` varchar(128) DEFAULT '' COMMENT '标题',  `time` datetime DEFAULT NULL ON UPDATE CURRENT_TIMESTAMP COMMENT '时间',  PRIMARY KEY (`id`) ) ENGINE=InnoDB DEFAULT CHARSET=utf8mb4 COMMENT='sina新闻';

代码如下:

<?php class DB extends Worker {   private static $db;   private $dsn;   private $root;   private $pwd;   public function __construct($dsn, $root, $pwd)   {     $this->dsn = $dsn;     $this->root = $root;     $this->pwd = $pwd;   }   public function run()   {     //创建连接对象     self::$db = new PDO($this->dsn, $this->root, $this->pwd);     //把require放到worker线程中,不要放到主线程中,不然会报错找不到类     require './vendor/autoload.php';   }   //返回一个连接资源   public function getConn()   {     return self::$db;   } } class Sina extends Thread {   private $name;   private $url;   public function __construct($name, $url)   {     $this->name = $name;     $this->url = $url;   }   public function run()   {     $db = $this->worker->getConn();     if (empty($db) || empty($this->url)) {       return false;     }     $content = file_get_contents($this->url);     if (!empty($content)) {       //获取标题,地址,时间       $data = QL\QueryList::Query($content, [         'tit' => ['.c_tit > a', 'text'],         'url' => ['.c_tit > a', 'href'],         'time' => ['.c_time', 'text'],       ], '', 'UTF-8', 'GB2312')->getData();       //把获取的数据插入数据库       if (!empty($data)) {         $sql = 'INSERT INTO tb_sina(`url`, `title`, `time`) VALUES';         foreach ($data as $row) {           //修改下时间,新浪的时间格式是这样的04-23 15:30           $time = date('Y') . '-' . $row['time'] . ':00';           $sql .= "('{$row['url']}', '{$row['tit']}', '{$time}'),";         }         $sql = rtrim($sql, ',');         $ret = $db->exec($sql);         if ($ret !== false) {           echo "线程{$this->name}成功插入{$ret}条数据\n";         } else {           var_dump($db->errorInfo());         }       }     }   } } //抓取页面地址 $url = 'http://roll.news.sina.com.cn/s/channel.php?ch=01#col=89&spec=&type=&ch=01&k=&offset_page=0&offset_num=0&num=60&asc=&page='; //创建pool池 $pool = new Pool(5, 'DB', ['mysql:dbname=test;host=192.168.33.226', 'root', '']); //获取100个分页数据 for ($ix = 1; $ix <= 100; $ix++) {   $pool->submit(new Sina($ix, $url . $ix)); } //循环收集垃圾,阻塞主线程,等待子线程结束 while ($pool->collect()) ; $pool->shutdown();

由于使用到了QueryList,大家可以通过composer进行安装。

composer require jaeger/querylist

不过安装的版本是3.2,在我的php7.2下会有问题,由于each()已经被废弃,所以修改下源码,each()全换成foreach()就好了。

运行结果如下:

php怎么使用pthreads v3多线程实现抓取新浪新闻信息

数据也保存进了数据库

php怎么使用pthreads v3多线程实现抓取新浪新闻信息

PHP开发环境搭建工具有哪些

一、phpStudy,是一个新手入门最常用的开发环境。二、WampServer,WampServer也同样的也是和phpStudy一样操作简单对小白比较友好。三、XAMPP,XAMPP(Apache+MySQL+PHP+PERL)是一个功能强大的建站集成软件包;四、MAMP,MAMP分为两种MAMP和MAMP Pro for Mac。五、宝塔面板,宝塔面板是一款服务器管理软件,支持windows和linux系统。六、UPUPW,UPUPW是目前Windows平台下最具特色的Web服务器PHP套件。

以上是“php怎么使用pthreads v3多线程实现抓取新浪新闻信息”这篇文章的所有内容,感谢各位的阅读!希望分享的内容对大家有帮助,更多相关知识,欢迎关注亿速云行业资讯频道!

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI