新版采集示例
我们以新浪网环球新闻做个示例用新的内容采集工具来采集新闻页面地址http://roll.new s.s ina.c om.cn/news/gjxw/hqqw/index_1.shtml
所要采集的新闻页面最好是列表页
例页面上有显示上一页 123. 。 。 。 。 。下一页
比如第一页它的地址是 http://roll.new s.sina.c om.cn/news/gjxw/hqqw/index_1.shtml单击第二页地址就是 http://roll.new s.s ina.c om.cn/news/gjxw/hqqw/index_2.shtml
有一种规律性的延伸。
后台设置如下
首先进入后台单击“文章采集”单击左侧的“规则设置NEWS”。
1、将采集的页面地址复制到【采集路径】中
2、将采集的页面地址复制到【路径参数】将1替换为{0}
3、采集页数自已填写数字 例如 1
4、 页面编码可鼠标右击查看页面源文件
查看到这个页面编码为gb 2312那么就在页面编码里输入“gb 2312” 当然也有是utf-8的比如
所以根据采集的页面编码来输入。点击“下一步”
5、在这里我们可以看见这些采集的规则设置
“列表标签”就是整个新闻列表的标签查看页面源文件找到新闻条目如图
那么我们就可以定义“列表“标签”为“//ul [@c las s="lis t_009"]” ”为什么是这样规则呢
因为设置的格式是这样的 //+标签的起始代码+[@+标签的属性] 看到下面你就会明白了。那么“详细页标题标签”就是 //h1 [@id="artibodyTitle"]
那么“详细页内容标签”即是 //div [@id="artibody"] 注 当标签里同时有class和id时优先选择id属性jwWWmMMM第四维度——免费学习建站首选品牌
设置好的即如下图
然后单击“下一步”
7.看到如上图所示标有成功字样 即表示设置成功再点击“完成”按纽即可。
如果出现下图标题失败或者内容失败则表示不成功重新设置标签规则直到出现成功字样为止如图
8、点击“采集”jwWWmMMM第四维度——免费学习建站首选品牌
9.再点击“确定”
10、新闻采集成功之后采集的内容都会在临时内容里显示。点击文章采集—临时内容new
11.将已采集好的新闻勾选起来点击转移
12.选择转移的新闻类别 点击转移
13.提示操作成功之后确定去新闻管理查看刚刚转移的内容 内容管理—新闻模块—新闻管理。将转移的新闻勾选更新
这样采集的新闻就会显示在网站上了。jwWWmMMM第四维度——免费学习建站首选品牌
昔日数据怎么样?昔日数据是一个来自国内服务器销售商,成立于2020年底,主要销售国内海外云服务器,目前有国内湖北十堰云服务器和香港hkbn云服务器 采用KVM虚拟化技术构架,湖北十堰机房10M带宽月付19元起;香港HKBN,月付12元起; 此次夏日活动全部首月5折促销,有需要的可以关注一下。点击进入:昔日数据官方网站地址昔日数据优惠码:优惠码: XR2021 全场通用(活动持续半个月 2021/7...
数脉科技怎么样?昨天看到数脉科技发布了7月优惠,如果你想购买香港服务器,可以看看他家的产品,性价比还是非常高的。数脉科技对香港自营机房的香港服务器进行超低价促销,可选择10M、30M的优质bgp网络。目前商家有优质BGP、CN2、阿里云线路,国内用户用来做站非常不错,目前E3/16GB阿里云CN2线路的套餐有一个立减400元的优惠,有需要的朋友可以看看。点击进入:数脉科技商家官方网站香港特价阿里云...
HostKvm发布了夏季特别促销活动,针对香港国际/韩国机房VPS主机提供7折优惠码,其他机房全场8折,优惠后2GB内存套餐月付仅5.95美元起。这是一家成立于2013年的国外主机服务商,主要提供基于KVM架构的VPS主机,可选数据中心包括日本、新加坡、韩国、美国、中国香港等多个地区机房,均为国内直连或优化线路,延迟较低,适合建站或者远程办公等。下面分享几款香港VPS和韩国VPS的配置和价格信息。...