内容采集规则教程：数据处理

5

详情介绍
常见问题

对从内容页面提取的数据进行进一步处理，可以同时添加多个操作，按照从上到下的顺序来执行。

也就是说，上个步骤的结果会作为下个步骤的参数。

提取内容为空：如果提取内容为空，则使用正则匹配从原始页面中再次提取
内容替换/排除：将采集到的内容进行字符串替换，如需排除，则替换为空字符串即可
html标签过滤：过滤指定html标签，比如<a ，<font
字符截取：通过开始和结束字符串对内容进行截取
纯正则替换：通过强大的正则表达式进行复杂的替换。
数据转换：包括将结果简转繁、将结果繁转简、自动转化为拼音和时间修正转化
智能提取：包括提取第一张图片、智能提取时间、智能提取邮箱、智能提取手机号码、智能提取电话号码
高级功能：包括自动摘要、自动分词、Http请求、字符编码转换、同义词替换、空内容缺省值、内容加前后缀、随机插入、运行C#代码、批量内容替换，统计标签字符串长度等一系列功能。
补全单网址：将当前内容作为一个网址进行补全。
文件下载：可以自动探测并下载文件，可设置下载路径和文件名样式。
内容过滤：对于一些不符合条件的记录，可以通过设置内容过滤来删除或标记为未采。

声明：本站所有文章，如无特殊说明或标注，均为本站原创发布。任何个人或组织，在未征得本站同意时，禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益，可联系我们进行处理。

火车头采集器教程

免费下载或者VIP会员资源能否直接商用？

本站所有资源版权均属于原作者所有，这里所提供资源均只能用于参考学习用，请勿直接商用。若由于商用引起版权纠纷，一切责任均由使用者承担。更多说明请参考 VIP介绍。
提示下载完但解压或打开不了？

最常见的情况是下载不完整: 可对比下载完压缩包的与网盘上的容量，若小于网盘提示的容量则是这个原因。这是浏览器下载的bug，建议用百度网盘软件或迅雷下载。若排除这种情况，可在对应资源底部留言，或联络我们。
找不到素材资源介绍文章里的示例图片？

对于会员专享、整站源码、程序插件、网站模板、网页模版等类型的素材，文章内用于介绍的图片通常并不包含在对应可供下载素材包内。这些相关商业图片需另外购买，且本站不负责(也没有办法)找到出处。同样地一些字体文件也是这种情况，但部分素材会在素材包内有一份字体下载链接清单。
付款后无法显示下载地址或者无法查看内容？

如果您已经成功付款但是网站没有弹出成功提示，请联系站长提供付款信息为您处理
购买该资源后，可以退款吗？

源码素材属于虚拟商品，具有可复制性，可传播性，一旦授予，不接受任何形式的退款、换货要求。请您在购买获取之前确认好是您所需要的资源

首页