Home

继承者们

火车头使用Post方法采集Ajax页面教程_我的网站

毛骗

A |     

     阿里云优惠券 先领券再下单        前面有写过一篇瀑布流的采集方法,今天在添加一个POST方法来采集Ajax刷新页面的教程。    之前的文章请看:火车头采集动态加载Ajax数据(无分页瀑布流网站)    如果遇到POST方法来架子Ajax数据,这和我之前写的是两个类型,瀑布流是直接刷新出数据的页面。    采集网站分析    采集任何一个新站前我们都要对他进行一番分析才好下手。    列表页分析    这个网站的列表页,前面并不是通过Ajax加载的。      朔州8月26日电 (记者 杨静)2026山西·朔州陶瓷产品进出口交易会26日正在山西省朔州市应县举行。

B | 朔州陶瓷产品技术交流会期间,来自中国陶瓷工业协会、山西工学院陶瓷产业学院、陶瓷企业家等业内人士围绕产品数字化设计、智能品牌建设等议题开展研讨,共话中国陶瓷未来。  中国陶瓷工业协会副理事长侯文全介绍,中国是全球最大的陶瓷生产国与出口国,市场规模持续稳健增长。随着消费者健康意识的提升,兼具抗菌、防霉、抗病毒等功能的健康陶瓷产品快速渗透市场,应用于家庭餐桌、餐饮服务及母婴等高频使用场景。  “《健康陶瓷性能评价规范第1部分:日用陶瓷》团体标准已于2026年7月1日正式实施,首次将抗菌、防霉、抗过敏原、抗病毒核心健康功能纳入日用陶瓷标准体系,填补行业空白。

C | ”侯文全表示,该标准为朔州陶瓷企业提质升级、对标市场提供了行动指南。CTRL+U可以直接看到列表内容,通过浏览器也看不到相关请求地址。    

    因为习惯原因,我直接看了下尾页列表页。  中国科学院上海硅酸盐研究所研究员王士维分享了先进陶瓷及其制备工艺。他表示“结构决定性能,关注显微结构”,先进陶瓷技术为陶瓷产业突破传统边界、拓展新赛道提供全新思路,鼓励科技与产业深度融合,拓宽应用边界。  西班牙凯拉捷特公司中国区商务经理涂磊回顾了数码装饰技术历程,其见证了日用瓷喷墨打印技术在中国落地生根的全过程。针对日用陶瓷企业普遍面临“贴花环节工人后继无人、用工成本攀升”的困境,涂磊坦言“未来日用陶瓷的自动化和数码化势在必行”。  作为扎根朔州的陶瓷教育工作者,山西工学院陶瓷产业学院院长程久发从艺术与生活角度阐释陶瓷创作的哲理性。然后顺手CTRL+U看看网站代码结构有没有大的变化。防止后期采集出错。结果就发现无法看到列表内容。

D | 浏览器可以看到一个通过post请求的地址。    

    这时候就意识到这网站列表页可能后面的应该全是通过Ajax加载的。

E | 程久发表示,陶瓷创作可注入艺术内涵,以艺术赋能提升品牌温度,让产品既有科技硬度,更具文化厚度。    通过笨方法,手动访问页面看看Ajax加载大概是哪些。  本次交流会由应县人民政府承办,活动旨在链接行业高端资源、转化前沿技术成果、健全产业标准体系、赋能品牌价值提升,夯实朔州陶瓷产业优势,提升朔州陶瓷产品核心竞争力。最后找到大概从2200页左右开始Ajax加载。    那我们采集的时候,前面的列表页就可以使用普通方式去采集(速度更快)。    2200页开始到尾页就通过post请求Ajax页面数据。

F |     抓包获取Post数据    这个Ajax地址我在浏览器看不到任何跟页码有关的数据。最后只能使用抓包工具看一下详细的请求内容了。    

    使用抓包工具Fiddler    Fiddler下载地址:OneDrive-Fiddler-Setup_v5.0.20204.45441.zip    安装设置完成后我们打开浏览器。重新访问一下采集页面,Fiddler会抓到很多请求地址。

G |     查看分析Post数据    Ctrl+F 我们搜索那个Ajax地址    

火车头使用Post方法采集Ajax页面教程
    Fiddler会以黄色将搜索到的结果显示出来,我们点击一下他。    
火车头使用Post方法采集Ajax页面教程
    在Fiddler右侧会显示这个请求地址的相关详细信息。    
    信息顶部可以看到是post请求方法。    可以看到有我们请求的页码相关内容。    
    访问不同页码的页面,经过研究发现规律。

H |     

    currentPageIndex的值和页码相关,值等于页码减一。我们访问6139页时,currentPageIndex值是6138。    这就找到了规律,我们打开火车头采集器。

I |     火车头采集器配置分页设置    起始网址填入Ajax请求地址    

    点“高级模式”。    
    点“分页设置”,http请求方式“post”。    
    把我们Fiddler抓包获取的内容填进去。    
    将currentPageIndex值的内容替换成火车头采集器的“分页”标签。

J |     

    下面填入页码。    页面地址是从2200到6140,上面我们分析得出post请求内容的currentPageIndex值是实际页码减一。所以这里面我们填2199到6139.    
    网址获取选项设置    为了筛选出我们需要的内容,我们设置一下网址获取选项。

K |     打开浏览器F12开发工具,预览一下Ajax获取的内容。    

    可以看到链接的形式是    自考成考报名条件有哪些?    完整的链接地址是    https://域名/chengrenzikao/20200611152022.html    那我们就可以使用下面的规则提取地址。    
    我们测试一下网址采集。

L |     测试网址采集    点击测试可能提示“post请求必须选择网页编码”我们在火车头其他设置中将编码选为“UTF8”即可。    

    可以看到已经正确获取到了链接。不放心可以复制链接实际访问一下看看是否正确。    
    注意事项    采集过程注意运行线程和请求间隔时间。

M | 教程在测试时因为开的线程较多,频率过高导致对方网站开启了防CC设置。拉黑了我一个服务器IP,此教程写完用了两台服务器。    我们实际采集可以只开1个线程,并设置合适的间隔时间,比如1000ms到1500ms左右。    本文来自2号站长网,转载请注明出处:https://www.zz2zz.com/331414.html

        
    

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!。

Current article:http://5lbo5ux.runtunpaixufenjuduishuang.pics/q69c/20260826/6619116.html

Published on:14:16:13


Copyright 继承者们 2020-2099 About us | recruitment information | contact us | Site map | Friendly links | Feedback | Site map