不是很懂curl这样的采集,不知道能不能完全模拟浏览器的特征,像cookie啥的。
如果能有基于浏览器内核的采集,像定时执行firebug那样的去采集,感觉可以降低很多门槛。
比如淘宝商品页的商品介绍图片,可以轻松的拿下了
如果能有基于浏览器内核的采集,像定时执行firebug那样的去采集,感觉可以降低很多门槛。
比如淘宝商品页的商品介绍图片,可以轻松的拿下了
1
binux Jan 5, 2013
对于采集这件事来说,curl无所不能
浏览器内核?干的是渲染的活 |
2
sohoer Jan 5, 2013
就算是浏览器还有兼容性问题呢,所以只要满足大部份的采集需求就行了
|
3
xing393939 OP 比如 http://item.taobao.com/item.htm?id=162446389 ,想抓取它的商品介绍图片,还得熟悉它的js如何实现的,太费周折了
|
4
cxh116 Jan 5, 2013
Watir,主要用来搞浏览器自动化测试,也可以用来采集
|
5
cxh116 Jan 5, 2013
之前用过Watir抓取过淘宝联盟的数据,运行久了会失去响应,必须的kill进程,再重启
另外,同时启动多个浏览器,也会出现未知异常,这个得自己多折腾 |
6
xing393939 OP |
7
reusFork Jan 5, 2013 via Android Phantomjs
|
8
xing393939 OP @reusFork 爱你!
|
12
vitohe Jan 6, 2013
|