xing393939
V2EX  ›  问与答

基于浏览器内核的采集

  •  
  •   xing393939 · Jan 5, 2013 · 3982 views
    This topic created in 4960 days ago, the information mentioned may be changed or developed.
    不是很懂curl这样的采集,不知道能不能完全模拟浏览器的特征,像cookie啥的。
    如果能有基于浏览器内核的采集,像定时执行firebug那样的去采集,感觉可以降低很多门槛。
    比如淘宝商品页的商品介绍图片,可以轻松的拿下了
    14 replies    1970-01-01 08:00:00 +08:00
    binux
        1
    binux  
       Jan 5, 2013
    对于采集这件事来说,curl无所不能
    浏览器内核?干的是渲染的活
    sohoer
        2
    sohoer  
       Jan 5, 2013
    就算是浏览器还有兼容性问题呢,所以只要满足大部份的采集需求就行了
    xing393939
        3
    xing393939  
    OP
       Jan 5, 2013
    比如 http://item.taobao.com/item.htm?id=162446389 ,想抓取它的商品介绍图片,还得熟悉它的js如何实现的,太费周折了
    cxh116
        4
    cxh116  
       Jan 5, 2013
    Watir,主要用来搞浏览器自动化测试,也可以用来采集
    cxh116
        5
    cxh116  
       Jan 5, 2013
    之前用过Watir抓取过淘宝联盟的数据,运行久了会失去响应,必须的kill进程,再重启
    另外,同时启动多个浏览器,也会出现未知异常,这个得自己多折腾
    xing393939
        6
    xing393939  
    OP
       Jan 5, 2013
    reusFork
        7
    reusFork  
       Jan 5, 2013 via Android   ❤️ 2
    Phantomjs
    xing393939
        8
    xing393939  
    OP
       Jan 5, 2013
    @reusFork 爱你!
    guolin
        9
    guolin  
       Jan 6, 2013
    @reusFork 有没有连webkit都不启动,只执行js和解析dom的。因为已启动webkit消耗就大了。
    reusFork
        10
    reusFork  
       Jan 6, 2013
    @guolin 不知道
    luztak
        11
    luztak  
       Jan 6, 2013
    @guolin 考虑下自己改v8?
    [路过打酱油
    vitohe
        12
    vitohe  
       Jan 6, 2013
    clowwindy
        13
    clowwindy  
       Jan 6, 2013 via iPhone   ❤️ 1
    @guolin jsdom
    guolin
        14
    guolin  
       Jan 6, 2013
    @clowwindy 晚上回家试试, 比如抓取奇艺的视频,如果用解析js的方式就可以完全仿真的抓取地址。如果用其他方式,如果奇艺的规则变了就没法抓了。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1555 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 65ms · UTC 16:32 · PVG 00:32 · LAX 09:32 · JFK 12:32
    ♥ Do have faith in what you're doing.