新书推介:《语义网技术体系》
作者:瞿裕忠,胡伟,程龚
   XML论坛     W3CHINA.ORG讨论区     计算机科学论坛     SOAChina论坛     Blog     开放翻译计划     新浪微博  
 
  • 首页
  • 登录
  • 注册
  • 软件下载
  • 资料下载
  • 核心成员
  • 帮助
  •   Add to Google

    >> 搜索引擎, 信息分类与检索, 语义搜索, Lucene, Nutch, GRUB, Larbin, Weka
    [返回] 中文XML论坛 - 专业的XML技术讨论区计算机技术与应用『 Web挖掘技术 』 → 目前互联网上公布出来的正文提取算法,大家可以综合比较下 查看新帖用户列表

      发表一个新主题  发表一个新投票  回复主题  (订阅本版) 您是本帖的第 7139 个阅读者浏览上一篇主题  刷新本主题   树形显示贴子 浏览下一篇主题
     * 贴子主题: 目前互联网上公布出来的正文提取算法,大家可以综合比较下 举报  打印  推荐  IE收藏夹 
       本主题类别:     
     kg_1997 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:2
      积分:61
      门派:XML.ORG.CN
      注册:2007/6/24

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给kg_1997发送一个短消息 把kg_1997加入好友 查看kg_1997的个人资料 搜索kg_1997在『 Web挖掘技术 』 的所有贴子 引用回复这个贴子 回复这个贴子 查看kg_1997的博客楼主
    发贴心情 目前互联网上公布出来的正文提取算法,大家可以综合比较下

    正文一般应该是网页中最长的部分,如何抽取正文,这部分是最为核心的。因为如果不能很好的提取原有文章的内容和样式,那么搜索出来的东西就会惨不忍睹.根本就没有使用价值。

      在做正文抽取模块之前曾经参考过很多抽取模式,有配置模版的,有搞视觉匹配的.有搞关键字识别的.挨个做了分析首先配置摸版是不太现实的,因为在搜索技术资讯的时候,根本不知道会搜索到哪个网站,也根本没精力去配置摸版。所以这个行不通。基于视觉效果的分析,这个难度比较大,而且只适合于规范的网站,而现在很多网站根本不规范,广告链接漫天飞.人家都把最好的位置留给广告了.而且我一直怀疑这个模式的可行性,它只是一个善意的推测.所以这方面没做过多尝试。

    ========================================

    目前互联网上公布出来的正文提取算法,大家可以综合比较下,一起来测试下哪个更好用。


    词网--北京词网科技有限公司
    http://demo.cikuu.com/cgi-bin/cgi-contex

    猎兔网页正文提取
    http://www.lietu.com/extract/

    PHP版网页正文提取
    http://www.woniu.us/get_content_demo/

    网页正文提取分析(DEMO)
    http://61.128.196.27/txt

    个人认为http://61.128.196.27/txt 这个提取最牛,基本上无论什么页面都能提取出来,而且能有效的保持原文风格、图片、链接。


       收藏   分享  
    顶(0)
      




    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2010/4/16 12:02:00
     
     GoogleAdSense
      
      
      等级:大一新生
      文章:1
      积分:50
      门派:无门无派
      院校:未填写
      注册:2007-01-01
    给Google AdSense发送一个短消息 把Google AdSense加入好友 查看Google AdSense的个人资料 搜索Google AdSense在『 Web挖掘技术 』 的所有贴子 访问Google AdSense的主页 引用回复这个贴子 回复这个贴子 查看Google AdSense的博客广告
    2024/12/22 7:22:21

    本主题贴数1,分页: [1]

    管理选项修改tag | 锁定 | 解锁 | 提升 | 删除 | 移动 | 固顶 | 总固顶 | 奖励 | 惩罚 | 发布公告
    W3C Contributing Supporter! W 3 C h i n a ( since 2003 ) 旗 下 站 点
    苏ICP备05006046号《全国人大常委会关于维护互联网安全的决定》《计算机信息网络国际联网安全保护管理办法》
    62.500ms