Loading...
  所在位置:论坛首页 -> ┈┋业界相关┋┈ -> 网站运营及收益 -> [转帖]优化新思路:SEO查重算法 打造终极“伪原创”

[转帖]优化新思路:SEO查重算法 打造终极“伪原创”

作者:别太狂 时间:2008-5-12 11:28:16 收藏 编辑

大家好, 我是 ,呵呵,第一次在在这里来写东西,感觉不太好意思啊,我是SEO初学者,在网上看过几篇文章,也看过两本书,对SEO来说,没有什么很深的体会,只是单纯就我所知道的某一点来写写,大虾们别笑啊!

  我现在要讲的是:网页查重算法,也就是搜索引擎是怎么检查两个网页的相似性的?这应该是大家应该比较关心的问题吧,因为这有助于让你的“伪原创”更像一个“原创”

  首先我跟大家讲有名的I—MATCH算法。

  我们在比较两件事物的相似性时,往往都会拿能均衡的反应这事物本质的东西来比较,就像比赛时,要去除一个最高分和最低分,然后再变算总分一样~~

  I—MATCH算法基于的依据是,在文挡中,特别高频的词和特别低频的词无法反应这一个文挡的真实内容,所以在比较之前,先将文挡中高频词和低频词去掉(注意:这里的高频和低频指的是文档频率,并非关键词在你网页中的密度!)

  我们来看一个例子:

  这里有两段网页文字:

  1.中国足球队在米卢的率领下首次获得世界杯决赛阶段的比赛资格,新浪体育播报 。

  2.米卢率领中国足球队员首次杀入世界杯决赛阶段,搜狐体育播报。(嘿嘿,看到这两句很熟吧?)

  文档(一)中去掉高频:中国,在,的,获得,比赛,资格,新浪,体育,播报

  去掉低频:米卢

  则剩下中频词有:足球队,率领,首次,世界杯,决赛,阶段

  文档(二)中去掉高频:中国,搜狐,体育,播报

  去掉低频:米卢,杀入

  则剩下中频词有:率领,足球队,首次,世界杯,决赛 ,阶段

  看到了吧?剩下的,两者是一模一样 这就是相似性的存在

  呵呵,其实这个例子很早就有过的。。

  综上所述:搜索引擎要检测相似性,主要就是要分词和词频的比较!!

  不知道大家是否都清楚了?呵呵,下次再讲一个经典算法:Shingle算法。

  就到这里吧。祝大家的“伪原创”越来越好! SEO学习还任重道远啊!一起努力



·热门回顾

·最新帖子
第1页 共页 共0个回复     <<    >>    
快速回复
  • 支持UBB,HTML标签

  • 高级回复

  • 操作选项:评分 加精 解精 奖惩 设专题 设公告 解公告 固顶 总固顶 解固顶 结帖 解结帖 锁帖 解锁 移帖 删帖
      首页 | 购买指南 | 商业版本 | 虚拟主机 | 特色介绍 | 下载中心 | 支付方式
    Copyright 2004-2008 BBSGood.com Powered By: BBSGood.Speed Version 5.0
      咨询电话:0575-85513832、0575-85513825(传真)、7*24小时咨询服务:13606552007 不良信息举报中心 浙ICP备05029817号
      业务QQ:38958768、客服QQ1:415896239、客服QQ2:343896043、MSN:jccsxx@hotmail.com