日志存档:05, 2008

向SEO初学者推荐一些文章

2008-05-08,星期四 | 分类:SEO/SEM图片档案 | 标签: |
没时间一篇篇文章发布,把一些先前浏览过的有关SEO文章拍个照,SEO初学者是一个借鉴-重度使用搜索引擎去搜索这些文章吧(网上转载泛滥)。建议再系统的学习相关书籍教程+实践,SEO定会给你带来很大的乐趣和价值! 图一: 图二:

ROBOTS.TXT语法和作用

2008-05-08,星期四 | 分类:SEO技术 | 标签: |
1、 什么是robots.txt? robots.txt是一个纯文本文件,通过在这个文件中声明该网站中不想被robots访问的部分,这样,该网站的部分或全部内容就可以不被搜索引擎收录了,或者指定搜索引擎只收录指定的内容。当一个搜索机器人访问一个站点时,它会首先检查该站点根目录下是否存在robots.txt,如果找到,搜索机器人就会按照该文件中的内容来确定访问的范围,如果该文件不存在,那么搜索机器人就沿着链接抓取。 robots.txt必须放置在一个站点的根目录下,而且文件名必须全部小写。 2、 robots.txt的语法 "robots.txt"文件包含一条或更多的记录,这些记录通过空行分开(以CR,CR/NL, or NL作为结束符),每一条记录的格式如下所示:     "<field>:<optionalspace><value><optionalspace>"。 在该文件中可以使用#进行注解,具体使用方法和UNIX中的惯例一样。该文件中的记录通常以一行或多行User-agent开始,后面加上若干Disallow行,详细情况如下: User-agent: 该项的值用于描述搜索引擎robot的名字,在"robots.txt"文件中,如果有多条User-agent记录说明有多个robot会受到该协议的限制,对该文件来说,至少要有一条User-agent记录。如果该项的值设为*,则该协议对任何机器人均有效,在"robots.txt"文件中, "User-agent:*"这样的记录只能有一条。 Disallow : 该项的值用于描述不希望被访问到的一个URL,这个URL可以是一条完整的路径,也可以是部分的,任何以Disallow 开头的URL均不会被robot访问到。例如"Disallow: /help"对/help.html 和/help/index.html都不允许搜索引擎访问,而"Disallow: /help/"则允许robot访问/help.html,而不能访问/help/index.html。 任何一条Disallow记录为空,说明该网站的所有部分都允许被访问,在"/robots.txt"文件中,至少要有一条Disallow记录。如果 "/robots.txt"是一个空文件,则对于所有的搜索引擎robot,该网站都是开放的。   下面是一些robots.txt基本的用法: 禁止所有搜索引擎访问网站的任何部分: User-agent: * Disallow: / 允许所有的robot访问 User-agent: * Disallow: 或者也可以建一个空文件 "/robots.txt" file 禁止所有搜索引擎访问网站的几个部分(下例中的cgi-bin、tmp、private目录) User-agent: * Disallow: /cgi-bin/ Disallow: /tmp/ Disallow: /private/ 禁止某个搜索引擎的访问(下例中的BadBot) User-agent: BadBot Disallow: / 只允许某个搜索引擎的访问(下例中的WebCrawler) User-agent: WebCrawler Disallow: User-agent: * Disallow: / 常见搜索引擎机器人Robots名字 名称                     搜索引擎 Baiduspider            http://www.baidu.com Scooter              http://www.altavista.com ia_archiver             http://www.alexa.com Googlebot           http://www.google.com FAST-WebCrawler http://www.alltheweb.com Slurp                  http://www.inktomi.com MSNBOT            http://search.msn.com robots.txt举例 下面是一些著名站点的robots.txt: http://www.cnn.com/robots.txt http://www.google.com/robots.txt http://www.ibm.com/robots.txt http://www.sun.com/robots.txt http://www.eachnet.com/robots.txt 常见robots.txt错误 颠倒了顺序: 错误写成 User-agent: * Disallow: GoogleBot 正确的应该是: User-agent: GoogleBot Disallow: * 把多个禁止命令放在一行中: 例如,错误地写成 Disallow: /css/ /cgi-bin/ /images/ 正确的应该是 Disallow: /css/ Disallow: /cgi-bin/ Disallow: /images/ 行前有大量空格 例如写成         Disallow: /cgi-bin/ 尽管在标准没有谈到这个,但是这种方式很容易出问题。 404重定向到另外一个页面: 当Robot访问很多没有设置robots.txt文件的站点时,会被自动404重定向到另外一个Html页面。这时Robot常常会以处理robots.txt文件的方式处理这个Html页面文件。虽然一般这样没有什么问题,但是最好能放一个空白的robots.txt文件在站点根目录下。 采用大写。例如 USER-AGENT: EXCITE DISALLOW: 虽然标准是没有大小写的,但是目录和文件名应该小写: user-agent:GoogleBot disallow: 语法中只有Disallow,没有Allow! 错误的写法是: User-agent: Baiduspider Disallow: /john/ allow: /jane/ 忘记了斜杠/ 错误的写做: User-agent: ...

标准网站开发流程中搜索引擎作用描述

2008-05-08,星期四 | 分类:SEO转载 | 标签: |
一:标准的网站开发流程   二:各个流程搜索引擎的作用描述 立案过程 立案过程是一个商业目的的思考,也是一句广告语的锤炼过程。比如某网站的定位描述是“出售廉价机票”,这就是最简单的商业目的。那么我们建立一个网站的最 本质目的也就如此。即便如阿里巴巴这样复杂的网站,也可以有一句话的定位“商人们的交易平台”。这个时候能够确定的就是网站的主关键词及其同义词。 调研过程 如何调研,我们讨论在调研过程中不要忘记互联网调研。尤其是通过搜索引擎来调研,比如你是一家北京销售灯具的公司,正打算建立一家灯具的 销售网站。那么你要明白你最主要的竞争对手就是北京及其周边地区的同样销售灯具的公司。 虽然互联网已经拓展了交易的边界,这个边界是受限于你的实际商业行 为及定向客户所限的;比如,你的网站是面向全国的青少年,那么你的竞争对手也就是同样行为的网站,在立案之后确定了的网站主关键词来进行调研是一定要做的事情。 策划定位过程 策划也是计划的意思,虽然我们不一定做的很详细,但这个过程还是不能省的。在确定了网站的定位及进行调研之后,我们要策划即符合商业定位,又有一定的特色 的商业流程。(当然了,如果你能找到国外的网站,那么可以考虑使用,会节省策划的时间)。在这时候我们可能用网站群、网站、二级域名、目录来规划整个商业 行为。每个节点都是一个大的或者小的商业行为的描述。比如阿里巴巴,它的china.alibaba.com是中国站,而china.alibaba.com/buy则是一个买东西的商业目录。虽然在网站建立的初期做不到这么多,只能实现一个基本的功能。比如视频网站,开始最先实现的功能必然是播放功能。但我们一定要意识到这种规划未来会带给我们什么样的后果。这个世界就是这样公平,尤其是新网站,老的网站域名、二级目录比比皆是,而新的网站作为站在巨人肩膀上看世界,可以避免很多麻烦。 网站的框架页 UI是网站的框架页,比如首页、分类页、专题页、内容页、登陆页、管理页等核心页面的布局,对于网站的核心页面未来也是搜索引擎最为看重的点,所以他们的 布局一定要有一定的取舍。不能因为商业行为而忽略互联网营销,也不能因为互联网营销而舍弃商业行为。此外要注意排版。 实现 实现的话题很简单,但也最难做,因为一件事情他有表面和瓤子之分。看表面都一样,看代码发现哪个更专业,事情总要做的,只是看其面作还是后面做。当你的项目经理问你,如果按照开发标准,将不能完成老板的开发时间,你的回答是什么?按照标准来,还是开发出来就行? 上线 上线是个简单的事情,就像纳斯达克按个电子按钮那么简单。但是如果你的宣传到位,那么第一天你的信息可能淹没搜索引擎。就如某某公司开业典礼,造成交通堵塞一样。  推广 当你发现别人的商业利润总比你高,你去找原因,原来是搜索引擎在进行辅助。然后你也去找搜索引擎优化专家去做。其实慢慢你会发现,他们的秘诀除了具有广大 的资源优势外,另外最重要的就是为你前面的工作还债。比如立案的时候你的关键词范围太大、调研的时候选错了竞争毒手、策划的网站架构有错误、UI的排版不 够合理、实现的时候不够标准或者上线的时候不够节制。 如果说资源优势可以压倒一切的话,那么只是小的项目,对于一家有着40万页面以上的网站来讲,能找到4万个链接不知道要做多久。看看百度有多少个link,24万个,可能数据不够准确,但我们要反思的是Link资源不是无限的。它就像一个24位的数码排 列。尤其是大型网站,核心工作是维护,而不是开拓,当然也要为某方面的工作还债。
Pages: Prev 1 2 3 4 5 6 7 Next