一个robots.txt 文件中有什么?
每个robots.txt 文件包含一条或多条记录。一条记录由robot 的用户代理字符串组成,即你愿意遵循的指示和应用于它的指示。不用担心你需要知道在web中漫游的所有robot的用户代理字符串,因为你可以用通配符* 来应用所有的robots。以下是一个记录的例子:
User-agent: *
Disallow: /XYZfinances.htm
Disallow: /admin
Disallow: /news/update.htm
除了用户代理字符串/通配符,只需要包含一个disallow 命令。这一个简单的例子就显示了你将会需要的全部可能性。它表明没有用户代理字符串能够进入 XYZfinances.htm ,用这一行表示:
Disallow: /XYZfinances.htm
或者说用户代理字符串不能进入管理文件夹及其下面的所有文件夹:
Disallow: /admin
或者是新闻文件夹中的update.htm文件,如果新闻文件夹中所有其它内容都可以被索引的话。
在一条记录中你愿意包含多少用户代理字符串的名字都可以。同样在任何一个robots.txt 文件中,你愿意包含多少条记录都可以(只要用一个或多个空行分隔开这些记录就可以)。
每一条单独的记录都可以为一个或多个robots提供不同的指示。但是为那些没有用用户代理字符串所命名的引擎增加一个通配符规则是明智的。最流行的选择是维护用一条记录和一个代表用户代理字符串的通配符所表示一个方案。一个有196个用户代理的清单可参考
http://info.webcrawler.com/mak/projects/robots/robots.htm。
普遍认为,robots应该忽略大小写和版本号。要记住这是大多数商业搜索引擎的robots作者们的意见,因为你不想用那些没用的页面来使用户感到苦恼。但是,虽然在命令行中你可以不必考虑大小写,但是必须保证在键入URL时是准确无误的。虽然Windows NT 对文件名和路径名的大小写无所谓,但并不是所有的平台都如此。
你希望包含进去的其它东西就只有注释了,这些使用UNIX bourne shell 协定,如用#符号表示在hash 符号前面空白,和一行中可以被忽略的剩余部分。如果一行中只包含一个注释的话,它就可以完全被忽略,虽然它在记录之间的作用与空行并不相同。
|