域名年龄别只看注册日期,26个站的存档比它更早

域名年龄别只看注册日期,26个站的存档比它更早
张文保 24 分钟阅读 1,170 阅读
本文目录
  1. 一个域名的年龄,公开记录里有几个答案?
  2. 注册记录里那个日期,记的到底是哪一次注册?
  3. 有多少个站,网页存档比注册日期还早?
  4. 存档早了十几年的那几个,当年上面是什么?
  5. 反过来:注册了十七年才有第一个网页的是谁?
  6. 把两个日期摆在一起,131个站分成了四类
  7. 首次存档的年份为什么挤在1996到2002?
  8. 存档记录中间那段空白,是域名掉过的痕迹
  9. 有8个站在档案馆里根本查不到,为什么?
  10. 我的尺子错在哪
  11. 怎么给一个域名做背景调查?
  12. 常见问题解答
  13. 注册记录里的日期和实际不符,是注册商填错了吗?
  14. 怎么快速判断一个域名有没有前世?
  15. 档案馆里查不到,是不是说明这个域名很新?
  16. 存档记录中间断了几年,一定是域名过期了吗?
  17. 做外链评估的时候,这两个日期该用哪个?
  18. 为什么很多站的首次存档都挤在1998年前后?
  19. 买老域名之前,这套检查够用吗?
  20. 权威参考资料
摘要:把131个海外品牌的域名注册记录和它们在互联网档案馆里的第一份网页快照摆到一起,两个日期对不上的比想象中多得多:26个站的网页存档比注册日期还早,最多早13年;反过来也有注册了十七年才出现第一个网页的。差值分布里,只有52个站的两个日期落在同一年前后。glossier.com在2001年那一版存档上挂的是一个成人视频聊天站,govee.com在1998年是美国地方政府的信息门户。

做外链评估、买老域名、或者只是接手一个别人留下的站,多半都会去查一下这个域名多老。查到的那个数字,通常来自注册记录里的registration那一栏。

问题是,那一栏记的不是这个域名第一次被注册的时间,而是当前这一次注册的开始时间。一个域名如果中途过期、掉进删除流程、被别人重新抢注,这个数字就会归零重来。从记录上看,它是个崭新的域名;实际上它可能已经在网上待了二十年,只是换了好几拨主人。

这一轮用两把独立的尺子量了同一批131个域名:一把是各注册局的RDAP记录,另一把是互联网档案馆里最早那份状态码为200的网页快照。两个日期一对,差得相当离谱。

一个域名的年龄,公开记录里有几个答案?

至少三个,而且它们回答的不是同一个问题。

看哪里它回答的问题会在什么时候被重置
注册局的registration事件当前这一次注册是什么时候开始的域名过期删除后被重新注册,就重来一次
互联网档案馆的第一份快照这个地址上第一次出现能抓到的网页是什么时候不会重置,但档案馆1996年才成立,也可能漏抓
品牌自己说的成立年份这家公司什么时候开始做生意和域名毫无关系,可能早也可能晚

三把尺子会分叉,是因为它们各自被不同的事情推动。注册记录跟着钱走,谁付了续费谁就是当前的所有者,前任的痕迹随着记录重建被清空;档案馆跟着抓取走,只要那几年有人爬到过这个地址就留下一份;品牌成立年份跟着工商登记走,和这串字符没有任何绑定关系。一个域名换主人的时候,第一把尺子归零,第二把尺子照旧往前走,第三把尺子刚刚开始。挑域名的时候要评估的那几个维度里,域龄一直是最容易被工具简化成一个数字的,而这个数字恰恰来自最容易被重置的那把尺子。

多数人只查第一个,把它当成域名的年龄。而域名年龄到底影不影响排名这件事,站内之前已经从算法口径讲过一轮;这一篇不谈影不影响,只谈一件更前置的事:你手里那个数字,本身就未必是你以为的那个意思。

注册记录里那个日期,记的到底是哪一次注册?

RDAP是现在查域名注册信息的标准接口,取代了老的WHOIS文本格式。它返回的是一份结构化的JSON,里面有个events数组,每个事件带一个eventAction和一个日期。字段的定义写在RFC 9083里,查询协议本身在RFC 7480

关键在于registration这个事件的语义。它记的是当前这条注册记录的创建时间,而不是这个字符串历史上第一次被注册的时间。一个域名走完过期流程的路径是这样的:到期不续 → 宽限期 → 赎回期 → 待删除 → 从注册局释放 → 任何人都能重新注册。这套流程的各个阶段在ICANN的域名生命周期说明里有完整定义。一旦走完最后一步,新的注册记录就是一份全新的记录,registration从当天算起,前面那十几年在这份记录里一个字都不剩。顺带一提,这和把几个域名合并成一个站时发生的事不一样:那种情况下老域名还在你手里、301还在生效,历史是接着的;而这里说的是记录本身被换掉了。

所以要看见前面那一段,得换一把不会被重置的尺子。互联网档案馆的抓取记录正好符合:它只往里加,不会因为域名换了主人就把历史抹掉。它对外提供一个叫CDX的查询接口,能直接问出某个地址最早的一次抓取是什么时候,用法写在CDX服务的官方说明里。这类按时间维度访问同一个资源的做法,协议层面叫Memento,规范是RFC 7089

有多少个站,网页存档比注册日期还早?

131个域名里,130个拿到了RDAP记录(graza.co所在的.co没在IANA的引导表里登记RDAP服务),122个拿到了档案馆的首次抓取时间。两边都齐的121个,可以直接对账。

其中26个的网页存档早于注册日期,占21.5%。差得最狠的几个:

域名注册记录说档案馆说
menuspace.com2015-04-152002-01-3013年
glossier.com2012-09-242001-12-0311年
liquiddeath.com2014-05-302003-07-2711年
baseus.com2011-03-062002-11-249年
fromourplace.com2019-01-212011-02-078年
rothys.com2012-08-282004-04-158年
oclean.com2005-09-202000-10-185年
govee.com2002-05-191998-12-034年
kotn.com2003-07-171999-10-104年
marinelayer.com2004-03-192000-09-254年

这不是个别现象。这26个里有Glossier、Liquid Death、Rothy's、Our Place这些近十年最有名的DTC品牌,也有倍思、Oclean这样的中国出海品牌。它们的共同点是:创立得晚,但看中的域名早就有人用过。这类域名要么在二级市场上买回来,要么等前一任主人不再续费之后接手,两条路都会让注册记录重新开始计时。

差值的大小也有规律。差1到2年的那批(farfetch、italic、nespresso、pandora、temu、bugaboo、allbirds、snowpeak、soundcore)更像是注册记录做过一次转移或者续期重建,域名未必真的掉过;差4年以上的那批才是典型的易主,因为一个域名要走完到期、宽限、赎回、删除这一整套流程再被别人拿到,本身就需要好几个月,而重新做站又要时间。换句话说,差值不只是个数字,它大致对应着中间隔了几道手续。做尽调时可以拿3年当一条粗略的分界线:差得比它少,多看两眼即可;差得比它多,就该把前世的页面一版一版翻出来了。

存档早了十几年的那几个,当年上面是什么?

光看日期还只是数字。真正有意思的是把最早那一份快照原样取回来,看看当年那个地址上到底是谁。档案馆的URL加一个id后缀就能拿到未经改写的原始归档内容,标题栏一目了然:

域名最早那一版存档的标题
menuspace.com(2002年)BuyDomains.com的域名待售页,写着域名注册、经纪与估价服务
glossier.com(2001年)Sexy Live WebCam Chat,一个成人视频聊天站
govee.com(1998年)Welcome to Govee.com,美国州与地方政府信息资源门户
kotn.com(1999年)Karavan of the Nile, Inc.
rothys.com(2004年)NMS-Forum
marinelayer.com(2000年)整页只有一个词:SORRY

govee.com那一条尤其说明问题。1998年它是一个美国地方政府信息门户,域名本身就是government的谐音;今天它是一个中国出海的智能照明品牌。中间隔了二十多年、两个大洲、两个完全不搭界的行业,而注册记录上只留下2002年那一个日期。

menuspace.com那一条则给出了另一种线索:2002年它已经挂在域名交易商的待售页上。一个域名在待售页上停留过,本身就是它至少易过一次手的证据,而这条证据在注册记录里同样看不到。

顺带说一句,这个动作也是最省事的尽调手段。要买一个老域名的时候,与其看第三方工具给的域龄评分,不如直接把它十年前、十五年前的快照调出来翻两页。过期域名复用怎么做尽调那篇讲过要查的六类信号,这一条可以排在最前面,因为它最便宜也最直观。

反过来:注册了十七年才有第一个网页的是谁?

对账表的另一头同样值得看。有些域名注册得很早,但很多年里没有任何可抓取的网页。

域名注册记录说档案馆最早抓到相隔
shein.com1998-01-162015年17年
flyingtiger.com1997-07-192006年9年
ecoflow.com1998-05-152007年9年
rab.equipment2014-02-122020年6年
brooklynbedding.com2007-07-282013年6年

shein.com那17年的空档最扎眼。域名1998年就注册了,而档案馆第一次抓到能打开的网页要到2015年。这中间可能是域名一直被握在别人手里没做站,也可能做过站但档案馆没抓到。两种解释在这份数据里区分不了,正文只能说到这一步。

但无论哪种解释,结论的方向都一样:注册日期早,不等于这个地址上早就有内容、早就有人链接它。真正和SEO相关的那些积累——外链、被引用、被抓取的历史——绑在有内容的那些年上,不绑在注册记录的第一行。这也是为什么新站起量需要多久这个问题不能用域龄来回答:一个1998年注册但2015年才开始有内容的域名,在搜索引擎眼里的资历是从2015年算的。这一点和域名里塞关键词到底有没有用是同一类误会:大家盯着域名字符串本身,而真正起作用的东西长在别处。

把两个日期摆在一起,131个站分成了四类

121个能对账的站,按两个日期的差值分开:

类型站数说明
存档早于注册26注册记录被重置过,域名有前世
同年或差1年52注册完不久就建了站,记录可信
注册后晚2到3年才有网页28先占坑后做站,或早期没被抓到
注册后晚4年以上才有网页15长期闲置或握在别人手里

只有52个站,也就是不到一半,两个日期是能互相印证的。剩下69个站,你从注册记录里读到的那个年份,和这个地址上实际有内容的年份,对不上。

还有一个数字可以配着看:这122个站有存档的年数,中位数是23年。也就是说这批样本里一半以上的域名,在网上留下痕迹的时间超过二十年。而跨度最短的几个分别是stanley1913.com的7年、beistravel.com的9年、avocadogreenmattress.com的11年——这三个都是近些年才起来的品牌,它们的域名也确实是新的,两把尺子在这里是对得上的。真正的麻烦不在这类站身上,而在那些“域名很老、但老的那部分跟你没关系”的站身上。

做竞品分析或者外链评估时,这个比例值得放在心上。手上那张表里如果有一列叫域龄,那么按这批样本推算,其中大概每十行就有两行的真实历史比表上写的长,另有三到四行比表上写的短。抽样口径决定你看到的结论是真是假,这句话在这里同样成立。

首次存档的年份为什么挤在1996到2002?

122个拿到首次存档的站,年份分布是这样的:

区间站数占比
1996到2002年7057.4%
2003到2011年2218.0%
2012年以后3024.6%

又是一个中间薄两头厚的形状,而且第一段高得反常:1998年一年就有20个站的首次存档落在里面。

这里必须小心,别把档案馆自己的历史当成域名的历史。互联网档案馆1996年才开始存档,早期抓取的重点是那批已经在网上、且被别人链接到的站。所以1996到2002年这个高峰,一部分是真实的(这批样本里确实有大量九十年代就存在的老牌企业域名),另一部分是采集偏差——那几年档案馆做过几次大规模普查,把当时能爬到的域名扫了一遍。

能佐证这一点的是最早那批的日期:8个站的首次存档集中在1996年12月20日到31日这十来天里,包括innisfree、italic、traeger、reebok、bugaboo、pandora、anker。七个毫不相干的域名在同一周被第一次抓到,这显然是抓取方的排期,不是这七个站在同一周上线。把这类批次痕迹当成商业信号,就会得出很滑稽的结论。同一类误读在别处也常见,比如把页面上那个修改时间当成内容真的更新过,或者把页面里声明的第三方域名当成它真的还在被使用。记录方的行为,经常被当成被记录方的行为。

存档记录中间那段空白,是域名掉过的痕迹

除了首尾两个日期,中间那段也有信息。把每个域名逐年是否有存档拉成一条线,就能看见断档。

域名断在哪空了多久
allbirds.com2001年到2015年13年
baseus.com2003年到2012年8年
awaytravel.com2005年到2013年7年
tentree.com2005年到2010年4年
zalando.com2005年到2009年3年
sulwhasoo.com2007年到2011年3年

allbirds.com那条线最完整:2000年有网页,2001年之后整整13年一片空白,2015年重新出现,而Allbirds这个品牌是2016年前后才广为人知的。三条证据——注册日期2002年、最早存档2000年、中间13年断档——拼起来讲的是同一件事:这个域名在成为今天这个品牌之前,先被别人用过一轮,然后荒了很多年。

要提醒的是,断档不能直接等同于域名过期。页面长期返回错误码、被robots规则挡住抓取、或者档案馆那几年没排到它,都会造成同样的空白。判断的时候要把断档和另外两条证据放在一起看,单独一条不足以定论。

还有第三条佐证可以加进来:断档结束之后那一版页面,和断档之前那一版是不是同一个行业。allbirds.com断档前是2000年前后的老页面,断档后2015年那一版已经是今天这个鞋类品牌的雏形,行业完全不同;而zalando.com那3年断档前后都是同一家德国电商,更像是抓取排期造成的空档而不是易主。行业换没换,比断了几年更能说明问题。这套读法和把搜索结果页的历史快照做成可对账的时间线是同一个思路:单点没有意义,序列里的转折才有意义。

有8个站在档案馆里根本查不到,为什么?

131个站里,有8个的CDX查询稳定返回403:dollarshaveclub、dreametech、everlane、fjallraven、framebridge、functionofbeauty、philips、rituals。

403这个码容易和限流搞混,所以先得排除。补采是单线程按字母顺序跑的,把日志翻出来看紧挨着的几行:philips.com返回403的时候,前一行的peakdesign.com拿到了1998年的时间戳,后一行的prose.com拿到了1997年的;rituals.com返回403的时候,前一行的ritual.com和后一行的rothys.com都是正常的。同一时间窗里,隔壁的请求都成功了,这就排除了限流。

剩下的解释是档案馆对这些域名做了访问排除。域名主人可以主动申请把自己的历史快照撤下,某些法域的下架请求也会导致同样的结果。有意思的是这8个里有好几个是把品牌形象看得很重的公司。这也提醒一件事:档案馆这把尺子不是永远可用的,对方随时可以把它关掉。

这把尺子失效的时候,还剩几条路:其他独立运营的存档服务各有各的抓取范围,站内那篇讲Google缓存退役之后网页快照还能怎么查的文章里比较过几家的覆盖差异;再就是从外链数据倒推,看指向这个域名的最早那批链接是什么时候出现的,这条路更贵但不受对方控制。没有哪一把尺子是永远在的,所以做判断的时候最好手里有两把以上。

我的尺子错在哪

这一轮有三处值得交代。

第一处,最早那份快照该不该只认200。第一版只统计状态码为200的抓取,理由是要确认那个地址上真有能打开的页面。但同时也取了一份不过滤状态码的作对照,34个能比的站里有3个不一样:aloyoga.com最早的抓取是2013年5月的一个301跳转,最早的200要到当年10月;buckmason.com和stanley1913.com也是类似情况。差的时间不长,但方向要说清楚——只认200得到的是保守值,真实的首次出现只会更早。

第二处,档案馆的覆盖率不是100%。122个站有首次存档,8个被排除,1个始终没取到。这意味着任何基于这批数据的百分比,分母都是121或122,不是131。文中每个比例都标了实际分母,就是为了避免读者按131去心算。

第三处是个自己写出来的乌龙。验证403是不是限流的时候,写了段脚本从日志里找含403的行,用的是最朴素的字符串包含判断。结果它把jysk.com的时间戳20010519024032和prose.com的19970403185352也当成了403——因为这两串数字里恰好有403这三个字符。虽然不影响结论(真正的403只有两条,前后邻居确实正常),但这个坑很典型:从一行文本里找字段,得按字段找,不能按字符串包含找。同一天在别处也被绊过一次,见站内那篇讲一个字段叫什么和它实际记什么是两回事的实测。

怎么给一个域名做背景调查?

三步,全部免费,十分钟能跑完一个域名。

第一步,拿注册记录里的注册日期。RDAP的地址可以从IANA的引导表里按后缀查到,也可以直接用聚合服务:

curl -s -H "accept: application/rdap+json" https://rdap.org/domain/example.com \
  | python -m json.tool | grep -A2 registration

第二步,拿档案馆的首次抓取时间。CDX接口支持只要一条、只要成功抓取:

curl -s "http://web.archive.org/cdx/search/cdx?url=example.com&output=json&limit=1&fl=timestamp,statuscode&filter=statuscode:200"

# 逐年看有没有断档,一年只返回一行
curl -s "http://web.archive.org/cdx/search/cdx?url=example.com&output=json&fl=timestamp&collapse=timestamp:4"

第三步,把最早那一版原样调出来看。时间戳后面加id这个后缀,拿到的就是当年的原始内容,不带档案馆注入的工具条:

curl -s "http://web.archive.org/web/19981203000000id_/http://example.com/" | head -40

如果手上要批量跑几十个域名,把前两步写成脚本按行读域名即可,注意档案馆那边要控制频率,并发一高就会大面积返回429——这一轮就是被它拦掉一大半,改成单线程加固定间隔才补齐的。把结果连同日志里的抓取记录放在一起对,能看出更多东西。

三个数字拿到之后,按这张表判断:

看到什么说明什么接下来查什么
存档早于注册域名有前世,注册记录被重置过调出前世的页面,看行业是否敏感、有没有被处罚的痕迹
两个日期差1年以内大概率是原始主人,记录可信不用额外查
注册后多年才有网页长期闲置或被人囤着别把注册年份当作积累年份来估值
中间有多年断档可能过期掉过,也可能只是没被抓到结合注册日期和断档后的内容一起判断
档案馆返回403被排除了,这把尺子对它失效换其他存档服务,或只用注册记录加外链历史

最后一句提醒。这三个数字回答的都是历史,不是价值。一个域名有前世不代表它不能用,前世干净也不代表买来就能起量。保哥接手过一个北欧户外装备客户的站,域名是二手的,前一任主人做的是完全不相关的行业,最终决定继续用它的依据不是域龄,而是把断档前后的页面各翻了几十个,确认没有博彩和成人内容的历史,也没有大批量的垃圾外链残留。域名的过去只决定要不要多做几步排查,不决定这个域名值多少钱。

常见问题解答

注册记录里的日期和实际不符,是注册商填错了吗?

不是。registration这个事件按规范记的就是当前这条注册记录的创建时间,域名过期删除后被重新注册,新记录从头开始是标准行为,不是错误。要看更早的历史,只能靠不会被重置的第三方记录,比如网页存档。

怎么快速判断一个域名有没有前世?

一条命令就够:用CDX接口查它最早那次成功抓取的时间,和注册日期比。存档比注册早,基本可以确定注册记录被重置过。本轮131个站里有26个是这种情况,占能对账样本的21.5%。再把最早那版页面调出来看一眼,通常几秒钟就能看出当年是干什么的。

档案馆里查不到,是不是说明这个域名很新?

不一定。查不到有三种可能:域名确实新、当年没被抓到、以及被档案馆排除了访问。本轮就有8个站稳定返回403,其中包括philips这样1987年就注册的老域名。判断新旧不能只看这一个来源,要和注册记录一起看。

存档记录中间断了几年,一定是域名过期了吗?

不一定。页面长期返回错误码、被robots规则挡住抓取、或者那几年档案馆没排到它,都会造成同样的空白。断档只是一条线索,要和注册日期、断档前后的页面内容放在一起才能下判断。本轮有断档的站是9段,涉及8个域名。

做外链评估的时候,这两个日期该用哪个?

看你要评估什么。判断这个域名积累了多久的外链和引用,用有内容的那段时间,也就是存档记录;判断当前这个所有者持有多久、续费风不风险,用注册记录。两个数字回答不同的问题,混用会得出很奇怪的结论。

为什么很多站的首次存档都挤在1998年前后?

互联网档案馆1996年才成立,早期做过几次大规模普查。本轮有8个站的首次抓取集中在1996年12月下旬那十来天里,这几个域名彼此毫无关系,明显是抓取方的排期而不是它们同时上线。所以首次存档年份要当作抓取记录读,不能直接当作上线时间读。

买老域名之前,这套检查够用吗?

不够,但它应该排在最前面,因为最便宜。这套方法只回答历史归属和断档,不回答外链质量、有没有被算法处罚、内容有没有留下负面痕迹。这些要另外查,站内讲过期域名复用的那篇里列了完整的尽调清单。

权威参考资料

分享到
标签
版权声明

本文标题:《域名年龄别只看注册日期,26个站的存档比它更早》

本文链接:https://zhangwenbao.com/domain-first-archive-vs-registration-audit.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交