处理网站死链时,最常见的误操作是把“打不开”“返回404”“被robots.txt挡住”“从站点地图消失”当成同一件事,然后直接删页面、改URL或屏蔽抓取。实际上,死链的核心判断是:目标URL是否还能返回有效内容,以及站内或站外是否仍有链接指向它。下面给出一份可执行清单,每项说明查什么、怎么查、结果说明什么。
要查什么:该URL的HTTP状态码和响应内容,而不是只看浏览器是否显示错误页。
怎么查:用浏览器开发者工具的网络面板,或命令行工具请求该URL,记录状态码。例如:
curl -I https://example.com/old-page
结果说明什么:返回404或410,说明服务器明确表示该资源不存在,通常可视为死链;返回301或302,说明是跳转,不是死链,但要检查跳转目标是否相关、是否形成跳转链;返回403,可能是权限或防火墙拦截,不一定是内容消失;返回200但页面显示“未找到”,说明服务器配置了软404,需要单独处理。
适用条件:先确认状态码,再决定是修复链接、恢复内容还是保留404。把403或超时直接当死链删除,是典型误操作。
要查什么:robots.txt 是否禁止了该路径,以及页面本身是否仍可访问。
怎么查:打开站点根目录下的 robots.txt,检查Disallow规则是否覆盖目标路径;再在未登录、未缓存的情况下直接访问该URL。
结果说明什么:robots.txt 的抓取限制不等于可靠的索引移除。页面可能仍被其他来源引用,也可能仍出现在搜索结果中。若页面本身返回200,它就不是死链,只是抓取受限。把“被robots.txt挡住”当成“页面已死”并删除内容,会误伤仍有效页面。
要查什么:该URL是否出现在站点地图中,以及它是否被站内其他页面链接。
怎么查:在站点地图文件中搜索该URL;再用站内搜索或爬取工具检查是否有内链指向它。
结果说明什么:站点地图不保证收录,也不等于链接有效性清单。一个页面不在站点地图里,仍可能被正常访问和被链接;反过来,站点地图里列出的URL也可能已经404。判断死链应看状态码和链接关系,而不是只看站点地图。
要查什么:证书是否有效、页面是否返回正常内容,以及链接目标是否与当前内容一致。
怎么查:访问该URL,检查证书错误提示;再核对页面标题、主体内容是否与链接锚文本和上下文一致。
结果说明什么:HTTPS 不保证安全无漏洞或排名,也不代表链接目标有效。一个HTTPS页面可以返回404,也可以跳转到无关页面。看到锁图标就认为链接正常,会漏掉内容失效和跳转错配。
面对一个疑似死链,先按下面顺序检查,再决定处理方案。
curl -I或开发者工具请求URL。404/410倾向保留或替换链接;301/302先检查跳转目标。方案选择:当原URL有高度相关的替代内容、且仍有内外链指向时,优先修复为301;当原内容已无替代、链接指向也已清理时,保留404更清晰。两种方案都要以状态码和链接关系为依据,而不是凭“页面打不开”一个现象下结论。
下一步:挑出你站点中最近被报告为“死链”的URL,先记录它的HTTP状态码和至少一个链接来源,再按上面的清单决定是修复跳转还是保留404。