网站死链查询检查前需要准备哪些信息:先备齐范围、入口与判定依据

📍 WDQWDWQD987AAAAA:216.73.217.22
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /3a8f0963bf93.html
📄

网站死链查询检查前需要准备哪些信息:先备齐范围、入口与判定依据

做网站死链查询前,最需要准备的不是工具账号,而是三样东西:要查的范围、可用的入口清单、判定死链的标准。范围决定你查多少页面,入口决定你从哪里发现链接,判定标准决定一个链接到底算不算死链。三者缺一项,结果就会要么漏查,要么把正常页面误报成死链。

先确定查询范围:全站、目录还是指定页面

范围不同,准备工作差别很大。全站查询需要你拿到完整的URL来源,通常包括XML站点地图、导航与栏目结构、历史内容列表。只查某个目录时,你需要该目录的入口页和分页规则。只查指定页面时,准备一份待查URL清单即可。

判断方法:如果你连网站一共有多少可访问页面都说不清,就不要先跑全站扫描,先从栏目页和站点地图建立基础清单。站点地图只反映提交意愿,不保证页面已被收录,也不保证清单完整,所以它适合当起点,不适合当唯一依据。

准备入口清单:链接可能藏在哪些位置

死链查询查的是“链接指向的目标是否可用”,所以你需要知道链接出现在哪里。常见入口包括:

如果网站改过域名或目录结构,还要准备旧URL与新URL的对应关系。没有这份对应表,你只能发现“打不开”,却无法判断应该修复、重定向还是删除。

明确判定标准:什么情况才算死链

不是所有非200状态都叫死链。检查前要和执行人约定判定口径:

  1. 404或410:目标不存在,通常按死链处理。
  2. 301或302:能跳转到有效页面时不算死链,但跳转链过长或最终仍404要单独记录。
  3. 403或401:可能是权限或反爬限制,不一定是页面消失,需要人工复核。
  4. 超时或连接失败:可能是服务器临时问题,也可能是永久失效,应重复检查后再定性。
  5. 软404:页面返回200但内容为空或提示不存在,需要结合页面内容判断。

这里要区分“可能原因”和“已经定位的原因”。同一个404,可能是链接写错、页面被删、重定向规则失效或服务器配置变化,不能只凭一次扫描就断言唯一原因。

准备工具与访问条件

无论用爬虫工具、日志分析还是搜索引擎后台的抓取错误报告,你都需要提前确认:

如果站点有多个子域或独立移动站,要把它们分别列入范围,避免只查主站漏掉移动端链接。

执行前的检查清单与选择步骤

可以按下面顺序准备,再决定查多大范围:

  1. 列出域名、子域、协议和主要目录。
  2. 导出站点地图和栏目入口,形成初始URL清单。
  3. 标记哪些链接来自模板、哪些来自内容、哪些来自外部。
  4. 确定状态码判定规则和需要人工复核的例外。
  5. 确认工具权限、限速和检查时间窗口。
  6. 先小范围试跑,核对结果格式,再扩大范围。

如果只是修复几个已知打不开的链接,准备待查URL和判定标准就够了;如果要做全站健康检查,就必须补齐入口清单和改版对应关系,否则结果无法直接用于修复决策。

下一步:先整理一份包含URL来源、出现位置和期望状态的表格,再用小范围试跑验证判定规则,确认无误后再执行完整查询。

图1 图2

nginx