网站死链查询检查前需要准备哪些信息:先备齐范围、入口与判定依据
📍 WDQWDWQD987AAAAA:216.73.217.22
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /3a8f0963bf93.html
📄
网站死链查询检查前需要准备哪些信息:先备齐范围、入口与判定依据
做网站死链查询前,最需要准备的不是工具账号,而是三样东西:要查的范围、可用的入口清单、判定死链的标准。范围决定你查多少页面,入口决定你从哪里发现链接,判定标准决定一个链接到底算不算死链。三者缺一项,结果就会要么漏查,要么把正常页面误报成死链。
先确定查询范围:全站、目录还是指定页面
范围不同,准备工作差别很大。全站查询需要你拿到完整的URL来源,通常包括XML站点地图、导航与栏目结构、历史内容列表。只查某个目录时,你需要该目录的入口页和分页规则。只查指定页面时,准备一份待查URL清单即可。
判断方法:如果你连网站一共有多少可访问页面都说不清,就不要先跑全站扫描,先从栏目页和站点地图建立基础清单。站点地图只反映提交意愿,不保证页面已被收录,也不保证清单完整,所以它适合当起点,不适合当唯一依据。
准备入口清单:链接可能藏在哪些位置
死链查询查的是“链接指向的目标是否可用”,所以你需要知道链接出现在哪里。常见入口包括:
- 主导航、面包屑、页脚等全站模板区域
- 文章正文中的内链和外链
- 列表页、分页、标签页、专题聚合页
- XML站点地图中列出的URL
- 已提交给搜索引擎的旧链接或历史改版记录
如果网站改过域名或目录结构,还要准备旧URL与新URL的对应关系。没有这份对应表,你只能发现“打不开”,却无法判断应该修复、重定向还是删除。
明确判定标准:什么情况才算死链
不是所有非200状态都叫死链。检查前要和执行人约定判定口径:
- 404或410:目标不存在,通常按死链处理。
- 301或302:能跳转到有效页面时不算死链,但跳转链过长或最终仍404要单独记录。
- 403或401:可能是权限或反爬限制,不一定是页面消失,需要人工复核。
- 超时或连接失败:可能是服务器临时问题,也可能是永久失效,应重复检查后再定性。
- 软404:页面返回200但内容为空或提示不存在,需要结合页面内容判断。
这里要区分“可能原因”和“已经定位的原因”。同一个404,可能是链接写错、页面被删、重定向规则失效或服务器配置变化,不能只凭一次扫描就断言唯一原因。
准备工具与访问条件
无论用爬虫工具、日志分析还是搜索引擎后台的抓取错误报告,你都需要提前确认:
- 是否有权访问目标站点,是否需要登录态或IP白名单
- 爬取频率是否会给服务器造成压力,是否需要限速
- robots.txt是否限制抓取;抓取限制不等于可靠的索引移除,也不能代替死链判定
- 是否使用HTTPS;HTTPS不保证安全无漏洞,也不保证排名,只影响连接层面的检查
如果站点有多个子域或独立移动站,要把它们分别列入范围,避免只查主站漏掉移动端链接。
执行前的检查清单与选择步骤
可以按下面顺序准备,再决定查多大范围:
- 列出域名、子域、协议和主要目录。
- 导出站点地图和栏目入口,形成初始URL清单。
- 标记哪些链接来自模板、哪些来自内容、哪些来自外部。
- 确定状态码判定规则和需要人工复核的例外。
- 确认工具权限、限速和检查时间窗口。
- 先小范围试跑,核对结果格式,再扩大范围。
如果只是修复几个已知打不开的链接,准备待查URL和判定标准就够了;如果要做全站健康检查,就必须补齐入口清单和改版对应关系,否则结果无法直接用于修复决策。
下一步:先整理一份包含URL来源、出现位置和期望状态的表格,再用小范围试跑验证判定规则,确认无误后再执行完整查询。