判断网站被挂马检测工具是否采集遗漏,核心是建立一条可复核的证据链:先用站内可获取的页面清单和URL来源做基准,再与工具输出的检测结果逐条比对,最后对差异项人工确认是漏采、误报还是页面本身不可访问。不能只看工具报告里的“已扫描数量”就下结论,因为扫描数量不等于有效覆盖。
遗漏判断的前提是有一份“应检清单”。这份清单可以从以下来源合并得到:
sitemap.xml中列出的URL;?id=或分页参数的地址。把这些来源去重后,得到一份基准URL集合。注意:搜索引擎收录量、第三方流量估算和站内日志的口径不同,不能互相替代。收录量可能滞后或只代表部分索引,不能直接当作应检清单。
把工具输出的已检测URL列表导出,与基准清单做集合运算:
这里最关键的一步是对疑似遗漏项做人工复访,而不是直接相信差集。因为差集里可能混入以下情况:
robots.txt或防火墙规则限制,工具主动跳过;只有人工复访确认页面可正常访问、且工具确实没有检测记录时,才判定为采集遗漏。
发现遗漏后,不要直接断言是工具缺陷。先做一组对照检查:
www与不带www、带尾斜杠与不带尾斜杠、大小写不同的地址,可能被工具视为不同页面,导致统计上看似遗漏。把上述检查结果记录下来,才能把“可能原因”收敛为“已经定位的原因”。例如,如果手动添加后能扫描,且原任务配置了深度限制,那么可以定位为范围配置导致的遗漏,而不是工具无法检测该页面。
网站结构会变化,今天完整的清单明天可能就过期。建议在以下时点重新执行比对:
每次比对只需保留三样东西:基准清单、工具输出、差异项的处理结论。这样下次出现类似问题时,可以直接对照历史记录判断是新增遗漏还是重复问题。
下一步:从你当前使用的网站被挂马检测工具中导出最近一次检测的URL列表,与站点地图做一次差集比对,把差异项逐条人工复访并记录状态码。