结论有条件:只有当新旧数据源对同一关键词、同一地域、同一设备类型采用一致的排名口径时,历史曲线才具备可连接性;否则曲线本身没有可比性,强行拼接只会制造“排名突然波动”的假象。判断能否连接,不靠工具界面上的连续性提示,而要靠你手里能核对的口径记录和抽样验证。
“数据源”这个词在不同团队里指代不同东西。对做百度关键词排名查询的人来说,至少要拆成三层:采集入口(从哪个结果页形态取数)、排名口径(是否含推广位、是否区分自然结果与聚合卡片)、样本范围(地域、设备、登录状态、时间点)。换供应商时往往三层同时变,但对外只表现为“换了个数据源”。
如果只有采集入口变了,而排名口径和样本范围保持一致,历史曲线大概率能接上,偏差通常落在可接受的抖动区间内。如果排名口径变了,比如旧源把带“广告”标识的结果排除后再计数,新源把推广位也计入位次,那么同一关键词的“第3名”可能对应完全不同的展示位置,曲线必然断层。
一个可操作的核对动作:挑5到10个你熟悉的关键词,在新旧源同时可用的重叠期各取一次数,逐条记录位次和结果标题。若同一关键词在同一天的两个源里位次差异稳定在固定偏移上(例如始终差1位),说明口径差异是系统性的,可以通过换算对齐;若差异方向随机,说明样本范围或采集时点不一致,曲线不可直接连接。
假设你验证过重叠期,发现新旧源位次差异稳定,于是决定把历史曲线接起来。这个结论在一种情况下会失效:旧源的历史数据本身是滚动覆盖的,而非逐日归档。
很多排名查询工具为了控制存储成本,只保留最近一段时间的逐日明细,更早的数据被压缩成周均值或直接丢弃。此时你在重叠期看到的一致性,只证明“当前两个源口径接近”,并不能证明“旧源三年前的那段曲线也是同一口径采集的”。如果旧曲线早期部分来自压缩后的近似值,而新源从第一天起就是逐日明细,那么连接点之后曲线会显得更“毛刺”,这不是排名真的变抖了,而是数据粒度变了。
区分这两种原因的证据是:查旧源在压缩切换节点前后的数据粒度是否一致。如果旧源在某个时间点之前只有周粒度、之后才有日粒度,那么真正可连接的历史起点应该定在日粒度开始之后,而不是工具里能看到的最早日期。
多个角色对“曲线能不能连”有不同理解时,争论通常停留在“我觉得波动不正常”。把分歧落地成一张核对表,比继续讨论更有效。建议列出这几项,每项都要有可指认的来源:
这份表的作用不是证明谁对,而是把“曲线看起来断了”拆成可以分别验证的条目。通常填完表会发现,争议集中在口径和粒度两项上,而不是数据源本身不可用。
完成抽样对照后,根据差异形态决定下一步。若差异稳定且方向一致,可以在新源数据上做固定偏移换算,再与旧曲线拼接,并在图表上标注换算区间,避免后续读者误读。若差异随机,不要拼接,改为把新旧曲线分段展示,中间留出重叠期作为过渡带,让读者自己看到口径切换的位置。
这个动作会直接影响你之后对“排名下降”的判断:做了偏移换算的曲线,任何超出历史抖动范围的变动才值得追查;分段展示的曲线,则要先排除口径切换造成的假波动,再讨论真实排名变化。无论哪种处理,都应在图表旁注明数据源切换日期和口径差异,让后面接手的人不必重新推导一遍。