先别急着删。把两篇文章并排打开,逐句标出重复的是“事实本身”还是“事实的表述”。多数冗余来自后者:同一组数据被换了三次说法,读者接收到的信息却没有增加。处理顺序应是先合并事实清单,再决定哪篇保留完整版、哪篇只做引用,最后才动句子。
把重复拆成三类,判断会清晰很多。第一类是同一事实的机械换写,例如“公司成立于2015年”和“这家企业自2015年起运营”,信息量完全相同,属于必须处理的对象。第二类是同一事实的不同侧面,比如一篇写产能、一篇写交付周期,共用同一组产线数据,这不算冗余,但需要指明引用来源,避免读者以为是两组独立证据。第三类是同一结论的多次强调,通常出现在开头、小标题和结尾,删掉中间那次往往无损。
判断依据可以很直接:如果删掉其中一处,读者对事实的理解是否发生变化?不变,就是冗余;变了,就是必要重复。
假设你手上有两篇稿件,A篇是主稿,B篇是分发稿。把两篇里出现同一事实的句子都摘出来,列成一张对照清单,只写事实本身,不写修饰语。然后做一次删除测试:把B篇里的重复事实整段拿掉,看B篇剩下的论证是否还站得住。
这个动作的结果会直接决定下一步:删除测试通过,就进入改写;不通过,就先补证据,再谈精简。
出现与直觉相反的结果时,通常是因为读者不是从第一篇开始读的。分发稿被单独看到时,如果核心事实只存在于主稿里,读者会失去判断依据。所以“减少冗余”的目标不是让重复归零,而是让每处重复都承担明确功能:一处用于完整陈述,其余用于简短指回。
可以这样操作:在主稿中把关键事实写全,包括时间、口径和适用范围;在分发稿中只保留一句概括,并说明完整信息在另一篇中。这样既避免同一段话被反复展开,也不会让单篇读者悬空。
第三步最容易走偏。同义词替换不产生新价值,读者能感觉到内容在原地打转。真正有效的做法是让重复的事实承担不同功能,或者干脆让它只出现一次。
没有适用于所有稿件的字数或重复次数标准,也不存在某个固定的关键词密度能让重复变得合理。判断依据始终是:读者能否从当前页面获得完整判断,以及这处重复是否提供了新的角度、新的证据或新的适用条件。三者都没有,就该处理。
另外,请求量或抓取量的变化不能单独证明精简做对了,它还可能来自分发渠道调整、时间波动或统计口径变化。要确认处理效果,应回到内容本身:同一事实是否还有两处以上在重复陈述,且没有新增信息。如果没有,这一步就算完成。