先给结论:把咨询记录里“可稳定复现的身份线索”抽出来,按线索合并成“人”,再按时间窗口切分“次”。如果只按消息条数或会话数统计,你得到的往往是次数而不是人数,两者在复购、客服排班和投放评估里会导向完全不同的判断。
常见的一种反常结果:某段时间咨询总量明显上升,但真正的新增用户并没有同步增加。原因通常是同一批人反复来问,每来一次就产生一条新会话。此时如果你把会话数当成人数,就会误判为“拉新有效”。
要区分两种解释,先承认它们都能解释“总量上升”:
这两种解释对应的动作完全相反:前者该继续投放,后者该检查是不是有未解决的问题在反复触发咨询。
不要只看总量,要看可核对的原始记录。以下证据按可靠性从高到低排列:
一个注明假设的短例子:假设某周有100条咨询会话,其中60条带有可识别的会员ID,这60条里只有20个不同ID,且其中5个ID各出现3次以上。那么在“ID可信”的前提下,这60条至少对应20个人,而不是60个人。剩下40条无ID会话无法直接归人,应单独标注为“待定”,不要默认按1:1计入人数。
具体动作是建一张去重对照表:一行一个“人”,列出该人的咨询次数、首次与末次时间、涉及话题。做法如下:
这张表的结果会直接影响下一步:如果确定人数与总次数差距很大,说明问题出在“频次”而非“规模”,此时应优先排查高频话题对应的产品或流程问题,而不是加大拉新投入。反之,如果人数与次数同步增长,才适合把资源放在获取端。
第三方估算流量、搜索引擎报告与站内统计口径不同,咨询数据同样存在口径差异。你手上的“次数”可能来自会话系统,而“人数”只能来自带身份的记录,二者本就不是同一量纲,不能直接相除得出“人均咨询次数”就下结论。
另外,请求量、抓取量或某项统计归零,不能单独证明你的去重逻辑正确。它也可能是采集中断、字段缺失或时间窗口设置错误导致的。判断去重是否可靠,要看同一标识能否在多次记录中被稳定匹配,而不是看某个数字是否好看。
最后提醒一个边界:如果身份线索覆盖率很低,任何人数估算都只是区间,不是精确值。此时更稳妥的做法是先提升标识采集的完整性,再谈人数与次数的拆分,否则后续所有诊断都建立在不可核对的基础上。