在Chrome全面停用第三方cookie之后的一周,一家大型DSP测量了自己的人群匹配率:一夜之间从72%跌到31%。
恢复最快的团队早已建好多信号定向管道,其余团队花了几个月做改造。
把第一方数据作为价值最高的定向信号接入
拥有直接用户关系的公司——通过会员计划、登录态体验和邮件订阅建立——手中握有程序化广告里最有价值的数据。
接入经过认证的第一方信号的需求方平台,比依赖概率人群包的平台多匹配20-40%的展示。相关工程工作包括:
- 灵活的身份识别链路,可接收哈希邮箱、登录事件和媒体方提供的 ID
- PII隔离边界防止原始用户数据跨越系统边界,广告交易平台不会看到未哈希的标识符
- 在竞价时刻做实时人群评估,而不是用几小时内就会失效的批量人群
- 发布商数据接入API可接收自定义分类体系,无需改动DSP侧的表结构
只有当接入链路处理得足够快、能支撑实时竞价决策时,第一方数据才有价值。刷新周期长达 6 小时的批处理链路会错过其中大部分价值。
隐私优先的定向要求在每一处数据边界上保持工程严谨部署可媲美用户级定向精度的上下文 AI
上下文定向早已超越关键词匹配。基于 Transformer 的模型分析整页语义——主题、情感、品牌安全信号——在很多投放类型上,定向精度可以媲美用户级数据。
对广告技术开发团队的好处是:上下文信号不需要用户数据,没有复杂的同意管理,也没有监管风险。约束是:推理必须在广告请求时完成。
- 对超时为10ms的实时竞价平台来说,让每次出价评估多花5ms的上下文分类器太慢
- 在抓取阶段对发布商页面做预分类,把实时开销降为一次不足0.5ms的缓存查询
- 基于广告主特定品牌安全要求训练的语义模型,在相关性指标上比通用分类器高出15-25%
上下文 AI 无需用户数据即可完成定向。工程代价在推理速度,而不在隐私合规。
整合三项已达到生产成熟度的隐私增强技术
目前有三类隐私增强技术(PET)已在生产环境运行:
- 端上处理:ML推理在用户设备上运行,只把聚合后的信号发给广告交易平台。Apple的SKAdNetwork和Google的Topics API都是这个思路。
- 数据洁净室——DSP 开发团队和 SSP 开发团队都用数据洁净室匹配第一方数据集,双方都不暴露原始用户数据。让这类关联快到足以支撑实时竞价决策,是核心的工程难题。
- 差分隐私:向聚合数据加入经过校准的噪声,防止识别到具体用户。适用于无需精确到用户粒度的测量与报表场景。
隐私增强技术必须并入竞价链路,且不增加延迟解决供应方平台的变现难题
发布商面临一个具体问题:既要变现库存,又不能把用户数据泄露给竞价链条上的每一个买方。
卖方自定义受众让供应方平台把自己的用户划分成人群包,并在不暴露个人身份的前提下提供给买方。实现需要:
- SSP在媒体方第一方数据上运行自有的受众分类模型
- 与买方预期兼容的人群分类体系——以IAB Content Taxonomy 3.0为基准
- 人群信号随竞价请求一同传递,不给拍卖增加延迟——开销目标控制在1ms以内
应对没有浏览器信号的移动应用环境
应用内展示完全缺少浏览器层面的信号。IDFA在iOS上采用选择加入机制,授权率大约为25%。
在移动端做好受众定向,需要投入这些方向:
- SDK层的上下文信号——应用类目、会话深度、应用内行为模式
- 端上推理模型,在不传输原始行为数据的前提下评估用户意图
- 用服务器到服务器的归因回调取代基于像素的跟踪——回调在展示发生几分钟甚至几小时后才到达,因此需要可靠的基础设施、去重逻辑和容忍延迟的设计
- 针对应用内场景重新训练点击率模型——应用内的用户交互模式与网页端差异很大
构建灵活的数据管道,扛得住下一次定向变化
定向技术格局仍在按季度变化。围绕单一方案搭建僵化管道的工程团队,会面临昂贵的返工。
- 构建统一接口的数据接入层,兼容第一方、上下文和群组等多种信号类型
- 投入身份识别能力,使其在已登录和匿名两种场景下都能生效
- 把度量基础设施当作一等工程问题,而不是事后补上的报表
- 所有与隐私相关的计算都要按竞价超时预算做基准测试
最终胜出的需求方平台,是把信号灵活性当作架构原则而不是功能需求的那一个。