搜索广告满意度与模型优化
商业广告搜索满意度评估
商业搜索满意度是评估搜索引擎产品要求,结合商业搜索广告个性化特点,从浏览到点击后、服务后行为的全面评估。其计算公式为:商业搜索满意度 = 大搜搜索满意度 + 用户行为交互机器评价 + 商业后验服务质量。
DNN->ERNIE 模型优化
- 背景与挑战:典型的广告点击率预估模型采用DNN,但直接将文本输入模型存在语义理解挑战,尤其是高噪声落地页内容挖掘。广告点击信号无法完全代表相关性,导致信号失效。
- 技术挑战:长文本建模带来的语义理解挑战,以及性能平方级增长压力。
- 重点举措:
- 常规解法:新硬件(GPU)、蒸馏萃取(128D2H2L)、模型剪枝(顶层优化)。
- 提效举措:离散核心词集合输入与序列模型适配、多层级Token化设计(与凤巢能力结合)。
- 核心词集合输入与序列模型适配:
- 问题的本质是思考posembedding的作用,是否可以退化为词袋模型。
- 业务挑战:落地页侧长文本(~600-1500汉字),需要~140汉字信息量,压缩比率低,性能挑战巨大。
- 基线:以核心词重要性稳定倒排作为模型输入。
- 问题:语义片段破坏严重、核心词排序算法与模型耦合严重、线上quota利用率低。
- Tokenization优化:1字粒度语义特征缺乏对片段文本精确建模的能力,算力消耗大。
- 多层级Token化设计:带入先验切词知识,以每个token的硬编码形式语义收敛取代soft语义收敛,以精确语义到宽泛语义逐渐兜底的token策略,保证专名优先,再用basic词粒度承接,最后由字粒度兜底。
PROMPT的应用
- 行业化业务发展与平台策略模型:
- 方案:新增行业id作为tokenid,给予独特的pos/typeembedding,预训练阶段强制mask行业id,增加行业分类任务预估,Finetune阶段将行业id作为softprompt引入样本,作为分类行业锚点,实现隔离性。
- 技术抽象:一种具有良好隔离性的增量学习范式,一种双塔语义模型优化方法。
- 策略分析:思考预训练双塔模型的必要性,一般做法是预训练单塔模型,NSP任务在每个塔的作用上有效吗?sentence_B的信号去哪里了?同构或异构双塔模型均采用产出模型作为encoder,输入对应文本作为sentence_A。
AIGC与想象力
- AIGC解决的问题:
- 搜索广告商业生态问题再回顾:供给侧是天花板,搜索广告优质供给不变条件下,用户体验单维优化难有突破。
- 求解路径:多管齐下,驱动优质内容建设正循环,联合客户,协同优化。
- 生成式模型与搜索满意度预估:
- 自动化物料生成、debug&&解释性工具、系统级别LLMreward。