数据闭环规则挖掘引擎实战:从结构化元数据中批量发现高价值场景.docxVIP

  • 0
  • 0
  • 约2.07千字
  • 约 5页
  • 2026-09-14 发布于浙江
  • 举报

数据闭环规则挖掘引擎实战:从结构化元数据中批量发现高价值场景.docx

数据闭环规则挖掘引擎实战:从结构化元数据中批量发现高价值场景

规则挖掘引擎实战

从结构化元数据中批量发现高价值场景:批流双模

标签收进体系之后,挖掘的第一个大规模消费方登场——规则挖掘引擎。它的定位很明确:挖掘漏斗的第一层过滤器。业界做cornercase挖掘的主流范式是「规则先验粗筛+模型不确定性细筛」两级漏斗:先用低成本的规则从海量数据里圈出候选,再让昂贵的模型去精挑。华为ADS的数据闭环同样以规则挖掘作为第一层过滤器,控制下游算力开销。

本篇拆解这套引擎的三件事:规则怎么定义(规则即数据)、规则有哪六大种类(附真实示例)、规则怎么跑(批流双模执行链路)。

一、规则即数据:配置也是湖仓资产

第一个设计决策是「规则即数据」:规则配置存在挖掘平台的MySQL,经FlinkCDC实时同步入湖(ods_mining_rule_config)。规则不是散落在代码里的if-else,而是与业务数据一样可查询、可追溯、可审计的湖仓资产——谁在什么时候改了什么规则,一查便知。

规则的表达与管理能力:

双模式表达:SQL条件+可视化配置——工程师写SQL,业务同学拖配置,产出的规则等价;可组合标签、GPS范围、时间、传感器信号、模型输出等多类条件;

全生命周期管理:创建/修改/禁用/优先级/版本,变更全程留痕;

优先级驱动下游:rule_prio

文档评论(0)

1亿VIP精品文档

相关文档