数据闭环数据挖掘平台架构设计:控制面、数据面分离的工程实践.docxVIP

  • 2
  • 0
  • 约3.76千字
  • 约 6页
  • 2026-09-11 发布于浙江
  • 举报

数据闭环数据挖掘平台架构设计:控制面、数据面分离的工程实践.docx

数据闭环数据挖掘平台架构设计:控制面、数据面分离的工程实践

谁来从海量数据里发现高价值场景?这就是数据挖掘平台的位置:它居于闭环的枢纽,输出有两条路——命中存量数据直接回补训练集(零采集成本),未命中则下发定向采集需求,开启新一轮循环。

数据挖掘与AI:从平台架构到抽帧、标签、规则挖掘、VLM?推理、向量化流水线与多模态检索。开篇这篇讲最难也最重要的问题:一个要消费湖仓数据的平台,自身应该怎么设计,才不会破坏单一事实源?

一、平台定位:挖掘域的枢纽与双出口

数据挖掘与多模态检索平台是智驾数据闭环挖掘域的核心工具平台,承担「从海量数据中发现高价值场景」的职责。它用四项核心能力完成这件事:

规则挖掘引擎基于结构化元数据与已有标签,批量产出高价值场景标签——「雨天+夜间+无灯路口」这类组合条件,用SQL就能圈出来;

VLM推理挖掘引擎多模态大模型做语义级标签与关键说明(caption)生成——规则覆盖不了的长尾场景,让大模型看图说话来补;

统一标签体系采集标签、规则标签、大模型标签三来源统一字典、统一管理、可追溯;

多模态语义检索T+1向量化流水线构建图片与文本向量,支撑「以文搜图、以图搜图」。

这四项能力服务的正是上篇全景综述里讲过的「挖掘双出口」:库内命中场景直接回补训练集,零采集成本;未命中才下发定向采集需求。特斯拉DataEngine的「触发挖掘→自动

文档评论(0)

1亿VIP精品文档

相关文档