- 1、本文档共4页,可阅读全部内容。
- 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 5、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 6、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 7、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 8、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
基于电商平台商品信息的数据挖掘分析.doc
基于电商平台商品信息的数据挖掘分析
摘 要
本文采用分水岭分割、随机滤波分割算法对网购时的商品图片信息进行分割,从而提取商品的纹理特征信息。这有利于解决吊牌上商品信息与商品规格参数信息的不一致,让消费者更加相信商家提供的商品信息从而自信消费;另一个是图像中文字的检测识别,有利于电商企业更好地做出商品推荐,售后服务和信息监管。
【关键词】网购图片 分水岭分割 纹理
1 背景与挖掘目标
网购时,用户无法直接接触商品,电商提供的商品信息是顾客做出购买决定的重要依据。展现商品信息的形式有很多种,其中大多数是以图片形式呈现。图像可以将事物生动地呈现在我们面前,让我们更直观地接受商品信息。但是照片中的文本信息不能直接检索,处理,从而加大了监管工作的难度与工作量,也为电商管理者带来了不便。在图像中,文字信息包含丰富的高层语义信息,提取这些文字,对图像高层语义的理解,索引和检索非常有用。
传统的OCR技术,能对纸质文字进行字符自动识别,但对于以图片为背景的文字识别效果较差,影响OCR技术效果的因素有:文字及背景的色彩,背景的复杂程度,文本倾斜,图片分辨率以及字符大小等。因此本次建模针对电商平台上图像的文字识别,在已有的传统技术上进行改动,不要直接将图片上的文字写入计算机,而是运用分割算法将图像中的文字提取出来后再写入计算机进行识别,达到能够自动高效的从商品信息图片上提取文本信息的效果。
本用例主要包括以下几个步骤:
1.1 爬取图像集
图像集的获取是本次数据挖掘分析的第一步,本文从图像1中对图像进行随机抽取,存放于txt文件中,得到图像集。
1.2 图像预处理
它的目的是消除图像中无用信息,恢复有用信息,减少误差。第一步是将图像转化为二值图像,第二步是去噪,第三步是倾斜校正,第四步是归一化。
1.3 版面分析
即将版面进行分割,分理出图像中的文本块,图片块和线条,图像中文字块检测是利用图像中文字与背景在模式上的差异,在图像中找到文字的位置,通常图像中的文字检测不是单个字符独立地检测,而是以文字块整体作为对象,利用文字块中文字密集分布所呈现的较为稳定的统计特征来进行模式判断。
1.4 特征提取
从文字的许多特征中找出最重要的特征。良好的特征应具备可区别性,可靠性,数量少等特点。
1.5 字符识别
是对划分出的文字行进行识别,识别为中文,英文字母,数字及标点符号。
1.6 后处理
对识别出的文字进行上下文匹配,即对单字识别的结果进行分词,与词库中的词进行比较,提高系统的识别率,减少误识率。
1.7 结果分析
根据分析结果,让电商企业更好地做出商品推荐,售后服务和信息监管,从而构建健康,有秩序的电商网购平台。
2 商品图像的分割
图像特征提取的目的是从复杂的图像背景中快速提出嵌入的文字,文字在图像中的位置不确定,文字大小任意,字体未知,图像不清晰等因素加强了提取的难度。但是文字特征又使得提取工作有章可循。版面分析是使用计算机自动地完成对图像的分析,最终分离出文本块,线条,图片块等区域,与此同时确定各个区域块间存在的关系。而快速准确的版面分析为字符识别操作的必要条件。
本文采用分水岭分割算法对图1进行分割,分割的结果如图2所示。
3 结束语
在将图像先导入后进行图像预处理,并在已有算法的基础上,实现对图像中文字的检测分割,再将分割后的图片进行特征提取,为广大网民网购时提供参考。
参考文献
[1]张洪瀚,姜娇娇.基于数据挖掘的电子商务商品推荐[J].中国信息界,2007(17).
[2]王红玉.数据挖掘在电子商务中的应用[J].电脑编程技巧与维护,2016(03).
[3]朱蔚恒,陈健,印鉴.数据挖掘在电子商务中的应用[J].计算机工程,2002(08).
作者简介
欧杰泉(1980-),男,大学本科学历。现为广州市轻工职业学校助教。研究方向为图像处理。
作者单位
广州市轻工职业学校 广东省广州市 510650
4
您可能关注的文档
- 基于微信企业号的企业移动协同管理平台.doc
- 基于微信企业号的校园移动服务.doc
- 基于微信公众号的大学生英语语用能力实证研究.doc
- 基于微信公共平台的微课程开发与应用研究.doc
- 基于微信墙的外语课堂交互探究.doc
- 基于微信平台的数字信号处理智慧课堂建设.doc
- 基于微信的农业专家在线服务系统的设计与开发.doc
- 基于微课的翻转课堂之“IF虚拟语气”的案例分析.doc
- 基于微课的翻转课堂教学模式研究:以高职英语写作为例.doc
- 基于微课的高职英语信息化教学应用探索.doc
- 浙江衢州市卫生健康委员会衢州市直公立医院高层次紧缺人才招聘11人笔试模拟试题参考答案详解.docx
- 浙江温州泰顺县退役军人事务局招聘编外工作人员笔试备考题库及参考答案详解一套.docx
- 江苏靖江市数据局公开招聘编外工作人员笔试模拟试题及参考答案详解.docx
- 广东茂名市公安局电白分局招聘警务辅助人员40人笔试模拟试题带答案详解.docx
- 江苏盐城市大丰区住房和城乡建设局招聘劳务派遣工作人员4人笔试模拟试题带答案详解.docx
- 浙江舟山岱山县东沙镇人民政府招聘笔试模拟试题及参考答案详解1套.docx
- 最高人民检察院直属事业单位2025年度公开招聘工作人员笔试模拟试题含答案详解.docx
- 浙江金华市委宣传部、中共金华市委网信办所属事业单位选调工作人员笔试备考题库及答案详解1套.docx
- 广东深圳市党建组织员招聘40人笔试模拟试题及答案详解1套.docx
- 江苏南京水利科学研究院招聘非在编工作人员4人笔试模拟试题及参考答案详解.docx
最近下载
- 【自考复习资料】28061现代教育技术(复习重点).doc VIP
- JB-TG-NFS3-3030用户手册说明书.pdf VIP
- 《智能超轻型飞行器安全技术评估规范》.pdf VIP
- 全国二卷-2025年高考语文真题作文深度点评与分析(2025.6.7).docx VIP
- 小学数学专题研究自考必备最全知识点 .pdf VIP
- 北京卷:议论文-2025年高考语文真题作文深度点评与分析.docx VIP
- 北京卷(2):记叙文-2025年高考语文真题作文深度点评与分析(2025.6.7).docx VIP
- 持续葡萄糖监测临床应用专家共识 2024.pdf VIP
- 部编人教版八年级语文上册全套测试卷(配2025年秋改版教材).doc
- 2025年高考北京卷语文真题作文记叙文深度点评与分析.docx VIP
文档评论(0)