个人征信报告,OCR识别,OCR识别技术方案_征信 ocr识别-程序员宅基地

技术标签: 征信报告  征信报告ocr  征信报告OCR公司  征信报告OCR识别技术  

一、产品背景

1、业务需求

个人征信报告是反应个人信用最真实、直观的材料,通过评估个人的信用情况,从而给予信用贷款是国内金融信贷机构通行的做法。

目前个人征信报告都是从人民银行征信中心获取打印的,个人征信数据属于个人隐私信息,不能对金融信贷机构开放,因此,信贷机构从人民银行征信中心获取个人信用数据是比较困难的,必须通过央行的牌照申请。

基于以上情况,现行个人信用贷款的业务模式是:个人从人民银行征信官网查询打印本人的征信报告,提交纸质材料或者扫描影像件给信贷机构,信贷机构将信用数据录入到各自的风控模型中,进而对申请人给予评级和相应额的的贷款。

信贷机构在实际业务中遇到如下的问题:

1)贷款审批流程时间长,容易错过意向客户:由于个人征信报告数量大,而目前的风控系统都需要手工录入个人信用的数据,因此在数据录入环节,手工方式效率低下,阻碍了信用的快速评估。因此,数据从纸质信用报告转化到风控系统中的电子数据,是效率关键所在。

2)信用数据评估不精确,不全面,隐含风险:由于信用报告数据量大,信贷业务部门又希望能快速放款,所以对风控数据评估势必存在疏漏和主观判断。出现这种情况还是因为,信用数据的获取和录入耗费时间。信用数据评估的不精确,对信贷业务会留下潜在的风险,影响贷款决策。

以上是从影响信贷审批效率的一个方面分析的,不难看出,如果提高个人征信报告数据采集的效率将提升整个信贷活动的效率,提升信贷部门的作业效率,提升客户的体验度,从而获取更多的信贷客户。

2、数据获取方案

从实际情况出发,目前获取个人征信报告的途径有三种,简要说明如下:

1)直接对接人民银行的征信系统:目前央行只授权了8家征信企业可以获得个人征信牌照,意味着更多的信贷机构无法直接从官方拿到信用数据,如果从已授权的8家征信企业购买信用数据,即使有非公开渠道,在法律上应该也是禁止的,风险较大;

2)从人民银行查询征信的网页结果中解析征信数据:此方法属于技术手段,存在数据被篡改、数据不可信的问题;

3)通过征信中心,查询并打印个人的征信报告:此方法由于是官方提供了查询打印平台,所以对消费者来说,最便捷,数据也最可信。缺点是贷款人提交的征信报告是纸质版,需要将数据录入到风控系统中,数据采集工作量较大。

对比以上三种方式,信贷机构都选择了第三种,即由贷款人提交个人征信报告,提交方式为征信报告扫描件,大额贷款还需要本人带上征信报告面签。在第三种方式中,录入信用数据到风控系统中是必须的,如何提高数据采集的效率是提升信贷业务效率的关键所在。在经过多个项目的考察和探索、实践,我们研发出一套依托于OCR(光学字符识别)技术快速采集个人征信报告数据的解决方案,从而为信贷机构提供高可靠性的信用数据。

二、解决方案

1、方案工作流程说明如下

OCR(光学字符识别)技术,是通过图像处理技术手段,将图像(影像)上的文字、表格、图像转化为电子版的数据,通过计算机程序,快速实现数据信息的采集。个人征信报告中,存在大量的数据需要手工录入,使用OCR技术将极大提高数据采集的效率和准确度。

解决方案流程如下图所示:

①客户面签时,业务人员将客户的征信报告扫描为图像资料,扫描要求为300DPI(分辨率);

②业务人员将扫描的图像按顺序导入OCR自动识别软件中,软件开始自动分析图像特征和数据;

③表格分析识别/文字分析识别:通过版面分析、表格分析、文字分析,识别出征信报告的表格部分、文字部分。表格分析,检测所有的表格线,并组织成单元格结构,为之后的还原提供数据支撑;文字分析,对非表格部分,进行分析并识别。

④识别结果校验和汇总:表格中,存在多种文字类型和数据格式,通过识别后分析判断,进行二次识别,以提高识别精度。

⑤导出Excel/csv格式:对表格分析识别、文字分析识别的结果进行组织和导出,按照原表格样式进行原版书还原。

A.风控系统:在风控系统和OCR识别系统之间,通过Excel/csv方式进行数据交互。风控系统不需要改造即可使用OCR自动识别出来的数据。

2、方案技术特点

1)速度快:OCR的特点为速度快,识别一张征信报告平均耗时5秒,以一份征信报告6页计算,识别一份征信报告需要30秒的时间,风控系统可以导入Excel数据,那么在30秒内,风控系统就可以获得个人征信报告的数据,对比人工录入,完全录入一份报告的数据,可能需要30分钟。

2)数据详细:采用OCR识别方式,将获得申请人所有详细的信用数据;

3)数据精度高:有数据表明,OCR技术识别率比人工录入的精度要高,计算机作业不受环境、作业疲劳的影响,保证高精度;

4)表格原版式还原:传统的OCR文字识别软件只能处理全幅文字的识别,处理简单表格结构的识别,且有些OCR软件还需要制作识别模板才能识别,不能满足征信报告如此复杂的表格的识别。在本方案中,实现了表格自动检测自动识别的功能,且经过实际测试应用,表格检测的准确率高达99%。因为表格线检测精度高,才可以实现表格原版式还原,还原出一个逻辑结构和征信报告一样的表格。

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/etopliu18500233610/article/details/78688981

智能推荐

分布式光纤传感器的全球与中国市场2022-2028年:技术、参与者、趋势、市场规模及占有率研究报告_预计2026年中国分布式传感器市场规模有多大-程序员宅基地

文章浏览阅读3.2k次。本文研究全球与中国市场分布式光纤传感器的发展现状及未来发展趋势,分别从生产和消费的角度分析分布式光纤传感器的主要生产地区、主要消费地区以及主要的生产商。重点分析全球与中国市场的主要厂商产品特点、产品规格、不同规格产品的价格、产量、产值及全球和中国市场主要生产商的市场份额。主要生产商包括:FISO TechnologiesBrugg KabelSensor HighwayOmnisensAFL GlobalQinetiQ GroupLockheed MartinOSENSA Innovati_预计2026年中国分布式传感器市场规模有多大

07_08 常用组合逻辑电路结构——为IC设计的延时估计铺垫_基4布斯算法代码-程序员宅基地

文章浏览阅读1.1k次,点赞2次,收藏12次。常用组合逻辑电路结构——为IC设计的延时估计铺垫学习目的:估计模块间的delay,确保写的代码的timing 综合能给到多少HZ,以满足需求!_基4布斯算法代码

OpenAI Manager助手(基于SpringBoot和Vue)_chatgpt网页版-程序员宅基地

文章浏览阅读3.3k次,点赞3次,收藏5次。OpenAI Manager助手(基于SpringBoot和Vue)_chatgpt网页版

关于美国计算机奥赛USACO,你想知道的都在这_usaco可以多次提交吗-程序员宅基地

文章浏览阅读2.2k次。USACO自1992年举办,到目前为止已经举办了27届,目的是为了帮助美国信息学国家队选拔IOI的队员,目前逐渐发展为全球热门的线上赛事,成为美国大学申请条件下,含金量相当高的官方竞赛。USACO的比赛成绩可以助力计算机专业留学,越来越多的学生进入了康奈尔,麻省理工,普林斯顿,哈佛和耶鲁等大学,这些同学的共同点是他们都参加了美国计算机科学竞赛(USACO),并且取得过非常好的成绩。适合参赛人群USACO适合国内在读学生有意向申请美国大学的或者想锻炼自己编程能力的同学,高三学生也可以参加12月的第_usaco可以多次提交吗

MySQL存储过程和自定义函数_mysql自定义函数和存储过程-程序员宅基地

文章浏览阅读394次。1.1 存储程序1.2 创建存储过程1.3 创建自定义函数1.3.1 示例1.4 自定义函数和存储过程的区别1.5 变量的使用1.6 定义条件和处理程序1.6.1 定义条件1.6.1.1 示例1.6.2 定义处理程序1.6.2.1 示例1.7 光标的使用1.7.1 声明光标1.7.2 打开光标1.7.3 使用光标1.7.4 关闭光标1.8 流程控制的使用1.8.1 IF语句1.8.2 CASE语句1.8.3 LOOP语句1.8.4 LEAVE语句1.8.5 ITERATE语句1.8.6 REPEAT语句。_mysql自定义函数和存储过程

半导体基础知识与PN结_本征半导体电流为0-程序员宅基地

文章浏览阅读188次。半导体二极管——集成电路最小组成单元。_本征半导体电流为0

随便推点

【Unity3d Shader】水面和岩浆效果_unity 岩浆shader-程序员宅基地

文章浏览阅读2.8k次,点赞3次,收藏18次。游戏水面特效实现方式太多。咱们这边介绍的是一最简单的UV动画(无顶点位移),整个mesh由4个顶点构成。实现了水面效果(左图),不动代码稍微修改下参数和贴图可以实现岩浆效果(右图)。有要思路是1,uv按时间去做正弦波移动2,在1的基础上加个凹凸图混合uv3,在1、2的基础上加个水流方向4,加上对雾效的支持,如没必要请自行删除雾效代码(把包含fog的几行代码删除)S..._unity 岩浆shader

广义线性模型——Logistic回归模型(1)_广义线性回归模型-程序员宅基地

文章浏览阅读5k次。广义线性模型是线性模型的扩展,它通过连接函数建立响应变量的数学期望值与线性组合的预测变量之间的关系。广义线性模型拟合的形式为:其中g(μY)是条件均值的函数(称为连接函数)。另外,你可放松Y为正态分布的假设,改为Y 服从指数分布族中的一种分布即可。设定好连接函数和概率分布后,便可以通过最大似然估计的多次迭代推导出各参数值。在大部分情况下,线性模型就可以通过一系列连续型或类别型预测变量来预测正态分布的响应变量的工作。但是,有时候我们要进行非正态因变量的分析,例如:(1)类别型.._广义线性回归模型

HTML+CSS大作业 环境网页设计与实现(垃圾分类) web前端开发技术 web课程设计 网页规划与设计_垃圾分类网页设计目标怎么写-程序员宅基地

文章浏览阅读69次。环境保护、 保护地球、 校园环保、垃圾分类、绿色家园、等网站的设计与制作。 总结了一些学生网页制作的经验:一般的网页需要融入以下知识点:div+css布局、浮动、定位、高级css、表格、表单及验证、js轮播图、音频 视频 Flash的应用、ul li、下拉导航栏、鼠标划过效果等知识点,网页的风格主题也很全面:如爱好、风景、校园、美食、动漫、游戏、咖啡、音乐、家乡、电影、名人、商城以及个人主页等主题,学生、新手可参考下方页面的布局和设计和HTML源码(有用点赞△) 一套A+的网_垃圾分类网页设计目标怎么写

C# .Net 发布后,把dll全部放在一个文件夹中,让软件目录更整洁_.net dll 全局目录-程序员宅基地

文章浏览阅读614次,点赞7次,收藏11次。之前找到一个修改 exe 中 DLL地址 的方法, 不太好使,虽然能正确启动, 但无法改变 exe 的工作目录,这就影响了.Net 中很多获取 exe 执行目录来拼接的地址 ( 相对路径 ),比如 wwwroot 和 代码中相对目录还有一些复制到目录的普通文件 等等,它们的地址都会指向原来 exe 的目录, 而不是自定义的 “lib” 目录,根本原因就是没有修改 exe 的工作目录这次来搞一个启动程序,把 .net 的所有东西都放在一个文件夹,在文件夹同级的目录制作一个 exe._.net dll 全局目录

BRIEF特征点描述算法_breif description calculation 特征点-程序员宅基地

文章浏览阅读1.5k次。本文为转载,原博客地址:http://blog.csdn.net/hujingshuang/article/details/46910259简介 BRIEF是2010年的一篇名为《BRIEF:Binary Robust Independent Elementary Features》的文章中提出,BRIEF是对已检测到的特征点进行描述,它是一种二进制编码的描述子,摈弃了利用区域灰度..._breif description calculation 特征点

房屋租赁管理系统的设计和实现,SpringBoot计算机毕业设计论文_基于spring boot的房屋租赁系统论文-程序员宅基地

文章浏览阅读4.1k次,点赞21次,收藏79次。本文是《基于SpringBoot的房屋租赁管理系统》的配套原创说明文档,可以给应届毕业生提供格式撰写参考,也可以给开发类似系统的朋友们提供功能业务设计思路。_基于spring boot的房屋租赁系统论文

推荐文章

热门文章

相关标签