老周是集团信息部的负责人。去年公司花了三百多万上了套新ERP系统,从财务到生产到采购全部拉通。上线三个月后,老周发现一个尴尬的事:系统跑起来了,但数据进不去。
准确说,不是进不去——是要靠人手工敲进去。每天从各个食堂、仓库传过来的手写订货单、领料单、入库单,全都要人工一条一条录入ERP。ERP自己收不了这些手写纸上的数据。
老周遇到的问题,本质上是企业数字化中最容易被忽略的一环——非结构化数据的入口问题。
什么是"非结构化数据"?
IT圈经常讲的"非结构化数据",指的是那些没有固定格式、不能被计算机直接处理的原始数据。典型的包括:手写单据、纸质文档、照片、语音记录、视频监控。
与之相对的是"结构化数据"——Excel表格、数据库记录、标准格式的电子单据,计算机可以直接读取和处理。
一个残酷的现实是:**企业里大量的业务数据,源头都是非结构化的。** 食堂阿姨手写的订货单、仓库管理员填的领料单、配送司机签的配送单——这些每天产生的海量数据,从产生的那一刻起就是以"非结构化"的形式存在的。它们要变成ERP里可以跑的数据,中间必须经过一道"转换"——以前这个转换靠人,现在可以靠AI。
📊 企业数据的一个基本事实
据行业调研,企业日常产生的数据中,约80%属于非结构化数据。而在制造业工厂和流通行业,这个比例更高——因为大量业务信息仍然通过纸质单据在传递。从手写转成结构化数据的过程(人工录入),占用了IT系统运行中相当比例的人力成本。
为什么ERP、WMS、OA自己搞不定?
很多企业上了系统之后才发现一个问题:系统是电子的,但业务是纸质的。ERP能管你录入之后的数据,但它管不了"录入"这个动作本身。系统不会自动识别一张手写单子上的字,它只能等人把数据敲进去。
所以老周的团队不得不养着几个录入员,每天的工作就是:看纸→打字→确认。这套流程跟有没有ERP完全没有关系——三十年前没有ERP的时候也是这么干的,现在有了ERP还是这么干的。
区别只在于:三十年前打印出来的是纸质报表,现在打印出来的是电子报表。但数据进入系统的方式,一直没有变过。
非结构化数据识别的核心难点
非标数据的识别,为什么通用软件做不了?原因有三:
第一,格式不统一。** 十张食堂手写单有十种写法。有的写品名再写数量,有的反过来;有的画表格线,有的不画;有的用简称,有的写别名。通用软件处理的是"符合规范"的数据,而手写单据最大的特点就是"不规范"。
第二,字迹多变。** 通用OCR训练的是标准印刷体和标准化手写体。但实际的手写单据——圆珠笔没油了、写字的人赶时间、纸张放在潮湿的台面上——这些"现实条件"产生的字迹,远远超出了通用模型的承受范围。
第三,上下文依赖。** "散花"在食堂订货单上大概率是"散花菜"而不是"散落的花";"30斤"后面的单位如果只画了一个圈,根据上下文应该推断为"斤"。这些"行业常识"通用软件没有。
"结构"才是规模化泛化的关键
这是我们一直坚持的一个观点:物理世界的非标数据,只有通过"结构"才能实现规模化处理。
每一张手写单子都是不一样的,但它们的"结构"(品名+数量+单位+备注)是固定的。我们做的事情不是让系统"看懂所有手写字",而是让系统"看懂这一种结构下的手写字"。场景缩小了,精度就能提上去;结构固定了,规模化才有意义。
老周后来在我们的系统上试了一下——他拍了三张食堂手写单上传,系统全部识别正确。他说了一句话挺有意思:"我以为问题出在ERP上,其实问题出在ERP之前那一米。"