一个在生产环境中跑了2年的"录单Agent"——从拍照感知到执行入库,全链路自主闭环。
不是概念机,是真落地的企业AI智能体。
2024年初,我们在一家食材配送公司部署了第一套手写订单识别系统。那时候还没有"AI Agent"这个热词,我们管它叫"自动录单程序"。
两年后回头看,那个程序做的事情,其实就是今天大家讨论的"AI Agent"——感知输入→理解意图→调用工具→执行任务→闭环反馈。只不过我们的Agent没去写诗作图,它专心做了一件事:把食堂阿姨的手写订货单变成系统里的结构化数据。
一个典型的AI Agent包含四个核心能力:感知、决策、执行、学习。我们的录单Agent在这四个维度上都有对应的实现:
Agent的"眼睛"是OCR识别引擎。它通过深度学习视觉模型"看到"手写单据上的文字。但真实场景中的"看"不是拍张照就完事——Agent需要处理倾斜、反光、水渍、字迹粘连等复杂情况。经过图像预处理(纠偏、对比度增强、噪点过滤)后,才能进入文字识别阶段。
一个典型场景:食堂阿姨在忙碌中写的"西兰花",字迹歪斜、部分笔画被水渍覆盖。Agent的视觉模块需要先校正倾斜、增强对比度,再从模糊的笔画中提取出"西兰花"这个品名。
识别出一串字符只是第一步。Agent还需要理解这些字符的含义——哪个是品名、哪个是数量、哪个是单位。这需要场景知识的支撑。
Agent内部内置了一个餐饮食材知识库(2000+种常见食材及别名),以及一套纠错规则。当识别结果模糊时,Agent会结合上下文做"最佳猜测"——比如看到"散花"结合场景推断为"散花菜",看到"京包"推断为"京包菜"。这不只是OCR,这是语义理解。
Agent的"手"是数据写入接口。识别并结构化后的数据,自动写入ERP/WMS/进销存系统。整个过程不需要人工干预——Agent自主调用系统接口,完成数据的写入和状态更新。
这是Agent和普通OCR最本质的区别:OCR输出的是文字,Agent输出的是结果。一个把"西兰花20斤"变成一串文本,另一个把"西兰花20斤"变成系统中一条可查询、可统计、可与历史数据对比的正式记录。
Agent不是100%正确的。面对极端模糊的字迹或从未见过的单据格式,Agent会把"模糊项"标记出来,等待人工确认。这个确认结果会反馈到系统中——Agent会记住这个纠错,下次遇到类似情况就知道如何处理了。
这就是"持续学习"在真实场景中的样子:不是大模型在云端更新参数,而是Agent在日常使用中不断积累规则、完善知识库。用得越久,准确率越高。
部署时间:2年以上
累计处理单据:超过10万张
常规识别准确率:95%以上
单张处理速度:3-5秒(不含核验)
知识库规模:2000+食材、300+纠错规则
部署场景:食堂、工厂、配送站、仓库
很多人讨论AI Agent时,核心担忧是"人会不会被替代"。但在这个场景里,Agent做的事情不是替代人,而是把人的精力从"低价值重复劳动"中释放出来。
录单员原来每天花5-6小时盯着屏幕打字,现在只需要花20分钟核验Agent的识别结果。剩下的4-5个小时可以用来做更有价值的事情——核对库存、跟进异常订单、优化采购计划。人的价值被提升了,而不是被削减了。
两年多的实践让我们确信一件事:AI Agent落地成功的关键,不是你用了多先进的大模型,而是你选对了场景。
一个好的Agent场景有三个特征:输入是重复的、输出是标准的、价值是可量化的。手写录单恰好完美符合这三个条件——每天都在产生、每天都要录入、录错了就有损失。Agent不需要多聪明,只需要在重复中做到稳定不出错,它的价值就成立了。
如果你也想试试把"录单Agent"用在自己的业务中,可以从一张手写单开始——我们的手写订单识别体验版免费开放,你上传一张正在处理的单子,看看Agent能不能帮你省下那10分钟的录入时间。