《文渊慧典》开发手记之二:市场同类商业版调研
——大胖老师:“小菜,你花过最冤枉的钱是啥?”
——小菜:“给前女友买的口红,结果她跟卖口红的跑了。”
——大胖老师:“……那我比你强点,我花两万八买了套OCR,结果它连‘己’和‘已’都分不清。”
一、调研,从一次“血泪购物”开始
2022年春天,大胖老师所在的高校图书馆获批了一笔古籍数字化专项经费,不多不少,正好三十万。馆长拍着他肩膀说:“老胖啊,这笔钱交给你,买套最牛的OCR系统,把咱们那批明清契约全扫了。”大胖老师当时胸脯拍得震天响:“您放一百个心,市面上那么多成熟产品,挑个最好的,分分钟搞定。”
然后,他就带着小菜,开启了一段堪比“双十一凑满减”的魔幻选型之旅。两个月后,钱花了一半,系统换了三套,古籍一页没扫成。大胖老师在办公室对着天花板长叹:“我当年追你师母都没这么费劲。”
这就是“文渊慧典”立项前最重要的一课——市场调研,不是看广告,是看疗效。以下,就是那些年我们踩过的坑,和花过的冤枉钱。为了保护友商隐私,以下产品名称一律用“某”代替,请勿对号入座。如果硬要对号,那……说的就是你。
二、第一类选手:国际大厂的“洋套餐”
代表产品:某国际知名PDF编辑器(带OCR功能),年费订阅制,基础版1999美元/年起。
大胖老师一开始的想法很朴素:大厂嘛,技术肯定过硬。于是果断下单,下载安装,界面确实高大上,英文菜单、深色主题,一股硅谷精英范儿扑面而来。小菜兴奋地把一页光绪年间的契约扫描件拖进去,点击“识别文本”——进度条转啊转,像极了爱情,最后弹出结果。
一看,大胖老师的血压就上来了。
原图竖排写着:“立賣契人張大發因手頭拮据情愿將祖遺房產一處……”。识别结果:“立青契人弓大因手头吉据情愿将祖遣房一……”。繁体“賣”成了“青”,“張”成了“弓”,“拮据”成了“吉据”,“遺”成了“遣”。错字率高达40%,而且所有文字全堆在一段,竖排顺序彻底乱掉,连标点都没有。
大胖老师不死心,又试了一页民国报纸,上面有横排标题、竖排正文,还带广告插图。结果系统直接报错:“检测到多方向文本,建议旋转页面后重试。”小菜气得直笑:“它让我把每段文字都转成横向?那我不是得先手工PS一遍?我要这OCR有何用!”
更绝的是客服回复:“尊敬的用户,我们的中文OCR目前仅支持横排简体中文。竖排繁体中文属于小众需求,暂未纳入开发路线图。”大胖老师当时就想把“小众”俩字打印出来,贴满全国3000多家图书馆的大门。
小菜总结教训:“洋枪洋炮,打不了中国功夫。这些国际大厂的产品,底层训练数据99%是拉丁字母和横排英文,中文支持就是个添头,更别说竖排繁体。买它,等于花两万块买了个只会说‘Hello’的翻译机,你却指望它给你翻译《红楼梦》。”
三、第二类选手:国内AI云服务的“算费套餐”
代表产品:某国内大厂云OCR,按调用量计费,每千次识别8元,版面分析另加5元,表格识别再加10元。
有了第一次的教训,大胖老师把目光转向国内云服务商。心想着BAT出品,总该懂中文吧?于是又注册账号、充值、领新人优惠券,一通操作猛如虎,上传测试。
这回,竖排繁体倒是认出来了不少,准确率大概在85%左右。但新问题来了:钱。不是一次性买断,是按调用次数收费。大胖老师拿出计算器一摁,倒吸一口凉气。
他们馆藏那批契约文书,大约15万页。单页识别1次就是0.008元,看起来不贵,但注意,古籍不是拍一张就完事的,通常需要多角度补拍、局部放大、不同预处理下的多次识别择优。平均下来,一页要调用3-5次才能拿到理想结果。再加上版面分析、表格识别、印章检测……每页综合成本轻松突破0.1元。
15万页 × 0.1元 = 1.5万元。这只是单次处理。如果后续发现有漏扫、重扫,或者需要调整参数重新识别,每一次调用都在烧钱。大胖老师算了一下五年下来的总成本,吓得保温杯都端不稳了:“够给全系研究生发一年补助了!”
更要命的是数据安全问题。很多古籍是孤本,版权归图书馆所有,甚至涉密。把扫描件上传到商业云平台,等于把自己的家底儿交给别人保管。大胖老师去咨询法务,对方明确表示:上传即授权,出了数据泄露,云服务商只赔你代金券。代金券!小菜吐槽道:“这跟火锅店吃出蟑螂赔张优惠券有啥区别?”
小总结:“云OCR,有技术,但商业模式对图书馆不友好。计费方式像极了早年的手机流量——不用心疼,一用就超,超了就限速,限速了更干不成活。而且古籍不是快消品,它需要反复打磨,不是一锤子买卖。按次计费,就是钝刀子割肉,疼得你不敢放手做。”
四、第三类选手:开源软件的“毛坯房套餐”
代表产品:Tesseract OCR + OpenCV 自定义开发
被商业软件伤透心后,大胖老师决定回归极客本色:“咱自己搞!Tesseract是开源OCR鼻祖,OpenCV是图像处理神器,两个加一起,齐活儿!”小菜当时听了热血沸腾,仿佛已经看到自己站上开发者大会的领奖台。
接下来两个月,才是噩梦的真正开始。
首先,Tesseract的官方中文模型是基于简体的,繁体竖排需要自己训练。训练就要找数据集,可公开的古籍标注数据凤毛麟角。他们东拼西凑了几千张图,训练了三天三夜,得到的新模型准确率不到70%,比不打折的商业版还差。而且Tesseract对文本行检测很弱,遇到竖排加双行夹注,经常把两行当成一行,或者干脆漏掉注文。
其次,版面分析得自己手写。大胖老师用OpenCV写了一套规则:先用投影法找栏,再用连通域找字块,最后通过位置关系判断是正文还是注释。这套规则在测试集上表现不错,可一上真实古籍,瞬间被教做人——有的书页受潮卷边,文字歪斜;有的刻本字距不一,投影法切得七零八落;还有的稿本字迹潦草,连通域算法直接把连笔字当成一块墨疙瘩。小菜一个月改了几百行if-else,每次调整规则都像在打地鼠,按住一处,另一处又冒出来。
最后他们终于搞出一个勉强能用的版本,但速度奇慢,一页要跑两三分钟,而且换一本不同年代的书就得重新调参。大胖老师看着满屏的OpenCV代码,自我解嘲:“人家是‘代码即文档’,咱们这是‘代码即玄学’。”
沉痛教训:“开源不是万能药。Tesseract + OpenCV,听起来像极客搭积木,实际上相当于给你一堆水泥钢筋让你自己盖别墅。对于没有专业团队和大量训练数据的普通图书馆来说,这条路的结局多半是烂尾。”
五、第四类选手:古籍专业公司的“高端定制”
代表产品:某古籍数字化公司全套解决方案,软硬件一体,报价80万起。
走投无路之下,大胖老师联系了业内一家专做古籍数字化的公司。对方非常专业,派了三个售前工程师,西装革履地来馆里演示。系统确实强大:专用书稿扫描仪(不拆卷、冷光源、自动翻页),后台是定制OCR引擎,支持异体字识别、印章提取、甚至句读。处理效果几近完美,准确率95%以上。
大胖老师心动了,然后看到了报价单:扫描仪48万,软件授权30万,年维护费5万,总计首年83万。这还不包括驻场人员培训费和后期升级。馆长看了直接摆手:“咱们全馆一年的购书经费才60万,你这是要我们全体馆员喝西北风啊。”
更麻烦的是,这套系统是个黑箱,模型不开源,数据全走他们自己的服务器。相当于你花大价钱买了个“租界”——所有权归你,但命脉在人家手里。以后想迁移数据,想对接其他系统,都得看对方脸色。万一这家公司倒闭或被收购,巨资买的设备就是一堆废铁。
小菜嘀咕道:“这哪是买软件,分明是请了个祖宗回家供着。”
总结:“高端定制,效果惊艳,价格也惊艳。对于国图、上图这样的顶级大馆或许合适,但对于99%的市县图书馆,这是另一个世界的童话。数字化的初衷是让古籍‘飞入寻常百姓家’,如果门槛高到连图书馆都迈不进去,那数字化本身就成了一种新的壁垒。”
六、理想方案的雏形:我们需要什么样的OCR?
经历了从洋到中、从商到开、从低端到高端的全链条打击后,大胖老师和小菜精疲力尽地坐在实验室地板上,周围散落着各种宣传册和测试报告。大胖老师忽然笑了起来:“小菜,你说咱是不是太矫情了?又要马儿跑,又要马儿不吃草。”
小菜想了想,认真地回答:“不,老师,我们要的不是不吃草的马,而是一匹适合自家草场的马。别人的马再壮,吃的是精饲料,咱喂不起。咱需要一匹能啃干草、走山路、还不挑食的土马。”
“说得好!”大胖老师一拍大腿,“那咱们就捋一捋,这匹‘土马’到底该长什么样。”
两人在小白板上写下了“文渊慧典”最初的需求清单:
成本极低:硬件用普通PC,不依赖GPU;软件用开源框架,零授权费。总拥有成本控制在电费和网费以内。
精度够高:针对中文古籍,尤其是竖排繁体、异体字、双行夹注,准确率不低于90%,且支持上下文自动纠错。
部署简单:一条命令安装,一个网页界面操作,不懂技术的馆员也能用。数据全部本地存储,不外传。
持续进化:模型可随使用反馈不断优化,社区可以贡献标注数据,形成良性循环。
尊重标准:输出格式符合国际文献数字化标准(如METS/ALTO),方便未来对接其他系统。
大胖老师盯着清单看了半天,突然把笔一摔:“这要求,不就是让我们自己造吗?”
小菜点点头:“准确说,是站在巨人的肩膀上组装。2019年PaddleOCR发布,2021年PPStructure加入版面分析,2023年模型已经支持竖排繁体。这些开源组件就像现成的发动机、变速箱、轮胎。我们要做的,就是针对古籍这个特殊路况调校悬挂、加装导航,最后造一辆‘古籍越野车’。”
“行,就这么干!省下的钱,正好够给你们买枸杞的。”大胖老师端起保温杯,眼中有光。
七、调研结论:不是天下无马,而是需要识马的人
回顾这段折腾,大胖老师最后总结了几句扎心的话:
“市面上不是没有好技术,而是这些技术要么被封装在昂贵的商业套餐里,要么零散在开源社区需要高超的组装能力。图书馆缺的不是钱,是‘信息差’——不知道什么工具适合自己,不知道如何用低成本获得高精度。我们开发‘文渊慧典’,本质上是填平这道鸿沟。让技术的归技术,让文化的归文化,中间那座桥,我们来搭。”
小菜把这句话写在了项目立项书的第一页。
本文为注水技术版,您看看即可,不必当真,写此文字就是图一乐:-)