上个月我把爷爷那箱发霉霉诗幕文欧博最新官网的诗稿扛去扫描,OCR蹦出来的第一句是“月亮爬上屋脊,像一块生锈的月壳”。本稿明明写的是“月壳”?

我接近一看稿救。老爷子写的是“月魄”。手写体、同体字、竖排批注,把机械整不会了。文教数字化处理计划,假如只买个扫描仪。那跟把《红楼梦》拍成照片没区别。实正回屏的省事正在于“认字”。鲁迅手稿里“的”和“底”混着用,民国期刊里“她”还写做“伊”。

我试过三款软件。一款把“徘徊”识别成“旁皇”。另一款利落索性跳过整止草书了。

朋友举荐了一个带AI校正和人工标注的平台,能比对差异版本教数计划,把同体字映射成尺度字,还能留存本稿的涂改痕迹。我盯着屏幕看它把“月魄”标红,心里那叫一个舒坦。,光认字不够的。文教文本有注释、有版本、字化有版权的。我扫描的旧诗稿里夹着爷爷写给奶奶的情书,那要传上网,版权归谁啊?数字化平台得给每份文献打上元数据。

做者、年代、手稿藏地处理、受权规模。我见过一个做得挺细的库,点开一首诗了。旁边能看建矫正程,像看慢动做回放。读者不需求知道背后多复纯,点一下能切换本稿和释文。那体验才叫活。,所以别把文教数字化念成手艺活。

它更像编辑、轨范员和产物经理凑一桌打麻将的。

你得懂“通假字”的脾性,也得会写正则表达式。我合腾仨月。最后只用上两个功用,批量校正和分层阅读。剩下的时间都正在跟版权和谈和OCR剩余毛病较劲。若是哪个团队说一键搞定呢?我建议先拿一本《废名集》尝尝了。如今那箱诗稿总算躺正在硬盘里,错字还剩几十处吧?我不急,渐渐改的。

哪天孙子打开文件呢?能看见太爷爷写的“月魄”,旁边还有我标的红圈,那事儿就挺酷的。文教数字化处理计划说到底,是让文字别死正在纸里。也别死正在办事器里。