为查阅古籍文献,要出差到各地,探访各家图书馆——这是许多古籍研究者的共同记忆。在数字时代,这种情况正发生改变。国家图书馆(国家古籍保护中心)等6家单位近日在线新增发布古籍数字资源6786部(件)。至此,全国已累计在线发布古籍数字资源13万部(件)。依托数字化手段,卷帙浩繁的古籍走出“深闺高阁”,让文明触手可及。
1 兼顾“藏”与“用”
古籍,作为文物必须保护,作为文献必须为读者所用。兼顾“藏”与“用”,一直是古籍保护工作的重点,而数字化是最好的方法。
“2016年国家图书馆搭建起‘中华古籍资源库’平台,发布了普通古籍、甲骨、敦煌文献等数字资源,并全部实现免登录在线阅览。”国家图书馆副研究员南江涛介绍,国家图书馆还联合海内外收藏机构基本搭建“国家古籍数字平台”架构。
随着“中华古籍保护计划”深入开展,各地图书馆陆续投入人力物力,大力推进古籍数字化。国家图书馆先后联合39家单位发布数字古籍,其中不仅包含明清版刻,还有碑帖拓本等特色资源。相关数据显示,在现有的13万部(件)数字古籍中,超过10.2万部(件)归属于“中华古籍资源库”。
“这13万部(件)古籍数字资源,对于我们研究者来说格外珍贵。”北京大学中文系教授杨海峥感叹,在线查阅免去了往返奔波图书馆的时间,平衡了古籍的文物性与文献性。
2 AI助力古籍整理
把纸质古籍转化成数字文本,只是古籍保护的第一步。“现有的数字古籍大多由缩微胶片转换而成,分辨率低,使用也不方便。”杨海峥举例解释,这类古籍通常不具备检索功能,想查阅某部分内容,需逐篇逐页阅读原文,很难快速找到想要的知识。
人工智能的快速发展,为数字古籍的整理分类带来革命性变化。2022年10月,由字节跳动与北京大学数字人文研究中心合作研发的数字古籍平台“识典古籍”便是一个生动案例。
进入“识典古籍”网站,可以看到,《周易》《左传》《礼记》等陈列于首页上。随机点开一本,左侧为章节目录,右侧为正文,排版形式既顺应现代人的阅读习惯,又还原了古籍纸张的阅读美感。
“与一些数字化平台不同,‘识典古籍’是完全免费的,而且增加了简繁体转换、底本影像对照、全文检索等一系列便捷功能。”抖音集团企业社会责任部产品总经理唐垲鑫介绍,该平台主要应用了文字识别、自动标点和命名实体识别这3种技术,不仅能将影印本上的文字提取整理,还能通过序列标注识别文本中的人名、地名等信息,准确率为96%至97%。
“平台已整理上线了685部经典古籍,共计7900多万字,主要来自《四部丛刊》。”唐垲鑫说,“识典古籍”已上线手机移动版,未来平台中的书目将持续更新。
业内人士预测,随着AI技术的运用,古籍文献中所蕴藏的古代历史文化知识将不断被抽取,构建成各种各样的知识库,并将以知识图谱的形式支持互联网前端应用。
3 跨界合作成趋势
事实上,在“识典古籍”上线之前,文保机构、科研院校与互联网公司的跨界合作已越来越普遍。比如,腾讯联合敦煌研究院开发了AI病害识别技术,帮助“问诊”敦煌千年壁画。
由于在产品研发、设计方面存在优势,互联网公司等社会力量的加入会进一步保障古籍数字化平台的服务质量。“我们有优秀的产品经理、设计师、软件工程师,能够不断优化数字古籍平台的产品功能。”唐垲鑫说。
“识典古籍”的诞生离不开专家学者支持。北京大学数字人文研究中心主任王军表示,北大在这次合作中负责人工审核与校对,弥补人工智能有识别错误率的短板,并利用自有学术平台,连接更多专业研究者和学生群体。
专家认为,在古籍整理中,人文社科学者要积极介入,并加强与技术人员的合作,那样才能更好地利用机器而不是被机器牵着鼻子走,从而保证结果的准确性。
(据《人民日报》(海外版) 作者:刘乐艺)
?? 相关链接
《永乐大典》高清影像数据库及《国家珍贵古籍名录》知识库发布
由国家图书馆联合北京大学数字人文研究中心等单位研发的《永乐大典》高清影像数据库及《国家珍贵古籍名录》知识库近日在国家图书馆正式发布上线,公众可从国家图书馆官网登录免费使用。这两项重要的国家古籍数字化工程项目旨在用数字化手段完整保存并流传珍贵古籍,弘扬中华优秀传统文化。
据悉,《永乐大典》高清影像数据库项目的第一辑收录了国家图书馆藏《永乐大典》40册75卷内容,除了呈现《永乐大典》高清图像、整体风貌及相关知识,还尝试对部分大典内容做了知识标引示范。
《国家珍贵古籍名录》知识库包含了已批准公布的六批《国家珍贵古籍名录》,还收录了大量书影图像、说明文字内容。该项目综合应用了数字人文的多项技术,将珍贵古籍名录书目数据重构为知识库,以多维度知识图谱等多种可视化形式展示,以数字手段实现“辨章学术、考镜源流”的功能。 (据新华社电)