学习文献知识对古籍整理的意义

栏目:古籍资讯发布:2023-08-05浏览:1收藏

学习文献知识对古籍整理的意义,第1张

网上好象没相关信息,以下是个人理解:

文献知识是古籍整理的基础和必要工具,更是整理好古籍的前提与必要条件。

说文献知识是古籍整理的基础和必要工具,是因为:没有文献上的历史记载,古籍的整理用什么做依据,最基本的按朝代、按地区分类就不可能做到,没有历史依据的整理只可能是破坏,不可能达到保护性目的;一些古籍可能有缺损、残缺,要修补、整理就要有相关知识,知道缺失了什么才能知道该补什么,又该到哪里去找这些可以补上的信息,这时候,文献就是很好的查阅资料,没有文献,就好比航海中的船只没有罗盘,它是指引古籍整理的必要工具。

做同样一项工作,不同的人来做也能区分出好坏,古籍整理也是这样,要整理好古籍,没有丰富的文献知识做后盾,在碰到问题时不可能及时、准确地做出反应,甚至可能会破坏原有的古籍信息,因此文献知识又是整理好古籍的前提与必要条件。

1、继承优秀的传统文化,弘扬民族精神 我们中国是四大文明古国之一,有着丰富的文化遗产,这些遗产记载着我们 祖先在思想、科学、文艺等方面的高度成就,是智慧和血汗的结晶,是须臾不可 丢弃的。它是中华民族之魂,是坚强的民族精神支柱,这种内在的思想活力是我 们中华民族生命力的体现,是我们炎黄子孙继承下来的无与伦比的文化瑰宝,是 一眼永不枯竭的泉水,它的深处流出的永远都是“清如许”的“活水”,有太多 的珍奇值得学生去采撷、吸收和发扬。学习文言文是继承中华文化、弘扬民族精 神、提高自身素质的重要途径。

2、促进现代汉语学习,提高语文水平 古代汉语是现代汉语的基础,是“源”,现代汉语是古代汉语的继承和发展。克先《学习心理学》福建少年儿童出版社1987年版第巧页 夸美纽斯《大教学论》教育科学出版社1999年5月第1版第103页 章志光主编《心理学》人民教育出版社1985年版第67页 是“流”,它们两者是一脉相承、血肉相连的,是同一种语言发展的不同阶段, 并不是两种语言。我们学习语言,除了向人民群众学习,向外国语言学习,还应 该从古代语言中学习。这方面,很多作家是我们的学习典范。鲁迅、巴金等许多 优秀作家从小就开始了古文名篇的启蒙,吸收古代语言的精华。巴金十二三岁能 将《古文观止》倒背如流,吴晗十三岁以前背完了《三字经》,梁启超在30岁前 把《史记》都背了下来,郭沫若三岁时就能背诵《唐诗三百首》。因此,他们运 用古代语言的水平,无不到了炉火纯青的地步。这些告诉我们,学习古典作品, 吸收有生命力、有表现力的古代语言,是提高语文水平的一条重要途径。

3、培养多种能力,提高美学素养 学习文言文,使学生懂得一些历史知识、文学知识和社会生活知识,增强了 解社会、认识事物的能力。文言文语言优美,韵律工整,音调和谐,经常诵读,‘ 不仅培养了语感,还提高了记忆能力。文言文由于语言的隔阂、时代的隔阂和思 想的隔阂,学生理解起来虽然有一定的难度,但能锻炼和提高学生的理解能力和 分析批判能力,从而形成辩证唯物主义观点。

甲骨文是中国已发现的古代文字中时代最早、体系较为完整的文字甲骨文主要指殷墟甲骨文,又称为“殷墟文字”、“殷契”,是殷商时代刻在龟甲兽骨上的文字19世纪末年在殷代都城遗址被今河南安阳小屯发现,继承了陶文的造字方法,是中国商代后期(前14~前11世纪)王室用于占卜记事而刻(或写)在龟甲和兽骨上的文字殷商灭亡周朝兴起之后,甲骨文还延绵使用了一段时期

甲骨文于1898年被古董商、金石学家、学者王懿荣所识别,之后在殷墟(河南安阳小屯村) 中国甲骨文之父——王懿荣

大规模挖掘,有大量的龟甲兽骨出土,加上别地的零星采集,至今已收集十几万片,其中单篇文章最长者达百余字,可以看出应用文雏形(节选自《应用写作》月刊1992年第3期《应用文的雏形——甲骨文》)

甲骨文的内容大部分是殷商王室占卜的记录商朝的人皆迷信鬼神,大事小事都要卜问,有些占卜的内容是天气晴雨,有些是农作收成,也有问病痛、求子的,而打猎、作战、祭祀等大事,更是需要卜问了!所以甲骨文的内容可以隐略了解商朝人的生活情形,也可以得知商朝历史发展的状况

(光学字符识别,Optical Character Recognition),是通过图像处理和模式识别技术对光学的字符进行识别的意思,是自动识别技术研究和应用领域中的一个重要方面。它是一种能够将文字自动识别录入到电脑中的软件技术,是与扫描仪配套的主要软件,属于非键盘输入范畴,需要图像输入设备主要是扫描仪相配合。

现在OCR主要是指[1]文字识别软件,在1996年清华紫光开始搭配中文识别软件之前,市场上的扫描仪和OCR软件一直是分开销售的,专业的OCR软件在早些时候卖得比扫描仪还要贵。随着扫描仪分辨率的提升,OCR软件也在不断升级,扫描仪厂商现在已把专业的OCR软件搭配自己生产的扫描仪出售。OCR技术的迅速发展与扫描仪的广泛使用是密不可分的,近两年随着扫描仪逐渐普及和OCR技术的日臻完善,OCR己成为绝大多数扫描仪用户的得力助手。 自20世纪60年代初期出现第一代OCR产品开始,经过半个世纪的不断发展和改进,包括手写体的各种OCR技术的研究取得了令人瞩目的成果,人们对OCR产品的功能要求也从原来的单纯注重识别率,发展到对整个OCR系统的识别速度、用户界面的友好性、操作的简便性、产品的稳定性、适应性、可靠性和易升级性、售前售后服务质量等各方面提出更高的要求。

OCR的概念是在1929年由德国科学家Tausheck最先提出来的,后来美国科学家Handel也提出了利用技术对文字进行识别的想法。而最早对印刷体汉字识别进行研究的是的Casey和Nagy,1966年他们发表了第一篇关于汉字识别的文章,采用了模板匹配法识别了1000个印刷体汉字。

早在60、70年代,世界各国就开始有OCR的研究,而研究的初期,多以文字的识别方法研究为主,且识别的文字仅为0至9的数字。以同样拥有方块文字的日本为例,1960年左右开始研究OCR的基本识别理论,初期以数字为对象,直至1965至1970年之间开始有一些简单的产品,如印刷文字的邮政编码识别系统,识别邮件上的邮政编码,帮助邮局作区域分信的作业;也因此至今邮政编码一直是各国所倡导的地址书写方式。

20世纪70年代初,日本的学者开始研究汉字识别,并做了大量的工作。中国在OCR技术方面的研究工作起步较晚,在70年代才开始对数字、英文字母及符号的识别进行研究,70年代末开始进行汉字识别的研究,到1986年汉字识别的研究进入一个实质性的阶段,不少研究单位相继推出了中文OCR产品早期的OCR软件,由于识别率及产品化等多方面的因素,未能达到实际要求。同时,由于硬件设备成本高,运行速度慢,也没有达到实用的程度。只有个别部门,如信息部门、新闻出版单位等使用OCR软件。1986年以后我国的OCR研究有了很大进展,在汉字建模和识别方法上都有所创新,在系统研制和开发应用中都取得了丰硕的成果,不少单位相继推出了中文OCR产品。进入20世纪90年代以后,随着平台式扫描仪的广泛应用,以及我国信息自动化和办公自动化的普及,大大推动了OCR技术的进一步发展,使OCR的识别正确率、识别速度满足了广大用户的要求。 由于扫描仪的普及与广泛应用,OCR软件只需提供与扫描仪的接口,利用扫描仪驱动软件即可。因此,OCR软件主要是由图像处理模块、版面划分模块、文字识别模块和文字编辑模块等4部分组成。

1、图像处理模块

图像处理模块主要具有文稿扫描、图像缩放、图像旋转等功能。通过扫描仪输入后,文稿形成图像文件,图像处理模块可对图像进行放大,去除污点和划痕,如果图像放置不正,可以手工或自动旋转图像,目的是为文字识别创造更好的条件,使识别率更高。

2、版面划分模块

版面划分模块主要包括版面划分、更改划分,即对版面的理解、字切分、归一化等,可选择自动或手动两种版面划分方式。目的是告诉OCR软件将同一版面的文章、表格等分开,以便于分别处理,并按照怎样的顺序进行识别。

3、文字识别模块

文字识别模块是OCR软件的核心部分,文字识别模块主要对输入的汉字进行阅读,但不能一目多行,必须逐行切割,对于汉字通常也是一个字一个字地辨认,即单字识别,再进行归一化。文字识别模块通过对不同样本汉字的特征进行提取,完成识别,自动查找可疑字,具有前后联想等功能。

4、文字编辑模块

文字编辑模块主要对OCR识别后的文字进行修改、编辑,如系统识别认为有误,则文字会以醒目的红色或蓝色显示,并提供相似的文字供选择,选择编辑器供输出等。 一个OCR识别系统,其目的很简单,只是要把影像作一个转换,使影像内的图形继续保存、有表格则表格内资料及影像内的文字,一律变成计算机文字,使能达到影像资料的储存量减少、识别出的文字可再使用及分析,当然也可节省因键盘输入的人力与时间。

从影像到结果输出,须经过影像输入、影像前处理、文字特征抽取、比对识别、最后经人工校正将认错的文字更正,将结果输出。

1影像输入

欲经过OCR处理的标的物须透过光学仪器,如影像扫描仪、传真机或任何摄影器材,将影像转入计算机。科技的进步,扫描仪等的输入装置已制作的愈来愈精致,轻薄短小、品质也高,对OCR有相当大的帮助,扫描仪的分辨率使影像更清晰、扫除速度更增进OCR处理的效率。

下载:《泰比科技光学OCR影像前处理:影像前处理是OCR系统中,须解决问题最多的一个模块,从得到一个不是黑就是白的二值化影像,或灰阶、彩色的影像,到独立出一个个的文字影像的过程,都属于影像前处理。包含了影像正规化、去除噪声、影像矫正等的影像处理,及图文分析、文字行与字分离的文件前处理。在影像处理方面,在学理及技术方面都已达成熟阶段,因此在市面上或网站上有不少可用的链接库;在文件前处理方面,则凭各家本领了;影像须先将、表格及文字区域分离出来,甚至可将文章的编排方向、文章的提纲及内容主体区分开,而文字的大小及文字的字体亦可如原始文件一样的判断出来。

文字特征抽取:单以识别率而言,特征抽取可说是 OCR的核心,用什么特征、怎么抽取,直接影响识别的好坏,也所以在OCR研究初期,特征抽取的研究报告特别的多。而特征可说是识别的筹码,简易的区分可分为两类:一为统计的特征,如文字区域内的黑/白点数比,当文字区分成好几个区域时,这一个个区域黑/白点数比之联合,就成了空间的一个数值向量,在比对时,基本的数学理论就足以应付了。而另一类特征为结构的特征,如文字影像细线化后,取得字的笔划端点、交叉点之数量及位置,或以笔划段为特征,配合特殊的比对方法,进行比对,市面上的线上手写输入软件的识别方法多以此种结构的方法为主。

对比数据库:当输入文字算完特征后,不管是用统计或结构的特征,都须有一比对数据库或特征数据库来进行比对,数据库的内容应包含所有欲识别的字集文字,根据与输入文字一样的特征抽取方法所得的特征群组。

2对比识别

这是可充分发挥数学运算理论的一个模块,根据不同的特征特性,选用不同的数学距离函数,较有名的比对方法有,欧式空间的比对方法、松弛比对法(Relaxation)、动态程序比对法(Dynamic Programming,DP),以及类神经网络的数据库建立及比对、HMM(Hidden Markov Model)…等著名的方法,为了使识别的结果更稳定,也有所谓的专家系统(Experts System)被提出,利用各种特征比对方法的相异互补性,使识别出的结果,其信心度特别的高。

字词后处理:由于OCR的识别率并无法达到百分之百,或想加强比对的正确性及信心值,一些除错或甚至帮忙更正的功能,也成为OCR系统中必要的一个模块。字词后处理就是一例,利用比对后的识别文字与其可能的相似候选字群中,根据前后的识别文字找出最合乎逻辑的词,做更正的功能。

字词数据库:为字词后处理所建立的词库。

3人工校正

OCR最后的关卡,在此之前,使用者可能只是拿支鼠标,跟着软件设计的节奏操作或仅是观看,而在此有可能须特别花使用者的精神及时间,去更正甚至找寻可能是OCR出错的地方。一个好的OCR软件,除了有一个稳定的影像处理及识别核心,以降低错误率外,人工校正的操作流程及其功能,亦影响OCR的处理效率,因此,文字影像与识别文字的对照,及其屏幕信息摆放的位置、还有每一识别文字的候选字功能、拒认字的功能、及字词后处理后特意标示出可能有问题的字词,都是为使用者设计尽量少使用键盘的一种功能,当然,不是说系统没显示出的文字就一定正确,就像完全由键盘输入的工作人员也会有出错的时候,这时要重新校正一次或能允许些许的错,就完全看使用单位的需求了。

4结果输出

有人只要文本文件作部份文字的再使用之用,所以只要一般的文字文件、有人要漂漂亮亮的和输入文件一模一样,所以有原文重现的功能、有人注重表格内的文字,所以要和Excel等软件结合。无论怎么变化,都只是输出档案格式的变化而已。如果需要还原成原文一样格式,则在识别后,需要人工排版,耗时耗力。 1资料录入

文献资料的数字化录入,一般分为:

1.纯图像方式。

2.目录文本、正文图像方式。

3.全文本方式。

4.全文索引方式。文本方式和图像方式的混合体。

2识别过程

书本级:中文,英文;简体,繁体;

版式级:竖排,横排;有无分栏;

行切分 字切分

识别:真正的OCR识别过程,图像信息还原成文本信息

后处理:人工干预,主要集中在前四个阶段。

3识别结果决定因素

1.的质量,一般建议150dpi以上

2.颜色,一般对彩色识别很差,黑白的较高,因此建议ocr的为黑白tif格式

3.最重要的就是字体,如果是手写识别率很低。

国内OCR识别简体差错率为万分之三,如果要求更高的精度需要投入更大的人工干预。繁体识别由于繁体字库的不统一性(民国时期的字库和现在繁体字库不统一),导致识别困难,在人工干预下,精度能达到90%以上(图文清晰情况下)。 1.分辨率的设置是文字识别的重要前提。一般来讲,扫描仪提供较多的图像信息,识别软件比较容易得出识别结果。但也不是扫描分辨率设得越高识别正确率就越高。选择300dpi或400dpi分辨率,适合大部分文档扫描。注意文字原稿的扫描识别,设置扫描分辨率时千万不要超过扫描仪的光学分辨率,不然会得不偿失。下面是部分典型设置,仅供参考。

(1)1、2、3号字的文章段,推荐使用200dpi。

(2)4、小4、5号字的文章段,推荐使用300dpl

(3)小5、6号字的文章段,推荐使用400dpl

(4)7、8号字的文章段,推荐使用600dpi。

2. 扫描时适当地调整好亮度和对比度值,使扫描文件黑白分明。这对识别率的影响最为关键,扫描亮度和对比度值的设定以观察扫描后的图像中汉字的笔画较细但又不断开为原则。进行识别前,先看看扫描得到的图像中文字质量如何,如果图像存在黑点或黑斑时或文字线条很粗很黑,分不清笔画时,说明亮度值太小了,应该增加亮度值在试试;如果文字线条凹凸不平,有断线甚至图像中汉字轮廓严重残缺时,说明亮度值太大了,应减小亮度后再试试。

3.选好扫描软件。选一款好的适合自己的OCR软件是作好文字识别工作的基础,一般不要使用扫描仪自带的OEM软件,OEM的OCR软件的功能少、效果差,有的甚至没有中文识别。

再选一个图像软件,第一,OCR软件不能识别所有的扫描仪;第二,也是最关键的,利用图像软件的扫描接口扫描出来的图像便于处理。

4.如果要进行的文本是带有格式的,如粗体、斜体、首行缩进等,部分OCR软件识别不出来,会丢失格式或出现乱码。如果必须扫描带有格式的文本,事先要确保使用的识别软件是否支持文字格式的扫描。也可以关闭样式识别系统,使软件集中注意力查找正确的字符,不再顾及字体和字体格式。

5.在扫描识别报纸或其他半透明文稿时,背面的文字透过纸张混淆文字字形,对识别会造成很大的障碍。遇到该类扫描,只要在扫描原稿的背面附。盖一张黑纸,扫描时,增加扫描对比度,即可减少背面模糊字体的影响,提高识别正确率,

6.一般文本扫描原稿都为黑、白两色原稿,但是在扫描设置时却常将扫描模式设为灰度模式。特别是在原稿质量较差时,使用灰度模式扫描,并在扫描软件处理完后再继续识别,这样会得到较好的识别正确率。值得注意的是OCR识别软件可以自己确定阀值,几个百分点的阀值差异,可能就会影响识别的正常进行。当然,得到的图像文件的大小会比黑白文件大很多。在进行大批量文稿扫描时,必须对原稿进行测试,找到最佳的阀值百分比。

7.遇到图文混排的扫描原稿,首先明确使用的识别软件是否支持自动分析图文这一功能。如果支持的话,在进行这类扫描识别时,OCR软件会自动计算出文本的内容、位置和先后顺序。文字部分可以按照标示顺序正常识别。

8.手动选取扫描区域会有更好识别效果。设置好参数后,先预览一下,然后开始选取扫描区域。不要将要用的文章一股脑儿选在一个区域内,因为现在的文章排版为了追求更好的视觉效果,使用图文混排的较多,扫成一幅图像会影响OCR识别。因此,要根据实际情况将版面分成N个区域,怎么划分区域呢?每一区域内的文字字体、字号最好一致,没有图形、图像,每一行的宽度一致,遇到长短不一,再细分,一般一次最多可扫描10个选区。根据不同情况,合理地设置识别区域的顺序。不要嫌这个过程太烦,那可是提高识别率的有效手段。注意各识别区域不能有交叉,做到一切觉得完好以后再进行识别。这样一般的识别率会在95%以上,对于识别不正确的文字进行校对后,就可以进入相应的文字处理软件进行所需的处理了。

9.在放置扫描原稿时,把扫描的文字材料一定要摆放在扫描起始线正中,以最大限度地减小由于光学透镜导致的失真。同时应保护扫描仪玻璃的干净和不受损害。文字有一定角度的倾斜,或者是原稿文字部分为不正规排版,必须在扫描后使用旋转工具,进行纠正;否则OCR识别软件会将水平笔划当做斜笔划处理,识别正确率会下降很多。建议用户尽量将扫描原稿放正,用工具旋转纠正会降低图像质量,使字符识别更加困难。

10.先预览整体版面,选定要扫描的区域,再用放大预览工具,选择一小块进行放大显示到全屏幕,观察其文字的对比度,文字的深浅浓度,据情况调整阀值的大小,最终要求文字清晰,不浓(文字成团),不淡(文字断笔伐),一般在阀值80左右为宜,最后再扫描。

11.用工具擦掉图像污点,包括原来版面中的不需要识别的插图、分隔线等,使文字图像中除了文字没有一点多余的东西;这可以大提高识别率并减少识别后的修改工作。

12.如果要扫描印刷质量稍微差一些的文章,比如说报纸,扫描的结果将不会黑白分明,会出现大量的黑点,而且在字体的笔画上也会出现粘连现象,这两项可是汉字识别的大忌,将严重影响汉字识别的正确率。为获得较好的识别结果,必须仔细进行色调调节,反复扫描多次才能获得比较理想的结果。另外由于报纸很薄且大部分纸质不高,导致扫描仪上盖板不能完全压住报纸(有缝隙),所以一般情况下报纸的扫描识别效果没有杂志的效果好。解决办法是在报纸上压一至两本16K的杂志,效果还是不错的。

价值:

甲骨文在汉字漫长的发展历史上具有极其重要的地位,作为现代汉字的鼻祖是当之无愧的。我国汉字的萌芽,大约出现于新石器时代晚期陶片上的刻划符号。但这些刻划文字虽已具备了文字的雏形,但都是一些简单的符号和单字,无完整的体系和规律。真正具有一定的体系并有比较严密的规律的文字,最早的要算是甲骨文了。据研究,甲骨文中共有不重复的单字4500个左右,已识单字在1700个左右,而这些单字还不是当时使用的全部文字。甲骨文是研究古文字的宝贵资料。中国的文字萌芽较早,在新石器时代仰韶文化的陶器上,就发现了各种刻划符号,成为中国文字的雏形,经过二三千年的孕育、发展,到了商代,中国的文字达到基本成熟阶段。、甲骨文具有一定体系并有比较严密的规律,刻划精湛,内容丰富,对中国古文字研究有重要作用。过去,古文字研究的主要的依据是商周青铜器上的铭文,如东汉许慎的《说文解字》。甲骨文比《说文解字》要早1500年,而且它是来源于直接发掘出来的出土文物,可信程度更高,对研究汉字的起源和发展,纠正《说文解字》的疏失,解决青铜器铭文中悬而未决的问题,都有极大价值。

意义:

甲骨文,又称“契文”、“甲骨卜辞”、殷墟文字或“龟甲兽骨文”。甲骨文记录和反映了商朝的政治和经济情况,主要指中国商朝后期(前14~前11世纪)王室用于占卜吉凶记事而在龟甲或兽骨上契刻的文字,内容一般是占卜所问之事或者是所得结果。殷商灭亡周朝兴起之后,甲骨文还使用了一段时期,是研究商周时期社会历史的重要资料。甲骨文其形体结构已有独立体趋向合体,而且出现了大量的形声字。它上承原始刻绘符号,下启青铜铭文,是汉字发展的关键形态,被称为“最早的汉字”。现代汉字即由甲骨文演变而来。在总共10余万片有字甲骨中,含有4千多不同的文字图形,其中已经识别的约有2800多字。

甲骨文是中国的一种古代文字,是汉字的早期形式,有时候也被认为是汉字的书体之一,也是现存中国王朝时期最古老的一种成熟文字,最早出土于河南省安阳市殷墟。属于上古汉语(old chinese),而非上古或者原始的其他语系的语言。

热门文章
    确认删除?
    回到顶部