OCR識別技術(shù).docx_第1頁
OCR識別技術(shù).docx_第2頁
OCR識別技術(shù).docx_第3頁
OCR識別技術(shù).docx_第4頁
OCR識別技術(shù).docx_第5頁
免費預(yù)覽已結(jié)束,剩余1頁可下載查看

下載本文檔

版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請進行舉報或認(rèn)領(lǐng)

文檔簡介

OCR識別技術(shù)OCR技術(shù)是光學(xué)字符識別技術(shù)的縮寫(Optical Character Recognition),是通過掃描等光學(xué)輸入方式將各種票據(jù)、報刊、書籍、文稿及其它印刷品的文字轉(zhuǎn)化為圖像信息,再利用文字識別技術(shù)將圖像信息轉(zhuǎn)化為可以使用的計算機輸入技術(shù)。可應(yīng)用于銀行票據(jù)、大量文字資料、檔案卷宗、文案的錄入和處理領(lǐng)域。適合于銀行、稅務(wù)等行業(yè)大量票據(jù)表格的自動掃描識別及長期存儲。相對一般文本,通常以最終識別率、識別速度、版面理解正確率及版面還原滿意度4個方面作為OCR技術(shù)的評測依據(jù);而相對于表格及票據(jù), 通常以識別率或整張通過率及識別速度為測定OCR技術(shù)的實用標(biāo)準(zhǔn)。采用OCR識別技術(shù),可以將其應(yīng)用于銀行票據(jù)光盤縮微系統(tǒng),可以自動提取票據(jù)要素,可減輕操作員的工作量,減少重復(fù)勞動,尤其是在與銀行事后且監(jiān)督系統(tǒng)相結(jié)合后,可以替代原先的操作人員完成事后監(jiān)督工作。由計算機自動識別票據(jù)上的日期、帳號、金額等要素,通過銀行事后監(jiān)督系統(tǒng)與業(yè)務(wù)系統(tǒng)中的數(shù)據(jù)進行比較,完成傳統(tǒng)的事后監(jiān)督操作;配有印章驗證系統(tǒng)后,自動將憑證圖像中的印章與系統(tǒng)中預(yù)留的印鑒進行比較,完成印章的真?zhèn)巫R別。OCR識別技術(shù)不僅具有可以自動判斷、拆分、 識別和還原各種通用型印刷體表格,在表格理解上做出了令人滿意的實用結(jié)果,能夠自動分析文稿的版面布局,自動分欄、并判斷出標(biāo)題、橫欄、圖像、表格等相應(yīng)屬性,并判定識別順序,能將識別結(jié)果還原成與掃描文稿的版面布局一致的新文本。表格自動錄入技術(shù),可自動識別特定表格的印刷或打印漢字、字母、數(shù)字,可識別手寫體漢字、手寫體字母、數(shù)字及多種手寫符號,并按表格格式輸出。提高了表格錄入效率,可節(jié)省大量人力。同時支持將表格識別直接還原成PTF、PDF、HTML等格式文檔;并可以對圖像嵌入橫排文本和豎排文本、表格文本進行自動排版面分析。利用目前的高新技術(shù)-OCR,直接從憑證影像中提取金額、帳號等重要數(shù)據(jù),代替人的手工錄入,與條碼識別/流水識別緊密結(jié)合,實現(xiàn)建立事后副本帳、完成事后監(jiān)督的工作。OCR處理一般使用性能較好的PC機,OCR處理程序一經(jīng)啟動會自動掃描數(shù)據(jù)庫中的憑證影像,發(fā)現(xiàn)有需OCR處理而未處理的,提取到本地進行處理。 OCR手寫體、印刷體識別技術(shù),能識別不同人寫的千差萬別的手寫體漢字和數(shù)字,應(yīng)用于本系統(tǒng),識別憑證影像中儲戶填寫的信息,如大寫金額、小寫金額、帳號、存期、日期、證件號等,可以代替手工錄入。同時被識別得出的金額還要與流水識別所得的金額進行核對,核對成功,則OCR識別成功。這樣處理是為了避免誤判。 經(jīng)過對銀行產(chǎn)生的實際憑證進行的大量測試,在實際開發(fā)過程中,根據(jù)銀行的實際需求,OCR技術(shù)在票據(jù)和表格識別能力和手寫體自動識別能力上不斷提升,目前處理速度可達(dá)到每分鐘6080張票據(jù),存折識別率已經(jīng)達(dá)到了85%以上,存單、憑條識別率達(dá)到90%以上,而85%以上的識別率就能減少80%以上的數(shù)據(jù)錄入員。在檔案領(lǐng)域OCR技術(shù)使檔案掃描成果達(dá)到了全文可識別,將檔案數(shù)字化發(fā)展提升了到了一個新的階段,是原本掃描出來的圖片變得更容易進行檢索,為數(shù)字檔案館的數(shù)據(jù)查詢提供了技術(shù)支持,是檔案數(shù)字化發(fā)展中必不可少的一環(huán)。技術(shù)歷史光學(xué)文字識別的概念是在1929年由奧地利科學(xué)家Gustav Tauschek最先提出來的,后來美國科學(xué)家Handel也提出了利用技術(shù)對文字進行識別的想法。而最早對印刷體漢字識別進行研究的是IBM公司的Casey和Nagy,1966年他們發(fā)表了第一篇關(guān)于漢字識別的文章,采用了模板匹配法識別了1000個印刷體漢字。早在60、70年代,世界各國就開始有OCR的研究,而研究的初期,多以文字的識別方法研究為主,且識別的文字僅為0至9的數(shù)字。以同樣擁有方塊文字的日本為例,1960年左右開始研究OCR的基本識別理論,初期以數(shù)字為對象,直至1965至1970年之間開始有一些簡單的產(chǎn)品,如印刷文字的郵政編碼識別系統(tǒng),識別郵件上的郵政編碼,幫助郵局作區(qū)域分信的作業(yè);也因此至今郵政編碼一直是各國所倡導(dǎo)的地址書寫方式。20世紀(jì)70年代初,日本的學(xué)者開始研究漢字識別,并做了大量的工作。中國在OCR技術(shù)方面的研究工作起步較晚,在70年代才開始對數(shù)字、英文字母及符號的識別進行研究,70年代末開始進行漢字識別的研究,到1986年漢字識別的研究進入一個實質(zhì)性的階段,不少研究單位相繼推出了中文OCR產(chǎn)品.早期的OCR軟件,由于識別率及產(chǎn)品化等多方面的因素,未能達(dá)到實際要求。同時,由于硬件設(shè)備成本高,運行速度慢,也沒有達(dá)到實用的程度。只有個別部門,如信息部門、新聞出版單位等使用OCR軟件。1986年以后我國的OCR研究有了很大進展,在漢字建模和識別方法上都有所創(chuàng)新,在系統(tǒng)研制和開發(fā)應(yīng)用中都取得了豐碩的成果,不少單位相繼推出了中文OCR產(chǎn)品。進入20世紀(jì)90年代以后,隨著平臺式掃描儀的廣泛應(yīng)用,以及我國信息自動化和辦公自動化的普及,大大推動了OCR技術(shù)的進一步發(fā)展,使OCR的識別正確率、識別速度滿足了廣大用戶的要求。軟件結(jié)構(gòu)由于掃描儀的普及與廣泛應(yīng)用,OCR軟件只需提供與掃描儀的接口,利用掃描儀驅(qū)動軟件即可。因此,OCR軟件主要是由下面幾個部分組成。1. 圖像輸入、預(yù)處理:2. 圖像輸入:對于不同的圖像格式,有著不同的存儲格式,不同的壓縮方式。預(yù)處理:主要包括二值化,噪聲去除,傾斜較正等3. 二值化:對攝像頭拍攝的圖片,大多數(shù)是彩色圖像,彩色圖像所含信息量巨大,對于圖片的內(nèi)容,我們可以簡單的分為前景與背景,為了讓計算機更快的,更好的識別文字,我們需要先對彩色圖進行處理,使圖片只前景信息與背景信息,可以簡單的定義前景信息為黑色,背景信息為白色,這就是二值化圖了。4. 噪聲去除:對于不同的文檔,我們對燥聲的定義可以不同,根據(jù)燥聲的特征進行去燥,就叫做噪聲去除5. 傾斜較正:由于一般用戶,在拍照文檔時,都比較隨意,因此拍照出來的圖片不可避免的產(chǎn)生傾斜,這就需要文字識別軟件進行較正。6. 版面分析:將文檔圖片分段落,分行的過程就叫做版面分析,由于實際文檔的多樣性,復(fù)雜性,因此,目前還沒有一個固定的,最優(yōu)的切割模型。7. 字符切割:由于拍照條件的限制,經(jīng)常造成字符粘連,斷筆,因此極大限制了識別系統(tǒng)的性能,這就需要文字識別軟件有字符切割功能。8. 字符識別:這一研究,已經(jīng)是很早的事情了,比較早有模板匹配,后來以特征提取為主,由于文字的位移,筆畫的粗細(xì),斷筆,粘連,旋轉(zhuǎn)等因素的影響,極大影響特征的提取的難度。9. 版面恢復(fù):人們希望識別后的文字,仍然像原文檔圖片那樣排列著,段落不變,位置不變,順序不變,的輸出到word文檔,pdf文檔等,這一過程就叫做版面恢復(fù)。10. 后處理、校對:根據(jù)特定的語言上下文的關(guān)系,對識別結(jié)果進行較正,就是后處理。工作流程一個OCR識別系統(tǒng),其目的很簡單,只是要把影像作一個轉(zhuǎn)換,使影像內(nèi)的圖形繼續(xù)保存、有表格則表格內(nèi)資料及影像內(nèi)的文字

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護處理,對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對任何下載內(nèi)容負(fù)責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時也不承擔(dān)用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論