字符字節(jié)和編碼_第1頁
字符字節(jié)和編碼_第2頁
字符字節(jié)和編碼_第3頁
字符字節(jié)和編碼_第4頁
字符字節(jié)和編碼_第5頁
已閱讀5頁,還剩7頁未讀, 繼續(xù)免費(fèi)閱讀

下載本文檔

版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡介

1、字符字節(jié)和編碼原創(chuàng)文章,轉(zhuǎn)載請保留或注明出處:級別:中級摘要:本文介紹了字符與編碼的發(fā)展過程,相關(guān)概念的正確理解。舉例說明了一些實(shí)際應(yīng)用中,編碼的實(shí)現(xiàn)方法。然后,本文講述了通常對字符與編碼的幾種誤解,由于這些誤解而導(dǎo)致亂碼產(chǎn)生的原因,以及消除亂碼的辦法。本文的內(nèi)容涵蓋了“中文問題”,“亂碼問題”。掌握編碼問題的關(guān)鍵是正確地理解相關(guān)概念,編碼所涉及的技術(shù)其實(shí)是很簡單的。因此,閱讀本文時(shí)需要慢讀多想,多思考。引言“字符與編碼”是一個(gè)被經(jīng)常討論的話題。即使這樣,時(shí)常出現(xiàn)的亂碼仍然困擾著大家。雖然我們有很多的辦法可以用來消除亂碼,但我們并不一定理解這些辦法的內(nèi)在原理。而有的亂碼產(chǎn)生的原因,實(shí)際上由于底

2、層代碼本身有問題所導(dǎo)致的。因此,不僅是初學(xué)者會對字符編碼感到模糊,有的底層開發(fā)人員同樣對字符編碼缺乏準(zhǔn)確的理解?;仨撌?. 編碼問題的由來,相關(guān)概念的理解1.1 字符與編碼的發(fā)展從計(jì)算機(jī)對多國語言的支持角度看,大致可以分為三個(gè)階段:系統(tǒng)內(nèi)碼說明系統(tǒng)階段一ASCII計(jì)算機(jī)剛開始只支持英語,其它語言不能夠在計(jì)算機(jī)上存儲和顯示。英文 DOS階段二ANSI編碼(本地化)為使計(jì)算機(jī)支持更多語言,通常使用 0x800xFF 范圍的 2 個(gè)字節(jié)來表示 1 個(gè)字符。比如:漢字 中 在中文操作系統(tǒng)中,使用 0xD6,0xD0 這兩個(gè)字節(jié)存儲。不同的國家和地區(qū)制定了不同的標(biāo)準(zhǔn),由此產(chǎn)生了 GB2312, BIG5

3、, JIS 等各自的編碼標(biāo)準(zhǔn)。這些使用 2 個(gè)字節(jié)來代表一個(gè)字符的各種漢字延伸編碼方式,稱為 ANSI 編碼。在簡體中文系統(tǒng)下,ANSI 編碼代表 GB2312 編碼,在日文操作系統(tǒng)下,ANSI 編碼代表 JIS 編碼。不同 ANSI 編碼之間互不兼容,當(dāng)信息在國際間交流時(shí),無法將屬于兩種語言的文字,存儲在同一段 ANSI 編碼的文本中。中文 DOS,中文 Windows 95/98,日文 Windows 95/98階段三UNICODE(國際化)為了使國際間信息交流更加方便,國際組織制定了 UNICODE 字符集,為各種語言中的每一個(gè)字符設(shè)定了統(tǒng)一并且唯一的數(shù)字編號,以滿足跨語言、跨平臺進(jìn)行文

4、本轉(zhuǎn)換、處理的要求。Windows NT/2000/XP,Linux,Java字符串在內(nèi)存中的存放方法:在 ASCII 階段,單字節(jié)字符串使用一個(gè)字節(jié)存放一個(gè)字符(SBCS)。比如,Bob123 在內(nèi)存中為:426F6231323300Bob1230在使用 ANSI 編碼支持多種語言階段,每個(gè)字符使用一個(gè)字節(jié)或多個(gè)字節(jié)來表示(MBCS),因此,這種方式存放的字符也被稱作多字節(jié)字符。比如,中文123 在中文 Windows 95 內(nèi)存中為7個(gè)字節(jié),每個(gè)漢字占2個(gè)字節(jié),每個(gè)英文和數(shù)字字符占1個(gè)字節(jié):D6D0CEC431323300中文1230在 UNICODE 被采用之后,計(jì)算機(jī)存放字符串時(shí),改為

5、存放每個(gè)字符在 UNICODE 字符集中的序號。目前計(jì)算機(jī)一般使用 2 個(gè)字節(jié)(16 位)來存放一個(gè)序號(DBCS),因此,這種方式存放的字符也被稱作寬字節(jié)字符。比如,字符串 中文123 在 Windows 2000 下,內(nèi)存中實(shí)際存放的是 5 個(gè)序號:2D4E87653100320033000000 在 x86 CPU 中,低字節(jié)在前中文1230一共占 10 個(gè)字節(jié)。回頁首1.2 字符,字節(jié),字符串理解編碼的關(guān)鍵,是要把字符的概念和字節(jié)的概念理解準(zhǔn)確。這兩個(gè)概念容易混淆,我們在此做一下區(qū)分:概念描述舉例字符人們使用的記號,抽象意義上的一個(gè)符號。1, 中, a, $, ¥, 字節(jié)計(jì)算機(jī)中存儲數(shù)

6、據(jù)的單元,一個(gè)8位的二進(jìn)制數(shù),是一個(gè)很具體的存儲空間。0x01, 0x45, 0xFA, ANSI字符串在內(nèi)存中,如果“字符”是以 ANSI 編碼形式存在的,一個(gè)字符可能使用一個(gè)字節(jié)或多個(gè)字節(jié)來表示,那么我們稱這種字符串為 ANSI 字符串或者多字節(jié)字符串。中文123(占7字節(jié))UNICODE字符串在內(nèi)存中,如果“字符”是以在 UNICODE 中的序號存在的,那么我們稱這種字符串為 UNICODE 字符串或者寬字節(jié)字符串。L中文123(占10字節(jié))由于不同 ANSI 編碼所規(guī)定的標(biāo)準(zhǔn)是不相同的,因此,對于一個(gè)給定的多字節(jié)字符串,我們必須知道它采用的是哪一種編碼規(guī)則,才能夠知道它包含了哪些“字符

7、”。而對于 UNICODE 字符串來說,不管在什么環(huán)境下,它所代表的“字符”內(nèi)容總是不變的?;仨撌?.3 字符集與編碼各個(gè)國家和地區(qū)所制定的不同 ANSI 編碼標(biāo)準(zhǔn)中,都只規(guī)定了各自語言所需的“字符”。比如:漢字標(biāo)準(zhǔn)(GB2312)中沒有規(guī)定韓國語字符怎樣存儲。這些 ANSI 編碼標(biāo)準(zhǔn)所規(guī)定的內(nèi)容包含兩層含義:1. 使用哪些字符。也就是說哪些漢字,字母和符號會被收入標(biāo)準(zhǔn)中。所包含“字符”的集合就叫做“字符集”。 2. 規(guī)定每個(gè)“字符”分別用一個(gè)字節(jié)還是多個(gè)字節(jié)存儲,用哪些字節(jié)來存儲,這個(gè)規(guī)定就叫做“編碼”。 各個(gè)國家和地區(qū)在制定編碼標(biāo)準(zhǔn)的時(shí)候,“字符的集合”和“編碼”一般都是同時(shí)制定的。因此,

8、平常我們所說的“字符集”,比如:GB2312, GBK, JIS 等,除了有“字符的集合”這層含義外,同時(shí)也包含了“編碼”的含義。“UNICODE 字符集”包含了各種語言中使用到的所有“字符”。用來給 UNICODE 字符集編碼的標(biāo)準(zhǔn)有很多種,比如:UTF-8, UTF-7, UTF-16, UnicodeLittle, UnicodeBig 等。回頁首1.4 常用的編碼簡介簡單介紹一下常用的編碼規(guī)則,為后邊的章節(jié)做一個(gè)準(zhǔn)備。在這里,我們根據(jù)編碼規(guī)則的特點(diǎn),把所有的編碼分成三類:分類編碼標(biāo)準(zhǔn)說明單字節(jié)字符編碼ISO-8859-1最簡單的編碼規(guī)則,每一個(gè)字節(jié)直接作為一個(gè) UNICODE 字符。比

9、如,0xD6, 0xD0 這兩個(gè)字節(jié),通過 iso-8859-1 轉(zhuǎn)化為字符串時(shí),將直接得到 0x00D6, 0x00D0 兩個(gè) UNICODE 字符,即 。反之,將 UNICODE 字符串通過 iso-8859-1 轉(zhuǎn)化為字節(jié)串時(shí),只能正常轉(zhuǎn)化 0255 范圍的字符。ANSI 編碼GB2312,BIG5,Shift_JIS,ISO-8859-2 把 UNICODE 字符串通過 ANSI 編碼轉(zhuǎn)化為“字節(jié)串”時(shí),根據(jù)各自編碼的規(guī)定,一個(gè) UNICODE 字符可能轉(zhuǎn)化成一個(gè)字節(jié)或多個(gè)字節(jié)。反之,將字節(jié)串轉(zhuǎn)化成字符串時(shí),也可能多個(gè)字節(jié)轉(zhuǎn)化成一個(gè)字符。比如,0xD6, 0xD0 這兩個(gè)字節(jié),通過 G

10、B2312 轉(zhuǎn)化為字符串時(shí),將得到 0x4E2D 一個(gè)字符,即 中 字?!癆NSI 編碼”的特點(diǎn):1. 這些“ANSI 編碼標(biāo)準(zhǔn)”都只能處理各自語言范圍之內(nèi)的 UNICODE 字符。2. “UNICODE 字符”與“轉(zhuǎn)換出來的字節(jié)”之間的關(guān)系是人為規(guī)定的。UNICODE 編碼UTF-8,UTF-16, UnicodeBig 與“ANSI 編碼”類似的,把字符串通過 UNICODE 編碼轉(zhuǎn)化成“字節(jié)串”時(shí),一個(gè) UNICODE 字符可能轉(zhuǎn)化成一個(gè)字節(jié)或多個(gè)字節(jié)。與“ANSI 編碼”不同的是:1. 這些“UNICODE 編碼”能夠處理所有的 UNICODE 字符。2. “UNICODE 字符”與“

11、轉(zhuǎn)換出來的字節(jié)”之間是可以通過計(jì)算得到的。我們實(shí)際上沒有必要去深究每一種編碼具體把某一個(gè)字符編碼成了哪幾個(gè)字節(jié),我們只需要知道“編碼”的概念就是把“字符”轉(zhuǎn)化成“字節(jié)”就可以了。對于“UNICODE 編碼”,由于它們是可以通過計(jì)算得到的,因此,在特殊的場合,我們可以去了解某一種“UNICODE 編碼”是怎樣的規(guī)則?;仨撌?. 字符與編碼在程序中的實(shí)現(xiàn)2.1 程序中的字符與字節(jié)在 C+ 和 Java 中,用來代表“字符”和“字節(jié)”的數(shù)據(jù)類型,以及進(jìn)行編碼的方法:類型或操作C+Java字符wchar_tchar字節(jié)charbyteANSI 字符串charbyteUNICODE 字符串wchar_t

12、String字節(jié)串字符串mbstowcs(), MultiByteToWideChar()string = new String(bytes, encoding)字符串字節(jié)串wcstombs(), WideCharToMultiByte()bytes = string.getBytes(encoding)以上需要注意幾點(diǎn):1. Java 中的 char 代表一個(gè)“UNICODE 字符(寬字節(jié)字符)”,而 C+ 中的 char 代表一個(gè)字節(jié)。 2. MultiByteToWideChar() 和 WideCharToMultiByte() 是 Windows API 函數(shù)。 回頁首2.2 C+

13、中相關(guān)實(shí)現(xiàn)方法聲明一段字符串常量:/ ANSI 字符串,內(nèi)容長度 7 字節(jié)char sz20 = 中文123;/ UNICODE 字符串,內(nèi)容長度 5 個(gè) wchar_t(10 字節(jié))wchar_t wsz20 = Lx4E2Dx6587x0031x0032x0033;UNICODE 字符串的 I/O 操作,字符與字節(jié)的轉(zhuǎn)換操作:/ 運(yùn)行時(shí)設(shè)定當(dāng)前 ANSI 編碼,VC 格式setlocale(LC_ALL, .936);/ GCC 中格式setlocale(LC_ALL, zh_CN.GBK);/ Visual C+ 中使用小寫 %s,按照 setlocale 指定編碼輸出到文件/ GCC

14、中使用大寫 %Sfwprintf(fp, L%sn, wsz);/ 把 UNICODE 字符串按照 setlocale 指定的編碼轉(zhuǎn)換成字節(jié)wcstombs(sz, wsz, 20);/ 把字節(jié)串按照 setlocale 指定的編碼轉(zhuǎn)換成 UNICODE 字符串mbstowcs(wsz, sz, 20);在 Visual C+ 中,UNICODE 字符串常量有更簡單的表示方法。如果源程序的編碼與當(dāng)前默認(rèn) ANSI 編碼不符,則需要使用 #pragma setlocale,告訴編譯器源程序使用的編碼:/ 如果源程序的編碼與當(dāng)前默認(rèn) ANSI 編碼不一致,/ 則需要此行,編譯時(shí)用來指明當(dāng)前源程序使

15、用的編碼#pragma setlocale(.936)/ UNICODE 字符串常量,內(nèi)容長度 10 字節(jié)wchar_t wsz20 = L中文123;以上需要注意 #pragma setlocale 與 setlocale(LC_ALL, ) 的作用是不同的,#pragma setlocale 在編譯時(shí)起作用,setlocale() 在運(yùn)行時(shí)起作用?;仨撌?.3 Java 中相關(guān)實(shí)現(xiàn)方法字符串類 String 中的內(nèi)容是 UNICODE 字符串:/ Java 代碼,直接寫中文String string = 中文123;/ 得到長度為 5,因?yàn)槭?5 個(gè)字符System.out.println

16、(string.length();字符串 I/O 操作,字符與字節(jié)轉(zhuǎn)換操作。在 Java 包 java.io.* 中,以“Stream”結(jié)尾的類一般是用來操作“字節(jié)串”的類,以“Reader”,“Writer”結(jié)尾的類一般是用來操作“字符串”的類。/ 字符串與字節(jié)串間相互轉(zhuǎn)化/ 按照 GB2312 得到字節(jié)(得到多字節(jié)字符串)byte bytes = string.getBytes(GB2312);/ 從字節(jié)按照 GB2312 得到 UNICODE 字符串string = new String(bytes, GB2312);/ 要將 String 按照某種編碼寫入文本文件,有兩種方法:/ 第一

17、種辦法:用 Stream 類寫入已經(jīng)按照指定編碼轉(zhuǎn)化好的字節(jié)串OutputStream os = new FileOutputStream(1.txt);os.write(bytes);os.close();/ 第二種辦法:構(gòu)造指定編碼的 Writer 來寫入字符串Writer ow = new OutputStreamWriter(new FileOutputStream(2.txt), GB2312);ow.write(string);ow.close();/* 最后得到的 1.txt 和 2.txt 都是 7 個(gè)字節(jié) */如果 java 的源程序編碼與當(dāng)前默認(rèn) ANSI 編碼不符,則在編

18、譯的時(shí)候,需要指明一下源程序的編碼。比如:E:javac -encoding BIG5 Hello.java以上需要注意區(qū)分源程序的編碼與 I/O 操作的編碼,前者是在編譯時(shí)起作用,后者是在運(yùn)行時(shí)起作用?;仨撌?. 幾種誤解,以及亂碼產(chǎn)生的原因和解決辦法3.1 容易產(chǎn)生的誤解對編碼的誤解誤解一在將“字節(jié)串”轉(zhuǎn)化成“UNICODE 字符串”時(shí),比如在讀取文本文件時(shí),或者通過網(wǎng)絡(luò)傳輸文本時(shí),容易將“字節(jié)串”簡單地作為單字節(jié)字符串,采用每“一個(gè)字節(jié)”就是“一個(gè)字符”的方法進(jìn)行轉(zhuǎn)化。而實(shí)際上,在非英文的環(huán)境中,應(yīng)該將“字節(jié)串”作為 ANSI 字符串,采用適當(dāng)?shù)木幋a來得到 UNICODE 字符串,有可能

19、“多個(gè)字節(jié)”才能得到“一個(gè)字符”。通常,一直在英文環(huán)境下做開發(fā)的程序員們,容易有這種誤解。誤解二在 DOS,Windows 98 等非 UNICODE 環(huán)境下,字符串都是以 ANSI 編碼的字節(jié)形式存在的。這種以字節(jié)形式存在的字符串,必須知道是哪種編碼才能被正確地使用。這使我們形成了一個(gè)慣性思維:“字符串的編碼”。當(dāng) UNICODE 被支持后,Java 中的 String 是以字符的“序號”來存儲的,不是以“某種編碼的字節(jié)”來存儲的,因此已經(jīng)不存在“字符串的編碼”這個(gè)概念了。只有在“字符串”與“字節(jié)串”轉(zhuǎn)化時(shí),或者,將一個(gè)“字節(jié)串”當(dāng)成一個(gè) ANSI 字符串時(shí),才有編碼的概念。不少的人都有這個(gè)

20、誤解。第一種誤解,往往是導(dǎo)致亂碼產(chǎn)生的原因。第二種誤解,往往導(dǎo)致本來容易糾正的亂碼問題變得更復(fù)雜。在這里,我們可以看到,其中所講的“誤解一”,即采用每“一個(gè)字節(jié)”就是“一個(gè)字符”的轉(zhuǎn)化方法,實(shí)際上也就等同于采用 iso-8859-1 進(jìn)行轉(zhuǎn)化。因此,我們常常使用 bytes = string.getBytes(iso-8859-1) 來進(jìn)行逆向操作,得到原始的“字節(jié)串”。然后再使用正確的 ANSI 編碼,比如 string = new String(bytes, GB2312),來得到正確的“UNICODE 字符串”。回頁首3.2 非 UNICODE 程序在不同語言環(huán)境間移植時(shí)的亂碼非 UNI

21、CODE 程序中的字符串,都是以某種 ANSI 編碼形式存在的。如果程序運(yùn)行時(shí)的語言環(huán)境與開發(fā)時(shí)的語言環(huán)境不同,將會導(dǎo)致 ANSI 字符串的顯示失敗。比如,在日文環(huán)境下開發(fā)的非 UNICODE 的日文程序界面,拿到中文環(huán)境下運(yùn)行時(shí),界面上將顯示亂碼。如果這個(gè)日文程序界面改為采用 UNICODE 來記錄字符串,那么當(dāng)在中文環(huán)境下運(yùn)行時(shí),界面上將可以顯示正常的日文。由于客觀原因,有時(shí)候我們必須在中文操作系統(tǒng)下運(yùn)行非 UNICODE 的日文軟件,這時(shí)我們可以采用一些工具,比如,南極星,AppLocale 等,暫時(shí)的模擬不同的語言環(huán)境?;仨撌?.3 網(wǎng)頁提交字符串當(dāng)頁面中的表單提交字符串時(shí),首先把字符

22、串按照當(dāng)前頁面的編碼,轉(zhuǎn)化成字節(jié)串。然后再將每個(gè)字節(jié)轉(zhuǎn)化成 %XX 的格式提交到 Web 服務(wù)器。比如,一個(gè)編碼為 GB2312 的頁面,提交 中 這個(gè)字符串時(shí),提交給服務(wù)器的內(nèi)容為 %D6%D0。在服務(wù)器端,Web 服務(wù)器把收到的 %D6%D0 轉(zhuǎn)化成 0xD6, 0xD0 兩個(gè)字節(jié),然后再根據(jù) GB2312 編碼規(guī)則得到 中 字。在 Tomcat 服務(wù)器中,request.getParameter() 得到亂碼時(shí),常常是因?yàn)榍懊嫣岬降摹罢`解一”造成的。默認(rèn)情況下,當(dāng)提交 %D6%D0 給 Tomcat 服務(wù)器時(shí),request.getParameter() 將返回 0x00D6, 0x00

23、D0 兩個(gè) UNICODE 字符,而不是返回一個(gè) 中 字符。因此,我們需要使用 bytes = string.getBytes(iso-8859-1) 得到原始的字節(jié)串,再用 string = new String(bytes, GB2312) 重新得到正確的字符串 中?;仨撌?.4 從數(shù)據(jù)庫讀取字符串通過數(shù)據(jù)庫客戶端(比如 ODBC 或 JDBC)從數(shù)據(jù)庫服務(wù)器中讀取字符串時(shí),客戶端需要從服務(wù)器獲知所使用的 ANSI 編碼。當(dāng)數(shù)據(jù)庫服務(wù)器發(fā)送字節(jié)流給客戶端時(shí),客戶端負(fù)責(zé)將字節(jié)流按照正確的編碼轉(zhuǎn)化成 UNICODE 字符串。如果從數(shù)據(jù)庫讀取字符串時(shí)得到亂碼,而數(shù)據(jù)庫中存放的數(shù)據(jù)又是正確的,那么

24、往往還是因?yàn)榍懊嫣岬降摹罢`解一”造成的。解決的辦法還是通過 string = new String( string.getBytes(iso-8859-1), GB2312) 的方法,重新得到原始的字節(jié)串,再重新使用正確的編碼轉(zhuǎn)化成字符串?;仨撌?.5 電子郵件中的字符串當(dāng)一段 Text 或者 HTML 通過電子郵件傳送時(shí),發(fā)送的內(nèi)容首先通過一種指定的字符編碼轉(zhuǎn)化成“字節(jié)串”,然后再把“字節(jié)串”通過一種指定的傳輸編碼(Content-Transfer-Encoding)進(jìn)行轉(zhuǎn)化得到另一串“字節(jié)串”。比如,打開一封電子郵件源代碼,可以看到類似的內(nèi)容:Content-Type: text/plain; charset=gb2312Content-Transfer-Encoding: base64sbG+qcrQuqO17cf4yee74bGjz9W7+b3wudzA7dbQ0MQNCg0KvPKzxqO6uqO17cnnsaPW0NDEDQoNCg=最常用的 Content-Transfer-Encoding 有 Base64 和 Quoted-Printable 兩種。在對二進(jìn)制文件或者中文文本進(jìn)行轉(zhuǎn)化時(shí),Base64 得到的“字節(jié)串”比 Quoted-Printable 更短。在對英文文本進(jìn)行轉(zhuǎn)化時(shí),Quoted-Printable 得到的“字節(jié)串”比 Base

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對任何下載內(nèi)容負(fù)責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論