ISO 8859,全称ISO/IEC 8859,是
国际标准化组织(ISO)及
国际电工委员会(IEC)联合制定的一系列8位
字符集的标准,现时定义了15个字符集。ASCII收录了空格及94个“可印刷字符”,足以给英语使用。但是,其他使用
拉丁字母的语言(主要是
欧洲国家的语言),都有一定数量的
附加符号字母,故可以使用ASCII及控制字符以外的区域来储存及表示。除了使用
拉丁字母的语言外,使用
西里尔字母的
东欧语言、
希腊语、
泰语、现代
阿拉伯语、
希伯来语等,都可以使用这个形式来
储存及表示。
引言
ASCII收录了空格及94个“可印刷字符”,足以给英语使用。但是,其他使用拉丁字母的语言(主要是
欧洲国家的语言),都有一定数量的附加符号字母,故可以使用ASCII及控制字符以外的区域来储存及表示。
除此以外,如使用
西里尔字母的
东欧语言、希腊语、泰语、现代阿拉伯语、希伯来语等,都可以使用这个形式来储存及表示。
字符集
ISO/IEC
8859-1 (Latin-1) -
西欧语言
ISO/IEC 8859-2 (Latin-2) -
中欧语言
ISO/IEC 8859-3 (Latin-3) -
南欧语言。世界语也可用此
字符集显示。
ISO/IEC 8859-4 (Latin-4) -
北欧语言
ISO/IEC 8859-5 (Cyrillic) - 斯拉夫语言
ISO/IEC 8859-6 (Arabic) - 阿拉伯语
ISO/IEC 8859-7 (Greek) - 希腊语
ISO/IEC 8859-8 (Hebrew) - 希伯来语(视觉顺序)
ISO 8859-8-I - 希伯来语(逻辑顺序)
ISO/IEC 8859-9 (Latin-5 或 Turkish) - 它把Latin-1的冰岛语字母换走,加入
土耳其语字母。
ISO/IEC 8859-10 (Latin-6 或 Nordic) -
北日耳曼语支,用来代替Latin-4。
ISO/IEC 8859-11 (Thai) - 泰语,从
泰国的 TIS620 标准字集演化而来。
ISO/IEC 8859-13 (Latin-7 或 Baltic Rim) - 波罗的语族
ISO/IEC 8859-14 (Latin-8 或 Celtic) -
凯尔特语族 ISO/IEC 8859-15 (Latin-9) - 西欧语言,加入Latin-1欠缺的芬兰语字母和大写法语重音字母,以及欧元符号。
ISO/IEC 8859-16 (Latin-10) -
东南欧语言。主要供罗马尼亚语使用,并加入欧元符号。
由于英语没有任何重音字母(不计外来词),故可使用以上十五个字集中的任何一个来表示。
至于德语方面,因它除了 A-Z, a-z 外,只用 Ä, Ö, Ü, ä, ö, ß, ü 七个字母,而所有拉丁字集(1-4, 9-10, 13-16)均有此七个字母,故德语可使用以上十个字集中的任何一个来表示。
此系列中没有-12号的原因是,此计划原本要设计成一个包含
塞尔特语族字符集的“Latin-7”,但后来塞尔特语族变成了ISO 8859-14 / Latin-8。亦有一说谓-12号本来是预留给
印度天城体梵文的,但后来却搁置了。
基本结构
每个字集定义最多96个字母或符号,在0xA0-0xFF根据不同字符集放入不同的字符。
ISO/IEC 8859十五个字符集的比较 Bin Oct Dec Hex 1 2 3 4 5 6 7 8 9 10 11 13 14 15 16
10100000 240 160 A0 NBSP
10100001 241 161 A1 ¡ Ą Ħ Ą Ё ‘ ¡ Ą ก ” Ḃ ¡ Ą
10100010 242 162 A2 ¢ ˘ ˘ ĸ Ђ ’ ¢ ¢ Ē ข ¢ ḃ ¢ ą
10100011 243 163 A3 £ Ł £ Ŗ Ѓ £ £ £ Ģ ฃ £ £ £ Ł
10100100 244 164 A4 ¤ ¤ ¤ ¤ Є ¤ ?¤ ¤ Ī ค ¤ Ċ ??
10100101 245 165 A5 ¥ Ľ Ĩ Ѕ ₯ ¥ ¥ Ĩ ฅ „ ċ ¥ „
10100110 246 166 A6 ¦ Ś Ĥ Ļ І ¦ ¦ ¦ Ķ ฆ ¦ Ḋ Š Š
10100111 247 167 A7 § § § § Ї § § § § ง § § § §
10101000 250 168 A8 ¨ ¨ ¨ ¨ Ј ¨ ¨ ¨ Ļ จ Ø Ẁ š š
10101001 251 169 A9 © Š İ Š Љ © © © Đ ฉ © © © ©
10101010 252 170 AA ª Ş Ş Ē Њ ͺ × ª Š ช Ŗ Ẃ ª Ș
10101011 253 171 AB « Ť Ğ Ģ Ћ « « « Ŧ ซ « ḋ « «
10101100 254 172 AC ¬ Ź Ĵ Ŧ Ќ ، ¬ ¬ ¬ Ž ฌ ¬ Ỳ ¬ Ź
10101101 255 173 AD ญ
10101110 256 174 AE ® Ž Ž Ў ® ® Ū ฎ ® ® ® ź
10101111 257 175 AF ¯ Ż Ż ¯ Џ ― ¯ ¯ Ŋ ฏ Æ Ÿ ¯ Ż
10110000 260 176 B0 ° ° ° ° А ° ° ° ° ฐ ° Ḟ ° °
10110001 261 177 B1 ± ą ħ ą Б ± ± ± ą ฑ ± ḟ ± ±
10110010 262 178 B2 2 ˛ 2 ˛ В 2 2 2 ē ฒ 2 Ġ 2 Č
10110011 263 179 B3 3 ł 3 ŗ Г 3 3 3 ģ ณ 3 ġ 3 ł
10110100 264 180 B4 ´ ´ ´ ´ Д ΄ ´ ´ ī ด “ Ṁ Ž Ž
10110101 265 181 B5 µ ľ µ ĩ Е ΅ µ µ ĩ ต µ ṁ µ ”
10110110 266 182 B6 ¶ ś ĥ ļ Ж Ά ¶ ¶ ķ ถ ¶ ¶ ¶ ¶
10110111 267 183 B7 · ˇ · ˇ З · · · · ท · Ṗ · ·
10111000 270 184 B8 ¸ ¸ ¸ ¸ И Έ ¸ ¸ ļ ธ ø ẁ ž ž
10111001 271 185 B9 1; š ı š Й Ή 1; 1; đ น 1; ṗ 1; č
10111010 272 186 BA º ş ş ē К Ί ÷ º š บ ŗ ẃ º ș
10111011 273 187 BB » ť ğ ģ Л ؛ » » » ŧ ป » Ṡ » »
10111100 274 188 BC ¼ ź ĵ ŧ М Ό ¼ ¼ ž ผ ¼ ỳ Œ Œ
10111101 275 189 BD ½ ˝ ½ Ŋ Н ½ ½ ½ ― ฝ ½ Ẅ œ œ
10111110 276 190 BE ¾ ž ž О Ύ ¾ ¾ ū พ ¾ ẅ Ÿ Ÿ
10111111 277 191 BF ¿ ż ż ŋ П ؟ Ώ ¿ ŋ ฟ æ ṡ ¿ ż
11000000 300 192 C0 À Ŕ À Ā Р ΐ À Ā ภ Ą À À À
11000001 301 193 C1 Á Á Á Á С ء Α Á Á ม Į Á Á Á
11000010 302 194 C2 Â Â Â Â Т آ Β Â Â ย Ā Â Â Â
11000011 303 195 C3 Ã Ă Ã У أ Γ Ã Ã ร Ć Ã Ã Ă
11000100 304 196 C4 Ä Ä Ä Ä Ф ؤ Δ Ä Ä ฤ Ä Ä Ä Ä
11000101 305 197 C5 Å Ĺ Ċ Å Х إ Ε Å Å ล Å Å Å Ć
11000110 306 198 C6 Æ Ć Ĉ Æ Ц ئ Ζ Æ Æ ฦ Ę Æ Æ Æ
11000111 307 199 C7 Ç Ç Ç Į Ч ا Η Ç Į ว Ē Ç Ç Ç
11001000 310 200 C8 È Č È Č Ш ب Θ È Č ศ Č È È È
11001001 311 201 C9 É É É É Щ ة Ι É É ษ É É É É
11001010 312 202 CA Ê Ę Ê Ę Ъ ت Κ Ê Ę ส Ź Ê Ê Ê
11001011 313 203 CB Ë Ë Ë Ë Ы ث Λ Ë Ë ห Ė Ë Ë Ë
11001100 314 204 CC Ì Ě Ì Ė Ь ج Μ Ì Ė ฬ Ģ Ì Ì Ì
11001101 315 205 CD Í Í Í Í Э ح Ν Í Í อ Ķ Í Í Í
11001110 316 206 CE Î Î Î Î Ю خ Ξ Î Î ฮ Ī Î Î Î
11001111 317 207 CF Ï Ď Ï Ī Я د Ο Ï Ï ฯ Ļ Ï Ï Ï
11010000 320 208 D0 Ð Đ Đ а ذ Π Ğ Ð ะ Š Ŵ Ð Đ
11010001 321 209 D1 Ñ Ń Ñ Ņ б ر Ρ Ñ Ņ ั Ń Ñ Ñ Ń
11010010 322 210 D2 Ò Ň Ò Ō в ز Ò Ō า Ņ Ò Ò Ò
11010011 323 211 D3 Ó Ó Ó Ķ г س Σ Ó Ó ำ Ó Ó Ó Ó
11010100 324 212 D4 Ô Ô Ô Ô д ش Τ Ô Ô ิ Ō Ô Ô Ô
11010101 325 213 D5 Õ Ő Ġ Õ е ص Υ Õ Õ ี Õ Õ Õ Ő
11010110 326 214 D6 Ö Ö Ö Ö ж ض Φ Ö Ö ึ Ö Ö Ö Ö
11010111 327 215 D7 × × × × з ط Χ × Ũ ื × Ṫ × Ś
11011000 330 216 D8 Ø Ř Ĝ Ø и ظ Ψ Ø Ø ุ Ų Ø Ø Ű
11011001 331 217 D9 Ù Ů Ù Ų й ع Ω Ù Ų ู Ł Ù Ù Ù
11011010 332 218 DA Ú Ú Ú Ú к غ Ϊ Ú Ú ฺ Ś Ú Ú Ú
11011011 333 219 DB Û Ű Û Û л Ϋ Û Û Ū Û Û Û
11011100 334 220 DC Ü Ü Ü Ü м ά Ü Ü Ü Ü Ü Ü
11011101 335 221 DD Ý Ý Ŭ Ũ н έ İ Ý Ż Ý Ý Ę
11011110 336 222 DE Þ Ţ Ŝ Ū о ή Ş Þ Ž Ŷ Þ Ț
11011111 337 223 DF ß ß ß ß п ί ‗ ß ß ฿ ß ß ß ß
11100000 340 224 E0 à ŕ à ā р ـ ΰ א à ā เ ą à à à
11100001 341 225 E1 á á á á с ف α ב á á แ į á á á
11100010 342 226 E2 â â â â т ق β ג â â โ ā â â â
11100011 343 227 E3 ã ă ã у ك γ ד ã ã ใ ć ã ã ă
11100100 344 228 E4 ä ä ä ä ф ل δ ה ä ä ไ ä ä ä ä
11100101 345 229 E5 å ĺ ċ å х م ε ו å å ๅ å å å ć
11100110 346 230 E6 æ ć ĉ æ ц ن ζ ז æ æ ๆ ę æ æ æ
11100111 347 231 E7 ç ç ç į ч ه η ח ç į ็ ē ç ç ç
11101000 350 232 E8 è č è č ш و θ ט è č ่ č è è è
11101001 351 233 E9 é é é é щ ى ι י é é ้ é é é é
11101010 352 234 EA ê ę ê ę ъ ي κ ך ê ę ๊ ź ê ê ê
11101011 353 235 EB ë ë ë ë ы ً λ כ ë ë ๋ ė ë ë ë
11101100 354 236 EC ì ě ì ė ь ٌ μ ל ì ė ์ ģ ì ì ì
11101101 355 237 ED í í í í э ٍ ν ם í í ํ ķ í í í
11101110 356 238 EE î î î î ю َ ξ מ î î ๎ ī î î î
11101111 357 239 EF ï ď ï ī я ُ ο ן ï ï ๏ ļ ï ï ï
11110000 360 240 F0 ð đ đ № ِ π נ ğ ð ๐ š ŵ ð đ
11110001 361 241 F1 ñ ń ñ ņ ё ّ ρ ס ñ ņ ๑ ń ñ ñ ń
11110010 362 242 F2 ò ň ò ō ђ ْ ς ע ò ō ๒ ņ ò ò ò
11110011 363 243 F3 ó ó ó ķ ѓ σ ף ó ó ๓ ó ó ó ó
11110100 364 244 F4 ô ô ô ô є τ פ ô ô ๔ ō ô ô ô
11110101 365 245 F5 õ ő ġ õ ѕ υ ץ õ õ ๕ õ õ õ ő
11110110 366 246 F6 ö ö ö ö і φ צ ö ö ๖ ö ö ö ö
11110111 367 247 F7 ÷ ÷ ÷ ÷ ї χ ק ÷ ũ ๗ ÷ ṫ ÷ ś
11111000 370 248 F8 ø ř ĝ ø ј ψ ר ø ø ๘ ų ø ø ű
11111001 371 249 F9 ù ů ù ų љ ω ש ù ų ๙ ł ù ù ù
11111010 372 250 FA ú ú ú ú њ ϊ ת ú ú ๚ ś ú ú ú
11111011 373 251 FB û ű û û ћ ϋ û û ๛ ū û û û
11111100 374 252 FC ü ü ü ü ќ ό ü ü ü ü ü ü
11111101 375 253 FD ý ý ŭ ũ § ύ LRM ı ý ż ý ý ę
11111110 376 254 FE þ ţ ŝ ū ў ώ RLM ş þ ž ŷ þ ț
11111111 377 255 FF ÿ ˙ ˙ ˙ џ ÿ ĸ ’ ÿ ÿ ÿ
在0xA0的位置是“不换行空格”(no-break space)。
在0xAD的位置,大部分都放入了“选择性连字号”(soft hyphen, 即只在一个文字在它的中间换行时才出现的连字号),若你使用的
浏览器支援选择性连字号,上表将不会有任何显示。
黄色的是ISO/IEC 8859-7:2003版本及ISO/IEC 8859-8:1999版本新增的符号。LRM是“左至右记号”(left-to-right mark, U+200E)、RLM是“右至左记号”(right-to-left mark, U+200F)。
绿色的是该字集未有定义该位置。
0x00-0x1F、0x7F、0x80-0x9F在此字符集中未有定义。(控制字符是由ISO/IEC 6429定义)。
关系
在ISO/IEC 8859-n之中,
国际标准化组织只替每个字符集定义了最多96个字符(0xA0-0xFF)。
ISO-8859-n(在ISO与8859之间加上一连
字号)则是由IANA根据ISO/IEC 8859-n所定义的编码表。它除了ISO/IEC 8859-n的字符外,还包括ASCII(0x20-0x7E)字符及65个控制字符(0x00-0x1F及0x7E-0x9F)。
类似的编码
ISO 8859-12这个号码本来是预留给印度天城体梵文的,但最终未有定义。印度有它自己的编码-ISCII。
JIS X 0201是日语片假名的字符集标准。它能与ISO 8859兼容。
VISCII是
越南语在本土以外的侨民最常用的字符集标准。但因越南语有超过一百个重音字母,故它不兼容在ISO 8859。越南国家标准另外有一个符合ISO8859标准的字符集,但字符需要组合,像泰文一样。
ISO 6438是
非洲字母的字符集,但甚少被采纳。
发展状况
The ISO/IEC 8859 standard was maintained by ISO/IEC Joint Technical Committee 1, Subcommittee 2, Working Group 3 (ISO/IEC JTC 1/SC 2/WG 3). In June 2004, WG 3 disbanded, and maintenance duties were transferred to SC 2. The standard is not currently being updated, as the Subcommittee's only remaining Working Group, WG 2, is concentrating on development of ISO/IEC 10646.
参见
由
国际标准化组织出版的ISO/IEC 8859标准,可从以下网址获取 (需要付费) ISO catalogue site 及 ANSI eStandards Store.
部分由ISO/IEC JTC 1/SC 2/WG 3出版的部分ISO/IEC 8859最后审核草案(PDF版本),可从WG 3网站获取:
ISO/IEC 8859-1:1998 - 8-bit single-byte coded graphic character sets, Part 1: Latin alphabet No. 1 (draft dated February 12, 1998, published April 15, 1998)
ISO/IEC 8859-4:1998 - 8-bit single-byte coded graphic character sets, Part 4: Latin alphabet No. 4 (draft dated February 12, 1998, published July 1, 1998)
ISO/IEC 8859-7:1999 - 8-bit single-byte coded graphic character sets, Part 7: Latin/Greek alphabet (draft dated June 10, 1999; superseded by ISO/IEC 8859-7:2003, published October 10, 2003)
ISO/IEC 8859-10:1998 - 8-bit single-byte coded graphic character sets, Part 10: Latin alphabet No. 6 (draft dated February 12, 1998, published July 15, 1998)
ISO/IEC 8859-11:1999 - 8-bit single-byte coded graphic character sets, Part 11: Latin/Thai character set (draft dated June 22, 1999; superseded by ISO/IEC 8859-11:2001, published Dec 15, 2001)
ISO/IEC 8859-13:1998 - 8-bit single-byte coded graphic character sets, Part 13: Latin alphabet No. 7 (draft dated April 15, 1998, published October 15, 1998)
ISO/IEC 8859-15:1998 - 8-bit single-byte coded graphic character sets, Part 15: Latin alphabet No. 9 (draft dated August 1, 1997; superseded by ISO/IEC 8859-15:1999, published March 15, 1999)
ISO/IEC 8859-16:2000 - 8-bit single-byte coded graphic character sets, Part 16: Latin alphabet No. 10 (draft dated November 15, 1999; superseded by ISO/IEC 8859-16:2001, published July 15, 2001)
ECMA standards, which in intent correspond exactly to the ISO/IEC 8859 character set standards, can be found at:
Standard ECMA-94: 8-Bit Single Byte Coded Graphic Character Sets - Latin Alphabets No. 1 to No. 4 2nd edition (June 1986)
Standard ECMA-113: 8-Bit Single-Byte Coded Graphic Character Sets - Latin/Cyrillic Alphabet 3rd edition (December 1999)
Standard ECMA-114: 8-Bit Single-Byte Coded Graphic Character Sets - Latin/Arabic Alphabet 2nd edition (December 2000)
Standard ECMA-118: 8-Bit Single-Byte Coded Graphic Character Sets - Latin/Greek Alphabet (December 1986)
Standard ECMA-121: 8-Bit Single-Byte Coded Graphic Character Sets - Latin/Hebrew Alphabet 2nd edition (December 2000)
Standard ECMA-128: 8-Bit Single-Byte Coded Graphic Character Sets - Latin Alphabet No. 5 2nd edition (December 1999)
Standard ECMA-144: 8-Bit Single-Byte Coded Character Sets - Latin Alphabet No. 6 3rd edition (December 2000)
《
中华人民共和国国家标准》制定了5个标准以对应ISO/IEC 8859的字符集
GB/T 15273.1-1994 信息处理 八位单字节编码图形字符集 第一部分:拉丁字母一
GB/T 15273.2-1995 信息处理 八位单字节编码图形字符集 第二部分:拉丁字母二
GB/T 15273.3-1995 信息处理 八位单字节编码图形字符集 第三部分:拉丁字母三
GB/T 15273.4-1995 信息处理 八位单字节编码图形字符集 第四部分:拉丁字母四
GB/T 15273.7-1996 信息处理 八位单字节编码图形字符集 第七部分:拉丁/希腊字母