Tecnologia da Informação

Codificação de Caracteres ISO/IEC 8859-5

Pontos principais

  • A ISO/IEC 8859-5 é uma codificação de 8 bits para alfabetos cirílicos, publicada originalmente em 1988.
  • Não foi amplamente adotada, sendo superada por padrões como Windows-1251, KOI8-R e IBM-866.
  • O layout do bloco cirílico do Unicode foi baseado na estrutura da ISO 8859-5.
  • A norma original não suportava a letra ucraniana 'ґ', levando à criação da Code Page 1124 pela IBM.

A ISO/IEC 8859-5 é uma norma técnica de codificação de caracteres de 8 bits, parte da série ISO/IEC 8859, projetada para representar grafemas de alfabetos que utilizam a escrita cirílica. Publicada originalmente em 1988, esta norma visa padronizar a representação de idiomas como russo, búlgaro, bielorrusso, sérvio e macedônio em sistemas computacionais.

Características e Escopo

O padrão ISO/IEC 8859-5 é baseado no ASCII, mantendo a compatibilidade com os primeiros 128 caracteres (0-127). A extensão para 8 bits permite a inclusão de caracteres cirílicos na faixa superior (128-255). Embora tenha sido concebida para ser a solução universal para línguas cirílicas, a norma não obteve a adoção generalizada que se esperava.

Limitações e Alternativas

Na prática, outras codificações de 8 bits tornaram-se mais prevalentes que a ISO 8859-5, especialmente em sistemas operacionais específicos:

  • KOI8-R e KOI8-U: Amplamente utilizadas em sistemas Unix e no início da internet russa.
  • IBM-866: Comum em sistemas DOS.
  • Windows-1251: O padrão predominante em sistemas Microsoft Windows para cirílico.

É importante notar que, diferentemente da relação entre a Windows-1252 e a ISO 8859-1 (Latim-1), a Windows-1251 não possui uma relação estreita de mapeamento com a ISO 8859-5, o que causou fragmentação na troca de dados entre sistemas.

Relação com o Unicode

Apesar da baixa adoção comercial, a ISO 8859-5 teve um impacto significativo na arquitetura do Unicode. O bloco principal de caracteres cirílicos no padrão Unicode foi estruturado utilizando um layout baseado na ISO 8859-5, facilitando a migração de dados legados para o padrão universal moderno.

Histórico e Evolução Técnica

A evolução da norma foi marcada por ajustes na ordenação dos caracteres. A primeira edição do padrão ECMA-113 era equivalente ao ISO-IR-111, que expandia o KOI-8 (definido pelo GOST 19768-74). No KOI-8, as letras russas eram organizadas de forma a corresponderem aos seus equivalentes romanos no ASCII, facilitando a leitura em sistemas que não suportavam cirílico.

Contudo, o rascunho inicial da ISO 8859-5 (DIS-8859-5:1987) foi revisado após a substituição do GOST 19768-74 pelo ISO-IR-153 em 1987. Esta nova revisão reorganizou as letras russas em ordem alfabética (com exceção da letra Ё), resultando no conjunto final conhecido como ISO-IR-144.

Adaptações Regionais e Extensões

Devido a lacunas na norma original, surgiram variantes para atender necessidades linguísticas específicas:

  • Ucraniano: A ISO 8859-5 carece da letra ge (ґ), essencial para a ortografia ucraniana. Para suprir essa falha, a IBM criou a Code Page 1124, que substitui o caractere ѓ pelo ґ.
  • IBM Code Page 915: Uma extensão da ISO/IEC 8859-5 que adiciona símbolos semigráficos na área de controle C1.
  • Conjuntos Suplementares: Foram registrados conjuntos como o ISO-IR-200 (Uralic Supplementary Cyrillic Set) e ISO-IR-201 (Volgaic Supplementary Cyrillic Set) para suportar idiomas como Sami de Kildin, Komi, Nenets, Chuvash e Mari, que não eram contemplados pela norma base.

Perguntas frequentes

O que é a ISO/IEC 8859-5?

É um padrão de codificação de caracteres de 8 bits projetado para representar idiomas que utilizam o alfabeto cirílico, como o russo e o búlgaro.

Por que a ISO 8859-5 não foi amplamente utilizada?

Porque outras codificações, como a Windows-1251 e a KOI8-R, já estavam estabelecidas ou eram mais convenientes para os sistemas operacionais da época.

Qual a relação entre a ISO 8859-5 e o Unicode?

O bloco principal de caracteres cirílicos do Unicode utiliza um layout baseado na ISO 8859-5, o que serviu como referência para a padronização universal.

A ISO 8859-5 suporta o idioma ucraniano?

Parcialmente. Ela não inclui a letra 'ґ', necessária para a ortografia ucraniana, o que exigiu a criação de variantes como a Code Page 1124 da IBM.