Globaprom.

Wat is Unicode? De universele standaard voor tekencodering, uitgelegd

Unicode is de universele standaard die elk teken van elk schriftsysteem zijn eigen nummer geeft, zodat tekst intact blijft wanneer die tussen systemen, talen en apparaten beweegt. Daardoor overleeft een naam als Nguyễn of Müller een gang door een database.

Vóór Unicode had elke taalfamilie haar eigen incompatibele codering, en tekst die in de ene werd opgeslagen werd vaak onleesbaar als je hem in een andere opende. Unicode verving dat door één kaart: één nummer per teken, van het Latijnse alfabet tot het Arabisch, het Chinees en emoji. Het Unicode Consortium beheert het, en versie 17.0, uitgebracht in 2025, dekt 159.801 tekens verdeeld over 172 schriftsystemen.

In de praktijk denken ontwikkelaars zelden aan Unicode tot er iets breekt. Tekst van begin tot eind als UTF-8 opslaan (de meest voorkomende Unicode-codering), van het formulierveld naar de database naar het exportbestand, is wat namen met accenten, niet-Latijnse schriften en valutasymbolen behoedt voor verandering in vraagtekens. Een winkel die door heel Europa verkoopt verwerkt de Duitse ß, de Franse é en de Poolse ł in hetzelfde bestelformulier zonder erbij na te denken. Doe het op één plek verkeerd en de fout duikt veel verderop op: op een verzendlabel, een factuur, of een zoekopdracht die het record niet meer vindt.

Dit goed doen is deel van i18n: een product dat uitgaat van simpele Engelse tekst overleeft zijn eerste klant genaamd José niet.

Waarom het belangrijk is voor maatwerksoftware

Elk product dat wij bouwen is meertalig-klaar, en Unicode-ondersteuning is de vloer daaronder. We behandelen tekst als UTF-8 van database tot interface, zodat de software klaar is voor elke taal, inclusief schriften van rechts naar links, voordat er ook maar één vertaling is besteld.