¿Qué es Unicode? El estándar universal de codificación, explicado
Unicode es el estándar universal que da a cada carácter de cada sistema de escritura su propio número, para que el texto llegue intacto al moverse entre sistemas, idiomas y dispositivos. Es la razón por la que un nombre como Nguyễn o Müller sobrevive a un paso por la base de datos.
Antes de Unicode, cada familia de idiomas tenía su propia codificación incompatible, y un texto guardado en una se volvía ilegible al abrirlo en otra. Unicode lo sustituyó por un único mapa: un número por carácter, del alfabeto latino al árabe, el chino y los emoji. El Consorcio Unicode lo mantiene, y la versión 17.0, publicada en 2025, cubre 159.801 caracteres en 172 sistemas de escritura.
En la práctica, los desarrolladores casi no piensan en Unicode hasta que algo se rompe. Guardar el texto en UTF-8 (la codificación Unicode más común) de principio a fin, del campo del formulario a la base de datos y al fichero de exportación, evita que los nombres con tildes, las escrituras no latinas y los símbolos de moneda se conviertan en signos de interrogación. Una tienda que vende por toda Europa maneja la ß alemana, la é francesa y la ł polaca en el mismo formulario de pedido sin pensarlo. Un fallo en un solo punto reaparece mucho más adelante: en una etiqueta de envío, una factura o una búsqueda que ya no encuentra el registro.
Hacer esto bien es parte de la i18n: un producto que da por hecho texto en inglés sencillo no sobrevive a su primer cliente llamado José.
Por qué importa para el software a medida
Cada producto que construimos está listo para el multilingüe, y el soporte de Unicode es la base de todo eso. Tratamos el texto como UTF-8 desde la base de datos hasta la interfaz, así que el software está listo para cualquier idioma, incluidas las escrituras de derecha a izquierda, antes de encargar una sola traducción.