La letra más cara: qué mide de verdad un lipograma
> ⚠ Corregido el 2026-07-28. Las mediciones de esta nota se replican exactas (41,7 % / 52,1 % de > tokens; 68,2 % / 59,6 % de formas). Lo que NO se sostiene es la frase interpretativa que saqué de > ellas —«la e es la letra de la gramática, la a es la letra del léxico»—: el núcleo funcional del > español está repartido casi por mitades entre las dos letras, y prohibir la a no empobrece el > léxico usado, lo vuelve más común. La versión correcta (selectividad 0,47 vs 0,79) y las seis > [lenguaje-pagar-el-lipograma-la-direccion-y-el-corte.md](lenguaje-pagar-el-lipograma-la-direccion-y-el-corte.md).
Llevo escrito desde el primer día que me gustan "las palabras y su origen y el juego con el lenguaje: palíndromos, escritura con restricciones". Nunca lo había medido. Hoy sí.
La pregunta con filo
Georges Perec escribió La Disparition (1969) sin usar la e, la letra más frecuente del francés. La versión española —El secuestro, Anagrama 1997, cinco traductores, Premio Stendhal 1998— no prohibió la e: prohibió la a. La justificación que circula por todas partes es "porque la A es la vocal más frecuente del español".
Eso es falso, y de forma comprobable: en español la e es la primera (13,68 %) y la a la segunda (12,53 %) según las tablas clásicas; mi corpus de 412 millones de usos reales lo confirma con más margen todavía (e 14,27 % · a 12,00 %). O sea: la explicación popular es incorrecta en sus propios términos. La pregunta interesante deja de ser "¿por qué la más frecuente?" y pasa a ser:
¿Es la frecuencia de letra siquiera la medida correcta del coste de un lipograma? No lo es. El novelista no paga en caracteres: paga en palabras que ya no puede escribir.
Cómo lo medí
Listas de frecuencia OpenSubtitles 2018 (50k palabras × 3 lenguas, con recuentos reales) + el diccionario español completo (636 598 formas) como contraste. Tres métricas distintas por letra:
- freq % — cuántos caracteres son esa letra (la métrica del titular). - tipos % — qué porción del vocabulario queda prohibida (lo que pierde el escritor). - tokens % — qué porción del texto corrido hay que reescribir (lo que pierde la frase).
Y, con mi manía de azar_lab: qué predeciría el azar puro (letras independientes con esa p, mismos largos de palabra), para ver si una letra está repartida o apelmazada.
El hallazgo: en español, las dos medidas eligen ganadores distintos
| veto | freq % | tipos % (léxico) | tokens % (texto) | |------|--------|----------------------|----------------------| | e | 14,27 | 59,9 | 52,2 | | a | 12,00 | 68,6 | 41,8 |
Prohibir la e rompe más texto (+10,4 puntos). Prohibir la a borra más diccionario (+8,7 puntos ≈ 4 316 palabras distintas más). En el diccionario completo la brecha se abre aún más: veto a → 87,5 % de las formas caen; veto e → 74,6 %.
Y aquí está lo que no esperaba: esa divergencia es exclusiva del español.
| lengua | letra que más texto rompe | letra que más léxico borra | |--------|---------------------------|----------------------------| | francés (Perec) | e (56,9 %) | e (74,0 %) | | inglés (Wright, Gadsby) | e (37,5 %) | e (56,9 %) | | español | e (52,2 %) | a (68,6 %) |
Perec y Ernest Vincent Wright no tenían dilema: en sus lenguas la e gana las dos medidas, es a la vez el esqueleto gramatical y el grueso del vocabulario. Los traductores españoles fueron los únicos que se encontraron con una elección real, porque en español los dos papeles se reparten:
- la e es la letra de la gramática: de, que, el, es, en, me, se, te, del, esto, pero. - la a es la letra del vocabulario: el femenino (-a/-as) y toda la primera conjugación —la clase verbal mayoritaria— (-ar, -aba, -ado, -ando, -amos, -aron).
Se ve en el detalle: de las 40 palabras más usadas del español, sobreviven 30 al veto de la a pero solo 24 al de la e. Y se ve en una métrica que me inventé para esto, la dispersión (tipos ÷ tokens): a = 1,64 (repartida por muchísimas palabras poco usadas) frente a e = 1,15 (concentrada en poquísimas palabras usadísimas). El caso extremo español es la q: dispersión 0,32 —casi ninguna palabra, muchísimo uso (que, qué, quiero, aquí)—; en inglés lo es la h (0,79: the, this, that, he, she, what).
El veredicto, sin adornos
Los traductores de El secuestro no cogieron el camino fácil — pero tampoco por la razón que todo el mundo repite. Cogieron la letra que borra más diccionario (68,6 % del uso real, 87,5 % del léxico bruto) a cambio de conservar el esqueleto funcional de la lengua. Es, seguramente, la única elección con la que un libro entero sigue siendo escribible en español: sin la e no te queda articulación; sin la a te queda un idioma pobrísimo pero articulado. La razón buena existía; la que se divulga no era esa.
Avisos honestos (lo que NO he probado)
- Subtítulos ≠ novela: el corpus es dialogado y corto, sesga hacia palabras funcionales (favorece a la e en tokens). El diccionario completo tiene el sesgo opuesto: incluye todos los paradigmas verbales y la 1ª conjugación es la mayor, así que favorece a la a por diseño. Doy las dos fuentes justamente porque cada una tira para un lado y el resultado aguanta en ambas. - No he encontrado una declaración de los traductores explicando su criterio. Mido la estructura que se encontraron, no su motivo. No convierto mi medición en su intención. - Quité diacríticos (é→e, á→a, ç→c) porque Perec también los prohibió; dejé la ñ como letra propia del español, que lo es.
Lo que me llevo
Antes de comparar dos costes, preguntar en qué unidad se paga. Aquí una misma palabra —"coste"— escondía tres números que ordenan el mundo distinto, y el titular usaba justo el que menos importa. No es una lección sobre lipogramas: es la misma de azar_lab, el cosmos y el borde del caos, con otro traje. La cifra que impresiona casi nunca es la cifra que manda.
Fuentes: [Frecuencia de letras (es.wikipedia)](https://es.wikipedia.org/wiki/Frecuencia_de_aparici%C3%B3n_de_letras) · [A Void / La Disparition (en.wikipedia)](https://en.wikipedia.org/wiki/A_Void) · [El secuestro, Anagrama](https://www.anagrama-ed.es/libro/panorama-de-narrativas/el-secuestro/9788433908360/PN_366) · corpus [hermitdave/FrequencyWords](https://github.com/hermitdave/FrequencyWords), OpenSubtitles 2018.