miércoles, 23 de septiembre de 2026

Guía: optimiza el uso de tokens para hacer más eficiente tu operación

Cada palabra que escribes a una IA se convierte en pequeñas piezas llamadas tokens. Entender cómo funcionan te ayuda a saber por qué el español puede consumir más que el inglés y qué puedes hacer para aprovechar mejor cada consulta.

Cuando hablamos con una inteligencia artificial, imaginamos que el sistema lee nuestras frases como las leería otra persona. No es así. Antes de interpretar una pregunta, un modelo de lenguaje la divide en pequeñas piezas llamadas tokens. Esas piezas pueden ser palabras completas, partes de una palabra, signos de puntuación o espacios.

Los tokens son la unidad básica con la que el modelo procesa el lenguaje. También son la medida que utilizan muchas empresas para calcular cuánto cuesta utilizar sus modelos mediante una API, que es el sistema que permite conectar una inteligencia artificial con una aplicación, un sitio web o los sistemas internos de una compañía.

Una palabra no siempre equivale a un token

Podemos imaginar los tokens como las piezas con las que una inteligencia artificial arma y desarma una frase. Algunas palabras son tan frecuentes que el modelo las reconoce casi completas. Otras aparecen divididas en varios fragmentos.

La palabra “casa”, por ejemplo, podría conservarse como una sola pieza. Una palabra menos frecuente, más larga o con una terminación compleja podría dividirse en varias. Lo mismo ocurre con nombres propios, direcciones de internet, números, códigos y signos especiales.

Por eso, contar palabras no basta para saber cuánto texto está procesando un modelo. Una instrucción de 100 palabras puede requerir una cantidad distinta de tokens que otra del mismo tamaño.

OpenAI ofrece Tiktoken, una herramienta que permite observar cómo sus modelos dividen un texto y calcular cuántos tokens contiene. Este cálculo debe hacerse con el tokenizador correspondiente al modelo que se utilizará, porque no todos los sistemas separan el lenguaje de la misma manera.

¿Por qué el español puede ocupar más tokens?

El inglés suele utilizar menos tokens que el español por una combinación de factores. Durante años, los modelos se entrenaron con grandes cantidades de información en inglés. Como consecuencia, sus vocabularios reconocen con mayor facilidad muchas palabras y combinaciones frecuentes de ese idioma.

Una palabra común en inglés puede estar representada como una sola pieza, mientras que su equivalente en español puede dividirse en varias. También influye que el español tiene palabras más largas y utiliza terminaciones para expresar género, número, persona y tiempo verbal.

Por ejemplo, en inglés una idea puede expresarse con una palabra relativamente breve, mientras que en español esa palabra puede incorporar más información gramatical. Además, el modelo pudo haber visto con más frecuencia la versión inglesa durante su entrenamiento.

La diferencia no significa que el español sea un idioma menos eficiente. El problema está en cómo fue construido el vocabulario del modelo y en la cantidad de ejemplos disponibles para cada lengua. Una investigación presentada en la conferencia EMNLP encontró que algunos tokenizadores fragmentan de forma desproporcionada las lenguas con menor representación, lo que puede elevar sus costos de procesamiento y afectar su desempeño.

[pms-restrict subscription_plans="431, 2200"]

El costo no es igual para todos

No existe una cifra universal que indique cuánto más cuesta procesar español que inglés. La diferencia depende del modelo, del texto y del tokenizador.

Una conversación cotidiana puede tener un comportamiento muy distinto al de un documento con términos técnicos, números, nombres propios o tablas. También puede cambiar el precio según se trate de tokens de entrada —lo que el usuario envía— o de salida —lo que el modelo responde—.

Para una persona que utiliza IA algunas veces al día, la diferencia puede ser casi imperceptible. Para una empresa que procesa miles de documentos, atiende clientes con agentes automáticos o genera respuestas durante todo el día, el efecto puede acumularse.

Cada solicitud puede incluir la pregunta, instrucciones generales, documentos de referencia y parte del historial de conversación. Si todos esos elementos se repiten miles de veces, el costo deja de depender únicamente de la pregunta del usuario y también incluye todo el contexto que la aplicación vuelve a enviar.

Los tokens también ocupan espacio

Los tokens no solo influyen en el precio. También determinan cuánta información puede recibir un modelo en una sola conversación o solicitud.

La llamada ventana de contexto es el espacio total que el modelo tiene disponible para considerar instrucciones, documentos, mensajes anteriores y respuesta. Si una aplicación envía demasiada información innecesaria, ocupa parte de ese espacio antes de que el modelo llegue al contenido importante.

Es parecido a trabajar sobre un escritorio. Si está cubierto de papeles que ya no necesitamos, queda menos espacio para revisar el documento que realmente importa.

Mejores prácticas para aprovechar los tokens

La primera práctica es medir el consumo real. Contar palabras solo ofrece una aproximación, porque cada modelo divide el texto de manera diferente. Antes de calcular costos o establecer límites para una aplicación, conviene utilizar el contador oficial del modelo que se empleará.

La segunda es escribir instrucciones directas. No hace falta eliminar toda cortesía ni convertir cada solicitud en una orden seca; basta con quitar frases que no cambian la tarea. Por ejemplo:

“Ayúdame a organizar mis gastos del mes. Te voy a mandar una lista; clasifícalos por categoría y dime en qué estoy gastando más.”

Puede escribirse:

“Clasifica mis gastos por categoría y dime en qué gasto más.”

La segunda petición conserva el objetivo y reduce palabras innecesarias.

En una solicitud cotidiana, eliminar frases introductorias y repeticiones puede reducir el tamaño de una instrucción entre 10% y 30%. El ahorro exacto en tokens debe medirse con el modelo correspondiente, pero la reducción puede ser relevante cuando la misma petición se utiliza miles de veces.

También es recomendable enviar solo la información relacionada con la tarea. Si se quiere revisar una cláusula de un contrato, no hace falta incluir el documento completo si el resto no aporta contexto. En una empresa, un asistente que revisa pedidos puede recibir el número de orden, el estado de la entrega y la política aplicable, en lugar de cargar todo el historial del cliente.

En documentos y conversaciones extensos, el ahorro puede ser mucho mayor. Las investigaciones sobre compresión automática de prompts han reportado reducciones de entre dos y cinco veces en determinados contextos, lo que equivale a utilizar entre 50% y 80% menos tokens. LLMLingua, un sistema desarrollado por investigadores de Microsoft, llegó a reportar una compresión de hasta 20 veces en algunas pruebas específicas, con una pérdida de rendimiento de aproximadamente 1.5% en una de sus evaluaciones.

Esos resultados corresponden a experimentos controlados y no garantizan el mismo ahorro en cualquier conversación. Un estudio publicado en NAACL reportó una reducción de 2.37 veces en el uso de tokens sin pérdida de calidad en una tarea de evaluación de traducciones. Otros métodos han conseguido reducciones promedio de entre 18% y 27% en la longitud de las solicitudes.

Otra práctica consiste en pedir desde el inicio el formato de respuesta. “Explícame este reporte” puede producir una respuesta extensa y poco controlada. “Resume este reporte en cinco puntos y señala los dos riesgos principales” delimita mejor el trabajo y reduce la necesidad de hacer varias consultas para obtener el resultado deseado.

En conversaciones largas, conviene sustituir el historial completo por un resumen actualizado. Así, el modelo recibe los datos que siguen siendo relevantes y no vuelve a procesar información que ya dejó de ser necesaria.

Por último, hay que revisar si el modelo elegido corresponde a la tarea. No todas las solicitudes requieren el sistema más avanzado ni la respuesta más extensa. Una clasificación sencilla, un resumen breve o una extracción de datos pueden resolverse con un modelo más pequeño y menos costoso, mientras que una tarea compleja puede justificar un modelo con mayores capacidades.

Optimizar tokens no significa escribir siempre menos. Significa enviar información útil, evitar repeticiones y pedir exactamente el resultado que se necesita. La mejor instrucción es la más breve que conserva el contexto suficiente para producir una buena respuesta.

¿Hay que escribirle en inglés?

No necesariamente. Cambiar de idioma solo para ahorrar tokens puede hacer que una persona pierda precisión, matices o naturalidad. En una tarea cotidiana, una instrucción clara en español suele ser más importante que una posible reducción de tokens.

Para una empresa que procesa grandes volúmenes de información, sí tiene sentido medir el consumo en español e inglés, comparar modelos y revisar qué idioma ofrece mejores resultados para cada proceso. La decisión debe considerar el costo, pero también la calidad de la respuesta y la facilidad con la que los empleados pueden utilizar la herramienta.

El español no es el problema. La diferencia surge porque los modelos no distribuyen sus piezas de lenguaje de manera uniforme entre todos los idiomas. Comprenderlo permite tomar mejores decisiones: diseñar instrucciones más claras, evitar información repetida y controlar el costo de utilizar inteligencia artificial.

Los tokens son invisibles para quien hace una pregunta, pero están presentes en cada respuesta. Entenderlos ayuda a ver qué ocurre entre el momento en que escribimos una instrucción y el momento en que la máquina responde.

[/pms-restrict]

Contenido restringido para usuarios premium

Comienza con 30 días de acceso incluido. Después, continúa por $169 MXN al mes.

Una forma simple de estar al día

Una selección clara sobre IA, tecnología y los cambios que vale la pena seguir, directo en tu correo.