Qué es Tokenización
División de texto en tokens para procesamiento del modelo
Tokenización es el proceso de dividir texto en unidades individuales (tokens) para el procesamiento posterior por un modelo de lenguaje o sistema NLP.
Tipos de Tokenización
- Basada en palabras — división por espacios y puntuación
- Subpalabra (BPE) — división en subcadenas frecuentes
- Nivel de carácter — cada carácter como token separado
- SentencePiece — tokenización independiente del idioma
Por qué importa la Tokenización
- Define el vocabulario del modelo
- Afecta el manejo de palabras raras
- Determina los costos de solicitud API (por token)
- Impacta la velocidad de procesamiento
Ejemplos de Tokens
- "hola mundo" → ["hola", " mundo"]
- "aprendizaje automático" → ["aprendi", "zaje", " automático"]
- "increíble" → ["in", "creíble"]
Tokenizadores Populares
- tiktoken (OpenAI) — para modelos GPT
- SentencePiece — Google, independiente del idioma
- Byte-Level BPE — trabaja con bytes
- WordPiece — BERT y derivados