O que é Tokenização
Divisão de texto em tokens para processamento do modelo
Tokenização é o processo de dividir texto em unidades individuais (tokens) para processamento subsequente por um modelo de linguagem ou sistema NLP.
Tipos de Tokenização
- Baseada em palavras — divisão por espaços e pontuação
- Subpalavra (BPE) — divisão em substrings frequentes
- Nível de caractere — cada caractere como token separado
- SentencePiece — tokenização independente de idioma
Por que a Tokenização é Importante
- Define o vocabulário do modelo
- Afeta o tratamento de palavras raras
- Determina os custos de requisição API (por token)
- Impacta a velocidade de processamento
Exemplos de Tokens
- "olá mundo" → ["olá", " mundo"]
- "aprendizado de máquina" → ["aprendi", "zado", " de", " máquina"]
- "inacreditável" → ["in", "acreditável"]
Tokenizadores Populares
- tiktoken (OpenAI) — para modelos GPT
- SentencePiece — Google, independente de idioma
- Byte-Level BPE — trabalha com bytes
- WordPiece — BERT e derivados