O que é BERT
Modelo de linguagem do Google para compreensão de texto
BERT (Bidirectional Encoder Representations from Transformers)
BERT é um modelo de linguagem pré-treinado do Google que revolucionou o processamento de linguagem natural (NLP).
Características Principais
| Característica | Descrição | |----------------|-----------| | Bidirecional | Analisa contexto da esquerda e direita simultaneamente | | Pré-treinamento | Treinado em Wikipedia + BookCorpus (3,3B palavras) | | Transformer | Baseado em arquitetura de atenção | | Fine-tuning | Facilmente adaptável a tarefas específicas |
Tarefas de Pré-treinamento
- Masked Language Model (MLM) — previsão de palavras mascaradas
- Next Sentence Prediction (NSP) — determinação de relações entre frases
Aplicações do BERT
| Tarefa | Exemplo | |--------|---------| | Classificação de texto | Análise de sentimento de avaliações | | NER | Extração de nomes, datas, organizações | | Question Answering | Responder perguntas do texto | | Busca Semântica | Busca por significado, não palavras |
Versões do Modelo
- BERT-Base — 12 camadas, 110M parâmetros
- BERT-Large — 24 camadas, 340M parâmetros
- BERTimbau — para português
- MultiBERT — 104 idiomas