Qu'est-ce que BERT
Modèle de langage Google pour la compréhension de texte
BERT (Bidirectional Encoder Representations from Transformers)
BERT est un modèle de langage pré-entraîné de Google qui a révolutionné le traitement du langage naturel (NLP).
Caractéristiques Principales
| Caractéristique | Description | |-----------------|-------------| | Bidirectionnel | Analyse le contexte de gauche et droite simultanément | | Pré-entraînement | Entraîné sur Wikipedia + BookCorpus (3,3B mots) | | Transformer | Basé sur l'architecture d'attention | | Fine-tuning | Facilement adaptable à des tâches spécifiques |
Tâches de Pré-entraînement
- Masked Language Model (MLM) — prédiction des mots masqués
- Next Sentence Prediction (NSP) — détermination des relations entre phrases
Applications de BERT
| Tâche | Exemple | |-------|---------| | Classification de texte | Analyse de sentiment des avis | | NER | Extraction de noms, dates, organisations | | Question Answering | Répondre aux questions depuis le texte | | Recherche Sémantique | Recherche par sens, pas par mots |
Versions du Modèle
- BERT-Base — 12 couches, 110M paramètres
- BERT-Large — 24 couches, 340M paramètres
- CamemBERT — pour le français
- MultiBERT — 104 langues