# Atelier d’annotation NLP de texte

Effectue une tokenisation locale explicable, une segmentation, les mots vides, lemmes, racines, entités et n-grammes avec export JSONL ou CoNLL.

> Page canonique: https://elysiatools.com/fr/tools/text-nlp-annotation-workbench

- **Catégorie:** Text Processing

- **Mots-clés:** annotation NLP, tokenisation, lemmatisation, entités, n-grammes

## Présentation

Cet atelier d’annotation NLP analyse un texte avec une tokenisation locale explicable, une segmentation, la gestion des mots vides, la racinisation, la lemmatisation, la détection d’entités et les n-grammes. Les résultats peuvent être exportés en JSON, JSONL ou CoNLL.

## Entrées

- **Contenu texte** (textarea): Paste a document or corpus sample...
- **Langue** (select)
- **Format de sortie** (select)
- **Supprimer les mots vides** (checkbox)
- **Activer la racinisation** (checkbox)
- **Activer la lemmatisation** (checkbox)
- **Détecter les entités** (checkbox)
- **Taille du n-gramme** (number)

## Quand l'utiliser

- Annoter rapidement un document ou un échantillon de corpus avant une analyse NLP.
- Extraire des tokens, des lemmes, des racines, des entités et des n-grammes selon une langue choisie.
- Produire un export structuré en JSON, JSONL ou CoNLL pour un traitement ultérieur.

## Fonctionnement

- Collez le texte à analyser dans le champ « Contenu texte ».
- Sélectionnez la langue ou laissez la détection automatique s’effectuer.
- Activez ou désactivez la suppression des mots vides, la racinisation, la lemmatisation et la détection d’entités.
- Choisissez la taille du n-gramme de 1 à 3, puis le format de sortie JSON, JSONL ou CoNLL.

## Cas d'usage

- Préparer un corpus multilingue pour une analyse exploratoire des tokens et des lemmes.
- Repérer des entités comme les adresses e-mail dans des notes de support ou des documents textuels.
- Exporter des annotations ligne par ligne en JSONL ou CoNLL pour un workflow de traitement linguistique.

## Questions fréquentes

### Quels textes puis-je analyser ?

Vous pouvez coller un document ou un échantillon de corpus dans le champ de texte obligatoire.

### Quelles langues sont disponibles ?

L’outil prend en charge la détection automatique ainsi que l’anglais, le chinois, l’espagnol, le français, l’allemand, le russe et le portugais.

### Quels traitements NLP sont proposés ?

L’outil propose la tokenisation, la segmentation, la gestion des mots vides, la racinisation, la lemmatisation, la détection d’entités et les n-grammes.

### Quels formats de sortie puis-je choisir ?

Les résultats sont disponibles en JSON, JSONL avec un token par ligne, ou CoNLL.

### Quelle taille de n-gramme est disponible ?

Vous pouvez choisir une taille comprise entre 1 et 3, avec une valeur par défaut de 2.

## Outils associés

- [Extracteur d'Emails en Vrac](https://elysiatools.com/fr/tools/bulk-email-extractor): Extrayez toutes les adresses e-mail du texte saisi, des articles, du code source Web ou de contenu mixte. Prend en charge la déduplication et l'exportation vers JSON.
- [Expertise et réparation de l’encodage texte](https://elysiatools.com/fr/tools/text-encoding-forensics-and-repair): Examine l’encodage, le BOM, les retours à la ligne et le mojibake, puis produit une réparation locale notée.
- [Traducteur de Titres Multi-langue IA Illimité](https://elysiatools.com/fr/tools/unlimited-ai-title-translator-multi): Outil professionnel de traduction de titres multi-langue avec IA pour les films, séries, anime, jeux et plus, avec sortie au format JSON
- [Suppresseur de Caractères BOM](https://elysiatools.com/fr/tools/data-bom-remover): Supprimer les caractères BOM (Byte Order Mark) du contenu textuel et des fichiers. Parfait pour nettoyer les fichiers texte avec des problèmes d'encodage.
- [Supprimer les Lignes en Double](https://elysiatools.com/fr/tools/remove-duplicate-lines): Déduplique les lignes d'une liste ou d'un bloc de texte. Conserve la première ou la dernière occurrence, avec des options de sensibilité à la casse, de coupe des espaces et d'ignorance des lignes vides.
- [Visualiseur de diff JSON](https://elysiatools.com/fr/tools/json-diff-visualizer): Compare deux JSON et genere un rapport visuel avec chemins et statistiques
- [JSON Key Extractor](https://elysiatools.com/fr/tools/json-key-extractor): Extract all keys from JSON objects with multiple output formats. Perfect for analyzing JSON structure, documentation generation, and understanding complex nested objects.
- [Unique Profond](https://elysiatools.com/fr/tools/uniq-with): Supprime les doublons profonds avec lodash _.uniqWith

## Exemples

- [Échantillons de Texte avec Emojis](https://elysiatools.com/fr/samples/text-with-emoji-samples): Texte multilingue contenant divers emojis Unicode pour tester l'extraction d'emojis
- [Exemples de Lignes en Double](https://elysiatools.com/fr/samples/text-duplicate-line-samples): Fichiers d'échantillon avec divers types de lignes en double pour tester les outils de suppression des doublons
- [Exemples de Caractères Spéciaux](https://elysiatools.com/fr/samples/text-special-characters-samples): Fichiers texte d'échantillon avec divers caractères spéciaux, signes de ponctuation et symboles pour tester la suppression des caractères non alphanumériques
- [Exemples d'Opérations sur Fichiers Android Java](https://elysiatools.com/fr/samples/android-file-operations-java): Exemples d'opérations sur fichiers Android Java incluant lecture/écriture de fichiers texte, copier/déplacer, parcours de répertoires et validation de fichiers
