Atelier d’annotation NLP de texte | Outil en ligne gratuit | Elysia Tools
Elysia Tools
Navigation mobile
Text Processing
Atelier d’annotation NLP de texte
Effectue une tokenisation locale explicable, une segmentation, les mots vides, lemmes, racines, entités et n-grammes avec export JSONL ou CoNLL.
Exécution
Exécuter cet outil
Remplissez le formulaire, lancez l’outil et consultez le résultat au même endroit.
Exemples
Exemples adaptés à cet outil
Associé
Continuer avec des outils et dossiers associés
Guide d'utilisation de l'outil
Découvrez quand utiliser cet outil, ce qu'il prend en charge et comment les utilisateurs l'appliquent.
Points clés
Catégorie
Text Processing
Types d’entrée
textarea, select, checkbox, number
Type de sortie
json
Exemples associés
4
API disponible
Oui
Aperçu
Cet atelier d’annotation NLP analyse un texte avec une tokenisation locale explicable, une segmentation, la gestion des mots vides, la racinisation, la lemmatisation, la détection d’entités et les n-grammes. Les résultats peuvent être exportés en JSON, JSONL ou CoNLL.
Quand l’utiliser
Annoter rapidement un document ou un échantillon de corpus avant une analyse NLP.
Extraire des tokens, des lemmes, des racines, des entités et des n-grammes selon une langue choisie.
Produire un export structuré en JSON, JSONL ou CoNLL pour un traitement ultérieur.
Fonctionnement
1Collez le texte à analyser dans le champ « Contenu texte ».
2Sélectionnez la langue ou laissez la détection automatique s’effectuer.
3Activez ou désactivez la suppression des mots vides, la racinisation, la lemmatisation et la détection d’entités.
4Choisissez la taille du n-gramme de 1 à 3, puis le format de sortie JSON, JSONL ou CoNLL.
Cas d’usage
Préparer un corpus multilingue pour une analyse exploratoire des tokens et des lemmes.
Repérer des entités comme les adresses e-mail dans des notes de support ou des documents textuels.
Exporter des annotations ligne par ligne en JSONL ou CoNLL pour un workflow de traitement linguistique.
Exemples
1. Annoter une note de support en anglais
Analyste support
Contexte
Une analyste souhaite examiner rapidement une courte note contenant une adresse e-mail et obtenir un résultat JSON structuré.
Problème
Identifier les tokens et les entités tout en écartant les mots vides.
Utilisation
Collez « The quick fox emailed [email protected]. », sélectionnez l’anglais, gardez le format JSON et activez les options d’annotation souhaitées.
Langue : en ; format : JSON ; mots vides : activés ; racinisation : activée ; lemmatisation : activée ; entités : activées ; n-gramme : 2.
Résultat
Le résultat indique la langue anglaise, un total de 6 tokens et une entité de type EMAIL.
2. Exporter un texte chinois en CoNLL
Chercheur en linguistique
Contexte
Un chercheur veut conserver la segmentation d’un court texte chinois et récupérer des étiquettes dans un format lisible ligne par ligne.
Problème
Obtenir un export CoNLL sans supprimer les mots vides ni appliquer la racinisation ou la lemmatisation.
Utilisation
FAQ
Quels textes puis-je analyser ?
Vous pouvez coller un document ou un échantillon de corpus dans le champ de texte obligatoire.
Quelles langues sont disponibles ?
L’outil prend en charge la détection automatique ainsi que l’anglais, le chinois, l’espagnol, le français, l’allemand, le russe et le portugais.
Quels traitements NLP sont proposés ?
L’outil propose la tokenisation, la segmentation, la gestion des mots vides, la racinisation, la lemmatisation, la détection d’entités et les n-grammes.
Quels formats de sortie puis-je choisir ?
Les résultats sont disponibles en JSON, JSONL avec un token par ligne, ou CoNLL.
Quelle taille de n-gramme est disponible ?
Vous pouvez choisir une taille comprise entre 1 et 3, avec une valeur par défaut de 2.