# Рабочая область NLP-разметки текста

Выполняет объяснимую локальную токенизацию, сегментацию, обработку стоп-слов, леммы, основы, сущности и n-граммы с экспортом JSONL или CoNLL.

> Каноническая страница: https://elysiatools.com/ru/tools/text-nlp-annotation-workbench

- **Категория:** Text Processing

- **Ключевые слова:** NLP-разметка, токенизация, лемматизация, сущности, n-граммы

## Обзор

Рабочая область NLP-разметки текста локально токенизирует и сегментирует текст, обрабатывает стоп-слова, определяет леммы, основы, сущности и n-граммы. Результат можно получить в форматах JSON, JSONL или CoNLL.

## Входные данные

- **Текст** (textarea): Paste a document or corpus sample...
- **Язык** (select)
- **Формат вывода** (select)
- **Удалять стоп-слова** (checkbox)
- **Включить стемминг** (checkbox)
- **Включить лемматизацию** (checkbox)
- **Определять сущности** (checkbox)
- **Размер n-граммы** (number)

## Когда использовать

- Чтобы быстро разбить документ на токены и предложения перед анализом текста.
- Чтобы очистить корпус от стоп-слов и подготовить леммы, основы или n-граммы.
- Чтобы найти сущности, например адреса электронной почты, и экспортировать разметку в JSONL или CoNLL.

## Как это работает

- Вставьте текст в поле «Текст» и выберите язык или оставьте автоматическое определение.
- Выберите формат результата: JSON, JSONL или CoNLL.
- Включите или отключите удаление стоп-слов, стемминг, лемматизацию и определение сущностей.
- Укажите размер n-граммы от 1 до 3 и запустите разметку текста.

## Сценарии использования

- Подготовка текстовых корпусов для поиска частотных слов и устойчивых сочетаний.
- Предварительная разметка отзывов, обращений в поддержку и других текстовых данных.
- Экспорт структурированной разметки для последующего анализа в JSONL или CoNLL.

## Частые вопросы

### Какие языки поддерживаются?

Доступны автоматическое определение, английский, китайский, испанский, французский, немецкий, русский и португальский.

### Какие форматы вывода доступны?

Результат можно получить в JSON, JSONL или CoNLL.

### Можно ли удалить стоп-слова?

Да. Для этого включите опцию «Удалять стоп-слова».

### Что делает лемматизация?

Она добавляет к токенам их леммы — базовые словарные формы.

### Какой размер n-граммы можно выбрать?

Доступны значения от 1 до 3, включая униграммы, биграммы и триграммы.

## Связанные инструменты

- [Массовый Извлекатель Электронной Почты](https://elysiatools.com/ru/tools/bulk-email-extractor): Извлеките все адреса электронной почты из входного текста, статей, веб-исходного кода или смешанного содержимого. Поддерживает дедупликацию и экспорт в JSON.
- [Криминалистика и восстановление кодировки текста](https://elysiatools.com/ru/tools/text-encoding-forensics-and-repair): Проверяет кодировку, BOM, переводы строк и mojibake, а затем создаёт локальный вариант исправления с оценкой.
- [Безлимитный Мультиязычный ИИ-переводчик заголовков](https://elysiatools.com/ru/tools/unlimited-ai-title-translator-multi): Профессиональный инструмент мультиязычного перевода заголовков с ИИ для фильмов, сериалов, аниме, игр и многого другого с выводом в формате JSON
- [Удалитель BOM Символов](https://elysiatools.com/ru/tools/data-bom-remover): Удаление BOM (Byte Order Mark) символов из текстового и файлового содержимого. Идеально для очистки текстовых файлов с проблемами кодировки.
- [Удаление дубликатов строк](https://elysiatools.com/ru/tools/remove-duplicate-lines): Убирает повторяющиеся строки в списке или блоке текста. Оставляет первое или последнее вхождение, с настройками учёта регистра, обрезки пробелов и игнорирования пустых строк.
- [Визуализатор различий JSON](https://elysiatools.com/ru/tools/json-diff-visualizer): Сравнивает два JSON и строит визуальный отчет с путями и статистикой
- [Извлекатель ключей JSON](https://elysiatools.com/ru/tools/json-key-extractor): Извлекает все ключи из объектов JSON с множественными форматами вывода. Идеально для анализа структуры JSON, генерации документации и понимания сложных вложенных объектов.
- [Глубокие уникальные](https://elysiatools.com/ru/tools/uniq-with): Удаляет дубликаты с lodash _.uniqWith и глубокой проверкой

## Примеры

- [Примеры текста с эмодзи](https://elysiatools.com/ru/samples/text-with-emoji-samples): Многоязычный текст, содержащий различные эмодзи Unicode для тестирования извлечения эмодзи
- [Примеры Дублирующихся Строк](https://elysiatools.com/ru/samples/text-duplicate-line-samples): Примеры файлов с различными типами дублирующихся строк для тестирования инструментов удаления дубликатов
- [Примеры Специальных Символов](https://elysiatools.com/ru/samples/text-special-characters-samples): Примеры текстовых файлов с различными специальными символами, знаками пунктуации и символами для тестирования удаления неалфавитно-цифровых символов
- [Примеры Файловых Операций Android Java](https://elysiatools.com/ru/samples/android-file-operations-java): Примеры файловых операций Android Java включая чтение/запись текстовых файлов, копирование/перемещение, обход директорий и валидацию файлов
