1. Разделение несбалансированного датасета тональности 70/15/15
ML-инженерКонтекст
Специалист готовит обучающий набор отзывов, где положительный класс преобладает, а нейтральный представлен малой долей строк.
Проблема
При обычном случайном сплите редкий класс может неравномерно распределиться или полностью выпасть из тестового набора.
Как использовать
Вставить CSV-текст с колонкой `label`, выбрать стандартный режим сплита 70/15/15, включить стратификацию и нажать обработку.
{
"targetColumn": "label",
"splitMode": "standard",
"trainPercent": 70,
"valPercent": 15,
"stratify": true,
"randomSeed": 42,
"exportZip": true
}Результат
Датасет разделен на train, validation и test с точным сохранением пропорций каждого класса и упакован в ZIP с отчетом.