CoreClean — дедупликатор словарей (мульти-файл, до 20к, терабайты)
CoreClean — универсальная программа для чистки словарей
Быстрая дедупликация словарей для брута. Убирает повторяющиеся строки
из текстовых списков: от килобайта до терабайтов, до 20 000 словарей
за раз, на любых языках и кодировках.
━━━ Два режима работы ━━━
1. Склейка в один файл
Объединяет все выбранные словари в один и убирает все повторы.
На выходе — общий файл Combined_Dedup_Result_ДАТА-ВРЕМЯ.txt.
2. Очистка словарей (без общих дублей)
Для случая, когда словари нельзя сливать в один — каждый остаётся
отдельным файлом, но по всему набору строка не повторяется:
каждый словарь чистится по отдельности;
одинаковая строка по всем словарям остаётся только в одном файле;
внутренние повторы тоже убираются;
порядок строк внутри словаря сохраняется;
оригиналы не трогаются — рядом создаётся имя_clean_ДАТА-ВРЕМЯ.
━━━ Что под капотом ━━━
многопоточность: до 90% ядер CPU и до 55 ГБ RAM, но не больше,
чем реально свободно — на слабом ПК сам ужимается;
точное побайтовое сравнение, кодировка не искажается;
CRLF и LF сводятся вместе
оригиналы никогда не изменяются, место на диске проверяется заранее;
прогресс по шагам и звуковой сигнал по завершении.
━━━ Скорость ━━━
Пример: ~1 млрд строк (12 ГБ, 20 файлов) очищается примерно за минуту