========================================
CoreClean — быстрая дедупликация словарей
========================================
Программа убирает повторяющиеся строки из текстовых
словарей. Работает с файлами от килобайта до терабайтов,
до 20 000 словарей за раз, на любых языках и кодировках.
----------------------------------------
ЧЕТЫРЕ КНОПКИ — ЧЕТЫРЕ РЕЖИМА
----------------------------------------
1) «Удалить дубли»
Склеивает все выбранные словари в ОДИН файл и убирает
из него все повторы. На выходе — один общий файл
Combined_Dedup_Result_ДАТА-ВРЕМЯ.txt рядом с первым словарём.
2) «Убрать цепочку дублей с словарей»
Для случая, когда словари нельзя сливать в один — каждый
должен остаться отдельным файлом, но по всему набору
строка не должна повторяться.
Как работает:
• каждый словарь чистится по отдельности и сохраняется сам по себе;
• если одна и та же строка есть в нескольких словарях, она
остаётся только в ОДНОМ из них, а из остальных вырезается;
• повторы внутри самого словаря тоже убираются;
• порядок строк внутри каждого словаря сохраняется;
• оригиналы не трогаются — рядом создаётся очищенная копия
имя_clean_ДАТА-ВРЕМЯ с тем же расширением.
Итог: тот же набор словарей, каждый под своим именем, но
ни одна строка не дублируется между ними.
3) «Очистить словари от этих символов»
Убирает из строк только те символы, которые вы впишете или
вставите в поле над кнопкой. Остальное в строке остаётся.
Как работает:
• из каждой строки вырезаются все символы из вашего списка,
в каком бы месте строки они ни стояли;
• если после чистки строка стала пустой — она выбрасывается;
• дубли НЕ трогаются, порядок строк сохраняется;
• кодировка словаря определяется сама (UTF-8 или системная),
а рядом с кнопкой её можно выбрать вручную — поддерживаются
все кодировки Windows (кириллица, западные, KOI8, DOS, CJK и др.);
UTF-16/32 переводятся в UTF-8 — символы совпадут в любом случае;
• каждый словарь пишется отдельно, оригиналы не трогаются —
рядом создаётся имя_clean_ДАТА-ВРЕМЯ с тем же расширением.
ВНИМАНИЕ: удаляется ровно то, что вписано. Если добавить в поле
обычную букву, цифру или пробел — они вырежутся и из паролей.
4) «Разбить по символам»
Использует символы из того же поля как РАЗДЕЛИТЕЛИ и режет
каждую строку на куски — каждый кусок становится новой строкой.
Пример (разделители -.,@

:
Astranom-Wifi -> Astranom
Wifi
Angela1983@mail.ru:1234 -> Angela1983
mail
ru
1234
• разделители в результат не попадают, пустые куски выбрасываются;
• дубли не трогаются, порядок сохраняется;
• каждый словарь пишется отдельно (имя_split_ДАТА-ВРЕМЯ),
оригиналы не трогаются.
Любой символ, даже непечатаемый, задаётся в поле так:
\t = табуляция, \n и \r = перевод строки, \\ = сам слэш,
\xHH = байт по коду, \uXXXX = символ Юникода по коду.
(это работает и для удаления символов). Наведите курсор на кнопку —
всплывёт подсказка с примером.
----------------------------------------
ЧТО ПОД КАПОТОМ
----------------------------------------
- Использует до 90% ядер процессора и до 55 ГБ памяти,
но не больше, чем реально свободно — на слабом ПК
сам ужимается и не тормозит систему.
- Оригинальные файлы никогда не изменяются.
- Свободное место проверяется заранее, каждая запись
контролируется — данные не теряются.
- По завершении — звуковой сигнал.
Галочка «Ограничить нагрузку» (30/60/90%) — если хотите
параллельно работать за ПК. По умолчанию выключена (полная мощность).
Выберите словари любой из четырёх кнопок выше, чтобы начать.
━━━ Скорость ━━━
Пример: ~1 млрд строк (12 ГБ, 20 файлов) очищается примерно за минуту
━━━ Требования ━━━
Windows x64.
➤ СКАЧАТЬ CoreClean