Как посчитать количество уникальных слов в тексте

Создание сайтов на Django
Данный курс научит Вас создавать сайты на очень мощном фреймворке – Django. Курс состоит из 9 разделов, в которых Вы с нуля освоите данный фреймворк на примере создания полноценного Интернет-магазина.
В рамках многочисленных упражнений Вы так же создадите свой собственный сайт, что даст Вам ту необходимую практику для закрепления материала, а также полноценную серьёзную работу для своего портфолио.
Помимо самого курса Вас ждёт ещё и бесплатный ценный Бонус: «Unit-тестирование сайта на Django». В этом Бонусе Вы узнаете, как можно написать автоматические тесты для проекта на Django. Это позволит находить оперативно ошибки, а также даст возможность в будущем добавлять новый функционал, не боясь что-то сломать в старом.
Подпишитесь на мой канал на YouTube, где я регулярно публикую новые видео.
Подписаться

Подписавшись по E-mail, Вы будете получать уведомления о новых статьях.
Подписаться

Добавляйтесь ко мне в друзья ВКонтакте! Отзывы о сайте и обо мне оставляйте в моей группе.
Анализатор слов
Инструмент «Анализатор слов» представляет исходный список ключевых фраз в виде списка уникальных слов, отсортированых в порядке убывания частоты встречаемости в исходном списке.
Этот инструмент аналогичен «Анализатору слов» в «Подборе слов» за исключением того, что здесь вы можете использовать произвольный список ключевых слов.
Список уникальных слов полезно просмотреть, чтобы понять, какие из часто встречающихся в выборке слов не относятся к вашей теме, и поэтому их нужно поместить в список слов для исключения. Пример ключевой фразы поможет понять контекст употребления слов и выявить нецелевые контекстные значения ваших поисковых слов.
Например, мы ищем «светлые обои » для квартиры. Вверху списка уникальных слов находятся слова «рабочий» и «стол», поэтому фразу «рабочий слол» можно сразу поместить в список исключений, поскольку речь идет об обоях, которые являются электронными картинками для рабочего стола ПК.
Максимальное количество строк в исходном списке — 100 000.
Если в вашем исходном списке ключевых слов встречаются операторы поиска (кавычки, восклицательный знак, минус и т.п., например, при копировании их из кампаний Яндекс Директ), то сначала нормализуйте ваш список ключевых слов.
Пишем простой счётчик уникальных слов на Python с GUI на Tkinter
Данная статья написана для тех, кто только начал изучать Python. В ней я пошагово опишу создание простого счетчика слов из txt-файлов, применяя Tkinter. Исходный код написан под Python 2.7, в конце статьи я добавлю несколько комментариев относительно того, как перенести его под 3.6
С чего начинаем?
Никаких незаурядных лестниц в программе не будет, так что рекомендую писать в IDLE; конечно же, без проблем можно писать и в PyCharm’е, и в Эклипсе.
Время создать первую и последнюю функцию, которая, собственно, будет выполнять все подсчёты:
Итак, что выполняет эта функция? Всё очевидно: открывает файл, считываем содержимое, убирает всякие символы и создает список из содержимого файла. Не стоит забывать убрать верхний регистр методом lower для корректной дальнейшей проверки на повторение слов. Дальше мы будем обрабатывать этот список. Фактически, считав длину этого списка функцией len, нам уже будет известно количество слов.
Количество уникальных слов
Чтобы посчитать кол-во уникальных слов, создадим ещё один список, в который будет через цикл заносить слова, которых ещё в нём не было:
Далее мы просто будет считывать длину списка nonrep_words.
Графическая оболочка
Для начала нам следует подключить соответствующие модули в нашу программу:
Теперь после определения нашей главной функции напишем код, который будет отображать главное окно, название нашей программки, кнопку «Импортировать файл» и поле вывода:
Вообще-то можно и не использовать фрейм для кнопки, лейбла и текстового поля, но если вы захотите на досуге добавить в дальнейшем ещё несколько каких-либо функций, то фрейм будет полезен для позиционирования.
При создании кнопки мы забиндили её на функцию counter.
Импорт файла и вывод
В начало определения функции counter добавим строчки:
Здесь всё просто: чистим поле вывода методом delete, затем открываем файл методом askopenfilename и передаём его имя переменной filename.
Далее в конец функции добавим:
Здесь мы выводим длину двух списков: списка всех слов и списка уникальных слов.