- PVSM.RU - https://www.pvsm.ru -

Самый полезный модуль стандартной библиотеки Python, о котором все постоянно забывают

Самый полезный модуль стандартной библиотеки Python, о котором все постоянно забывают - 1

В Python много отличных доступных «из коробки» модулей. Один из самых полезных — collections [1]. Он содержит «специализированные типы для создания контейнеров», являющихся альтернативами универсальным dict, list, set и tuple. Ниже мы рассмотрим три содержащихся в модуле класса, с которыми большинство питонистов сталкивались, но постоянно забывают применять на практике.

NamedTuple

Сложно переоценить полезность именованных кортежей [2] для дата-саентистов. Скажем, занимаетесь вы созданием новой модели, постоянно добавляя новые характеристики в список, который затем планируете скормить фреймворку для машинного обучения. С ростом количества характеристик, рано или поздно вы начнёте путаться и забывать, какой индекс за что отвечает. Ещё хуже, если с вашим кодом придётся работать коллегам: они могут вообще ничего не понять.

Всего пара строк может привести скрипт в порядок. Смотрите:

from collections import namedtuple

Features = namedtuple('Features', ['age', 'gender', 'name'])
row = Features(age=22, gender='male', name='Alex')
print(row.age)

Теперь для доступа к элементам строки вместо указания индексов можно использовать имена, что делает код значительно чище и проще.

Counter

Counter [3], как следует из названия, считает. Звучит несложно, но дата-саентистам нужно вести подсчёты постоянно, поэтому инструмент крайне полезен на практике.

Есть несколько способов создать счётчик, но самый простой — инициализировать его списком значений:

from collections import Counter

ages = [22, 22, 25, 25, 30, 24, 26, 24, 35, 45, 52, 22, 22, 22, 25, 16, 11, 15, 40, 30]
value_counts = Counter(ages)
print(value_counts.most_common())

Запустив этот код (что, кстати, можно сделать передав соответствующий сниппет [4] в pythonanywhere.com/gists/ [5]), вы увидите:

[(22, 5), (25, 3), (24, 2), (30, 2), (35, 1), (40, 1), (11, 1), (45, 1), (15, 1), (16, 1), (52, 1), (26, 1)]

Список кортежей в порядке убывания распространённости значений, где первый элемент кортежа — значение, а второй — как часто оно встречается в изначальном списке. Пары строк кода оказалось достаточно, чтобы узнать, что «22» — самый распространённый возраст, и встречается он 5 раз.

DefaultDict

Один из моих самых любимых инструментов стандартной библиотеки. DefaultDict [6] — словарь с дефолтным значением для любого нового ключа. Пример:

from collections import defaultdict

my_default_dict = defaultdict(int)
for letter in 'the red fox ran as fast as it could':
	my_default_dict[letter] += 1
print(my_default_dict)

Возвращает:

defaultdict(<type 'int'>, {'a': 4, ' ': 8, 'c': 1, 'e': 2, 'd': 2, 'f': 2, 'i': 1, 'h': 1, 'l': 1, 'o': 2, 'n': 1, 's': 3, 'r': 2, 'u': 1, 't': 3, 'x': 1})

При работе с обычным словарём пришлось бы постоянно проверять, существует ли ключ, и инициализировать несуществующие ключи вручную. В примере выше для каждого несуществующего ключа уже есть значение по умолчанию — 0. Это позволяет писать код чище и понятнее.

Помимо целочисленного, DefaultDict часто используют в связке с пустым списком, чтобы начинать добавление элементов без бойлерплейта.

Вперёд — к чистому коду!

Попробуйте вспомнить, можно ли применить классы из collections [1] к задачам, которые вы недавно решали. Иногда «переоткрытие» старых модулей стандартной библиотеки приносит больше пользы, чем освоение новых инструментов.

Автор: germn

Источник [7]


Сайт-источник PVSM.RU: https://www.pvsm.ru

Путь до страницы источника: https://www.pvsm.ru/python/339346

Ссылки в тексте:

[1] collections: https://docs.python.org/3/library/collections.html

[2] именованных кортежей: https://docs.python.org/3/library/collections.html#collections.namedtuple

[3] Counter: https://docs.python.org/2/library/collections.html#collections.Counter

[4] соответствующий сниппет: https://gist.github.com/tfolkman/baff331fcfd65ae411fe1c8b672c7e1f#file-counter-py

[5] pythonanywhere.com/gists/: https://www.pythonanywhere.com/gists/

[6] DefaultDict: https://docs.python.org/3/library/collections.html#collections.defaultdict

[7] Источник: https://habr.com/ru/post/478934/?utm_source=habrahabr&utm_medium=rss&utm_campaign=478934