Как установить Pandas - Академия Selectel

Как установить Pandas

Анализ данных и работа с ИИ в Python с помощью библиотеки Pandas. Установка в Linux, Windows и macOS, обновление и основные функции.

Подготовка данных — это то, с чего начинается любой проект по Data Science или машинному обучению. И здесь не обойтись без Pandas — одной из самых популярных библиотек Python, созданной для эффективной работы с таблицами.

В этой статье рассмотрим методы установки Pandas, разберем часто встречающиеся ошибки при работе с библиотекой и познакомимся с ее основными командами. 

Библиотека Pandas позволяет:

  • читать данные из файлов разного формата (CSV, Excel, SQL, JSON и др.);
  • хранить данные в виде таблиц;
  • фильтровать, сортировать и группировать данные;
  • выполнять вычисления над столбцами;
  • объединять несколько таблиц;
  • очищать данные (удалять пропуски, дубликаты);
  • подготавливать данные для анализа, машинного обучения и визуализации.

Установка через pip в Python 

Менеджер пакетов pip — это самый простой инструмент для установки библиотек , потому что он устанавливается вместе с Python и не требует дополнительной конфигурации. 

Рекомендуется устанавливать Pandas в виртуальном окружении с помощью стандартной Python-библиотеки venv. Это изолирует зависимости проекта и предотвращает конфликты между разными проектами.

Linux, macOS

Установка Pandas

Как создать виртуальное окружение:


      python3 -m venv .venv 
source .venv/bin/activate

После этого можно переходить к установке Pandas:


      pip install pandas

Чтобы проверить, что Pandas успешно установлена, выполните следующую команду:


      pip list | grep pandas

В выводе появится строка с версией Pandas.

В выводе появится строка с версией Pandas.

Обновление версии Pandas

Для обновления версии Pandas выполните команду:


      pip install --upgrade pandas

Удаление Pandas

Чтобы удалить Pandas, используйте команду:


      pip uninstall pandas

Windows

Установка Pandas

Как создать виртуальное окружение в командной строке:


      py -m venv .venv 
.venv\Scripts\activate

Далее выполните команду для установки Pandas:


      pip install pandas

Чтобы проверить, что Pandas успешно установлена, выполните команду:


      pip list | findstr pandas

В выводе команды вы получите строчку с версией Pandas.

Обновление версии Pandas

Для обновления версии Pandas выполните команду:


      pip install --upgrade pandas

Удаление Pandas

Чтобы удалить Pandas, используйте команду:


      pip uninstall pandas

Установка через conda (Linux, Windows, macOS)

Еще один способ установки библиотеки Pandas — это менеджер пакетов conda, который входит в дистрибутивы Miniconda, Anaconda, Miniforge, используемые для машинного обучения и работы с искусственным интеллектом.

Для работы с менеджером пакетов conda необходимо установить один из дистрибутивов, который содержит в себе conda.

Разработчики Pandas в официальной документации рекомендуют использовать дистрибутив Miniforge.Также рекомендуется при работе с Pandas использовать виртуальное окружение.

Установка Pandas

Как создать виртуальное окружение с помощью conda:


      conda create -n myenv python=3.12
conda activate myenv

Замените myenv на название вашего проекта и версию Python на ту, которую вы хотите использовать (в примере взята версия Python 3.12).

Для установки Pandas через conda выполните следующую команду:


      conda install pandas

Чтобы проверить, что Pandas установилась корректно, выполните команду:


      conda list pandas

В выводе должна отобразиться строка с версией Pandas.

В выводе должна отобразиться строка с версией Pandas.

Обновление версии Pandas

Для обновления версии Pandas выполните команду:


      conda update pandas

Удаление Pandas

Чтобы удалить Pandas, используйте команду:


      conda remove pandas

Установка через apt (Linux)

Если вы хотите установить пакет Pandas на уровне всей системы, а не в виртуальном окружении, то используйте установку через APT (Advanced Packaging Tool) — это набор утилит для работы с программными пакетами в системах Linux.

Установка Pandas

Для установки Pandas через apt используйте следующую команду:


      sudo apt install python3-pandas

Чтобы проверить, что Pandas успешно установлена, выполните команду:


      dpkg -l | grep python3-pandas

В выводе вы увидите строчку с версией Pandas. В Debian/Ubuntu пакет Pandas разделен на две части, поэтому вы можете увидеть две строчки.

В выводе вы увидите строчку с версией Pandas.

Обновление версии Pandas

Для обновления версии Pandas выполните команду:


      sudo apt upgrade python3-pandas

Удаление Pandas

Чтобы удалить Pandas, используйте команду:


      sudo apt remove python3-pandas

Установка из git (Linux, Windows, macOS)

Для установки Pandas из git в Linux и macOS используйте командную строку, а для Windows стоит использовать Git Bash — терминал с оболочкой Bash и Unix-командами.

Установка Pandas

Установка Pandas через git может потребоваться, если вы хотите использовать последнюю доступную версию пакета из репозитория или если вы хотите изменять исходный код Pandas. 

В ином случае установка Pandas таким способом не рекомендуется, потому что могут понадобиться дополнительные зависимости для сборки, а код Pandas может быть менее стабильным, чем официальный релиз.

Чтобы установить Pandas из git, используйте следующую команду:


      git clone https://github.com/pandas-dev/pandas.git

Эта команда клонирует репозиторий Pandas на ваш компьютер в папку с названием Pandas. Перейдите в нее с помощью команды:


      cd pandas

Далее нужно активировать виртуальное окружение с помощью стандартной Python-библиотеки venv. Во время установки без использования виртуального окружения вы можете столкнуться с ошибкой externally-managed-environment. Начиная с новых версий Debian и Ubuntu, разработчики ввели защиту PEP 668, которая предотвращает перезапись или повреждение критически важных системных пакетов. 

Ошибка externally-managed-environment.

Как создать виртуальное окружение:


      python3 -m venv .venv 
source .venv/bin/activate

Так как мы не скачиваем готовый пакет Pandas, а собираем его из исходного кода, нужно дополнительно установить пакет для компиляции build-essential и набор инструментов для сборки Pandas из исходного кода. Выполните следующие две команды:


      sudo apt install build-essential
pip install -U pip setuptools wheel cython meson-python ninja numpy

Далее выполните команду для сборки Pandas:


      pip install .

Выполнение команды может занять некоторое время. В результате выполнения вы получите вывод Successfully installed Pandas.

Чтобы проверить, что Pandas успешно установлена, выполните следующую команду:


      pip list | grep pandas

В выводе появится строка с версией Pandas.

В выводе появится строка с версией Pandas.

Обновление версии Pandas

Для обновления версии через git нужно получить последние изменения из репозитория Pandas командой:


      git pull

После этого нужно заново собрать и установить Pandas командой:


      pip install .

Удаление Pandas

Чтобы удалить Pandas, используйте команду:


      pip uninstall pandas

Часто встречающиеся ошибки при работе с Pandas

ModuleNotFoundError: No module named ‘pandas’

Эта ошибка возникает, если библиотека Pandas не установлена.

Эта ошибка возникает, если библиотека Pandas не установлена.

Проверьте, что вы находитесь в нужном рабочем окружении, в котором установлена Pandas.

Если у вас не установлена библиотека Pandas, установите ее.

ImportError: Cannot import name from ‘pandas’

Эта ошибка возникает при попытке импортировать несуществующий класс или функцию из библиотеки Pandas.

ImportError: Cannot import name from 'pandas'

Проверьте название класса в официальной документации Pandas. Если его нет в документации, возможно, вы хотите импортировать класс из другой библиотеки.

В проектах на Python часто используется импорт Pandas в таком формате:

import pandas as pd

Эта команда делает доступными основные классы и функции Pandas, используемые в повседневной работе. Их можно использовать, прописав pd в начале: pd.DataFrame.

ImportError: pandas requires version X or newer of Y

Ошибка возникает, когда версия дополнительной библиотеки, используемой Pandas, не соответствует требованиям текущей версии Pandas. В примере на скриншоте приведена библиотека openpyxl.

В примере на скриншоте приведена библиотека openpyxl.

Для решения проблемы нужно обновить библиотеку командой:


      pip install --upgrade openpyxl

Замените openpyxl на название библиотеки, версию которой нужно обновить.

Основные команды для работы с данными

Импорт библиотеки

Для подключения библиотеки Pandas к Python-проекту нужно импортировать ее в свой код:


      import pandas as pd

pd — это общепринятый псевдоним Pandas, который дальше будет использоваться в коде при взаимодействии с библиотекой.

Для примера используем Pandas для чтения файла в формате csv:


      pd.read_csv()

При желании можно использовать вместо pd любое подходящее наименование или название библиотеки целиком:


      import pandas
pandas.read_csv()

DataFrame

DataFrame — это основная структура данных в Pandas в виде таблицы.

У DataFrame тоже есть общепринятое наименование переменной df.

Пример использования:


      df = pd.read_csv()

Вместо наименования df можно использовать любое подходящее, в примере приводятся наименования table и data:


      table = pd.read_csv()
data = pd.read_csv()

Рассмотрим основные команды для работы с библиотекой Pandas.

Чтение из файла

Для чтения данных из файла используются команды, которые начинаются с read_. В примере прочитаем файлы в формате csv, excel, json, sql:


      pd.read_csv()
pd.read_excel()
pd.read_json()
pd.read_sql()

В скобки необходимо вставить название файла, который нужно прочитать.

Просмотр данных

Чтобы просматривать данные из DataFrame, в Pandas есть разные команды. Для чтения первых пяти строк из файла используется команда с пустыми скобками:


      df.head()

В скобках можно указать число строк, которые нужно вывести. Например, чтение первых десяти строк:


      df.head(10)

Если нужно прочитать последние строки, используется команда:


      df.tail()

В скобках можно указать количество строк или оставить скобки пустыми для вывода пяти последних строк. Чтобы посмотреть информацию о таблице, используется команда:


      df.info()

Эта команда выводит количество строк, наименования всех колонок, количество непустых значений в каждой колонке, тип данных и использование памяти.

Для просмотра размера таблицы можно использовать команду:


      df.shape

Для вывода списка столбцов используется команда:


      df.columns

Выбор данных

Для работы с определенными данными из таблицы есть несколько основных команд.

Для выбора столбца по имени используется команда:


      df["Age"]

В примере используем столбец с названием Age.

Для выбора нескольких столбцов одновременно, их можно перечислить в скобках:


      df[["Age","Salary"]]

В примере используем колонки Age и Salary.

Если нужно работать с первой строкой таблицы, используем команду iloc, которая выбирает строки по порядковому номеру:


      df.iloc[0]

Для выбора нескольких строк перечисляем их в скобках. Например, выбор первой и третьей строки:


      df.iloc[[0, 2]]

Можно добавить дополнительное условие для выбора строки. Например, выберем строку, в которой возраст больше десяти:


      df[df["Age"] > 10]

Также можно дополнительно задать имя столбца, данные из которого нужно вынести. Например, выведем из столбца Name все строки, в которых возраст больше десяти. Для этого используем команду loc, которая выбирает строки и столбцы по именам:


      df.loc[df["Age"] > 10, "Name"]

Работа с пустыми строками

Для поиска пустых значений в таблице используется команда:

Команду можно применить к определенным столбцам. Для примера возьмем столбец Age:


      df["Age"].isna()

Для удаления всех строк, в которых есть хотя бы одно пустое (NaN) значение, используется команда:


      df = df.dropna()

При удалении или изменении столбца команда создает новый DataFrame, а старый остается без изменений. Поэтому нужно задать новой таблице имя или использовать то же имя для добавления изменений в имеющийся DataFrame.

Если нужно удалить строки, имеющие пустые значения только в указанных столбцах:


      df = df.dropna(subset=["Age", "Salary"])

Для заполнения пустых значений какой-нибудь переменной используется команда:


      df = df.fillna(0)

В примере вместо пустых значений NaN проставляется 0.

Добавление столбца

Чтобы добавить новый столбец в таблицу, используется команда:


      df["Total"] = [10, 20, 30]

В примере добавляется столбец с названием Total и значениями 10, 20 и 30. Важно, чтобы количество значений совпадало с количеством строк в таблице.

Удаление столбца и строки

Удалить столбец можно командой:


      df = df.drop(columns=['Age'])

Для удаления первой строки используем команду:


      df = df.drop(df.index[0])

Вместо значения 0 можно подставить любой номер строки, которую нужно удалить.

Сохранение файла в нужном формате

Если необходимо сохранить DataFrame в определенном формате, используется команда, начинающаяся с to_. Для примера сохраним DataFrame в формате csv, excel, json:


      df.to_csv()
df.to_excel()
df.to_json()

Посмотреть полный список функций и методов Pandas можно в официальной документации

Чем может помочь Selectel

Если вы занимаетесь задачами, связанными с машинным обучением, вам будет полезен DAVM — готовый облачный сервер с предустановленными и настроенными инструментами. Он подходит для разработки и обучения ML-моделей, тестирования LLM, создания небольшой платформы обработки данных и BI-аналитики. Среди доступных и готовых к работе инструментов — популярные фреймворки и библиотеки, включая Keras, TensorFlow, HuggingFace, OpenCV, PyTorch, Pandas и другие.

Образ DAVM разворачивается за несколько минут из панели управления. Мы уже настроили авторизацию через Keycloak, установили CUDA Toolkit для работы с GPU и привязали домен, с помощью которого вы сможете подключаться к инструментам через интернет.

Вам остается только выбрать готовую или собрать кастомную конфигурацию DAVM. Выбирайте любую конфигурацию облачного сервера с RAM от 4 ГБ и объемом загрузочного диска от 100 ГБ. Если ваша задача — обучение ML-моделей, рекомендуем использовать конфигурации линейки GPU Line.