Как установить Pandas
Анализ данных и работа с ИИ в Python с помощью библиотеки Pandas. Установка в Linux, Windows и macOS, обновление и основные функции.
Подготовка данных — это то, с чего начинается любой проект по Data Science или машинному обучению. И здесь не обойтись без Pandas — одной из самых популярных библиотек Python, созданной для эффективной работы с таблицами.
В этой статье рассмотрим методы установки Pandas, разберем часто встречающиеся ошибки при работе с библиотекой и познакомимся с ее основными командами.
Библиотека Pandas позволяет:
- читать данные из файлов разного формата (CSV, Excel, SQL, JSON и др.);
- хранить данные в виде таблиц;
- фильтровать, сортировать и группировать данные;
- выполнять вычисления над столбцами;
- объединять несколько таблиц;
- очищать данные (удалять пропуски, дубликаты);
- подготавливать данные для анализа, машинного обучения и визуализации.
Установка через pip в Python
Менеджер пакетов pip — это самый простой инструмент для установки библиотек , потому что он устанавливается вместе с Python и не требует дополнительной конфигурации.
Рекомендуется устанавливать Pandas в виртуальном окружении с помощью стандартной Python-библиотеки venv. Это изолирует зависимости проекта и предотвращает конфликты между разными проектами.
Linux, macOS
Установка Pandas
Как создать виртуальное окружение:
python3 -m venv .venv
source .venv/bin/activate
После этого можно переходить к установке Pandas:
pip install pandas
Чтобы проверить, что Pandas успешно установлена, выполните следующую команду:
pip list | grep pandas
В выводе появится строка с версией Pandas.

Обновление версии Pandas
Для обновления версии Pandas выполните команду:
pip install --upgrade pandas
Удаление Pandas
Чтобы удалить Pandas, используйте команду:
pip uninstall pandas
Windows
Установка Pandas
Как создать виртуальное окружение в командной строке:
py -m venv .venv
.venv\Scripts\activate
Далее выполните команду для установки Pandas:
pip install pandas
Чтобы проверить, что Pandas успешно установлена, выполните команду:
pip list | findstr pandas
В выводе команды вы получите строчку с версией Pandas.
Обновление версии Pandas
Для обновления версии Pandas выполните команду:
pip install --upgrade pandas
Удаление Pandas
Чтобы удалить Pandas, используйте команду:
pip uninstall pandas
Установка через conda (Linux, Windows, macOS)
Еще один способ установки библиотеки Pandas — это менеджер пакетов conda, который входит в дистрибутивы Miniconda, Anaconda, Miniforge, используемые для машинного обучения и работы с искусственным интеллектом.
Для работы с менеджером пакетов conda необходимо установить один из дистрибутивов, который содержит в себе conda.
Разработчики Pandas в официальной документации рекомендуют использовать дистрибутив Miniforge.Также рекомендуется при работе с Pandas использовать виртуальное окружение.
Установка Pandas
Как создать виртуальное окружение с помощью conda:
conda create -n myenv python=3.12
conda activate myenv
Замените myenv на название вашего проекта и версию Python на ту, которую вы хотите использовать (в примере взята версия Python 3.12).
Для установки Pandas через conda выполните следующую команду:
conda install pandas
Чтобы проверить, что Pandas установилась корректно, выполните команду:
conda list pandas
В выводе должна отобразиться строка с версией Pandas.

Обновление версии Pandas
Для обновления версии Pandas выполните команду:
conda update pandas
Удаление Pandas
Чтобы удалить Pandas, используйте команду:
conda remove pandas
Установка через apt (Linux)
Если вы хотите установить пакет Pandas на уровне всей системы, а не в виртуальном окружении, то используйте установку через APT (Advanced Packaging Tool) — это набор утилит для работы с программными пакетами в системах Linux.
Установка Pandas
Для установки Pandas через apt используйте следующую команду:
sudo apt install python3-pandas
Чтобы проверить, что Pandas успешно установлена, выполните команду:
dpkg -l | grep python3-pandas
В выводе вы увидите строчку с версией Pandas. В Debian/Ubuntu пакет Pandas разделен на две части, поэтому вы можете увидеть две строчки.

Обновление версии Pandas
Для обновления версии Pandas выполните команду:
sudo apt upgrade python3-pandas
Удаление Pandas
Чтобы удалить Pandas, используйте команду:
sudo apt remove python3-pandas
Установка из git (Linux, Windows, macOS)
Для установки Pandas из git в Linux и macOS используйте командную строку, а для Windows стоит использовать Git Bash — терминал с оболочкой Bash и Unix-командами.
Установка Pandas
Установка Pandas через git может потребоваться, если вы хотите использовать последнюю доступную версию пакета из репозитория или если вы хотите изменять исходный код Pandas.
В ином случае установка Pandas таким способом не рекомендуется, потому что могут понадобиться дополнительные зависимости для сборки, а код Pandas может быть менее стабильным, чем официальный релиз.
Чтобы установить Pandas из git, используйте следующую команду:
git clone https://github.com/pandas-dev/pandas.git
Эта команда клонирует репозиторий Pandas на ваш компьютер в папку с названием Pandas. Перейдите в нее с помощью команды:
cd pandas
Далее нужно активировать виртуальное окружение с помощью стандартной Python-библиотеки venv. Во время установки без использования виртуального окружения вы можете столкнуться с ошибкой externally-managed-environment. Начиная с новых версий Debian и Ubuntu, разработчики ввели защиту PEP 668, которая предотвращает перезапись или повреждение критически важных системных пакетов.

Как создать виртуальное окружение:
python3 -m venv .venv
source .venv/bin/activate
Так как мы не скачиваем готовый пакет Pandas, а собираем его из исходного кода, нужно дополнительно установить пакет для компиляции build-essential и набор инструментов для сборки Pandas из исходного кода. Выполните следующие две команды:
sudo apt install build-essential
pip install -U pip setuptools wheel cython meson-python ninja numpy
Далее выполните команду для сборки Pandas:
pip install .
Выполнение команды может занять некоторое время. В результате выполнения вы получите вывод Successfully installed Pandas.
Чтобы проверить, что Pandas успешно установлена, выполните следующую команду:
pip list | grep pandas
В выводе появится строка с версией Pandas.

Обновление версии Pandas
Для обновления версии через git нужно получить последние изменения из репозитория Pandas командой:
git pull
После этого нужно заново собрать и установить Pandas командой:
pip install .
Удаление Pandas
Чтобы удалить Pandas, используйте команду:
pip uninstall pandas
Часто встречающиеся ошибки при работе с Pandas
ModuleNotFoundError: No module named ‘pandas’
Эта ошибка возникает, если библиотека Pandas не установлена.

Проверьте, что вы находитесь в нужном рабочем окружении, в котором установлена Pandas.
Если у вас не установлена библиотека Pandas, установите ее.
ImportError: Cannot import name from ‘pandas’
Эта ошибка возникает при попытке импортировать несуществующий класс или функцию из библиотеки Pandas.

Проверьте название класса в официальной документации Pandas. Если его нет в документации, возможно, вы хотите импортировать класс из другой библиотеки.
В проектах на Python часто используется импорт Pandas в таком формате:
import pandas as pd
Эта команда делает доступными основные классы и функции Pandas, используемые в повседневной работе. Их можно использовать, прописав pd в начале: pd.DataFrame.
ImportError: pandas requires version X or newer of Y
Ошибка возникает, когда версия дополнительной библиотеки, используемой Pandas, не соответствует требованиям текущей версии Pandas. В примере на скриншоте приведена библиотека openpyxl.

Для решения проблемы нужно обновить библиотеку командой:
pip install --upgrade openpyxl
Замените openpyxl на название библиотеки, версию которой нужно обновить.
Основные команды для работы с данными
Импорт библиотеки
Для подключения библиотеки Pandas к Python-проекту нужно импортировать ее в свой код:
import pandas as pd
pd — это общепринятый псевдоним Pandas, который дальше будет использоваться в коде при взаимодействии с библиотекой.
Для примера используем Pandas для чтения файла в формате csv:
pd.read_csv()
При желании можно использовать вместо pd любое подходящее наименование или название библиотеки целиком:
import pandas
pandas.read_csv()
DataFrame
DataFrame — это основная структура данных в Pandas в виде таблицы.
У DataFrame тоже есть общепринятое наименование переменной df.
Пример использования:
df = pd.read_csv()
Вместо наименования df можно использовать любое подходящее, в примере приводятся наименования table и data:
table = pd.read_csv()
data = pd.read_csv()
Рассмотрим основные команды для работы с библиотекой Pandas.
Чтение из файла
Для чтения данных из файла используются команды, которые начинаются с read_. В примере прочитаем файлы в формате csv, excel, json, sql:
pd.read_csv()
pd.read_excel()
pd.read_json()
pd.read_sql()
В скобки необходимо вставить название файла, который нужно прочитать.
Просмотр данных
Чтобы просматривать данные из DataFrame, в Pandas есть разные команды. Для чтения первых пяти строк из файла используется команда с пустыми скобками:
df.head()
В скобках можно указать число строк, которые нужно вывести. Например, чтение первых десяти строк:
df.head(10)
Если нужно прочитать последние строки, используется команда:
df.tail()
В скобках можно указать количество строк или оставить скобки пустыми для вывода пяти последних строк. Чтобы посмотреть информацию о таблице, используется команда:
df.info()
Эта команда выводит количество строк, наименования всех колонок, количество непустых значений в каждой колонке, тип данных и использование памяти.
Для просмотра размера таблицы можно использовать команду:
df.shape
Для вывода списка столбцов используется команда:
df.columns
Выбор данных
Для работы с определенными данными из таблицы есть несколько основных команд.
Для выбора столбца по имени используется команда:
df["Age"]
В примере используем столбец с названием Age.
Для выбора нескольких столбцов одновременно, их можно перечислить в скобках:
df[["Age","Salary"]]
В примере используем колонки Age и Salary.
Если нужно работать с первой строкой таблицы, используем команду iloc, которая выбирает строки по порядковому номеру:
df.iloc[0]
Для выбора нескольких строк перечисляем их в скобках. Например, выбор первой и третьей строки:
df.iloc[[0, 2]]
Можно добавить дополнительное условие для выбора строки. Например, выберем строку, в которой возраст больше десяти:
df[df["Age"] > 10]
Также можно дополнительно задать имя столбца, данные из которого нужно вынести. Например, выведем из столбца Name все строки, в которых возраст больше десяти. Для этого используем команду loc, которая выбирает строки и столбцы по именам:
df.loc[df["Age"] > 10, "Name"]
Работа с пустыми строками
Для поиска пустых значений в таблице используется команда:
Команду можно применить к определенным столбцам. Для примера возьмем столбец Age:
df["Age"].isna()
Для удаления всех строк, в которых есть хотя бы одно пустое (NaN) значение, используется команда:
df = df.dropna()
При удалении или изменении столбца команда создает новый DataFrame, а старый остается без изменений. Поэтому нужно задать новой таблице имя или использовать то же имя для добавления изменений в имеющийся DataFrame.
Если нужно удалить строки, имеющие пустые значения только в указанных столбцах:
df = df.dropna(subset=["Age", "Salary"])
Для заполнения пустых значений какой-нибудь переменной используется команда:
df = df.fillna(0)
В примере вместо пустых значений NaN проставляется 0.
Добавление столбца
Чтобы добавить новый столбец в таблицу, используется команда:
df["Total"] = [10, 20, 30]
В примере добавляется столбец с названием Total и значениями 10, 20 и 30. Важно, чтобы количество значений совпадало с количеством строк в таблице.
Удаление столбца и строки
Удалить столбец можно командой:
df = df.drop(columns=['Age'])
Для удаления первой строки используем команду:
df = df.drop(df.index[0])
Вместо значения 0 можно подставить любой номер строки, которую нужно удалить.
Сохранение файла в нужном формате
Если необходимо сохранить DataFrame в определенном формате, используется команда, начинающаяся с to_. Для примера сохраним DataFrame в формате csv, excel, json:
df.to_csv()
df.to_excel()
df.to_json()
Посмотреть полный список функций и методов Pandas можно в официальной документации.
Чем может помочь Selectel
Если вы занимаетесь задачами, связанными с машинным обучением, вам будет полезен DAVM — готовый облачный сервер с предустановленными и настроенными инструментами. Он подходит для разработки и обучения ML-моделей, тестирования LLM, создания небольшой платформы обработки данных и BI-аналитики. Среди доступных и готовых к работе инструментов — популярные фреймворки и библиотеки, включая Keras, TensorFlow, HuggingFace, OpenCV, PyTorch, Pandas и другие.
Образ DAVM разворачивается за несколько минут из панели управления. Мы уже настроили авторизацию через Keycloak, установили CUDA Toolkit для работы с GPU и привязали домен, с помощью которого вы сможете подключаться к инструментам через интернет.
Вам остается только выбрать готовую или собрать кастомную конфигурацию DAVM. Выбирайте любую конфигурацию облачного сервера с RAM от 4 ГБ и объемом загрузочного диска от 100 ГБ. Если ваша задача — обучение ML-моделей, рекомендуем использовать конфигурации линейки GPU Line.