读取数据
import pandas as pd
# 读取 CSV
df = pd.read_csv('data.csv', encoding='utf-8')
# 读取 Excel
df = pd.read_excel('data.xlsx', sheet_name='Sheet1')
# 读取 JSON
df = pd.read_json('data.json')数据预览
df.head(10) # 前10行
df.info() # 基本信息
df.describe() # 统计描述
df.shape # (行, 列)筛选与过滤
# 条件筛选
df[df['age'] > 30]
df[(df['age'] > 30) & (df['city'] == '北京')]
# 字符串包含
df[df['name'].str.contains('张')]数据清洗
# 删除空值
df.dropna()
# 填充空值
df.fillna(value=0)
df.fillna(method='ffill') # 前向填充
# 删除重复
df.drop_duplicates()分组聚合
# 按城市分组计算平均年龄
df.groupby('city')['age'].mean()
# 多聚合
df.groupby('city').agg({'age': ['mean', 'max'], 'salary': 'sum'})合并表
pd.merge(df1, df2, on='id', how='left')
pd.concat([df1, df2], axis=0) # 垂直拼接Pandas 是 Python 数据科学的基石,熟练使用能让工作效率翻倍。
