Python 数据分析 Pandas 核心操作
Pandas 是 Python 数据分析的标配库,提供 DataFrame 和 Series 数据结构。
1. 数据读取与预览
import pandas as pd
df = pd.read_csv('data.csv', encoding='utf-8')
df.head() # 前5行
df.info() # 列信息和类型
df.describe() # 统计描述2. 筛选与过滤
# 条件筛选
df[df['age'] > 30]
df[(df['age'] > 30) & (df['city'] == '北京')]
# 字符串包含
df[df['name'].str.contains('张')]3. 数据清洗
# 删除空值
df.dropna()
# 填充空值
df.fillna(0)
df.fillna(method='ffill')4. 分组聚合
# 按城市计算平均年龄
df.groupby('city')['age'].mean()
# 多聚合
df.groupby('city').agg({'age': ['mean', 'max'], 'salary': 'sum'})5. 合并表
pd.merge(df1, df2, on='id', how='left')
pd.concat([df1, df2], axis=0)Pandas 是数据分析师和科学家必备工具。
