商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > Python Pandas数据分析的使用完整教学

Python Pandas数据分析的使用完整教学

  发布于2026-06-30 阅读(0)

扫一扫,手机访问

一、数据接入层:高效I/O与现代数据格式

企业的数据源往往是百家争鸣——CSV、Excel、SQL数据库、数据湖里的Parquet文件,不一而足。而分析的起点,就是“如何把数据快速且省内存地读进来”。这看似基础,实则藏着不少门道。

Python Pandas数据分析的使用完整教学

1.1 传统格式的“避坑”读取

不少新手一上来就直接用read_csv()读个大文件,结果内存撑爆、类型推断错误,场面一度尴尬。更专业的做法是:精准控制读取的列、预先指定数据类型,并顺手把时间列解析好。

import pandas as pd
import numpy as np

# 专业做法:精准控制列、类型与分块
dtypes = {
    'order_id': 'int32',
    'user_id': 'int32',
    'status': 'category',  # 低基数枚举字段使用 category
    'amount': 'float32'
}

df = pd.read_csv(
    'huge_orders.csv',
    usecols=['order_id', 'user_id', 'status', 'amount', 'order_time'],
    dtype=dtypes,
    parse_dates=['order_time']
)

1.2 超大文件的分块处理 (Chunking)

当CSV文件大到几十个GB,单机内存吃不消时,就轮到 chunksize 登场了,它能让你像流水线一样处理数据。

chunk_iter = pd.read_csv('billion_rows.csv', chunksize=100_000)
total_revenue = 0

for chunk in chunk_iter:
    # 在每个 chunk 上进行聚合操作,最后合并结果
    total_revenue += chunk['amount'].sum()

1.3 拥抱现代数据湖格式:Parquet

一个非常中肯的建议:如果团队内部有大量数据需要流转,请果断放弃CSV,全面转向Parquet。它天生就是列式存储,压缩率高得惊人,而且能完美保留数据类型,省去你反复做类型转换的麻烦。

# 写入 Parquet (使用 pyarrow 引擎)
df.to_parquet('orders_clean.parquet', engine='pyarrow', compression='snappy')

# 读取 Parquet (Pandas 2.0+ 推荐开启 PyArrow 后端)
df_arrow = pd.read_parquet('orders_clean.parquet', dtype_backend='pyarrow')

二、数据诊断层:快速探索与质量评估 (EDA)

拿到数据后,千万别急着建模或画图。先按捺住躁动的心,给数据来个“全身体检”——这能让你对后续工作的难度和方向心中有数。

2.1 一键生成数据质量诊断报告

def diagnose_dataframe(df: pd.DataFrame) -> pd.DataFrame:
    """数据质量诊断函数"""
    diag = pd.DataFrame({
        'Dtype': df.dtypes,
        'Non_Null': df.count(),
        'Null_Count': df.isnull().sum(),
        'Null_Rate(%)': (df.isnull().sum() / len(df) * 100).round(2),
        'Unique_Count': df.nunique(),
        'Memory_MB': df.memory_usage(deep=True) / (1024**2)
    })
    return diag.sort_values('Null_Rate(%)', ascending=False)

# 调用
diagnose_dataframe(df)

2.2 数值与分布的快速概览

只看均值、中位数、最大最小值远远不够。更推荐关注一下尾部分布,比如95分位和99分位,这能让你发现那些藏在“长尾”里的极端值。

# 查看数值型统计量,并调整显示精度
pd.set_option('display.float_format', lambda x: '%.2f' % x)
print(df.describe(percentiles=[.05, .25, .5, .75, .95, .99])) # 关注长尾分布

# 查看类别型字段的基数和Top频率
print(df.describe(include=['category', 'object']))

三、数据清洗层:脏数据处理方案

如果数据科学家的大部分时间都花在了哪?答案是数据清洗,占了约70%。我们的目标是采用向量化、自动化的方式来搞定这些“脏活累活”。

3.1 缺失值的高级处理

遇到缺失值,不要无脑丢一句dropna()。背后的业务逻辑才是决定处理方式的关键:退款金额缺失可能意味着没退款,那就填0;某个用户的评分数据缺失,用他历史评分的均值来补,是不是比全局均值更合理?

# 1. 业务规则填充:例如“退款金额”缺失代表未退款,填0
df['refund_amount'] = df['refund_amount'].fillna(0)

# 2. 分组填充:用该用户的历史均值填充缺失的评分
df['user_score'] = df.groupby('user_id')['user_score'].transform(
    lambda x: x.fillna(x.mean())
)

# 3. 时间序列插值:对于连续的传感器/财务数据,使用线性或样条插值
df['daily_revenue'] = df['daily_revenue'].interpolate(method='spline', order=2)

3.2 异常值检测与截断 (Winsorization)

在计算均值或训练模型前,必须跟“羊毛党”或“测试订单”产生的极端值做个了断。用基于IQR的“盖帽法”截断,是个成熟且有效的做法。

def clip_outliers_iqr(series: pd.Series, factor=1.5) -> pd.Series:
    """基于 IQR 的异常值截断(盖帽法)"""
    Q1 = series.quantile(0.25)
    Q3 = series.quantile(0.75)
    IQR = Q3 - Q1
    lower_bound = Q1 - factor * IQR
    upper_bound = Q3 + factor * IQR
    return series.clip(lower=lower_bound, upper=upper_bound)

df['amount_clean'] = clip_outliers_iqr(df['amount'])

3.3 字符串的向量化正则提取

从杂乱的备注、地址或描述文本中提取出结构化的信息,是数据分析师的家常便饭。这个场景下,向量化的.str.extract() 比逐行用 apply 调用正则表达式,快了不止一个数量级。

# 假设 df['remark'] 包含类似 "使用优惠券:VIP2026, 免邮" 的文本
# ✅ 向量化做法:
df['coupon_code'] = df['remark'].str.extract(r'优惠券:([A-Z0-9]+)')

# 清理隐藏字符并统一小写
df['city'] = df['city'].str.strip().str.lower().str.replace(r's+', ' ', regex=True)

四、数据转换层:重塑、聚合与多表关联

如果说Pandas有它的“灵魂区域”,那非数据转换层莫属。它决定了你能否将一滩“明细数据”成功转化为桌面上的“业务洞察”。

4.1 优雅的条件筛选:query()

query() 是很多Pandas高手的最爱。它不仅写起来像SQL一样自然,更重要的是,在处理大数据框时,底层用 numexpr 来加速,内存效率远高于传统的布尔索引

# 筛选:高价值、已完成、特定城市的订单
target_cities = ['北京', '上海', '广州', '深圳']

# 使用 @ 引用外部变量
df_filtered = df.query(
    "amount > 1000 and status == 'completed' and city in @target_cities"
)

4.2 分组聚合的终极形态:命名聚合

Pandas 0.25之后引入的命名聚合,可是一项伟大的发明。它让 groupbyagg 的代码可读性直接拉满,输出的宽表结构也一目了然。

user_stats = df.groupby('user_id').agg(
    total_orders=('order_id', 'count'),
    total_spend=('amount', 'sum'),
    a vg_spend=('amount', 'mean'),
    first_order=('order_time', 'min'),
    last_order=('order_time', 'max')
).reset_index()

# 计算 RFM 模型中的时间间隔特征
user_stats['recency_days'] = (pd.Timestamp('2026-05-27') - user_stats['last_order']).dt.days

4.3 数据重塑:长宽表转换

meltpivot_table 就像是两把反方向的钥匙,专门用来解决数据展示和分析时的格式难题。

# 宽转长:将 Jan, Feb, Mar 三列销售额转为一列
df_long = pd.melt(
    df_wide, 
    id_vars=['store_id', 'region'], 
    value_vars=['Jan_Sales', 'Feb_Sales', 'Mar_Sales'],
    var_name='month', 
    value_name='sales'
)

# 长转宽:生成 地区 x 月份 的交叉报表
report = pd.pivot_table(
    df_long, 
    values='sales', 
    index='region', 
    columns='month', 
    aggfunc='sum', 
    fill_value=0,
    margins=True # 添加总计行/列
)

4.4 多表关联的“防爆”

在大规模数据分析中,merge 操作后数据行数“爆炸式”翻倍,从而引发内存溢出或结果异常,是最常见的生产事故之一。一个安全的小习惯是:务必使用 validate 参数来护体。

# ✅ 务必使用 validate 参数验证关联键的唯一性
# 'm:1' 表示左表多对一右表,如果右表 key 不唯一,直接报错拦截!
df_final = pd.merge(
    orders, 
    users, 
    on='user_id', 
    how='left',
    validate='m:1', 
    suffixes=('_order', '_user')
)

五、时序分析层:商业时间序列处理

在电商、金融、SaaS等行业中,时间序列就是数据的灵魂。处理得好,你能从中听出业务的“心跳”。

5.1 时间重采样 (Resample)

将一笔笔不规则的交易流水,聚合为标准的日、周、月报表,是构建任何业务看板的第一步。

# 确保索引是 DatetimeIndex
df_time = df.set_index('order_time')

# 按日重采样,计算每日总GMV和订单数
daily_report = df_time.resample('D').agg(
    gmv=('amount', 'sum'),
    orders=('order_id', 'count')
).fillna(0) # 补齐没有交易的日期

5.2 滑动窗口与滞后特征 (Rolling & Shift)

移动平均、同比、环比——这些业务分析中最常见的指标,都建立在对 rollingshift 的熟练运用上。

# 1. 7日移动平均 GMV
daily_report['gmv_ma7'] = daily_report['gmv'].rolling(window=7).mean()

# 2. 计算日环比增长率 (今日 / 昨日 - 1)
daily_report['gmv_dod'] = daily_report['gmv'].pct_change(periods=1)

# 3. 计算周同比 (今日 / 7天前 - 1)
daily_report['gmv_wow'] = daily_report['gmv'].pct_change(periods=7)

六、性能优化层:突破Pandas内存与速度瓶颈

当数据量超过500万行,很多Pandas操作就会开始变得“慢吞吞”。别急,掌握下面几个核心技巧,你的代码有望提速10倍到100倍

6.1 拥抱Pandas 2.x的PyArrow后端

可以说,这是Pandas历史上一次里程碑式的更新。 PyArrow后端带来的零拷贝读取、更低的内存占用,以及对原生缺失值的支持,让曾经的瓶颈变成了坦途。

# 开启全局 PyArrow 后端 (Pandas 2.0+)
pd.options.mode.dtype_backend = "pyarrow"

# 或者在读取时指定
df = pd.read_csv('data.csv', engine='pyarrow', dtype_backend='pyarrow')
# 此时字符串不再是低效的 object,而是 string[pyarrow],内存直降 70%!

6.2 Copy-on-Write (CoW) 机制

Pandas 2.2开始默认开启的CoW机制,彻底解决了“链式赋值警告(SettingWithCopyWarning)”这个老大难问题,也避免了隐式的内存复制。

# 开启 CoW
pd.options.mode.copy_on_write = True

# 现在,切片操作是懒加载的(视图),只有当你真正修改切片数据时,才会发生内存拷贝。
subset = df[df['amount'] > 100]
subset['new_col'] = 1  # 安全,不会触发警告,也不会意外修改原 df

6.3 消灭apply,走向向量化

apply 本质上是一个披着函数外衣的 for 循环,性能低下。数据分析的世界里,向量化才是王道。

# 场景:根据金额划分等级 (低、中、高)

# ❌ 极慢的 apply
def get_level(x):
    if x < 100: return 'Low'
    elif x < 1000: return 'Mid'
    else: return 'High'
df['level'] = df['amount'].apply(get_level)

# ✅ 向量化方案 1:np.select (推荐,逻辑清晰)
conditions = [df['amount'] < 100, df['amount'] < 1000]
choices = ['Low', 'Mid']
df['level'] = np.select(conditions, choices, default='High')

# ✅ 向量化方案 2:pd.cut (适用于连续数值分箱)
df['level_bin'] = pd.cut(df['amount'], bins=[0, 100, 1000, np.inf], labels=['Low', 'Mid', 'High'])

七、工程实践层:链式编程与代码规范

在实际项目中,代码的可读性和可维护性与运行效率同等重要。推荐使用链式操作(Method Chaining),让代码像一条清晰的生产流水线。

7.1 链式操作与pipe函数

将多个步骤“串联”起来,不仅能让数据处理逻辑一目了然,也方便你随时插入或调整某一步操作。

def drop_outliers(df: pd.DataFrame, col: str) -> pd.DataFrame:
    """自定义清洗管道"""
    limit = df[col].quantile(0.99)
    return df[df[col] <= limit]

# 一气呵成的数据流水线
final_df = (
    pd.read_csv('raw_data.csv', parse_dates=['time'])
    .query("status == 'success'")
    .assign(
        # 在链中直接创建新列
        revenue = lambda x: x['price'] * x['qty'],
        year_month = lambda x: x['time'].dt.to_period('M')
    )
    .pipe(drop_outliers, col='revenue')  # 接入自定义函数
    .groupby('year_month')
    .agg(total_rev=('revenue', 'sum'))
    .reset_index()
)

7.2 代码规范Checklist

  1. 禁止使用 inplace=True:它并不能节省内存,还会破坏链式编程,且在CoW机制下已逐渐被淘汰。
  2. 警惕 object 类型:数据读进来后,第一件事就是把字符串转成 stringcategory,大整数降级为 int32,别犹豫。
  3. 隔离业务逻辑:把复杂的 groupby 或清洗逻辑封装成独立的函数,用 pipe 调用。这样做的好处是便于单元测试,也方便同事理解。
  4. 大表关联前先聚合:这是一个铁律。永远不要拿两张千万级的明细表直接 merge,先在子表做 groupby 聚合,缩到合适的粒度之后再进行关联。
本文转载于:https://www.jb51.net/python/365077g8l.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注