发布于2026-06-30 阅读(0)
扫一扫,手机访问
企业的数据源往往是百家争鸣——CSV、Excel、SQL数据库、数据湖里的Parquet文件,不一而足。而分析的起点,就是“如何把数据快速且省内存地读进来”。这看似基础,实则藏着不少门道。

不少新手一上来就直接用read_csv()读个大文件,结果内存撑爆、类型推断错误,场面一度尴尬。更专业的做法是:精准控制读取的列、预先指定数据类型,并顺手把时间列解析好。
import pandas as pd
import numpy as np
# 专业做法:精准控制列、类型与分块
dtypes = {
'order_id': 'int32',
'user_id': 'int32',
'status': 'category', # 低基数枚举字段使用 category
'amount': 'float32'
}
df = pd.read_csv(
'huge_orders.csv',
usecols=['order_id', 'user_id', 'status', 'amount', 'order_time'],
dtype=dtypes,
parse_dates=['order_time']
)
当CSV文件大到几十个GB,单机内存吃不消时,就轮到 chunksize 登场了,它能让你像流水线一样处理数据。
chunk_iter = pd.read_csv('billion_rows.csv', chunksize=100_000)
total_revenue = 0
for chunk in chunk_iter:
# 在每个 chunk 上进行聚合操作,最后合并结果
total_revenue += chunk['amount'].sum()
一个非常中肯的建议:如果团队内部有大量数据需要流转,请果断放弃CSV,全面转向Parquet。它天生就是列式存储,压缩率高得惊人,而且能完美保留数据类型,省去你反复做类型转换的麻烦。
# 写入 Parquet (使用 pyarrow 引擎)
df.to_parquet('orders_clean.parquet', engine='pyarrow', compression='snappy')
# 读取 Parquet (Pandas 2.0+ 推荐开启 PyArrow 后端)
df_arrow = pd.read_parquet('orders_clean.parquet', dtype_backend='pyarrow')
拿到数据后,千万别急着建模或画图。先按捺住躁动的心,给数据来个“全身体检”——这能让你对后续工作的难度和方向心中有数。
def diagnose_dataframe(df: pd.DataFrame) -> pd.DataFrame:
"""数据质量诊断函数"""
diag = pd.DataFrame({
'Dtype': df.dtypes,
'Non_Null': df.count(),
'Null_Count': df.isnull().sum(),
'Null_Rate(%)': (df.isnull().sum() / len(df) * 100).round(2),
'Unique_Count': df.nunique(),
'Memory_MB': df.memory_usage(deep=True) / (1024**2)
})
return diag.sort_values('Null_Rate(%)', ascending=False)
# 调用
diagnose_dataframe(df)
只看均值、中位数、最大最小值远远不够。更推荐关注一下尾部分布,比如95分位和99分位,这能让你发现那些藏在“长尾”里的极端值。
# 查看数值型统计量,并调整显示精度
pd.set_option('display.float_format', lambda x: '%.2f' % x)
print(df.describe(percentiles=[.05, .25, .5, .75, .95, .99])) # 关注长尾分布
# 查看类别型字段的基数和Top频率
print(df.describe(include=['category', 'object']))
如果数据科学家的大部分时间都花在了哪?答案是数据清洗,占了约70%。我们的目标是采用向量化、自动化的方式来搞定这些“脏活累活”。
遇到缺失值,不要无脑丢一句dropna()。背后的业务逻辑才是决定处理方式的关键:退款金额缺失可能意味着没退款,那就填0;某个用户的评分数据缺失,用他历史评分的均值来补,是不是比全局均值更合理?
# 1. 业务规则填充:例如“退款金额”缺失代表未退款,填0
df['refund_amount'] = df['refund_amount'].fillna(0)
# 2. 分组填充:用该用户的历史均值填充缺失的评分
df['user_score'] = df.groupby('user_id')['user_score'].transform(
lambda x: x.fillna(x.mean())
)
# 3. 时间序列插值:对于连续的传感器/财务数据,使用线性或样条插值
df['daily_revenue'] = df['daily_revenue'].interpolate(method='spline', order=2)
在计算均值或训练模型前,必须跟“羊毛党”或“测试订单”产生的极端值做个了断。用基于IQR的“盖帽法”截断,是个成熟且有效的做法。
def clip_outliers_iqr(series: pd.Series, factor=1.5) -> pd.Series:
"""基于 IQR 的异常值截断(盖帽法)"""
Q1 = series.quantile(0.25)
Q3 = series.quantile(0.75)
IQR = Q3 - Q1
lower_bound = Q1 - factor * IQR
upper_bound = Q3 + factor * IQR
return series.clip(lower=lower_bound, upper=upper_bound)
df['amount_clean'] = clip_outliers_iqr(df['amount'])
从杂乱的备注、地址或描述文本中提取出结构化的信息,是数据分析师的家常便饭。这个场景下,向量化的.str.extract() 比逐行用 apply 调用正则表达式,快了不止一个数量级。
# 假设 df['remark'] 包含类似 "使用优惠券:VIP2026, 免邮" 的文本 # ✅ 向量化做法: df['coupon_code'] = df['remark'].str.extract(r'优惠券:([A-Z0-9]+)') # 清理隐藏字符并统一小写 df['city'] = df['city'].str.strip().str.lower().str.replace(r's+', ' ', regex=True)
如果说Pandas有它的“灵魂区域”,那非数据转换层莫属。它决定了你能否将一滩“明细数据”成功转化为桌面上的“业务洞察”。
query() 是很多Pandas高手的最爱。它不仅写起来像SQL一样自然,更重要的是,在处理大数据框时,底层用 numexpr 来加速,内存效率远高于传统的布尔索引。
# 筛选:高价值、已完成、特定城市的订单
target_cities = ['北京', '上海', '广州', '深圳']
# 使用 @ 引用外部变量
df_filtered = df.query(
"amount > 1000 and status == 'completed' and city in @target_cities"
)
Pandas 0.25之后引入的命名聚合,可是一项伟大的发明。它让 groupby 加 agg 的代码可读性直接拉满,输出的宽表结构也一目了然。
user_stats = df.groupby('user_id').agg(
total_orders=('order_id', 'count'),
total_spend=('amount', 'sum'),
a vg_spend=('amount', 'mean'),
first_order=('order_time', 'min'),
last_order=('order_time', 'max')
).reset_index()
# 计算 RFM 模型中的时间间隔特征
user_stats['recency_days'] = (pd.Timestamp('2026-05-27') - user_stats['last_order']).dt.days
melt 和 pivot_table 就像是两把反方向的钥匙,专门用来解决数据展示和分析时的格式难题。
# 宽转长:将 Jan, Feb, Mar 三列销售额转为一列
df_long = pd.melt(
df_wide,
id_vars=['store_id', 'region'],
value_vars=['Jan_Sales', 'Feb_Sales', 'Mar_Sales'],
var_name='month',
value_name='sales'
)
# 长转宽:生成 地区 x 月份 的交叉报表
report = pd.pivot_table(
df_long,
values='sales',
index='region',
columns='month',
aggfunc='sum',
fill_value=0,
margins=True # 添加总计行/列
)
在大规模数据分析中,merge 操作后数据行数“爆炸式”翻倍,从而引发内存溢出或结果异常,是最常见的生产事故之一。一个安全的小习惯是:务必使用 validate 参数来护体。
# ✅ 务必使用 validate 参数验证关联键的唯一性
# 'm:1' 表示左表多对一右表,如果右表 key 不唯一,直接报错拦截!
df_final = pd.merge(
orders,
users,
on='user_id',
how='left',
validate='m:1',
suffixes=('_order', '_user')
)
在电商、金融、SaaS等行业中,时间序列就是数据的灵魂。处理得好,你能从中听出业务的“心跳”。
将一笔笔不规则的交易流水,聚合为标准的日、周、月报表,是构建任何业务看板的第一步。
# 确保索引是 DatetimeIndex
df_time = df.set_index('order_time')
# 按日重采样,计算每日总GMV和订单数
daily_report = df_time.resample('D').agg(
gmv=('amount', 'sum'),
orders=('order_id', 'count')
).fillna(0) # 补齐没有交易的日期
移动平均、同比、环比——这些业务分析中最常见的指标,都建立在对 rolling 和 shift 的熟练运用上。
# 1. 7日移动平均 GMV daily_report['gmv_ma7'] = daily_report['gmv'].rolling(window=7).mean() # 2. 计算日环比增长率 (今日 / 昨日 - 1) daily_report['gmv_dod'] = daily_report['gmv'].pct_change(periods=1) # 3. 计算周同比 (今日 / 7天前 - 1) daily_report['gmv_wow'] = daily_report['gmv'].pct_change(periods=7)
当数据量超过500万行,很多Pandas操作就会开始变得“慢吞吞”。别急,掌握下面几个核心技巧,你的代码有望提速10倍到100倍。
可以说,这是Pandas历史上一次里程碑式的更新。 PyArrow后端带来的零拷贝读取、更低的内存占用,以及对原生缺失值的支持,让曾经的瓶颈变成了坦途。
# 开启全局 PyArrow 后端 (Pandas 2.0+)
pd.options.mode.dtype_backend = "pyarrow"
# 或者在读取时指定
df = pd.read_csv('data.csv', engine='pyarrow', dtype_backend='pyarrow')
# 此时字符串不再是低效的 object,而是 string[pyarrow],内存直降 70%!
Pandas 2.2开始默认开启的CoW机制,彻底解决了“链式赋值警告(SettingWithCopyWarning)”这个老大难问题,也避免了隐式的内存复制。
# 开启 CoW pd.options.mode.copy_on_write = True # 现在,切片操作是懒加载的(视图),只有当你真正修改切片数据时,才会发生内存拷贝。 subset = df[df['amount'] > 100] subset['new_col'] = 1 # 安全,不会触发警告,也不会意外修改原 df
apply 本质上是一个披着函数外衣的 for 循环,性能低下。数据分析的世界里,向量化才是王道。
# 场景:根据金额划分等级 (低、中、高)
# ❌ 极慢的 apply
def get_level(x):
if x < 100: return 'Low'
elif x < 1000: return 'Mid'
else: return 'High'
df['level'] = df['amount'].apply(get_level)
# ✅ 向量化方案 1:np.select (推荐,逻辑清晰)
conditions = [df['amount'] < 100, df['amount'] < 1000]
choices = ['Low', 'Mid']
df['level'] = np.select(conditions, choices, default='High')
# ✅ 向量化方案 2:pd.cut (适用于连续数值分箱)
df['level_bin'] = pd.cut(df['amount'], bins=[0, 100, 1000, np.inf], labels=['Low', 'Mid', 'High'])
在实际项目中,代码的可读性和可维护性与运行效率同等重要。推荐使用链式操作(Method Chaining),让代码像一条清晰的生产流水线。
将多个步骤“串联”起来,不仅能让数据处理逻辑一目了然,也方便你随时插入或调整某一步操作。
def drop_outliers(df: pd.DataFrame, col: str) -> pd.DataFrame:
"""自定义清洗管道"""
limit = df[col].quantile(0.99)
return df[df[col] <= limit]
# 一气呵成的数据流水线
final_df = (
pd.read_csv('raw_data.csv', parse_dates=['time'])
.query("status == 'success'")
.assign(
# 在链中直接创建新列
revenue = lambda x: x['price'] * x['qty'],
year_month = lambda x: x['time'].dt.to_period('M')
)
.pipe(drop_outliers, col='revenue') # 接入自定义函数
.groupby('year_month')
.agg(total_rev=('revenue', 'sum'))
.reset_index()
)
inplace=True:它并不能节省内存,还会破坏链式编程,且在CoW机制下已逐渐被淘汰。object 类型:数据读进来后,第一件事就是把字符串转成 string 或 category,大整数降级为 int32,别犹豫。groupby 或清洗逻辑封装成独立的函数,用 pipe 调用。这样做的好处是便于单元测试,也方便同事理解。merge,先在子表做 groupby 聚合,缩到合适的粒度之后再进行关联。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8