当前位置:

首页 > 系统应用 > 聚焦重要数据价值丨DolphinDB降采样算法介绍

聚焦重要数据价值丨DolphinDB降采样算法介绍

1. 绪论在真实的业务场景中,时间序列数据具有以下特点:采集频率(秒级甚至毫秒级)高,导致数据量非常庞大。数据价值密度低。对数据进行合理的降采样不仅极大地可以降低系统压力、节约存储成本,同时也可以帮助用户聚焦重要信息,提升数据价值。本教程将以要点感知算法为例介绍如何在 DolphinDB 自定义并应

1. 绪论

在真实的业务场景中,时间序列数据具有以下特点:

  • 采集频率(秒级甚至毫秒级)高,导致数据量非常庞大。
  • 数据价值密度低。

对数据进行合理的降采样不仅极大地可以降低系统压力、节约存储成本,同时也可以帮助用户聚焦重要信息,提升数据价值。本教程将以要点感知算法为例介绍如何在 DolphinDB 自定义并应用算法降采样数据。

1.1 行业背景

在物联网用户场景里,普遍存在这样一种需求:查询某个采集点全年(或一季度、一个月)的数据,并进行展示分析。而在展示时,若呈现所有数据,会引发性能问题,特别是实时展示时。况且,这其实并非必要,因为仅展示大概趋势就足以满足决策要求,过多数据点反而可能干扰决策。就拿折线图来说,在可视化场景中,随着x轴数据不断增多,y轴对应的数据量也会增加,体现在图上的折线就会愈发复杂。当数据量达到一定程度,就很难再从图中找到具体某一个点所代表的真实值,数据变得十分拥挤。下图展示了1个包含1万个数据点的折线图:

为了能够看到图形的整体,我们就要隐藏一些点,仅展示那些能够代表其他的点,或者是创建能够代表这些点的新数据点,这就是降采样算法解决的问题。

1.2 业务挑战

总体而言,在上述物联网时序数据应用场景中,首先需要将数据存下来,再将一定时间跨度的数据进行可视化展示,或者是流计算实时推送数据进行展示,而不对数据进行降采样,会存在以下几个问题:

  • 存储成本:高采集频率、多采集点数据的存储成本极高
  • 数据展示:展示原始数据遭遇性能瓶颈,且大量噪声数据影响局部趋势
  • 数据价值:数据价值不与存储、展示成本成正比

2. 降采样算法概述

DolphinDB已内置实现了最大值、最小值、平均值等简单的降采样算法,用户可直接调用相应函数来计算。这些降采样算法都是用一个值来表示多条数据,这样做的好处是计算简单、速度快,但缺点是信息损失较大。除了这些,还有很多学者提出了大量更为复杂、高级的降采样算法,适用于不同的场景。DolphinDB的语言具备强大的编程能力,能支持用户自定义实现复杂的降采样算法。接下来,本文将以PIP算法为例,为大家介绍其算法原理、DolphinDB脚本实现,还会给出案例脚本,用户可在自己的DolphinDB server上直接运行该脚本。

3. PIP 算法

3.1 PIP 介绍

PIP(Perceptually Important Points)算法又叫要点感知算法,是一种时间序列聚合算法,其思路是:对于一个长度为 n 的时间序列数据,迭代地依据最大距离原则采样出 k 个数据点, k 是人为设置的降采样数据点数(k <= n)。PIP 算法的具体步骤如下(论文参考:https://sci-hub.se/10.1109/iscmi.2017.8279589)

  • 第一步:采样出时间序列的第 1 个和最后 1 个样本放入降采样数据点集
  • 第二步:计算剩余未采样样本点到其邻接的 2 个要点构成的直线的距离
  • 第三步:采样出距离最大的样本点放入降采样数据点集
  • 第四步:重复第二步和第三步直到采样要点数达到 k 个

可以通过下面的演示图片,更直观的感受 PIP 算法的计算过程:

其中,上述点到直线的距离计算常用的是垂直距离(Vertical Distance),本文中的脚本实现也将采用该距离计算公式。对于点(x3,y3)到另外两点(x1,y1)、(x2,y2)所构成直线的距离的计算公式为

即为下图中蓝色虚线所示的距离:

3.2 脚本实现

DolphinDB 支持用户通过 defg 声明编写脚本实现自定义聚合函数,并且rolling等滑动窗口函数支持调用用户自定义的聚合函数进行滑动计算,因此 DolphinDB 天然支持用户自定义降采样算法进行滑动计算,以下代码为 PIP 算法的脚本实现:

defg PIP(X, Y){
data = table(X as x, Y as y)
rowTab = select x, y, rowNo(x) as rowNo from data
n = size(X)
// k为每次滑动降采样的数据量,取值范围为 3~n(n 为滑动窗口大小)
k = 5
samples = 2
result = string(X[0])+"_"+string(Y[0])
indexList = [0,n-1]
do{
distanceVec = [0.0]
for (i in 0..(size(indexList)-2)){
start, end = indexList[i], indexList[i+1]
x1, y1 = X[start], Y[start]
x2, y2 = X[end], Y[end]
a = (y1-y2)/(x1-x2)
b = y1-a*x1
distanceVec=join(distanceVec, abs(Y[(start+1): end] - (X[(start+1): end]*a + b)))
distanceVec.append!(0)
}
distanceMax = distanceVec.max()
tmp = table(rowTab, distanceVec as distance)
nextPoint = select x, y, rowNo from tmp where distance = distanceMax
result += ","+string(nextPoint.x[0])+"_"+string(nextPoint.y[0])
indexList = indexList.append!(nextPoint.rowNo[0]).sort()
samples = samples+1
}while(samples < k)
result += ","+string(X.last())+"_"+string(Y.last())
return result
}

3.3 算法性能

PIP 算法的时间复杂度是 O(n2),得益于 DolphinDB 内置的向量化编程,我们可以将算法的时间复杂度降低为 O(n) ,极大地提升了算法的计算性能,在单机社区版的 DolphinDB 上将 1 千万条的时间序列数据降采样至 4 万条数据只需 1.4s,并且还可以通过多线程的方式进一步提升性能。

4. 案例演示

4.1 案例脚本

本案例将以 1000 万条的正弦波动数据为例,使用 PIP 算法进行降维并展示降维前后的可视化对比,用户可以在自己的 DolphinDB 环境上运行该案例的完整代码。

  • 清理环境
login('admin', '123456')
undef(all)
clearAllCache()
  • 自定义 PIP 算法函数及解析函数
// PIP 算法聚合函数
defg PIP(X, Y){
data = table(X as x, Y as y)
rowTab = select x, y, rowNo(x) as rowNo from data
n = size(X)
// k 为每次滑动降采样的数据量,取值范围为 3~n(n 为滑动窗口大小)
k = 5
samples = 2
result = string(X[0])+"_"+string(Y[0])
indexList = [0,n-1]
do{
distanceVec = [0.0]
for (i in 0..(size(indexList)-2)){
start, end = indexList[i], indexList[i+1]
x1, y1 = X[start], Y[start]
x2, y2 = X[end], Y[end]
a = (y1-y2)/(x1-x2)
b = y1-a*x1
distanceVec=join(distanceVec, abs(Y[(start+1): end] - (X[(start+1): end]*a + b)))
distanceVec.append!(0)
}
distanceMax = distanceVec.max()
tmp = table(rowTab, distanceVec as distance)
nextPoint = select x, y, rowNo from tmp where distance = distanceMax
result += ","+string(nextPoint.x[0])+"_"+string(nextPoint.y[0])
indexList = indexList.append!(nextPoint.rowNo[0]).sort()
samples = samples+1
}while(samples < k)
result += ","+string(X.last())+"_"+string(Y.last())
return result
}

// 降采样结果解析函数
def strToTable(result){
samplesPIP = keyedTable(`x`y, 1:0, `x`y, `DOUBLE`DOUBLE)
for (res in result){
windows = res.split(',')
for (window in windows){
row = window.split('_')
samplesPIP.append!(table([double(row[0])] as x, [double(row[1])] as y))
}
}
return samplesPIP.sortBy!(`x, 1)
}
  • 模拟数据
// 模拟 1 千万条正弦数据,大小为 153 MB
X = (double(0..9999999)*pi/1000)
Y = sin(X)
  • 结合rolling函数进行滑动计算
// 调用 rolling 函数进行滑动窗口计算,每 1000 个点滑动 1 次,降采样到 10 个点
timer{pipResult = rolling(PIP, [X, Y], 1000, 999)}

// 解析降采样结果输出一张表
samplesPIP = strToTable(pipResult)

4.2 结果展示

DolphinDB 内置了画图函数 plot,用户可以在库内直接调用对数据进行可视化展示,接下来将调用 plot 函数可视化对比降采样前后数据。

  • 原始数据折线图:
plot(Y[0:10000], X[0:10000])

  • 降采样数据折线图:
plot(samplesPIP.y[0:100], samplesPIP.x[0:100])

可见,PIP 降采样算法可以完全保留数据的趋势信息。但在实际业务场景中,需结合实际业务场景合理设置滑动窗口大小及降采样点数。

本文内容来源于网友投稿,如有侵权请联系删除。
作者最新文章
系统应用 物联网
相关文章 更多
Windows 10家庭版怎么升级到专业版?步骤与成本说明
Windows 10家庭版怎么升级到专业版?步骤与成本说明

想知道如何将 Windows 10 家庭版升级到专业版?本文详解通过微软商店购买和输入产品密钥两种官方升级方法,说明数据保留情况、成本计算及升级后如何验证 BitLocker 和远程桌面等功能,助您安全获取专业版权限。

win10自动更新突然恢复启用是什么原因
win10自动更新突然恢复启用是什么原因

Windows 10 自动更新突然重新启用怎么办?本文详解暂停35天期限结束、误点继续更新、重启后任务续跑及公司域策略覆盖等常见原因,提供查看更新历史、设置活动时间和正确使用疑难解答的操作指南,帮助用户在支持结束前安全管理系统更新。

Media Creation Tool下载失败或速度慢的解决方法
Media Creation Tool下载失败或速度慢的解决方法

解决 Media Creation Tool 在下载 Windows 镜像时速度慢、中断或报错的问题。本文按操作顺序指导用户检查网络连接、系统权限、磁盘空间及 U 盘状态,确保顺利制作可启动安装介质。

普通用户选Windows 10家庭版还是专业版?适用场景分析
普通用户选Windows 10家庭版还是专业版?适用场景分析

不确定该选Windows 10家庭版还是专业版?本文解析两者在远程连接、磁盘加密和虚拟化等方面的实际差异,帮你避开性能误区,根据真实使用场景做出最具性价比的选择。

win10断电重启后自动继续更新要怎么阻止
win10断电重启后自动继续更新要怎么阻止

Win10断电重启后总是自动继续更新怎么办?别强行关机,先等恢复完成。教你用暂停更新、设置活动时间和按流量计费连接,减少更新对工作的打扰。注意Win10支持已终止,长期不更新有风险。

win10能不能单独关闭功能更新不关闭安全补丁
win10能不能单独关闭功能更新不关闭安全补丁

解析Windows 10功能更新与质量更新的区别。说明个人家庭版无法永久单独关闭功能更新,专业版可通过组策略延迟功能升级。提醒用户关注Win10支持终止时间,避免误用禁用服务导致安全风险。

win10使用移动热点如何禁止win10自动更新下载
win10使用移动热点如何禁止win10自动更新下载

想知道Win10连手机热点时如何避免偷跑流量?只需将热点网络设为“按流量计费的连接”,即可限制Windows Update自动下载非优先更新。本文提供详细界面导览与设置步骤,助你精准控制后台数据消耗。

U盘启动安装Windows11容易失败?正确装机流程是什么
U盘启动安装Windows11容易失败?正确装机流程是什么

详解 Windows 11 安装的三种路径风险,指导如何制作官方安装介质、正确进入启动菜单、安全清理磁盘分区以及装后验证激活状态,帮助用户避免数据丢失和安装失败。

win10怎么只关闭大版本升级保留安全更新推送
win10怎么只关闭大版本升级保留安全更新推送

想只关闭Win10大版本升级但保留安全补丁?本文区分功能更新与质量更新,详解专业版组策略配置方法,并说明家庭版限制及Win10停止支持后的应对建议。

win10笔记本外出联网如何阻止自动下载更新包
win10笔记本外出联网如何阻止自动下载更新包

Win10笔记本外出使用手机热点时,如何防止自动下载更新包消耗流量?本文详解通过设置“按流量计费的连接”和“暂停更新”来精准控制流量,对比传递优化限速效果,并解释为何不应直接禁用Windows Update服务。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)
Windows

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。