发布于2026-07-07 阅读(0)
扫一扫,手机访问
在 Ubuntu 系统下用 Go 做数据分析,这条路线其实比想象中要清晰得多。我们一步步来梳理。
先把基础打牢。安装 Go 本身不复杂,建议直接上 1.22 以上的版本,一句命令搞定:
sudo apt update && sudo apt install -y golang
验证安装就用 go version。
那么,真正干活的时候要用到哪些库?这里按用途列一份清单:
还有一个容易被忽略的细节:如果需要生成 PNG 或 SVG 格式的可视化图表,得先装好 graphviz。
sudo apt install -y graphviz
这一套组合拳下来,从数据读取、清洗、统计到出图,基本就全覆盖了。
直接进入实战环节。目标很明确:读取一个 CSV 文件,计算均值、方差、标准差,再做个简单的分组计数。
下面这段代码可以直接跑,路径记得按自己实际的文件位置改一下:
package main
import (
"encoding/csv"
"fmt"
"log"
"os"
"sort"
"strconv"
"gonum.org/v1/gonum/stat"
)
type Record struct {
Region string
Score float64
}
func main() {
f, err := os.Open("data.csv")
if err != nil {
log.Fatal(err)
}
defer f.Close()
reader := csv.NewReader(f)
records, err := reader.ReadAll()
if err != nil {
log.Fatal(err)
}
var data []Record
for i, row := range records {
if i == 0 {
continue // 跳过表头
}
score, err := strconv.ParseFloat(row[1], 64)
if err != nil {
continue // 容错处理:非法行直接跳过
}
data = append(data, Record{Region: row[0], Score: score})
}
// 基础统计
scores := make([]float64, len(data))
for i, r := range data {
scores[i] = r.Score
}
fmt.Printf("均值: %.2f 方差: %.2f 标准差: %.2f\n",
stat.Mean(scores, nil), stat.Variance(scores, nil), stat.StdDev(scores, nil))
// 分组计数
regionCnt := make(map[string]int)
for _, r := range data {
regionCnt[r.Region]++
}
fmt.Println("分组计数:", regionCnt)
// 中位数的手动实现
sort.Float64s(scores)
n := len(scores)
med := scores[n/2]
if n%2 == 0 {
med = (scores[n/2-1] + scores[n/2]) / 2
}
fmt.Printf("中位数: %.2f\n", med)
}
这里有几个要点值得留意:用 encoding/csv 读取文件,strconv 做安全的数值转换,Gonum/stat 负责出统计结果。如果数据里有缺失值,可以用 math.NaN() 标记,统计时 Gonum 会自动忽略它们。
数据算出来了,下一步就是画图。Gonum/plot 是个不错的选择,画个直方图非常直接:
package main
import (
"log"
"math/rand"
"time"
"gonum.org/v1/plot"
"gonum.org/v1/plot/plotter"
"gonum.org/v1/plot/vg"
)
func main() {
rand.Seed(time.Now().UnixNano())
vals := make(plotter.Values, 1000)
for i := range vals {
vals[i] = rand.NormFloat64()
}
hist, err := plotter.NewHist(vals, 20)
if err != nil {
log.Fatal(err)
}
p, err := plot.New()
if err != nil {
log.Fatal(err)
}
p.Add(hist)
p.Title.Text = "Normal distribution"
p.X.Label.Text = "X"
p.Y.Label.Text = "Frequency"
if err := p.Sa ve(8*vg.Inch, 4*vg.Inch, "hist.png"); err != nil {
log.Fatal(err)
}
}
如果要做更复杂的业务报表,可以考虑 Gota 和 go-chart 的组合。Gota/dataframe 负责数据清洗和分组聚合——比如计算“涨跌幅”之类的新列,go-chart 负责出图,最终可以导出 PNG 或者通过 HTTP 服务本地预览。这套流程对于探索性分析来说,效率很高。
进入机器学习部分,先从最简单的线性回归开始。Gonum/mat 加上 Gonum/stat/regression 就能搞定:
package main
import (
"fmt"
"gonum.org/v1/gonum/mat"
"gonum.org/v1/gonum/stat/regression"
)
func main() {
// X: [1, x1; 1, x2; ...], y: 目标
X := mat.NewDense(4, 2, []float64{1, 1, 1, 2, 1, 3, 1, 4})
y := mat.NewVecDense(4, []float64{3, 4, 5, 6})
model := new(regression.Linear)
if err := model.Fit(X, y); err != nil {
panic(err)
}
xNew := mat.NewVecDense(2, []float64{1, 5})
pred, err := model.Predict(xNew)
if err != nil {
panic(err)
}
fmt.Printf("预测值: %.2f\n", pred.AtVec(0))
}
分类任务可以试试 GoLearn 的决策树,下面是一个演示结构:
package main
import (
"fmt"
"github.com/sjwhitworth/golearn/base"
"github.com/sjwhitworth/golearn/trees"
)
func main() {
X := [][]float64{{1, 2}, {2, 3}, {3, 4}, {4, 5}, {5, 6}}
y := []string{"A", "A", "B", "B", "B"}
fmt.Println("GoLearn 决策树示例(演示)")
clf := trees.NewClassifier(trees.NewID3(0.8, 100))
// 实际使用时需要按 GoLearn 文档构造 Instances 后调用 Fit 和 Predict
}
至于选型,基本原则是:数值计算和回归任务优先用 Gonum;传统机器学习可以试试 GoLearn;如果涉及深度学习或计算图,Gorgonia 是个值得关注的选择。
最后聊点工程实践。性能剖析这块,可以在程序中引入 net/http/pprof,启动服务后访问 /debug/pprof 就能拿到数据,然后用 go tool pprof 分析 CPU 和内存。想生成火焰图?别忘了先装 Graphviz。
命令示例:
go tool pprof cpu.prof
在交互界面输入 web 就能看到可视化结果。
并发处理方面,面对大文件或批量任务时,可以用 goroutine 配合 channel 做并行解析和聚合。这里有个经验:一定要控制好并发数和内存占用,同时借助 sync.WaitGroup 或 errgroup 来做错误收敛,否则容易翻车。
至于数据规模的问题,如果单机内存扛不住,就采用流式处理加分批聚合的策略。结果可以写入 CSV 或 JSON,也可以直接入库——PostgreSQL、MySQL、MongoDB、InfluxDB、Redis 都是常见的选择,取决于后续的分析和可视化诉求。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8