商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > 如何使用 Go 语言爬取基于 AJAX 渲染的动态网页

如何使用 Go 语言爬取基于 AJAX 渲染的动态网页

  发布于2026-07-19 阅读(0)

扫一扫,手机访问

本文介绍在 Go 中处理 AJAX 驱动网站爬虫的核心思路:由于标准 http.Get 仅获取静态 HTML,无法执行 Ja vaScript,因此需模拟浏览器行为或逆向分析 AJAX 请求,才能提取真实渲染后的内容。

编写爬虫时,最怕的就是碰上一类“表里不一”的网页:你兴冲冲地发个请求,拿回来的 HTML 却是个空壳,真正的内容——比如商品列表、文章链接——全都不见踪影。这背后,通常就是 AJAX 在“作祟”。

Go 语言默认的 HTTP 客户端,说白了,它就是个“老实人”——你让它请求什么,它就乖乖返回什么,完全没有执行 Ja vaScript 的能力。所以,调用 http.Get() 返回的,往往只是服务器初始响应的 HTML 骨架。那些通过 AJAX 动态注入到

里的链接,根本不会出现在响应体中。那么,问题来了:怎么绕过这个限制呢?

方案一:逆向分析 AJAX 请求(推荐,轻量高效)

如果前端逻辑清晰、API 接口也相对稳定,这条路就是首选。具体做法,其实就三步:

  1. 打开浏览器开发者工具(F12 → Network → XHR/Fetch),盯着页面加载时发出的真实请求;
  2. 把请求 URL、HTTP 方法、Headers(像 User-Agent、Referer、X-Requested-With 这些)、查询参数和请求体(比如 JSON 格式)都记下来;
  3. 用 Go 代码模拟这个请求,然后解析返回的 JSON/XML/HTML 片段,就能拿到想要的数据了。

示例:模拟一个获取文章列表的 AJAX 请求

package mainimport (    "encoding/json"    "fmt"    "io/ioutil"    "net/http"    "strings")type Article struct {    ID   int    `json:"id"`    URL  string `json:"link"`    Title string `json:"title"`}func main() {    client := &http.Client{}    req, _ := http.NewRequest("GET", "https://example.com/api/articles?page=1", nil)    req.Header.Set("User-Agent", "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36")    req.Header.Set("X-Requested-With", "XMLHttpRequest")    resp, err := client.Do(req)    if err != nil {        panic(err)    }    defer resp.Body.Close()    body, _ := ioutil.ReadAll(resp.Body)    var articles []Article    if err := json.Unmarshal(body, &articles); err == nil {        for _, a := range articles {            fmt.Printf("- %s → %s\n", a.Title, a.URL)        }    }}

✅ 优势非常明显:速度快、资源占用低、而且很容易做成并发。不过,需要留个心眼:接口可能带鉴权(比如 token、cookie),也可能有反爬策略(比如时间戳、签名),频率限制也得注意。

方案二:集成无头浏览器(适用于复杂 SPA)

当你碰到的 AJAX 逻辑高度耦合,加密参数怎么都还原不出来,或者页面严重依赖完整的 DOM 生命周期(比如 Vue/React 路由、滚动加载),这时候,用无头浏览器就是最直接的办法。

推荐一个库:chromedp,纯 Go 实现,不用额外装 Selenium,比较省心。安装好 Chrome/Chromium 之后,就可以通过它来控制浏览器,执行 JS、等元素加载、提取渲染后的 DOM。

package mainimport (    "context"    "log"    "time"    "github.com/chromedp/chromedp")func main() {    ctx, cancel := chromedp.NewExecAllocator(context.Background(), append(chromedp.DefaultExecAllocatorOptions[:],        chromedp.Flag("headless", true),        chromedp.Flag("disable-gpu", true),    )...)    defer cancel    ctx, cancel = chromedp.NewContext(ctx)    defer cancel    var links []string    err := chromedp.Run(ctx,        chromedp.Na vigate("https://example.com"),        // 等待 .content 加载完成(最多 5 秒)        chromedp.WaitVisible(".content", chromedp.ByQuery, chromedp.NodeReadyStateComplete),        // 执行 JS 提取所有 a 标签 href        chromedp.Evaluate(`Array.from(document.querySelectorAll('.content a')).map(a => a.href)`, &links),    )    if err != nil {        log.Fatal(err)    }    for _, link := range links {        log.Println("Found link:", link)    }}

✅ 好处是能 100% 复现用户行为,几乎兼容所有前端框架。但代价也很明显:启动开销大、内存吃得多,还得管理好浏览器生命周期,所以一般不推荐高频或大规模使用。

总结与选型建议

  • 优先尝试方案一:实际上,90% 的 AJAX 网站,只要在 Network 面板里仔细找找,都能定位到真实的 API。手动构造请求,可控性更高,也更容易维护;
  • 慎用方案二:只有当逆向成本实在太高,或者业务强依赖客户端渲染时,才考虑启用它。生产环境里,建议配合连接池和超时控制;
  • 通用增强项:不管选哪个方案,User-Agent 一定要加,Timeout 要合理设置,http.Client 最好复用,重定向和 Cookie 也得处理好。当然,别忘了遵守 robots.txt 和网站的 Terms of Service。

动态网页爬取的本质,其实不是“让 Go 去执行 JS”,而是理解前端的数据流——从“页面怎么变”,转向“数据从哪来”。搞清楚请求逆向和协议交互,这才是 Go 爬虫工程师的核心能力。

本文转载于:https://www.php.cn/faq/2311199.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注