当前位置:首页 > 文章列表 > Golang > Go教程 > Go 怎么提取网页链接并补全相对地址

Go 怎么提取网页链接并补全相对地址

来源:17golang原创 2026-09-06 03:18:43 0浏览 收藏

抓网页链接通常不是把 HTML 当字符串做正则替换,而是先让 golang.org/x/net/html 按 HTML5 规则构建节点树,再读取 a 元素的 href。相对地址的补全交给 net/url:页面是 https://example.com/docs/index.html 时,../api 才能被正确解释成对应的绝对地址。

要点速览
  • html.Parse 负责理解 HTML 结构,不能把解析结果当作未经处理的原文。
  • url.ResolveReference 会根据页面基准 URL 处理 foo/docs../api
  • 提取和后续抓取要分开;对外链至少检查 schemehost

先划清网页输入和外链风险

这类小工具的输入有三个:页面 URL、页面 HTML 和页面里出现的 href。输出可以只是规范化后的字符串列表,不必在提取阶段马上发起 HTTP 请求。这样做的好处是,解析器只负责读取结构,访问策略单独负责判断目标是否允许。

空 href、纯片段地址(例如 #comments)通常不是新的页面;mailto:javascript: 等 scheme 也不应直接交给 HTTP 客户端。若抓取器有站点范围,还要把规范化后的 host 放进 allowlist 判断。

用 html.Parse 找到真正的 a[href] 节点

html.Parse 返回文档树。下面的递归遍历只取元素节点中的 href,并保留链接文本,代码没有假设标签一定写成完整的开始/结束形式,因为 HTML5 解析器会处理常见的省略和嵌套情况。

package main

import (
    "fmt"
    "io"
    "strings"

    "golang.org/x/net/html"
)

type Link struct {
    Href string
    Text string
}

func textOf(n *html.Node) string {
    var b strings.Builder
    var walk func(*html.Node)
    walk = func(cur *html.Node) {
        if cur.Type == html.TextNode {
            b.WriteString(cur.Data)
        }
        for child := cur.FirstChild; child != nil; child = child.NextSibling {
            walk(child)
        }
    }
    walk(n)
    return strings.Join(strings.Fields(b.String()), " ")
}

func extractLinks(r io.Reader) ([]Link, error) {
    doc, err := html.Parse(r) // 让 HTML5 解析器负责构建文档树。
    if err != nil {
        return nil, err
    }

    links := make([]Link, 0)
    var walk func(*html.Node)
    walk = func(n *html.Node) {
        if n.Type == html.ElementNode && n.Data == "a" {
            for _, attr := range n.Attr {
                if attr.Key == "href" && strings.TrimSpace(attr.Val) != "" {
                    links = append(links, Link{Href: attr.Val, Text: textOf(n)})
                    break
                }
            }
        }
        for child := n.FirstChild; child != nil; child = child.NextSibling {
            walk(child)
        }
    }
    walk(doc)
    return links, nil
}

func main() {
    links, err := extractLinks(strings.NewReader(`FooAPI`))
    if err != nil {
        panic(err) // 示例直接退出;服务中应记录错误并返回可诊断信息。
    }
    for _, link := range links {
        fmt.Printf("%s -> %s\\n", link.Text, link.Href)
    }
}
Go html.Parse 构建 HTML 文档树并从 a 元素读取 href 属性的静态关系图
图1:HTML 文档树中的 a 元素与 href 属性是提取网页链接的输入边界。

这里没有使用 n.Descendants(),是为了让遍历逻辑在较老的 Go 编译环境中也容易读懂。官方文档还特别提醒:解析输入应为 UTF-8;如果页面实际是其他编码,应先完成字符集转换再交给解析器。

用 ResolveReference 把相对地址变成绝对地址

地址补全不要自己拼斜杠。先分别解析页面基准地址和 href,再调用 ResolveReference。它会根据引用形式处理目录、文件名、根路径和上级路径。

package main

import (
    "fmt"
    "net/url"
    "strings"
)

func normalizeLink(pageURL, rawHref string) (*url.URL, error) {
    href := strings.TrimSpace(rawHref)
    if href == "" || strings.HasPrefix(href, "#") {
        return nil, nil // 空值和当前页面片段不产生新的页面地址。
    }

    base, err := url.Parse(pageURL) // 页面 URL 是所有相对引用的基准。
    if err != nil {
        return nil, err
    }
    ref, err := url.Parse(href) // 先解析引用,再让标准库处理路径规则。
    if err != nil {
        return nil, err
    }
    if ref.Scheme != "" && ref.Scheme != "http" && ref.Scheme != "https" {
        return nil, nil // 不把 mailto、javascript 等交给 HTTP 抓取器。
    }

    resolved := base.ResolveReference(ref)
    if resolved.Scheme != "http" && resolved.Scheme != "https" {
        return nil, nil // 只保留本示例允许的网络协议。
    }
    resolved.Fragment = "" // 爬取页面本身时,片段通常不改变 HTTP 资源。
    return resolved, nil
}

func main() {
    for _, raw := range []string{"foo", "/docs", "../api", "#part"} {
        u, err := normalizeLink("https://example.com/docs/index.html", raw)
        if err != nil {
            fmt.Println("invalid:", raw, err)
            continue
        }
        if u != nil {
            fmt.Println(raw, "=>", u.String())
        }
    }
}
Go url.Parse 与 ResolveReference 根据页面基准 URL 补全相对 href 并经过 scheme host 边界检查的关系图
图2:相对 href 先经过页面基准 URL 规范化,再由 scheme 与 host 边界决定是否允许后续访问。

例如基准地址带有 index.html 时,foo 会落在当前目录;以斜杠开头的 /docs 从站点根路径计算;../api 则回到上一级目录。最终结果仍应以 u.String() 作为后续记录或请求的地址。

提取完成后再做 host allowlist 复查

解析器能告诉你“这是什么链接”,不能替你决定“能不能访问”。如果页面内容不可信,href 可能指向外部主机。把允许的 scheme、host 和是否保留片段写成独立规则,便于审计和测试。

输入处理结果
foo按页面目录解析站内绝对 URL
/docs按 host 根路径解析站内绝对 URL
../api回退一个目录站内绝对 URL
mailto: 或未知 scheme拒绝进入 HTTP 请求跳过

安全判断前如果依赖 HTML 的语义结构,官方建议把解析结果重新序列化后再作信任决策,因为 HTML5 解析可能补出节点、调整父子关系或改变原始嵌套。一个实用的复查顺序是:确认页面 URL 可解析、确认结果 scheme、确认 host 在允许集合、限制重定向,并为每次拒绝记录原始 href 与原因。

常见问题

为什么不用正则表达式直接匹配 href?

正则很难覆盖 HTML 实体、大小写、未闭合标签和嵌套规则。需要理解文档结构时,用 html.Parse 更稳妥。

相对链接补全后要不要保留片段?

如果用途是抓取页面资源,通常清除 Fragment;如果用途是生成站内导航,则应保留,并按业务去重。

页面不是 UTF-8 怎么办?

先根据响应头或页面声明完成字符集转换,再把 UTF-8 字节交给 html.Parse;不要让解析器承担编码猜测。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
囧次元离线缓存能用吗?版本、包名与安卓兼容核对囧次元离线缓存能用吗?版本、包名与安卓兼容核对
上一篇
囧次元离线缓存能用吗?版本、包名与安卓兼容核对
颜料墨水和染料墨水打印文件有什么区别
下一篇
颜料墨水和染料墨水打印文件有什么区别
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    158次使用
  • C-Eval中文评测基准:大语言模型多学科能力评估指南
    C-Eval
    深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
    87次使用
  • ClickPrompt:AI提示词生成与优化工具,支持Stable Diffusion、ChatGPT及代码辅助
    ClickPrompt
    ClickPrompt是一款专为AI提示词编写者设计的开源在线工具,支持Stable Diffusion绘图、ChatGPT对话及GitHub Copilot代码辅助。提供Prompt自动生成、一键运行、社区分享及可视化优化功能,帮助用户高效获取精准AI输出。
    46次使用
  • PromptHero官网:AI提示词搜索、优化与学习平台,支持Midjourney/Stable Diffusion
    PromptHero
    PromptHero是专业的AI提示词搜索引擎与优化平台,支持Stable Diffusion、Midjourney等主流模型。提供海量提示词库、分类搜索、在线课程及社区互动,助力用户高效生成高质量AI图像与文本。
    30次使用
  • OpenArt免费开源指南:Stable Diffusion Prompt Book提示词手册详解
    Stable Diffusion Prompt Book
    深入解析OpenArt推出的Stable Diffusion Prompt Book,这本免费的开源提示词指南涵盖从基础语法到高级技巧,提供风格化词库与参数建议,助您优化AI绘画生成效果。
    30次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码