HTML 内容提取
粘贴 HTML 源码,一次提取全部链接(文字、href、外链与 nofollow)、图片、h1–h6 标题层级树、meta 信息、纯文本与表格数据,结果可按分类复制或导出 JSON。
浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。
HTML 源码
提取结果
先粘贴一段 HTML
JSON 导出
这个工具能做什么
- 做 SEO 审计时一次性看清一个页面的链接、图片、标题层级与 meta:外链和 nofollow 会被标出来,不用再翻源码。
- 把网页源码里的表格数据、纯文本抓出来复用,例如把后台导出的 HTML 表格转成可粘贴的文本或 JSON。
- 核对标题层级是否合理(有没有跳级、有没有多个 h1),粘贴一段 HTML 就能看到树状结构。
- 只想要页面正文时,先用「纯文本」标签页把标签和脚本去掉,再拿去做统计或翻译。
示例
输入
<h1>UniKit 使用指南</h1> <p>打开 <a href="/tools">工具列表</a>,也可以访问 <a href="https://astro.build" rel="nofollow" target="_blank">Astro</a>。</p> <img src="/cover.png" alt="封面" width="800" height="400">
输出
工具列表 /tools Astro https://astro.build [外链, nofollow, _blank] (标题层级)h1 UniKit 使用指南 (统计)链接 2 · 图片 1 · 标题 1 · 表格 0 · 字符 28 · 词 21
「外链」是按基准地址判断的:填 https://unikit.cc/guide 时 /tools 算站内,https://astro.build 算外链;不填基准地址时,所有绝对地址都会被当成外链。
常见问题
没有填基准地址会怎样?
相对地址(/tools、./a.html)一律不算外链,带 http(s):// 或 // 开头的绝对地址全部标记为外链。想让判断准确,就填上页面所在的完整地址,工具会用它比主机名。
这段 HTML 不完整、标签没闭合也能解析吗?
可以。这里用的是自己写的容错 tokenizer,缺结束标签时会把后续内容当成子节点继续往下走,不会报错。只有输入完全为空(只有空白字符)时才会提示「请输入 HTML 源码」。
为什么脚本和样式里的文字没出现在纯文本里?
<script> 与 <style> 的内容会被整块丢弃,因为它们是代码而不是页面正文。表格单元格之间会用空格连接,块级元素之间补换行,最后再把空行去掉。
中文和英文的词数是怎么算的?
拉丁字母按词计(连续的字母数字算一个词),中日韩汉字按字计,两者相加。所以中英混排的页面词数会比单纯的英文词数统计要大。
我的页面源码会被上传吗?
不会。解析、提取与 JSON 导出全部在浏览器里完成,页面不发起任何请求,也不会记录你粘贴的内容。
关键词:html 提取html extractor链接提取extract links标题层级heading treemeta 提取表格提取table extractorhtml 解析