跳到主内容
UniKit

去掉 HTML 标签

把 HTML 片段里的标签全部去掉只留纯文本:可选保留换行与链接地址、解码实体、整块删除 script/style,并统计去掉了多少标签。

浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。

HTML 源码

选项

纯文本

这个工具能做什么

  • 把网页正文的 HTML 复制过来去掉标签,得到一段可以直接粘进文档、邮件或表格的纯文本。
  • 处理后台导出的 HTML 邮件或抓取结果时,顺手丢掉 <script>/<style> 整块内容,避免把代码混进正文。
  • 保留链接模式下会把地址跟在文字后面(文字 <https://…>),整理参考资料时不用再逐个点开抄 URL。
  • 把 HTML 表格或列表转成带换行的文本,方便丢进 Excel 或命令行工具继续处理。

示例

输入

<h1>UniKit</h1>
<p>去掉 <b>HTML</b> 标签,保留 <a href="https://unikit.cc">链接</a> 与文字。</p>
<script>console.log("x")</script>

输出

UniKit
去掉 HTML 标签,保留 链接 <https://unikit.cc> 与文字。

默认设置下:块级标签变成换行、<script> 整块删除、&amp; 之类的实体会被解码、多余空白折叠成一个空格。工具还会报告去掉了 10 个标签和 1 个脚本块。

常见问题

为什么链接文字后面多了一串 <https://…>?

这是「保留链接」选项的效果,它把 href 追加到链接文字后面,方便整理参考资料。不需要的话把它关掉,地址就会随标签一起消失。另外以 # 开头的锚点链接不会追加地址。

表格转换后每一行是怎么分开的?

td、th、tr、table 都属于会转成换行的块级标签,所以每个单元格和每一行之间都会有换行。如果你想要「一行一条记录」的效果,把「折叠多余空白」打开,连续空行会被合并成一行。

HTML 写得乱七八糟、标签没闭合会报错吗?

不会。工具用的是自己写的宽松 tokenizer,遇到孤立的 < 会当普通文本处理,遇到没闭合的标签也不会中断。唯一的硬限制是输入长度:超过 200 万字符会提示分段处理。

和「HTML 内容提取」有什么区别?

那个工具偏结构化提取(链接表、图片表、标题树、meta、表格二维数组,还能导出 JSON),适合分析。这个工具只输出一段纯文本,胜在直接可用。

粘贴的内容会被上传吗?

不会,整段处理都在浏览器内存里完成,页面不发起网络请求,内容也不会被保存。

关键词:strip htmlhtml to text去掉 html 标签html 转文本html tag stripperplain text纯文本解码实体decode entitiesdom to text

同类工具