去掉 HTML 标签
把 HTML 片段里的标签全部去掉只留纯文本:可选保留换行与链接地址、解码实体、整块删除 script/style,并统计去掉了多少标签。
浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。
HTML 源码
选项
纯文本
这个工具能做什么
- 把网页正文的 HTML 复制过来去掉标签,得到一段可以直接粘进文档、邮件或表格的纯文本。
- 处理后台导出的 HTML 邮件或抓取结果时,顺手丢掉 <script>/<style> 整块内容,避免把代码混进正文。
- 保留链接模式下会把地址跟在文字后面(文字 <https://…>),整理参考资料时不用再逐个点开抄 URL。
- 把 HTML 表格或列表转成带换行的文本,方便丢进 Excel 或命令行工具继续处理。
示例
输入
<h1>UniKit</h1>
<p>去掉 <b>HTML</b> 标签,保留 <a href="https://unikit.cc">链接</a> 与文字。</p>
<script>console.log("x")</script>输出
UniKit 去掉 HTML 标签,保留 链接 <https://unikit.cc> 与文字。
默认设置下:块级标签变成换行、<script> 整块删除、& 之类的实体会被解码、多余空白折叠成一个空格。工具还会报告去掉了 10 个标签和 1 个脚本块。
常见问题
为什么链接文字后面多了一串 <https://…>?
这是「保留链接」选项的效果,它把 href 追加到链接文字后面,方便整理参考资料。不需要的话把它关掉,地址就会随标签一起消失。另外以 # 开头的锚点链接不会追加地址。
表格转换后每一行是怎么分开的?
td、th、tr、table 都属于会转成换行的块级标签,所以每个单元格和每一行之间都会有换行。如果你想要「一行一条记录」的效果,把「折叠多余空白」打开,连续空行会被合并成一行。
HTML 写得乱七八糟、标签没闭合会报错吗?
不会。工具用的是自己写的宽松 tokenizer,遇到孤立的 < 会当普通文本处理,遇到没闭合的标签也不会中断。唯一的硬限制是输入长度:超过 200 万字符会提示分段处理。
和「HTML 内容提取」有什么区别?
那个工具偏结构化提取(链接表、图片表、标题树、meta、表格二维数组,还能导出 JSON),适合分析。这个工具只输出一段纯文本,胜在直接可用。
粘贴的内容会被上传吗?
不会,整段处理都在浏览器内存里完成,页面不发起网络请求,内容也不会被保存。
关键词:strip htmlhtml to text去掉 html 标签html 转文本html tag stripperplain text纯文本解码实体decode entitiesdom to text