文本信息提取
从杂乱的文本里提取邮箱、URL、IPv4/IPv6、电话号码、数字、UUID、话题标签、@提及、日期与金额,支持按类型筛选、去重、排序,并导出为文本报告或 JSON。
浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。
提取类型
选项
提取结果
共 22 条
邮箱2
- support@unikit.cc @5
- dev@example.com @28
URL2
- https://unikit.cc/tools,文档 @48
- https://docs.example.com/guide?lang=zh @75
IPv4 地址1
- 192.168.1.10 @119
IPv6 地址1
- 2001:db8::1 @139
电话号3
- 192.168.1.10 @119
- +86 138-0013-8000 @155
- 716-446655440000 @198
数字8
- 192.168 @119
- 2001 @139
- 1 @149
- 86 @156
- 138 @159
- 1 @219
- 299.00 @221
- 2026 @234
UUID1
- 550e8400-e29b-41d4-a716-446655440000 @178
话题标签1
- #UniKit @248
@提及1
- @mxu @259
日期1
- 2026-10-10 @234
金额1
- $1,299.00 @218
导出报告
邮箱 (2) - support@unikit.cc @5 - dev@example.com @28 URL (2) - https://unikit.cc/tools,文档 @48 - https://docs.example.com/guide?lang=zh @75 IPv4 地址 (1) - 192.168.1.10 @119 电话号 (3) - 192.168.1.10 @119 - +86 138-0013-8000 @155 - 716-446655440000 @198 数字 (8) - 192.168 @119 - 2001 @139 - 1 @149 - 86 @156 - 138 @159 - 1 @219 - 299.00 @221 - 2026 @234 IPv6 地址 (1) - 2001:db8::1 @139 UUID (1) - 550e8400-e29b-41d4-a716-446655440000 @178 金额 (1) - $1,299.00 @218 日期 (1) - 2026-10-10 @234 话题标签 (1) - #UniKit @248 @提及 (1) - @mxu @259
这个工具能做什么
- 从一段日志、邮件正文或聊天记录里把邮箱、URL、IP 一次性挑出来,不用一个个复制粘贴。
- 排查线上问题时把日志里的 IPv4 / IPv6 和 UUID 提出来,方便直接去查对应机器和请求。
- 做数据清洗:把「日期 + 金额」从报表文本里抽出来,导出 JSON 后喂给脚本继续处理。
- 整理营销文案时统计话题标签(#)和 @提及 的分布,核对是否漏掉了合作方账号。
示例
输入
ada@example.com https://unikit.cc/docs 2026-10-10 $1,299.00(只勾选「邮箱 / URL / 日期 / 金额」四种类型)
输出
邮箱 (1) - ada@example.com @0 URL (1) - https://unikit.cc/docs @17 日期 (1) - 2026-10-10 @42 金额 (1) - $1,299.00 @54
文本报告按类型分组,格式是「类型 (数量)」加「- 值 @起始下标」;勾选「按类型分组排序」后同一类型的项会聚在一起。URL 末尾的中英文标点会被自动去掉。
常见问题
电话号码为什么容易误报?
号码格式太自由,工具只按「7–15 位数字,且含 +、空格、括号、点或连字符」判断,所以 192.168.0.1 这种 IP 也可能被当成电话。反过来 2026-10-10 会被明确排除,因为它更像日期。发现误报时少勾几个类型即可。
数字类型的提取结果为什么这么多?
数字模式匹配的是任意独立的数值,日期、IP、金额、电话里的数字也会被单独命中,所以结果会显得冗余。它适合「把文本里所有数字找出来」,不适合精确取某一种数值——那种场景用金额或日期类型更准。
「按类型去重」和「按类型分组排序」有什么区别?
去重是同一个类型下值相同的只保留第一次出现;分组排序是先按勾选顺序把类型排好,再按出现位置排。两者可以同时开:先去重再分组,结果里每个值在各自类型下只出现一次。
IPv6 和 URL 的识别准吗?
IPv6 会做结构校验:带 :: 的必须不超过 7 组、每组 1–4 个十六进制位,不带 :: 的必须正好 8 组,所以 12:34:56 这类时间格式不会误判。URL 要求以 http(s):// 或 www. 开头,末尾的句号、逗号、中文标点会被剥掉。
提取的内容会被上传吗?
不会。全部用正则和字符串处理在浏览器里完成,没有网络请求,粘贴的日志不会被保存。
关键词:提取extractemail邮箱urlipphoneuuid日期金额正则提取