跳到主内容
UniKit

文本信息提取

从杂乱的文本里提取邮箱、URL、IPv4/IPv6、电话号码、数字、UUID、话题标签、@提及、日期与金额,支持按类型筛选、去重、排序,并导出为文本报告或 JSON。

浏览器本地运行所有计算都在你的浏览器里完成,数据不会离开本机。

提取类型
选项

提取结果

共 22 条

邮箱2
  • support@unikit.cc @5
  • dev@example.com @28
URL2
  • https://unikit.cc/tools,文档 @48
  • https://docs.example.com/guide?lang=zh @75
IPv4 地址1
  • 192.168.1.10 @119
IPv6 地址1
  • 2001:db8::1 @139
电话号3
  • 192.168.1.10 @119
  • +86 138-0013-8000 @155
  • 716-446655440000 @198
数字8
  • 192.168 @119
  • 2001 @139
  • 1 @149
  • 86 @156
  • 138 @159
  • 1 @219
  • 299.00 @221
  • 2026 @234
UUID1
  • 550e8400-e29b-41d4-a716-446655440000 @178
话题标签1
  • #UniKit @248
@提及1
  • @mxu @259
日期1
  • 2026-10-10 @234
金额1
  • $1,299.00 @218

导出报告

邮箱 (2)
- support@unikit.cc @5
- dev@example.com @28

URL (2)
- https://unikit.cc/tools,文档 @48
- https://docs.example.com/guide?lang=zh @75

IPv4 地址 (1)
- 192.168.1.10 @119

电话号 (3)
- 192.168.1.10 @119
- +86 138-0013-8000 @155
- 716-446655440000 @198

数字 (8)
- 192.168 @119
- 2001 @139
- 1 @149
- 86 @156
- 138 @159
- 1 @219
- 299.00 @221
- 2026 @234

IPv6 地址 (1)
- 2001:db8::1 @139

UUID (1)
- 550e8400-e29b-41d4-a716-446655440000 @178

金额 (1)
- $1,299.00 @218

日期 (1)
- 2026-10-10 @234

话题标签 (1)
- #UniKit @248

@提及 (1)
- @mxu @259

这个工具能做什么

  • 从一段日志、邮件正文或聊天记录里把邮箱、URL、IP 一次性挑出来,不用一个个复制粘贴。
  • 排查线上问题时把日志里的 IPv4 / IPv6 和 UUID 提出来,方便直接去查对应机器和请求。
  • 做数据清洗:把「日期 + 金额」从报表文本里抽出来,导出 JSON 后喂给脚本继续处理。
  • 整理营销文案时统计话题标签(#)和 @提及 的分布,核对是否漏掉了合作方账号。

示例

输入

ada@example.com  https://unikit.cc/docs  2026-10-10  $1,299.00(只勾选「邮箱 / URL / 日期 / 金额」四种类型)

输出

邮箱 (1)
- ada@example.com @0

URL (1)
- https://unikit.cc/docs @17

日期 (1)
- 2026-10-10 @42

金额 (1)
- $1,299.00 @54

文本报告按类型分组,格式是「类型 (数量)」加「- 值 @起始下标」;勾选「按类型分组排序」后同一类型的项会聚在一起。URL 末尾的中英文标点会被自动去掉。

常见问题

电话号码为什么容易误报?

号码格式太自由,工具只按「7–15 位数字,且含 +、空格、括号、点或连字符」判断,所以 192.168.0.1 这种 IP 也可能被当成电话。反过来 2026-10-10 会被明确排除,因为它更像日期。发现误报时少勾几个类型即可。

数字类型的提取结果为什么这么多?

数字模式匹配的是任意独立的数值,日期、IP、金额、电话里的数字也会被单独命中,所以结果会显得冗余。它适合「把文本里所有数字找出来」,不适合精确取某一种数值——那种场景用金额或日期类型更准。

「按类型去重」和「按类型分组排序」有什么区别?

去重是同一个类型下值相同的只保留第一次出现;分组排序是先按勾选顺序把类型排好,再按出现位置排。两者可以同时开:先去重再分组,结果里每个值在各自类型下只出现一次。

IPv6 和 URL 的识别准吗?

IPv6 会做结构校验:带 :: 的必须不超过 7 组、每组 1–4 个十六进制位,不带 :: 的必须正好 8 组,所以 12:34:56 这类时间格式不会误判。URL 要求以 http(s):// 或 www. 开头,末尾的句号、逗号、中文标点会被剥掉。

提取的内容会被上传吗?

不会。全部用正则和字符串处理在浏览器里完成,没有网络请求,粘贴的日志不会被保存。

关键词:提取extractemail邮箱urlipphoneuuid日期金额正则提取

同类工具