粘贴你的一段样例文本,或选一份内置示例;勾选要处理的实体类型,切换脱敏策略,右侧立刻显示结果。整个过程只发生在你当前的浏览器标签页里。默认策略为生产默认档(占位符可逆),与桌面端真实输出一致。
可逆性说明:占位符可逆与 LLM token 可逆并非靠令牌本身反猜原文,而是靠本机映射库(每个占位令牌对应唯一原文)。本页两种哈希算法均与真实引擎逐字节一致:占位符短码 MD5(原文) 取前 6 位大写,哈希策略 SHA-256(盐+原文) 取前 10 位大写(引擎实现见 core/patterns.py entity_hash / hash_label),所以你在演示里看到的令牌与真实引擎输出完全相同(例如手机号 13812345678 恒为 [PHONE_4C0115],哈希策略下恒为 [PHONE#38AED90481])。
提示:把鼠标移到绿色高亮处可查看原始值。本演示引擎为前端简化版,仅用于展示脱敏方法;真实产品在本机使用「规则引擎为主 + 模型补充 + 人工复核」三层识别实体,且文件全程不离开你的电脑。
已知差异(如实说明):演示仅内置 7 类代表性实体的识别规则,其余类型由真实引擎在本机离线识别。脱敏行为本身——占位符短码、掩码规则、哈希(SHA-256)、LLM token 形态与推荐映射——均已与引擎逐一对齐,并随引擎能力升级同步(2026-09-15 新增中文实体掩码、按字段推荐与哈希策略)。
下表严格区分生产可用与未暴露,不含任何演示增强。
对全部主要类型做部分遮蔽:数字 ID 如 138****5678、身份证前 6 后 4、银行卡前 6 后 4、邮箱固定 3 星;姓名保留姓(张*)、公司保留前 2 后 4、地址保留前 6 后 4。自 2026-09-15 起中英文实体均可用掩码,通过 maskStrategy=mask 调用。
对全部需脱敏类型(27 类)统一替换为占位令牌 —— [PERSON_615DB5]、[COMPANY_C49095]、[LOCATION_0CFECA],其中后缀是 MD5(原文) 前 6 位大写。原文存入本机映射库、凭映射精确可逆还原。这是产品默认输出(llmMode=false),也是「脱敏后仍能复扫 / 审计 / 喂 AI」的核心能力。
开启 llmMode=true 后生效,标签为中文且每类型从 1 递增:[公司_1:北京-科技]、[人名_1]、[身份证_1]。默认预设下仅 公司(地区 + 行业≤2)与 地址(行政区划串)带属性,其余类型无属性。引擎提供 4 种预设:chatgpt [公司_1] / internal [公司_1:北京-科技] / archive [公司_1|北京|科技] / llm_rich [电话_1:138](属性增强档,默认关,会额外暴露号段 / 邮箱域名 / 卡组织 / 户籍省份)。
通过 maskStrategy=hash 调用,输出 [PERSON#8F3A2C1D9B](SHA-256 前 10 位十六进制,长度可用 DATAMASK_HASH_LENGTH 调整)。同值恒同哈希——外发共享后仍能跨表 / 跨文档做等值关联,却无法反推原文,也不需要在本机保留映射库。⚠️ 如实说明:手机号 / 身份证号取值空间小,未加盐时存在彩虹表反推风险,请配置 DATAMASK_HASH_SALT 或请求级 hashSalt。哈希 ≠ 绝对安全。
ℹ️ 能力边界(真实引擎现状 · 2026-09-17):生产对外提供 4 种输出——占位符可逆(默认,maskStrategy=placeholder)、掩码(maskStrategy=mask,含中文实体)、哈希(maskStrategy=hash,确定性不可逆)、LLM token 可逆(llmMode=true)。另有 按字段类型推荐策略(maskStrategy=recommend,或 GET /strategies 取映射)与 token 预设清单(GET /token-presets)。文本泛化、整段删除 仍为规划能力。
掩码覆盖范围:引擎可识别的全部 27 类需脱敏类型都有掩码函数(含护照 / 军官证 / 统一社会信用代码 / 车牌 / IP / MAC / GPS 等 7 类结构化标识符,2026-09-15 补齐;合同编号 2026-09-16 补齐)—— 掩码模式下不会有任何类型静默回退为占位符。其中 9 类的掩码语义本身就是「整体替换为令牌」(URL / 股票代码 / 基金代码 / 邮编 / 微博 / 公众号 / 服务号 / IMEI / 外国人永居证)—— 它们没有「制度性片段」可保留,输出形态与占位符相同,但并非回退,属设计行为。哈希覆盖范围:对全部需脱敏类型可用,且不依赖类型级掩码函数(哈希只需类型名与原文,与掩码函数是否存在无关)。
为什么可逆脱敏是我们重点推荐的? 脱敏不等于报废数据。影数鹏真实引擎对全部需脱敏类型采用映射表可逆——脱敏后文本以占位令牌 / 带属性 token 呈现,原文锁在本机映射库,凭映射精确还原。同一份文档脱敏后,你仍能在本机做二次复扫、审计追溯、把干净数据喂给下游 AI 分析。对「既要合规、又要用数据」的审计与财务场景,这是兼顾安全与价值的最优解。
下表严格按引擎实测填写:生产可用指有 API 出口、客户可实际使用;已接入·默认关闭指引擎已接入但默认关闭、需企业版开启。
maskStrategy=mask 调用。[TYPE_MD5前6大写](如 [PHONE_4C0115]),凭本机映射库精确还原,是产品默认输出(llmMode=false)。[TYPE#SHA256前10大写](如 [PHONE#38AED90481]),确定性不可逆、无需映射库,适合外发共享时做跨表等值关联。通过 maskStrategy=hash 调用;建议配合盐值使用。llmMode=true 后生效,中文标签 + 每类型递增序号([公司_1:北京-科技]);默认预设下仅公司 / 地址带属性,其余类型无属性。llm_rich 预设可扩展属性,但有隐私代价、默认关。| 字段类型 | 生产可用 | LLM token 输出 | 默认行为 |
|---|---|---|---|
| 身份证 / 手机 / 银行卡 / 邮箱 | 占位符可逆 · 掩码 · 哈希 · LLM token | [身份证_1] [电话_1] [银行卡_1] [邮箱_1](均无属性) | 占位符[IDCARD_F6B028] |
| 姓名 | 占位符可逆 · 掩码(保留姓) · 哈希 · LLM token | [人名_1](仅称谓上下文带属性) | 占位符[PERSON_615DB5] |
| 公司 / 机构 | 占位符可逆 · 掩码(前2后4) · 哈希 · LLM token | [公司_1:北京-科技]地区 + 行业≤2 | 占位符[COMPANY_C49095] |
| 地址 | 占位符可逆 · 掩码(前6后4) · 哈希 · LLM token | [地址_1:北京市海淀区…]行政区划全串 | 占位符[LOCATION_0CFECA] |
| 结构化标识符 护照 / 军官证 / 统一社会信用代码 / 车牌 / IP / MAC / GPS | 占位符可逆 · 掩码 · 哈希 · LLM token | 未登记中文名的类型回退英文枚举,如 [PASSPORT_1] | 占位符[PASSPORT_D02F3C]掩码示例见下表 |
| 其余结构化类型 (股票 / 基金 / 邮编 / QQ / 微信 / IMEI / 微博 / 400 电话 / 公众号 / 服务号 / 永居证) | 占位符可逆 · 掩码 · 哈希 · LLM token | 未登记中文名的类型回退英文枚举,如 [STOCK_1] | 占位符[STOCK_7FBA1E] |
| 绝密字段 | 当前版本无整段删除策略;建议用占位符模式,且脱敏产物与映射库分离保管 | ||
| 类型 | 原文 | 掩码结果 | 保留了什么(为什么可保留) |
|---|---|---|---|
| 护照号 PASSPORT | E12345678 | E******78 | 首位证件类别字母(E 普通因私 / H 港澳 / M 台湾)—— 制度信息 |
| 军官证 MILITARY | 军字第1234567号 | 军字第*******号 | 「军字第…号」框架 —— 证件制度标识,编号才是敏感信息 |
| 统一社会信用代码 USCC | 91110000600037341X | 91**************1X | 前 2 位「登记管理部门 + 机构类别」—— 公开分类信息 |
| 车牌号 CAR_PLATE | 京A12345 | 京A***** | 省简称 + 发牌机关字母 —— 同城同字母段有数十万辆车 |
| IP 地址 IP_ADDR | 192.168.1.100 | 192.168.***.*** | 前两段网段 —— 排障与统计需要;主机位才指向具体设备 |
| MAC 地址 MAC_ADDR | 00:1A:2B:3C:4D:5E | 00:1A:2B:**:**:** | 前 3 字节厂商码(OUI)—— 由 IEEE 分配,只定位厂商 |
| GPS 坐标 GPS | 22.5431,114.0579 | 22.****,114.**** | 整数度(约 111km 粒度)—— 与地址掩码「保留省市区」同级 |
⚠️ 能力边界(如实说明):GPS 小数位遮蔽后,仍可能被周边坐标反推;需要绝对不可逆时请改用占位符策略。同理,掩码保留段本身即是有意公开的信息,若客户合规口径要求「零信息外露」,应统一使用占位符可逆。
下方为引擎实际可输出的实体类型(口径真源 = core/entity_types.py 的 REGISTRY)。精确构成:29 类 = 27 类需脱敏 + 2 类识别但不脱敏(日期 / 金额);其中 27 类需脱敏类型全部支持「掩码」策略(含合同编号,2026-09-16 补齐)。另有 3 个历史别名(HK_MACAO→PASSPORT、FUND→FUND_CODE、NAME→PER)与 1 个内部中间类型 ADDRESS(产出后归并进 LOC,不对外输出),均不计入 29 类。上方演示框内实时展示代表性实体,其余由真实引擎在本机离线识别与脱敏。
财务 / 审计场景不能碰这两类字段 —— 脱敏会破坏凭证可用性与证据链,因此引擎识别它们但默认不替换。
这四个类型从不作为输出类型出现。保留别名是为了兼容既有调用方;对外一律以规范类型名(左侧 EN)为准。
脱敏不等于报废数据。原文锁在本机映射库,LLM 只看到带属性的令牌;下游分析完成后,凭令牌反查即可精确还原。以下三步均为生产引擎真实产物(同一份委托合同)。
为什么令牌要带属性?[公司_1:北京-科技] 比 [ORG_1] 多保留了「地区 + 行业」,下游 AI 仍能做行业与地域维度的统计,而具体是哪家公司始终不出本机。
引擎支持 4 种文档格式的上传脱敏与反向还原,版式、字体、表格结构保持不变。下图左右为同一份合同的处理前后(右侧为生产引擎真实输出)。
引擎对每个实体给出可信度与复核等级。低可信度不是「硬脱」,而是保留原文交给人——因为漏脱敏比误报严重得多。
| 复核等级 | 可信度 | 行为 | 为什么这样设计 |
|---|---|---|---|
| auto | ≥ 0.90 | 自动脱敏 · 免复核 | 规则命中确定性高(如身份证/手机号形态唯一),直接处理不打扰人 |
| suggest | 0.70 – 0.90 | 自动脱敏 · 建议复核 | 形态较弱、存在同形干扰(如股票代码 / 邮编),建议看一眼 |
| required | 0.50 – 0.70 | 自动脱敏 · 必须复核 | 中低可信,必须人工确认后才定稿 |
| suspect | < 0.50 | 不脱敏 · 保留原文 | 宁可留着让人看,也不擅自替换 —— 误替换会破坏文档可读性与证据链 |