脱敏这条路,可能一开始就走偏了

我出去分享案件看板,去过律所给律师讲,也去过科技企业给法务讲。
台下坐的人不一样,关心的事也不一样。但提问环节,永远有同一个问题:
"数据怎么办?"
"要传到云上去吗?"
"你们怎么脱敏?"
每一次都会被问到。
问得多了我看出个规律:问这个问题的,基本都是还没真用起来的人。
真用起来的,反倒不问了。不是不在乎,是心里已经有数。而且说句实在话——日常真在用 AI 的人里面,绝大多数不会主动脱敏。不是胆子大,是太麻烦。
其实现在脱敏工具做得已经挺好了。
元典那套智能文档脱敏系统我看过。它是规则加 AI 两条腿走:身份证号、手机号这种有固定格式的,用规则去抓;人名、机构、地址这些没规律的,交给模型认。处理完能导出一张「原文 ↔ 占位符」的对照表,材料拿回来以后可以反着还原回去。
它给了三种用法:内网版,数据不出服务器;单机版,装完在本机浏览器里打开,不用搭内网环境,断网也能跑;还有个 WPS 插件,直接嵌在文档侧边栏,读全文、脱敏、写回,不用来回切软件。
这个思路其实挺对的—— 尽量把脱敏这道工序塞进你本来的工作流里 ,少让你开一个东西。
脱敏猫、君合的 Word 插件、藏敏,我也大致看过,路数差不多:识别、遮罩或替换、能还原、尽量在本机跑。
这基本上就是这条路能做到的上限了。
但真到干活的时候,大部分人还是嫌它多一个步骤。一份材料得走两趟——脱敏、上传、处理、取回、再还原,中间那张对照表你还得盯着别丢别串。用遮罩和星号,AI 拿到的是残缺信息,三个"某"之间什么关系它得猜。
所以大家实际的做法是拿经验分流:普通材料直接就传了;真正涉密的、要紧的、刑事案卷那种,压根不碰 AI。
这个分流看着挺合理。但代价是被牺牲掉的那一半——
挡在门外的, 恰恰是你手上最要紧的那批材料。
01 · 这条路我自己也走过一段
我不是站在岸上说风凉话。这条路我自己下去走过。
早些时候我真研究过脱敏,还手搓过一个工具,用正则去匹配身份证号、手机号、地址那些固定格式的东西。写着写着就写不下去了——规则越堆越多,该漏的还是漏,不该动的照样误伤,光一个人名就有十几种写法。
后来我放弃自己做了。但一直在想,这件事该往哪走。
我当时想到的最优解,是让脱敏彻底消失:你在软件里点一下,它自己在后台把材料脱一遍发给云端,大模型回来了再把占位符自动还原成真名。你从头到尾看到的都是完整的,压根不知道中间发生过什么。
我一直觉得这就是这条路的尽头。做到这一步,这件事就算解决了。
但它始终停在我的想象里。而现在,我不想做它了。
不是因为难,是因为我想明白了一件事:就算真做出来,做到完全无感,这条路还是偏的。
说到底,我们要脱敏,不是因为 AI 看了当事人的名字会怎么样,是因为那份材料得离开你的电脑,交到一家你没签过保密协议的公司手里去处理。
脱敏从来不是我们想做的事, 是被逼的。
被"算力在别人家"这件事逼的。
半个月前,我还在文章里劝大家先脱敏。
今天我改主意了。因为我们从一开始,问的就是一个错的问题。
大家都在问,材料怎么改才能给 AI 看。 没人问,AI 为什么不能来你这儿。
我家电视柜的隔层里,现在多了一个黑色的小盒子。

旁边立着 PS5 的手柄。它比手柄大不了多少,扁扁一块,前脸一排蜂窝散热孔,一个绿灯亮着。
它正在跑一个一千两百多亿参数的大模型。没有声音,手放上去是温的。
02 · 一只手能拎起来的东西
不到两公斤。插上电、连上网线,完事。
不装 Windows,它自己带一套 Linux;不配机柜,它躺在电视柜里;不请人维护,我用自己 Mac 上的 AI 软件远程连过去,一条条命令让 AI 自己去装。
最意外的是它有多安静。待机 11 瓦,跑模型的时候我连着采样了 100 秒,功耗中位数 42 瓦。
作对比:一台配 5090 显卡的整机,满载几百瓦起步,风扇声隔一个房间都听得见。
42 瓦,比你办公室一盏台灯费电不了多少。
按这个功耗让它整夜干活,一晚上电费大概两毛钱。 (按民用电价粗算。)
03 · 真正让这件事成立的,不是盒子
这里我得说句公道话:这台小机器去年就发布了,"本地部署"这个词也喊了不止一年。
以前不成,是因为能塞进这种机器里的模型,不够聪明。跑得动的太笨,聪明的塞不进去。
真正变的,是这个月刚开源出来的两个模型。
一个是 Qwen3.8-27B,8 月 14 号开源的,Apache 2.0 协议,随便商用。另一个是 Qwen3.8-Flash-Next——8 月 26 号才放出来,到今天满打满算四天。
27B 是"全员到岗"型的:每吐一个字,整个模型都得从头跑一遍。它体积小、装得进显卡,所以在 4090、5090 那种卡上飞快。但它的见识受限于体量。
Flash-Next 走的是另一条路,官方自己把它定位成下一代架构的预览版。它更像一家人手很足的所:所里养着一千多亿参数,可每接一个活,只叫最对口的那一小拨上场——每个字实际动用的,只有六十来亿。
人多,所以见识广;每次上场的人少,所以跑得还快。 代价是,你得养得起这一屋子人。
代价就落在内存上。这么大的模型,5090 那种显卡根本装不下。而这个盒子有 128G 内存,正好装得下。
所以这不是"我买了台好设备"。是这类模型和这类机器,刚好在这个时间节点配上了。显卡快但装不下,盒子装得下但慢一点——而 Flash-Next 这种"总量大、每次只上一小拨"的结构,恰恰把盒子的短板绕过去了。
不是我等到了合适的盒子, 是盒子终于等到了适合它的模型。
说点更直观的。Flash-Next 发布时官方放出来的跑分表里,有几个数字挺唬人——
跑在我这盒子里的开源模型 对比 Claude Opus 4.6 Max GPQA Diamond · 科学推理 91.7 对 91.3 SWE-bench Pro · 软件工程 62.5 对 53.4 高出 9.1 LiveCodeBench v6 · 代码 91.9 对 88.8 高出 3.1 黑色大字是开源模型 灰色是闭源模型
27B 那边也不弱:SWE-bench Pro 61.7,Terminal Bench 2.1 拿到 73.0,比上一代的 63.4 提了一大截。
这些名字你可能没感觉,我翻译一下——
一个能塞进你办公桌抽屉的开源模型, 在好几个公开榜单上跟最贵的闭源模型打平,个别项还赢了。
丑话也说在前面:这些数字是厂商自己测的,第三方复测还没跟上;而且这些榜单基本都在考编程和推理,没有一项是考中文法律的。
所以我没拿跑分当结论。我自己去试了——
我挑了一个真实的医疗美容纠纷咨询,同一道题、同样的参数,让 27B 和 Flash-Next 各跑一遍。

速度上两个几乎一模一样,七项办案框架也都齐。差距全在细节:
27B 只泛泛引了《民法典》,Flash-Next 精确到 1218、1221、1222 条。 病历推定过错这条规则,27B 一笔带过,Flash-Next 给全了。诉讼时效 27B 干脆漏了,Flash-Next 不但提了三年,还带上了中断的情形。
这几条要是漏在给当事人的答复里,是要出事的。
跑分表看不出这种差别。得拿真题去问,才知道哪个能用。
写这篇文章的时候我算了一下: 这个模型开源到现在,一共四天。 所以下面这些数字都很新,也可能很快就被更新的东西盖过去——这正是我想赶紧写出来的原因。
04 · 一台机器,三件事一起干
盒子上现在同时开着三个模型。
写东西的。 中文法律文书每秒二三十个字,比你读的快。一份几千字的案情材料,它几秒钟读完,然后往下写。
认字的。 扫描件、拍照的卷宗、盖着章的 PDF,都能认。
做检索的。 我把整个法律知识库喂进去建了索引:6723 个文件,切成 5 万多块,8 分钟跑完。之后问"表见代理的构成要件",它先翻出我自己整理过的笔记,再挂上民法典 172 条。
三个一起开着会不会互相抢?我压测过:写东西的速度只掉了 5%。
这是它干活时候的样子——

三行 VLLM 就是那三个模型,分别吃掉 88.9G、8.4G、5.1G,加起来 102 个 G,压在 121.7G 上——那是 128G 内存刨掉系统占用之后,真正能给模型用的部分。GPU 跑到 87%,温度 62 度。
而这个时候,它的功耗是 32.83 瓦。
下面那条是硬盘:3754G,还空着 2689G。那是留给卷宗的地方。
今天下午,我把案件看板接上了它。传一份扫描的完税证明进去,三十秒出结果,表格结构完整还原——那还是第一次跑,模型是冷的。
盒子里还带着 4T 硬盘。这个位置放的不只是模型,是 一个团队的卷宗、笔记和办案经验 ——它们躺在这儿,不在任何人的网盘上。
还有一件我觉得挺有意思的事:它是一直开着的。
不像云端 AI,你问一句它答一句,按 token 收费。它就在那儿,24 小时通着电,一晚上两毛钱。所以完全可以让它整夜整夜地替你干活——把白天新进来的材料过一遍、归好类,第二天早上给你一份摘要。
我还给它接了个能连手机的助手,人在外面也能支使它干活。这部分我还在摸索,等跑顺了单独写。
这一圈下来,我办案的时候,材料一步都没出过我家。
05 · 这一路是怎么折腾过来的
我不想把这事写得太顺。这几天踩的坑,够写另一篇了。
把整台机器搞死过一次。 今天上午换一个更大的模型,加载的瞬间内存被打穿。机器没死透——能 ping 通,说明系统还活着,但所有服务全没响应,SSH 也连不上,十五分钟不自愈,最后只能硬重启。后来查明白了:模型加载那一下要的内存,比它稳定跑起来之后占的多得多。
它想太多,想到忘了写。 有一次让它做一个复杂的案件分析,等了半天,正文一个字没出来。查日志才发现,配额全烧在"思考"上了——它在心里想了个够,还没开始动笔就到上限了。找到正确的关法之后,同一个任务九十秒出了两千多字完整结果。
OCR 一开始慢得没法用。 传一张图进去要六秒多。查下来才发现,大头根本不花在认字上——是每来一个文件都要把模型重新加载一遍,而且文件之间还排着队。
改完之后是这样:

一样的机器、一样的模型,单张图从 6.6 秒变成 1.54 秒。
这里我想多说一句:这个提速 不是在盒子上改改就完了 。盒子这头改成常驻加攒批,案件看板那头也得跟着改——得会并发提交、会等结果、OCR 忙不过来的时候得排队而不是报错。两边一起调,才有上面那个数。
它现在确实能用了, 但它也确实还会咬人。
这些坑最后都填上了。三个模型现在稳稳地一起跑,案件看板也接通了。但我得老实说——这一路不是"插上电就能用"。
06 · 所以我不建议大多数人现在去买
盒子只是把算力搬回来了,它不会自己干活。
你还得先挑对模型——挑错了型号,这台机器立刻从能干活退回能说话;然后装模型、配 OCR、建索引,再把这一整套接到你日常真正在用的东西里面。能独立跑通这一圈的人,本身已经是个很懂 AI 的人了——而这样的人,其实也没多大必要专门为了脱敏折腾这一遭。
反过来,真正需要这套东西的人——手上有不能上云的卷宗、想把团队办案经验沉下来的——往往恰恰是最不想折腾技术的那批人。
这个错位,就是"本地化部署"喊了这么久、真正落地却很少的原因。
不是模型不行,是硬件和软件中间那一段,一直没人接。
我自己是因为手上正好有案件看板,才把这一段接上了。
07 · 这件事为什么值得说
一年多前,"本地化部署"还只有掏得起大钱的机构才有资格讨论。2025 年初那波一体机热的时候,市面报价从几十万到数百万,最高配的推理一体机优惠价接近六百万——这个数字不是我编的,当时新浪财经报道过。
现在这个小盒子,三万多。躺在我家电视柜里。
我知道这两件事不能硬比:几百万那套是给全所几十上百号人同时用的,还带集成和运维。我这个,是给自己和一个小团队用的。
但有件事是真的变了:
这道门槛塌了一大截。
以前是"你得是个大所",现在是"你愿意花三万块试一试"。
这背后还有一件更要紧的事。
刑事、涉密、尽调、家事里那些最私密的材料——这些活过去被划成 AI 禁区,不是因为 AI 干不了,是因为你不敢让它看。
这堵墙一塌,禁区就没了。
而且它塌的方式很特别:它不是让大所更强,是让小所和个人,第一次在这件事上跟大所站到了同一条起跑线。以前"我们所有本地化部署"是一句能拿出去说的话,是资源优势;现在它只是三万块钱和一个周末。
再往下想一层——一台自己的机器,意味着它可以整夜整夜地替你干活,不计费、不限量、不用担心哪句话说错了被记下来。今天它在整理卷宗,明天它就能在你睡觉的时候把这周的案子过一遍。
我不是在说这盒子有多神。我是说:
这大半年,"AI 用得好不好",很大程度上取决于你在哪个平台、有多少预算、敢不敢把材料传上去。
这三条,现在都不成立了。
我今天这套,还很糙,坑一堆。但方向已经很清楚——模型只会越来越强、越来越省,今天它刚好跨过"能用"这条线,明年后年只会更宽。
⚠️ 最后有句话我得说清楚。
我不是说脱敏今天就没意义了。我是说,它过临界点了。
以前脱敏是必修,因为除了脱敏你没别的办法。现在它开始变成一道选择题:你可以继续脱敏上云,也可以让材料干脆别出门。
所以我不再劝人"喂 AI 之前先脱敏"了。
我想说的是另一件事——
你手上那些一直不敢交出去的材料, 是时候重新想想了。
原文发布于「零代码法律人」。读者可前往 微信公众号阅读原文。