「改写时代」Claude 水印何以陷入困局

Anthropic 不久前宣布要在 Claude 的输出文本中植入一种无形标记,等到周末,他们终于公开了这项技术的具体实现细节。

正如此前的推测,该方案采纳了 Google DeepMind 研发的 SynthID 技术。其复杂程度远超「往文本中嵌入特殊字符」的简单想象。这个标记不是后期加盖,而是在模型逐步生成各个 token 时,就一步步内化于文字的肌理之中。

恰好在此时刻,用于破坏这类标记的工具也随之涌现。在 GitHub 平台上,一些开发者已着手创建消除文本水印的软件。

Claude把生成文本加入隐形水印 尴尬的事发生了

此技术并不具有强大的防护能力,简而言之,将文本经由其他模型处理,便足以瓦解该隐形标记的作用。

如此一来,Claude 的水印处境显得颇为尴尬。细想之下更显可怕的是:Claude 为使文字将来能被辨别,必须调整用词的概率;而意欲躲避检测的用户,则以改写措辞作为最朴素直接的对抗手段。

从「隐没」到「融合」:Claude 的水印生成逻辑

要想理解这场较量的真面目,必须先搞清楚 SynthID 这套已有的机制具体在运作什么。

AMP

大型语言模型在构造文本时,并非先行完成完整的心理表述再按字序输出。每个生成节点上,模型都基于既有的语境,对下一个 token 的各种可能性赋予概率值,进而进行抽取。

不妨设想 Claude 在完成「这部电影真____」的语段。在这个生成步骤上,模型面临众多选项,其中出现概率较高的候选包括:

「好看」40%

「厉害」20%

「精彩」10%

……

SynthID 的做法并不是强制 Claude 的选词,也不会剔除任何选项。其实质是在抽签发生之前,依照唯有检验方掌握的规则,对部分候选 token 的评分做出细微变动,使得某些方案相比原本更易被选中。

当移至下一个 token 的生成时,由于语境已然改变,所有概率均需重新评估,所谓偏好的候选也随之变动。所以绝无一份恒定的「Claude 水印高频词表」存在;即使某词在当前场景有益,置于不同的语境就可能失效。

将其中任意单词单独审视,几无可能发现端倪。真正具备可检测性的,是众多生成选择汇积之后呈现的统计特征。

AMP

用最朴素的比喻,这如同一场考卷上全是选择题的考试,出题者并未明言答案,但悄悄对中意的考生说:有疑虑就选 C。

一题选中 C 显然无足轻重,十题也许只是偶然,C 选项本来就存在故也说不准。

但在几百题的规模上,若单就此学生的作答来看,不论对错,C 的出现频率都异常之高,且反复符合「此老师偏爱设 C」的规律,就难以用巧合来辩解了。

水印检测的逻辑如出一辙,其目标并非证实「这句话唯 Claude 能生成」的特殊性,而是提问:在足够长的文本序列中,每个生成点本应有众多选择,那么为何最终的 token 组合会持续展现出符合某套秘密规则的统计倾向?

AMP

「隐形」的含义正在于此,标记并无肉眼可指向的对应字符,而是凭籍统计规则。然而这也暴露了一个根本困境——因为信号本就附着在 token 的抉择上,因此重新选择 token,自然就能打破这套统计关联。

模型「加标」,用户「消标」:循环的改写游戏

若水印存于文件元数据,攻击方可径直删除;若寄于隐形 Unicode 字符,则可清洗异常符号。偏偏 SynthID 的困局就在于,它与文字本体已浑然一体。

要想祛除水印却又不能将其整句删去,那么最直白的策略便是:在基本保持原旨的前提下,对这串 token 进行重组。

AMP

可以替换近义词,可以将主动句改为被动句,或者最直接的——索性交给别的模型重新处理一遍,自洗其身。

这类做法都能弱化既有的统计相关性。博客作者 Daring Fireball 以改写工具 Declaude 为最有说服力的例子:其初衷是「去除过度的 AI 风格,重新锤炼」,而这种改写无意间也能把 Claude 特意刻下的标记消除掉。

市场上长期存在 Pangram 等工具用于侦测 AI 参与度,这使得上述攻防不再停留于理论层面而转化为现实需求。攻击手法可能各异,但指向一致:最大限度维持内容完整,同时摧毁检测系统所依赖的 token 序列。

AMP

真是一场淋漓尽致的「躲猫猫」游戏啊。

为了侦测 AI 有无出手,生成过程中模型须细微修正措辞的抉择;为了躲避追查,使用者便要重做选词。为让水印承受住常规改写,标记体系又得强化等级;用户则继续探寻既不大改原旨、又能有力摧毁统计讯号的手法。从纯技术视角,这是典型的攻防战,防方期望信号跨越复制、修改、格式调整等环节仍能幸存,攻方则力求以最小代价使检测功能失灵。

文本领域与图像、音频的情形有本质不同。图片水印可尽可能地隐匿在不妨碍视觉的区域,但文字水印能否利用的「空间」本身就源于各类词汇、句构和表述决策。

AMP

图片来自:Atlasiko

所以,每一轮的攻防演进,都必然要对文章的肌肤本身进行干预。

更显尴尬的是,该机制对刻意逃脱者与普通使用者的作用并不对等。坚心作弊的用户可以积极寻觅不含水印的模型、重写程序抑或连续「洗稿」;毫无规避意图的人则可能被迫接纳带着水印限制的产出。

最终,被标记所牢牢刻印的,恰好是那批未曾刻意躲避它的人。

全员都在替换措辞,可还有谁在意这句话该如何成文?

游戏终局:「谁追上谁」已不再是关键

标记方与解标记方虽立场对立,却在同一个前提下达成了共识:似乎可以把一句话分解为「应当保住的含义」与「不妨改动的措词」两个层面。

若大旨未发生显著偏离,具体用词便可成为技术系统或作者自身的操作余地,二者都借此施展拳脚。

科技评论家、Daring Fireball 主笔 John Gruber 对文本水印最核心的置疑,可归结为一个更简明的命题:若大意相仿,是否就等于文字未曾更动?

AMP

不妨看看如下两个例句的差异:

「他终于答应了。」

vs

「他终于松口了。」

二者都可表述「某人最终允诺某事」的核心,然而后句里无形间多了一丝先前的抗拒、经历拉锯方才低眉的暗示。

虽然这两句在传意层面确有相似,但对在乎笔墨的人而言,二者绝非可任意替换。即便在平日对谈中,它们也各自承载了微妙差异的分量。

Anthropic 与 Google 都声称,标记设计的目标在于保持文本的语意、品质与易读性不变;一份细微的概率倾斜,是否在实际生成里引发人能感知的质量偏差,尚需额外证明。

AMP

但一个根本的转变已然发生:模型选词时,新增了一个与「怎样最好地表述」无涉的优化指标。

昔时,一个理想的生成系统在准确、清晰、自然与符合用户需求、遵循人类书写习惯等诸多目标间寻求均衡。

融入文本标记机制后,系统还得考虑「生成的字句是否能被标记系统辨认」;而用户若欲反抗,文字又增加了「如何修改至无法识别」的新优化层。不论目的为何,双方都能宣称自己尽力保留了「本意」。

然而写作绝非可与措辞相分离、仅存其意的事业。词与意如唇齿相依。文本的生成并非先行铸造完整的「意图」,再随意填充同义词。选什么词的决断本身,正在造就「意思」这物。

Claude 欲证「此文我经手」,用户期求「你莫能识」。当各方都为了证明身份而去改造措词时,「这句话本该如何落笔」——已被驱至暗角。

这场交锋的终极战场,争夺的不是技术有无隐形、有无知觉,而是语言本身那些昔日属于文风、韵律与表述精妙的探求,是否仍有容身的地界。


上一篇 2026/08/18 17:06
下一篇 2026/08/18 17:07

相关推荐

  • 台湾「鞭刑入法」公投风波:一场民意与人权的激烈对碰

    台湾立法院通过「鞭刑入法」公投提案,拟在刑法中纳入此罚。事件源于多起严重恶性案件引发民意,民调显示八成以上民众支持评估此制度。然而人权组织与法律界人士强烈反对,认为违背国际人权标准,并质疑有效性。

    2026/08/20
    00
  • 欧洲创新突围:德国SPRIND模式能否打破美中技术围城?

    面对美中科技竞争,欧洲探索新创新模式。德国SPRIND机构凭借快速决策和跨国资助在业界引关注。英国C3 Biotech利用其资金成功研发农业废弃物制化学品技术。法国、瑞典等国纷纷跟进,联动构建欧洲创新生态。

    2026/08/20
    00
  • 底层有声音:农民工文学何以在焦虑时代爆红

    伴随经济前景的不确定,中国农民工文学日益走红。从快递员胡安焉到诗人王计兵,底层劳动者用文字诉说真实困境。这些作品既暴露社会不公,又歌颂坚毅品格,却也面临官方的话语导向。他们的笔触打破沉默,让被忽视的群体获得看见,唤醒社会共鸣。

    2026/08/20
    00
  • 哈利王子月底回英倒计时!现身华府全程笑颜,背后有何深意?

    英国王子哈利与妻子梅根计划月底前携两名孩子从美国迁往英国长住。消息公开仅数小时后,哈利即现身华府参与退伍军人圆桌讨论,始终面带笑意。他强调社会需尊重退役军人的专业与经历,透露筹划商业新举措重视这一群体。

    2026/08/20
    00
  • 卡萨国际稳定部队获美国重金扶持,首批援资逾2亿美元

    美国政府拟向卡萨国际稳定部队投入逾2亿美元,这是其首次为陷入僵局的卡萨和平计划提供资金支持。2亿美元用于装备、基础设施、车辆和运营,600万美元用于改装装甲车。部队将主导安保行动、推进非军事化并保障人道主义援助,具体编制仍在协商中。

    2026/08/20
    00

发表回复

登录后才能评论