AI 数据与信任之争/AI图

手工劳动/兽妹

手工编辑 /角叔

出品/独角兽观察

事情始于一名开发者的偶然发现。

9月中旬,技术博主ferstar在清理本地磁盘时注意到一个异常:智谱AI旗下的AI编程工具ZCode,在用户处于登录状态时,会自动将整个工作区代码打包、加密,然后上传到阿里云的OSS服务器上。

被打包的不只是他正在编辑的文件——而是完整的Git版本历史、LFS大文件缓存、reflog操作记录,甚至部分全局开发配置文件。换句话说,一个项目从第一行代码开始的全部研发资产,都被这样悄无声息的搬到了智谱的服务器上。

更让开发者炸毛的是加密方式:RSA公钥由智谱服务端下发,本地生成的加密包连用户自己都解不开。上传功能默认常开,客户端界面里找不到任何开关,隐私政策里也只字未提。

事件迅速发酵。太原一家名为承明科技的公司直接发函追责,称其6个工作区的源代码、数据库口令、接口密钥、用户个人信息全部被完整上传,并质疑数据是否涉及跨境传输。

9月21日,智谱公开致歉,宣布ZCode正式开源至GitHub,邀请中国信通院和绿盟科技完成首轮安全审计——确认涉事存储桶已清空、数据已删除。同

一天,智谱MaaS平台宣布即将上线"零数据留存"机制。

一次产品功能的默认开启,为什么会演变成一场行业级的数据安全信任危机? 这起事件的意义,早已超出了智谱一家公司的公关应对,它把整个AI行业心照不宣的"数据原罪",摆到了台面上。

01

AI编程工具的"数据潜规则"

智谱ZCode出事之后,很多开发者开始重新审视自己正在用的AI编程工具——GitHub Copilot、Cursor、Claude Code……它们会不会也在做同样的事?

把市面上主流AI编程工具的数据政策放在一起对比,你会发现一个有趣的现象:大家的做法大同小异,但"透明度"天差地别。

GitHub Copilot——作为这个赛道的开创者和行业标杆,Copilot在数据合规上做得最"体面"。根据其官方文档和Trust Center的公开信息:付费版(Individual、Business、Enterprise)默认不使用客户代码训练模型,数据留存遵循"零数据保留"原则(Zero Data Retention)。所有传输数据在传输过程和静态存储时都加密。企业版还提供IP侵权赔偿保障。换句话说,GitHub把"你的代码归你"这件事,写进了合同里。

Cursor——争议就多一些。根据Cursor Alternatives等第三方评测的对比,Cursor的默认行为是:代码片段、提示词、编辑器操作数据都会发送到Cursor后端服务器,这些数据可能被用于模型改进和产品分析。隐私模式(Privacy Mode)确实存在,但它是opt-in(需要手动开启)而不是opt-out(默认关闭)。也就是说,如果你不主动去设置里打开,你的代码就在被持续上传。

Claude Code——Anthropic的企业版提供明确的数据处理协议(DPA),合规框架相对完善,支持SOC 2 Type II、ISO 27001等认证。但免费版和个人Pro版的数据保护力度就弱很多。

智谱ZCode——这次暴露问题的特殊性在于:它不是"默认上传但可以关闭",也不是"默认上传但隐私政策里写了",而是默认上传、不能关闭、隐私政策没写、而且加密方式让用户完全失去掌控。这已经不是"数据政策不够友好"的问题了,而是接近"隐瞒行为"的性质。

横向对比下来,你会发现AI编程工具行业有一个心照不宣的潜规则:几乎所有产品都在收集用户代码数据,区别只在于"收多少、怎么收、有没有告诉用户"。

为什么会这样?因为AI编程工具的核心竞争力是模型能力,而模型能力的提升需要海量真实代码数据做训练。

GitHub Copilot之所以能做到"不用客户代码训练",是因为它背后有GitHub上百亿行公开代码做训练底子。而其他后来者——Cursor、ZCode、以及无数同类产品——没有这样的公开代码资产,它们的模型从哪里来?

答案不言自明。

02

智谱撞到了信任红线

把视线拉回到智谱这家公司本身。

36氪的报道提到一个细节:这起数据风波爆发的时间点,距离智谱完成完成一笔约 390 亿港元的再融资计划,仅仅过去了很短时间。一家已经登陆港股、同时冲刺科创板 A 股 IPO、估值千亿级别的头部AI大模型公司,却因为旗下编程工具的一个"默认开启"功能,陷入了成立以来最严重的信任危机。

这就很值得玩味了。

智谱长期以来的品牌定位是什么?是"国产大模型第一梯队"、是"技术派"、是"安全可靠"。它的客户里有大量政府、金融、央企等对数据安全要求极高的机构。而ZCode这次暴露的问题——静默上传完整代码仓库——恰恰是这类对安全要求极高客户最不能容忍的事情。

更微妙的是时机。如果这起事件早爆发半年,影响可能还没这么大。但现在,国产大模型赛道的竞争已经进入了"企业级落地"的阶段。过去大家比的是模型参数、跑分、谁的能力更强;现在大家比的是谁的企业客户更多、谁的收入更高、谁能真正在生产环境中跑通。

而企业级市场,数据安全是入场券,不是加分项。

你可以能力不是最强的,但你不能不可信。 一旦企业客户认定你的产品会偷传代码、会泄露数据,那不管你的模型跑分多高,人家都不敢把生产环境交给你。

这就是为什么智谱的反应这么快——48小时内完成致歉、整改、开源、引入第三方审计、宣布零数据留存,一套组合拳打下来,也算是“亡羊补牢”里,危机公关表现得非常好的了。

但问题是:速度快,不代表信任能回来。

开源ZCode是最狠的一步棋——把代码全部放到GitHub上,让全球开发者自己去检查有没有后门、有没有偷偷上传的逻辑。这在形式上确实堵住了"暗箱操作"的质疑。

但这次事件给开发者社区留下了“曝光之后才走向透明”的印象。要改变这个印象,需要智谱足够的诚意,也需要时间来验证。

03

AI公司的"数据饥渴"

这起事件最值得深挖的,不是智谱做错了什么,而是它暴露了整个AI行业的一个结构性矛盾:

AI公司对训练数据的无限饥渴,和用户对自身数据的主权诉求之间,存在根本性的张力。

大模型的训练需要海量数据。在公开互联网数据被消耗得差不多之后,各家公司都在寻找新的数据源。用户在使用AI产品过程中产生的交互数据——代码、对话、文档——就成了一座待开采的金矿。

但这里有一个巨大的灰色地带:用户在使用产品时产生的数据,到底归谁?

从法律层面看,源代码是开发者或企业的知识产权,未经授权上传和使用,涉嫌侵犯著作权。从伦理层面看,用户把自己的代码交给你,是为了让你帮忙写代码,不是为了让你拿回去训练自己的模型。从商业层面看,企业花大价钱购买AI编程工具的订阅服务,结果自己的核心代码被供应商拿去训练模型、未来可能被竞争对手使用,这笔账怎么算都不划算。

那为什么大家还在这么做?因为不这么做,模型就追不上对手。

这是一个囚徒困境。如果行业里有一家公司偷偷用用户数据训练模型,那其他公司如果不用,模型效果就会落后,市场份额就会下降。最终的均衡结果就是:所有人都在偷偷用,但没有人公开承认。

智谱ZCode事件,相当于把这个心照不宣的游戏规则,不小心捅破了。

那行业应该怎么破局?

目前看来,有几条路径:

路径一:零数据留存(ZDR)——像GitHub Copilot企业版那样,用户的输入输出数据在模型调用完成后立即销毁,不做任何静态存储。这是最干净的方案,但对AI公司来说意味着失去了宝贵的训练数据来源。智谱这次宣布MaaS平台上线零数据留存机制,就是在向这个方向靠拢。

路径二:明确告知+用户授权——把数据使用范围写进隐私政策,让用户在知情的前提下选择是否同意。Cursor的隐私模式就是这个思路。问题在于,绝大多数用户根本不会去读隐私政策,默认选项才是真正的决策点。

路径三:联邦学习/本地化部署——模型在用户本地运行,数据不出端。这是最安全的方案,但对模型规模和算力有很高要求,目前只有轻量级小模型能做到。

路径四:数据交易市场——建立合法合规的数据交易机制,企业付费购买高质量训练数据,而不是从用户那里"偷"。但这个市场目前还在早期阶段。

现实是,这四条路径没有一条能完全解决问题。整个行业都在"用户体验、模型效果、数据合规"三者之间走钢丝。智谱ZCode事件,只不过是钢丝上有人摔了一跤,让所有人都看到了这条钢丝有多窄。

结语

智谱ZCode的数据隐私风波,看起来是一次产品功能的"误操作",但它戳中的是整个AI行业的痛点。

AI公司需要用户数据来训练模型,用户需要保护自己的数据不被滥用。 这对矛盾不会因为某一次整改、某一份审计报告、某一个开源声明就消失。它会在未来反复出现——可能是下一个AI编程工具,可能是某家大模型公司,可能是某个AI助手产品。

唯一确定的趋势是:AI行业的"野蛮生长"时代正在结束,"信任基建"的时代正在开始。 那些能够率先在数据安全、隐私保护、合规透明上建立起真正壁垒的公司,才能在下一阶段的竞争中活下来。

智谱这次交了学费。但愿全行业都能从这笔学费里,学到点什么。(完)

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部