GitHub则宣布,自4月24日起,CopilotFree、Pro和Pro+用户的输入、输出、代码片段及相关上下文,默认可用于模型训练和改进,用户可在设置中选择退出。
Cursor也披露其代码库索引功能默认开启,会扫描用户打开的代码目录,并将代码库索引信息同步至服务器。此外,Cursor此前还修复过一起高危逻辑漏洞——恶意Agent可通过修改文本文件绕过原有保护规则,读取本应被排除的敏感文件。
据业内人士向澎湃新闻记者介绍,现行《个人信息保护法》《数据安全法》明确要求数据收集遵循最小必要、同意原则,不能在用户不知情的情况下过度采集数据,商业源码也属于受保护的商业秘密。
但难点在于:AI桌面客户端不同于传统手机App,缺乏像移动端App那样常态化的上架前检测机制。软件打包分发后,客户端底层行为藏在二进制代码内部,普通用户很难自行发现静默上传逻辑,监管也难以主动穿透、提前发现这类隐蔽的客户端后门,大多只能等到事件曝光之后才介入核查,属于事后追责模式。
这也意味着,AI时代,新型产品的数据隐私与入口安全问题,已成为行业面临的最新挑战。
9月20日深夜,智谱MaaS(模型即服务)平台宣布,将上线“数据内容不留存”功能。生效后,用户输入和输出的数据仅用于完成当次模型调用,不做静态存储。
建投通信研报认为,对于金融、政企、代码等高敏感场景,客户真正关注的是原始Prompt、模型Output和代码是否会在平台侧长期保存。此次MaaS进一步提供数据不留存选项,相当于从制度承诺升级为产品级能力,有望降低大客户采购API和Agent产品时的数据合规门槛。
站在产业长期健康发展的角度,田丰认为国内AI编程生态应当确立两条基础共识:数据采集默认关闭、需用户主动确认;审计与安全披露常态化。这需要头部厂商、企业客户和监管方共同参与,无法单靠个别企业的自我约束完成。
他表示,行业共识可借鉴此前几代计算范式走过的路径:从默认信任逐步过渡到默认最小权限。从大型机到PC互联网,再到移动互联网,每一代计算范式早期通常都是默认开放,出问题后再逐步收紧权限;操作系统和浏览器之所以能发展出今天的权限弹窗、沙箱隔离机制,也是经历多轮安全事件后才逐渐定型。AI编程工具眼下正处于类似的早期阶段,行业主动把这条经验前置,能够减少重复付出同样的学习成本。
田丰建议,可考虑将涉及源代码、密钥等企业级敏感数据的自动采集功能,纳入现行数据合规监管框架的延伸适用范围,参照个人信息保护领域已经确立的“默认关闭、显式同意”原则,对同类企业数据场景给出对应合规指引;同时鼓励建立行业层面的事件响应时限规范和常态化审计公示机制,形成一条统一、可预期的合规路径以证明整改到位,减少企业各自应对时的重复成本,也减少用户单纯依靠自行监测才能发现问题的局面。
郭涛向澎湃新闻记者表示,未来一至两年,AI编程工具赛道最值得警惕的重大安全事件,并非单纯的代码泄露,而是借助编程智能体作为跳板入侵企业内部生产环境。AI编程工具深度对接企业代码仓库与内网开发环境,一旦权限管控失效,恶意指令便可驱动工具批量读取仓库密钥、配置文件,自动完成代码修改、提交部署,形成自动化攻击链路。
其次是供应链层面风险:大量企业复用AI生成组件,模型内置的隐性漏洞会通过开源代码快速扩散至成千上万企业系统,形成跨企业的群体性安全事故。不同于普通大模型对话内容泄露,编程智能体风险直接传导至生产业务,事件一旦爆发,造成的产业损失和影响范围将显著大于普通大模型安全事故。