人工智能企业最值得保护的资产,往往不是一份独立的“机密文件”,而是散落在数据湖、标注平台、代码仓、模型仓、实验追踪平台、MLOps流水线、云控制台、向量数据库、API网关和客户交付环境中的组合能力。原始语料、清洗规则、标签体系、失败样本、评测集、模型权重、LoRA或Adapter、系统Prompt、RAG知识库、推理加速内核、算力调度策略和客户部署经验,只有相互关联时才真正构成企业的技术壁垒。

这种组合资产具有极高的可复制性。一份Checkpoint或微调权重可能直接承载模型能力;一套内部评测集和标签规则可以帮助竞争者看清优化方向;一段推理脚本、一个容器镜像或一组超参组合,可能让外部团队绕过数月甚至更长时间的试错;一个长期有效的云控制台账号或API令牌,则可能把数据、模型、代码、密钥和日志同时暴露。

AI行业的泄密也很少只发生在“有人偷走源代码”的极端情形。更常见的路径,是外包标注人员看到超出任务范围的样本,工程师把故障日志或Prompt输入公共在线工具,Checkpoint被缓存到个人设备,模型包误传公共仓库,客户POC使用真实数据和真实策略,技术博客暴露内部评测方法,第三方红队长期留存用例,云运维账号项目结束后仍未撤销,或者员工离职前集中下载模型与数据。

因此,人工智能行业商业秘密保护不能停留在“签保密协议、代码仓设权限、文件统一加密”的层面。行业化实施方案要把识别定密、A/B/C分级、保密期限、数据与模型目录、系统标签、最小授权、外发审批、API治理、开源审查、第三方退出、日志证据和事件响应嵌入数据采集、标注、训练、微调、评测、红队、部署、交付和持续迭代的全过程。

核心结论:AI企业真正要保护的不是“某一个文件”,而是模型、数据、代码、算力、Prompt/RAG、接口和客户场景共同形成的组合知识。只有把每一项秘密拆到可命名、可分级、可授权、可审计的最小颗粒,并让目录、权限、日志、外发、合同、期限和证据链同步运行,企业才能形成可证明的合理保密措施。

 

一、为什么人工智能企业不能直接套用通用保密制度

1. AI核心能力是“数据+模型+工程+场景”的组合,而不是单一代码文件

传统软件企业可能把源代码作为保护中心,但AI产品的差异往往同时来自数据来源、清洗去重、标签体系、训练配比、模型结构、超参组合、评测方法、Prompt工作流、推理优化和客户反馈。只保护其中一项,其他环节仍可能帮助外部还原完整能力。行业方案必须建立对象之间的关联关系,识别哪些片段单独价值有限、组合后却会形成决定性优势。

2. 模型权重是一种可直接复制、难以追回的高价值数字制品

模型权重、Checkpoint、LoRA、Adapter、蒸馏模型和推理镜像与普通文档不同。一旦被复制到外部仓库、个人设备或客户环境,原始企业很难确认副本数量,也难以依靠“删除原文件”消除风险。模型仓专库专域、加密存储、白名单访问、双人审批、哈希签名和接收方绑定指纹,应成为AI企业的基础控制。

3. 标签体系、失败样本和评测集往往比公开模型结构更能体现诀窍

模型结构可以参考公开论文,基础模型也可能来自开源生态,但企业如何选样、如何标注、哪些失败样本被保留、如何设置评测基准、怎样定义拒答和安全边界,往往决定最终产品表现。这些内容容易被误认为“辅助资料”,实际上能够直接暴露优化方向、业务逻辑和模型短板。

4. GPU算力、MLOps和云平台配置会暴露完整训练管线

训练集群拓扑、资源配额、任务调度、对象存储路径、容器镜像、KMS/HSM策略、日志和备份,不只是运维资料。外部运维或云服务人员一旦获得超范围权限,可能同时看到数据位置、训练任务、模型版本、密钥和客户项目。通用文档制度无法替代MFA、JIT、独立VPC、堡垒机双录、WORM日志和备份加密。

5. API、SDK、客户POC和私有化交付构成持续对外的信息窗口

不交付权重并不等于没有泄密风险。接口字段过宽、系统Prompt被返回、响应包含内部策略、异常调用用于模型抽取、SDK内置高权限密钥、POC环境使用真实数据,都可能让外部逐步推导模型行为和业务规则。对外交付必须设置最小字段、签名、限流、白名单、沙箱、到期撤权和调用审计。

6. 外包标注、评测红队、联合开发和云算力使第三方深入核心链路

AI企业常常需要数据提供商、标注团队、红队机构、云算力供应商、插件服务商、联合开发方和客户团队协作。第三方为了完成任务需要接触部分信息,但“需要合作”不等于“可以获得完整数据集、完整权重或全量策略”。行业方案必须把准入、合同、最小接触、过程审计、交付验收和退出删除连成闭环。

7. 模型快速迭代使秘密边界、密级和期限持续变化

训练数据、评测集、模型版本、接口策略和客户方案不断更新。某一版本在发布前可能是核心商业秘密,公开后只有未公开底稿继续受控;某个客户知识库在合同期内高度敏感,合作终止后还要按约定保留或删除;旧模型和失败实验仍可能降低竞争者试错成本。静态清单和“一次定密终身不变”难以适应。

8. 商业秘密保护必须与数据、个人信息、算法、跨境和开源合规协同

AI对象常与个人信息、重要数据、数据出境、出口管制、算法备案、网络安全和开源许可证义务交叉。商业秘密保护不能用来阻止依法披露,也不能以保密名义越界监控。成熟做法是先划清合规边界,再对合法留存、共享或公开中的非必要细节实行净化、最小披露和证据留痕。

二、人工智能企业应优先识别的十类商业秘密

核心资产

典型内容

主要载体或系统

泄露后可能影响

训练数据与采集规则

原始语料、数据来源、采集规范、清洗去重、合成规则、失败样本、数据血缘。

数据湖、对象存储、数据仓、采集脚本、数据目录。

训练优势、数据来源与业务逻辑被复制。

标签体系与偏好数据

标签定义、标注指南、偏好数据、质检规则、困难样本和一致性标准。

标注平台、样本库、指南、质检记录。

模型对齐方向和业务判断口径暴露。

模型权重与微调制品

基础模型权重、Checkpoint、LoRA/Adapter、蒸馏模型、策略包。

模型仓、制品库、对象存储、推理镜像。

核心能力被直接复用或二次扩散。

训练与推理工程

训练脚本、超参、优化器、数据配比、推理内核、量化压缩、加速策略。

代码仓、实验平台、MLOps、容器镜像。

研发试错和工程优化路径被快速还原。

评测、对齐与红队

评测集、内部基准、红队用例、奖励模型、拒答规则、安全边界。

评测平台、报告库、策略仓、会议材料。

产品短板、优化方向和安全规则暴露。

Prompt、RAG与知识库

系统Prompt、提示词模板、工作流、知识切片、嵌入与检索排序规则。

向量库、知识库、Agent平台、配置中心。

业务流程和客户知识积累被复制。

代码、配置与制品

源代码、部署脚本、插件配置、API配置、CI/CD、镜像、SBOM。

代码仓、配置仓、制品库、CI/CD。

内部实现、密钥路径和部署能力暴露。

算力与平台配置

训练集群拓扑、GPU成本模型、调度策略、资源配额、KMS/HSM、备份。

云控制台、集群平台、堡垒机、日志平台。

全域数据、模型、密钥和成本能力联动失守。

API、SDK与线上策略

接口字段、签名、令牌、限流、白名单、系统Prompt、风控规则、调用日志。

API网关、SDK仓、监控平台、客户接入环境。

模型抽取、策略推导和接口滥用。

经营与客户信息

私有化方案、报价、算力成本、投标底稿、客户问题清单、重大合同。

CRM、VDR、报价系统、会议纪要、交付文档。

客户流失、报价失守和项目竞争力下降。

 

1. 训练数据与采集规则:真正的优势经常形成于“公开数据之后”

很多企业使用公开语料或采购数据,但竞争优势并不只在原始来源,而在采集选择、清洗去重、质量分层、敏感字段处理、合成规则、失败样本保留和训练调用方式。即使基础数据公开,企业经过长期加工形成的数据组合、版本和血缘仍可能具有独立价值。

数据对象应精确到数据集版本、批次、字段和用途。进入核心训练前要记录来源、许可、哈希、清洗脚本、标签版本和调用记录;高敏数据默认禁止整包导出,确需共享时采用字段最小化、切片、脱敏、水印和期限控制。

2. 标签体系、标注指南与偏好数据:看似“人工说明”,实则是业务判断模型

标签定义、正负样本边界、困难样本处理、偏好排序、质量抽检和一致性规则,把企业的业务经验转化为可训练数据。外包团队一旦同时获得完整指南、全量样本和质检结论,就可能复刻模型对业务场景的判断方式。

标注任务应按批次、字段和角色切片,外包人员只见任务必要片段;使用只读平台、屏幕水印、下载限额、操作日志和蜜罐样本。项目结束后不仅要回收账号,还要验证外包方本地副本、截图、缓存和二次分包是否清除。

3. 模型权重、Checkpoint、LoRA和Adapter:最需要优先止血的P0对象

模型权重可直接承载训练结果。基础模型权重、关键微调权重、LoRA/Adapter、蒸馏模型、策略包和推理镜像一旦外泄,竞争者可能绕过数据准备和训练成本,直接复用或继续微调。权重传播后副本难以追回,因此不能沿用普通文档外发方式。

核心权重应统一进入模型仓,禁止通过邮件、公共网盘、个人移动硬盘和公共仓库流转。每个版本生成哈希、签名和版本说明,访问采用名单制、MFA、JIT或双人审批;客户交付版本加入接收方绑定指纹,并设置许可证、证书或密钥到期。

4. 训练策略、超参组合和失败实验:成功模型背后的试错路径同样有价值

模型结构可能公开,但数据配比、学习率策略、优化器配置、训练阶段、蒸馏流程、量化方式和推理优化常由大量实验形成。失败实验、异常样本和未采用路线能够帮助他人避开错误方向,节省算力和时间,因此不能在版本淘汰后自动视为无价值。

训练任务立项时同步识别秘密点,实验追踪平台记录代码提交、数据版本、超参、资源使用和责任人。高敏任务使用独立项目空间和受控终端,Checkpoint不得缓存到个人设备;历史实验到期时应复核秘密性和替代价值,再决定归档、降密或销毁。

5. 评测集、对齐策略和红队用例:谁掌握评测,谁就看见模型优化方向

内部评测集、红队用例、奖励模型、RLHF/RLAIF流程、拒答规则和安全边界,不仅用于检验模型,还会暴露企业如何定义“好”“坏”“可回答”和“必须拒绝”。评测集泄露还可能导致外部针对性优化,失去客观基准。

训练集、评测集和红队集应分区管理,评测集不得混入训练;红队报告和安全绕过样例不应在客服、销售或外部合作中原文扩散。对外演示使用净化用例和模拟数据,内部排行榜、缺陷与修复记录按策略段分段可见。

6. 系统Prompt、Agent工作流、RAG知识库和向量库:AI应用层的新型商业秘密

系统Prompt并不只是几句话,而可能包含角色设定、工具调用、上下文选择、路由、输出模板、拒答逻辑和业务规则。RAG知识库还包含知识来源、切片、嵌入、检索、重排和更新机制,客户知识与企业经验沉淀其中后,通常具有更高敏感性。

Prompt和知识库应按模型、产品、客户和版本编号,客户知识库与通用知识库隔离,密钥不得写入提示词。外部演示只使用净化版Prompt和模拟知识,插件调用记录、向量导出和原文回溯均需审计,禁止把内部URL、客户标识和策略阈值放入公开材料。

7. 代码仓、推理内核、MLOps流水线与镜像:工程效率也是竞争壁垒

训练脚本、特征工程、推理加速、量化压缩、自动评测、部署回滚和监控策略,决定模型能否低成本稳定运行。代码仓里还可能混入密钥、客户数据路径、内部服务地址和配置模板,公共仓库镜像或离职带离会形成组合泄密。

核心算法、推理内核、客户部署脚本和密钥配置应分仓分支,关键分支强制评审、签名提交和安全扫描,禁止未授权fork或个人仓库镜像。容器镜像、模型包和部署包统一进入受控制品库,完成签名、SBOM和版本归档。

8. GPU算力拓扑、调度与成本模型:平台侧信息可以反推研发能力

训练集群规模、GPU型号和配额、任务优先级、调度策略、数据挂载、训练周期和算力成本模型,能够帮助外部推导企业研发节奏、客户能力和成本结构。云控制台、根账号、KMS密钥和备份一旦失守,还会连带暴露模型与数据。

人机账号分离,高权限账号强制MFA,根账号封存,临时权限JIT到期回收。训练域、推理域、办公域和外联域分隔,高敏项目使用独立VPC或项目空间;任务、模型导出、镜像拉取、外部插件和密钥调用全量记录,关键日志WORM保存。

9. API、SDK、系统Prompt和线上策略:不交付权重也可能被“问”出能力

接口字段、错误信息、响应模板、限流规则、系统Prompt、插件配置和风控原因如果暴露过多,外部可以通过批量探测、提示注入和模式化调用推导模型行为,甚至实施模型抽取。SDK内置密钥或长期令牌则会形成持续入口。

接口文档按密级管理,只开放必要字段;客户调用使用签名、来源白名单、额度、速率限制和可撤销令牌。监测批量探测、异常失败率、提示注入、重复采集和异常地理位置,异常工单与具体客户、令牌、模型版本和处置动作关联。

10. 客户方案、私有化部署和算力报价:经营信息与技术信息往往相互映射

私有化部署拓扑、客户数据接入、模型选型、资源配置、SLA、算力成本和报价底稿,既暴露客户需求,也能让竞争者推导企业交付能力和成本边界。重大投标、并购和融资材料还可能同时包含路线图、模型效果和核心团队信息。

客户POC优先使用沙箱、脱敏数据和净化版材料,原件原则上不外发。VDR按角色和阶段授权,动态水印、禁止下载或限次下载,关闭后取得回收或删除确认;合同明确客户输入输出、日志和反馈样本是否可回流训练。

三、AI企业最容易发生泄密的十六个“正常工作时刻”

1. 数据采购或接收时,授权材料齐全,但原始数据先进入了临时网盘

业务为了赶进度,先让供应商通过个人邮箱、临时链接或共享云盘交付,随后再补合规审查。此时原始数据已经产生多个副本。正确做法是数据进入前确认来源、许可、个人信息和用途边界,使用固定受控入口,生成批次编号、哈希和接收清单。

2. 外包标注团队拿到完整数据集和完整标签体系

完成一批标注通常不需要同时看到全量语料、客户身份、完整业务规则和所有困难样本。任务应按批次、字段和人员切片,平台限制下载,屏幕水印到人,设置蜜罐样本,并抽查是否存在截图、个人设备和链式分包。

3. 数据分析人员通过BI或Notebook一次性导出全量训练样本

合法账号不等于可以任意导出。批量查询、Notebook下载和对象存储复制要设置审批、限额、字段最小化和异常告警,尤其关注夜间导出、离职前高频访问和跨项目数据合并。

4. 训练过程中,Checkpoint自动同步到个人设备或公共对象存储

自动保存和异地调试容易让权重绕开模型仓。训练脚本应把正式制品写入受控模型仓,个人终端仅允许临时受控缓存并到期清理;对象存储默认私有,公开配置、跨账号复制和快照导出纳入告警。

5. 工程师为排障把模型、日志和内部URL提交给公共在线工具

在线翻译、公共生成式AI、代码助手和文档插件可能改变数据流向。模型结构、客户数据、系统Prompt、接口密钥、内部URL和故障日志不得进入非受控平台;受控AI仍应审批、脱敏、最小输入并复核输出。

6. 评测集被复制到训练目录,或者随演示材料一起外发

评测集污染训练会破坏评估,也会扩大接触范围。训练、评测、红队和客户数据应分区分级,评测用例对外只提供结论或净化样例,不能把内部基准、评分口径和全部失败案例交给演示对象。

7. 红队报告在跨部门群中传播,完整绕过方法被大量人员看到

红队用例、提示注入链路和安全边界本身具有敏感性。客服、销售和运营通常只需要处置口径,不需要掌握完整绕过步骤。报告应按策略段分层,原始材料进入受控库,会议名单、屏幕和资料回收均留痕。

8. 论文、模型卡、技术博客或白皮书发布前,只检查了密钥和客户名称

即使没有明文密钥,训练配比、评测集构成、内部工具链、关键参数、失败结论和截图中的路径也可能使秘密性不可逆丧失。发布前应做内部版与公开版差分扫描,由技术、法务和保密共同审查,并保留净化映射。

9. 客户POC为了展示效果,直接接入真实生产数据和真实知识库

POC环境往往人员多、节奏快、权限临时。更稳妥的做法是使用沙箱、脱敏样本、虚拟客户标识和净化版Prompt;账号、接口和VDR设置期限,演示结束后关闭访问并验证数据、日志和模型副本处置。

10. API返回了系统Prompt、内部策略原因或过多调试信息

错误栈、调试字段和策略解释可能帮助外部还原内部逻辑。接口只返回业务必要信息,系统Prompt、内部特征、模型状态和风控原因不得外显;生产环境关闭冗余调试,异常调用与令牌、客户和模型版本关联。

11. SDK包内置长期有效密钥,或者第三方联调令牌项目结束后未吊销

临时令牌最容易变成长期入口。SDK不应内置高权限密钥,令牌按客户、用途和环境隔离,设置额度、来源白名单和到期;项目结束统一吊销,复核调用日志和第三方本地配置。

12. 私有化交付把完整模型权重、训练脚本和内部镜像一起交给客户

客户完成部署未必需要掌握全部训练资产。可根据合同提供编译制品、加密权重、必要配置和运维接口,保留内部训练管线;交付包哈希、指纹、许可证和接收清单应绑定具体客户和环境。

13. 云算力或第三方运维使用共享高权限账号,远程会话没有录屏

共享账号无法追责,长期权限会跨项目复用。云控制台和集群管理采用实名账号、MFA、JIT、工单绑定和堡垒机双录,高敏操作双人复核,项目结束撤销账号、证书、密钥和外部网络通道。

14. 代码仓为了协作允许个人fork、外部镜像或整库clone

个人仓库和外部镜像绕过企业日志和离职清退。按项目与密级分仓,关键分支强制评审和签名提交,限制整库clone、下载和外发;开源前清理历史提交、许可证和敏感依赖。

15. 核心员工离职时只关闭邮箱,没有审计模型仓、数据湖和云控制台

AI岗位通常跨系统接触数据、代码、权重和客户项目。离职当日应撤销代码仓、模型仓、对象存储、数据平台、实验平台、云控制台、KMS、VDR、API令牌和设备权限,并核查最近90日异常下载、克隆和外发。

16. 模型退役后,旧权重、备份和共享链接长期无人管理

旧版本可能包含仍可复用的能力、客户数据和缺陷信息。退役时触发期限复核,关闭接口和共享链接,撤销许可证和密钥,按同密级归档备份;确需销毁时生成删除、销毁和复核记录。

四、九个常见误区,会让AI商业秘密保护“看起来很严、实际有缺口”

误区一:认为只要保护模型权重,数据、评测和Prompt可以按普通资料处理。实际上,标签体系、失败样本、评测集、系统Prompt和RAG工作流能够暴露模型优化方向和业务逻辑,单独也可能具有高价值。

误区二:认为所有内部数据和代码统一设为最高密级最安全。过度定密会让普通资料与核心权重走同一流程,业务开始绕开审批,真正高价值对象反而缺少名单制、强审计和禁止外发等差异化控制。

误区三:认为第三方签署NDA后就可以整包交付。NDA建立义务,却不会自动限制任务切片、下载、二次分包、人员变更、数据删除和账号撤销,企业仍要履行自主保护责任。

误区四:认为云服务商平台安全,企业就不需要管理云账号。云平台提供基础能力,但根账号、MFA、VPC隔离、对象存储公开配置、KMS权限、日志和备份仍由企业配置,错误授权可能导致全域暴露。

误区五:认为API不交付权重,所以不存在商业秘密泄露。接口字段、调试信息、系统Prompt、内部策略和异常调用模式,可以让外部推导模型行为或实施模型抽取,API本身就是需要治理的信息出口。

误区六:认为开源审查等于扫描密钥。公开代码、模型卡、论文、白皮书和演示视频还可能暴露数据构成、评测集、关键参数、内部工具链、客户案例和失败结论,需要技术与法务联合差分审查。

误区七:认为企业版或本地AI工具可以不受限制使用。受控环境降低外部扩散风险,但仍需明确可输入对象、调用权限、日志、模型训练回流、跨部门访问和输出发布审查,不能以“内部部署”替代分级管理。

误区八:认为项目结束、模型下线或密钥轮换后,资料自动失去价值。旧权重、失败实验、历史评测、客户部署和运维日志可能继续降低外部试错成本,必须到期复核后再降密、解密或销毁。

误区九:发生异常后先删除账号、清空设备和要求人员说明。过早清理可能破坏日志、快照和传播路径。正确顺序是止血、封存、取证、评估、通报、处置、整改和复测。

五、从“模型资料”到商业秘密:识别、定密、分级和期限怎样落地

AI企业不宜使用“模型资料”“训练数据”“项目代码”作为笼统对象。更适合的名称是“某基础模型权重_v3.2”“某行业模型偏好数据集_v5”“某客户RAG知识库切片与重排规则”“某推理加速内核及量化配置”“某API风控策略包”。对象越具体,越容易说明边界、价值、知悉范围、系统位置和泄露后果。

定密应先核验三要件:信息是否不为公众普遍知悉,是否能够带来研发时间、算力成本、模型效果、客户收入或竞争优势,企业是否已经采取与价值相适应的制度、合同、权限、加密、水印、日志、门禁和清退措施。不满足三要件但仍不宜扩散的,可以转入内部敏感信息或数据分类分级管理,避免用高密级替代事实判断。

方案建议采用“触发临时控制—候选事项申报—公开检索—价值证明—保密措施核验—合规复核—定密初审—分级与期限建议—审批登记—系统联动与复核”的十步闭环。对拟开源、拟交付权重、拟上传外部工具、拟开放API或拟让第三方接触的高敏对象,实行先控后审。

保护级

典型AI对象

最低控制要求

期限建议

A / 核心

基础模型和关键微调权重、核心训练数据与评测集、关键对齐策略、推理加速内核、重大客户全量画像和决定性算力成本模型。

名单制、专库专域、强加密、MFA/JIT、原则禁止原件外发、双人审批、交付指纹、外部AI禁入、全量审计。

技术类可10—20年或长期滚动复核;重大变化即时复核。

B / 重要

关键微调数据、Adapter、红队用例、重要API策略、配置模板、客户部署方案、重要供应商条件。

岗位授权+关键名单制、受控外发、动态水印、关键操作审计、第三方最小接触、受控AI审批。

通常3—10年,或合同终止、替代版本稳定运行后一定期间。

C / 一般

一般接口说明、非关键运维文档、常规运营分析和普通项目方案。

基础访问控制、外发审批或登记、必要水印和定期复核。

按项目、版本或业务窗口设置1—5年等期限。

 

保密期限不宜统一。核心模型权重和推理内核可以长期并每三年复核;训练数据、评测集和标签体系可按版本冻结日设置5—10年或条件型期限;客户知识库、微调数据和私有化方案可设置合同终止后2—5年;开源材料在首次公开前受控,公开后仅未公开底稿继续管理;API密钥、证书和配置按失效或轮换条件处置。到期不等于自动解密,到期前应评估续期、降密、解密或转轨。

六、行业化实施方案应形成七个相互连接的闭环

• 治理闭环:保密委员会或数据与AI治理委员会统筹,保密办公室组织,AI商业秘密保护工作组专项推进,算法、数据、平台、安全、法务、产品、运维和业务部门一岗双责。

• 目录闭环:建立商业秘密事项、涉密人员、涉密系统/数据、涉密载体、第三方接触和对外披露清单,统一唯一编号、版本、密级、期限、责任人和状态。

• 研发闭环:在数据接收、标注、训练、Checkpoint、评测、红队、发布和退役节点触发定密、权限调整、外发门禁和到期复核。

• 系统闭环:数据湖、模型仓、代码仓、MLOps、对象存储、VDR、API网关、云控制台和日志平台的标签、权限、水印、DLP、AI禁入和期限字段与目录联动。

• 第三方闭环:外包标注、云算力、红队评测、插件供应商、联合开发和客户POC执行准入、合同、最小接触、审计、验收、撤权和删除验证。

• 证据闭环:围绕形成过程、秘密性、商业价值、保密措施、访问流转、对外披露和事件处置形成电子证据包,支持内审、客户审计和维权。

• 改进闭环:月度抽查、季度专项检查、年度内审、KPI/KRI、异常告警、演练和整改复测持续校准控制。

这些闭环不应成为七套孤立流程,而要嵌入模型立项、数据治理、实验管理、发布门禁、客户交付、采购合同、云资源申请、账号生命周期和离职清退。真正的验收标准不是文件数量,而是具体控制能否运行、日志能否调取、异常能否告警、第三方能否退出、证据能否对应到具体模型或数据版本。

七、AI全生命周期八类专项SOP怎样落地

1. 数据采集、购买与接收SOP

数据进入前完成来源、授权、个人信息、重要数据、跨境和合同限制审查;建立来源登记、批次编号、哈希和血缘;原始数据分区存储,禁止个人设备采集和临时网盘中转。接收清单、脱敏说明、导入日志和合规意见共同进入证据包。

2. 外包标注与数据加工SOP

准入前评估第三方接触面,任务按批次、字段和角色切片,外包人员只见必要片段;受控标注平台限制下载和复制,屏幕水印、日志、下载限额和蜜罐样本同步启用。交付后抽检夹带原始数据,项目结束撤权并验证删除。

3. 训练、微调、蒸馏与实验SOP

训练任务立项时识别数据、脚本、超参、Checkpoint和失败实验;实验追踪平台绑定数据版本、代码提交、责任人和资源记录;高敏任务独立空间、JIT授权和KMS加密;正式权重统一入仓,个人设备和公共存储不得长期缓存。

4. 评测、对齐、安全红队与发布准入SOP

训练集、评测集和红队集分离;红队用例和对齐策略按策略段分段可见;模型发布前形成评测记录、风险审查、回退方案和批准门禁。对外仅披露必要指标和净化用例,不公开内部绕过方法、奖励模型和完整安全边界。

5. 推理部署、API/SDK与线上运行SOP

推理镜像签名,密钥运行时注入;API字段最小化,签名、限流、白名单和可撤销令牌成为默认;监测提示注入、批量探测、模型抽取和异常地理位置;调用日志、异常工单、策略变更和版本回退能够关联。

6. 客户POC与私有化交付SOP

合作前签署NDA并明确客户数据、模型制品和日志回流边界;POC使用沙箱、脱敏数据和净化版Prompt;交付包水印、哈希或指纹绑定接收方,VDR分层授权,到期撤权。客户环境远程支持使用白名单、工单和会话双录。

7. 开源、论文、博客与公开演示SOP

拟公开对象先实施临时控制,开展secret扫描、许可证扫描、SBOM、仓库历史清理和内部/公开版本差分;技术、法务、保密联合审查训练数据、评测集、Prompt、客户信息、内部工具链和关键参数,保留批准记录和发布截图。

8. 持续迭代、退役、归档与销毁SOP

模型版本、数据集、接口和客户环境退役时触发期限复核;关闭共享链接和许可证,撤销账号、令牌和外部网络,验证第三方删除;历史权重、日志和备份按同密级加密归档。销毁需形成对象、范围、方式、见证和复核记录。

八、数据湖、模型仓、代码仓、MLOps和API网关如何与商业秘密目录联动

系统/平台

重点保护对象

最低落地要求

数据湖/数据仓/样本库

训练数据、评测集、标签、客户数据、血缘和清洗规则。

分区分级、字段最小化、导出审批、限额、水印/蜜罐、血缘记录和异常下载告警。

模型仓/制品库

权重、Checkpoint、Adapter、蒸馏模型、策略包、镜像。

专库专域、加密、白名单、MFA/JIT、下载双人审批、哈希签名和交付指纹。

代码仓/配置仓

训练脚本、推理内核、Prompt配置、部署脚本、密钥路径。

分仓分支、强制评审、签名提交、secret/许可证扫描、限制fork和个人镜像。

MLOps/实验平台

数据版本、实验参数、任务调度、评测、发布和回退。

项目空间隔离、任务审批、版本冻结、操作日志、发布门禁和回退留痕。

云控制台/算力集群

GPU资源、VPC、对象存储、KMS/HSM、网络和备份。

实名账号、MFA、JIT、根账号封存、独立VPC、堡垒机双录、WORM日志和恢复演练。

API网关/SDK平台

接口字段、签名、限流、令牌、系统Prompt、调用日志。

最小字段、来源白名单、可撤销令牌、速率限制、异常调用检测和客户退出撤权。

VDR/受控协作平台

客户POC、尽调、私有化方案、合同和净化材料。

分层授权、动态水印、下载限制、到期关闭、披露清单和回收/删除确认。

日志/SIEM/WORM

访问、下载、克隆、导出、外发、云操作和远程会话。

集中审计、不可篡改、检索导出、权限分离和事件证据封存。

 

目录字段至少包括唯一编号、对象名称、版本、类别、密级、期限、责任人、知悉范围、系统位置、外发策略、AI禁入、水印/指纹、日志要求和证据包位置。身份与权限采用RBAC/ABAC,并可结合项目、设备、网络位置、时间窗口和审批状态;A/B级对象的访问、下载、导出和外发必须从系统中留下可核验记录。

生成式AI与外部在线工具要进入同一控制体系。机密及以上对象不得输入非受控平台;一般商业秘密也只能在完成脱敏、必要性判断和审批后使用。受控AI环境应记录模型、用户、输入类别、调用时间和输出用途,并明确输入是否用于二次训练、日志保存多久以及谁可审计。

九、第三方治理:从“签约”延伸到“准入、运行、退出和删除验证”

等级

典型第三方

最低控制

高风险

接触核心样本、未公开模型、权重、训练环境或核心代码的标注团队、红队机构、云算力和联合开发方。

尽调+NDA+安全/环境审查+人员承诺+最小权限+双人审批;至少每6个月复核,结束即撤权和删除验证。

中风险

一般数据加工、客户POC支持、受控运维、SDK联调、第三方插件。

简版尽调+NDA+受控外发+账号/令牌台账+日志;至少每12个月复核,到期回收资料。

低风险

仅接触公开或净化版资料的一般服务支持。

边界告知、保密提示和最小访问;按合同周期关闭临时权限。

 

合同至少明确用途限定、对象范围、人员和系统、时间窗口、禁止转披露与链式分包、安全措施、成果与衍生数据权属、禁止逆向和二次训练、返还/删除/销毁、企业抽查权、违约责任和证据保全配合。外包标注结果、评测报告、脚本、工具和微调成果的归属也应写清。

退出清退不能只发送一封“项目结束”邮件。企业要吊销账号、证书和令牌,关闭VDR与共享链接,回收资料和设备,验证云桶、标注平台、个人终端和备份副本的删除,抽检水印或蜜罐命中情况,并把退出清单、删除证明和复核结果归档。无法直接验证的,应通过平台日志、远程见证、第三方声明和风险处置形成替代证据。

十、人员、区域、会议和协作工具:让最小知悉真正落实到日常工作

基础模型负责人、核心算法科学家、训练平台负责人、数据治理负责人、模型安全负责人和核心客户私有化架构师,通常属于核心涉密岗位,应实施名单制授权、专项协议、年度培训、利益冲突审查和离职前异常访问审计。数据工程、MLOps、评测红队、运维、产品和售前交付等重要岗位按项目授权,转岗或项目结束及时撤权。

模型评审、红队复盘、重大客户POC、投融资和开源审查会议按内容分级,实行参会名单、材料编号、动态水印、终端与拍摄管理、会后回收和纪要定密。核心研发区、数据处理区和算力控制区设置分级门禁,访客预约、审批、陪同和禁拍;电子载体、打印、扫描和截屏按对象密级管理。

公共网盘、个人邮箱、公共IM、未授权AI工具和外部代码仓默认不得处理受控对象。受控协作平台要能够设置人员、对象、用途、期限、下载和水印,并保存操作日志。跨境协作、远程办公和客户现场支持还应同步完成数据、个人信息和合同合规审查。

十一、发生疑似泄密后,先止血和固定证据,再讨论责任

步骤

关键动作

AI行业重点证据

发现

模型异常下载、数据整包导出、云桶公开、API异常探测、公共仓库命中、第三方逾期留存等及时报告。

告警、邮件/IM、仓库记录、云日志、人员报告。

止血

冻结相关账号、令牌和外发通道,暂停模型下载、接口调用、VDR和第三方访问,保护业务连续性。

冻结工单、策略变更、应急授权和影响范围。

封存与取证

保全模型哈希、数据版本、代码提交、终端快照、云控制台、API、堡垒机、VDR和门禁记录。

哈希、时间戳、WORM日志、录屏、快照和交接记录。

评估

确认具体秘密对象、三要件、传播范围、接收方、客户/合规影响和可追回程度。

对象边界、价值材料、权限矩阵、披露清单。

处置

内部问责、合同追责、通知客户或合作方,必要时启动行政、民事或刑事维权。

决策记录、律师意见、通知和证据保全。

整改复测

修复权限、接口、流程和第三方控制,复测数据导出、模型下载、API异常和撤权。

整改台账、复测报告、管理评审和关闭证明。

 

证据包至少覆盖形成过程、秘密性、商业价值、保密措施、访问流转和事件线索。AI行业特别需要保留数据来源与血缘、训练任务、代码提交、实验记录、模型哈希、评测版本、KMS日志、模型下载、API调用、云控制台、VDR访问、外包标注操作、发布审查和离职清退。只有这些记录能够对应到具体对象和版本,后续内审、客户审计与维权才有基础。

十二、30—60—90日及年度路线:先关闭P0信息出口,再完成体系化建设

阶段

主题

重点任务

主要产出

0—30日

止血与建账

成立AI商业秘密保护工作组;盘点训练数据、模型权重、评测集、代码仓、外部协作和云算力;冻结高风险外发;发布临时AI工具禁入。

P0资产清单、RACI、临时控制、外发门禁、开源审查、第三方账号清理。

31—60日

制度与系统联动

批量完成定密、分级和期限;配置数据湖、模型仓、代码仓、VDR、云控制台和API网关标签;补强第三方条款。

商密目录、权限矩阵、期限台账、第三方准入、POC与发布SOP。

61—90日

复测与运行验证

测试数据导出、权重下载、水印溯源、API异常、离职撤权、第三方删除和开源发布;开展培训与演练。

复测报告、培训记录、演练报告、整改闭环、KPI/KRI看板。

91—180日

扩面与固化

从核心模型试点扩展到产品线、客户交付和一般数据资产;完善自动化DLP、UEBA、模型指纹和供应链安全。

制度发布、系统配置证据、扩面清单、技术策略验收。

年度

内审与持续改进

目录复核、密级和期限校准、第三方复评、技术策略更新、事件案例复盘和管理评审。

年度内审、管理评审、改进计划、制度修订和证据抽样。

 

没有一次性部署全部安全工具的企业也可以启动。受控目录、人工审批、专用账号、MFA、限时链接、纸质或动态水印、模型哈希、第三方名单、会议回收和删除确认,都可以形成首期措施。关键是先覆盖P0对象,有明确责任人,有运行记录,能够抽查和复测。

首批试点可选择“核心训练数据+模型权重”“外包标注+评测红队”“客户POC+API接口”“云算力+MLOps高权限”四类组合。这些场景同时覆盖模型、数据、代码、算力和第三方,跑通后最容易复制到其他产品线。

十三、正式实施项目应交付哪些成果,怎样验收

交付域

主要成果

验收关注点

组织治理

方针目标、组织任命、RACI、AI专项工作组、例会和重大事项审查机制。

职责无空档,P0事项可上报、决策和闭环。

资产目录

数据、标签、评测、权重、Prompt/RAG、代码、算力、API、客户方案清单。

对象边界、版本、密级、期限、责任人、系统位置完整。

制度与SOP

定密分级、期限、外发、AI工具、第三方、开源、POC、账号、事件和离职清退。

流程可执行,表单、审批和责任节点清楚。

系统与技术

数据湖、模型仓、代码仓、MLOps、云控制台、API网关、VDR和日志控制。

标签、权限、水印、哈希、日志和告警有测试样本。

第三方治理

准入评估、NDA/合同条款、权限台账、任务切片、删除验证和复评。

高风险第三方均能定位接触对象、人员、账号和退出证据。

证据与培训

三要件证据包、发布审查、外发记录、培训考试、事件演练和整改复测。

抽样可调取、可回放、可对应具体对象。

验收报告

测试用例、结果、残余风险、问题分级、整改闭环和管理评审。

重大不符合项为0,一般问题有责任人与期限。

 

可量化指标包括P0对象目录覆盖率、A/B级权重哈希签名覆盖率、外发审批合规率、离职当日撤权率、第三方账号逾期数、公共仓库敏感命中、API异常调用、模型权重异常下载和整改闭环率。最终验收前,应至少完成一次数据导出、模型下载、开源发布、API调用、离职撤权和第三方删除验证的场景复测。

十四、哪些人工智能企业最值得优先启动行业化方案

正在研发基础模型或行业模型、拥有独有训练数据和标签体系、模型权重商业化价值高、客户私有化交付多、外包标注与红队评测频繁、依赖云算力和第三方插件、开放API/SDK、准备开源或发布论文白皮书的企业,应优先建立行业化商业秘密保护体系。

曾发生权重误传、公共仓库命中、云桶公开、数据整包导出、公共AI输入、接口异常探测、外包人员超范围访问、第三方账号长期有效或离职异常下载的企业,更不应把问题归结为个人疏忽。这些现象通常意味着目录、权限、第三方、发布和证据之间存在系统性断点。

中小型AI团队可以先抓六项:P0对象清单、模型仓集中、数据导出审批、API令牌到期、外包任务切片和离职撤权。大型集团则应统一A/B/C保护级、目录字段、系统标签和第三方准入,再由各模型、产品线和研发中心细化。

十五、实施后,企业应出现八类可验证变化

• 训练数据、评测集、模型权重、Prompt/RAG、代码、算力和API不再用“模型资料”笼统描述,而是有具体编号、版本、责任人、期限和系统位置。

• Checkpoint和交付模型统一进入模型仓,下载、导出、哈希、签名、指纹和接收方均可追溯。

• 外包标注和红队评测只接触任务必要切片,账号到期、日志抽查和删除验证成为项目退出标准。

• 开源、论文、白皮书、模型卡和演示材料区分内部原件、净化版和公开版,并保存差分审查记录。

• 云控制台、MLOps、KMS和对象存储的高权限账号实名、MFA、JIT、双录和到期回收。

• API/SDK字段、令牌、限流、白名单和异常调用能够关联客户、用途、模型版本和处置工单。

• 员工知道哪些数据、代码、权重、Prompt、客户信息和日志不得进入公共AI、个人网盘和外部仓库。

• 发生异常下载、接口探测或第三方留存时,企业能够快速止血、定位对象、固定证据、整改并复测。

这些变化不会必然拖慢AI研发。边界清楚以后,数据团队知道哪些字段可以加工,算法团队知道权重存到哪里,平台团队知道哪些操作需要审批,销售和交付知道客户能看到哪一版,第三方知道何时撤权和删除。临时争论和过度共享会减少,研发与商业化反而更稳定。

十六、保密网如何协助人工智能企业落地

北京天正合商业秘密保护咨询服务中心与北京企密安信息安全技术有限公司,可依托保密网为人工智能企业提供商业秘密保护评估、密源识别、定密分级、保密期限、制度SOP、数据/模型/代码/算力/API专项控制、第三方与外包治理、AI工具使用规则、开源发布审查、人员培训、复测与验收等服务。

行业实施不是出售一份通用模板,而是把企业现有模型类型、数据来源、云/本地算力、代码与模型仓、客户交付、外包标注、第三方评测、API和开源计划映射到具体对象和控制点。项目可采用“评估—方案—试点—实施—培训—复测—验收”的路径,先关闭最危险的信息出口,再逐步扩展到全业务链。

十七、人工智能(模型 / 数据 / 算力)行业商业秘密保护常见问题

1. 模型权重一定属于商业秘密吗?

不一定自动构成。需要核验其是否不为公众所知悉、是否具有商业价值、企业是否已采取相应保密措施。公开模型原始权重可能不具秘密性,但企业独有微调权重、蒸馏模型、策略包和内部增量通常需要重点审查。

2. 公开数据加工形成的训练集还能保护吗?

可能。公开来源不等于企业的选择、清洗、去重、组合、标签、版本、质量分层和调用方式已经公开。应对加工后的对象边界和组合价值进行独立判断。

3. 为什么评测集和失败样本也要保密?

评测集暴露模型优化方向和安全边界,失败样本与实验路径能够帮助外部避开错误、节省算力和时间,因此可能具有明显商业价值。

4. 外包标注团队必须看到数据,怎样实现最小知悉?

按批次、字段、角色和期限切片,去标识或代码化客户信息,使用只读标注平台、水印、下载限制和日志;把完整标签规则、全量数据和所有困难样本分开管理。

5. 不交付模型权重,只开放API,还需要商密保护吗?

需要。接口字段、系统Prompt、内部策略、错误信息和调用模式可能被用于推导模型行为或模型抽取,应实施最小字段、签名、限流、白名单、异常检测和令牌到期。

6. 企业版生成式AI能否处理内部代码和数据?

应按企业批准的模型、部署、训练回流、日志和权限条件判断。受控环境降低外部风险,但仍需分级、必要性、脱敏、审批和输出复核;A/B级对象通常需要更高审批或禁止输入。

7. 开源发布前最重要的审查是什么?

不仅扫描密钥,还要对内部版本和公开版本做差分,检查训练数据、评测集、Prompt、关键参数、客户信息、内部工具链、仓库历史和许可证义务,并形成技术、法务和保密联合批准。

8. 云算力供应商签了合同,为什么还要管账号和日志?

合同不能替代技术边界。企业仍需实名账号、MFA、JIT、网络隔离、KMS/HSM、堡垒机双录、WORM日志、备份加密和退出撤权,以证明实际采取了保密措施。

9. 没有DLP、UEBA和模型指纹,能否先启动?

可以。先用受控目录、模型仓、人工审批、MFA、限时链接、哈希、水印、第三方名单、发布审查和清退确认覆盖P0对象,再按风险逐步引入自动化工具。

10. 发现权重异常下载或云桶公开,第一步做什么?

先冻结相关账号、令牌和共享,暂停模型下载与第三方访问,保全模型哈希、云日志、终端、代码仓、API、邮件和IM记录,确认具体对象和扩散范围,再决定调查、通知、合同追责和维权。

结语:AI企业真正要保护的,是模型能力背后的组合知识

基础模型可以开源,论文可以公开,API可以对外,客户也需要交付,但数据如何选择、标签如何定义、模型如何训练、评测如何设计、Prompt与知识如何编排、推理如何加速、算力如何调度、接口如何运行和客户问题如何解决,仍然是企业长期投入形成的组合知识。

成熟的商业秘密保护不是让所有人都“看不到”,也不是把所有对象都设为最高密级,而是让每个人为了明确任务看到最小必要内容,让每个数据集、权重、仓库、账号、令牌、交付包和公开版本都有边界、有期限、有记录、可撤销。

当定密、权限、模型仓、数据治理、云算力、API、开源审查、第三方和证据链真正进入研发与交付流程后,商业秘密保护就不再只是泄密后的追责工具,而会成为守住研发投入、模型能力、算力成本、客户信任和商业化节奏的日常经营能力。

合规提示:本文用于人工智能(模型 / 数据 / 算力)行业商业秘密保护科普和服务介绍,不替代国家秘密、重要数据、个人信息、数据出境、出口管制、算法备案、网络安全等级保护、开源许可或具体法律意见。涉及专项事项时,应按适用规则另行履行程序。

咨询与项目对接

项目

信息

服务主体

北京企密安信息安全技术有限公司 / 北京天正合商业秘密保护咨询服务中心

服务内容

商业秘密保护评估、行业方案本地化、密源识别、定密分级、保密期限、制度SOP、数据/模型/代码/算力/API控制、第三方治理、培训、复测与验收

官方网站

www.baomiwang.com

业务专线

010-63711822 / 13718605588

服务邮箱

baomi@baomiwang.com