版权与内容来源声明本文为原创整理。文中涉及官方文档、开源仓库、论文与公开报道的内容均在附表 A 中标注来源引用官方原文保持原样不作改写。文中命令、版本号与界面截图以本文成文时的实测/核验结果为准标注「待验证」的部分请以你本地环境实际输出为判断依据。本文不推荐任何不合规的软件获取方式也不对任何收益结果作承诺。转载请注明出处。第1章 卡住事业单位用大模型的往往不是技术是数据事业单位、学校的信息中心、图书馆等公共文化机构以及承担后勤和业务支撑的骨干这两年都在琢磨同一件事能不能让大模型帮着处理日常文档、答疑、写材料。想法很朴素落地却常卡在一个地方——数据不能随便往外送。这种卡顿表面看是网络或采购问题根子上是数据边界没理清。很多单位一上来就纠结「用哪个模型」「要不要上公有云」但真正该先回答的问题是我要喂给模型的那批数据分别属于哪一档哪些能出内网哪些只能在内网转哪些必须先把人去掉本篇不谈「模型进不了公网怎么办」那种纯网络题也不泛泛讲隐私政策而是把焦点放在一个具体动作上数据分级。先把数据按「能不能出内网、能不能给外部接口、必须脱敏到什么程度」分成几档再谈方案怎么选。分级做对了后面的选型和部署才有依据。第2章 为什么必须先分级法律对数据的要求不是一刀切为什么非得先分级而不是直接挑模型因为法律对数据的要求不是一刀切。《中华人民共和国数据安全法》第二十一条写明国家建立数据分类分级保护制度根据数据在经济社会发展中的重要程度以及一旦遭到篡改、破坏、泄露或者非法获取、非法利用对国家安全、公共利益或者个人、组织合法权益造成的危害程度对数据实行分类分级保护。国家数据安全工作协调机制统筹协调有关部门制定重要数据目录加强对重要数据的保护。关系国家安全、国民经济命脉、重要民生、重大公共利益等数据属于国家核心数据实行更加严格的管理制度。各地区、各部门应当按照数据分类分级保护制度确定本地区、本部门以及相关行业、领域的重要数据具体目录对列入目录的数据进行重点保护。这里先解释一个术语「分类分级」是指先把数据按业务属性归类再按重要程度和危害程度分档管理二者合起来构成一套可执行的保护规则。同法第二十七条第二款进一步要求重要数据的处理者应当明确数据安全负责人和管理机构落实数据安全保护责任。这对技术方案意味着什么意味着「我的数据里有重要数据」不是一句口头判断而需要落到负责人、管理机构、保护责任上。而要让保护责任可落地第一步就是把数据分成可执行的档位哪类能出、哪类不能出、哪类脱敏后能出。不先分级后面的模型选型、部署位置、接口设计都没有判断基准。需要提醒本文只做条文原话的转述与技术含义说明不构成法律意见。某条数据是否属于「重要数据」「核心数据」以本单位合规或法务口径以及主管部门发布的具体目录为准。第3章 一张能落地的四档分档表下面给一张能落地的四档分档表。分档的逻辑只围绕三个问题能不能出内网、能不能给外部接口、必须脱敏到什么程度。表1四档数据分档表档位名称能否出内网能否给外部接口建议处理方式一档可公开能能可直接用于训练或调用仍须确认来源合法二档内部可用限内网不能本地部署或内网服务不对外开放接口三档脱敏后可用脱敏后能脱敏后能字段级脱敏后再调用外部接口四档严禁出内网不能不能仅人工处理模型不得接触原文逐档说明一档 可公开指对外发布的内容比如公开公告、脱敏后的统计数据、公开的规章制度。这类数据可以直接进模型但来源仍要合法不能拿到来路不明的材料当训练语料。二档 内部可用指仅在单位内部流转、不涉敏感个人信息的业务文档比如内部办事流程、非涉密的工作总结。它能在内网里用但不能直接甩给外部接口。三档 脱敏后可用指本身带个人字段但把标识去掉后仍可用于分析或调用的数据比如带姓名和手机号的工单记录。处理方式是先做字段级脱敏再决定是否调用外部接口。四档 严禁出内网指涉密内容、核心数据以及未经脱敏的敏感个人信息。这类只能由人来处理模型连原文都不能碰。为什么要单列敏感个人信息《中华人民共和国个人信息保护法》第二十八条给出定义敏感个人信息是一旦泄露或者非法使用容易导致自然人的人格尊严受到侵害或者人身、财产安全受到危害的个人信息包括生物识别、宗教信仰、特定身份、医疗健康、金融账户、行踪轨迹等信息以及不满十四周岁未成年人的个人信息。只有在具有特定的目的和充分的必要性并采取严格保护措施的情形下个人信息处理者方可处理敏感个人信息。同法第二十九条补充处理敏感个人信息应当取得个人的单独同意法律、行政法规规定处理敏感个人信息应当取得书面同意的从其规定。「单独同意」是指针对敏感个人信息这件事专门取得的授权不能混在笼统的用户协议里一笔带过。再说一个常被误读的点。《生成式人工智能服务管理暂行办法》第二条第二款写明行业组织、企业、教育和科研机构、公共文化机构、有关专业机构等研发、应用生成式人工智能技术未向境内公众提供生成式人工智能服务的不适用本办法的规定。这一条要准确限定它说的是「不适用本办法」并不代表不受其他法律约束。数据安全法、个人信息保护法、网络安全法等对该类内部研发与处理活动仍然适用。不能把它读成「内网自用就没有合规义务」。第4章 方案选型本地部署、内网服务、脱敏后调用、只能人工——怎么对上号分好档下一步是把档位对到具体方案上。常见四类方案分别吃什么档表2四档到方案的映射档位对应方案说明一档本地或云端均可注意训练与调用数据的来源合法二档本地部署 / 内网服务数据不离开单位可控环境三档脱敏后调外部接口先脱敏再对外调用四档只能人工模型不接触原文由人完成逐个解释术语和适用边界本地部署指把模型跑在单位自己的机房或服务器上数据和推理都不离开自有环境。内网服务指模型部署在隔离的内网里只有内网可达外部网络碰不到。两者都服务于「数据不出可控范围」这个目标区别在暴露面大小。脱敏指把能指向具体个人的字段做替换或遮蔽让单条记录难以直接认出是谁。单独同意前面提过是针对敏感个人信息的专门授权。《生成式人工智能服务管理暂行办法》第六条提到推动公共数据分类分级有序开放并鼓励采用安全可信的芯片、软件、工具、算力和数据资源。原文节选推动公共数据分类分级有序开放扩展高质量的公共训练数据资源。鼓励采用安全可信的芯片、软件、工具、算力和数据资源。「公共数据」在这里指由公共管理和服务机构在履职中采集、产生的数据其开放利用须按分类分级规则有序进行。同办法第七条对「提供者」的训练数据处理活动提出要求原文生成式人工智能服务提供者以下称提供者应当依法开展预训练、优化训练等训练数据处理活动遵守以下规定一使用具有合法来源的数据和基础模型二涉及知识产权的不得侵害他人依法享有的知识产权三涉及个人信息的应当取得个人同意或者符合法律、行政法规规定的其他情形四采取有效措施提高训练数据质量增强训练数据的真实性、准确性、客观性、多样性五《中华人民共和国网络安全法》、《中华人民共和国数据安全法》、《中华人民共和国个人信息保护法》等法律、行政法规的其他有关规定和有关主管部门的相关监管要求。同办法第八条对数据标注提出要求在生成式人工智能技术研发过程中进行数据标注的提供者应当制定符合本办法要求的清晰、具体、可操作的标注规则开展数据标注质量评估抽样核验标注内容的准确性对标注人员进行必要培训提升尊法守法意识监督指导标注人员规范开展标注工作。需要说明第七条、第八条直接约束的是「向境内公众提供服务的提供者」。对未向公众提供服务的内部研发直接适用尺度以本单位合规口径为准但「使用合法来源数据」「涉及个人信息须有同意或法定情形」「提升训练数据质量」这些要求在内部场景同样是稳妥的做法不应因为「不适用本办法」就整体忽略。此外《中华人民共和国个人信息保护法》第三十六条规定了国家机关场景的存储与出境要求事业单位可类比参考但适用范围要写清国家机关处理的个人信息应当在中华人民共和国境内存储确需向境外提供的应当进行安全评估。安全评估可以要求有关部门提供支持与协助。这一条主语是「国家机关」事业单位是否直接适用须看具体性质与合规口径这里只作类比参考不作法律意见。第5章 一个可操作的最小流程上面是原则下面给一个能照着做的最小流程。表3最小流程步骤步骤动作产出1 盘点列出要进模型的数据资产与字段数据清单2 分档按表1给每个字段定档字段档位表3 处理按档位选择本地/内网/脱敏/人工处理方案4 调用脱敏后的记录方可调外部接口脱敏数据5 留痕记录谁、何时、按哪档处理复核记录下面用两段 Python 示意「字段级分档 脱敏后送外部接口」。代码仅为可读的伪代码未在本机实际运行。⚠️代码待验证 字段级分档 脱敏后送外部接口伪代码仅示意 字段分档tier 1~4 对应四档 脱敏后的记录方可调用外部接口 fromtypingimportDict FIELD_TIERS:Dict[str,int]{公开公告:1,内部制度:2,姓名:3,手机号:3,身份证号:3,涉密文号:4,}defmask_phone(value:str)-str:returnvalue[:3]****value[-4:]defmask_id(value:str)-str:returnvalue[:6]**********value[-4:]defprepare_record(record:Dict[str,str])-Dict[str,str]:out{}forfield,valueinrecord.items():tierFIELD_TIERS.get(field,4)iftier4:raiseValueError(四档字段不得离开内网转人工处理)iftier3:if手机infield:valuemask_phone(value)elif身份证infield:valuemask_id(value)else:value***out[field]valuereturnout再给一段正则脱敏手机号与身份证号的片段同样未实际运行。⚠️代码待验证importre phone_rere.compile(r(\d{3})\d{4}(\d{4}))id_rere.compile(r(\d{6})\d{8}(\d{4}))text联系人张三手机13812345678身份证110101199001011234textphone_re.sub(r\1****\2,text)textid_re.sub(r\1********\2,text)print(text)Anthropic 在工程实践文档里有一句值得记的话「When building applications with LLMs, we recommend finding the simplest solution possible, and only increasing complexity when needed.」对应到本文就是先分级、先最小可行流程别一上来就上复杂架构。这份资料是什么本章用到的字段分档与脱敏最小流程示例放在资料包里扫码即可获取第6章 三个容易搞错的地方落地时最容易踩三个坑逐个说清。第一未向公众提供服务不等于没有合规义务。前面引过的《生成式人工智能服务管理暂行办法》第二条第二款说的是「不适用本办法」不是「不受任何法律约束」。数据安全法、个人信息保护法、网络安全法对该类内部处理活动仍然适用。把这条读成「内网自用就随便搞」是常见的误读。第二脱敏不等于匿名。把姓名换成编号、把手机号中间打星并不自动等于匿名化。能否重新识别到具体个人要单独评估如果结合其他字段仍能定位到某人那它还是个人信息不是匿名数据。这里只做提醒不展开法条解释具体判定以合规口径为准。第三涉及敏感个人信息要单独同意。前面引的《中华人民共和国个人信息保护法》第二十九条写明处理敏感个人信息应当取得个人的单独同意。这意味着在把含敏感字段的数据送进任何模型流程前先确认授权是否到位而不是默认「内部使用就无需同意」。第7章 上线前的数据检查清单最后给一份上线前的数据检查清单。事业单位场景下人工复核这一步省不掉。表4上线前数据检查清单检查项要点是否完成数据盘点列出全部要进模型的数据与字段□字段分档每个字段按表1定档□重要数据是否落入重要数据/核心数据目录□敏感信息是否含敏感个人信息单独同意是否到位□脱敏规则三档字段脱敏是否可重新识别评估□部署位置二档以上是否留在本地/内网□人工复核四档及关键字段是否经人工确认□留痕处理记录是否可追溯□几个强调点分档不是一次性动作数据来源变化后要重评脱敏的可识别性要单独评估不能只看「打了星」四档数据和关键字段必须有人工复核签字或记录模型不能替人做最终判断。这份资料是什么本章的上线前数据检查清单模板放在资料包里扫码即可获取附表 A本文引用事实与出处对照表编号事实出处本文位置1《数据安全法》第二十一条国家建立数据分类分级保护制度按重要程度与危害程度实行分类分级保护制定重要数据目录并重点保护全国人大法律法规数据库 https://wb.flk.npc.gov.cn/flfg/PDF/8a19eb7aaa1e463cb21ff7cc2bac99d1.pdf第2章2《数据安全法》第二十七条第二款重要数据处理者应当明确负责人和管理机构落实保护责任同上第2章3《生成式人工智能服务管理暂行办法》第七条提供者训练数据处理须合法来源、涉知识产权不侵权、涉个人信息取得同意等中国政府网 https://www.gov.cn/zhengce/zhengceku/202307/content_6891752.htm七部门令第15号2023-07-10公布2023-08-15施行第4章4同办法第八条数据标注须有清晰可操作规则、质量评估、人员培训同上第4章5同办法第二条第二款未向境内公众提供生成式人工智能服务的研发应用不适用本办法不代表不受其他法律约束同上第3章、第6章6同办法第六条推动公共数据分类分级有序开放鼓励安全可信算力与数据资源同上第4章7《个人信息保护法》第二十八条敏感个人信息定义及处理前提《中华人民共和国个人信息保护法》原文核验于 2026-09-26官方发布文本 URL 待验证第3章8同法第二十九条处理敏感个人信息应取得单独同意同上第3章、第6章9同法第三十六条国家机关处理的个人信息应在境内存储出境须安全评估事业单位类比参考同上第4章10Anthropic 工程文档构建 LLM 应用时先用最简单方案必要时才增加复杂度https://www.anthropic.com/engineering/building-effective-agents核验 2026-09-26第5章注事实 7、8、9 与事实 1、2 同属经核验法条引用时保持原样个保法官方发布文本 URL 标注待验证请以你本地查询到的官方文本为准。附表 B术语速查表术语一句话解释分类分级先按业务属性归类再按重要程度与危害程度分档管理形成可执行的保护规则脱敏把能指向具体个人的字段替换或遮蔽降低单条记录被直接识别的风险本地部署把模型跑在单位自己的机房或服务器上数据与推理不离开自有环境内网服务模型部署在隔离内网中仅内网可达外部网络无法访问单独同意针对敏感个人信息这件事专门取得的授权不能混在笼统协议里匿名化 / 可识别性脱敏不代表匿名能否重新识别到个人要单独评估公共数据公共管理和服务机构在履职中采集、产生的数据开放须按分类分级有序进行重要数据 / 核心数据一旦遭危害会影响国家安全、公共利益等的数据须重点或更加严格保护敏感个人信息泄露或非法使用易侵害人格尊严或人身财产安全的个人信息如生物识别、医疗健康等训练数据 / 数据标注用于预训练与优化的数据标注是为训练打标的过程须有规则与质量评估写在最后这篇用到的资料写这篇文章时把数据合规那几部法律的原文又逐条对了一遍顺手也整理了几份配套的东西大模型学习路线图从零基础到能自己动手做 Agent按阶段说明每一步该学什么、哪些可以先跳过《LangChain LangGraph MCP 智能体开发实战》视频课7 个模块从私有化部署、EmbeddingRAG 到 MCPAgent 全流程AI 大模型知识库在线可查Agent Skills 从入门到落地、Claude Skills 完全指南等专题按目录浏览即可640 套 AI 大模型行业报告 经典 PDF 书籍看行业落地案例和别人怎么做的时候用得上大模型零基础到精通教学视频跟着敲一遍比只读文档快得多资料是我自己整理的放在下面这个码上扫码即可获取添加时备注「AI」优先通过。资料按「先路线、再动手、最后查漏」的顺序整理好了建议先看学习路线那一份照着它挑一条适合自己当前基础的路径再往下看。