结论先行:AI 预测毒理学已经能在皮肤致敏、急性经皮毒性等终点上做出接近传统试验水平的判断,但目前在中国《化妆品安全评估技术导则》框架下,它只能作为证据权重中的补充材料,不能单独替代毒理学试验或权威机构已公布的评估结论,也不构成《化妆品安全技术规范》认可的检验报告。企业真正能落地的是三件事:原料初筛、交叉参照的类似物论证、以及数据缺口的风险排序。

一、这篇综述的来源与范围

2025 年 7 月,意大利 IDI-IRCCS 皮肤病研究医院与罗马"智慧大学"(Sapienza)皮肤科团队在 MDPI 期刊《Cosmetics》发表综述《Artificial Intelligence in Cosmetic Formulation: Predictive Modeling for Safety, Tolerability, and Regulatory Perspectives》(Cosmetics 2025, 12, 157,2025 年 7 月 24 日上线)。作者检索 PubMed 与 SCOPUS,按 PICO 框架(研究对象为化妆品、干预为 AI 工具、对照为其他开发策略、结局为 AI 在化妆品领域的主要应用)进行叙述性综述,覆盖表面活性剂、聚合物、香精、防腐剂、抗氧化剂、益生元六大原料类别,以及质地感官、稳定性、皮肤致敏与急性经皮毒性等预测场景。

值得注意的是,这篇综述并不只是讲"AI 能做什么"。它同时用了一整节讨论伦理与立法挑战,并明确指出:欧盟委员会与美国 FDA 已在探索毒理学 in silico 模型的验证与标准化,但针对化妆品领域 AI 预测模型,官方指引仍然缺失。这句话放到中国语境下同样成立,而且是本文要展开的核心。

二、四类机器学习范式在化妆品科学中的分工

范式核心逻辑典型算法化妆品应用主要局限
监督学习用带标签数据(结构加已知结果)训练预测关系支持向量机、决策树、回归、随机森林毒性、溶解度、配方稳定性、功效预测依赖大量高质量标注数据
无监督学习在无标签数据中发现隐藏结构或分组K-means 聚类、层次聚类、PCA消费者分群、感官与配方参数模式识别不直接输出预测,可解释性弱
半监督学习小样本标注数据结合大样本未标注数据自训练、协同训练(Co-training)标注数据稀缺时提升泛化能力伪标签错误会传播放大
强化学习智能体通过与环境交互获得奖励或惩罚Q-learning、策略梯度自适应配方优化、智能推荐系统化妆品领域仍多停留在概念验证

三、配方端:AI 已渗透到六类原料

原料类别预测的性能与终点主要 AI 方法已报道性能
表面活性剂临界胶束浓度 CMC、亲水亲油平衡 HLB、毒性、生物降解性QSAR、SVR、人工神经网络 ANN、生成对抗网络 GAN清洁泡沫配方预测 R²=0.77(>500 样本)
聚合物玻璃化转变温度 Tg、分子量分布、溶解度参数、触感图神经网络 GNN、聚合物指纹、主动学习仍处于早期,专用数据库与指纹不足
香精气味特征、复配比例优化、替代分子设计GNN、ANN、DNN、粗糙集机器学习 RSML四组分香精复配优化,可处理"活性悬崖"
防腐剂最低抑菌浓度 MIC、细胞毒性、内分泌干扰、神经毒性DeepTox、ProTox-II、QSAR(随机森林加 SMOTE)神经毒性预测准确率 87.7%(452 个化学品外部验证)
抗氧化剂抗氧化活性分类、氢原子转移反应性随机森林、SVR、量子化学与机器学习混合1900 多个化合物,分类准确率超过 90%
益生元与微生态菌群与表型关联、去屑、保湿效果可解释 AI、自动化高通量筛选益生元洗发水头皮屑减少 86%

其中防腐剂一项尤为典型:Kan 等用随机森林结合 SMOTE 建立 QSAR 模型预测神经毒性,在 452 个化学品的外部验证集上准确率达 87.7%,157 种受评估防腐剂中有 15 种被标记为可能对神经细胞有细胞毒性。另有研究用 AI 从人源 β-防御素出发设计抗菌肽 IK-16-1,对大肠杆菌、金黄色葡萄球菌、铜绿假单胞菌和白念珠菌均表现出广谱抑菌活性,且无溶血活性。这类工作的价值在于提前排除高风险候选,而不是给出最终答案。

四、安全端:两张最关键的"成绩单"

4.1 急性经皮毒性

Lou 等使用超过 3400 个动物来源数据点训练机器学习与深度学习模型,在十折交叉验证下取得兔数据 AUC 78%、大鼠数据 AUC 82% 的成绩,并引入 SARpy 结构警示片段识别、Shapley 加性解释(SHAP)和注意力指纹热图提升可解释性,最终形成可独立运行的预测软件工具。

4.2 皮肤致敏

欧盟自 2013 年全面禁止化妆品及其原料的动物试验后,Bühler 试验、豚鼠最大化试验、局部淋巴结试验(LLNA)逐步被新方法论(NAM)取代或补充,包括体外方法 h-CLAT、DPRA、KeratinoSens,以及 in silico 模型。综述提到,表现最好的模型是采用 24 个理化描述符与 eAR 值训练的朴素贝叶斯分类器,整体准确率 86%、敏感性 80%、特异性 90%。该模型被用于评估 15 个新兴或研究不足的半抗原,其中 7 个被预测为致敏物:仙客来醛、N,N-二甲基丙烯酰胺、二甲基硫代氨基甲酰基苯并噻唑硫化物、香叶醇氢过氧化物、异冰片基丙烯酸酯、橙花醛、异戊烯基咖啡酸酯。

更具说服力的是 Cosmetics Europe 与美国国家毒理学计划(NTP)合作的基准研究:以精选的 LLNA 和人体致敏数据集为参照,多种非动物策略的表现与动物及人体数据相当甚至更优,且不同模型误判的化合物并不一致——这意味着集成建模或共识建模可以进一步提升可靠性。商业工具如 SpheraCosmolife 已将暴露与危害预测整合,直接输出安全边际(MoS),并支持 3R 原则(替代、减少、优化动物使用)。

但局限同样明确:模型精度高度依赖输入数据的质量与代表性,数据集不平衡(已知致敏物多于非致敏物)会引入偏倚;多数现有模型只覆盖有限的毒性通路,容易忽略复杂的生物交互与个体差异。

五、关键事实速览

事项事实对中国企业的提示
预测能力皮肤致敏准确率 86%,急性经皮毒性 AUC 78%—82%达到可用于初筛的水平,但未达到可单独定论的水平
监管定位欧美官方对化妆品 AI 预测模型尚无明确指引国内同样无专门认可路径,按证据权重处理
原料准入生成模型产出的新分子不在已使用原料目录内默认须走新原料注册备案并承担监测期义务
清单管理防腐剂、防晒剂、着色剂、染发剂实行准用清单预测性能优异不等于可以合法使用
功效评价祛斑美白、防晒、防脱发属特殊化妆品须按《化妆品安全技术规范》规定方法开展人体功效试验

六、中国监管下的五条硬边界

边界一:in silico 预测属于"证据权重",不是法定检验报告

《化妆品安全评估技术导则》采用证据权重思路,原料的毒理学证据通常来自《化妆品安全技术规范》规定的毒理学试验、权威机构已公布的安全评估结论(如 SCCS、CIR、JECFA、EFSA 等)、交叉参照(read-across)、TTC 阈值法以及其他科学合理的证据。AI 预测结果一般归入后两类的支撑材料——它可以解释"为什么这个原料与某个类似物的毒理特征相近",但报告最终仍要落到具体的 NOAEL 或 ADE 取值、暴露量(SED)计算和明确的结论句。

把"模型预测为不致敏"直接写成安评结论,是审评中最容易被打回的写法之一。相关方法如何规范落地,可参考《交叉参照(Read-across)方法在化妆品安全评估中的五步实操法》与《化妆品安全评估TTC方法实操全解》两篇。

边界二:AI 设计出的新分子,默认要先走新原料备案

《已使用化妆品原料目录》是判断"新原料"的基线。生成式模型(变分自编码器、GAN、GNN)给出的新表面活性剂、新肽类防腐剂,只要不在目录内,就没有可依赖的使用历史,必须按新原料注册备案路径提交毒理学资料与安全性评价资料,并承担相应的安全监测期义务。这一点常被配方端技术团队忽略:算法给出一个性能指标优秀的分子,合规端才发现路径完全不同。

边界三:防腐剂等实行准用清单管理,清单外不可用

综述中 AI 筛选防腐剂的方向很有吸引力,但中国对防腐剂、防晒剂、着色剂、染发剂实行《化妆品安全技术规范》准用清单管理。清单外物质即便 AI 预测其抑菌效果好、细胞毒性低,也不能作为防腐剂用于上市产品。企业可以做的,是在清单内用 AI 寻找更低刺激的使用浓度与更优复配比例,通过协同效应降低单一组分用量——这也是综述中提到的可行方向。

边界四:特殊化妆品的人体功效试验不可被模型替代

综述引用的美白霜优化案例中,混合 ANN 与遗传算法给出的最优配比为 3.00% 熊果苷、0.658% 芦荟苦素、0.007% 烟酰胺、0.993% 氧化白藜芦醇,黑色素含量降至 0.0824,模型 MSE 为 6.01×10⁻⁴、R² 为 0.979。这在配方筛选阶段很有价值,但祛斑美白属于特殊化妆品,其功效宣称评价必须按《化妆品安全技术规范》规定的方法开展人体功效试验并出具报告,不适用《化妆品功效宣称评价规范》中的通用方法条款,in silico 或体外数据不能替代。

AI 在这里的正确定位是"把要做的试验从 50 组压到 5 组",而不是"省掉试验"。

边界五:人脸图像与皮肤影像属敏感个人信息,算法合规是独立命题

综述提到的虚拟试妆、面部特征分析、皮肤微生物组表型预测,都会采集人脸形态与皮肤影像数据。在中国,生物识别信息受《个人信息保护法》约束,需要单独同意、最小必要、去标识化处理;若产品面向欧盟,还需同时满足 GDPR 与欧盟《人工智能法案》(2024 年正式通过)的风险分级要求——用于诊断或治疗相关功能的化妆品 AI 应用可能被划为高风险,须满足训练数据代表性、文档可追溯、透明度义务和人工监督等要求。这部分合规责任在品牌方,不因算法由第三方提供而转移。

七、企业怎么用:按场景对号入座

场景可以做什么不能做什么
原料数据缺口筛查用 QSAR 与交叉参照给缺少 NOAEL 的原料做风险排序,优先补做高风险项把预测值当作 NOAEL 直接代入 MoS 计算
新原料立项用生成模型缩小候选分子范围,提前排除含高风险结构警示片段的结构跳过毒理试验设计与监测期合规安排
配方优化用 ANN 与遗传算法优化活性物配比和感官参数,减少试错批次用模型输出替代稳定性、防腐挑战、人体功效试验
致敏风险自查用致敏预测模型对香精与防腐体系做初筛,标记需重点关注的组分据此直接作出"不致敏"宣称或免做斑贴试验
上市后信号监测用机器学习对不良反应文本做聚类,识别批次或组分聚集信号用模型结论替代法定不良反应报告义务

八、一个现实判断

综述作者的判断是:AI 能够重塑化妆品创新的科学、伦理与商业格局,前提是坚持多学科协作、透明的算法治理与包容性。对国内企业而言,更务实的姿态是把 AI 用在"减少试验数量、提高证据组织效率"上,而不是"替代试验"上。

具体来说,完整版安全评估落地后,企业最大的痛点从来不是"某个原料有没有数据",而是"数据缺口这么多,先补哪一个、用什么方法补最经济"。AI 预测模型恰恰能在这道排序题上发挥作用:先用模型把缺 NOAEL 的原料按预测毒性分级,再结合暴露量与使用场景决定哪些必须补试验、哪些可以用交叉参照或 TTC 处理。这才是降本的真正来源。

绿翊提示:完整版安全评估不是套用模板,而是要为每项原料建立来源清晰、条件适用、计算可追溯的证据链。AI 预测模型可以加速缺口识别与类似物筛选,但证据链的成立仍取决于毒理数据、风险物质、暴露量与 MoS 计算的严谨性。绿翊合规的法规与安全评估团队围绕原料毒理数据、风险物质、暴露量、SED/MoS、TTC 及交叉参照开展系统评估,并通过妆企易安评工具与人工复核提升检索和编制效率。企业如存在原料数据缺口、风险物质或报告整改问题,可提交配方和现有资料进行专项诊断。

常见问题解答

AI 预测的毒理数据能写进化妆品安全评估报告吗?

可以作为证据权重中的补充材料写入,用于支撑交叉参照的类似物论证或说明数据缺口的合理性,但不能单独作为毒理学终点结论。报告中仍需给出具体的 NOAEL 或 ADE 取值、暴露量计算和安全边际评估,并最终形成明确的安全性结论。把模型预测结果直接写成"不致敏""无毒性"的结论性表述,是审评中常见的退回原因。

用 AI 生成的新原料分子,备案时会被认可吗?

AI 生成的分子不在《已使用化妆品原料目录》内,即属于新原料,须按新原料注册备案路径提交毒理学资料与安全性评价资料,并承担相应的安全监测期义务。AI 预测结果可辅助试验方案设计,但不能替代注册备案要求的法定资料。立项阶段应先确认原料的目录归属,再判断申报路径。

皮肤致敏的 in silico 预测准确率达 86%,能替代斑贴试验吗?

目前不能。86% 的准确率来自特定数据集上的交叉验证结果,且模型存在数据集不平衡、覆盖毒性通路有限、忽略个体差异等局限,不同模型误判的化合物也不一致。实际工作中应将其定位为初筛工具,与体外方法(h-CLAT、DPRA、KeratinoSens)及人体斑贴试验形成组合证据,而非替代关系。

AI 优化的美白配方还需要做人体功效试验吗?

需要。祛斑美白属于特殊化妆品,其功效宣称评价必须按《化妆品安全技术规范》规定的方法开展人体功效试验并出具报告,不适用《化妆品功效宣称评价规范》的通用方法条款,in silico 预测与体外数据均不能替代。AI 的价值在于缩小候选配比范围、减少需要实测的试验组数,从而在合规前提下降低开发成本。

使用第三方 AI 工具做原料筛选,数据合规责任在谁?

责任在品牌方或备案人。若 AI 工具采集人脸图像、皮肤影像等生物识别信息,需按《个人信息保护法》履行单独同意、最小必要、去标识化等义务;面向欧盟市场时还需同时满足 GDPR 与欧盟《人工智能法案》的风险分级要求。第三方提供算法并不转移合规责任,委托协议中应明确数据处理边界与责任划分。

参考资料

相关阅读