摘要
结论先行:化妆品功效宣称的可信度,不取决于"做了多少实验",而取决于证据链是否闭合——即暴露剂量、作用靶点、终点指标与统计学推断能否前后呼应,不出现跳层外推的断层。
本文以《化妆品功效宣称评价规范》(2021年第50号公告)确立的四类依据为骨架,梳理从二维细胞、三维重建皮肤模型(RhE/RhS)、离体人皮肤到人体仪器测量、临床评分与消费者使用测试的层级结构与各层外推边界;重点展开人体功效评价试验的随机化、盲法、对照与样本量设计,以及配对 t 检验与 Wilcoxon 检验的选择逻辑、重复测量方差分析与线性混合效应模型、多重比较与多重终点校正、效应量与置信区间、ITT(意向性治疗)与 PP(符合方案)分析集、缺失值处理;随后讨论仪器测量的可靠性评价(ICC、Bland-Altman 分析、最小可检测变化),并给出证据链断裂点自查清单。
一、引言:为什么"做了实验"不等于"有了证据"
研发链条上最常见的错位,是把"实验产出数据"等同于"数据支撑宣称"。典型场景:某活性物在二维培养的成纤维细胞中使Ⅰ型胶原蛋白 mRNA 表达上调且具统计学显著性,于是产品宣称"抗皱"。但这一步到"抗皱"之间横亘着五个未经检验的假设:该浓度在人体皮肤中可达;能穿过角质层;mRNA 上调能转化为蛋白与组织学水平的变化;该变化能产生肉眼或仪器可分辨的皱纹改善;该改善超过安慰剂效应与测量噪声。任何一环断裂,证据链即失效。
监管层面早已意识到这一点。《化妆品监督管理条例》第二十二条规定:"化妆品的功效宣称应当有充分的科学依据。化妆品注册人、备案人应当在国务院药品监督管理部门规定的专门网站公布功效宣称所依据的文献资料、研究数据或者产品功效评价资料的摘要,接受社会监督。"《化妆品功效宣称评价规范》第十四条进一步要求方案设计"应当符合统计学原则,试验数据符合统计学要求"——注意表述是"符合统计学原则",而非仅仅"做了统计检验"。二者之间的差距,正是本文的核心。
二、证据金字塔:从体外到人体的四层模型及其效度边界
需先澄清:证据金字塔不意味着"层级越高越好",而是不同层级回答不同问题——体外模型回答"能不能",人体试验回答"有没有"。用低层级证据回答高层级问题,是证据链断裂的主要来源。
第一层:二维单细胞与共培养模型。 角质形成细胞、成纤维细胞、黑素细胞单层培养,以及黑素细胞-角质形成细胞共培养、巨噬细胞炎症模型等。优势是可控性高、通量大、机制可拆解;局限是缺乏三维结构与细胞外基质的力学信号、角质层屏障、代谢与清除、免疫与神经-内分泌-皮肤轴的整体调控。最关键的是,二维体系中"有效浓度"通常是自由浓度,与配方经皮递送后靶层的实际暴露量没有可比性。因此二维实验只能用于假设生成与排序,不能单独支撑功效宣称——这也与《规范》附1中"文献资料或研究数据"仅作搭配项(△)的定位一致。
第三层:离体人皮肤(ex vivo)。 整形外科来源的人体皮肤器官培养,保留完整表皮-真皮结构、附属器与部分屏障功能,可用于渗透、代谢、屏障修复、色素沉着等研究。其价值在于桥接:既能定量剂量-渗透关系,又能测组织学与分子终点。局限是:无血液循环与系统免疫;离体后屏障功能随时间衰减,培养窗口有限;供体间差异大。设计上必须把供体来源作为分层或随机效应,同一供体的多块皮肤视为非独立单位。
第四层:动物模型。 此处必须写准确,不能笼统称"禁止动物试验"。
欧盟方面,Regulation (EC) No 1223/2009 第18条确立"试验禁令+上市禁令"双重结构:成品动物试验禁令自 2004 年 9 月 11 日起适用;原料或原料组合自 2009 年 3 月 11 日起适用;上市禁令自 2009 年 3 月 11 日起适用于除重复剂量毒性、生殖毒性与毒代动力学外的人健康效应终点,这三类自 2013 年 3 月 11 日起适用——欧盟委员会官方说明明确该日期的适用"不论替代方法是否可得"。第18条另设严重安全性担忧情形下的豁免程序。故准确表述是:欧盟是按终点分阶段、并附豁免机制的试验与上市禁令,而非一刀切的"动物试验非法"。
中国方面需分场景。《规范》附3总则规定:"动物试验应当符合动物福利要求及3R(替代、减少、优化)原则。"——功效评价中的动物试验未被禁止,但受 3R 约束。安全性评价侧,《化妆品注册备案资料管理规定》第三十三条规定,普通化妆品的生产企业已取得所在国(地区)政府主管部门出具的生产质量管理体系相关资质认证、且安全风险评估结果能够充分确认产品安全性的,可免于提交毒理学试验报告(宣称婴幼儿和儿童使用、使用尚在安全监测中新原料、被列为重点监管对象的除外)。2026年7月29日国家药监局2026年第70号公告进一步将减免扩大至特殊化妆品中的烫发产品、非氧化型染发产品、仅具物理遮盖作用的祛斑美白产品,以及使用新原料的普通化妆品(儿童化妆品除外),并明确可通过技术指导原则适时调整。故中国是以企业资质+安全评估结论为条件的、按产品类别逐步扩大的毒理学试验报告减免,而非全面禁止。
第五层:人体仪器测量、临床评分与消费者使用测试。 无创生物工程测量(角质层含水量电容法、TEWL、皮肤色度、弹性、皮脂、表面 pH、高频超声、三维条纹投影皱纹成像等)提供连续型客观终点;临床评分提供等级/半定量终点;消费者使用测试提供真实场景下的主观终点。三者不可替代:仪器变化未必等于消费者可感知的变化,反之亦然。稳健的宣称通常需要至少两条独立链路相互印证。
三、中国功效评价四类依据的适用情形与方法要求
《规范》第五条规定功效宣称依据"包括文献资料、研究数据或者化妆品功效宣称评价试验结果等";第十四条界定试验的三种类型:"化妆品功效宣称评价试验包括人体功效评价试验、消费者使用测试和实验室试验。"第二十条给出术语定义要点:人体功效评价试验是"通过人体试验结果的主观评估、客观测量和统计分析等方式,对产品功效宣称作出客观评价结论的过程";消费者使用测试是"对消费者的产品使用情况和功效宣称评价信息进行有效收集、整理和分析的过程";实验室试验"包括但不限于动物试验、体外试验(包括离体器官、组织、细胞、微生物、理化试验)";文献资料须"标明出处,确保有效溯源";研究数据是"尚未公开发表的与产品功效宣称相关的研究结果"。
适用情形由第八条至第十二条及附1"化妆品功效宣称评价项目要求"规定。附1用三种符号表达强制程度:**√(必做项目)、\*(可选项目,但必须从中选择至少一项)、△(可搭配项目,但必须配合人体功效评价试验、消费者使用测试或者实验室试验一起使用)**。据此:祛斑美白、防晒、防脱发、祛痘、滋养、修护六项为人体功效评价试验必做;抗皱、紧致、舒缓、控油、去角质、防断发、去屑、宣称温和(无刺激)、宣称量化指标,以及特定宣称(敏感皮肤、无泪配方)为三选一(后者限人体试验或消费者测试);保湿、护发为四类全可选。第十条第二款还规定,祛斑美白、防晒、防脱发应当"由化妆品注册和备案检验机构按照强制性国家标准、技术规范的要求开展人体功效评价试验,并出具报告"。
方法选择顺序由第十五条规定:优先(一)我国化妆品强制性国家标准、技术规范规定的方法;(二)我国其他相关法规、国家标准、行业标准载明的方法;前述未作规定的,可任意选择(三)国外相关法规或技术标准规定的方法;(四)权威组织、技术机构及行业协会技术指南发布的方法、期刊公开发表的方法或自建方法——但采用后者时,"评价机构应当完成必要的试验方法转移、确认或验证"。这一条最常被忽视:引用期刊方法或自建方法时,转移与确认是强制前置事项而非可选项。
表1 四类依据的适用情形与方法要求对比(据《化妆品功效宣称评价规范》原文整理)
| 依据类别 | 法规定义要点 | 典型适用(第八条至第十二条、附1) | 关键方法要求 | 最常见断裂 |
|---|---|---|---|---|
| 文献资料/研究数据 | 公开发表、标明出处、可溯源;或未发表的研究结果 | 保湿、护发可单独使用;其他类别仅作搭配项(△) | 结论须充分支持宣称并说明关联性(第十九条、附4) | 引用原料文献却宣称成品功效;忽略浓度、基质、人群差异 |
| 实验室试验 | 特定环境条件下按规定程序,含动物试验与体外试验 | 抗皱、紧致、舒缓、控油、去角质、防断发、去屑等三选一之一;原料功效宣称可用 | 须说明空白、阴性、阳性对照与判定标准;须写明适用性与局限性(附3) | 有效浓度远超实际暴露量;无剂量-效应关系;终点与宣称不相关 |
| 消费者使用测试 | 客观科学方法收集、整理、分析使用与评价信息 | 特定宣称(敏感皮肤、无泪配方)二选一之一;抗皱等三选一之一 | 去除或隐藏包装干扰信息;不得使用诱导性用语;说明随机分组与盲法(附3) | 无对照、无盲法;诱导性问卷;以满意率代替功效证据 |
| 人体功效评价试验 | 实验室条件下主观评估+客观测量+统计分析 | 祛斑美白、防晒、防脱发、祛痘、滋养、修护必做 | 随机分组/盲法;环境适应15~30分钟以上;明确判定标准与统计假设(附3) | 样本量无依据;多重终点不校正;只报 P 值;ITT 与脱落未交代 |
四、人体功效评价试验的设计要点
附3"技术导则"对人体功效评价试验提出的结构化要求,可归纳为四组设计要素。
随机化。 其目的不是"看起来公平",而是通过切断分组与预后因素(基线值、年龄、肤质、季节、依从性倾向)的系统关联,使组间差异可被归因于干预。实操上大样本用区组随机保证阶段性入组平衡;存在已知强预后因素(基线皱纹分级、Fitzpatrick 分型或 ITA° 分层、性别、中心)时用分层随机或最小化法。半脸/半头设计中的随机化是左右侧分配随机化,须预先规定并平衡,避免操作者习惯性把受试物涂在同一侧。
盲法。 需区分三层:受试者盲、评价者盲(评分与读图者不知分组)、统计师盲(分组标签遮蔽或按独立统计分析计划执行)。仪器测量常被认为"客观所以无需盲法",这是误解——探头位置、压力、读取次数、异常值处理都受操作者预期影响。附3要求"采取随机分组或盲法等减少或控制偏倚所采取的措施"并记录仪器设置参数,正是为控制这类操作性偏倚。
对照的选择。 四类对照回答四个不同问题:空白/未处理对照回答"是否优于不处理";基质(安慰剂)对照回答"是否优于配方本身的基础作用"——这是最能扣除安慰剂效应与保湿剂短期物理性改善的对照,也是评价活性物贡献的必要条件;阳性对照回答"与市售参照相比如何"并提供方法灵敏度验证;自身前后对照回答"相对基线的变化"。半脸/前臂内外侧设计本质是配对设计,优势是消除个体间变异,代价是交叉污染与左右侧基线不对称。
安慰剂效应的量级值得重视:基质本身(水、保湿剂、油脂)即可在数小时内显著改变角质层含水量与皮肤表面光学特性;主观评分与消费者自评的响应更为明显。因此若宣称指向"某活性成分具有某功效",基质对照通常不可省略。
样本量估算。 附3的表述是"根据试验目的和统计学原则设定。方法未要求时,有效受试人数应当具有统计学意义。"这无法简化为"30人":样本量由效应量(预期差值)、变异度(配对设计用差值的标准差)、显著性水平 α(双侧0.05)与检验效能 power=1−β(0.80或0.90)决定。核心关系是样本量与效应量的平方成反比、与变异度的平方成正比——预期差值缩小一半,样本量增至约四倍;差值变异度降低一半,样本量降至约四分之一(两独立样本设计每组约为 2×(α 与 β 对应分位数之和)²×方差÷预期差值²,配对设计约为 (分位数之和)²×差值方差÷预期差值²)。因此与其纠结"30人够不够",不如优先做两件事:通过预试验或文献获得可靠的变异度估计;在方案中写明效应量的临床/消费者意义依据(如最小可感知改善、仪器最小可检测变化)。最后须计入脱落率并预先写明脱落判定标准。
五、统计学要求
这是证据链中最容易崩塌、也最容易被"事后修补"的环节。以下按决策顺序展开。
5.1 先定终点层级,再谈检验方法
《规范》附4要求摘要中"阐明主要评价指标进行统计分析时的统计假设以及判定为有效的依据"。这意味着方案必须预先指定主要终点(通常1个,最多2个)、次要终点与探索性终点。主终点承担确证性推断,其家族错误率(FWER)必须被控制;次要终点属支持性但仍需预先声明;探索性终点只产生假设,不得作为宣称依据。最常见的误用是:方案未指定主终点,结果出来后从十几个指标中挑一个 P<0.05 的作为"主要结果"——这在统计上等价于做了十几次检验却按一次检验的阈值判定,假阳性率被严重放大。
5.2 正态性与方差齐性:检验是辅助,不是裁判
Shapiro-Wilk 检验是常用正态性检验,样本量较小时功效较高。但两个反直觉的事实必须记住:样本量很大时,微不足道的偏离也会被判为"显著";样本量很小时,明显偏离也可能检不出。 故不应把正态性检验的 P 值作为选择参数/非参数方法的唯一开关。
更重要的是判断对象:配对 t 检验关注的是差值的分布,而非原始数据的分布。此外 t 检验对轻度偏离正态具有一定稳健性(样本量较大时可依赖中心极限定理),真正的敏感点是重尾与离群值。实操上应结合 Q-Q 图、偏度峰度、离群值检查综合决定,并把方法在方案中预先写死,避免"看了结果再选检验"。同理,方差齐性(Levene 检验等)影响两独立样本 t 检验的版本选择,但 Welch 校正在方差齐与不齐时都表现稳健,默认使用 Welch 版本通常比先做齐性检验再决定更安全——"先检验再选方法"的两步程序本身会改变最终检验的实际错误率。
5.3 配对 t 检验与 Wilcoxon 符号秩检验的适用条件
- 配对 t 检验:用于连续型终点、前后(或左右侧)配对、差值近似正态(或样本量足够大可依赖中心极限定理)的情形,检验平均差值是否为零,输出均值差及其置信区间。
- Wilcoxon 符号秩检验:用于配对设计、等级资料,或连续资料但差值明显偏离正态/存在离群值的情形。需纠正一个广泛误传——该检验并非无条件"检验中位数";它在差值分布对称的假设下检验位置偏移(原假设为差值分布关于 0 对称)。若差值分布明显不对称,其原假设与"中位数为零"并不等价,此时更恰当的是符号检验(sign test)或自助法/置换检验并明确估计目标。
- 两者都不解决"变化是否有意义"。P=0.001 但均值差只有 0.3 个角质层含水量单位,落在测量噪声范围内,毫无宣称价值。
5.4 重复测量:从方差分析到混合效应模型
功效试验几乎必然包含多个时间点(基线、2周、4周、8周……)。对每一时间点分别做多次 t 检验是错误的:既损失效率,又膨胀假阳性率。正确做法是整体建模:
- 重复测量方差分析(RM-ANOVA):时间作为受试者内因素、组别作为受试者间因素,检验组别×时间交互作用。关键假设是球对称性(sphericity),以 Mauchly 检验评估,不满足时用 Greenhouse-Geisser 或 Huynh-Feldt 校正自由度。
- 线性混合效应模型(LMM)/广义线性混合模型(GLMM):将受试者作为随机效应,可处理非平衡设计、不等间隔测量与个体特异性轨迹,并在随机缺失(MAR)假设下对部分缺失的受试者仍能提供有效推断,是目前更推荐的默认方案。
- 基线值作为协变量(ANCOVA)通常比"变化量"分析更有效率,尤其当两组基线不均衡时。
5.5 多重比较:Bonferroni、Holm 与 FDR
同时检验多个假设(多个时间点、部位、终点、亚组)时,按推断目标选择策略:Bonferroni 校正把阈值定为 α/m(或 P 值乘以 m),控制 FWER,简单但保守,检验数多时效能损失大;Holm-Bonferroni(逐步向下法)将 m 个 P 值升序排列,依次与 α/m, α/(m−1), …, α 比较,一旦不显著即停止并接受其后全部原假设,同样控制 FWER 但在任何情形下都不劣于 Bonferroni 且通常更有效,故确证性控制 FWER 时应优先选择;Benjamini-Hochberg(FDR)控制错误发现率,即"被判为阳性的结果中假阳性的期望比例",适用于探索性研究、多终点筛选与组学类终点,用于确证性主终点不够严格。针对时间点,比"逐点 t 检验"更好的做法是先用整体模型检验交互作用,再在模型框架内进行预设对比(如末次访视 vs 基线),并对对比次数校正。
5.6 多重终点的结构化策略
多重终点指多个临床问题,与多重比较相关但不同。三条策略:层级检验(gatekeeping)——预先规定顺序,只有前一终点显著才检验下一个,可在不额外损失效能的前提下控制 FWER;复合终点或全局检验——把多个指标合成为综合指标(如整体光老化评分),将多维问题降为一维;多变量方法——如多元方差分析(MANOVA)或 O'Brien 全局检验,作为整体检验的闸门。
需强调:亚组分析(按年龄、肤质、性别分层看效果)属探索性分析,除非预先设计并对亚组数量做校正,否则不能作为确证结论依据。
5.7 效应量与置信区间:不能只报 P 值
P 值回答"数据与零假设是否相容",不回答"效果有多大"。因此必须报告:效应量——Cohen's d(标准化均数差),小样本建议 Hedges' g 校正,配对设计可用 d_z;不必执着于 0.2/0.5/0.8 通用阈值,化妆品领域真正需要的是相对于仪器最小可检测变化与临床可感知阈值的锚定解释。置信区间——均值差的 95% 置信区间直接回答"改善量是否可能小于有意义阈值";一个 P<0.05 但下限接近 0 的结果,与置信区间完全落在有意义区间内的结果,证据强度完全不同。绝对量+相对量并用,如"角质层含水量较基线平均提高 X 个单位(95% CI: A–B)",而非仅报"提高 X%"(百分比基线依赖强,易被夸大)。有效率类指标(如"改善率 90%")必须同时给出分子分母与置信区间。
5.8 ITT(意向性治疗)与 PP(符合方案):不要混淆
这是最常被混淆的一对概念,区别不在"严格与否",而在回答的问题不同:
- ITT 分析集:所有经随机化的受试者,按被随机分配到的组别分析,无论是否完成、是否依从。它保持随机化建立的组间可比性,估计"实际使用条件下被分配使用该产品的效果"(偏向 effectiveness)。因包含不依从与脱落,ITT 通常偏保守(稀释效应)。
- PP 分析集:仅纳入完成且严格符合方案者,估计"完美依从条件下的效果"(偏向 efficacy)。但它破坏了随机化,可能引入选择偏倚——若脱落者多为"效果不明显者",PP 会系统性高估效果。
- 安全集:接受过至少一次试验产品并有安全性随访数据者,用于不良反应分析。
正确做法是:预先定义两个分析集、两个都分析、并比较结论。一致则结果稳健;不一致(常见于脱落率较高时)必须报告并讨论原因,不能只呈现更有利的那个。监管审评与高质量期刊通常要求 ITT 为主分析。另有"改良意向性治疗(mITT)"指纳入随机化后至少接受一次治疗且至少一次疗效评价者,须在方案中明确定义,不能事后决定。
5.9 缺失值的处理
先判断缺失机制:完全随机缺失(MCAR)、随机缺失(MAR)、非随机缺失(MNAR)。化妆品试验中最危险的是 MNAR——受试者因"感觉无效"或"出现刺激"而退出,此时缺失本身携带信息。不推荐末次观测值结转(LOCF):它在多数情形下低估不确定性并可能引入偏倚。推荐线性混合效应模型(MAR 下直接使用全部观测,无需插补)、多重插补结合 Rubin 规则合并,以及敏感性分析——在 MNAR 假设下重新分析,检验结论是否翻转。方案须预先写明脱落定义、缺失处理方式与敏感性分析策略,并报告各分析集实际人数与脱落原因分布。
5.10 常见统计误用清单
- 多个时间点做多次独立 t 检验,不建模、不校正。
- 多个终点未预设主终点,事后挑选显著者。
- 只报 P 值,不报效应量与置信区间;把"统计学显著"等同于"消费者可感知"。
- 半脸/左右配对设计按两独立样本分析;同一受试者多部位、同一供体多块离体皮肤视为独立样本(伪重复)。
- 用 Pearson 相关系数评价两台仪器或两个评分者的一致性(见第六节)。
- 正态性检验 P 值作为唯一决策开关;只报 PP 不报 ITT;脱落率超预期却不做敏感性分析。
- 亚组分析与事后分层挖掘当作确证性结论;有效率类指标不给分母与置信区间。
表2 常用统计方法的适用情形与常见误用
| 数据情形 | 推荐方法 | 关键判断点 | 常见误用 |
|---|---|---|---|
| 两组独立、连续终点 | Welch t 检验;非正态或等级用 Mann-Whitney U 检验 | Welch 为稳健默认,无需先验齐性检验 | 先做齐性检验再选版本 |
| 前后/左右配对、连续终点 | 配对 t 检验(差值近似正态);否则 Wilcoxon 符号秩检验 | 检验差值而非原始值的正态性 | 把 Wilcoxon 无条件称为"中位数检验" |
| 多时间点重复测量 | 重复测量 ANOVA(校正球对称性)或线性混合效应模型 | 检验组别×时间交互而非逐点检验 | 每个时间点单独做 t 检验 |
| 多终点/多对比 | 层级检验、Holm 或 Benjamini-Hochberg | 确证性控 FWER 用 Holm,探索性可用 FDR | 跳过主终点预设;或完全不校正 |
| 基线不均衡 | 以基线为协变量的 ANCOVA/混合模型 | 协变量须预先指定 | 事后按基线分层挖掘亚组 |
| 缺失与脱落 | 混合效应模型(MAR)/多重插补+敏感性分析 | 预先定义分析集与处理规则 | LOCF;只报 PP 不报 ITT |
| 一致性/可靠性评价 | ICC(绝对一致性版本)+ Bland-Altman | ICC 需报告模型、类型、定义与置信区间 | 用 Pearson r 替代 ICC |
六、仪器测量的可靠性与一致性评价
仪器的读数只有在可靠时才有意义。需区分重复性(同一操作者/设备/短间隔,反映随机误差)与再现性(不同操作者/设备/实验室,反映系统间差异)。
组内相关系数 ICC 不是相关系数。 ICC 建立在方差分解之上,本质是"真值方差 ÷(真值方差+误差方差)"。Pearson 相关系数衡量线性关联,对系统偏倚完全不敏感:若仪器 B 读数始终比仪器 A 高 5 个单位,两者 Pearson r 仍可为 1.0,但显然不可互换。ICC 的绝对一致性(absolute agreement)版本会把系统偏倚计入误差,一致性(consistency)版本则不会——因此当关注"两台设备/两名操作者的读数能否互相替代"时,必须选绝对一致性版本。Shrout 与 Fleiss(1979)定义 ICC(1,1)、(2,1)、(3,1) 等模型,McGraw 与 Wong 扩展至十种形式;Koo 与 Li(2016)给出选择流程与阈值:ICC<0.50 为差,0.50–0.75 为中等,0.75–0.90 为良好,>0.90 为优秀。规范报告应给出软件、模型、类型、定义、点估计与 95% 置信区间。
Bland-Altman 分析回答的是另一个问题:"两种方法的差异有多大,能否互换"。 以两次测量的差值为纵轴、均值为横轴作图,计算平均偏倚与 95% 一致性界限 LoA = 平均偏倚 ± 1.96×差值标准差。它与 ICC 互补:ICC 给相对可靠性的单一系数,LoA 给出原始单位下的差异范围,可直接与临床/消费者意义阈值比较。还需检查 LoA 是否随量级变化(漏斗形提示需对数转换或回归法处理)。一致性界限是否"可接受"是专业判断而非统计判断,须在方案中预先设定。
最小可检测变化(MDC/SDC)。 由标准测量误差 SEM = SD×√(1−ICC) 导出,MDC = 1.96×√2×SEM(95% 置信水平),回答"变化超过多少才能排除测量噪声"。这是把统计学显著性与实际意义联系起来的桥梁:若试验观察到的平均改善量小于该指标的 MDC,无论 P 值多小,都不宜作为功效宣称依据。
环境控制是可靠性的前提。 EEMCO(European Group for Efficacy Measurements on Cosmetics and Other Topical Products)系列指南覆盖角质层含水量、TEWL、皮肤颜色、表面 pH、拉伸功能特性、微循环与干皮临床评分等终点(含 2018 年水分测量修订版与 2020 年生物力学性能指南),反复强调环境条件、部位一致性、适应时间、探头压力与仪器设置;中国《规范》附3同样要求"受试者应在试验环境中适应15~30分钟以上"。修订版 EEMCO 指南明确指出仪器间与仪器内的变异验证"仍然具有挑战性,目前尚无验证标准或测试体模"——提示:跨研究、跨仪器的绝对值比较必须谨慎,同一研究内部的相对变化才是可靠的信息载体。
七、证据链断裂点自查清单
以下十项,任何一项不成立,宣称的证据强度即应下调:
- 暴露量断层:体外有效浓度是否高于配方在靶层的实际可达浓度?有无渗透/暴露数据支撑?若无,只能标注为机制假设。
- 细胞毒性窗口:未报告活力/毒性阈值的高浓度"效应",可能是应激反应或细胞死亡伴随现象。
- 单一模型外推:结论是否仅来自一个细胞系或一个 3D 模型?
- 剂量-效应关系缺失:只测一个浓度,即缺失"效应真实存在"的关键证据。
- 终点与宣称不相关:测胶原蛋白 mRNA 却宣称"淡纹"、测 TEWL 却宣称"抗老"——机制终点与临床终点之间需要桥接证据。
- 缺乏基质对照:无基质对照时只能宣称"产品使用后观察到改善",不能宣称"某活性成分具有某功效"。
- 安慰剂与期望效应未扣除:是否盲法?问卷是否使用诱导性用语(《规范》附3明确禁止)。
- 统计推断不闭合:是否预设主终点?多重比较是否校正?是否报告效应量与置信区间?ITT 与 PP 是否都报告?
- 测量可靠性未验证:变化量是否大于该指标的 MDC?仪器重复性是否在本实验室条件下被确认?
- 时间尺度不匹配:体外观察数小时至数天,人体宣称"4周淡纹"——模型窗口是否覆盖宣称对应的生物学过程?
八、讨论与展望
其三,统计学要求正从"事后分析"前移到"设计前置"。ICH E9(R1) 的估计目标(estimand)框架——先明确研究要估计什么,再讨论估计方法——同样适用于化妆品功效试验。把估计目标、分析集、缺失值策略、多重性策略写进方案,比任何事后统计技巧都更能提升证据强度。
结论仍然朴素:证据链的价值不在于层级最高的一环有多高,而在于最薄弱的一环有多弱。 一次设计严谨、统计透明的 30 人人体试验,其证据强度远高于一套"机制完整但剂量断层、多重比较未校正"的体外实验组合。
参考文献
- 国家药品监督管理局.《化妆品功效宣称评价规范》(国家药监局关于发布《化妆品功效宣称评价规范》的公告,2021年第50号),自2021年5月1日起施行。(含附1化妆品功效宣称评价项目要求、附2等效评价指导原则、附3化妆品功效宣称评价试验技术导则、附4功效宣称依据摘要式样)
- 《化妆品监督管理条例》(国务院令第727号,2020年6月29日公布,自2021年1月1日起施行). 第二十二条.
- 国家药品监督管理局.《化妆品注册备案资料管理规定》. 第三十三条(免于提交毒理学试验报告的情形).
- 国家药品监督管理局.《关于化妆品注册备案有关事项的公告》(2026年第70号),2026年7月29日.
- 国家药品监督管理局.《关于将化妆品中防腐剂检验方法等7项检验方法纳入化妆品安全技术规范(2015年版)的通告》(2021年第17号),2021年2月18日.(含《化妆品祛斑美白功效测试方法》《化妆品防脱发功效测试方法》)
- 《化妆品安全技术规范》(2015年版). 第六章毒理学试验方法、第七章人体安全性检验方法、第八章人体功效评价检验方法.
- 中华人民共和国工业和信息化部. QB/T 4256-2011《化妆品保湿功效评价指南》.
- European Parliament and Council. Regulation (EC) No 1223/2009 on cosmetic products, Article 18(Animal testing). Official Journal of the European Union, 22.12.2009. 及欧盟委员会关于动物试验禁令时间表的官方说明.
- Berardesca E. EEMCO guidance for the assessment of stratum corneum hydration: electrical methods. *Skin Research and Technology*, 1997, 3: 126–132.
- Rogiers V. EEMCO guidance for the assessment of transepidermal water loss in cosmetic sciences. *Skin Pharmacology and Applied Skin Physiology*, 2001, 14(2): 117–128.
- Berardesca E, Loden M, Serup J, Masson P, Monteiro Rodrigues L. The revised EEMCO guidance for the in vivo measurement of water in the skin. *Skin Research and Technology*, 2018, 24: 351–358.
- Monteiro Rodrigues L, Fluhr JW, the EEMCO Group. EEMCO guidance for the in vivo assessment of biomechanical properties of the human skin and its annexes: revisiting instrumentation and test modes. *Skin Pharmacology and Physiology*, 2020, 33: 44–60.
- Piérard GE. EEMCO guidance for the assessment of skin colour. *Journal of the European Academy of Dermatology and Venereology*, 1998, 10(1): 1–11.
- Parra JL, Paye M. EEMCO guidance for the in vivo assessment of skin surface pH. *Skin Pharmacology and Applied Skin Physiology*, 2003, 16: 188–202.
- Bland JM, Altman DG. Statistical methods for assessing agreement between two methods of clinical measurement. *The Lancet*, 1986, i: 307–310.
- Shrout PE, Fleiss JL. Intraclass correlations: uses in assessing rater reliability. *Psychological Bulletin*, 1979, 86(2): 420–428.
- Koo TK, Li MY. A guideline of selecting and reporting intraclass correlation coefficients for reliability research. *Journal of Chiropractic Medicine*, 2016, 15(2): 155–163.
- ISO 24444 *Cosmetics — Sun protection test methods — In vivo determination of the sun protection factor (SPF)*;ISO 24442 *Cosmetics — Sun protection test methods — In vivo determination of sunscreen UVA protection*;ISO 24443 *Cosmetics — Determination of sunscreen UVA photoprotection in vitro*;ISO 16217:2020;ISO 18861:2020.(ISO 正文付费,仅引用编号与名称)
- ICH. E9(R1) *Addendum on Estimands and Sensitivity Analysis in Clinical Trials to the Guideline on Statistical Principles for Clinical Trials*.(用于估计目标与敏感性分析框架的方法学借鉴)
常见问题解答
体外实验证明某成分能促进胶原合成,可以直接宣称"抗皱"吗?
不可以。按《规范》附1,"抗皱"属于人体功效评价试验、消费者使用测试、实验室试验三选一(必须至少选一项),文献资料/研究数据仅为可搭配项(△),不能单独使用。更关键的是效度问题:体外实验回答"能否",而"抗皱"宣称需回答"使用后皱纹是否变得不明显"。若仅有细胞实验,正确做法是宣称原料的机制研究结论,并按《规范》第十一条第二款论证原料功效与产品功效的关联性;若要作产品的抗皱宣称,应补充人体功效评价试验,终点须与皱纹本身(三维成像的皱纹体积、面积、深度或经验证的图像分级)相关,而非停留在分子标志物。
"P<0.05"是不是就足以支持功效宣称?
不是,且远不够。P 值只说明数据与"无差异"假设不相容的程度,不说明差异有多大。要支撑宣称至少同时满足三点:其一,效应量点估计与 95% 置信区间都落在"有意义"范围内——该范围应锚定于仪器最小可检测变化与消费者可感知阈值;其二,若存在多个终点或多个时间点,须预先指定主终点并对多重性做校正(Holm 控 FWER,或 Benjamini-Hochberg 控 FDR),事后挑显著者无效;其三,ITT 与 PP 分析集结论应一致,脱落与缺失数据须有预先定义的处理规则与敏感性分析。此外《规范》附3要求报告"阐明主要评价指标进行统计分析时的统计假设以及判定为有效的依据"——只报 P 值的报告在形式审查上也不完整。
中国现在到底能不能做化妆品动物试验?
需分场景。**功效评价**领域,《规范》附3明确"动物试验应当符合动物福利要求及3R(替代、减少、优化)原则"——未被禁止,但受 3R 约束。**安全性评价**领域实行"以条件换减免":《化妆品注册备案资料管理规定》第三十三条规定,普通化妆品在生产企业具备所在国(地区)主管部门出具的生产质量管理体系资质认证、且安全风险评估结果足以确认产品安全性时,可免于提交毒理学试验报告(宣称婴幼儿和儿童使用、使用尚在安全监测中新原料、被列为重点监管对象的除外);2026年第70号公告进一步把减免扩大到特殊化妆品中的烫发产品、非氧化型染发产品、仅具物理遮盖作用的祛斑美白产品,以及使用新原料的普通化妆品(儿童化妆品除外),并明确可通过技术指导原则动态调整。故准确表述是:**中国在持续扩大减免范围,但尚未全面禁止;新原料等高风险情形仍高度依赖毒理学数据。** 相比之下,欧盟第18条是按终点分阶段的"试验禁令+上市禁令":成品自2004年9月11日起,原料自2009年3月11日起,上市禁令自2009年3月11日起适用于除重复剂量毒性、生殖毒性与毒代动力学外的终点,这三类自2013年3月11日起适用,且该日期不以替代方法是否已获验证为条件;同时设有严重安全性担忧情形下的豁免程序。