摘要

功效宣称的"文献支持"从来不是"找到几篇论文"就能完成的事。本文从中国法规与循证方法学两条线切入,论证"文献资料或研究数据分析"在《化妆品功效宣称评价规范》(国家药监局2021年第50号公告)框架下的法律位置与证据学位置:对仅具保湿、护发功效的产品,文献可单独作为依据;对抗皱、紧致等功效,文献只能作为"搭配项",必须配合人体功效评价试验、消费者使用测试或实验室试验共同使用。在此基础上,本文系统梳理系统评价的方法学内核——PICO/PIRO 框架、PRISMA 2020 的 27 项报告清单、PROSPERO 前瞻性注册、RoB 2(五域)与 ROBINS-I(七域)与 QUADAS-2(四域)的偏倚评估、GRADE 证据分级(四级 + 五个降级因子 + 三个升级因子)与 OCEBM 2011 证据等级,以及 Meta 分析中 I²、Q 检验、固定/随机效应模型、亚组/敏感性分析与发表偏倚检测。结合视黄醇抗衰与烟酰胺的功效系统评价实例,指出化妆品领域系统评价面临的原料—成品传导、浓度—基质异质性、动物试验禁用下的证据重构等特殊难题,并给出从证据到功效宣称依据摘要的衔接路径。结论先行:系统评价是"文献支持"的最高实现形式,但它在化妆品领域的可用性受制于研究异质性与证据链断裂,必须用偏倚与分级工具显性化不确定性。

一、引言:为什么"查了文献"不等于"有了依据"

化妆品企业为一条"保湿""抗皱""舒缓"宣称准备依据时,最常见的动作是让研发或法规同事去查文献、截图、归档。这在行政程序上或许是"有文件",在证据学上却可能什么都不是。差别在于:随意检索得到的文献,其设计类型、偏倚风险、人群与剂量是否与被宣称的产品对得上,都未经系统检验;而"文献资料调研"作为《化妆品功效宣称评价规范》明文认可的功效宣称依据之一,其真正的证据价值,取决于它能否经得起"可重复检索—透明筛选—偏倚评估—证据分级"这套循证流程的检验。

这正是系统评价(systematic review)与 Meta 分析的用武之地。系统评价不是"综述",它是一种可复现的研究方法:预先设定纳入标准与检索策略,系统检索全部相关证据,对纳入研究逐一评估偏倚风险,再对证据体进行分级。中国化妆品功效宣称的合规框架已经为"文献/研究数据"留出了位置,而把这个位置"做实"的方法学工具,主要来自循证医学。本文的任务,是把这两条线接起来:法规给了"文献"一个合法席位,方法学则决定这个席位上的证据是否可信、可信到何种程度。

二、中国法规框架下"文献/研究数据"作为功效依据的适用情形

2.1 规范的结构:五类评价依据、四个适用层级

《化妆品功效宣称评价规范》(国家药品监督管理局公告 2021 年第 50 号,2021 年 4 月 8 日发布,自 2021 年 5 月 1 日起施行,以下简称《规范》)第三条将功效宣称评价定义为"通过文献资料调研、研究数据分析或者化妆品功效宣称评价试验等手段……作出相应评价结论的过程"。据此,功效宣称依据在法条上可归为两大类、共五小类:非试验类(文献资料调研、研究数据分析)与试验类(人体功效评价试验、消费者使用测试、实验室试验)。其中实验室试验依《规范》第二十条(五)的定义,包括但不限于动物试验、体外试验(离体器官、组织、细胞、微生物、理化试验)等。

需要特别指出的是《规范》第五条与《化妆品监督管理条例》第二十二条之间的呼应:《条例》第二十二条要求注册人、备案人"公布功效宣称所依据的文献资料、研究数据或者产品功效评价资料的摘要";《规范》第五条进一步规定"功效宣称依据包括文献资料、研究数据或者化妆品功效宣称评价试验结果等"。这意味着"文献资料/研究数据"是上位法明文认可的依据形式,但它的适用范围被《规范》第八至十二条和附1(化妆品功效宣称评价项目要求)作了严格的差异化限定。

2.2 第八条与附1:文献"可单独"与"仅可搭配"的分水岭

《规范》第八条规定:"仅具有保湿和护发功效的化妆品,可以通过文献资料调研、研究数据分析或者化妆品功效宣称评价试验等方式进行功效宣称评价。"这是全文唯一一处允许文献/研究数据单独作为依据的条款。对应的附1 中,保湿、护发两行在"人体功效评价试验、消费者使用测试、实验室试验、文献资料或研究数据"四栏中均标注为"*"(可选,但至少选择一项),即注册人、备案人可从四类依据中任选其一,纯文献路线在保湿、护发上是合规的。

与之形成对照的是第九条:抗皱、紧致、舒缓、控油、去角质、防断发、去屑,以及宣称"温和(无刺激)"或量化指标(如宣称保持时间、统计数据等)的化妆品,"应当通过化妆品功效宣称评价试验方式",可同时结合文献资料或研究数据分析结果。附1 中这九行(第7—13 项及第18、19 项)在试验三栏标注"*"、在"文献资料或研究数据"栏标注"△"。附1 的说明对"△"的定义是:"为可搭配项目,但必须配合人体功效评价试验、消费者使用测试或者实验室试验一起使用。"

这是理解中国化妆品"文献支持"制度最关键的细节:**"*"与"△"的区别,就是"文献能否独当一面"的区别。** 保湿、护发可以"纯文献";抗皱、紧致、舒缓等则"文献只能锦上添花、不能雪中送炭"——单独以文献/研究数据支持抗皱宣称,不满足《规范》第九条与附1 的要求,实践中已被监管部门认定为不充分(参见部分地方行政复议与行政处罚案例中对第八条与第九条适用范围的辨析)。

再往上,第十条规定祛斑美白、防晒、防脱发、祛痘、滋养、修护"应当通过人体功效评价试验方式进行功效宣称评价";第十一条第一款规定特定宣称(宣称适用敏感皮肤、宣称无泪配方)"应当通过人体功效评价试验或消费者使用测试的方式进行功效宣称评价"。这两类功效的附1 标注为"√"(必做)或"*/*"(二选一),文献资料在其中没有法定席位

2.3 第十一条第二款:原料功效到产品功效的传导规则

《规范》第十一条第二款规定:"通过宣称原料的功效进行产品功效宣称的,应当开展文献资料调研、研究数据分析或者功效宣称评价试验证实原料具有宣称的功效,且原料的功效宣称应当与产品的功效宣称具有充分的关联性。"这一条是原料—成品证据传导的核心,也是化妆品领域系统评价最常被调用的场景之一——"特定宣称(原料功效)"在附1 中四栏均标注"*"(四选一),理论上允许以文献单独支持原料功效宣称。

但"充分的关联性"是一个容易被低估的门槛。它至少包含三层含义:其一,原料的功效方向必须与产品宣称一致(不能以原料的抗皱文献去支持产品的舒缓宣称);其二,文献中的浓度、基质、使用条件应能合理外推到该产品(以 0.01% 原料文献支持含 5% 原料产品的宣称尚可,反向则需论证);其三,原料在成品配方中的添加量与稳定性足以在正常使用条件下重现文献所证实的功效。这三点,恰好与系统评价中的"间接性(indirectness)"判据高度同构,为下文将 GRADE 引入化妆品文献评估提供了制度接口。

三、系统评价方法学:PICO 框架与 PRISMA 2020 报告规范

3.1 从"想查什么"到 PICO/PIRO:问题的结构化

系统评价的第一步不是打开数据库,而是把功效问题结构化为可检索、可判定的形式。干预类问题用 PICO:人群(Population)、干预(Intervention)、对照(Comparator)、结局(Outcome)。以"烟酰胺能否改善面部皮肤屏障/保湿"为例:P = 健康成人面部皮肤(或轻中度屏障受损人群);I = 外用含烟酰胺产品;C = 赋形剂/空白对照或基准保湿剂;O = 经皮水分流失(TEWL)、角质层含水量、保湿评分等。

化妆品功效问题常带一个 PICO 装不下的维度——剂量/浓度与暴露时长,因此衍生出 PIRO(Population、Intervention、Regimen/浓度与频次、Outcome)或把浓度并入 I 的细化框架。是否预先框定浓度区间、时长区间,直接决定后续 Meta 分析能否合并:浓度 2% 与 10% 的烟酰胺若不做区分地合并,产出的合并效应量在生物学上是可疑的。

3.2 PRISMA 2020:27 项报告清单

PRISMA(Preferred Reporting Items for Systematic reviews and Meta-Analyses)是系统评价的报告规范,不是开展方法。它规定"写什么",而"怎么做"由 Cochrane 手册规定,二者互补、不可混淆。PRISMA 2020(Page MJ 等,BMJ 2021;372:n71)取代 2009 版,其 27 项清单分属七个板块:标题(第1项)、摘要(第2项)、引言(第3—4项:理由、目的)、方法(第5—15项)、结果(第16—22项)、讨论(第23项)、其他信息(第24—27项)。

方法部分 11 项是清单的技术重心:第5项纳入/排除标准与分组;第6项信息来源(所有数据库、注册平台、网站、参考文献清单及各来源最后检索日期);第7项完整检索策略(含过滤器与限定);第8项筛选过程(几人独立筛选、是否用自动化工具);第9项数据提取过程;第10项数据条目(结局与变量的定义、对缺失信息的假设);第11项偏倚风险评估方法与工具;第12项效应指标(如比值比 OR、均数差 MD、标准化均数差 SMD);第13项综合方法(含 Meta 分析模型、异质性识别、亚组分析、敏感性分析);第14项报告偏倚评估方法;第15项证据确定性(如 GRADE)评估方法。结果部分第16—22项对应报告检索筛选流程(流程图)、纳入研究特征、偏倚结果、单个研究结果、综合结果、报告偏倚与确定性评估。

对化妆品功效系统评价而言,最容易被"省略"的三项恰恰最致命:第7项(不给出可复现的检索式,读者无法判断检索是否偏倚)、第11项(不评估纳入研究的偏倚风险,把随机对照与无对照的小样本试验等权混合)、第15项(不做确定性分级,只报"有效"结论却不交代证据强度)。这三项直接决定了"文献支持"是证据还是广告素材。

3.3 PROSPERO 前瞻性注册

PROSPERO(International prospective register of systematic reviews,由英国约克大学 Centre for Reviews and Dissemination 维护)是系统评价的前瞻性注册平台,注册号形如 CRD420xxxxxxxx。注册的核心价值在于预先固定研究问题、检索策略、纳入标准与计划的分析方法,从而压缩"结果驱动"的操纵空间(如事后删改结局、选择性报告亚组)。PRISMA 2020 第24项要求报告注册信息与方案偏离。化妆品领域的真实注册示例:一项烟酰胺外用治疗特应性皮炎的系统评价注册号为 CRD42024583712;一项外用抗光老化干预的网络 Meta 分析注册号为 CRD42024528500——后者说明注册机制同样适用于包含化妆品功效成分的皮肤研究。

四、偏倚风险评估与证据分级

4.1 为什么必须先评偏倚,再谈结论

系统评价的结论强度,上限由纳入研究中偏倚最大的部分决定,而非由多数研究决定。化妆品功效文献的突出问题是研究设计高度混杂:既有随机、双盲、赋形剂对照的规范试验,也有无对照的开放标签前后比较、甚至仅凭仪器读数变化的"试验"。把这些证据等权相加,会得到系统性膨胀的效应估计——偏倚(bias)与随机误差不同,它不随样本量增大而消失,而是稳定地把估计推向某一方向。因此,偏倚风险评估是系统评价的强制步骤,也是 GRADE 分级的第一道闸门。

4.2 RoB 2:随机对照试验的五域评估

RoB 2(Risk of Bias 2,Sterne 等,BMJ 2019;366:l4898)是 Cochrane 评估随机试验偏倚的现行工具,针对每个结局(而非每篇研究整体)评估五个域:

  1. 随机化过程产生的偏倚(分配序列如何生成、是否隐藏分配、基线是否失衡);
  2. 偏离既定干预产生的偏倚(受试者与执行者是否设盲、是否按意向性分析);
  3. 结局数据缺失产生的偏倚(失访是否均衡、是否有证据表明缺失导致偏倚);
  4. 结局测量产生的偏倚(结局评估者是否设盲、测量工具是否恰当);
  5. 选择性报告结果的偏倚(是否按预设方案报告全部结局)。

每个域经信号问题(signalling questions)判定为"低风险/有一定顾虑/高风险"。对主观性强的化妆品结局(如目测皱纹分级、自我感知舒缓),第2、4域几乎必然成为关注点:若试验未设盲且结局为主观评分,风险常被判定为"有一定顾虑"甚至"高风险"。

4.3 ROBINS-I:非随机干预研究的七域评估

化妆品领域大量研究并非随机试验(如开放前后对比、历史对照、半脸对照但未随机)。此时用 RoB 2 不恰当,应改用 ROBINS-I(Risk Of Bias In Non-randomised Studies of Interventions,Sterne 等,BMJ 2016;355:i4919),它评估七个域:

  1. 混杂产生的偏倚(是否识别并控制关键混杂,如季节、基础肤质、防晒行为);
  2. 研究对象选择产生的偏倚(纳入与分组时点是否可能受结局或干预影响);
  3. 干预分类产生的偏倚(干预/暴露的定义与测量是否清晰、是否可能错分);
  4. 偏离既定干预产生的偏倚;
  5. 缺失数据产生的偏倚;
  6. 结局测量产生的偏倚;
  7. 选择性报告结果的偏倚。

前三个域针对干预开始前的偏倚来源,是 ROBINS-I 相对 RoB 2 的核心增量——非随机研究的最大威胁是混杂与选择,而非随机化过程本身。判定等级为"低/中等/严重/危殆/无信息";若任一域为"危殆",该结局通常被排除出定量综合。ROBINS-I 要求评估者预先声明期望的混杂因素与共同干预,这一"预设"动作与 PROSPERO 注册的精神一致。

4.4 QUADAS-2:诊断准确性研究的四域评估

当系统评价回答的不是"干预是否有益",而是"某项检测/仪器读数能否准确识别某皮肤状态"(如用皮肤成像区分敏感肌、用仪器测含水量判断保湿)时,适用 QUADAS-2(Whiting 等,Ann Intern Med 2011;155:529-536)。它评估四个域——研究对象选择、待评检测(index test)、金标准(reference standard)、流程与时机——并单独评估"适用性关切"。化妆品功效评价里"仪器替代临床终点"的问题(如以 TEWL 代理屏障功能)本质上是一个诊断准确性问题,QUADAS-2 是判断"仪器读数能否支撑宣称"的合适工具。

4.5 工具选择总览

下表汇总化妆品领域常见研究类型与偏倚工具的对应关系。

研究类型 适用工具 域数 判定等级
随机对照试验(RCT,含半脸随机对照)RoB 25低风险/有一定顾虑/高风险
非随机干预研究(开放前后、历史对照、非随机半脸等)ROBINS-I7低/中等/严重/危殆/无信息
诊断/测量准确性研究(仪器或评分判定皮肤状态)QUADAS-24低/高/不清楚(另评估适用性)
队列/病例对照观察研究(辅助判断安全信号)ROBINS-I(或 NOS)7同上

4.6 GRADE:证据体的分级

偏倚工具评估的是单个研究,GRADE(Grading of Recommendations Assessment, Development and Evaluation,工作组见 gradeworkinggroup.org)评估的是针对某个结局的证据体,产出"证据确定性"四级:高、中等、低、极低。

GRADE 的起点由研究设计决定:无重要局限的随机试验起始为"高",观察性研究起始为"低"。随后依五个因子降级(每个降 1 或 2 级):

  1. 偏倚风险(研究设计或执行中的局限);
  2. 不一致性(研究间结果差异大且无合理解释,对应 Meta 分析中的异质性);
  3. 间接性(研究的 PICO 与实际应用场景有重要差异,如人群、干预、对照、结局或替代终点不同);
  4. 不精确性(样本量小、事件数少、可信区间宽);
  5. 发表偏倚(阴性结果未发表、选择性报告)。

三个因子可升级(用于观察性研究):

  1. 大效应(效应量大且方向一致);
  2. 剂量—反应梯度(剂量/浓度与效应呈单调关联);
  3. 残余混杂(所有可预期的混杂若被校正,只会使效应更明显,而非稀释)。

化妆品语境下最常用到的降级因子是"间接性"与"不一致性":前者对应 2.3 节谈到的原料—成品传导与浓度外推问题,后者对应不同配方、浓度、评估时长的研究难以合并的困境。GRADE 的结论不是"有效/无效",而是"高/中/低/极低确定性证据显示……",这一措辞方式正是从证据走向宣称摘要时最需要的。

4.7 OCEBM 2011 与 GRADE 的差异

牛津循证医学中心证据等级(OCEBM Levels of Evidence Working Group,"The Oxford 2011 Levels of Evidence")按问题类型(治疗、诊断、预后、筛查等)把证据排成 1—5 级:以治疗获益为例,1 级为随机试验的系统评价(或 n-of-1 试验),2 级为单个随机试验(或效应显著的观察研究),3 级为非随机对照队列,4 级为病例系列/病例对照,5 级为机制推理。OCEBM 是"研究设计金字塔"式的层级排序,简洁但静态;GRADE 则在设计起点上叠加降级/升级因子,动态且显性化判断过程。二者不矛盾:OCEBM 回答"这类设计天然站在哪个台阶",GRADE 回答"这批具体证据现在能信几分"。对化妆品功效摘要而言,GRADE 的四级确定性更适合直接转写为宣称措辞。

五、Meta 分析在化妆品领域的可行性与陷阱

5.1 异质性:I² 与 Q 检验的准确理解

Meta 分析将多个研究的效应量加权合并,前提是研究间足够同质。异质性有两类:临床/方法学异质性(人群、干预、对照、结局、设计的差异)与统计异质性(观察到的效应量波动超出随机误差预期)。前者靠设计判断,后者用统计量量化。

Cochran Q 检验(Q 统计量)检验"研究间效应量是否一致"的原假设,但它在研究数少时检验效能低(检出不了真异质性)、研究数多时又过度敏感(把无临床意义的波动判为显著)。I² 统计量(Higgins & Thompson,BMJ 2003;327:557-560)描述"由异质性而非偶然所解释的总变异比例",范围为 0—100%。Cochrane 手册给出的是近似解读区间(非硬性切点):0—40% 可能不重要,30—60% 可能中等,50—90% 可能显著,75—100% 可能很大。关键在于:I² 衡量的是变异中异质性的占比,而非异质性的绝对大小——样本量很大时,即使效应量差异很小,I² 也可能很高。因此 I² 必须与效应量的实际分布、可信区间宽度结合解读,绝不能单独以"I² > 50% 就拒绝合并"或"I² < 50% 就放心合并"。

5.2 固定效应模型与随机效应模型

固定效应模型假设所有研究估计同一个真实效应,研究间差异纯属抽样误差,权重主要取决于研究内方差(大研究权重高);随机效应模型(经典 DerSimonian-Laird 法)假设真实效应服从一个分布,允许研究间存在真实差异,权重在存在异质性时更均衡,且合并可信区间更宽。选择依据是研究间的同质性判断而非 I² 的机械阈值:若研究在浓度、配方、人群、结局上明显异质,即使 I² 不高,随机效应模型也更稳健;反之,同质的同一方案重复研究可用固定效应。需要警惕的是,随机效应模型不是"异质性过大时继续合并的通行证"——当临床异质性大到合并结果失去解释意义时,正确做法是放弃合并、改做定性综合(narrative synthesis)。

5.3 效应量与显著性:两个不可混淆的概念

效应量回答"效应有多大",显著性回答"这个效应是否可能纯属偶然"。前者如均数差(MD,用于同单位连续结局,如 TEWL 的绝对变化)、标准化均数差(SMD,用于不同量表的同一构念,如不同皱纹评分系统)、相对危险度(RR)与比值比(OR,用于二分类结局)。后者是 p 值或可信区间。化妆品功效文献的常见错误是只报 p 值不报效应量与精度:一个 p<0.05 的结论,若效应量微小(如保湿评分 0.3 分、95%CI 跨越无临床意义阈值),在功效宣称上并无实质价值。同样,ITT(意向性分析,按随机分组分析全部受试者)与 PP(符合方案分析,仅分析完成方案者)的差别也必须澄清:ITT 保留随机化的平衡、反映"真实世界"效应,PP 则可能因选择性失访引入偏倚;两者回答的问题不同,绝不可混用或选择性选用更有利的那个。

5.4 亚组分析、敏感性分析与发表偏倚

当合并结果存在显著异质性时,亚组分析(按预先指定的特征分层,如按浓度区间、按研究设计、按评估时长)用于探索异质性来源,但亚组结论属观察性质,需谨慎解读(多重比较会膨胀假阳性,PRISMA 第13e项要求报告其预设性)。敏感性分析(如剔除高风险研究后重估、逐一剔除单篇研究 leave-one-out、改用另一效应模型)用于检验合并结果的稳健性(PRISMA 第13f项)。

发表偏倚(及更广义的报告偏倚)指结果"显著"或"阳性"的研究更易发表,导致合并效应被高估。检测工具:漏斗图(以效应量为横轴、精度为纵轴的散点,无偏倚时呈对称倒漏斗)、Egger 回归检验(检验漏斗图不对称性的线性回归,检验效能通常高于 Begg)与 Begg 秩相关检验。需强调:漏斗图不对称既可能源于发表偏倚,也可能源于小研究效应、真异质性或方法学质量差异,不能把不对称简单等同于"存在发表偏倚"。在纳入研究数很少(如 <10 篇,化妆品领域常见)时,上述检验效能极低,几乎无法可靠检出发表偏倚——这是化妆品系统评价必须坦白的方法学局限。

六、化妆品领域系统评价的特殊挑战

体外试验能否纳入系统评价? 可以,但必须分层处理,不能与人体研究合并。体外数据(细胞活力、基因表达、胶原合成等)回答的是机制与"可能有效"的问题,属 OCEBM 的机制推理层级,GRADE 下通常起始于低/极低确定性。合理的做法是:体外证据单独定性综合,作为"机制合理性"支撑;人体试验单独综合,作为"功效效力"支撑;二者之间以"机制—效力"桥接而非统计合并。

原料研究与成品研究的可整合性。 这是化妆品系统评价最根本的"间接性"问题。以烟酰胺为例:文献中烟酰胺以 2%—10% 浓度、不同基质(凝胶、乳霜、洗剂)、不同频次出现,且常与其他活性物复配。把这些研究合并出"烟酰胺有效"的单一结论,掩盖了浓度—基质—复配的异质性。可操作的策略是:以"单一活性、浓度区间、赋形剂对照、人体结局"为纳入门槛压缩间接性,或用亚组/元回归把浓度作为调节变量显性化。

浓度与基质差异如何处理? 除亚组分层外,还应优先纳入报告了浓度与基质的原始研究,并在提取表中固定"浓度、基质、时长、对照类型"四个字段;当基质差异过大(如含促渗剂的配方 vs 惰性赋形剂)时,应降级(GRADE 间接性)或放弃合并。

动物试验禁用下的证据基础重构。 中国化妆品安全评估与新原料备案语境下,动物试验逐步受限,"3R"原则(减少、替代、优化)推动体外替代方法兴起。这意味着既往依赖动物数据的功效证据链出现缺口,需以体外机制 + 人体试验 + 消费者使用测试 + 文献系统评价来重构。系统评价在其中的价值尤为突出:当单一来源证据被削弱时,只有把多方证据以透明方式综合与分级,才能为"无动物试验"背景下的功效宣称提供有据可依的替代论证。

七、典型案例:从具体系统评价到功效摘要

案例一:视黄醇(维生素 A 类)抗衰——一篇"审慎"的系统评价。 Spierings(J Clin Aesthet Dermatol,2021 年 9 月,14 卷 9 期,PMID 34980969)针对非处方(OTC)视黄醇类化妆品改善面部皮肤衰老,以 PubMed 检索"retinoid、tretinoin、retinol、retinal、retinaldehyde、skin"等词,纳入 9 篇随机、双盲、赋形剂对照试验。结果:4 篇报告治疗组与赋形剂组无统计学显著差异;其余 5 篇仅提供视黄醇对细纹"轻度改善"的弱证据,且被逐条批评存在重大方法学缺陷。结论是:在至少一篇高质量试验出现之前,几乎没有可信证据支持 OTC 视黄醇改善老化外观。这篇评价的示范意义在于:它用同一套偏倚审视标准,把"阳性试验"降格为"广告素材",直接演示了"查了文献"与"有依据"的差距。

案例二:外用抗光老化干预的网络 Meta 分析——一篇"综合比较"的量化评价。 Lin 等(Scientific Reports,2025,15:26889,DOI 10.1038/s41598-025-12597-0)按 PRISMA 指南检索 PubMed、Embase、Web of Science 与 Cochrane CENTRAL(检索至 2025 年 6 月 1 日),注册于 PROSPERO(CRD42024528500),纳入 23 篇 RCT、3905 名受试者,以贝叶斯网络 Meta 分析比较多种外用抗光老化成分。核心结论:异维 A 酸、视黄醇、维 A 酸对细纹改善显著(异维 A 酸排序最高);他扎罗汀对粗大皱纹最有效;维 A 酸与视黄醇在色素沉着上更优;安全性上维 A 酸最佳。作者同时承认研究在种族多样性、潜在商业偏倚与皮肤评估方法上的局限。

案例三:烟酰胺的适应证系统评价。 Albadawi 等(International Journal of Medicine in Developing Countries,2026,10(6):1635-1639,DOI 10.24911/IJMDC.51-1768252893)按 PRISMA 检索 MEDLINE、EMBASE、Google Scholar、CENTRAL,注册 PROSPERO(CRD42024583712),纳入 3 项研究、490 名特应性皮炎成人,发现烟酰胺相关制剂与疾病严重度改善(SCORAD 下降约 25%)及屏障功能改善(TEWL 下降约 15%)相关,但因方法学与临床异质性未进行 Meta 分析。这个案例说明:纳入研究过少、异质性过大时,正确结论是"定性综合 + 明确限定",而非强行合并出一个数字。

从证据到宣称的衔接示范。 以"烟酰胺保湿"为例,若系统评价经 GRADE 评级为"低确定性证据(因研究间配方异质与样本量小而降级)显示外用烟酰胺可减少经皮水分流失",则功效宣称依据摘要的合规措辞应写为:"经文献资料调研(系统评价/证据综合),提示烟酰胺具有减少经皮水分流失、支持皮肤屏障的作用;该结论基于 X 项人体研究,证据确定性为低——中等,具体配方功效以本产品的人体功效评价试验/消费者使用测试结果为准。"要点有三:把 GRADE 四级转写为"高/中/低/极低"的通俗表述;把"原料功效"与"本产品功效"分开陈述,呼应《规范》第十一条第二款的关联性要求;对仅可用文献的保湿/护发宣称,直接陈述文献结论;对需试验的宣称,明确文献为辅助而非替代。

八、讨论与展望

AI 文献检索的双刃剑。 大模型辅助检索与筛选可大幅提升效率,PRISMA 2020 第8、9项也要求报告自动化工具的使用。但 AI 存在幻觉与召回偏倚风险:它可能"自信地"生成不存在的文献或标准号,也可能漏检关键数据库。合规底线是:AI 只能作为检索与初筛的加速器,纳入/排除判定、数据提取与偏倚评估必须由人工复核,且所有文献均需回溯至原始出处核验——这正是本文开篇"铁律"的现实意义。

PRISMA 扩展模块的适用性。 PRISMA 2020 有多个扩展:PRISMA-S(检索策略 16 项)、PRISMA-ScR(范围综述)、PRISMA-P(方案)、PRISMA-NMA(网络 Meta 分析扩展)等。化妆品功效系统评价若涉及多成分比较,可参考 PRISMA-NMA(案例二即网络 Meta 分析);若仅为机制/证据地图,可用 PRISMA-ScR。

对小样本研究的应对。 化妆品功效研究普遍样本小、异质大、发表偏倚难以检测。应对策略包括:用随机效应模型并明确承认不确定性;用 GRADE 降级而非回避;用 SMD 而非 MD 跨量表合并;在纳入研究 <10 篇时放弃漏斗图/Egger/Begg 的过度解读;优先报告可信区间而非单点 p 值;把"证据缺口"本身作为结论的一部分,为后续开展高质量赋形剂对照试验提供方向。

制度层面的趋势。 随着《化妆品功效宣称评价规范》落地深化,监管对"文献资料调研"的质量要求必然从"有无文献"走向"文献是否经系统评价与分级"。系统评价方法学将从学术工具转化为合规能力:能产出可复现检索式、可核查偏倚评估、可分级证据确定性的企业,将在功效宣称的"证据竞争"中占据先手。

参考文献

  1. 国家药品监督管理局. 国家药监局关于发布《化妆品功效宣称评价规范》的公告(2021年第50号)[EB/OL]. 2021-04-08. https://www.nmpa.gov.cn/xxgk/ggtg/hzhpggtg/jmhzhptg/20210409160321110.html(抓取于 2026-09-10,含第八、九、十、十一、十二条及附1、附2)
  2. 化妆品监督管理条例(中华人民共和国国务院令第727号). 第二十二条(引自地方行政处罚决定书转引文本,抓取于 2026-09-10)
  3. Page MJ, McKenzie JE, Bossuyt PM, et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ. 2021;372:n71. doi:10.1136/bmj.n71
  4. PRISMA. PRISMA 2020 Checklist [EB/OL]. https://www.prisma-statement.org/(27项清单,抓取于 2026-09-10)
  5. Higgins JPT, Thomas J, Chandler J, et al. Cochrane Handbook for Systematic Reviews of Interventions, version 6.4 (updated August 2023) [EB/OL]. Cochrane. https://training.cochrane.org/handbook(抓取于 2026-09-10;付费正文仅引用编号与名称)
  6. Sterne JAC, Savović J, Page MJ, et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ. 2019;366:l4898. doi:10.1136/bmj.l4898
  7. Sterne JA, Hernán MA, Reeves BC, et al. ROBINS-I: a tool for assessing risk of bias in non-randomised studies of interventions. BMJ. 2016;355:i4919. doi:10.1136/bmj.i4919
  8. Whiting PF, Rutjes AWS, Westwood ME, et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Ann Intern Med. 2011;155(8):529-536.
  9. Guyatt GH, Oxman AD, et al. GRADE: an emerging consensus on rating quality of evidence and strength of recommendations. BMJ. 2008;336(7650):924-926.(GRADE 系列与方法见 gradeworkinggroup.org 及 gradepro.org,抓取于 2026-09-10)
  10. GRADE Working Group. GRADE handbook [EB/OL]. https://gradepro.org/handbook/(降级/升级因子表 5.2、5.3,抓取于 2026-09-10)
  11. OCEBM Levels of Evidence Working Group. The Oxford 2011 Levels of Evidence [EB/OL]. Oxford Centre for Evidence-Based Medicine. https://www.cebm.ox.ac.uk/(抓取于 2026-09-10)
  12. Higgins JPT, Thompson SG, Deeks JJ, Altman DG. Measuring inconsistency in meta-analyses. BMJ. 2003;327(7414):557-560.(I² 统计量)
  13. PROSPERO. International prospective register of systematic reviews [EB/OL]. University of York, Centre for Reviews and Dissemination. https://www.crd.york.ac.uk/prospero/(抓取于 2026-09-10)
  14. Spierings NMK. Evidence for the Efficacy of Over-the-counter Vitamin A Cosmetic Products in the Improvement of Facial Skin Aging: A Systematic Review. J Clin Aesthet Dermatol. 2021;14(9). PMID: 34980969.
  15. Lin L, Chen X, Liu C, et al. Comparative efficacy of topical interventions for facial photoaging: a network meta-analysis. Sci Rep. 2025;15:26889. doi:10.1038/s41598-025-12597-0.(PROSPERO: CRD42024528500)
  16. Albadawi HA, Alrimthi ES, Alomran SA, et al. Evaluating the effectiveness of niacinamide containing emollients and cleansing gel in treating atopic dermatitis: a systematic review. International Journal of Medicine in Developing Countries. 2026;10(6):1635-1639. doi:10.24911/IJMDC.51-1768252893.(PROSPERO: CRD42024583712)
  17. 化妆品功效宣称评价规范 附1《化妆品功效宣称评价项目要求》. 经由西安市碑林区人民政府等官方转引文本核实(√/*/△ 说明,抓取于 2026-09-10)

常见问题解答

《化妆品功效宣称评价规范》里,保湿功效能不能只用文献、不做试验?

能。第八条规定仅具保湿和护发功效的化妆品,可通过文献资料调研、研究数据分析或功效宣称评价试验等方式评价;附1 中保湿、护发四栏均标注"*"(至少选一),故纯文献路线合规。但"合规"不等于"证据强":文献系统评价的确定性经 GRADE 可能仅为低/极低,建议在摘要中如实披露证据强度。

抗皱宣称附了文献,为什么还会被认定不充分?

抗皱在第九条与附1 中要求"应当通过化妆品功效宣称评价试验方式",文献栏为"△"(可搭配,但必须配合试验使用)。单独以文献支持抗皱,不满足第九条,监管部门可依此认定依据不足。

原料有文献、产品能不能直接说原料功效?

可走第十一条第二款的"原料功效"路线,但须满足"证实原料具有宣称功效 + 原料功效与产品功效具有充分关联性"两个要件。关联性要求浓度、基质、使用条件可合理外推,与系统评价中的"间接性"判据同构,建议在摘要中把原料证据与本产品证据分开陈述。

体外试验能不能写进系统评价支持功效?

可纳入,但必须与人体研究分层综合,不能统计合并。体外数据属机制层级证据(OCEBM 5 级、GRADE 低/极低起点),其作用是"机制合理性"支撑,而非"功效效力"证明;效力仍需人体试验或消费者使用测试。

I² 很高还能做 Meta 分析吗?

I² 高提示异质性大,但 I² 不是"能否合并"的唯一判据,须结合临床异质性判断与效应量分布。若异质性大到合并结果失去解释意义,应放弃定量合并、改做定性综合,并探索亚组/元回归解释异质性来源。

本系列其他文章

延伸阅读(机制篇)

绿翊提示:功效宣称的依据链一旦与配方、检测报告和安全评估脱节,最容易在备案或上市后抽查阶段暴露,导致补充试验、改版和进度延期。绿翊合规成立于2017年,拥有4000+特殊化妆品成功申报经验和法规、安评、检测、质量复合团队,可协助设计功效评价方案、审核宣称依据并统筹检测与备案资料。产品准备送检或宣称定稿前,建议先提交配方与宣称进行预审。