科学慈善需要什么样的评估?

中国慈善家 · 2026-09-24

 

编者按

本专栏第52期,何国科律师从法律和实务角度梳理了科学慈善面临的三组实践障碍:基金会能不能资助企业开展科研;科研成果的知识产权归谁、慈善资金与商业化的边界在哪里;科研项目应该怎样接受审计和评估。合规负责划定“可以做什么”的边界,但边界之内“做得好不好”,最终要落在评估上。

为此,专栏邀请评估方向的青年学者朱照南,从科技评估的国际经验和评估理论出发,对科学慈善需要何种评估进行梳理。朱照南曾受科技部科技评估中心委托,梳理各国科技评估的指南文件,这些案例中的具体评估困境、经验和教训,或许可以为中国科学慈善的发展提供一些参考。

可计算的和有价值的

何律师有一句话我非常认同:“不是项目没有价值,而是我们的评价工具不适合它。”我想给这句话加一个注脚:除了评价工具“不适合”这个层次,这里还藏着一个更深刻的挑战:凡是长期、复杂、价值多元的人类活动,被评估时都会遭遇几重无法被技术手段彻底消除的困境。科研如此,公益如此,教育、医疗也如此。

在《形式指标与实质指标:慈善组织评估指标的僭越及其后果》一文中,我提出过一对概念:依据规范性要求、偏重量化和痕迹核查的指标是形式指标,票据、签收单、会议记录、受益人数都属此类;试图呈现组织和项目真实运作状况与实际效果的指标,是实质指标。

形式指标的正当功能是守住合规底线,但实践中经常僭越实质指标,用最容易核查的东西,替代了最值得关心的东西。被评估者围绕“痕迹”组织工作,评估非但没有促进实质,反而制造了形式主义。

科研项目的评估更容易放大这一困境。基础研究以五年、十年为单位见效,而审计一年一轮;探索未知意味着多数假设终将被证伪,而传统评估默认“承诺的产出必须交付”;成果是论文、专利、人才、认知的改变,形态多样且严重滞后,过程材料则少得可怜,一个实验室一年可能只有一份研究进展报告。科研的价值,恰恰在形式指标无法测量的地方。

那么把形式指标换成量化指标行不行?很遗憾,英国的经验同样给出了否定的回答。

英国“卓越研究框架”(REF)是世界上利益相关度最高的科研评估之一,结果直接决定英格兰每年约13亿英镑主流科研拨款的分配。各机构只提交精选代表作和讲述研究如何改变政策、产业与社会的“影响力案例”,交由同行专家通读评议。2015年英国官方委托完成的评审报告《指标的浪潮》(The Metric Tide)专门检验了“能否用量化指标替代同行评议”,结论很确定:量化指标与同行评议结果的相关性不足,只能辅助判断。

REF官方委托的独立评审发现,REF 2021全流程花费约4.71亿英镑,是上一轮的近两倍;影响力案例被批评为精心包装的“讲故事竞赛”。美国智库兰德公司(RAND Corporation)的调查显示,多数英国研究者认为REF对本国科研文化总体是负面影响,青年学者感受更深,但多数人认可2021年规则改进的方向,且表示REF并未直接改变自己个人的研究,负面感受集中在系统与文化层面。此外,REF还被批评抑制了高风险、长周期的研究,对以专著为载体的人文学科尤其不利。2024年,有研究者依据官方委托的评审结果给出了一个耐人寻味的概括:REF“并没有让研究变得更好”。

为什么会这样?底层原因不在指标形态,而在测量与被测量对象之间的关系。一项量化社会指标越是被用于社会决策,就越容易受到腐蚀压力,也就越容易扭曲和败坏它本来要监测的社会过程,这是“坎贝尔定律”。丹麦评估学者拉尔森(Peter Dahler-Larsen)进一步提出,指标不是在完成测量之后顺带产生副作用,而是在根本上参与构成了它所声称测量的那个现实,界定什么算问题、什么算成绩、谁是好组织,他称之为绩效指标的“构成性效应”(Constitutive Effects)。因此,量化指标、质性指标都会被异化,区别只在于与资源、声誉和职业前景绑定得有多紧。

这也正是中国科研评价改革此刻的处境。2018年以来,“破四唯”“破五唯”、代表作制度、分类评价渐次推开,方向与国际转向一致,但仍处于“破易立难”的困境之中——破掉数论文容易,替代性的评价标准和评价能力还没有建立起来。

顺着这个分析,“立”的方向或许需要重新理解。现实中的评估体系在设计上千差万别:谁来评(政府、行业、平台、第三方),为何评(监管筛选还是发展支持),评什么(合规、绩效、能力、透明度),结果与资格和资金绑定得有多紧,过程是打分式还是协商式,结果以等级标签还是叙述报告呈现。这些差异会带来系统性不同的后果。

让单一体系承担全部功能,往往是评估失灵的共同起点。更有希望的方向是让不同性质的评估各归其位,形成有分工的评估生态:监管性评估守住合规底线,不必额外承担识别卓越的任务;支持性评估陪伴组织改进,不必背负筛选和排名的压力;行业性评估负责信息透明,把判断权交还给资助方。

问责,还是学习

评估领域最常讨论的一个问题是:评估到底为了什么?是向出资人证明钱花得值(问责),还是帮助做事的人做得更好(学习)?评估目的不同,立场、指标、方法乃至最终发现都会不同。

非营利组织同时面对资助方、监管者、受益人和公众多方的问责要求,这种情况在学术上被称为“多重问责失序”(Multiple Accountabilities Disorder)。非营利评估专家易卜拉欣(Alnoor Ebrahim)把问责压力下的典型病症称作“问责短视”(Accountability Myopia),即组织紧盯报告与合规,看不见组织学习,最终连问责本想保障的绩效也一并失效。正如一线公益组织花费大量资源应付问责,评估反而成了负担,“解决问题的方案本身变成了问题”。

问责还是学习,英国和荷兰为这两个端点提供了样本。

问责端是英国的REF。案例直接关系一所大学未来数年的拨款,博弈动机足够强。一项对REF 2014高分与低分影响力案例的对比研究发现,高分案例普遍符合一种清晰、直接、简化因果关系的写作体裁,可读性显著更高——写作风格的隐性规则可能与公开的评审标准一起影响了评分。这种高利害的绑定,使问责功能在实际运行中压过了学习功能。

学习端是荷兰的《战略评估协议》(SEP)。研究单位先写约20页自我评估,对照自己设定的战略目标,指标自选;外部委员会审阅材料、实地考察之后,给出一份帮助改进的定性报告。一个论文数量平平的研究组,只要让委员会看到它在开放科学、学术文化和博士生培养上的扎实积累、朝自己设定的方向稳步推进,同样可以得到正面评价。在这套“宽松”制度下,荷兰科研在国际比较中长期位居前列。两者未必构成因果,但至少说明不打分与高水平科研可以并存。

学习导向同样有代价。对SEP的批评集中在:各单位自定目标、自选指标,机构之间不可比,议会想知道“钱花得值不值”时给不出直接答案;评估高度依赖研究组的叙述,“会写”可能替代“做得好”;结果不与经费挂钩,改进建议缺乏抓手。荷兰学界自己也在追问,研究单位和评估者能否驾驭这么大的自由度。

美国国家科学基金会(NSF)2023年发布的《评估政策》,把“指导改进”与“问责”并列为评估的多元目的,交给每一次具体的评估去权衡。但NSF的另一项制度“更广泛的影响”(Broader Impacts),显示了另一个问题:把理念写进标准,不等于落进实践。这个标准被科学家持续批评为模糊难评。追踪研究发现,“更广泛影响”从申请书到结项报告整体缩水约14%,而且缩水几乎全部发生在面向弱势群体和普惠人群的部分,面向优势群体的影响数量基本不变。没有配套的评审能力和跟踪机制,再好的标准也会变成申请书里的漂亮段落。

三个样本放在一起可以看到,问责与学习不是是非题,站在哪个位置取决于钱从哪里来、必须向谁负责。这是制度选择,不是技术问题。

中国基金会并非没有外部问责,年检、等级评估、《慈善法》的信息公开要求都真实存在;但相对于花纳税人的钱、必须向全民交代的政府科研拨款,慈善资助在“如何定义和评估成功”上的自主空间理应更大一些。这份自由度本身就是慈善相对政府资助的一项制度优势,问题在于是否自觉地使用它。

谁来定义成功

评估所依据的“好”,是谁的“好”?公益面对的问题涉及多个利益相关方,捐赠人、执行者、受益人、公众有不同的、甚至冲突的价值诉求;评估选取什么标准、听取谁的声音,从来不是中立的技术操作,而是一种价值立场。科研资助同样如此:一项研究,学术共同体认为严谨漂亮,但它回应的是谁的问题?成果最终惠及了谁?

国际农业研究磋商组织(CGIAR)给出了一个比较明确的制度回答。作为全球最大的公共农业科研资助网络,它的结构与科学慈善几乎同构:出资方提供资金,科研机构做研究,最终受益人是发展中国家的小农户。CGIAR在评估指南中把“面向发展的研究质量”(QoR4D)拆解为四个要素:相关性、科学可信度、正当性、有效性。“正当性”问的是研究过程是否公平、包容,被利益相关方认可。换句话说,“研究做得好不好”,当地社区有发言权,学术严谨在这个框架里只占四分之一。

反面证据来自NSF。一项对397个NSF资助项目的分析发现,这些项目声称产生的社会影响,流向优势群体的密度(每百万美元3.27次)明显高于流向边缘群体(0.75次);还有约十分之一的项目,结项报告里找不到可辨认的社会影响。研究者的解读是:结项报告被看重的是“交没交”,而不是“做没做成”。如果没有人追问“影响了谁”,“社会影响”就容易流向离研究者最近、最方便触达的人群。

这对科学慈善的警示是直接的。慈善的问责结构天然向上倾斜,评估报告呈给理事会、捐赠人,很少抵达受资助的科研团队,更不用说其服务的公众,这就是“向上问责”对“向下问责”的挤出与替代。国际发展领域几十年的教训,包括CGIAR自身,正是评估的“捐赠方导向”。也要承认,CGIAR式的多维质量观操作门槛不低,指南自己就说,覆盖四要素需要“足够的资源保障”——理念的先进程度和落地成本大体成正比。

四个国际样本的模式对比。

 

四个国际样本在“问责—学习”光谱上的位置与各自代价。

 

一场正在发生的全球评估转型

将前文的各国案例放在一起,可以看到一个比较清晰的趋势与方向:它们是同一场全球评估转型在科技评估领域的显影。

我这几年追踪国际评估前沿的核心发现是,这场评估范式转型的深度超出了方法层面的更新换代。2020年美国评估协会年会上,时任主席帕森斯(Beverly Parsons)指出,当前评估领域关于社会和经济系统的基本假设来自工业时代,把世界看作可拆解、可测量、可控制的机器,而这些基础假设急需转型,转向承认地球和人类社会是活的、自组织的系统。评估的经典定义也在被改写,评估学者施华特(Thomas A. Schwandt)和盖茨(Emily F. Gates)主张评估要从“确定价值”走向“发展价值”,从项目末端的一锤定音(我们做得如何),扩展为持续的、共同建构的评价性学习(我们接下来应该做什么)。

我曾把这场转型概括为从“价值验证”走向“共创未来”的五个趋势:从线性思维到系统复杂性、从单一文化到多元包容、从外部判断到参与共创、从技术工具到反思实践、从评价过去到共创未来。前文的案例分别对应了不同的层面,并共同指向第五条:评估的时间之箭调头,不再只是照向过去的后视镜,而开始参与塑造未来。

需要如实说明的是,这场转型仍在早期。以随机对照试验为代表的证据分级路径,在国际发展与公共政策评估中依然占据主流位置。更准确地说,当前正在形成的是一股方向清晰、正在壮大的潮流,但其仍处在与旧范式的拉锯之中。

全球评估转型的五个趋势。

 

这个图景可能改变科学慈善对自身位置的判断。只看国内传统的项目评估惯例,进入科研资助的基金会似乎面对着一套不太合用的工具,处处别扭;放到全球转型的坐标系里,它此刻遇到的评估难题,恰恰是国际评估领域正在讨论的前沿议题。

出路:走向自觉的评估

评估工具的“不适合”,根源在这三重固有困境:测量有其限度、问责与学习必须权衡、“好”需要被多元地定义。它们没有终极解法,只有或自觉或不自觉的取舍。英国、美国、荷兰和CGIAR的实践提供了一份“每种取舍的代价清单”,全球评估转型提供了做取舍时的方向感。评估的成熟,在于带着对困境的清醒认知去设计制度,放弃彻底“消灭”困境的幻想。这也是我理解的评估思维的核心:与其掌握更多测量技术,不如始终追问评估本身的假设、立场与后果。

基于前文的梳理,这里为进入科研资助领域的中国慈善组织提供几条参考建议。

第一,让“谁受益”成为必答题。在评估框架里给“正当性”留一个位置:研究回应的是谁的问题?过程是否尊重了相关社区?成果的通路是否真的通向最需要的人?评估报告除了呈给理事会,更要反馈给科研团队。评估者的角色也要从“测量技术员”和“风险管理者”,向“能力建设者”拓展。

第二,行业共建,而不是各自摸索。行业组织可以参照QoR4D的多维质量观和SEP的自我评估结构,制定本土化的科技类慈善项目评估指引;建立科学家、公益、法律、财务混合的评审网络。

第三,挖掘和梳理本土评估经验。中国公益评估界以“支持型评估”和“基于公益项目模式的评估”为代表,强调评估者与被评估方的协作关系、以评估促进组织发展,与全球评估转型的方向相合。腾讯发起的“新基石研究员项目”以十年百亿元的规模资助基础研究,明确“选人不选项目”、不设成果考核期限、由科学家主导遴选,这是对传统项目制评估的一次主动背离,且颇有成效。

中国的国家科研评价体系正卡在“破易立难”的关口,而慈善资助体量小、机制活、试错成本低,科学慈善完全有条件成为中国科研评估创新的试验田,在“立”的这一端先行探索。这或许是科学慈善对中国科技创新的另一种贡献:除了捐钱,还包括探索一种更懂科学的、能够更好地推动科技向善的评估文化。 

科学的价值不在票据和签收单里,也不完全在任何一套指标体系里。评估的三重困境不会因为对象换成科学而消失,只会更加醒目。全球评估领域正在发生的范式转型提示我们,对这些困境比较有生命力的回应,是重新想象评估本身,让评估从末端的裁判,变成贯穿始终的学习伙伴;从验证过去的价值,变成与科学家、资助者和公众一起发展价值、共创未来。

中国的科学慈善还很年轻,评估制度尚未定型,还来得及想清楚再选择:我们要在问责与学习之间站在哪里?愿意为理想的评估支付多少成本?谁有资格定义我们所资助的科学“成功”?这也是在为中国的科研评价探路,参与一场更大范围的评估变革。

在合规为科学慈善守住底线之后,还需要一套自觉的、诚实的、面向未来的评估,来回答“什么是好”,让“评估向善”来真正支持与引领“科技向善”。

 

作 者 简 介

朱照南,管理学博士(非营利管理方向),现任教于印第安纳大学伯明顿分校 O'Neill 公共与环境事务学院,并担任公益行业评估支持平台研究部主任。拥有 15 年非营利组织评估、社会创新、公益项目评估及政府购买服务评估的研究与咨询经验,其研究与实践指向一个核心问题:在复杂变革与 AI 时代,如何重新定义与评估社会价值,如何让不可见的价值被认可,让有意义的行动被看见。

京ICP备2023001163号 京公网安备 11010202009386

COPYRIGHT ©1999-2025 ZGCSJ.COM. ALL RIGHTS RESERVED