生成式人工智能系统的安全风险评估框架构建研究

李泽伟 ,  齐佳音 ,  方滨兴

中国工程科学 ›› : 1 -17.

PDF (788KB)
中国工程科学 ›› : 1 -17. DOI: 10.15302/J-SSCAE-2025.09.026

生成式人工智能系统的安全风险评估框架构建研究

作者信息 +

Construction of Safety Risk Assessment Framework for Generative Artificial Intelligence Systems

Author information +
文章历史 +
PDF (806K)

摘要

生成式人工智能(GenAI)技术快速演进引发了安全挑战,构建相应的风险评估框架成为精准治理的迫切需求。本文基于生态风险理论的“压力源 ‒ 暴露 ‒ 效应”分析范式,将GenAI视为社会技术生态系统的压力源,构建了包含算法忠实度、技术统治度、行政治理能力3个核心维度的安全风险评估框架;提出了初步的评估指标体系,为将相应理论框架转化为可操作的测量工具提供了基础。其中,算法忠实度细分为认知忠实度(后向、前向)与情感忠实度,技术统治度考量基础设施渗透率和用户采信程度,行政治理能力基于政策布局理论评估管理部门宏观调节水平。以医疗临床辅助场景为例,对所提框架开展了探索性应用,展示了后向生成忠实度、非正式渗透风险在特定情境下的重要性以及框架在该场景中的应用逻辑与适用性。进一步阐述了未来GenAI系统安全风险治理体系的方法创新与突破方向,即构建动态、可计算的风险演化模型,发展智能化、自适应的评估验证技术,推动面向场景的模块化与差异化评估。整体上,安全风险评估框架有助于刻画GenAI风险的形成机制与传导路径,为不同场景下的差异化风险研究提供了理论支撑与模块化评估工具。

Abstract

The rapid evolution of generative artificial intelligence (GenAI) has given rise to new safety challenges, making it urgent to develop risk assessment frameworks that can support precise governance. Drawing on the stressor‒exposure‒effect analytical paradigm grounded in ecological risk theory, this study conceptualizes GenAI as a stressor within a sociotechnical ecosystem and proposes a safety risk assessment framework comprising three core dimensions: algorithmic fidelity, technological dominance, and administrative governance capacity. It further develops a preliminary system of assessment indicators, providing a basis for translating the theoretical framework into an operational measurement tool. Within this framework, algorithmic fidelity is subdivided into cognitive fidelity (including both backward-looking and forward-looking fidelity) and affective fidelity. Technological dominance considers the penetration of infrastructure and the degree of user acceptance or reliance, while the administrative governance capacity is used to assess the macro-level regulatory capacity of governing authorities based on the policy arrangement approach. Taking clinical decision support in healthcare as an example, this study conducts an exploratory application of the proposed GenAI safety risk assessment framework. The analysis preliminarily illustrates the importance of backward-looking generative fidelity and informal penetration risk in specific contexts, as well as the framework's application logic and potential applicability. The study further discusses directions for methodological innovation and breakthroughs in future GenAI safety risk governance, including the construction of dynamic and computable models of risk evolution, development of intelligent and adaptive assessment and validation technologies, and promotion of scenario-oriented modular and differentiated assessment. Overall, the proposed safety risk assessment framework helps characterize the formation mechanisms and transmission pathways of GenAI risks, providing theoretical support and modular assessment tools for differentiated risk research across diverse application scenarios.

Graphical abstract

关键词

生成式人工智能 / 安全风险评估 / 社会技术生态系统 / 算法忠实度 / 技术统治度 / 行政治理能力

Key words

generative artificial intelligence / safety risk assessment / sociotechnical ecosystem / algorithmic fidelity / technological dominance / administrative governance capacity

引用本文

引用格式 ▾
李泽伟,齐佳音,方滨兴. 生成式人工智能系统的安全风险评估框架构建研究[J]. 中国工程科学, , (): 1-17 DOI:10.15302/J-SSCAE-2025.09.026

登录浏览全文

4963

注册一个新账户 忘记密码

本刊网址:sscae.engineering.org.cn

一、 前言

当前,生成式人工智能(GenAI)快速发展并获得广泛应用,在重塑生产服务模式、提升决策效率[1-2]的同时,引发了社会对算法偏见、信息真实性、模型“黑箱”特性等的普遍关切[3]。由于训练数据中固有的历史偏见、社会刻板印象等可能被放大,GenAI在处理信息时可能产生两类核心风险:系统性地传递歧视[4],因错误的知识关联而产生与事实不符的“决策幻觉”[5]。在模型展现出过度自信特征时,这些问题尤其突出,难以被及时发现和纠正[6-7],相应的负面影响可能随着系统的普及而不断累积和扩大[1]。在此背景下,构建科学的风险评估体系成为国际共识[8],各国积极制定监管框架以应对潜在的挑战[9],但具体实践中普遍面临风险多维性、动态性、传导性等难题[1-2]。因此,识别并评估GenAI的潜在安全风险成为学术界和管理层面必须回应的紧迫议题[10]

有关GenAI系统安全风险的研究尚处于理论探索的早期阶段,主要关注技术性能测试[5]、法律监管框架或社会影响分析[11-12] 等单一维度,而在整合性理论框架建构方面存在明显的空白。在风险评估实践层面,缺乏精细化、情境化的评估工具[6],导致基于风险分级的治理模式虽在宏观上成为共识,但在微观操作上缺乏科学依据,现有评估工具难以适应GenAI在事实检索、创新生成等场景下的角色差异与风险特征。在核心概念层面,多聚焦认知准确性,而忽略情感表达的中立性维度,对模型深层偏见的揭示不够全面和彻底[7]。在最为关键的研究视角层面,往往孤立探讨技术、法律、社会等单一维度问题,尚未形成将技术内在属性、社会传导机制、治理调节能力纳入统一分析框架的概念体系,也缺乏对各个评估维度及其相互关系进行形式化界定的探讨,因而难以全面刻画GenAI风险的形成机制与传导路径。这种理论建构的缺失,导致后续的实证研究、政策实践缺乏必要的概念基础和分析工具。在当前阶段,首要的研究任务并非进行大规模的实证检验,而是先行开展GenAI系统安全风险评估维度的系统识别、概念内涵的精确界定、维度之间逻辑关系的形式化建构,为进一步的操作化测量、实证验证等筑牢理论基础。

针对上述研究空白,本文借鉴生态风险理论的分析范式[10],构建涵盖算法忠实度、技术统治度、行政治理能力3个核心维度的GenAI系统安全风险评估框架。生态风险理论用于评估外部压力源对生态系统可能造成的负面影响,相应风险由压力源的内在特性、生态系统的暴露程度以及两方面相互作用的后果共同决定。GenAI系统的应用可类比为外部压力源,自身的算法特性决定了潜在风险的性质,技术在社会中的应用规模和用户依赖程度体现了暴露水平,管理部门治理能力相当于生态系统的自我调节机制[11-12]。主要从技术内在属性、社会外部影响、宏观治理调节3个层面构建评估路径。在技术内在属性层面,评估算法忠实度(即系统输出与人类期望的一致性程度),考察模型在知识处理(准确重现已有知识与创新性推理的能力)、情感表达(保持中立并避免偏见的能力)两方面的表现。在社会外部影响层面,衡量技术统治度,考察技术在关键基础设施和社会大众中的应用普及程度,量化用户对技术输出的信任程度、依赖程度、核查行为模式。在宏观治理调节层面,引入行政治理能力作为关键调节变量,在系统分析治理体系中的行动者网络、权力资源分配、制度规则、政策话语的基础上,综合评估社会生态系统面对风险时的自我修复与调节能力。

二、 GenAI系统安全风险范畴界定与研究进展评述

(一) GenAI系统安全风险的内涵与范畴界定

本研究提及的GenAI系统安全风险,特指由GenAI系统的算法特性(如生成幻觉、持有偏见)与社会应用方式(如过度依赖、监管缺失)相互作用产生,可能对利益相关者造成实质性损害或可测量、可评估的潜在危害[13]。这类风险的内涵具有鲜明的时代特征,既延续了传统人工智能(AI)系统在算法透明性、数据隐私等方面的共性问题,也因GenAI强大的生成能力和广泛的应用场景而呈现出新的复杂性[14]

应用基于生态风险理论的风险放大框架[10],将GenAI系统风险的形成机制概括为技术层面的固有缺陷(风险源)、社会层面的风险放大(传导过程)、治理层面的调节滞后(调节机制)3个相互关联的过程,相关过程的叠加与交互决定了最终的风险水平。① 在技术层面,GenAI系统可能因训练数据中固有的历史偏见、社会刻板印象而产生歧视性输出,也可能因错误的知识关联而生成与事实不符的“决策幻觉”,技术内在的不完美性构成了风险的源头[15]。② 在社会层面,随着GenAI系统深度渗透至关键基础设施和日常生活,相应的技术缺陷可能被成倍放大;特别是用户对系统产生过度信任和依赖时往往疏于批判性审查,导致原本局限于技术系统内部的错误转化为真实世界中的决策失误和社会危害[16]。③ 在治理层面,由于GenAI系统演进速度明显超过监管体系的适应能力,现有的法律规范、伦理准则、技术标准往往滞后于技术发展,这种治理真空为风险的扩散和积累提供了空间[17]

GenAI系统安全风险具有鲜明的场景敏感性,即不同的应用情境下风险的性质、强度、可接受程度存在差异。可根据不同场景对准确性的要求程度,进行GenAI应用场景的风险分级。在对事实准确性要求极高的场景(如医疗诊断、法律咨询、金融分析等)中[18],即便是微小的事实错误都可能通过决策链条被放大并最终威胁到个体的基本权益,此类风险评估应侧重后向生成忠实度(对已有知识的准确重现能力)。在对准确性要求相对灵活、更注重创新性的场景(如创意写作、艺术创作、思路拓展等)中,系统的价值更多体现在激发灵感、提供新颖视角,如过度追求事实的严谨性反而可能压制创造潜力;此类风险评估应关注前向生成忠实度(基于已知信息进行合理推理和创新思考的能力),同时为准确性要求保留适度的容错空间[19]。科学界定GenAI系统安全风险的内涵与范畴,既需要从技术、社会、治理等维度进行全面考察,又需要根据具体应用场景的特点,建立差异化的风险认知框架和评估标准,这是构建有效治理体系的理论前提和实践基础[20]

(二) GenAI系统内在性风险的研究进展

技术内在性风险源自GenAI系统的架构设计、训练机制、数据特性等固有属性。当前研究在知识可靠性、推理稳健性、输出公平性3个维度上揭示了深层次的风险生成机制[21]

在知识可靠性层面,已有研究阐明了大语言模型幻觉生成的本质成因[22]。模型通过最大化训练数据中词汇序列的条件概率来生成文本,擅长捕捉语言的表面规律,但无法建立对世界状态的真实理解;当面对训练分布之外的知识或者需要整合多源矛盾信息时,模型倾向于依赖高频共现模式而非语义一致性进行推断,从而生成看似流畅实则谬误的内容。训练数据的时间截断特性进一步增加了模型适应动态知识的难度。这种知识更新机制本质上是参数空间的静态映射而非持续学习过程,限制了模型获取最新知识的能力[22]

在推理稳健性层面,已有研究揭示了模型推理能力的表层性本质。虽然经过大规模预训练后模型能够记忆并复现训练语料中的推理范式,但这种能力主要依赖模式匹配、浅层句法变换而非对逻辑规则的符号化操作;当推理任务超出训练分布、需要构建新颖的推理链条或进行反事实推断时,模型会呈现随推理深度增加而性能递减的脆弱性。这种脆弱性反映出模型缺乏对抽象概念的组合性理解、因果关系的结构化表征等能力,根源在于模型将推理简化为序列预测问题[23]

在输出公平性层面,已有研究剖析了算法偏见的多层次传导机制。训练数据中的社会偏见首先通过词嵌入空间中的几何关系被编码为向量偏移,随后在注意力机制的选择性聚焦下得到强化,最终通过解码策略的概率分配体现为差异化输出。这种偏见不仅表现为显性的内容歧视,而且隐藏在语言的微观结构中(如句法复杂度、语义能动性、情感极性的细微差异),形成难以察觉但持续作用的算法微偏见。然而,模型的“黑箱”特性导致这些偏见的追溯和消解面临归因困难[24]

越来越多的研究开始揭示不同风险维度之间的交互耦合机制。知识缺陷与情感偏见在特定查询下会形成偏见“放大回路”,即错误的知识关联会强化刻板印象,而偏见化的表征又会扭曲知识检索路径,推理的脆弱性则为错误的链式传播提供了通道。当前评估范式的根本局限在于静态性、场景无关性,主流的基准测试是基于固定数据集的一次性评估,无法捕捉模型在分布漂移下的动态退化,也难以刻画特定应用情境中的复合型风险暴露,缺乏对风险长尾效应、跨领域迁移特性的全面监测能力[25]

(三) GenAI系统社会传导性风险的研究进展

社会传导性风险源于GenAI系统嵌入社会结构并参与人机交互后,将内在缺陷转化为实际危害的过程。相关研究呈现从技术扩散机理到认知影响路径的考察脉络[26]

GenAI在社会系统中表现为非均衡扩散模式。在金融决策、医疗诊断、法律分析等关键基础设施领域的深度应用后形成了技术依赖网络,当多个节点采用同源或同类缺陷模型时,会产生决策同质化现象。这种集中式风险暴露使单点故障能够通过制度化的决策流程迅速传导至整个系统,从而引发连锁性崩溃。在教育、媒体、娱乐等大众应用场景中,GenAI系统渗透表现出分散但广覆盖的特征,虽然单次交互的即时风险相对可控,但重复暴露、长期浸润对认知模式及文化生态的塑造作用不容忽视。这种低烈度高频次的风险累积可能导致批判性思维的退化、信息判断能力的结构性弱化[27]

在用户行为机制方面,相关研究从认知心理学的角度阐明了人机交互中偏差形成的原理。GenAI系统通过流畅的语言生成、自信的表达风格,激活了人类认知系统中的“专家识别模块”。这一在进化过程中形成的启发式机制使人倾向于将语言的精确性、论证的完整性等同于内容的可靠性,从而在神经认知层面绕过了批判性评估的理性通道。这种认知捷径在面对复杂信息时能够有效降低认知负荷,但也为接受错误信息打开了认知漏洞[28]

自动化偏见的形成源于人类对一致性经验的过度泛化。当GenAI系统在多次交互中展现出稳定的可靠性后,用户会将这种局部可靠性归因于系统具有全局能力,进而降低监控频率并提升容错阈值。这一行为退化过程遵循典型的习惯化曲线,监控警觉性随使用时长呈指数级衰减,最终使用户从主动的协作者转变为被动的确认者[29]

此外,技术渗透与认知退化之间存在着自我强化的动力学机制。在高渗透环境下增加用户对GenAI的暴露频次可加速习惯化进程,而认知依赖的加深又会推动技术在决策链条中获得更核心的地位。这种正反馈循环形成的技术锁定效应,使初始的算法缺陷能够通过社会“放大器”被指数级扩散,最终从潜在威胁演变为广泛危机[30]

(四) 全球主要经济体治理GenAI系统模式评述

面对GenAI带来的深刻变革与潜在风险,全球主要经济体积极构建各具特色的治理框架,在促进技术创新、保障社会安全之间寻求审慎的平衡[1]。欧盟发布了以《人工智能法案》(2021年)为代表的一系列政策,推行基于风险等级的精细化管理,对高风险应用施加严格的透明度与问责制要求[2]。美国的治理模式更具分散性,由联邦和州级立法并行推进,展现出较高的灵活性与适应性[31-32]。英国推行“软法”路径,以发布非法定指导原则的方式鼓励负责任的创新[33]。中国建立了较为全面的安全治理体系,监管范围涵盖从训练语料、模型开发到服务备案的完整生命周期[34]

这些多样化的治理探索均趋向“风险分级+动态校准”范式,即根据GenAI系统的潜在风险进行分类管理,通过持续的立法修正、标准更新来应对新兴挑战。例如,欧盟最初认为聊天机器人是有限风险系统,随着相应社会影响的显现而重新将之确定为高风险系统[35]。然而,这个主流的治理范式面临着根本性的挑战,即划分风险等级缺乏科学且统一的评估依据。当前的评估标准过于笼统,难以捕捉并区分GenAI在不同应用场景下差异化的风险特征,导致评估结果与实际监管需求多有脱节[36]。此外,GenAI系统风险的性质并非一成不变。在医疗诊断、金融分析等事实知识检索类高风险场景中,微小的模型错误可能通过决策链条被放大,甚至威胁到基本的社会权益[37];而在创意生成等风险容忍度较高的场景中,过度追求事实的准确性将会压制创新潜力与表现力。这种场景依赖性凸显了评估体系的不足,因而系统性地评估GenAI的内在风险并为风险分级提供可靠的理论支撑成为核心议题。

为了应对上述挑战,已有研究提出了一些前瞻性的评估概念。算法忠实度包含了4项评估标准(模型生成的回答应与人类作出的回答无法区分、与人口统计背景保持一致、能从上下文中自然延伸、准确反映思想与社会背景的真实关系模式[38]),用于衡量GenAI系统模拟特定人类群体思维模式的准确性,为理解并评估算法偏见提供了新的视角,但应用范围仍需从特定的社会科学模拟拓展至更广泛的知识处理场景。目前的算法忠实度研究集中在认知层面,忽视了情感表达的中立性(即情感忠实度)。GenAI系统在描述不同主体时可能会无意识地使用带有偏向性的能动性表达(如对某些群体多使用主动性表达,而对另外一些群体多使用从属性表达),也就暴露并延续了训练数据中潜藏的社会刻板印象[39-40]。若缺乏对情感忠实度的有效评估,深层偏见将难以被揭示和纠正[39]

综合来看,现有研究的不足之处体现在3个层面。在风险评估的实践层面,现有研究未能提供足够精细且情境化的评估工具,导致基于风险分级的治理模式在微观操作上缺乏科学依据[36],难以适应GenAI在事实检索、创新生成等场景下的角色差异与风险特征。在核心概念的理论层面,算法忠实度等现有概念虽有启发意义,但内涵与外延均待深化;多聚焦认知准确性[38],而忽略情感表达的中立性维度[39],对模型深层偏见的揭示不够全面和彻底。此外,研究视角存在明显的割裂与碎片化,往往孤立地探讨技术、法律、社会等单一维度的问题,而未能构建将管理部门监管能力、技术系统特性、用户采信行为等复杂因素有机整合的分析框架。既有研究未能全面刻画GenAI风险的形成机制与传导路径,这是本研究致力弥补的理论空缺。

三、 GenAI系统安全风险评估框架和指标

基于前述的理论基础,本研究构建了GenAI系统安全风险评估框架(见图1),从复杂风险特性中提炼出3个可评估的核心维度,从技术内在属性、社会外部影响、宏观治理调节3个层面出发提出相应的评估路径:应用算法忠实度评估系统输出与人类期望的一致性程度,考察模型在知识处理(准确重现已有知识与创新性推理)、情感表达两方面的表现[38-39];采用技术统治度衡量技术在关键基础设施、社会大众中的应用普及程度,量化用户对技术输出的信任度、依赖度、核查行为模式[41];将行政治理能力作为关键调节变量,在全面分析治理体系中的行动者网络、权力资源分配、制度规则、政策话语的基础上,综合评估社会生态系统面对GenAI系统安全风险时的自我修复与调节能力[42-43]

需要说明的是,该评估框架在当前阶段主要面向以ChatGPT、Claude等大语言模型为代表的文本类GenAI系统。作此界定,是因为文本生成系统是当前GenAI系统中发展最为成熟、应用广泛的类型,相应安全风险暴露得最为显著且研究积累相对丰富,便于建立可操作的评估指标。当然,该框架在设计上具有向多模态生成系统拓展的潜力,核心的3层评估路径同样适用于图像生成、音频生成类系统;算法忠实度可拓展至视觉真实性、美学一致性等维度,技术统治度、行政治理能力属于社会和治理层面的评估维度,在根据具体技术特性调整测量方式后同样适用多模态系统。

(一) 算法忠实度:评估GenAI系统在知识处理与情感表达中的准确性

算法忠实度的初始含义是大语言模型模拟特定人类群体思维模式的准确程度[38]。有研究认为算法偏见是人类社会多样化观点的复杂映射,而非单一待消除的属性[38]。为此,本研究将该概念拓展为多维度评估框架,将算法忠实度定义为GenAI系统输出与人类合理期望之间的一致性程度,涵盖认知忠实度(对知识的把握)、情感忠实度(表达上的中立性)。相较传统的模型准确性概念,算法忠实度的内涵更为丰富,不仅关注技术性能指标,而且将评估视角扩展至输出的社会适切性。相较AI对齐概念,算法忠实度侧重结果评估而非训练过程干预[38]

本研究借鉴算法忠实度、知识表征领域的后向检索与前向推理等概念,将认知忠实度进一步细分为后向生成忠实度(模型准确重现已有知识的能力)、前向生成忠实度(模型基于已知信息进行创新推理的能力)。后向生成忠实度专注于评估模型准确重现已有知识的能力,不仅检验对单一事实的掌握程度,而且衡量在复杂知识网络中进行信息整合与关联的能力,本质上是在考察GenAI作为可靠知识提供者的安全边界。在金融、医疗、法律等高风险专业领域,信息的准确性和时效性是决策基础,不准确的知识重现可能通过决策链条引发连锁反应,如医疗辅助诊断模型如果无法准确整合多份病例报告中的复杂信息,则可能输出错误的诊断。实验研究表明,即便是经过充分训练的商业模型,在处理复杂、多源事实时的准确性仍有明显的提升空间,特别是在时态事实适应性测试中多数模型处理历史事实的表现普遍优于处理最新事实,表明模型适应知识更新的能力有限,可能与训练数据的时效性及更新频率相关[44]

前向生成忠实度侧重评估模型基于已知信息进行逻辑推理和创新思考的能力,反映的是模型突破既有认知框架、产生新知识的潜力,与GenAI系统作为创造性思维辅助工具的核心价值相呼应。然而,对前向忠实度宜进行辩证评估。尽管GPT-4等模型在数学推理初始测试中表现出较高的准确率,但在处理需要多步推理的复杂问题时性能显著下降,说明推理更多依赖模式匹配而非深层次的逻辑理解[45]。在创造性问题解决任务中,模型虽能提出看似新颖的方案,但物理可行性多有不足,如高效解决率仅为18.9%[46]。从风险评估的角度看,过于严苛的准确性标准会抑制模型的创新能力,在以创意为主要目标的场景中,适度宽容的评估方法反而更有利于技术发展。

情感忠实度用于评估模型在处理不同对象和议题时语言表达的中立性,可通过量化分析语言正式度、情感倾向、能动性等方面的差异进行测量,进而揭示潜在的偏见[39]。算法偏见的传统研究主要关注事实判断层面的系统性偏差,而情感忠实度研究则关注语言表达的微观层面,借鉴社会语言学中关于语言能动性偏见的实证发现来考察模型在描述不同对象时语气、情感色彩上的隐性差异[39]。情感偏见能够带来切实的社会风险,如模型在生成推荐信时,可能因训练数据中根深蒂固的社会刻板印象而在描述不同性别群体时使用有差异的能动性词汇,这种差异可能在招聘等关键场景中延续并放大不公[39]。通过使用比值比、t检验等严谨的统计方法,可以有效识别这些表达差异,为模型优化和风险防控提供科学判据。

本研究构建了具体的评估指标体系(见表1),以将上述理论框架转化为可操作的测量工具。通过专门设计的任务、标准化的数据集,探测当前GenAI模型在不同忠实度维度上的能力边界与潜在缺陷。对于后向忠实度,所选任务用于严格测试模型减少“决策幻觉”并应对事实知识时效性衰减的能力,确保在严肃知识型应用中的可靠性。对于前向忠实度,所选任务充当评估模型复杂推理能力的代理指标,以甄别模型究竟依赖浅层的模式匹配,还是具备更深层的逻辑演绎等能力,进而考察在约束条件下的创新思维潜力。在情感忠实度方面,本研究将抽象的公平与伦理原则具象化为可量化的偏见指标,识别并度量模型在语言表达中可能放大或延续的社会偏见。

算法忠实度评估框架应是动态且具有场景适应性。评估需从静态快照转向动态调整,构建可持续演进的评估方法以支持相关研究和监管,而不能依赖静态、一次性的基准测试[36]。对于后向忠实度,动态调整重在解决模型处理时效性知识的短板[44]。具体地,动态评估机制应包括以下方面:建立持续更新的知识基准库,定期纳入最新的科学共识、法律判例、市场数据;设计时间衰减函数,对不同时期知识的准确性要求进行动态权重分配;实施滚动评估制度,定期重新测试模型在最新知识上的表现。对于前向忠实度,动态调整要求评估标准具有灵活性、能够平衡严谨性与创新性。评估者根据应用场景(如高风险的工程设计、低风险的创意写作)来动态调整逻辑严谨性、方案可行性的要求权重,避免采用统一且僵化的标准去衡量所有场景[45-46]。构成偏见的社会规范、语言习惯并非一成不变,因而情感忠实度评估也应是动态的,需要定期更新与偏见相关的语料库、关键词,确保可捕捉到新出现或更隐蔽的偏见形式[39]。开展算法忠实度的动态评估时,建立场景化的评估模块是关键。需要超越通用知识的评估范畴,根据GenAI的具体应用领域来遴选顶尖专家,共同开发并维护高度专业化、情境化的评估数据集。相应的评估框架可成为灵活、可演进的诊断工具箱,指引GenAI系统的安全发展。

(二) 技术统治度:评估GenAI系统在社会结构中的渗透程度与影响力

技术统治度旨在衡量GenAI系统在社会结构中的渗透广度、影响深度、用户采信程度,是连接技术内在属性与社会实际风险的关键因素。与评估技术自身属性的算法忠实度不同,技术统治度将视角转向外部,考察技术作为一种社会力量的实际影响力[23]。这一概念融合了技术社会学中技术扩散理论、人机交互领域中的自动化偏见等分析视角,也进行了进一步拓展。相比技术采纳率,技术统治度不仅考察使用普及程度,而且关注用户对技术输出的信任和依赖模式。相比算法权力等批判性概念,技术统治度可分解为量化的子指标,便于开展实证评估。当然,技术统治度本身不具有价值判断属性,相应指标具有中性含义,具体的风险意涵需要结合算法忠实度、行政治理能力来进行综合判断[21-22]。高的技术统治度意味着技术深度嵌入社会运行,潜在风险的传导路径更短、影响范围更广。本研究将技术统治度分解为基础设施渗透率、用户采信参数两个核心子维度,明确每个指标的评估内容与风险意涵(见表2)。

基础设施渗透率是对GenAI系统在社会关键领域、社会公众中普及程度的客观测量。可细分为专业部门使用率、公众使用率两个层面,有助于监管部门更精准地识别不同风险类型、优化监管资源配置,引导技术朝着更具解释性和可审核性的方向发展。① 专业部门使用率,主要关注GenAI系统在金融、医疗、能源管理、公共服务等关键基础设施领域的应用深度,一旦出现风险,后果将是集中且连锁的。例如,若多家金融机构采用同一个存在缺陷的策略性GenAI系统,可能引发同向交易踩踏,进而加剧市场波动;医疗机构若广泛采用存在偏差的诊断辅助工具,可能导致对特定人群的大规模误诊。② 公众使用率,主要衡量GenAI系统在商业、教育、媒体、娱乐等经济社会系统中的应用程度。这类应用的风险虽然相对分散,但能引发更普遍的伦理、文化和社会问题。例如,在教育领域过度依赖GenAI完成作业,可能削弱学生的批判性思维和独立研究能力;在媒体领域GenAI显著降低了制造高仿真度虚假信息的门槛,可能加速复杂不实信息的传播并侵蚀社会信任。

用户采信参数的设计借鉴了人机交互与自动化心理学的研究成果,从主观层面量化用户对GenAI的信任、依赖和审慎程度。该参数由两个相互作用的核心指标构成,是影响风险能否实际发生的关键人为因素。① 减轻工作量参数,反映用户为提升效率而将任务委托给GenAI的倾向,也是一种认知负荷转移的行为(将复杂的脑力劳动外包给机器以节约心智资源)。当用户感知到GenAI具有高可用性时,委托任务意愿会显著增强,进而形成依赖路径(已有专门的量表来衡量)。② 监控参数,衡量用户对AI输出认知警觉性及批判性审查程度,包括利用外部信源对事实性信息进行交叉核实,对AI生成内容的逻辑连贯性、论证合理性、潜在偏见的深入审视[41]

减轻工作量参数、监控参数两个核心指标的组合决定了用户的风险暴露水平,相互作用的动态关系成为影响风险实际发生概率的关键因素。当用户表现出极高的减轻工作量倾向,而监控参数又显著低于审慎水平时,就形成“过度依赖 ‒ 疏于核查”的高风险模式。这种模式的形成与自动化自满的心理现象密切相关,即用户因GenAI系统在过往任务中表现可靠而逐渐降低警惕性,减少了主动监控的行为;用户倾向于将GenAI的输出默认为正确,甚至在面对与自身判断相悖的结果时会因自动化偏见而选择相信机器[41]。更进一步,随着GenAI生成的语言愈发流畅、表达风格愈发自信,用户会产生“专家错觉”,从而进一步抑制用户的批判性思考意愿;用户从审慎的协作者转变为技术风险的被动接收者、无意识的“放大器”,放弃对AI输出的人工核验,从而埋下风险隐患;用户极易无条件地采纳模型的错误输出,从而将潜在的技术风险无缝地转化为现实世界中的决策失误或其他有害后果。

(三) 行政治理能力:评估管理部门的GenAI系统治理能力

行政治理能力是决定GenAI潜在风险能否被有效抑制或缓冲的关键调节变量。政策布局理论(PAA)为分析特定政策领域动态与稳定性提供了成熟框架[21-22],应用于GenAI治理领域可超越对单一政策法规的表层分析,深入考察管理部门应对新兴技术挑战的综合能力。PAA理论中的行动者网络等概念主要基于多中心治理模式,具体应用时需要结合国情进行适应性调整:在评估行动者网络时,应考虑不同国家在管理部门、市场、社会组织之间的权力分配差异;在评估权力资源时,应关注正式权力与非正式影响力的相对作用。

在政策话语维度,重点关注管理部门如何通过官方声明、战略规划等定义GenAI并阐述价值、框定风险。例如,在价值取向平衡性上,欧盟的话语体系始终强调构建值得信赖的AI,将人的基本权利置于核心,具体法案倾向采取严格的预防性监管路径[2,54];英国明确提出促进创新的治理方针,侧重为技术发展提供灵活性,避免过早的硬性立法阻碍产业发展[33]。风险认知是动态演变的过程,如欧盟意识到大语言模型在虚假信息传播、算法歧视方面的新增风险,在《人工智能法案》的修订过程中将之从有限风险提升至高风险级别并要求进行严格审查[35]

在行动者网络维度,聚焦参与治理过程的多元主体及其互动关系。GenAI治理具有复杂性,涉及监管机构、产业界、学术界、社会公众乃至国际组织等行动者。为了提高制度的完备性,管理部门需要设立专门机构并配备专业人员,也应建立吸纳外部意见的有效机制以体现多元参与的包容性[55]。此外,不同部门(如数据保护、市场竞争、行业安全)应避免AI监管职责重叠或出现监管空白,提高执行机构之间的协同性。

在权力与资源分配维度,有效治理不仅需要明确的法律授权,而且应以相对充足的财政、人力、技术资源为支撑。管理部门可在传统的强制性监管以外,采用监管沙盒等政策工具,在可控环境中测试和验证新技术,从而在风险和创新之间取得动态平衡[56]。随着AI趋于复杂,仅依靠传统的人工审查已难以为继,管理部门需要应用先进的监管和监督技术对“黑箱”模型进行有效审计和持续监控。

在制度规则维度,应重点考察构成治理基础的正式与非正式“游戏规则”,包括协调一致的法规体系、可快速响应技术演进的动态标准规范、清晰的责任分配与权利救济机制。在标准规范适应性方面,美国国家标准与技术研究院发布的《人工智能风险管理框架》以及针对GenAI的补充说明即为典型的动态标准体系,为业界提供了可操作的指导[57];我国在《生成式人工智能服务管理暂行办法》(2023年)发布后又推出了算法备案制度,体现了通过动态更新机制来持续监管的思路[34]。本研究构建了GenAI行政治理能力评估指标体系(见表3),将理论框架可操作化,为开展评估提供了基本工具。

行政治理能力评估是一个动态过程,尤其需要关注管理部门在促进创新、防范风险之间进行权衡和调整的能力,这是衡量管理部门GenAI治理能力成熟度的最终标准,也是确保技术发展不偏离安全轨道的基本保障。治理体系能否对快速变化的技术和风险环境作出敏捷响应,是衡量有效性的重要标志。动态评估应重点考察标准规范适应性指标对应的规则更新速度、价值取向平衡性指标对应的政策话语与资源配置灵活性。在出现颠覆性技术突破时,管理部门应迅速调整政策导向并引导社会进行理性讨论;当发现新的重大风险时,资源配置重点应迅速由鼓励创新项目转向风险防控和应急响应项目。

四、 评估框架应用探索:以医疗领域GenAI系统为例

(一) 医疗临床辅助场景的选取与评估设计

以医疗领域GenAI系统的临床辅助应用场景为例,按照提出的评估思路完成探索性分析(见表4),直观展示了GenAI系统安全风险评估框架的应用过程。

医疗健康是GenAI系统渗透较为深入且社会关注度极高的领域之一,技术应用正在从病历书写、文献检索等辅助性工作延伸至诊断建议、治疗方案推荐等核心临床决策环节,相应的风险评估具有现实紧迫性[18-19]。医疗场景涉及疾病识别、鉴别诊断、治疗决策、预后判断、医患沟通等多重维度,能够较为全面地检验评估框架和指标的适用性。医疗决策直接关联患者的生命健康权益,技术应用不仅可能造成诊疗失误,还可能引发医疗伦理、责任归属、医患信任等方面的问题,故风险类型更为丰富、后果严重程度远高于其他应用场景[37]。需要指出的是,评估对象并非单一医疗GenAI产品的技术能力,而是GenAI系统应用于医疗场景时可能产生的风险状况,因而关注的核心议题是在临床辅助诊疗场景下使用GenAI可能面临的风险,而非评判医疗大语言模型本身的性能;作为探索性的理论推演而非基于全面数据收集的实证研究,案例中的评估均为定性判断,主要用于展示评估逻辑,不用于得出确定性结论;相关判断的合理性有待后续实证研究检验[30]

(二) 风险评估指标的情景化应用

在算法忠实度维度,本研究针对医疗场景的高风险特征,对通用评估指标进行了模块化调整。表1中的通用数据集主要面向一般性事实核查任务,并未针对临床医学知识体系进行专门设计。因此,本研究在方法论框架下新增了医学知识专项测试模块。对于后向生成忠实度,构建了基于临床诊疗指南、药品说明书的知识准确性测试集,包含疾病定义及分类、诊断标准、治疗原则、药物适应症与禁忌症等核心知识模块;参照《中国临床诊疗指南》等文件编制了针对性测试题目,特别增加了医学知识时效性测试以考察GenAI对近年诊疗规范更新内容的掌握能力[23]。对于前向生成忠实度,构建了临床推理专项测试模块,涵盖典型病例诊断推理、复杂病例鉴别诊断、多系统疾病共存决策等,也引入临床专家定性评审作为量化测试的补充。对于情感忠实度,构建了医疗偏见敏感议题测试库并设计了控制变量实验,用于考察GenAI在涉及不同人口学特征患者时的诊疗建议差异和语言表达差异[39-40]。基于理论推断,医疗场景下的后向生成忠实度可能呈现显著的专科差异,前向生成忠实度可能处于中等水平,情感忠实度不足可能构成最为隐蔽且后果较为严重的风险环节。考虑到医疗领域“首先不伤害”的伦理原则,可在医疗场景中赋予后向生成忠实度更高的权重[22]

在技术统治度维度,评估基础设施渗透率需区分正式渗透、非正式渗透两个层面。在正式渗透层面,考察GenAI作为医疗器械获得监管准入并纳入医疗机构信息化基础设施的情况。目前,我国初步建立了AI医疗器械监管框架,而在现有分类体系中GenAI类产品因输出具有开放性和不可预测性而致定位不明确,大规模进入临床应用的条件尚不成熟[34]。在非正式渗透层面,相当比例的临床医师已在工作中使用通用GenAI工具辅助病历书写、文献检索甚至诊断参考,患者群体使用GenAI进行健康咨询的现象也趋于普遍,这种非正式使用缺乏质量控制机制且难以监测和追踪[26-27]。关于用户采信参数,需分别考察医务人员、患者两类用户群体的采信行为模式:前者虽具备专业质疑精神,但在面对GenAI流畅自信的输出时也可能出现批判性审查能力减弱的情况[28-29];后者通常缺乏专业医学知识来判断GenAI医疗建议的正确性,采信决策更多依赖非专业因素。考虑到用户的批判性审查行为对风险缓冲具有决定性意义[22],可在医疗场景中对用户采信参数赋予更高的权重。

在行政治理能力维度,本研究梳理了我国医疗GenAI治理相关政策文件[56-57],对表3中的各项指标进行了初步的定性判断。① 在政策话语维度,管理部门对AI医疗应用提出较为积极的宏观定位,如《“健康中国2030”规划纲要》(2016年)将智慧医疗列为重点发展方向。然而,现有政策主要沿用传统AI医疗器械的监管思路,针对GenAI的细化治理指导文件仍在形成过程中,针对性和前瞻性有待加强[35]。② 在行动者网络维度,医疗领域的GenAI治理涉及卫生行政部门、医疗机构、医务人员、患者、开发企业等多元主体,当前治理格局呈现监管部门主导的特征,但医务人员和患者的参与渠道相对有限,多元共治的行动者网络尚不完善[42-43]。③ 在权力资源维度,我国医疗器械监管体系具有较完备的法律授权和执行能力,但现有监管资源和技术能力在应对GenAI快速迭代方面存在不足,监管部门的技术评估能力和人员储备有待加强[17]。④ 在制度规则维度,GenAI在医疗临床应用中的具体规则仍存在较多空白,涉及使用边界确定、知情同意要求、医疗事故责任划分、患者数据保护等关键问题,均缺乏明确的制度规定[36]。整体来看,我国针对医疗临床辅助场景的行政治理能力处于中等水平,在监管框架、制度资源方面具有一定的基础条件,但针对GenAI系统特殊性的适应性调整仍显不足。

(三) 评估结果的综合分析与风险演变

基于3个维度的定性分析,对GenAI应用于医疗临床辅助场景的风险状况形成了初步认识。从定性评估结果的整体格局来看,医疗场景的风险状况呈现高后果风险与中等暴露程度并存的特征。从风险性质来看,由于医疗决策可能产生后果,任何诊疗错误都可能造成不可逆的健康损害,这决定了算法忠实度不足带来的风险后果远高于其他应用场景,尤其是后向生成忠实度(医学知识准确性)、情感忠实度(医疗公平性)的缺陷可能直接转化为对患者权益的实质性损害。从暴露程度来看,由于医疗领域监管准入门槛较高且正式渗透率仍处于较低水平,相关风险的大规模暴露在客观上受到一定的限制,然而非正式渠道的大量使用、用户采信行为模式的不确定性仍可能构成个体层面的显著风险暴露点。从治理调节来看,行政治理能力的中等水平意味着治理体系对于已识别风险具有一定的应对能力,但在GenAI系统快速演进、新型风险形态持续出现的背景下,治理体系的适应性和前瞻性仍需加强[29]

这一风险格局可能随技术应用和治理环境的变化而动态演变,可结合多个反事实情境进行前瞻性思考。① 假设未来医疗领域的GenAI监管准入政策进一步放开、通用GenAI工具的医疗应用功能持续强化,相应的技术统治度可能快速上升,届时正式渗透、非正式渗透的边界进一步模糊,风险暴露的规模和范围将显著扩大。② 假设GenAI在临床应用中暴露出更严重的诊疗错误、医疗歧视问题并引发社会广泛关注,可能触发监管收紧并引发公众信任危机。③ 假设医务人员对GenAI的依赖程度持续加深而批判性审查行为逐步退化,用户采信参数的风险特征将发生不利变化;即使技术本身的忠实度有所提升,人机协作模式失调仍可能成为新的风险“放大器”。④ 假设行政治理能力未能与技术发展同步提升,监管滞后将为风险累积和扩散提供空间;一旦发生严重的医疗事故,责任归属不清的制度缺陷将进一步损害医患信任关系并降低技术的社会接受度[22]。因此,医疗场景的GenAI风险评估不宜只关注当前的静态状况,还应建立动态演变路径的持续监测机制,尤其需要关注各维度变化的联动效应和可能的级联放大效应。

五、 未来GenAI系统安全风险治理体系的方法创新与突破方向

本研究构建的GenAI系统安全风险评估框架超越了单纯的技术性能测试层次,将技术内在属性、社会外部影响、宏观治理调节视为相互作用的有机整体,为解释风险的形成与传导机制提供了分析路径。然而,当前框架在具体操作层面仍存在量化困难、权重分配复杂、大规模实证验证缺失、文化与模态适应性不足等难题[58]。推动从概念框架发展为成熟的实践工具,核心方向是构建可与技术共同演进的动态评估和治理生态。

(一) 构建动态、可计算的风险演化模型

传统的静态评估范式已难以适应GenAI系统的快速迭代和风险形态的持续演变,亟需建立刻画风险动态演化的计算模型。应将评估理念从一次性的基准测试转向常态化的压力测试,构建可动态更新的数据集与评估协议,主动将真实世界中新出现的风险形态整合进测试流程。对于风险演化模型,基于时间序列分析和状态空间方法建立可追踪模型性能随时间退化的预测框架,捕捉分布漂移对模型可靠性的影响,量化知识时效性衰减的速率,识别引发性能突变的临界点[59]。在建模方法上,可融合多学科理论构建可计算的风险传导网络,将认知科学、社会心理学中的技术接受模型、自动化偏见等理论整合到用户采信参数的量化模型,采用微分方程或随机过程描述用户监控警觉性随使用时长的衰减动力学过程;借鉴复杂网络理论刻画技术在社会系统中的扩散模式,建立节点之间的风险传导矩阵,模拟连锁反应的触发机制[60]。GenAI系统还应具备自适应学习能力,可根据既有评估结果和新发现的风险事件持续演进,通过强化学习、贝叶斯更新机制调整风险权重和预警阈值,实现评估体系的自适应优化[61]。此外,针对不同风险维度之间的非线性交互,发展可刻画多因素耦合效应的计算方法。例如,可通过张量分解技术揭示知识缺陷、情感偏见、推理脆弱性的联合作用模式,利用因果推断框架识别风险放大回路中的关键干预点。可计算的动态模型将为监管决策提供定量化的预测工具,推动风险评估从定性描述迈向定量预测[62]

(二) 发展智能化、自适应的评估验证技术

GenAI系统评估的智能化是开展动态监测和精准干预的技术基础,建议突破传统人工设计测试集的局限,发展可自动生成对抗样本、自适应调整评估难度的智能化验证系统。在对抗性测试方面,开发基于生成对抗网络的自动化红队系统,持续探索模型的脆弱边界,通过对抗样本的迭代生成暴露模型在极端情况下的失效模式;不应局限于单一攻击策略,而是覆盖语义扰动、逻辑陷阱、价值观冲突等方面的压力场景[63]。在自适应评估方面,借鉴计算机自适应测试思路,根据模型在前序任务中的表现来动态调整后续评估的难度和侧重点,以在有限的评估成本下最大化信息获取效率;对于基础任务中表现不佳的模型,系统应自动强化对关联能力的深度探测;对于表现优异的模型,系统应推送更具挑战性的边界案例。随着GenAI应用从纯文本向图像、视频等模态演进,评估方法也应超越文本中心范式,发展可检测跨模态一致性、识别深度伪造痕迹、评估多模态推理能力的综合验证技术[64]。此外,智能化评估系统应具备可解释性,既要给出模型存在风险的判断,也需揭示风险产生的内在机理;采用注意力可视化、特征归因分析等技术定位模型决策过程中的关键缺陷节点,为后续的模型修正提供精准指导。

(三) 推动面向场景的模块化与差异化评估

GenAI在不同应用场景下的风险特征存在显著差异,要求评估框架具有高度的模块化和场景适应能力。面向场景的评估应建立可灵活组合的评估模块库,监管机构和开发者根据具体应用情境从工具箱中调用不同的指标模块并配置差异化的风险权重[65]。对于高风险的法律判决辅助、医疗诊断等场景,评估应采用严格的准确性阈值和低容错标准,强化对后向忠实度、推理稳健性的考察。对于低风险的创意内容生成、艺术创作等场景,可侧重创新性和表达多样性,避免过度的准确性追求压制创造潜力[66]。场景化评估的关键在于建立风险权重的动态调整机制,需要通过大规模的实证研究来校准不同场景下各维度指标的相对重要性。例如,可应用专家德尔菲法、层次分析法确定特定领域的权重配置方案,通过真实案例的回溯验证来迭代优化相应配置[67]。此外,风险的社会可接受度具有明显的文化依赖性,因而场景化评估还需考虑文化背景的差异性。在评估框架中建立文化自适应模块,通过构建本地化的偏见词库、开展文化敏感性测试来调整评估标准[68]。进一步,随着GenAI朝着更强的自主性和通用性方向发展,未来的评估需要从关注输出结果转向审查决策过程与学习机制的内在可控性,也应发展新的评估范式,包括模型目标函数的价值对齐度检验、持续学习过程的安全性监控、涌现能力的可预测性评估等[69]。这种前瞻性的理论探索和技术储备将驱动评估体系从被动响应转向主动预见,真正实现与技术发展的协同演进[70]

六、 结语

本文针对GenAI系统缺乏多维度综合评估、风险动态演化特征不明、风险传导机制不清等现实问题,借鉴生态风险理论的“压力源 ‒ 暴露 ‒ 效应”分析范式,构建了涵盖算法忠实度、技术统治度、行政治理能力的三维评估框架。该框架的核心贡献体现在多个层面:① 在理论视角上,将GenAI系统类比为社会技术生态系统中的“压力源”,突破了传统单一维度的技术性能测试范式,将技术内在属性、社会外部影响、宏观治理调节视为相互作用的有机整体;② 在概念深化上,拓展了算法忠实度概念的内涵,从单纯的认知层面扩展至情感表达的中立性维度并区分了后向生成忠实度、前向生成忠实度,为揭示模型深层偏见提供了更加完整的分析工具;③ 在传导机制上,阐明了风险从技术缺陷到社会危害的完整传导路径,揭示了技术特性如何通过基础设施渗透和用户采信行为被放大或缓冲,阐明了行政治理能力作为关键调节变量影响风险的最终表现形式;④ 在实践应用上,强调了应用场景对风险评估的决定性意义,区分了事实知识检索、创新生成等情境下的差异化风险特征与评估标准,为精准化、情境化的分级监管提供了可操作的评估路径。

本研究还存在一些局限性,如生态风险理论类比的适切性边界有待进一步论证、评估指标体系缺乏大规模的实证验证、框架对多模态GenAI系统的适用性需要拓展、行政治理能力维度在不同制度背景下的可迁移性有待检验等。展望未来,GenAI系统安全风险评估体系的发展可聚焦动态性、智能化、情境化3个关键方向,构建可计算的风险演化模型、发展自适应的智能化验证技术、建立模块化的场景适配机制,推动评估框架从静态的一次性测试转向可与技术协同演进的动态监测体系。

参考文献

[1]

Luna J,Tan I,Xie X F,et al. Navigating governance paradigms:A cross-regional comparative study of generative AI governance processes & principles[C]//Proceedings of the AAAI/ACM Conference on AI,Ethics,and Society,2024:917-931.

[2]

Paul R. European artificial intelligence “trusted throughout the world”:Risk‐based regulation and the fashioning of a competitive common AI market[J]. Regulation & Governance,2024,18(4):1065-1082.

[3]

Cheong I,Caliskan A,Kohno T. Safeguarding human values:Rethinking US law for generative AI’s societal impacts[J]. AI and Ethics,2025,5(2):1433-1459.

[4]

Wach K,Duong C D,Ejdys J,et al. The dark side of generative artificial intelligence:A critical analysis of controversies and risks of ChatGPT[J]. Entrepreneurial Business and Economics Review,2023,11(2):7-30.

[5]

Hannon B,Kumar Y,Sorial P,et al. From vulnerabilities to improvements—A deep dive into adversarial testing of AI models[C]//2023 Congress in Computer Science,Computer Engineering,& Applied Computing (CSCE),2023:2645-2649.

[6]

Gordon G,Rieder B,Sileno G. On mapping values in AI governance[J]. Computer Law & Security Review,2022,46:105712.

[7]

UNESCO. Recommendation on the ethics of artificial intelligence[EB/OL]. (2023-05-16)[2026-06-15]. https://www.unesco.org/en/articles/recommendation-ethics-artificial-intelligence.

[8]

Krafft T D,Zweig K A,König P D. How to regulate algorithmic decision-making:A framework of regulatory requirements for different applications[J]. Regulation and Governance,2022,16(1):119-136.

[9]

European Union. Regulation (EU) 2024/1689 laying down harmonised rules on artificial intelligence[EB/OL]. (2024-06-13)[2025-12-20]. https://eur-lex.europa.eu/eli/reg/2024/1689/oj.

[10]

Jones R N. An environmental risk assessment/management framework for climate change impact assessments[J]. Natural Hazards,2001,23(2-3):197-230.

[11]

Larned S T,Schallenberg M. Stressor-response relationships and the prospective management of aquatic ecosystems[J]. New Zealand Journal of Marine and Freshwater Research,2019,53(4):489-512.

[12]

Jarvis L,Rosenfeld J,Gonzalez-Espinosa P C,et al. A process framework for integrating stressor-response functions into cumulative effects models[J]. Science of the Total Environment,2024,906:167456.

[13]

Tredinnick L,Laybats C. The dangers of generative artificial intelligence[J]. Business Information Review,2023,40(2):46-48.

[14]

Hacker P,Engel A,Mauer M. Regulating ChatGPT and other large generative AI models[C]//Proceedings of the 2023 ACM Conference on Fairness Accountability and Transparency,2023:1112-1123.

[15]

Weidinger L,Uesato J,Rouh M,et al. Taxonomy of risks posed by language models[C]//Proceedings of the 2022 ACM Conference on Fairness. Accountability and Transparency,2022:214-229.

[16]

Yankouskaya A,Liebherr M,Ali R. Can ChatGPT be addictive? A call to examine the shift from support to dependence in AI conversational large language models[J]. Human-Centric Intelligent Systems,2025,5(1):77-89.

[17]

Taeihagh A. Governance of generative AI[J]. Policy and Society,2025,44(1):1-22.

[18]

Mohamed M A H,Al-Mhdawi M K S,Ojiako U,et al. Generative AI in construction risk management:A bibliometric analysis of the associated benefits and risks[J]. Urbanization,Sustainability and Society,2025,2(1):198-230.

[19]

Duffourc M,Gerke S. Generative AI in health care and liability risks for physicians and safety concerns for patients[J]. Jama,2023,330(4):313.

[20]

Namiot D,Ilyushin E. On cyber risks of generative artificial intelligence[J]. International Journal of Open Information Technologies,2024,12(10):109-119.

[21]

Wu F,Shen T,Bäck T,et al. Knowledge-empowered,collaborative,and co-evolving AI models:The post-LLM roadmap[J]. Engineering,2025,44:87-100.

[22]

Abu-Rasheed H,Weber C,Fathi M. Knowledge graphs as context sources for LLM-based explanations of learning recommendations[C]//2024 IEEE Global Engineering Education Conference (EDUCON),2024:1-5.

[23]

Martino A,Iannelli M,Truong C. Knowledge injection to counter large language model (LLM) hallucination[M]. Cham:Springer,2023:182-185.

[24]

Yang J. Integrated application of LLM model and knowledge graph in medical text mining and knowledge extraction[J]. Social Medicine and Health Management,2024,5(2):56-62.

[25]

Wang Y Q. Generative AI in operational risk management:Harnessing the future of finance[J]. SSRN Electronic Journal,2023:1-10.

[26]

Yankouskaya A,Babiker A,Rizvi S,et al. LLM-D12:A dual-dimensional scale of instrumental and relational dependencies on large language models[J]. ACM Transactions on the Web,2025:3765895.

[27]

Eigner E,Händler T. Determinants of LLM-assisted decision-making[PP/OL]. arXiv (2024-02-27)[2025-12-20]. https://doi.org/10.48550/arXiv.2402.17385.

[28]

Li Z W,Zhang Z,Wang M W,et al. From assistance to reliance:Development and validation of the large language model dependence scale[J]. International Journal of Information Management,2025,83:102888.

[29]

Liu S H,Hu X,Xia X,et al. An empirical study of vulnerable package dependencies in LLM repositories[PP/OL]. arXiv (2025-08-29)[2025-12-20]. https://doi.org/10.48550/arXiv.2508.21417.

[30]

Li L Q,Wang Z F,Jose J M,et al. LLM supporting knowledge tracing leveraging global subject and student specific knowledge graphs[J]. Information Fusion,2026,126:103577.

[31]

US Congress. Candidate voice fraud prohibition act[EB/OL].(2023-07-13)[2025-12-20]. https://www.congress.gov/bill/118th-congress/house-bill/4611.

[32]

US Congress. Preventing deep fake scams act[EB/OL]. (2025-06-18)[2025-12-20]. https://www.congress.gov/bill/119th-congress/senate-bill/2117/all-info.

[33]

Department for Science,Innovation and Technology. A pro-innovation approach to AI regulation[EB/OL]. (2023-03-29)[2025-12-20]. https://www.gov.uk/government/publications/ai-regulation-a-pro-innovation-approach.

[34]

国家互联网信息办公室. 生成式人工智能服务管理暂行办法[EB/OL]. (2023-07-10)[2025-12-20]. https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm.

[35]

Cyberspace Administration of China. Measures for the administration of generative artificial intelligence services[EB/OL]. (2023-07-10)[2025-12-20]. https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm.

[36]

European Parliament. Artificial intelligence act:MEPs adopt landmark law[EB/OL]. (2024-03-13)[2026-06-15]. https://www.europarl.europa.eu/news/en/press-room/20240308IPR19015/artificial-intelligence-act-meps-adopt-landmark-law.

[37]

Kreps S,McCain R M,Brundage M. All the news that’s fit to fabricate:AI-generated text as a tool of media misinformation[J]. Journal of Experimental Political Science,2022,9(1):104-117.

[38]

Xu D N,Fan S J,Kankanhalli M. Combating misinformation in the era of generative AI models[C]//Proceedings of the 31st ACM International Conference on Multimedia,2023:9291-9298.

[39]

Argyle L P,Busby E C,Fulda N,et al. Out of one,many:Using language models to simulate human samples[J]. Political Analysis,2023,31(3):337-351.

[40]

Wan Y X,Pu G,Sun J,et al. “Kelly is a warm person,Joseph is a role model”:Gender biases in LLM-generated reference letters[PP/OL]. V5. arXiv (2023-12-01)[2025-12-20]. https://doi.org/10.48550/arXiv.2310.09219.

[41]

Sheng E,Chang K W,Natarajan P,et al. The woman worked as a babysitter:On biases in language generation[C]//Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing,2019:3405-3410.

[42]

Merritt S M,Ako-Brew A,Bryant W J,et al. Automation-induced complacency potential:Development and validation of a new scale[J]. Frontiers in Psychology,2019,10:225.

[43]

Arts B,Leroy P. Institutional dynamics in environmental governance[M]. Dordrecht:Springer,2006:45-68.

[44]

Birkstedt T,Minkkinen M,Tandon A,et al. AI governance:Themes,knowledge gaps and future agendas[J]. Internet Research,2023,33(7):133-167.

[45]

Hu X M,Chen J Z,Li X C,et al. Do large language models know about facts?[PP/OL]. arXiv (2023-10-08)[2025-12-20]. https://doi.org/10.48550/arXiv.2310.05177.

[46]

Wang B S,Yue X,Sun H. Can ChatGPT defend its belief in truth? Evaluating LLM reasoning via debate[PP/OL]. V2. arXiv (2023-10-10)[2025-12-20]. https://doi.org/10.48550/arXiv.2305.13160.

[47]

Tian Y F,Ravichander A,Qin L H,et al. MacGyver:Are large language models creative problem solvers?[PP/OL]. V4. arXiv (2025-02-22)[2025-12-20]. https://doi.org/10.48550/arXiv.2311.09682.

[48]

Thorne J,Vlachos A,Christodoulopoulos C,et al. FEVER:A large-scale dataset for Fact Extraction and VERification[PP/OL]. V3. arXiv (2018-12-18)[2025-12-20]. https://doi.org/10.48550/arXiv.1803.05355.

[49]

Schuster T,Fisch A,Barzilay R. Get your vitamin C! Robust fact verification with contrastive evidence[PP/OL]. arXiv (2021-03-15)[2025-12-20]. https://doi.org/10.48550/arXiv.2103.08541.

[50]

Politifact fact-checking dataset[DB/OL]. [2025-12-20]. https://www.kaggle.com/datasets/shivkumarganesh/politifact-factcheck-data.

[51]

Cobbe K,Kosaraju V,Bavarian M,et al. Training verifiers to solve math word problems[PP/OL]. V2. arXiv (2021-11-18)[2025-12-20]. https://doi.org/10.48550/arXiv.2110.14168.

[52]

Saparov A,He H. Language models are greedy reasoners:A systematic formal analysis of chain-of-thought[PP/OL]. V4. arXiv (2023-03-02)[2025-12-20]. https://doi.org/10.48550/arXiv.2210.01240.

[53]

Rao S,Tetreault J. Dear sir or madam,may I introduce the GYAFC dataset:Corpus,benchmarks and metrics for formality style transfer[C]//Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Technologies,2018:129-140.

[54]

Socher R,Perelygin A,Wu J,et al. Recursive deep models for semantic compositionality over a sentiment treebank[C]//Proceedings of the 2013 Conference on Empirical Methods in Natural Language Processing,2013:1631-1642.

[55]

European Commission. Ethics guidelines for trustworthy AI[EB/OL]. (2019-04-08)[2025-12-20]. https://digital-strategy.ec.europa.eu/en/library/ethics-guidelines-trustworthy-ai.

[56]

Statt N. Google dissolves AI ethics board just one week after forming it[EB/OL]. (2019-04-05)[2025-12-20]. https://www.theverge.com/2019/4/4/18296113/google-ai-ethics-board-ends-controversy-kay-coles-james-heritage-foundation.

[57]

Morgan D. Anticipatory regulatory instruments for AI systems:A comparative study of regulatory sandbox schemes[C]//Proceedings of the 2023 AAAI/ACM Conference on AI,Ethics,and Society,2023:980-981.

[58]

Autio C,Schwartz R,Dunietz J,et al. Artificial intelligence risk management framework:Generative artificial intelligence profile:NIST AI 600-1[R]. Gaithersburg:National Institute of Standards and Technology,2024.

[59]

Gan Y Y,Yang Y,Ma Z,et al. Navigating the risks:A survey of security,privacy,and ethics threats in LLM-based agents[PP/OL]. arXiv (2024-11-14)[2025-12-20]. https://doi.org/10.48550/arXiv.2411.09523.

[60]

Goetz L,Trengove M,Trotsyuk A,et al. Unreliable LLM bioethics assistants:Ethical and pedagogical risks[J]. The American Journal of Bioethics,2023,23(10):89-91.

[61]

Mou Y T,Zhang S K,Ye W. SG-bench:Evaluating LLM safety generalization across diverse tasks and prompt types[C]//Advances in Neural Information Processing Systems 37,2024:123032-123054.

[62]

Sarker I H. LLM potentiality and awareness:A position paper from the perspective of trustworthy and responsible AI modeling[J]. Discover Artificial Intelligence,2024,4(1):40.

[63]

Zhou X Y,Wang W D,Lu L,et al. SafeAgent:Safeguarding LLM agents via an automated risk simulator[PP/OL]. V2. arXiv (2025-07-18)[2025-12-20]. https://doi.org/10.48550/arXiv.2505.17735.

[64]

Belmoukadam O,De Jonghe J,Ajridi S,et al. AdversLLM:A practical guide to governance,maturity and risk assessment for LLM-based applications[J]. International Journal on Cybernetics & Informatics,2024,13(6):51-68.

[65]

Hua W Y,Yang X J,Jin M Y,et al. TrustAgent:Towards safe and trustworthy LLM-based agents[C]//Findings of the Association for Computational Linguistics:EMNLP 2024,2024:10000-10016.

[66]

Ji J M,Liu M,Dai J,et al. BeaverTails:Towards improved safety alignment of LLM via a human-preference dataset[C]//Advances in Neural Information Processing Systems 36,2023:24678-24704.

[67]

Peng S,Chen P Y,Hull M,et al. Navigating the safety landscape:Measuring risks in finetuning large language models[C]//Advances in Neural Information Processing Systems 37,2024: 95692-95715.

[68]

Wei A,Haghtalab N,Steinhardt J. Jailbroken:How does LLM safety training fail?[C]//Advances in Neural Information Processing Systems 36,2023:80079-80110.

[69]

Yang Z Y,Raman S S,Shah A,et al. Plug in the safety chip:Enforcing constraints for LLM-driven robot agents[C]//2024 IEEE International Conference on Robotics and Automation (ICRA),2024:14435-14442.

[70]

Röttger P,Pernisi F,Vidgen B,et al. SafetyPrompts:A systematic review of open datasets for evaluating and improving large language model safety[C]//Proceedings of the AAAI Conference on Artificial Intelligence,2025:27617-27627.

[71]

Bird C,Ungless E,Kasirzadeh A. Typology of risks of generative text-to-image models[C]//Proceedings of the 2023 AAAI/ACM Conference on AI,Ethics,and Society,2023:396-410.

基金资助

中国工程院咨询项目“国家级大模型监管保险箍模式研究”(2025-XZ-08)

教育部哲学社会科学重大课题研究项目(24JZD040)

国家自然科学基金项目(72293583)

国家自然科学基金项目(72293580)

AI Summary AI Mindmap
PDF (788KB)

333

访问

0

被引

详细

导航
相关文章

AI思维导图

/