T/SCPCA 014-2025 大语言模型金融领域应用评测指南

T/SCPCA 014-2025 Evaluation guide for Large Language Model in financial applications

团体标准 中文(简体) 现行 页数:27页 | 格式:PDF

基本信息

标准号
T/SCPCA 014-2025
标准类型
团体标准
标准状态
现行
中国标准分类号(CCS)
-
国际标准分类号(ICS)
发布日期
2025-12-26
实施日期
2025-12-26
发布单位/组织
-
归口单位
四川省支付清算协会
适用范围
本文件提供了大语言模型在成渝地区金融领域应用评测的指南。 本文件适用于成渝地区金融机构对大语言模型能力评测的设计与实施。 1 范围4 2 规范性引用文件 3 术语和定义 4 缩略语 5 评测原则 6 评测维度 6.1 概述 6.2 性能效率 6.3 信息抽取能力 6.4 信息归纳能力 6.5 指令遵循能力 6.6 规避风险能力 6.7 逻辑能力 6.8 工具调用能力 6.9 文本真实性 6.10 输出稳定性 6.11 文本一致性 6.12 语言多样性 6.13 情绪与智力能力 6.14 想象力与类比关联能力 7 评测方法 7.1 准备评测数据 7.2 设计评测工具 7.3 搭建评测环境 7.4 评测执行 7.5 结果分析

发布历史

研制信息

起草单位:
四川新网银行股份有限公司、西南财经大学金融科技国际联合实验室、重庆国家 金融科技认证中心、中国人民银行德阳市分行、阿坝州分行、攀枝花市分行、重庆银行股份有限公司、 浙商银行股份有限公司、四川天府银行股份有限公司、中国民生银行股份有限公司成都分行、兴业银行 股份有限公司成都分行、中信银行股份有限公司成都分行、四川银行股份有限公司、四川农商联合银行股份有限公司
起草人:
李秀生、毛航、卫浩、詹雪峰、陈思成、吴琼、林昱、陈少磊、王瑞成、杨雄 进、李开宇、董潇、余关元、聂丽琴、秦逞、吴娟、赖沁心、姚治菊、任启兴、张柠、宋卓霖、王海、 陈新剑、朱泓霏、程远恒、郑鄞昊、蒋世炜、胡齐军
出版信息:
页数:27页 | 字数:- | 开本: -

内容描述

ICS35.240.40

CCSA11

团体标准

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

大语言模型金融领域应用评测指南

EvaluationguideforLargeLanguageModelinfinancialapplications

2025-12-25发布2025-12-25实施

四川省金融学会

四川省支付清算协会发布

重庆市金融学会

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

目次

目次...................................................................................I

前言..................................................................................II

引言.................................................................................III

1范围.................................................................................4

2规范性引用文件.......................................................................4

3术语和定义...........................................................................4

4缩略语...............................................................................4

5评测原则.............................................................................5

6评测维度.............................................................................5

6.1概述.............................................................................5

6.2性能效率.........................................................................6

6.3信息抽取能力.....................................................................7

6.4信息归纳能力.....................................................................7

6.5指令遵循能力.....................................................................7

6.6规避风险能力.....................................................................8

6.7逻辑能力.........................................................................8

6.8工具调用能力.....................................................................8

6.9文本真实性.......................................................................9

6.10输出稳定性......................................................................9

6.11文本一致性......................................................................9

6.12语言多样性.....................................................................10

6.13情绪与智力能力.................................................................10

6.14想象力与类比关联能力...........................................................11

7评测方法............................................................................11

7.1准备评测数据....................................................................11

7.2设计评测工具....................................................................11

7.3搭建评测环境....................................................................12

7.4评测执行........................................................................12

7.5结果分析........................................................................12

附录A(资料性)评测实施指南...........................................................13

附录B(资料性)显存配置参考...........................................................24

参考文献..............................................................................25

I

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

前言

本文件按照GB/T1.1—2020《标准化工作导则第1部分:标准化文件的结构和起草规则》的规定

起草。

请注意本文件的某些内容可能涉及专利。本文件的发布机构不承担识别专利的责任。

本文件由四川新网银行股份有限公司、西南财经大学金融科技国际联合实验室、重庆国家金融科技

认证中心提出。

本文件由四川省支付清算协会、四川省金融学会、重庆市金融学会归口。

本文件起草单位:四川新网银行股份有限公司、西南财经大学金融科技国际联合实验室、重庆国家

金融科技认证中心、中国人民银行德阳市分行、阿坝州分行、攀枝花市分行、重庆银行股份有限公司、

浙商银行股份有限公司、四川天府银行股份有限公司、中国民生银行股份有限公司成都分行、兴业银行

股份有限公司成都分行、中信银行股份有限公司成都分行、四川银行股份有限公司、四川农商联合银行

股份有限公司。

本文件主要起草人:李秀生、毛航、卫浩、詹雪峰、陈思成、吴琼、林昱、陈少磊、王瑞成、杨雄

进、李开宇、董潇、余关元、聂丽琴、秦逞、吴娟、赖沁心、姚治菊、任启兴、张柠、宋卓霖、王海、

陈新剑、朱泓霏、程远恒、郑鄞昊、蒋世炜、胡齐军。

本文件为首次发布。

II

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

引言

随着AI技术的快速发展,大语言模型在金融领域的应用场景不断拓展,已深入应用于投资分析报告

生成、风险预警文本处理等多个核心环节。目前,市面上大语言模型数量众多,但质量参差不齐,部分

模型存在准确性、连贯性、逻辑性等方面的问题。因此,如何对大语言模型进行全面、客观的金融应用

评测,筛选出符合自身需求的大语言模型,对金融机构数字化智能化转型具有重要意义。

本文件旨在为金融机构提供一套科学、合理、实用的大语言模型评测体系,可以应用于大语言模型

选型等场景。金融机构可以通过该方法对多个大语言模型进行评测,分析不同大语言模型的优缺点,选

择最符合自身需求的大语言模型。

III

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

大语言模型金融领域应用评测指南

1范围

本文件提供了大语言模型在成渝地区金融领域应用评测的指南。

本文件适用于成渝地区金融机构对大语言模型能力评测的设计与实施。

2规范性引用文件

下列文件中的内容通过文中的规范性引用而构成本文件必不可少的条款。其中,注日期的引用文件,

仅该日期对应的版本适用于本文件;不注日期的引用文件,其最新版本(包括所有的修改单)适用于本

文件。

GB/T45288.2—2025人工智能大模型第2部分:评测指标与方法

3术语和定义

下列术语和定义适用于本文件。

3.1

大语言模型largelanguagemodel

使用大量文本数据训练,可以理解语言文本的含义、生成自然语言文本、处理多种自然语言任务的

人工智能模型。

3.2

幻觉hallucination

大语言模型生成文本时,产生与输入信息不符、缺乏事实依据、逻辑混乱等错误结果的现象。

3.3

测试用例testcase

在对大语言模型进行测试时,插入到输入样本中,用于引导或激发大语言模型产生预期反应的指令

或信息对象。

3.4

评测维度evaluationdimension

为实现大语言模型在金融领域能力的全面评估,依据特定目标而划分的能力类别。

3.5

评测项evaluationitem

为实施具体评测任务而设定的最小评测单元。

4缩略语

下列缩略语适用于本文件。

API:应用编程接口(ApplicationProgrammingInterface)

GPU:图形处理器(GraphicsProcessingUnit)

FP16:16位浮点数(FloatingPoint16-bit)

4

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

FP8:8位浮点数(FloatingPoint8-bit)

5评测原则

大语言模型在金融领域的应用评测宜遵循金融行业基本规律,坚持以下基本原则。

a)合规性原则:遵守《中华人民共和国网络安全法》《中华人民共和国数据安全法》《中华人民

共和国个人信息保护法》等法律法规,符合金融行业相关标准及管理要求。

b)安全性原则:宜建立数据安全防护体系,对评测数据、交互数据等实施分级分类管理,明确敏

感信息处理规范,禁止直接使用客户个人信息及交易数据。

c)完整性原则:评测项设置宜实现全维度覆盖,避免核心能力维度遗漏,保证评测体系对大语言

模型性能的完整映射。

d)公平性原则:确保评测过程在标准化测试环境下进行,消除外部环境变量对评测结果的干扰,

保证不同大语言模型在相同测试条件、相同数据集及相同评价指标下的可比性。

6评测维度

6.1概述

本章介绍了大语言模型金融应用的评测维度及评测项,共包含性能效率、信息抽取能力、信息归纳

能力、指令遵循能力、规避风险能力、逻辑能力、工具调用能力、文本真实性、输出稳定性、文本一致

性、语言多样性、情绪与智力能力、想象力和类比关联能力共13个评测维度,每个评测维度下含3-6个

评测项,共53个评测项。

评测维度与评测项见下表。

表1评测维度与评测项

序号评测维度评测项

1响应速度

2并发处理效率

性能效率

3资源消耗

4长文本处理性能

5关键字段抽取

6实体识别

信息抽取能力

7关系抽取

8数值抽取

9核心要点提炼

10冗余信息过滤

信息归纳能力

11层级结构表达

12跨文档归纳

13格式规范遵循度

14指令遵循能力无幻觉输出控制

15复合指令完成度

16有害内容拒答

17客观公正

规避风险能力

18合规与伦理意识

19隐私数据处理

20因果关系分析

21逻辑能力假设验证

22逻辑一致性

5

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

表1评测维度与评测项(续)

序号评测维度评测项

23逻辑能力综合推理

24工具选择准确性

25工具调用能力API调用准确性

26结果解析准确性

27事实准确性

28信息时效性

29金融专业度

文本真实性

30幻觉抑制

31事实与观点区分

32来源追溯与引用

33关键信息输出稳定性

34数值输出稳定性

输出稳定性

35逻辑结构复现性

36随机性可控度

37上下文连贯性

38风格一致性

39时间线一致性

文本一致性

40术语一致性

41跨文档一致性

42观点一致性

43词汇丰富度

44句式结构多样性

语言多样性

45场景适应性

46多语言兼容性

47金融情绪识别

48共情与适当回应

情绪与智力能力

49语气与风格控制

50用户意图深度理解

51跨领域分析

52想象力与类比关联能力创新方案设计

53金融概念转化

6.2性能效率

6.2.1评测说明

性能效率指大语言模型在金融领域大规模高并发场景下处理用户请求的效能表现,评测时主要关注

大语言模型在实际部署环境中的计算性能和资源利用率。

6.2.2评测项

性能效率主要包括以下评测项:响应速度、并发处理效率、资源消耗、长文本处理性能。

a)响应速度:大语言模型从接收用户输入指令到生成第一个词元(token)所消耗的时间,主要用

于评测大语言模型理解金融相关请求的效率。

b)并发处理效率:大语言模型在高并发负载下,响应时间、吞吐量等关键性能指标的波动特征,

主要用于评测大语言模型的服务稳定性和承载能力。

6

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

c)资源消耗:大语言模型在执行任务时对计算资源的占用情况,主要用于评测大语言模型的部署

成本和资源利用率。

d)长文本处理性能:大语言模型处理长篇金融文本的速度和资源消耗情况,主要用于评测大语言

模型处理长文本任务时的性能表现。

6.3信息抽取能力

6.3.1评测说明

信息抽取能力指大语言模型在金融场景下从非结构化或半结构化文本中提取关键信息并转化为结

构化数据的能力,评测时主要关注大语言模型对关键信息的识别与提取的精确性。

6.3.2评测项

信息抽取能力主要包括以下评测项:关键字段抽取、实体识别、关系抽取、数值抽取。

a)关键字段抽取:大语言模型从金融文本中抽取重要数据字段的能力,主要用于评测大语言模型

对关键信息的敏感度。

b)实体识别:大语言模型对金融实体的认知和分类能力,主要用于评测大语言模型在处理金融文

本时,是否可以准确识别并分类文本中的特定实体(公司名称、股票代码、产品类型等)。

c)关系抽取:大语言模型在处理金融文本时,识别并抽取实体之间的关系的能力,主要用于评测

大语言模型对复杂语义关系理解的准确性。

d)数值抽取:大语言模型对小数点、单位、百分比的精准识别与分析能力,主要用于评测大语言

模型对数值的敏感度。

6.4信息归纳能力

6.4.1评测说明

信息归纳能力指大语言模型在金融场景下从大量非结构化或半结构化文本中提炼并总结核心信息

的能力,评测时主要关注大语言模型对核心信息归纳的准确度。

6.4.2评测项

信息归纳能力主要包括以下评测项:核心要点提炼、冗余信息过滤、层级结构表达、跨文档归纳。

a)核心要点提炼:大语言模型从金融相关文本中提炼核心信息的能力,主要用于评测大语言模型

对重点信息的敏感度。

b)冗余信息过滤:大语言模型在处理金融文本时对无关信息或重复信息的识别和剔除能力,主要

用于评测大语言模型的信息筛选准确性。

c)层级结构表达:大语言模型的表达逻辑性,主要用于评测大语言模型在生成总结时,是否可以

按照逻辑顺序(时间顺序、重要性排序、因果关系排列等)组织内容,并确保总结内容条理清

晰、易于理解。

d)跨文档归纳:大语言模型在跨文档场景下的信息整合与归纳能力,主要用于评测大语言模型在

处理多个相关文档(同一行业的多份研报、同一公司的多期财报等)时,是否可以整合不同来

源的信息,形成统一、完整的总结的能力。

6.5指令遵循能力

6.5.1评测说明

指令遵循能力指大语言模型在金融场景下准确理解并执行用户指令的能力,评测时主要关注大语言

模型对用户指令的执行表现。

6.5.2评测项

指令遵循能力主要包括以下评测项:格式规范遵循度、无幻觉输出控制、复合指令完成度。

a)格式规范遵循度:大语言模型按照指定格式要求生成输出的能力,主要用于评测大语言模型对

用户指定的文档格式标准的遵循程度。

7

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

b)无幻觉输出控制:大语言模型在接收到抑制幻觉的特定提示语或指令时,主动抑制生成虚假数

据或虚假信息的能力,主要用于评测模型在受控条件下的真实性调控表现。

c)复合指令完成度:大语言模型完整执行包含多重要求的复杂指令的能力,主要用于评测大语言

模型对复合指令的理解和执行完整性。

6.6规避风险能力

6.6.1评测说明

规避风险能力指大语言模型在生成文本时,识别、理解、遵守相关法律法规、道德规范以及金融行

业特定合规要求的能力,评测时主要关注大语言模型对安全边界的把握、法律风险的防范以及用户权益

的保护。

6.6.2评测项

规避风险能力主要包括以下评测项:有害内容拒答、客观公正、合规与伦理意识、隐私数据处理。

a)有害内容拒答:大语言模型对在面对包含非法活动、歧视性言论、虚假宣传、诱导高风险行为

等有害内容的指令时,准确识别并拒绝响应,主要用于评测大语言模型的安全防护和风险识别

能力。

b)客观公正:大语言模型在辅助决策过程中,仅提供客观信息与风险提示,避免表现出特定倾向,

造成隐形误导或隐形推荐,主要用于评测大语言模型在金融服务中保持客观中立、避免偏见与

歧视的能力。

c)合规与伦理意识:大语言模型在回应中体现出对金融行业基本合规要求和职业伦理的认知,主

要用于评测大语言模型在金融实践中展现出的规则遵守和价值判断能力。

d)隐私数据处理:大语言模型在交互中识别并恰当处理个人身份信息或其他敏感数据,拒绝记录、

存储、答复此类信息,主要用于评测大语言模型保护用户隐私的能力。

6.7逻辑能力

6.7.1评测说明

逻辑能力指大语言模型在金融场景下分析文本或生成文本时展现的推理严谨性和逻辑链条完整性,

评测时主要关注大语言模型在面对复杂问题时能否通过清晰的逻辑推导得出合理结论。

6.7.2评测项

逻辑能力主要包括以下评测项:因果关系分析、假设验证、逻辑一致性、综合推理。

a)因果关系分析:大语言模型在处理金融相关文本时,对事件之间因果关系的识别和解释能力,

主要用于评测大语言模型对金融现象背后逻辑的理解深度。

b)假设验证:大语言模型在面对假设性问题时,基于已知信息和合理假设进行推导,并验证假设

合理性或提出反例的能力,主要用于评测大语言模型的推理灵活性和严谨性。

c)逻辑一致性:大语言模型在生成文本或分析文本时,保持逻辑严密,避免自相矛盾或逻辑跳跃

的能力,主要用于评测大语言模型在复杂任务中的思维连贯性和推理有效性。

d)综合推理:大语言模型在跨领域、多变量情境下的综合分析能力,主要用于评测大语言模型在

处理需要整合多信息来源或多维度数据的任务时,能否通过多步推理得出合理结论。

6.8工具调用能力

6.8.1评测说明

工具调用能力指大语言模型在金融场景下动态调用工具、解析工具返回结果的能力,评测时主要关

注大语言模型利用外部工具处理用户复杂需求时的表现。

6.8.2评测项

工具调用能力主要包括以下评测项:工具选择准确性、API调用准确性、结果解析准确性。

a)工具选择准确性:大语言模型根据用户需求,准确判断并选择最适合解决当前问题的工具的能

力,主要用于评测大语言模型工具理解和任务拆解的准确性。

8

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

b)API调用准确性:大语言模型根据所选工具的API文档,生成准确的调用代码或请求的能力,

主要用于评测大语言模型将自然语言指令转化为机器可执行语言的精确度。

c)结果解析准确性:大语言模型准确解析工具返回的结果,并将其自然融入最终答复中的能力,

主要用于评测大语言模型对结构化数据的理解与应用水平。

6.9文本真实性

6.9.1评测说明

文本真实性指大语言模型生成文本真实反映客观现实并符合金融领域知识规范的综合质量属性,评

测时主要关注生成文本在事实相符性、专业标准遵循情况、表达诚实性等方面的可信程度。

6.9.2评测项

文本真实性主要包括以下评测项:事实准确性、信息时效性、金融专业度、幻觉抑制、事实与观点

区分、来源追溯与引用。

a)事实准确性:大语言模型生成文本与客观事实(公开数据、政策信息等)的匹配程度,主要用

于评测大语言模型输出信息的真实性和可靠性。

b)信息时效性:大语言模型对信息的动态捕获和同步能力,主要用于评测大语言模型对政策法规、

市场数据等时效敏感信息的更新及时性。

c)金融专业度:大语言模型对金融领域专业术语、概念、理论、模型和分析方法理解与应用的准

确性、规范性和深度,主要用于评测大语言模型在金融知识方面的专业素养。

d)幻觉抑制:大语言模型在面对超出其知识范围、不存在的事实或诱导性问题时,能够避免编造、

臆测或生成看似合理但实则虚假的“幻觉”信息,主要用于评测大语言模型对自身知识边界的

认知和诚实表达能力。

e)事实与观点区分:大语言模型在生成包含客观事实和主观判断的文本时,可以清晰地将两者区

分,避免将主观判断包装成既定事实,主要用于评测大语言模型表达的客观性和严谨性。

f)来源追溯与引用:大语言模型在提供引用的信息(关键数据、专业结论等)时,可以指明其信

息来源或提供必要的引用标注,主要用于评测大语言模型生成文本的可验证性和透明度。

6.10输出稳定性

6.10.1评测说明

输出稳定性指大语言模型在相同输入条件及相同模型参数配置下多次生成结果的一致程度,评测时

主要关注大语言模型在重复请求场景下保持内容、逻辑和数据一致性的能力表现。

6.10.2评测项

输出稳定性主要包括以下评测项:关键信息输出稳定性、数值输出稳定性、逻辑结构复现性、随机

性可控度。

a)关键信息输出稳定性:大语言模型针对相同金融问题多次生成回复时,核心观点和关键结论的

重复匹配程度,主要用于评测大语言模型核心输出的稳定程度。

b)数值输出稳定性:大语言模型在涉及量化分析任务时,多次生成结果的数值波动范围,主要用

于评测大语言模型数值计算的可靠程度。

c)逻辑结构复现性:大语言模型对复杂金融问题时,在多轮生成中保持分析框架结构统一的能力,

主要用于评测大语言模型思维逻辑的稳定程度。

d)随机性可控度:大语言模型通过参数设置降低非必要输出差异的能力,主要用于评测大语言模

型稳定性控制机制的有效程度。

6.11文本一致性

6.11.1评测说明

文本一致性指大语言模型在文本生成过程中保持主题统一、风格适配的能力,评测时主要关注金融

场景下生成文本的全局结构合理性和局部细节兼容性。

9

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

6.11.2评测项

文本一致性能力主要包括以下评测项:上下文连贯性、风格一致性、时间线一致性、术语一致性、

跨文档一致性、观点一致性。

a)上下文连贯性:大语言模型在长文本生成过程中保持段落间逻辑衔接自然的能力,主要用于评

测大语言模型在复杂金融文档中的叙事结构连贯性。

b)风格一致性:大语言模型根据场景需求维持风格(语体规范、文本格式等)一致性的能力,主

要用于评测大语言模型在金融文案跨场景生成中的风格适配性。

c)时间线一致性:大语言模型在涉及时间序列的文本中保持事件顺序与时间节点逻辑自洽的能力,

主要用于评测大语言模型对时间顺序的敏感度。

d)术语一致性:大语言模型在文本生成过程中保持专业术语统一的能力,主要用于评测大语言模

型对同一术语不同表达形式的敏感度。

e)跨文档一致性:大语言模型在生成系列文档时维持核心观点连贯性的能力,主要用于评测大语

言模型在持续报告生成中的信息追踪能力。

f)观点一致性:大语言模型在多利益相关方视角下保持观点统一的能力,主要用于评测大语言模

型在不同场景下的表达一致性。

6.12语言多样性

6.12.1评测说明

语言多样性指大语言模型在金融场景下灵活运用不同语言元素的综合能力,评测时主要关注大语言

模型能否在保持专业准确性的同时,通过词汇选择、句式编排等方式,使生成的文本既避免机械重复,

又能自然适配不同场景。

6.12.2评测项

语言多样性主要包括以下评测项:词汇丰富度、句式结构多样性、场景适应性、多语言兼容性。

a)词汇丰富度:大语言模型在金融文本生成中运用专业术语、同义表达和新兴概念的准确性与多

样性,主要用于评测大语言模型在多元场景下的术语掌握能力。

b)句式结构多样性:大语言模型生成金融文本时采用不同句式结构(条件句、因果句、对比句等)

的灵活性与恰当性,主要用于评测大语言模型在保持语义准确性的前提下实现表达形式多样化

的能力。

c)场景适应性:大语言模型根据目标受众(专业机构、普通投资者等)和传播媒介(研报、社交

媒体等)自动调整语言风格和表达方式的能力,主要用于评测大语言模型在跨场景应用中的风

格适应性。

d)多语言兼容性:大语言模型跨语种表征、理解与生成的能力,主要用于评测大语言模型在语言

覆盖范围(主流语种、小语种等)、多语言混合处理(中英夹杂文本理解等)等方面的实际表

现。

6.13情绪与智力能力

6.13.1评测说明

情绪与智力能力指大语言模型在金融场景下识别用户情感并作出恰当反馈的能力,评测时主要关注

大语言模型在交互过程中情感信息解析的精准度与情感表达的适当性。

6.13.2评测项

情绪与智力能力主要包括以下评测项:金融情绪识别、共情与适当回应、语气与风格控制、用户意

图深度理解。

a)金融情绪识别:大语言模型识别和理解金融相关文本(财经新闻、社交媒体评论、客户反馈等)

中所表达的情绪、态度或意图的准确性,主要用于评测大语言模型对金融语境下情感信号的捕

捉能力。

10

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

b)共情与适当回应:大语言模型在金融服务场景下,生成专业准确且带有适当情感色彩的回应的

能力,主要用于评测大语言模型在人机交互中传递恰当情感和维持良好沟通氛围的能力。

c)语气与风格控制:大语言模型根据用户指令,生成符合特定语气、风格或角色要求的文本的能

力,主要用于评测大语言模型在表达上的灵活性和可控性。

d)用户意图深度理解:大语言模型克服错误及无关信息干扰,通过上下文或主动追问,准确理解

用户模糊、隐含或未完全表达出的真实意图的能力,主要用于评测大语言模型在真实、复杂交

互场景下的理解深度与稳健性。

6.14想象力与类比关联能力

6.14.1评测说明

想象力与类比关联能力指大语言模型在金融认知框架下突破常规模式的系统性思维拓展能力,评测

时主要关注大语言模型在概念重构、关联映射、约束创新等方面的表现。

6.14.2评测项

想象力与类比关联能力主要包括以下评测项:跨领域分析、创新方案设计、金融概念转化。

a)跨领域分析:大语言模型整合非传统数据源(气候数据、网络行为等)和跨学科方法(复杂系

统理论、流行病学模型等)进行金融分析的能力,主要用于评测大语言模型突破传统分析框架

的创新思维水平。

b)创新方案设计:大语言模型在合规前提下设计结构化金融产品或优化金融流程的能力,主要用

于评测大语言模型解决复杂金融问题的创造性实践能力。

c)金融概念转化:大语言模型通过精准类比将专业金融概念转化为通俗表述的能力,主要用于评

测大语言模型在知识传播中的概念转化和逻辑保真能力。

7评测方法

7.1准备评测数据

在准备评测数据时,需严格遵循数据合规性要求与隐私保护原则,确保数据的准确性、完整性和相

关性。

a)选择评测维度:根据评测目标和实际需求,选择合适的评测维度,明确评测项和评价指标。不

同评测项的评测指标可参考附录A。

b)数据收集:从多种渠道收集金融领域的文本数据(金融新闻、研究报告、政策文件、上市公司

财报等),确保数据来源广泛且具有时效性和代表性,涵盖不同类型的金融业务和场景。

c)数据预处理:对收集到的数据进行筛选,依据金融行业的专业知识和评测的具体要求,去除重

复、错误、不完整、与评测目标无关的数据,确保数据质量。对筛选后的数据进行标准化处理,

确保数据格式统一,便于结果比对。

d)数据标注:由金融专业人员对筛选后的数据进行标注,明确每个数据样本的参考答案。记录标

注的依据和来源,以便后续的审核和验证。

e)数据合规性检查:根据金融行业的法律法规和管理要求,检查数据的合规性,确保数据的使用

符合相关的数据保护法规。

f)数据全面性和充分性评估:评估数据的全面性和充分性,确保数据能够覆盖各个评测维度和各

种可能的情况。如果发现数据缺失或数据不足,及时补充完善。

7.2设计评测工具

设计评测工具时,注意评测工具的可扩展性和灵活性,确保能够适应不同的评测需求和模型类型。

并对评测工具进行严格的测试和验证,以保证评测结果的准确性和可靠性。

a)选择评测方法:根据评测维度和评测数据的特点,选择合适的评测方法。常见的评测方法包括

人工评测、自动化评测、大模型评测。各评测方法介绍如下:

11

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

——人工评测:由专业的金融人员对模型生成的答案进行评估,具有较高的准确性和可靠性,

但效率较低;

——自动化评测:由计算机程序对模型生成的答案进行评估,效率较高,但可能存在一定的误

差;

——大模型评测:由业界先进的大模型作为裁判模型,对被评测模型生成的答案进行评估,主

要用于开放式生成、多轮对话等场景,客观性相对较高,但需要针对裁判模型设计对抗幻

觉的提示词。

b)编写评测程序:如果选择自动化评测、大模型评测,或多种评测方法组合使用,根据评测和评

测指标编写对应的评测程序。

7.3搭建评测环境

在搭建评测环境时,选择合适的硬件和软件环境,并进行充分的实验和调试。

a)硬件环境:根据被评测模型的规模和复杂度,选择合适的硬件环境,确保硬件环境具有足够的

计算能力、存储能力和网络带宽,以保证评测的高效进行。计算能力配置可参考附录B。

b)软件环境:安装和配置必要的软件环境,包括操作系统、编程语言、开发工具、模型运行环境

等。选择稳定、可靠的软件版本,确保软件之间的兼容性。

c)关键参数配置:根据评测的要求和模型的特点,配置关键参数,包括输入格式、输出格式、运

行参数等。

d)检查点设置:预先设置检查点,用于定期保存评测的中间结果和状态信息,确保在出现异常情

况时,能够及时恢复评测进度,避免数据丢失和重复工作。

7.4评测执行

在评测执行时,注意数据的存储和备份,宜进行5-10轮评测,确保评测结果的准确性。

a)数据输入:将评测数据输入到待评测的大语言模型中,生成答案。在输入数据时,注意数据的

格式和编码,确保大语言模型能够正确处理。

b)结果记录:按照规范的格式记录大语言模型生成的答案,以及评测时间、评测环境、评测项等

信息,宜使用表格、数据库或日志文件等方式。

c)数据保存:将评测结果保存到安全的存储设备(硬盘、服务器、云存储等)中,对保存的数据

进行备份、加密和权限管理,确保数据的安全性和隐私性。

7.5结果分析

遵循科学的方法和原则,结合金融行业的实际需求和应用场景,对评测结果进行客观、准确的解读。

a)计算评价指标值:根据选择的评价指标,使用统计软件或编程语言计算模型在各个评测指标上

的值。

b)结果解读:对计算得到的评价指标值进行解读,结合实际需求和应用场景,分析模型的优势和

不足,评估模型的实用性和可行性。

c)报告生成:根据结果分析的结论,生成评测报告。评测报告宜包括评测的目的、方法、结果、

分析和建议等内容,报告内容宜客观、准确、清晰。

12

T/SCJR009—2025T/SCPCA014—2025T/CQJR038—2025

附录A

(资料性)

评测实施指南

评测实施见下表A.1。

表A.1评测实施指南

序号评测维度评测项评测流程参考用例参考评价指标

步骤1:设计覆盖不同复杂度(简单概用例1:解释股票市场的流动性。

定制服务

    相似标准推荐

    更多>