GB/Z 243-2026 人工智能 端侧大模型推理引擎技术要求

GB/Z 243-2026 Artificial intelligence—Technical requirements for on-device large-scale model inference engine

国家标准 中文简体 现行 页数:20页 | 格式:PDF

基本信息

标准号
GB/Z 243-2026
标准类型
国家标准
标准状态
现行
中国标准分类号(CCS)
国际标准分类号(ICS)
发布日期
2026-08-27
实施日期
-
发布单位/组织
国家市场监督管理总局、国家标准化管理委员会
归口单位
全国信息技术标准化技术委员会(SAC/TC 28)
适用范围
本文件确立了功能视角下的端侧大模型推理引擎参考架构,规定了大模型在端侧部署的技术要求。
本文件适用于端侧大模型推理引擎的设计、开发、测试和部署。

发布历史

文前页预览

研制信息

起草单位:
上海交通大学、中国电子技术标准化研究院、浙江大学、淘宝(中国)软件有限公司、联想(北京)有限公司、中兴通讯股份有限公司、中国电信集团有限公司、青岛国创智能家电研究院有限公司、济南浪潮数据技术有限公司、中国电力科学研究院有限公司、中国移动通信集团终端有限公司、中国电信股份有限公司上海分公司、蔚来控股有限公司、上海壁仞科技股份有限公司、OPPO广东移动通信有限公司、天津大学、南京大学
起草人:
吴帆、牛超越、吴飞、鲍薇、吕承飞、吴杰、张东、王晔、王茜莺、周飞、郝建业、许辉阳、龚勃、刘彪、卢龙、丁瑞全、秦征、陈贵海、张慷、朱文印、董建、徐洋、崔卓、黄正翔、郑臻哲、杨易、张圣宇、郑若琳、刘晓璇、王召德、王晓辉、邢冯、陈晓春、朱姝、刘生钟、柳宁、陈静远、范鹤鹤、陈志文、康峰、李沁雅、章敏、魏颖、周煊赫、朱霖潮、贺可强、刘泽民
出版信息:
页数:20页 | 字数:21 千字 | 开本: 大16开

内容描述

ICS35240

CCSL.70

中华人民共和国国家标准化指导性技术文件

GB/Z243—2026

人工智能端侧大模型推理引擎技术要求

Artificialintelligence—Technicalrequirementsforon-devicelarge-scale

modelinferenceengine

2026-08-27发布

国家市场监督管理总局发布

国家标准化管理委员会

GB/Z243—2026

目次

前言

…………………………Ⅲ

引言

…………………………Ⅳ

范围

1………………………1

规范性引用文件

2…………………………1

术语和定义

3………………1

缩略语

4……………………1

参考架构

5…………………2

技术要求

6…………………2

数据

6.1…………………2

轻量化部署

6.2…………………………4

异构软硬件适配

6.3……………………6

推理计算加速

6.4………………………6

推理内存优化

6.5………………………8

参考文献

……………………10

GB/Z243—2026

前言

本文件为规范类指导性技术文件

本文件按照标准化工作导则第部分标准化文件的结构和起草规则的规定

GB/T1.1—2020《1:》

起草

请注意本文件的某些内容可能涉及专利文件的发布机构不承担识别专利的责任

。。

本文件由全国信息技术标准化技术委员会提出并归口

(SAC/TC28)。

本文件起草单位上海交通大学中国电子技术标准化研究院浙江大学淘宝中国软件有限公

:、、、()

司联想北京有限公司中兴通讯股份有限公司中国电信集团有限公司青岛国创智能家电研究院有

、()、、、

限公司济南浪潮数据技术有限公司中国电力科学研究院有限公司中国移动通信集团终端有限公司

、、、、

中国电信股份有限公司上海分公司蔚来控股有限公司上海壁仞科技股份有限公司广东移动

、、、OPPO

通信有限公司天津大学南京大学

、、。

本文件主要起草人吴帆牛超越吴飞鲍薇吕承飞吴杰张东王晔王茜莺周飞郝建业许辉阳

:、、、、、、、、、、、、

龚勃刘彪卢龙丁瑞全秦征陈贵海张慷朱文印董建徐洋崔卓黄正翔郑臻哲杨易张圣宇

、、、、、、、、、、、、、、、

郑若琳刘晓璇王召德王晓辉邢冯陈晓春朱姝刘生钟柳宁陈静远范鹤鹤陈志文康峰李沁雅

、、、、、、、、、、、、、、

章敏魏颖周煊赫朱霖潮贺可强刘泽民

、、、、、。

GB/Z243—2026

引言

端侧大模型推理引擎作为人工智能技术演进中的关键方向致力于将高性能的大语言模型和多模

,

态大模型部署于移动端设备以满足对低延迟响应离线处理低成本隐私保护等日益增长的实际需

,、、、

求相较于传统依赖云侧大模型推理部署方式端侧推理引擎能在保持智能能力的同时显著提升系统

。,,

的自主性实时性与鲁棒性已成为产业界与学术界高度关注的研究热点并在智能终端物联网自动

、,,、、

驾驶工业控制等领域展现出广阔的应用前景与实际价值本文件旨在规范当前端侧大模型推理引擎

、。

的系统架构与关键技术路径推动端侧资源约束下的模型压缩高效异构计算与调度优化等能力的标准

,、

化建设提升端侧智能系统的普适部署能力和运行效率进一步拓展大模型技术在终端侧的可持续发展

,,

与规模化落地助力智能生态体系的全面升级与广泛赋能

,。

GB/Z243—2026

人工智能端侧大模型推理引擎技术要求

1范围

本文件确立了功能视角下的端侧大模型推理引擎参考架构规定了大模型在端侧部署的技术要求

,。

本文件适用于端侧大模型推理引擎的设计开发测试和部署

、、。

2规范性引用文件

下列文件中的内容通过文中的规范性引用而构成本文件必不可少的条款其中注日期的引用文

。,

件仅该日期对应的版本适用于本文件不注日期的引用文件其最新版本包括所有的修改单适用于

,;,()

本文件

信息技术人工智能术语

GB/T41867—2022

人工智能大模型第部分通用要求

GB/T45288.1—20251:

3术语和定义

界定的以及下列术语和定义适用于本文件

GB/T41867—2022、GB/T45288.1—2025。

31

.

端侧大模型推理引擎on-devicelarge-scalemodelinferenceengine

部署在端侧设备上用于对已训练的大模型进行加载调度和执行利用设备本地计算资源实现高

,、,

效推理并支撑特定端侧智能任务运行的基础软件

,。

32

.

模型剪枝modelpruning

通过删除冗余参数或结构降低模型规模与计算成本的模型轻量化方法

,。

33

.

知识蒸馏knowledgedistillation

用复杂大模型教师模型指导轻量化模型学生模型将核心知识压缩迁移在降低模型资源占用

()(),,

的同时尽可能保留推理精度的模型轻量化方法

,。

4缩略语

下列缩略语适用于本文件

中央处理器

CPU:(CentralProcessingUnit)

图形处理器

GPU:(GraphicProcessingUnit)

神经处理器

NPU:(NeuralProcessingUnit)

后训练量化

PTQ:(Post-TrainingQuantization)

量化感知训练

QAT:(QuantizationAwareTraining)

1

定制服务