ICS13.310
CCSA91
中华人民共和国国家标准
GB/T47478.1—2026
公共安全 声纹识别应用 第1部分:采集
识别建库技术要求
Publicsecurity—Voiceprintrecognitionapplications—Part1:Technical
requirementsforcapturerecognitionanddatabaseconstruction
2026-04-30发布 2026-11-01实施
国家市场监督管理总局
国家标准化管理委员会发布目 次
前言 Ⅲ …………………………………………………………………………………………………………
引言 Ⅳ …………………………………………………………………………………………………………
1 范围 1 ………………………………………………………………………………………………………
2 规范性引用文件 1 …………………………………………………………………………………………
3 术语和定义 1 ………………………………………………………………………………………………
4 声纹语音文件的来源 2 ……………………………………………………………………………………
4.1 来源分类 2 ……………………………………………………………………………………………
4.2 声纹语音样本采集要求 2 ……………………………………………………………………………
5 声纹数据质量检测与质量分级 3 …………………………………………………………………………
5.1 质量检测通用要求 3 …………………………………………………………………………………
5.2 声纹语音质量检测内容 3 ……………………………………………………………………………
5.3 声纹数据质量分级 3 …………………………………………………………………………………
6 声纹语音文件建库要求 4 …………………………………………………………………………………
6.1 数据库分类 4 …………………………………………………………………………………………
6.2 建库通用要求 5 ………………………………………………………………………………………
6.3 声纹算法测试库 6 ……………………………………………………………………………………
6.4 声纹身份库 7 …………………………………………………………………………………………
6.5 声纹特定应用库 7 ……………………………………………………………………………………
ⅠGB/T47478.1—2026前 言
本文件按照GB/T1.1—2020《标准化工作导则 第1部分:标准化文件的结构和起草规则》的规定
起草。
本文件是GB/T47478《公共安全 声纹识别应用》的第1部分。GB/T47478已经发布了以下
部分:
———第1部分:采集识别建库技术要求。
请注意本文件的某些内容可能涉及专利。本文件的发布机构不承担识别专利的责任。
本文件由中华人民共和国公安部提出。
本文件由全国安全防范报警系统标准化技术委员会(SAC/TC100)归口。
本文件起草单位:公安部第三研究所、北京得意音通技术有限责任公司、北京远鉴信息技术有限公
司、科大讯飞股份有限公司、清华大学、中国人民大学。
本文件主要起草人:郑方、戎玲、游寒旭、邬晓钧、郑榕、殷兵、吴治平、黄小妮、金琴。
ⅢGB/T47478.1—2026引 言
GB/T47478《公共安全 声纹识别应用》拟由三个部分构成。
———第1部分:采集识别建库技术要求。目的在于确立声纹数据质量的要求与评价方法、数据采集
规范、重点(特种)数据库建库规则三部分内容要求。
———第2部分:数据交换格式与接口规范。目的在于确立声纹识别应用的数据交换格式与接口
规范。
———第3部分:远程声纹识别系统要求。目的在于为提供远程声纹识别服务的系统确立管理与运
行要求。
ⅣGB/T47478.1—2026公共安全 声纹识别应用 第1部分:采集
识别建库技术要求
1 范围
本文件规定了声纹语音文件的来源、声纹数据质量检测与质量分级、声纹语音文件建库要求。
本文件适用于声纹语音文件的获得、声纹数据质量检测、声纹语音文件数据库建设和声纹识别
应用。
2 规范性引用文件
下列文件中的内容通过文中的规范性引用而构成本文件必不可少的条款。其中,注日期的引用文
件,仅该日期对应的版本适用于本文件;不注日期的引用文件,其最新版本(包括所有的修改单)适用于
本文件。
GB/T21023—2007 中文语音识别系统通用技术规范
GB/T41786—2022 公共安全 生物特征识别 术语
GB/T41807—2022 信息安全技术 声纹识别数据安全要求
GA/T1587—2019 声纹自动识别系统测试规范
3 术语和定义
GB/T41786—2022、GB/T41807—2022、GA/T1587—2019界定的以及下列术语和定义适用于本
文件。
3.1
声纹 voiceprint
对语音中所蕴含的、能表征和标识说话人的语音特征,以及基于这些特征(参数)所建立的语音模型
的总称。
注:在法庭科学的语音及音频检验鉴定领域也称voicefeature。
[来源:GB/T41786—2022,3.8.1]
3.2
声纹语音文件 voiceprintspeechfile
包含能提取声纹特征的语音数据的音频文件。
注:保存声纹语音样本得到声纹语音文件;对已有电子数据文件进行复制、截取或经过其他处理后再保存也能得到
声纹语音文件。
3.3
声纹数据 voiceprintdata
声纹语音样本和声纹语音文件的总称。
3.4
声纹算法测试库 voiceprintalgorithmevaluationdatabase
用于算法研究、应用系统评测的声纹语音文件数据库。
1GB/T47478.1—20263.5
声纹身份库 voiceprintidentitydatabase
用于识别说话人身份的声纹语音文件数据库。
3.6
声纹特定应用库 voiceprintspecificapplicationdatabase
除声纹算法测试库、声纹身份库以外其他面向特定应用的声纹语音文件数据库。
4 声纹语音文件的来源
4.1 来源分类
根据声纹语音文件的获得方式不同,声纹语音文件的来源一般分为两类:
a) 直接获取:现场或远程通过语音采集设备采集形成声纹语音样本后,保存得到声纹语音文件;
b) 间接获取:读取已有电子数据文件进行截取、合并等非篡改性操作后,重新保存得到声纹语音
文件。
4.2 声纹语音样本采集要求
4.2.1 采集时需要考虑的因素
采集声纹语音样本时,应根据实际应用的需求考虑以下因素并提出明确要求:
a) 采集环境:环境混响条件、环境噪声情况、是否有其他人声等因素;
b) 采集设备:频率响应、灵敏度、波形失真度、指向性、是否采用麦克风阵列等因素;
c) 采集参数:采样率、量化精度、通道数等因素;
d) 采集约束:采集现场是否有人监督、被采集人是否配合、被采集人说话方式(如朗读、随意说话、
对话)等因素;
e) 采集内容:是否提示或指定语音内容、所需采集的有效语音时长等因素;
f) 其他应用要求的特定因素:被采集人性别、年龄、语种或方言、口音、情绪、语速、音量等因素。
4.2.2 声纹身份库采集要求
声纹身份库的声纹语音文件来源应为直接获取。声纹语音样本采集前应对被采集人提供指导,告
知采集注意事项。在声纹语音样本采集时,采集现场环境、人员部署、采集方式、采集设备等应满足以下
要求:
a) 采集前先核实被采集人的身份信息;
b) 采集现场安静无明显噪声;
c) 语音采集设备无明显回声、电噪声、啸叫声;
d) 采用8000Hz或者16000Hz采样频率,量化精度16bit;
e) 将语音采集设备的采集有效方向指向被采集人,保持语音采集设备与被采集人之间的距离适
当固定,关闭采集设备与采集软件的自动降噪功能;
f) 不在被采集人身体明显不适的状态下采集语音;
g) 被采集人主动配合,保持正常站姿或坐姿,以自然方式念读或者对话进行采集,说话内容不机
械式重复;
注:自然方式指不刻意大声或小声,不刻意捏鼻子、捏嗓子、变声、拖音,不压迫胸腔、口腔。
h) 被采集人避免对着采集设备咳嗽、叹气、大声吸气、大声呼气;
i) 优先采用普通话发音,保持正常的语速和情绪。
2GB/T47478.1—2026
GB-T 47478.1-2026 公共安全 声纹识别应用 第1部分 采集识别建库技术要求
文档预览
中文文档
15 页
50 下载
1000 浏览
0 评论
309 收藏
3.0分
温馨提示:本文档共15页,可预览 3 页,如浏览全部内容或当前文档出现乱码,可开通会员下载原始文档
本文档由 人生无常 于 2026-07-04 12:24:15上传分享