ASR 服务
一、概述
Level Infinite ASR(Automatic Speech Recognition)服务是基于大模型能力与海量游戏语音数据训练构建的实时语音识别服务,面向全球化游戏及相关泛娱乐场景,支持多语言语音实时转写。
服务针对游戏场景中的语音通信特点进行了专项优化,在复杂噪声环境、游戏术语识别、多语言及方言覆盖以及低延迟处理等方面具备较高识别准确率,可为实时翻译、语音聊天、内容审核等业务提供稳定可靠的语音识别能力。
二、适用场景
2.1 游戏内玩家语音聊天
将玩家语音实时转写为文字,支持游戏内公屏聊天、队内沟通等场景,适用于对转写实时性要求较高的语音互动需求。
2.2 游戏内 NPC 语音指令交互
玩家可通过语音与游戏内 AI 角色进行交互。ASR 模块负责将玩家语音实时转写为文本,作为下游系统的输入,既可支持与 AI NPC 的自然对话,也可支持语音控制 AI 队友、触发剧情推进等指令型交互,将语音输入转换为可执行的游戏操作指令。
2.3 直播与赛事同传
为游戏直播及赛事场景提供实时语音转写能力,并配合翻译模块实现多语言同声传译,支持多语种直播内容分发。
2.4 视频内容字幕生成
对游戏相关视频内容进行批量语音识别,输出文字稿或字幕文件,用于内容本地化处理。
三、核心能力
3.1 多语言语音识别
支持多语言语音转写能力,可将不同语言的语音输入实时转换为文本,对多种语言均具备基础识别能力。
在此基础上,针对中文、英文、阿拉伯语、土耳其语、俄语、印尼语、马来语等重点语种进行了专项训练与优化,以适配这些语言在发音、口音及表达方式上的差异。
3.2 噪声处理
内置噪声检测与过滤能力,可有效抑制枪声、爆炸声、环境人声等游戏场景中的背景噪声,在复杂音频环境下提升语音识别准确率。
支持按场景灵活配置,适用于开放麦、语音聊天及语音指令等高噪声交互场景。
3.3 说话人识别
在语音输入中区分是否为有效人声输入,支持说话人识别能力的按场景配置与启用,用于辅助判断语音输入的有效性。
在语音指令场景中,可减少环境音或无关语音造成的误触发;在语音聊天场景中,可放宽限制,避免影响正常对话内容识别。
3.4 多语种检测(LID)
多语种检测(Language Identification,LID)用于识别语音输入所属语言类型,并输出对应语种结果及置信度。
支持中文、英文、阿拉伯语、土耳其语、俄语等目标语种识别,并对非目标语种或无法判定的语音进行兜底处理,用于后续语音识别流程的语种路由与处理。
3.5 游戏用语识别优化
针对游戏场景中的语音识别问题,具备通用语、游戏常用语及游戏术语的分层优化能力,提升基础语音转写的整体准确性,并增强对游戏内高频表达的识别能力。
3.6 低延迟实时识别
提供端到端实时语音识别能力,支持 160ms - 350ms 低延迟输出,满足游戏语音聊天、实时对话及语音交互等对响应速度要求较高的业务场景。
3.7 全球多区域部署
已在新加坡、雅加达、美西(硅谷)、美东(弗吉尼亚)、南美(圣保罗)、法兰克福、中东(迪拜)等区域部署服务节点,支持根据目标用户区域选择就近节点接入,以降低网络传输延迟。
四、支持语言列表
ASR 服务当前已针对以下重点语言进行专项优化,包括:
| 分类 | 语言代码 | 语言 |
|---|---|---|
| 中文 | zh | 中文(简体/通用) |
| zh-tw | 繁体中文(台湾) | |
| zh-hk | 繁体中文(香港) | |
| 东亚语言 | ja | 日语 |
| ko | 韩语 | |
| 西欧语言 | en | 英语 |
| de | 德语 | |
| fr | 法语 | |
| 东欧语言 | ru | 俄语 |
| 东南亚语言 | ms | 马来语 |
| id | 印度尼西亚语 | |
| 中东/南亚语言 | ar | 阿拉伯语 |
| tr | 土耳其语 |
除重点优化语言外,系统同时支持所有语言的通用识别能力。
五、系统架构
ASR 语音识别引擎采用多阶段流水线架构,音频请求在进入模型前经过预处理:对原始音频进行降噪(ANS)净化,同时通过人声检测(VAD)与音频切分捕获有效语音边界,并完成输入规范化。
经多语种 ASR 模型推理并结合延迟压缩与稳定策略后,对输出文本进行后处理校准,并由语义纠错与格式化输出进行润色与标点规范,最终返回识别结果。
ASR 流程图

六、接入说明
6.1 接入方式
本服务提供 SDK 接入和标准 API 接入两种接入方式。
完整接入说明请参考 ASR 服务接入文档。