实时语音转写
请求地址
访问地址: https://rcsapi.hanwg.com/ability/rcs/stt/api/outbound/{chatbot}
提交方式:
支持https
只支持POST
功能:
本接口可以将 60 秒以下的音频转为文字。适用于语音对话、语音控制、语音输入等场景。接口中涉及到的平台参数,请在平台上获取。
接口限制:需要上传完整的录音文件,录音文件时长不超过 60 秒
支持音频格式:pcm、wav、amr、m4a
音频编码要求:采样率 16000、8000,16 bit 位深,单声道,若不符合要求,接口会转换为wav文件后再做转写。
请求头参数:
请求路径参数:
| 序号 | 名称 | 数据类型 | 可选属性 | 描述 |
|---|---|---|---|---|
| 1 | chatbot | string | M | 在5G CSP平台的申请的chatbot的id。 |
请求体参数:
| 序号 | 名称 | 数据类型 | 可选属性 | 描述 |
|---|---|---|---|---|
| 1 | speech | string | M | 语音文件的二进制语音数据 ,需要进行base64 编码。语音文件时长限定在60秒以内。 |
| 2 | format | string | M | 语音文件的格式,支持pcm、wav、amr、m4a,不区分大小写。当语音数据和文件格式不一致时,有可能导致文件转写不正确 |
| 3 | language | int | O | 语音文件的语言,默认值0; 0-普通话 1-英语 2-粤语 3-四川话 |
| 4 | phone | string | O | 语音文件关联的手机号。 |
| 5 | rate | string | C | 采样率 16000、8000, 固定值。默认为 8000;若pcm、amr格式的文件采样率为非8000时,请正确填写,避免识别不准确或者识别失败 |
请求示例:
参数值说明:以下json内容为提交请求数据格式
{
"speech":"UklGRtZBAABXQVZFZm10IBIAAAABAAEAQB8AAIA+AAACABAAAABkYXRhQCkAAAAAAAD......",
"format":"wav",
"format":8000,
"language": 0
}
请求响应:
| 序号 | 名称 | 数据类型 | 可选属性 | 描述 |
|---|---|---|---|---|
| 1 | code | int | M | 请求状态;参见提交响应错误码 |
| 2 | desc | string | M | 请求响应描述 |
| 3 | result | string | C | 请求响应内容,请求成功时存在 |
响应示例
{
"code": 0,
"desc": "请求成功",
"result ": "语音对应的文本"
}
提交响应错误码:
| 错误码 | 描述 |
|---|---|
| 0 | 请求成功 |
| 1 | 账号为空 |
| 2 | 账号或密码错误 |
| 3 | 密码为空 |
| 4 | ip鉴权失败 |
| 5 | 用户被禁发 |
| 6 | chabot为空 |
| 7 | 请求地址错误 |
| 8 | 缺少请求参数 |
| 9 | 数据包/内容为空 |
| 10 | 时间逾期 |
| 11 | chabot错误 |
| 99 | 系统繁忙 |
| 201 | 能力未添加 |
| 202 | 能力已禁用 |
| 203 | 语音文件内容为空 |
| 204 | 语音文件语言错误 |
| 205 | 语音文件时长太长 |
| 206 | 语音文件格式不支持 |
| 207 | 语音文件无法解析 |
文档更新时间: 2023-12-25 11:12 作者:夏亮