轻语API开放平台 返回全部接口

语音技术 · 同步接口

语音识别API(录音转文字)接入指南

语音识别API用于把音频文件转换成文字:上传wav、mp3等常见格式音频,接口同步返回识别出的文本内容。适合会议纪要、语音消息归档、视频字幕制作、语音质检等场景,单次调用约0.035元,按量计费。

· 参数与计费已按当前生产接口核对

接口速览

以下信息来自轻语API开放平台生产环境接口元数据,可直接用于技术选型评估。

接口地址POST /data/api/fetchTextByVoice
计费约0.035元/次
频率限制100次/分钟
超时时间30秒
鉴权方式apikey(注册后获取)
内容类型multipart/form-data

请求参数

参数名必填类型说明
apikey必填string用户的apikey,身份凭证
audio必填file音频文件,wav、mp3等格式均支持

响应示例

成功响应(HTTP 200)

{
  "code": 200,
  "message": "语音识别成功",
  "data": {
    "partial": "语音识别出的内容"
  }
}

调用示例

cURL 示例

curl -X POST 'https://5555api.com/data/api/fetchTextByVoice' \
  -F 'apikey=YOUR_APIKEY' \
  -F 'audio=@meeting.wav'

JavaScript 示例

const fd = new FormData();
fd.append('apikey', 'YOUR_APIKEY');
fd.append('audio', audioInput.files[0]); // wav、mp3均可

const resp = await fetch('https://5555api.com/data/api/fetchTextByVoice', {
  method: 'POST',
  body: fd
});
const result = await resp.json();
if (result.code === 200) {
  console.log('识别结果:', result.data.partial);
}

Python 示例

import requests

resp = requests.post(
    'https://5555api.com/data/api/fetchTextByVoice',
    data={'apikey': 'YOUR_APIKEY'},
    files={'audio': open('meeting.wav', 'rb')}
)
result = resp.json()
if result['code'] == 200:
    print('识别结果:', result['data']['partial'])
示例中的 YOUR_APIKEY 请替换为你在轻语API控制台获取的apikey;不要在公开页面或客户端代码中暴露正式API Key。

应用场景

会议纪要自动生成

会议录音直接转文字,配合标点规则整理成纪要初稿,人工只需校对补充。

语音消息归档检索

客服语音留言、微信群语音批量转文本入库,实现全文搜索和关键词告警。

视频字幕与口播稿

采访、口播音频先转文字再生成字幕文件,省去逐句听打时间。

常见问题

语音识别API支持哪些音频格式?

支持wav、mp3等常见音频格式。建议使用16kHz及以上采样率的清晰录音,识别准确率更高。

语音识别怎么收费?

按调用次数计费,约0.035元/次,按量扣费无需预付套餐。注册账号并充值后即可调用。

能识别长录音吗,有时长限制吗?

受接口30秒超时限制,建议单次上传的音频控制在合理时长内;长录音可先切分再逐段识别,最后拼接文本。

支持实时流式识别吗?

当前接口为文件转写模式:提交完整音频文件后同步返回文本。实时流式识别可关注平台后续更新。

识别中文准确率怎么样?

普通话识别准确率较高,安静环境、单人说话的效果最好;多人 overlapping 说话或强噪声环境建议先做音频降噪。

和文字转语音API是什么关系?

语音识别(ASR)把音频转成文字,文字转语音(TTS)把文字合成为音频,两者互为逆过程,可组合实现语音对话机器人。