语音技术 · 同步接口
语音识别API(录音转文字)接入指南
语音识别API用于把音频文件转换成文字:上传wav、mp3等常见格式音频,接口同步返回识别出的文本内容。适合会议纪要、语音消息归档、视频字幕制作、语音质检等场景,单次调用约0.035元,按量计费。
接口速览
以下信息来自轻语API开放平台生产环境接口元数据,可直接用于技术选型评估。
| 接口地址 | POST /data/api/fetchTextByVoice |
|---|---|
| 计费 | 约0.035元/次 |
| 频率限制 | 100次/分钟 |
| 超时时间 | 30秒 |
| 鉴权方式 | apikey(注册后获取) |
| 内容类型 | multipart/form-data |
请求参数
| 参数名 | 必填 | 类型 | 说明 |
|---|---|---|---|
apikey | 必填 | string | 用户的apikey,身份凭证 |
audio | 必填 | file | 音频文件,wav、mp3等格式均支持 |
响应示例
成功响应(HTTP 200)
{
"code": 200,
"message": "语音识别成功",
"data": {
"partial": "语音识别出的内容"
}
}
调用示例
cURL 示例
curl -X POST 'https://5555api.com/data/api/fetchTextByVoice' \
-F 'apikey=YOUR_APIKEY' \
-F 'audio=@meeting.wav'
JavaScript 示例
const fd = new FormData();
fd.append('apikey', 'YOUR_APIKEY');
fd.append('audio', audioInput.files[0]); // wav、mp3均可
const resp = await fetch('https://5555api.com/data/api/fetchTextByVoice', {
method: 'POST',
body: fd
});
const result = await resp.json();
if (result.code === 200) {
console.log('识别结果:', result.data.partial);
}
Python 示例
import requests
resp = requests.post(
'https://5555api.com/data/api/fetchTextByVoice',
data={'apikey': 'YOUR_APIKEY'},
files={'audio': open('meeting.wav', 'rb')}
)
result = resp.json()
if result['code'] == 200:
print('识别结果:', result['data']['partial'])
示例中的 YOUR_APIKEY 请替换为你在轻语API控制台获取的apikey;不要在公开页面或客户端代码中暴露正式API Key。
应用场景
会议纪要自动生成
会议录音直接转文字,配合标点规则整理成纪要初稿,人工只需校对补充。
语音消息归档检索
客服语音留言、微信群语音批量转文本入库,实现全文搜索和关键词告警。
视频字幕与口播稿
采访、口播音频先转文字再生成字幕文件,省去逐句听打时间。
常见问题
语音识别API支持哪些音频格式?
支持wav、mp3等常见音频格式。建议使用16kHz及以上采样率的清晰录音,识别准确率更高。
语音识别怎么收费?
按调用次数计费,约0.035元/次,按量扣费无需预付套餐。注册账号并充值后即可调用。
能识别长录音吗,有时长限制吗?
受接口30秒超时限制,建议单次上传的音频控制在合理时长内;长录音可先切分再逐段识别,最后拼接文本。
支持实时流式识别吗?
当前接口为文件转写模式:提交完整音频文件后同步返回文本。实时流式识别可关注平台后续更新。
识别中文准确率怎么样?
普通话识别准确率较高,安静环境、单人说话的效果最好;多人 overlapping 说话或强噪声环境建议先做音频降噪。
和文字转语音API是什么关系?
语音识别(ASR)把音频转成文字,文字转语音(TTS)把文字合成为音频,两者互为逆过程,可组合实现语音对话机器人。