ling-baseling-base

音频

语音转写、翻译与 TTS(经 relay)

在线 Playground

在浏览器中直接体验本页相关 API,无需本地安装 Go 环境。

音频 API

relay 封装上游 语音转写(Transcription)语音翻译(Translation),部分 channel 也支持 TTS。

语音转写

file, _ := os.Open("meeting.mp3")
defer file.Close()

resp, err := client.Audio(ctx, &relay.AudioRequest{
    Model:    "whisper-1",
    File:     file,
    FileName: "meeting.mp3",
}, true) // true = transcription
if err != nil {
    log.Fatal(err)
}
fmt.Println(resp.Text)

语音翻译(译为英文)

resp, err := client.AudioTranslation(ctx, &relay.AudioRequest{
    Model:    "whisper-1",
    File:     file,
    FileName: "speech.mp3",
})
fmt.Println(resp.Text)

请求字段

字段说明
Modelwhisper-1、各云 ASR 模型
File音频 io.Reader
FileName文件名(影响 MIME 推断)
Language源语言 hint(可选)
Prompt上下文提示(可选)
ResponseFormatjson / text / srt / verbose_json

支持的 Provider

Provider说明
OpenAIWhisper
Ali / Tencent / Xunfei国内云 ASR
AWSTranscribe

与 voice/recognizer 的区别

relay.Audiovoice/recognizer
场景单次文件转写 HTTP API流式 WebSocket 实时 ASR
集成统一 relay.Client独立 recognizer.Engine

实时语音场景优先 voice/recognizer;批量文件转写用 relay。

On this page