# 语音转文字（STT）

将音频文件转录为文字。请求使用 `multipart/form-data` 格式，必须包含 `file`（16k/单声道/16bit wav）和 `model`（如 `doubao-asr`）字段。
计费方式：按音频时长（秒）计费，结算以实际识别时长为准。

## POST /v1/audio/transcriptions

> 语音转文字（STT）

将音频文件转录为文字。请求使用 `multipart/form-data` 格式，必须包含 `file`（16k/单声道/16bit wav）和 `model`（如 `doubao-asr`）字段。
计费方式：按音频时长（秒）计费，结算以实际识别时长为准。

### Authentication

`Authorization: Bearer tr-xxx`

### Request Body

Content-Type: `multipart/form-data`

- **model** `string` **(required)**  
  语音识别模型 ID，可通过 `GET /v1/models` 过滤 `type: stt` 获取
- **file** `string` **(required)**  
  音频文件。豆包大模型流式语音识别要求 **16kHz / 单声道 / 16bit PCM 的 wav**。
- **language** `string`  
  音频语言（ISO-639-1 代码），指定后可提升识别准确率
- **prompt** `string`  
  提示词，可提供上下文以提升识别准确率
- **response_format** ``json` | `text` | `srt` | `verbose_json` | `vtt`` (default: `json`)  
  响应格式

### Response

- **text** `string` **(required)**  
  转录后的文字内容
- **duration** `number`  
  音频时长（秒），部分模型支持返回此字段

### Error Codes

- `400`: 
- `401`: 
- `402`: 
- `429`: 
- `502`:
